「新しいM5なら、メモリ16GBでも大型のローカルLLMが快適に動く」は誤解です。Macでモデルが動くかを先に決めるのは、チップ名よりも、モデル本体・コンテキスト・macOS・同時起動アプリを収めるユニファイドメモリの余裕です。
2026年10月3日時点では、16GBのMacは7GB台の小型モデルから、24GB・32GBは8GB前後のモデルから、48GB・64GBは16〜20GB級のモデルも候補にするのが安全側の出発点です。これは速度の実測値ではなく、Appleの実機構成とOllama公式の配布サイズを突き合わせた選定基準です。
- ターミナルとAPIを使うなら:Ollamaを選び、
gemma4:e2bのような小型モデルで最初の応答を確認する - 画面でモデルを比較するなら:LM Studioを選び、Discoverから取得、Chatでロード、Developerでlocalhost APIを確認する
- Macを買うなら:CPU世代だけで決めず、先にユニファイドメモリ容量とモデル保存用SSDを決める
なお、2026年10月3日のApple公式ページに掲載される現行Mac miniはM6とM5 Proです。M4/M4 Pro Mac miniは2024年モデルであり、「現行のベースM5 Mac mini」は公式ラインアップにありません。この記事は、既存のM4 Mac mini、M5搭載MacBook、現行M5 Pro Mac miniを含むApple Silicon Macで再現できる手順に絞っています。
MacでローカルLLMを動かす鍵はユニファイドメモリ

Apple Siliconには、CPUとGPUが同じメモリ領域を使うユニファイドメモリがあります。Appleの機械学習フレームワークMLXも、配列を共有メモリへ置き、CPUとGPUの間で転送せず扱えることを特徴として説明しています。これはローカル推論と相性のよい設計ですが、メモリが無限に使えるという意味ではありません。
モデルをロードすると、量子化された重みだけでなく、入力と会話履歴を保持するKVキャッシュ、OllamaやLM Studioの実行領域、macOS、ブラウザなども同じ容量を使います。したがって、ダウンロードしたモデルファイルが8GBだからといって、8GBメモリのMacで余裕を持って動くとは限りません。特に長い文書やコードを渡すと、コンテキストが増えて必要メモリも増えます。
- モデル本体:量子化された重みと必要な補助ファイル
- KVキャッシュ:入力、会話履歴、生成中の情報
- 推論ランタイム:Ollama、LM Studio、MLX、llama.cppなど
- macOSと同時起動アプリ:ブラウザ、エディタ、業務アプリの利用分
確認は「このMacについて」で終わらせず、実行中にも行います。Ollamaならollama psでモデルの配置と割り当てコンテキストを確認できます。モデル名の末尾にあるBはパラメータ規模の手掛かりですが、必要メモリは量子化方式やコンテキストでも変わるため、Bの数字だけで購入構成を決めないでください。
2026年10月3日のMac mini・MacBook選び

Mac miniをローカルLLM用に検討するとき、検索結果にはM4、M5、M6が混在します。Apple公式の世代と構成を分けると、判断しやすくなります。
| Mac | Apple公式の位置づけ | ユニファイドメモリ | ローカルLLM用途での見方 |
|---|---|---|---|
| M4 Mac mini | 2024年モデル | 16GB、24GB、32GB | 既存機や整備済み・中古を使う場合の現実的な入口。16GBは小型モデルから始める |
| M4 Pro Mac mini | 2024年モデル | 24GB、48GB、64GB | 大きめの量子化モデルや長い入力を試す余地が広い |
| M5 MacBook Air | 2026年モデル | 16GB、24GB、32GB | 持ち運びを優先する構成。モデルを動かしながら他のアプリも使うなら容量を先に見る |
| M5 Pro Mac mini | 2026年10月3日時点の現行上位モデル | 24GB、48GB、64GB | 据え置き運用と大きめのモデルを両立しやすい。Apple公式仕様は307GB/sのメモリ帯域幅 |
| M6 Mac mini | 2026年10月3日時点の現行標準モデル | 16GB、24GB、32GB | 新規購入の標準候補。この記事の手順は同じだが、対象検索語のM4/M5と世代を混同しない |
出典は、AppleのMac mini(2024)技術仕様、MacBook Air(13インチ、M5)技術仕様、現行Mac mini仕様です。M4 Mac miniはM4で最大32GB、M4 Proで最大64GB。現行M5 Pro Mac miniも最大64GBです。
Mac miniとMacBookの差は、同じチップ名だけでは語れません。持ち運びや内蔵画面が必要ならMacBook、据え置きのローカルAPIや常時稼働を考えるならMac miniが自然です。ただし、同じ24GBでも、ブラウザや開発環境を同時に多く開くMacBookではモデルに残せる余裕が減ります。購入時は「動く最大モデル」ではなく、「普段のアプリを開いたまま扱えるモデル」を基準にしてください。
モデルサイズはメモリ容量から逆算する

最初のモデル選びには、Ollamaの現行公式例が使えます。Ollama Quickstartはgemma4:e2bをローカル実行の例にし、ダウンロードを約7.2GB、Macでは利用可能なユニファイドメモリ8GBを推奨しています。2026年10月3日にOllamaのGemma 4モデル一覧を確認すると、配布形式によりE2Bは4.6〜7.5GB、12Bは7.7〜8.0GB、26Bは16〜19GB、31Bは19〜20GBです。
次の表は公式の動作保証ではなく、モデル配布サイズ、macOSの利用分、コンテキスト増加分を見込んだ安全側の開始位置です。速度や回答品質はモデル、量子化、入力、実行エンジンで変わるため、トークン毎秒の数値は置いていません。
| Macのメモリ | 最初に試す範囲 | 公式配布サイズの例 | 判断 |
|---|---|---|---|
| 8GB | さらに小さいモデル、短い入力 | LM Studioは小型モデルと控えめなコンテキストに限定するよう案内 | 既存機での学習用。新規購入の基準にはしにくい |
| 16GB | E2Bなど7GB台までを起点 | gemma4:e2bは約7GB台 |
ブラウザを閉じ、短い入力で開始。モデル本体以外の余白を残す |
| 24GB・32GB | E2B、E4B、12B級 | Gemma 4のE4Bは6.6〜9.5GB、12Bは7.7〜8.0GB | 業務アプリとの併用や、少し長い入力を評価しやすい |
| 48GB・64GB | 26B・31B級も比較対象 | Gemma 4の26Bは16〜19GB、31Bは19〜20GB | 大きめの重みとキャッシュの余白を取りやすいが、快適さは実機確認が必要 |
- 用途を1つ決める:要約、下書き、コード補助など
- 空きメモリを見る:搭載量ではなく普段のアプリ起動後で考える
- 配布サイズを見る:モデル本体が占める量を確認する
- コンテキストを控えめにする:最初から最大値にしない
- 同じ質問で比較する:速度、品質、メモリ使用を自分の用途で確認する
重要なのは、ストレージ容量と実行メモリを分けることです。Ollama公式はモデル保存に数十GBから数百GBを使う場合があると説明しています。SSDが256GBのMacでは複数モデルを試すだけで空きが減りやすいため、モデルを入れ替える運用か、保存先を別ボリュームへ移す設計も考えてください。
OllamaをMacへ入れて最初の応答を得る5手順

Ollamaは、ターミナルからモデルを取得し、ローカルAPIへつなぎたい人に向きます。公式のmacOS要件はmacOS Sonoma 14以降です。Apple MシリーズはCPUとGPUを利用でき、Intel MacはCPUのみと案内されています。
手順1:macOSとメモリを確認する
Appleメニューの「このMacについて」で、チップ、ユニファイドメモリ、macOSのバージョンを確認します。16GBなら、まずは7GB台のモデルと短い入力に絞ります。機密文書はまだ使わず、公開可能な短文で経路を確認してください。
手順2:公式配布からインストールする
OllamaのMac公式ダウンロードから取得できます。macOS向け公式文書が推奨する方法は、DMGを開いてOllamaをApplicationsへ移す手順です。公式ページにはターミナル用のインストールコマンドも掲載されています。
動作環境:macOS Sonoma 14以降、インターネット接続、管理者ポリシーで許可されたMac。
注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。組織管理端末では、シェルスクリプトを実行する前に情報システム部門のルールを確認してください。
curl -fsSL PH_6_ | sh
ollama --version
手順3:小型モデルを取得して会話する
Ollamaアプリを一度開いた後、公式Quickstartのローカル例を実行します。初回はモデルをダウンロードするため通信とSSD容量が必要です。
動作環境:Ollamaを起動済みのApple Silicon Mac。gemma4:e2b用に8GB程度以上の利用可能メモリを確保。
注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。
ollama run gemma4:e2b
入力欄が出たら、「MacでローカルLLMを使う利点を3点だけ挙げてください」のような、正解を確認しやすい質問を送ります。終了は/byeです。
手順4:GPU配置とコンテキストを確認する
別のターミナルで次を実行します。PROCESSORとCONTEXTを見れば、モデルの配置と割り当てられたコンテキストを確認できます。
動作環境:Ollamaでモデルを実行中のMac。
注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。
ollama ps
Ollamaのコンテキスト長ガイドは、コンテキストを増やすほど必要メモリが増えると明記しています。最初は既定値のまま試し、長い入力が本当に必要になってから調整してください。
手順5:localhost APIで応答を確認する
OllamaのローカルAPIはPH_8_で、ローカルモデルへのリクエストにAPIキーは不要です。次の例は、同じMacのローカルサーバーだけに質問を送ります。
動作環境:Ollamaアプリとgemma4:e2bを起動済み、curlを利用できるmacOS。
注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。
curl PH_9_ \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:e2b",
"messages": [
{"role": "user", "content": "ローカル推論を一文で説明してください。"}
],
"stream": false
}'
応答のmessage.contentに文章が返れば、モデル取得、ロード、ローカルAPIの最小経路は動いています。より詳しいモデル管理やAIエージェント連携は、既刊のOllamaの使い方とローカルLLMでのAIエージェント構築で確認できます。
- 公式配布:DMGまたは公式インストールスクリプト
- 小型モデル:
gemma4:e2bを取得 - ターミナル会話:短い公開可能な質問で確認
- 実行状態:
ollama psで配置とコンテキストを見る - localhost API:ポート11434へ同じMacから送信
LM StudioをMacへ入れてGUIから動かす

コマンドより画面操作を優先し、複数のモデルや量子化を見比べたい場合はLM Studioが分かりやすい選択です。2026年10月3日にLM Studio公式ダウンロードで確認できるmacOS版は0.4.25です。
LM Studioの公式システム要件は、macOS 14以降、Apple Silicon、16GB以上のRAMを推奨しています。8GB Macは小型モデルと控えめなコンテキストに限定し、Intel Macは非対応です。要件ページのチップ列挙はM1〜M4のままですが、公式リリースにはM5向けMLX修正が掲載されています。M5 Macでは古いビルドを使わず、公式配布の最新版を確認してください。
1.アプリを起動し、Discoverでモデルを探す
公式配布をApplicationsへ入れて起動します。Discoverで用途に合うモデルを検索し、配布元、ライセンス、形式、量子化、ファイルサイズを確認してからダウンロードします。名前が似た第三者変換もあるため、公開者と元モデルを読み飛ばさないことが大切です。
2.Chatでモデルをロードする
Chat画面でダウンロード済みモデルを選び、ロードします。最初はコンテキストを控えめにし、公開可能な短い質問を送ります。ロードに失敗した場合は、より小さい量子化モデルを選び、同時起動アプリを閉じてください。
CLIを使える場合は、実際にロードする前に公式の--estimate-onlyでメモリ見積もりを確認できます。次は公式Quickstartで使われるモデルを4Kコンテキストで見積もる例です。
動作環境:LM Studioを一度起動済みで、lmsを利用できるmacOS。
注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。
lms load --estimate-only ibm/granite-4-micro --context-length 4096
3.Developerでローカルサーバーを起動する
Developer画面の「Start server」を有効にすると、既定ではPH_13_から利用できます。CLIを使う場合、lmsはアプリに同梱されていますが、公式文書は最初にLM Studioを一度起動するよう案内しています。
動作環境:LM Studioを一度起動済みで、モデルをダウンロード・ロードしたApple Silicon Mac。
注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。
lms ls
lms ps
lms server start
lms server status
4.localhostだけでAPI応答を確認する
公式REST APIの現行例ではibm/granite-4-microを使用しています。モデルを取得済みで、Developer画面のAPI認証を有効にしていない既定のlocalhost運用なら、次のように確認できます。
動作環境:LM Studioローカルサーバーと対象モデルを起動済みのmacOS。
注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。
curl PH_14_ \
-H "Content-Type: application/json" \
-d '{
"model": "ibm/granite-4-micro",
"input": "Macでのローカル推論を一文で説明してください。"
}'
モデル識別子は、実際に取得したモデルへ合わせてください。既定のlocalhost APIは認証なしですが、LANへ公開すると条件が変わります。初回確認では--bind 0.0.0.0やCORSを有効にせず、同じMacだけからアクセスしてください。
配布元
ライセンス
量子化
サイズ
モデルをロード
短い質問
メモリ確認
Start server
localhost
ポート1234
同じMacから
一件送信
応答を読む
OllamaとLM Studioはどちらを選ぶべきか
両方を入れる必要はありません。最初の目的に合わせて1つを選び、同じ質問を同じモデルで評価した後に、必要ならもう一方を試します。
| 判断軸 | Ollama | LM Studio |
|---|---|---|
| 主な操作 | CLI、ローカルAPI、アプリ連携 | GUI、CLI、ローカルAPI |
| 向いている人 | シェルやコードから呼びたい人 | モデルと設定を画面で比較したい人 |
| 最初の確認 | ollama runとollama ps |
Discover、Chat、Developer |
| 既定のローカルAPI | localhost:11434 |
localhost:1234 |
| 注意点 | ローカルモデルとクラウドモデルを区別する | 配布元、形式、量子化を自分で選ぶ |
Ollamaは、スクリプト、エディタ、AIエージェントから呼ぶ経路を短くできます。LM Studioは、ダウンロード候補とロード状態を視覚的に追いやすい点が強みです。どちらもローカルサーバーを持つため、「GUIかCLIか」だけでなく、その後にAPI連携するかで選びましょう。
2026年9月末には、Ollamaがdecision models対応を発表し、LM Studio 0.4.25は条件を満たすMac向けにSplash engine対応を追加しました。後者はM3以降、macOS 26.4以降を対象とする個別エンジンの条件で、LM Studio全体の最低要件ではありません。機能名だけを見てOSやメモリ要件を混同しないことが重要です。
Mac miniをローカルLLMサーバーにする前の境界線
Mac miniは据え置きで使いやすく、ローカルAPIのホストにも向きます。ただし、OllamaもLM Studioもlocalhostで使う段階と、別端末から接続できるサーバーにする段階ではリスクが違います。
Ollamaは既定で127.0.0.1:11434へバインドします。LM Studioのlms server startも既定は127.0.0.1です。この範囲なら、通常は同じMacからだけアクセスします。0.0.0.0へ変えるとLAN上の別端末から到達できるため、認証、ファイアウォール、接続元制限、ログ、モデルのライセンス、入力データの扱いを決める必要があります。
同じMac
127.0.0.1
公開可能な入力
一件ずつテスト
0.0.0.0
CORS
ポート転送
外部トンネル
認証
ファイアウォール
接続元制限
ログ方針
「ローカルLLMだからデータが絶対に外へ出ない」とも断定できません。モデル検索とダウンロードには通信があり、Web検索、MCP、外部API、クラウドモデルを有効にすれば外部通信が加わります。Ollamaにはクラウド機能を無効化する設定もあります。機密情報を扱うなら、アプリ名ではなく、モデル、接続先、ツール、ログ、ネットワークを一つずつ確認してください。
Mac mini上でメッセージ連携や常時稼働エージェントまで進める場合は、OpenClawのDocker・Windows・Mac miniセットアップも参照できます。まずlocalhostでモデル単体を確認し、その後にエージェントを接続すると、モデルの問題と連携設定の問題を分離できます。
つまずきやすい4つの失敗と直し方
失敗1:チップ名だけでモデルを選ぶ
❌ M5なら31Bモデルも問題ない、と世代だけで決める
⭕ ユニファイドメモリ、モデル配布サイズ、コンテキスト、同時起動アプリの順に確認する
なぜ重要か:M5 MacBook Airには16GBから32GBまで構成差があります。同じM5でも、モデルに残せる余裕は同じではありません。
失敗2:モデルを保存できれば実行できると思う
❌ SSDに20GBの空きがあるので、20GBのモデルを20GBメモリで動かせると判断する
⭕ ストレージとユニファイドメモリを分け、OS、ランタイム、KVキャッシュの余白を残す
なぜ重要か:ファイルはSSDへ保存されますが、推論時には重みなどをメモリへロードします。長い入力ほどキャッシュも増えます。
失敗3:Ollamaアプリとサーバーを二重に起動する
❌ macOSアプリが動いているのに、別ターミナルでollama serveを重ねて起動する
⭕ まずアプリを開き、ollama runまたはAPIを試す。サーバーが動かない場合だけログと起動状態を確認する
なぜ重要か:macOSアプリはローカルサーバーを起動します。二重起動はポート競合の切り分けを難しくします。
失敗4:初回からLANへ公開する
❌ 0.0.0.0へバインドし、認証なしで社内LANやインターネットから到達可能にする
⭕ 既定のlocalhostで一件の応答を確認し、公開が必要なら認証と接続元制限を別工程で設計する
なぜ重要か:ローカルAPIは既定で認証不要です。公開範囲を広げる操作は、単なる便利設定ではなくセキュリティ変更です。
ローカルLLMをMacで動かすときのよくある質問
MacのローカルLLMに必要なメモリは何GBですか?
最初の1台なら16GBを最低の出発点とし、複数アプリとの併用や8〜12B級を試すなら24GB・32GB、大きめの量子化モデルを継続的に評価するなら48GB・64GBを検討します。これは万能な動作保証ではなく、モデル本体以外の余白を含めた安全側の選び方です。
M4 Mac mini 16GBでもローカルLLMは使えますか?
使えます。Ollama公式例のgemma4:e2bのような7GB台のモデルから始め、コンテキストを控えめにし、ブラウザなどを閉じて確認してください。大型モデルや長文処理が同じ快適さで動くという意味ではありません。
M5 MacBook AirはローカルLLMに向いていますか?
持ち運びながら小型・中型モデルを試す用途に向きます。Apple公式では16GB、24GB、32GBのユニファイドメモリ構成があります。チップがM5であることだけでなく、普段のアプリを含めて必要な容量を選んでください。
Mac miniとMacBook Proはどちらがよいですか?
据え置きのローカルAPI、共有前提の検証、常時稼働を考えるならMac mini、持ち運びと内蔵画面が必要ならMacBook Proが自然です。モデルの収まりやすさは、本体形状よりユニファイドメモリ容量と実行条件で判断します。
OllamaとLM Studioを両方入れる必要はありますか?
ありません。APIやスクリプト連携ならOllama、GUIで比較するならLM Studioから始めるとよいでしょう。同じモデルと質問で比較したい理由が生まれてから、もう一方を追加すれば十分です。
Intel Macでも動きますか?
Ollama公式はIntel MacをCPUのみで対応すると案内しています。一方、LM Studio公式はIntel Macを非対応としています。Intel Macへ新規投資するより、Apple Silicon Macを前提に検討する方が選択肢をそろえやすいです。
ローカルならインターネット接続は不要ですか?
取得済みモデルの推論はオフラインで行える構成がありますが、アプリ、モデル、実行エンジン、更新の取得には通信が必要です。Web検索、MCP、クラウドモデルを使えば推論中にも外部通信が加わります。
モデルのファイルサイズと必要メモリは同じですか?
同じではありません。モデル本体に加え、KVキャッシュ、推論ランタイム、macOS、同時起動アプリがメモリを使います。ファイルサイズは入口の判断材料であり、実行時はアクティビティモニタやollama psで確認してください。
Mac miniを社内のローカルLLMサーバーにできますか?
できますが、localhostでの個人利用とLAN公開は分けてください。別端末から使う場合は、認証、ファイアウォール、接続元制限、ログ方針、入力データ、モデルライセンスを決めてから公開します。
運営元 Uravation よりAIエージェントを構想から本番運用まで進める順番と、体制・KPIの決め方をまとめた資料を無料で公開しています。 AIエージェント導入ロードマップを受け取る(無料)
参考・出典
- Mac mini – 仕様 — Apple(参照日:2026年10月3日)
- Mac mini(2024)- 技術仕様 — Apple(参照日:2026年10月3日)
- MacBook Air(13インチ、M5)- 技術仕様 — Apple(参照日:2026年10月3日)
- MLX: An array framework for Apple silicon — Apple machine learning research(参照日:2026年10月3日)
- macOS – Ollama — Ollama(参照日:2026年10月3日)
- Quickstart – Ollama — Ollama(参照日:2026年10月3日)
- Introduction – Ollama API — Ollama(参照日:2026年10月3日)
- System Requirements – LM Studio — LM Studio(参照日:2026年10月3日)
- LM Studio as a Local LLM API Server — LM Studio(参照日:2026年10月3日)
- LM Studio 0.4.25 — LM Studio、2026年9月19日(参照日:2026年10月3日)
結論
MacでローカルLLMを始めるなら、チップ名から選ぶのではなく、用途、ユニファイドメモリ、モデル配布サイズ、コンテキストの順で決めます。16GBでは小型モデル、24GB・32GBでは8〜12B級、48GB・64GBでは16〜20GB級の配布物も比較候補にする、という安全側の基準なら、最初からメモリを使い切る失敗を避けやすくなります。
- 既存Macで始める:公開可能な短文と小型モデルで、最初の一件を返す
- 実行状態を確認する:モデルサイズ、コンテキスト、メモリ使用、接続先を見る
- 必要なときだけ広げる:大きいモデル、長文、LAN公開、エージェント連携を一つずつ追加する
ローカルLLMの仕組みやクラウドとの使い分けから確認したい方は、ローカルLLMの仕組み・クラウドとの違い・始め方もあわせてご覧ください。
ローカルLLMを業務へ組み込む前に、データ経路、モデル評価、権限、運用責任を整理することが重要です。
Uravationでは、AIエージェント導入の研修・コンサルティングを行っています。
