AIエージェント入門

ローカルLLMをMac miniで動かす5手順【2026年10月】

ローカルLLMをMac miniで動かす5手順【2026年10月】

この記事の結論

ローカル LLMをMacで動かす方法を2026年10月3日時点で整理。Mac mini・MacBookのメモリ目安、Ollama・LM Studioの導入、失敗対策まで解説します。

「新しいM5なら、メモリ16GBでも大型のローカルLLMが快適に動く」は誤解です。Macでモデルが動くかを先に決めるのは、チップ名よりも、モデル本体・コンテキスト・macOS・同時起動アプリを収めるユニファイドメモリの余裕です。

2026年10月3日時点では、16GBのMacは7GB台の小型モデルから、24GB・32GBは8GB前後のモデルから、48GB・64GBは16〜20GB級のモデルも候補にするのが安全側の出発点です。これは速度の実測値ではなく、Appleの実機構成とOllama公式の配布サイズを突き合わせた選定基準です。

  • ターミナルとAPIを使うなら:Ollamaを選び、gemma4:e2bのような小型モデルで最初の応答を確認する
  • 画面でモデルを比較するなら:LM Studioを選び、Discoverから取得、Chatでロード、Developerでlocalhost APIを確認する
  • Macを買うなら:CPU世代だけで決めず、先にユニファイドメモリ容量とモデル保存用SSDを決める

なお、2026年10月3日のApple公式ページに掲載される現行Mac miniはM6とM5 Proです。M4/M4 Pro Mac miniは2024年モデルであり、「現行のベースM5 Mac mini」は公式ラインアップにありません。この記事は、既存のM4 Mac mini、M5搭載MacBook、現行M5 Pro Mac miniを含むApple Silicon Macで再現できる手順に絞っています。

MacでローカルLLMを動かす鍵はユニファイドメモリ

MacでローカルLLMを動かす鍵はユニファイドメモリ
MacでローカルLLMを動かす鍵はユニファイドメモリ

Apple Siliconには、CPUとGPUが同じメモリ領域を使うユニファイドメモリがあります。Appleの機械学習フレームワークMLXも、配列を共有メモリへ置き、CPUとGPUの間で転送せず扱えることを特徴として説明しています。これはローカル推論と相性のよい設計ですが、メモリが無限に使えるという意味ではありません。

モデルをロードすると、量子化された重みだけでなく、入力と会話履歴を保持するKVキャッシュ、OllamaやLM Studioの実行領域、macOS、ブラウザなども同じ容量を使います。したがって、ダウンロードしたモデルファイルが8GBだからといって、8GBメモリのMacで余裕を持って動くとは限りません。特に長い文書やコードを渡すと、コンテキストが増えて必要メモリも増えます。

図解1:Macのユニファイドメモリを使う4要素

確認は「このMacについて」で終わらせず、実行中にも行います。Ollamaならollama psでモデルの配置と割り当てコンテキストを確認できます。モデル名の末尾にあるBはパラメータ規模の手掛かりですが、必要メモリは量子化方式やコンテキストでも変わるため、Bの数字だけで購入構成を決めないでください。

2026年10月3日のMac mini・MacBook選び

2026年10月3日のMac mini・MacBook選び
2026年10月3日のMac mini・MacBook選び

Mac miniをローカルLLM用に検討するとき、検索結果にはM4、M5、M6が混在します。Apple公式の世代と構成を分けると、判断しやすくなります。

Mac Apple公式の位置づけ ユニファイドメモリ ローカルLLM用途での見方
M4 Mac mini 2024年モデル 16GB、24GB、32GB 既存機や整備済み・中古を使う場合の現実的な入口。16GBは小型モデルから始める
M4 Pro Mac mini 2024年モデル 24GB、48GB、64GB 大きめの量子化モデルや長い入力を試す余地が広い
M5 MacBook Air 2026年モデル 16GB、24GB、32GB 持ち運びを優先する構成。モデルを動かしながら他のアプリも使うなら容量を先に見る
M5 Pro Mac mini 2026年10月3日時点の現行上位モデル 24GB、48GB、64GB 据え置き運用と大きめのモデルを両立しやすい。Apple公式仕様は307GB/sのメモリ帯域幅
M6 Mac mini 2026年10月3日時点の現行標準モデル 16GB、24GB、32GB 新規購入の標準候補。この記事の手順は同じだが、対象検索語のM4/M5と世代を混同しない

出典は、AppleのMac mini(2024)技術仕様、MacBook Air(13インチ、M5)技術仕様、現行Mac mini仕様です。M4 Mac miniはM4で最大32GB、M4 Proで最大64GB。現行M5 Pro Mac miniも最大64GBです。

Mac miniとMacBookの差は、同じチップ名だけでは語れません。持ち運びや内蔵画面が必要ならMacBook、据え置きのローカルAPIや常時稼働を考えるならMac miniが自然です。ただし、同じ24GBでも、ブラウザや開発環境を同時に多く開くMacBookではモデルに残せる余裕が減ります。購入時は「動く最大モデル」ではなく、「普段のアプリを開いたまま扱えるモデル」を基準にしてください。

モデルサイズはメモリ容量から逆算する

モデルサイズはメモリ容量から逆算する
モデルサイズはメモリ容量から逆算する

最初のモデル選びには、Ollamaの現行公式例が使えます。Ollama Quickstartはgemma4:e2bをローカル実行の例にし、ダウンロードを約7.2GB、Macでは利用可能なユニファイドメモリ8GBを推奨しています。2026年10月3日にOllamaのGemma 4モデル一覧を確認すると、配布形式によりE2Bは4.6〜7.5GB、12Bは7.7〜8.0GB、26Bは16〜19GB、31Bは19〜20GBです。

次の表は公式の動作保証ではなく、モデル配布サイズ、macOSの利用分、コンテキスト増加分を見込んだ安全側の開始位置です。速度や回答品質はモデル、量子化、入力、実行エンジンで変わるため、トークン毎秒の数値は置いていません。

Macのメモリ 最初に試す範囲 公式配布サイズの例 判断
8GB さらに小さいモデル、短い入力 LM Studioは小型モデルと控えめなコンテキストに限定するよう案内 既存機での学習用。新規購入の基準にはしにくい
16GB E2Bなど7GB台までを起点 gemma4:e2bは約7GB台 ブラウザを閉じ、短い入力で開始。モデル本体以外の余白を残す
24GB・32GB E2B、E4B、12B級 Gemma 4のE4Bは6.6〜9.5GB、12Bは7.7〜8.0GB 業務アプリとの併用や、少し長い入力を評価しやすい
48GB・64GB 26B・31B級も比較対象 Gemma 4の26Bは16〜19GB、31Bは19〜20GB 大きめの重みとキャッシュの余白を取りやすいが、快適さは実機確認が必要
図解2:モデルを選ぶ順番

重要なのは、ストレージ容量と実行メモリを分けることです。Ollama公式はモデル保存に数十GBから数百GBを使う場合があると説明しています。SSDが256GBのMacでは複数モデルを試すだけで空きが減りやすいため、モデルを入れ替える運用か、保存先を別ボリュームへ移す設計も考えてください。

OllamaをMacへ入れて最初の応答を得る5手順

OllamaをMacへ入れて最初の応答を得る5手順
OllamaをMacへ入れて最初の応答を得る5手順

Ollamaは、ターミナルからモデルを取得し、ローカルAPIへつなぎたい人に向きます。公式のmacOS要件はmacOS Sonoma 14以降です。Apple MシリーズはCPUとGPUを利用でき、Intel MacはCPUのみと案内されています。

手順1:macOSとメモリを確認する

Appleメニューの「このMacについて」で、チップ、ユニファイドメモリ、macOSのバージョンを確認します。16GBなら、まずは7GB台のモデルと短い入力に絞ります。機密文書はまだ使わず、公開可能な短文で経路を確認してください。

手順2:公式配布からインストールする

OllamaのMac公式ダウンロードから取得できます。macOS向け公式文書が推奨する方法は、DMGを開いてOllamaをApplicationsへ移す手順です。公式ページにはターミナル用のインストールコマンドも掲載されています。

動作環境:macOS Sonoma 14以降、インターネット接続、管理者ポリシーで許可されたMac。

注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。組織管理端末では、シェルスクリプトを実行する前に情報システム部門のルールを確認してください。

curl -fsSL PH_6_ | sh
ollama --version

手順3:小型モデルを取得して会話する

Ollamaアプリを一度開いた後、公式Quickstartのローカル例を実行します。初回はモデルをダウンロードするため通信とSSD容量が必要です。

動作環境:Ollamaを起動済みのApple Silicon Mac。gemma4:e2b用に8GB程度以上の利用可能メモリを確保。

注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。

ollama run gemma4:e2b

入力欄が出たら、「MacでローカルLLMを使う利点を3点だけ挙げてください」のような、正解を確認しやすい質問を送ります。終了は/byeです。

手順4:GPU配置とコンテキストを確認する

別のターミナルで次を実行します。PROCESSORとCONTEXTを見れば、モデルの配置と割り当てられたコンテキストを確認できます。

動作環境:Ollamaでモデルを実行中のMac。

注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。

ollama ps

Ollamaのコンテキスト長ガイドは、コンテキストを増やすほど必要メモリが増えると明記しています。最初は既定値のまま試し、長い入力が本当に必要になってから調整してください。

手順5:localhost APIで応答を確認する

OllamaのローカルAPIはPH_8_で、ローカルモデルへのリクエストにAPIキーは不要です。次の例は、同じMacのローカルサーバーだけに質問を送ります。

動作環境:Ollamaアプリとgemma4:e2bを起動済み、curlを利用できるmacOS。

注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。

curl PH_9_ \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma4:e2b",
    "messages": [
      {"role": "user", "content": "ローカル推論を一文で説明してください。"}
    ],
    "stream": false
  }'

応答のmessage.contentに文章が返れば、モデル取得、ロード、ローカルAPIの最小経路は動いています。より詳しいモデル管理やAIエージェント連携は、既刊のOllamaの使い方とローカルLLMでのAIエージェント構築で確認できます。

図解3:Ollamaの最小経路

LM StudioをMacへ入れてGUIから動かす

LM StudioをMacへ入れてGUIから動かす
LM StudioをMacへ入れてGUIから動かす

コマンドより画面操作を優先し、複数のモデルや量子化を見比べたい場合はLM Studioが分かりやすい選択です。2026年10月3日にLM Studio公式ダウンロードで確認できるmacOS版は0.4.25です。

LM Studioの公式システム要件は、macOS 14以降、Apple Silicon、16GB以上のRAMを推奨しています。8GB Macは小型モデルと控えめなコンテキストに限定し、Intel Macは非対応です。要件ページのチップ列挙はM1〜M4のままですが、公式リリースにはM5向けMLX修正が掲載されています。M5 Macでは古いビルドを使わず、公式配布の最新版を確認してください。

1.アプリを起動し、Discoverでモデルを探す

公式配布をApplicationsへ入れて起動します。Discoverで用途に合うモデルを検索し、配布元、ライセンス、形式、量子化、ファイルサイズを確認してからダウンロードします。名前が似た第三者変換もあるため、公開者と元モデルを読み飛ばさないことが大切です。

2.Chatでモデルをロードする

Chat画面でダウンロード済みモデルを選び、ロードします。最初はコンテキストを控えめにし、公開可能な短い質問を送ります。ロードに失敗した場合は、より小さい量子化モデルを選び、同時起動アプリを閉じてください。

CLIを使える場合は、実際にロードする前に公式の--estimate-onlyでメモリ見積もりを確認できます。次は公式Quickstartで使われるモデルを4Kコンテキストで見積もる例です。

動作環境:LM Studioを一度起動済みで、lmsを利用できるmacOS。

注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。

lms load --estimate-only ibm/granite-4-micro --context-length 4096

3.Developerでローカルサーバーを起動する

Developer画面の「Start server」を有効にすると、既定ではPH_13_から利用できます。CLIを使う場合、lmsはアプリに同梱されていますが、公式文書は最初にLM Studioを一度起動するよう案内しています。

動作環境:LM Studioを一度起動済みで、モデルをダウンロード・ロードしたApple Silicon Mac。

注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。

lms ls
lms ps
lms server start
lms server status

4.localhostだけでAPI応答を確認する

公式REST APIの現行例ではibm/granite-4-microを使用しています。モデルを取得済みで、Developer画面のAPI認証を有効にしていない既定のlocalhost運用なら、次のように確認できます。

動作環境:LM Studioローカルサーバーと対象モデルを起動済みのmacOS。

注意:本番環境で使用する前に、必ずテスト環境で動作確認してください。

curl PH_14_ \
  -H "Content-Type: application/json" \
  -d '{
    "model": "ibm/granite-4-micro",
    "input": "Macでのローカル推論を一文で説明してください。"
  }'

モデル識別子は、実際に取得したモデルへ合わせてください。既定のlocalhost APIは認証なしですが、LANへ公開すると条件が変わります。初回確認では--bind 0.0.0.0やCORSを有効にせず、同じMacだけからアクセスしてください。

図解4:LM Studioの画面とAPIの流れ

OllamaとLM Studioはどちらを選ぶべきか

両方を入れる必要はありません。最初の目的に合わせて1つを選び、同じ質問を同じモデルで評価した後に、必要ならもう一方を試します。

判断軸 Ollama LM Studio
主な操作 CLI、ローカルAPI、アプリ連携 GUI、CLI、ローカルAPI
向いている人 シェルやコードから呼びたい人 モデルと設定を画面で比較したい人
最初の確認 ollama runとollama ps Discover、Chat、Developer
既定のローカルAPI localhost:11434 localhost:1234
注意点 ローカルモデルとクラウドモデルを区別する 配布元、形式、量子化を自分で選ぶ

Ollamaは、スクリプト、エディタ、AIエージェントから呼ぶ経路を短くできます。LM Studioは、ダウンロード候補とロード状態を視覚的に追いやすい点が強みです。どちらもローカルサーバーを持つため、「GUIかCLIか」だけでなく、その後にAPI連携するかで選びましょう。

2026年9月末には、Ollamaがdecision models対応を発表し、LM Studio 0.4.25は条件を満たすMac向けにSplash engine対応を追加しました。後者はM3以降、macOS 26.4以降を対象とする個別エンジンの条件で、LM Studio全体の最低要件ではありません。機能名だけを見てOSやメモリ要件を混同しないことが重要です。

Mac miniをローカルLLMサーバーにする前の境界線

Mac miniは据え置きで使いやすく、ローカルAPIのホストにも向きます。ただし、OllamaもLM Studioもlocalhostで使う段階と、別端末から接続できるサーバーにする段階ではリスクが違います。

Ollamaは既定で127.0.0.1:11434へバインドします。LM Studioのlms server startも既定は127.0.0.1です。この範囲なら、通常は同じMacからだけアクセスします。0.0.0.0へ変えるとLAN上の別端末から到達できるため、認証、ファイアウォール、接続元制限、ログ、モデルのライセンス、入力データの扱いを決める必要があります。

図解5:localhost確認とLAN公開の境界

「ローカルLLMだからデータが絶対に外へ出ない」とも断定できません。モデル検索とダウンロードには通信があり、Web検索、MCP、外部API、クラウドモデルを有効にすれば外部通信が加わります。Ollamaにはクラウド機能を無効化する設定もあります。機密情報を扱うなら、アプリ名ではなく、モデル、接続先、ツール、ログ、ネットワークを一つずつ確認してください。

Mac mini上でメッセージ連携や常時稼働エージェントまで進める場合は、OpenClawのDocker・Windows・Mac miniセットアップも参照できます。まずlocalhostでモデル単体を確認し、その後にエージェントを接続すると、モデルの問題と連携設定の問題を分離できます。

つまずきやすい4つの失敗と直し方

失敗1:チップ名だけでモデルを選ぶ

❌ M5なら31Bモデルも問題ない、と世代だけで決める

⭕ ユニファイドメモリ、モデル配布サイズ、コンテキスト、同時起動アプリの順に確認する

なぜ重要か:M5 MacBook Airには16GBから32GBまで構成差があります。同じM5でも、モデルに残せる余裕は同じではありません。

失敗2:モデルを保存できれば実行できると思う

❌ SSDに20GBの空きがあるので、20GBのモデルを20GBメモリで動かせると判断する

⭕ ストレージとユニファイドメモリを分け、OS、ランタイム、KVキャッシュの余白を残す

なぜ重要か:ファイルはSSDへ保存されますが、推論時には重みなどをメモリへロードします。長い入力ほどキャッシュも増えます。

失敗3:Ollamaアプリとサーバーを二重に起動する

❌ macOSアプリが動いているのに、別ターミナルでollama serveを重ねて起動する

⭕ まずアプリを開き、ollama runまたはAPIを試す。サーバーが動かない場合だけログと起動状態を確認する

なぜ重要か:macOSアプリはローカルサーバーを起動します。二重起動はポート競合の切り分けを難しくします。

失敗4:初回からLANへ公開する

❌ 0.0.0.0へバインドし、認証なしで社内LANやインターネットから到達可能にする

⭕ 既定のlocalhostで一件の応答を確認し、公開が必要なら認証と接続元制限を別工程で設計する

なぜ重要か:ローカルAPIは既定で認証不要です。公開範囲を広げる操作は、単なる便利設定ではなくセキュリティ変更です。

ローカルLLMをMacで動かすときのよくある質問

MacのローカルLLMに必要なメモリは何GBですか?

最初の1台なら16GBを最低の出発点とし、複数アプリとの併用や8〜12B級を試すなら24GB・32GB、大きめの量子化モデルを継続的に評価するなら48GB・64GBを検討します。これは万能な動作保証ではなく、モデル本体以外の余白を含めた安全側の選び方です。

M4 Mac mini 16GBでもローカルLLMは使えますか?

使えます。Ollama公式例のgemma4:e2bのような7GB台のモデルから始め、コンテキストを控えめにし、ブラウザなどを閉じて確認してください。大型モデルや長文処理が同じ快適さで動くという意味ではありません。

M5 MacBook AirはローカルLLMに向いていますか?

持ち運びながら小型・中型モデルを試す用途に向きます。Apple公式では16GB、24GB、32GBのユニファイドメモリ構成があります。チップがM5であることだけでなく、普段のアプリを含めて必要な容量を選んでください。

Mac miniとMacBook Proはどちらがよいですか?

据え置きのローカルAPI、共有前提の検証、常時稼働を考えるならMac mini、持ち運びと内蔵画面が必要ならMacBook Proが自然です。モデルの収まりやすさは、本体形状よりユニファイドメモリ容量と実行条件で判断します。

OllamaとLM Studioを両方入れる必要はありますか?

ありません。APIやスクリプト連携ならOllama、GUIで比較するならLM Studioから始めるとよいでしょう。同じモデルと質問で比較したい理由が生まれてから、もう一方を追加すれば十分です。

Intel Macでも動きますか?

Ollama公式はIntel MacをCPUのみで対応すると案内しています。一方、LM Studio公式はIntel Macを非対応としています。Intel Macへ新規投資するより、Apple Silicon Macを前提に検討する方が選択肢をそろえやすいです。

ローカルならインターネット接続は不要ですか?

取得済みモデルの推論はオフラインで行える構成がありますが、アプリ、モデル、実行エンジン、更新の取得には通信が必要です。Web検索、MCP、クラウドモデルを使えば推論中にも外部通信が加わります。

モデルのファイルサイズと必要メモリは同じですか?

同じではありません。モデル本体に加え、KVキャッシュ、推論ランタイム、macOS、同時起動アプリがメモリを使います。ファイルサイズは入口の判断材料であり、実行時はアクティビティモニタやollama psで確認してください。

Mac miniを社内のローカルLLMサーバーにできますか?

できますが、localhostでの個人利用とLAN公開は分けてください。別端末から使う場合は、認証、ファイアウォール、接続元制限、ログ方針、入力データ、モデルライセンスを決めてから公開します。

運営元 Uravation よりAIエージェントを構想から本番運用まで進める順番と、体制・KPIの決め方をまとめた資料を無料で公開しています。 AIエージェント導入ロードマップを受け取る(無料)

参考・出典

結論

MacでローカルLLMを始めるなら、チップ名から選ぶのではなく、用途、ユニファイドメモリ、モデル配布サイズ、コンテキストの順で決めます。16GBでは小型モデル、24GB・32GBでは8〜12B級、48GB・64GBでは16〜20GB級の配布物も比較候補にする、という安全側の基準なら、最初からメモリを使い切る失敗を避けやすくなります。

  1. 既存Macで始める:公開可能な短文と小型モデルで、最初の一件を返す
  2. 実行状態を確認する:モデルサイズ、コンテキスト、メモリ使用、接続先を見る
  3. 必要なときだけ広げる:大きいモデル、長文、LAN公開、エージェント連携を一つずつ追加する

ローカルLLMの仕組みやクラウドとの使い分けから確認したい方は、ローカルLLMの仕組み・クラウドとの違い・始め方もあわせてご覧ください。

ローカルLLMを業務へ組み込む前に、データ経路、モデル評価、権限、運用責任を整理することが重要です。

Uravationでは、AIエージェント導入の研修・コンサルティングを行っています。

Need help moving from reading to rollout?

この記事を読んで導入イメージが固まってきた方へ

Uravationでは、AIエージェントの要件整理、PoC設計、社内導入、研修まで一気通貫で支援しています。

この記事をシェア

X Facebook LINE

※ 本記事の情報は2026年10月時点のものです。サービスの料金・仕様は変更される可能性があります。最新情報は各サービスの公式サイトをご確認ください。

関連記事