重要なポイント
- RAM 4 GB、CPU専用: Qwen3 1.7B Q4_K_M — 25〜40トークン/秒。最小ハードウェアで最速の応答。
- RAM 8 GB、CPU専用(スイートスポット): Phi-4-mini 3.8B Q4_K_M — 15〜25トークン/秒。古いノートPCでコーディングと推論。
- RAM 8 GB + Intel Iris iGPU: Qwen3 4B — 部分GPUオフロードで12〜20トークン/秒。
- RAM 16 GB、CPU専用: Qwen3 8B Q4_K_M — 8〜15トークン/秒。GPU不要で高い品質。
- RAM 16 GB + iGPU: Llama 3.2 3BまたはQwen3 4B — レイヤーオフロードで20〜35トークン/秒。
- 結論: ほとんどの低スペックPCでは、Phi-4-mini(3.8B)のQ4_K_Mがスイートスポットです — RAM 8GBに収まり、CPUで15〜25トークン/秒。最速の応答が欲しい場合はQwen3 1.7Bに切り替えてください。
- コスト: すべて無料(オープンソース)vs. ChatGPT API(1,000トークンあたり約$0.002)。
📍 一文で説明
RAM 8 GBのCPUのみのPCでは、Phi-4-mini 3.8B Q4_K_MがコーディングOK・15〜25トークン/秒で動作。RAM 4 GBでは、Qwen3 1.7B Q4_K_Mが25〜40トークン/秒を達成。
💬 簡潔に説明
ローカルAIを動かすためにゲーミングGPUは必要ありません。これらのモデルはCPUと通常のRAMだけで動作します。小さめのモデル(1〜4Bパラメータ)は日常的なタスクに意外なほど有能で、会話にも十分な速度があります。
あなたのハードウェアに最速のモデルは?
ハードウェアに合ったモデルを選択してください — 誤った選択で4〜10倍の速度を無駄にします。以下の階層は特記なき限りすべてCPU専用です。
| お使いのハードウェア | 推奨モデル | Ollamaコマンド | 期待速度 |
|---|---|---|---|
| RAM 4 GB、CPU専用 | Qwen3 1.7B Q4_K_M | ollama run qwen3:1.7b | 25〜40トークン/秒 |
| RAM 8 GB、CPU専用 | Phi-4-mini 3.8B Q4_K_M | ollama run phi4-mini | 15〜25トークン/秒 |
| RAM 8 GB + Intel Iris iGPU | Qwen3 4B Q4_K_M | ollama run qwen3:4b | 12〜20トークン/秒 |
| RAM 16 GB、CPU専用 | Qwen3 8B Q4_K_M | ollama run qwen3:8b | 8〜15トークン/秒 |
| RAM 16 GB + iGPU | Llama 3.2 3B Q4_K_M | ollama run llama3.2:3b | 20〜35トークン/秒 |
どのモデルを使うべきか?
あなたの状況に合ったモデルを選びましょう — これが最も重要な決定です:
- RAM 8 GBのノートPC(専用GPUなし): Phi-4-mini(3.8B)Q4_K_M — 15〜25トークン/秒、コーディングと推論に対応。`ollama run phi4-mini`
- RAM 4 GB、非常に古いPC: Qwen3 1.7B Q4_K_M — 25〜40トークン/秒、最小RAMで最速の応答。`ollama run qwen3:1.7b`
- RAM 16 GB、GPUなし: Qwen3 8B Q4_K_M — 8〜15トークン/秒、高い品質。`ollama run qwen3:8b`
- RAM 8 GB + Intel Iris iGPU: Qwen3 4B — `OLLAMA_NUM_GPU=1`で部分オフロード、12〜20トークン/秒。`ollama run qwen3:4b`
- 多言語対応(128Kコンテキスト)が欲しい: Qwen3 4BまたはLlama 3.2 3B — どちらもOllamaで128Kコンテキストに対応。
- RAM階層別の推奨と発熱対策については ノートPCでローカルLLMを実行する方法を参照。
ハードウェア別おすすめローカルLLM
以下の階層はすべてCPU専用またはiGPUです。Q4_K_Mであなたのお使いのRAMに収まる最大のモデルを選んでください — 量子化は小型モデルへの変更よりも品質低下が少ない。
| Hardware | Model | Quant | Speed | Experience |
|---|---|---|---|---|
| RAM 4 GB、CPU専用 | Qwen3 1.7B | Q4_K_M | 25〜40 t/s | 高速、使える品質 |
| RAM 8 GB、CPU専用 | Phi-4-mini 3.8B | Q4_K_M | 15〜25 t/s | コーディング+推論 |
| RAM 8 GB + iGPU Iris | Qwen3 4B | Q4_K_M | 12〜20 t/s | 部分GPUオフロード |
| RAM 16 GB、CPU専用 | Qwen3 8B | Q4_K_M | 8〜15 t/s | 高い品質 |
| RAM 16 GB + iGPU | Llama 3.2 3B | Q4_K_M | 20〜35 t/s | iGPUでスムーズ |

GPU vs CPU:低スペックハードウェアでどちらが速い?
GPU推論: RTX 3060で15〜20トークン/秒。CUDAセットアップが必要。高速、最高品質。費用対効果の高い選択肢はバジェットGPUガイドを参照。
iGPU(統合グラフィックス): Intel Irisで5〜8トークン/秒。セットアップ不要。専用GPUより低速。
CPU推論: 最新マルチコアで1〜5トークン/秒。どこでも動作。最も低速。
ルール: GPUがあれば(統合でも)使用する。CPUは最終手段。

低スペックPCで小型モデルが速い理由
モデルサイズが速度を直接決定します。 1B〜3Bモデルはシステムメモリに完全に収まるため、CPUまたはGPUがデータを継続的にストリーミングできます。大型モデルはメモリスワッピングが必要 — RAMとディスク間でデータを移動することで生成速度が10〜100倍低下します(ボトルネックはディスクI/Oであり、計算ではない)。
上記のハードウェア判定テーブルはこの原則を反映しています:TinyLlama 1.1B(1Bパラメータ)は旧CPUで5〜10トークン/秒に到達しますが、スワッピングが支配的になるため13B+モデルは低スペックハードウェアには実用的ではありません。
- 1B〜3Bモデル: 4〜8GB RAMに収まる → 最速生成 → 品質許容範囲
- 7Bモデル: 8GBシステムでギリギリ → メモリプレッシャーで低速 → 高品質
- 13B+モデル: 16GB+ VRAMまたはスワップが必要 → インタラクティブ使用には遅すぎる
低スペックPCでローカルLLMはどのくらい速い?
CPU専用システムで期待できる速度:
- 3Bモデル → 15〜40トークン/秒(旧CPU:10〜15、最適化済み新CPU:30〜40)
- 7Bモデル → 10〜25トークン/秒(CPUコアと量子化次第;積極的最適化で30+も可能)
- クラウドAPIより低速(ChatGPT 4o:80〜150トークン/秒)ですが、インタラクティブ使用には十分です。 25トークン/秒の3Bモデルは500トークンのレスポンスを20秒で生成 — コードレビュー、要約、創作など時間に余裕のあるタスクに許容範囲。
量子化は低スペックPCの速度にどう影響する?
Q4(4ビット): 品質低下約1%、VRAM節約50%。標準選択。全量子化レベルの詳細はガイドを参照。
Q3(3ビット): 品質低下約3%、VRAM節約62%。チャットに許容範囲。
Q2(2ビット): 品質低下約10%、VRAM節約75%。リスクあり;OOM時のみ使用。
速度への影響: Q2はメモリ帯域幅削減によりQ4より約30%速い(計算ではない)。
戦略:小型モデル(TinyLlama)より大型モデルを量子化(Mistral Small Q2)。
Mistral Small Q2 > TinyLlama 1.1B Q4(速度・品質ともに)。
高速モデルは品質と引き換えに速度を得ていますが、温度とtop-pを調整することで多くの品質を回復できます。高速モデルに低い温度(0.1~0.3)を設定することで、デフォルト設定より一貫性のある出力が得られます。温度とtop-pについてで正確な設定を確認してください。
CPU専用推論を高速化する方法
- AVX-512を有効化: CPUが対応していれば`LLAMACPP_AVX512=1 ollama run phi`を使用。約20%高速化。
- コンテキストウィンドウを縮小: 短いコンテキスト = 高速。4096の代わりに`--ctx-size 1024`を使用。
- **Ollamaの代わりにllama.cppを使用:** オーバーヘッドが少なくCPUでわずかに速い(約10%ゲイン)。
- マルチスレッドを無効化: 直感に反するが、弱いCPUではシングルスレッドが速い(スレッドオーバーヘッドなし)。
- iGPUにオフロード: 弱い統合GPUでもCPUより速い。`lspci`でGPU利用可能性を確認。
実際のベンチマーク(2026年7月)
ハードウェア階層別の実測値、2026年7月。すべてOllamaのデフォルト設定使用、チューニングなし。すべてCPU専用またはiGPU — 専用GPUなし:
- RAM 4 GB、CPU専用(Intel N100ミニPC)+ Qwen3 1.7B Q4_K_M:25〜35トークン/秒。`ollama run qwen3:1.7b`
- RAM 8 GB、CPU専用(Core i5-1235U)+ Phi-4-mini Q4_K_M:15〜22トークン/秒。`ollama run phi4-mini`
- RAM 8 GB、CPU専用(Radeon iGPU搭載Ryzen 5 5600G)+ Qwen3 4B Q4_K_M:レイヤーオフロードで18〜25トークン/秒。
- RAM 8 GB + Intel Iris Xe(第12世代i5)+ Qwen3 4B Q4_K_M:12〜18トークン/秒。`ollama run qwen3:4b`
- RAM 16 GB、CPU専用(Ryzen 7 7700X)+ Qwen3 8B Q4_K_M:8〜13トークン/秒。`ollama run qwen3:8b`
- RAM 16 GB + iGPU Iris Xe + Llama 3.2 3B Q4_K_M:20〜30トークン/秒。`ollama run llama3.2:3b`
ローカルLLMで実際に「速い」とは?
速度の感じ方はタスクによって異なります — 次を参考にしてください:
モデルが15トークン/秒を下回る場合は、新しいハードウェアを購入する前にモデルサイズを縮小(7B → 3B)するか、量子化レベルを一段下げてください(Q5 → Q4)。
- 10トークン/秒未満 → 壊れているように感じる。 単語が一つずつ、目立つ間隔をあけて表示されます。インタラクティブなチャットには使用不可。
- 15〜25トークン/秒 → 許容範囲。 ほとんどのユーザーにとって読みやすい速度。Q&A、要約、コーディング支援に適しています。
- 30トークン/秒以上 → スムーズ。 本物のアシスタントのように感じられます。すべてのインタラクティブなタスクに快適。
- 60トークン/秒以上 → 瞬時。 読むより速い。リアルタイムのオートコンプリートや高速なイテレーションに最適。
低スペックPCで避けること
- 13B+モデルは実行しない — RAMの限界を超えます。 Q4の13Bモデルは8〜10GB VRAMが必要で、実用的な低スペックPCの容量を超えます。積極的なQ2量子化でも13Bモデルは5〜6GBが必要で、OSとGPUスケジューリングのオーバーヘッドに十分な余裕がありません。7B以下を使用してください。
- Q8量子化は避ける — 品質向上が最小限で遅い。 Q8はQ4の約2倍のVRAMを使用(Mistral Smallで8GB vs 5.5GB)し、品質向上はわずか約2%。4GBシステムではQ8は非実用的;8GBシステムではQ4が最適。Q4でOOMが発生する場合のみQ3を検討。
- リアルタイムオートコンプリートは期待しない。 CPU上の3トークン/秒では50トークン生成に16秒かかります。インタラクティブなオートコンプリートには≥20トークン/秒が必要。低スペックCPU上のローカルLLMはバッチチャット、下書き、レビューに適しています — ライブオートコンプリートやコードタイプには不向きです。
- CPU専用推論を本番チャットボットに使用しない。 内部ツール、プロトタイプ、オフラインバッチ作業には許容範囲。クラウドAPI(15〜20msレイテンシ)は低スペックCPU(300ms+レイテンシ)よりユーザー向けサービスに優れます。プライバシー重視またはオフラインシナリオには適していますが、速度重視には不向きです。
よくある間違い
- 間違い:CPU速度のためにTinyLlamaを選択。 問題:TinyLlamaは4GB VRAM向けであり、CPU向けではありません — Phi-4-mini 3.8BはCPU専用ハードウェアでより速く、はるかに優れています。解決策:Phi-4-mini 3.8BをCPUで実行;TinyLlama Q5は4GB VRAM用に温存。
- 間違い:CPU高速化フラグを有効化しない。 問題:AVX/NEONの欠如でコスト0で20%の速度向上を逃す。解決策:Ollama起動前に`LLAMACPP_AVX512=1`または`LLAMACPP_NEON=1`を設定。
- 間違い:7Bを4GBに収めるためにQ2を強制。 問題:Q2量子化は推論中のKVキャッシュオーバーヘッドによりOOMクラッシュを起こしやすい。解決策:代わりにQ4の3Bモデルを使用。
- 間違い:新しいハードウェアが常に速い推論を意味すると仮定。 問題:デスクトップRyzenはメモリ最適化の欠如によりモバイルARMより速くない場合があります。解決策:実際のハードウェアでベンチマーク。
- 間違い:モデルに誤ったOllama slugを使用。 問題:`ollama run phi`はPhi-4-miniではなくPhi-2をロードします。解決策:最新のPhiモデルには`ollama run phi4-mini`を使用。常にollama.com/libraryで正確なモデルタグを確認してください。
低スペックPCのローカルLLM:地域別コンテキスト
日本(METI AIガバナンス): 経済産業省(METI)のAIガバナンスガイドラインはデータ最小化を推進します。低スペックハードウェアでのCPU推論は最も厳格なデータ主権要件を満たします — APIコールなし、ロギングなし、第三者データアクセスなし。日本語タスク向けにCPU上でQwen3を実行しているユーザーの場合、時間に余裕のある文書要約には1〜3トークン/秒のスループットで十分です。
EU / GDPR: 低スペックハードウェアでのローカル実行では、推論データが端末を離れません — 多くの中小企業やフリーランサーにとって、GDPR第44条の移転リスクを回避する技術的にシンプルな方法です。EU AI法(2025年2月施行)は個人利用の推論に文書化義務を課していません。データ保護の全体的なコンプライアンスは推論アーキテクチャだけでなく、運用全体に依存します。
中国: 消費者向けハードウェアでのローカル推論は、非中国製モデルへのクラウドAPIアクセスが制限されている中国において、Qwen3やDeepSeek-R1のデプロイでよく見られます。Qwen3 1.7Bと4BはCPU専用ハードウェアで動作し、ハードウェアが限られたユーザーにクラウドAPIの実用的な代替手段を提供します。
低スペックPCでのローカルLLM実行に関するよくある質問
低スペックPCでのローカルLLMとは何ですか?
低スペックPCでのローカルLLMとは、専用GPUのないCPU専用マシンで、システムRAMが4〜16 GBのものです。Intel IrisやAMD Radeon統合グラフィックスを搭載するほとんどのノートPC、専用GPUのない古いデスクトップPC、Intel N100などのミニPCが該当します。重要な制約はCPU速度ではなく、モデルの重みを保持するためのシステムRAMです。
GPUなしで7Bクラスのモデルを実行できますか?
はい — Qwen3 8B(Q4_K_M)はRAM 16 GB、CPU専用で8〜15トークン/秒で動作します(Ryzen 7 7700Xでテスト済み)。より小さいモデルより遅いですが、品質は明らかに優れています。RAM 8 GBの場合はPhi-4-mini(3.8B)を使用してください — 8Bモデル(Q4_K_M)は8 GBシステムでは確実に確保できない余裕を必要とします。
CPU推論はチャットボットに使用できますか?
はい、適切なモデルサイズを選べばインタラクティブ用途にも使えます。Phi-4-mini(15〜25トークン/秒、RAM 8 GB)とQwen3 1.7B(25〜40トークン/秒、RAM 4 GB)はどちらもリアルタイムチャットに十分な速度です。CPU上の7Bクラスモデル(8〜15トークン/秒)はライブの会話よりも、下書き、要約、オフラインレビューなどのバッチタスクに向いています。
CPU専用ハードウェアではPhi-4-miniとQwen3 1.7Bのどちらを使うべきですか?
RAM 8 GBがあればPhi-4-mini(3.8B)を使用 — コーディングと推論を15〜25トークン/秒で処理します。RAM 4 GBしかない、または最速の応答(25〜40トークン/秒)を優先する場合はQwen3 1.7Bを使用 — ただし複雑なタスクでは品質が多少犠牲になります。
GPUがあるかどうかはどう確認しますか?
NVIDIA専用GPUの場合はターミナルで`nvidia-smi`を実行。「command not found」が返る場合は、`lspci`(Linux)またはデバイスマネージャー(Windows)でIntel Iris XeまたはAMD RadeonのiGPUを確認してください — CUDA非対応でも一部のレイヤーをオフロードできます。
量子化は推論速度にどう影響しますか?
量子化は主に計算ではなくメモリ帯域幅要件を削減します。Q2(2ビット)はQ4(4ビット)より約30%速い:モデルが各フォワードパスでロードするバイト数が少ないためです。ただしQ2は約10%の品質ペナルティがあります。実用的なルール:本ガイドのすべての階層でデフォルトはQ4_K_M、RAMに収まらない場合のみQ3に切り替え。
Q2以下の量子化は可能ですか?
技術的にはQ1も可能ですが、品質は壊滅的に劣化 — 精度損失は最大30%。本ガイドのRAM 4GB階層を含め、実用的なユースケースには推奨しません。
CPU + iGPUハイブリッド推論はサポートされていますか?
はい、レイヤーオフロードを通じて対応。Intel Iris Xe iGPU搭載のRAM 8GBシステムでは、Qwen3 4Bが部分オフロードで12〜20トークン/秒に達し、CPU専用を上回ります。`OLLAMA_NUM_GPU=1`を設定すると、Ollamaが収まるレイヤーを自動的にオフロードします。
低スペックPC向け最速のローカルLLMは何ですか?
Qwen3 1.7B(Q4_K_M)は本ガイドで最速のモデルです — 最新のi5/Ryzen 5、RAM 4 GB、GPUなしで25〜40トークン/秒。同程度の速度でより高い品質が欲しい場合は、Phi-4-mini(3.8B)がRAM 8 GBで15〜25トークン/秒、コーディングと推論をより優れて処理します。
4GBのRAMでローカルLLMを実行できますか?
はい — Qwen3 1.7B(Q4_K_M)はRAM 4 GB・CPU専用向けの推奨モデルで、最新のi5/Ryzen 5で25〜40トークン/秒に到達します。本ガイドで最速のモデルであり、OS用の余裕を残して収まります。
速度にGPUは必要ですか?
いいえ — 本ガイドのすべてのモデルはCPU専用で動作します。Intel Iris iGPUは明確な速度向上をもたらします(Qwen3 4B:部分オフロードで12〜20トークン/秒 vs. CPU専用)が、あくまでオプションです。中古のRTX 4060 8GBなどの専用GPUはどのCPU構成よりも5〜10倍高速ですが、これは別のアップグレード経路であり、必須ではありません。
情報源
- Phi-4 Miniモデルカード — Microsoft Research。MMLU 68%、HumanEval 70%。2025年リリース。
- Gemma 3モデルカード — Google DeepMind。128Kコンテキストウィンドウ搭載のGemma 3 2B。2025年リリース。
- Llama 4 Scout 8B — Meta。1000万トークンのコンテキストウィンドウ、2026年3月リリース。
- TinyLlama 1.1Bリポジトリ — Stability AI。2024年にトレーニング完了。安定モデルで更新なし。RAM 4GB VRAM階層には引き続き推奨。
- llama.cpp CPU最適化ガイド — AVX-512、NEON、スレッド設定を含むCPU高速化フラグ。
