重要なポイント
- 小規模スケールでの最高の推論: Phi-4 Mini 3.8B -- 68% MMLU、70% HumanEval、4 GB RAMで動作。
- 最良の小型/エッジモデル: Gemma 4 E2B -- MMLU Pro 60%、128Kコンテキスト、約2 GB RAM、Apache 2.0。旧Gemma 2 2Bを置き換え。
- 最高の小規模コーディングモデル: Qwen2.5 3B -- ~2 GB RAMで65% HumanEval。
- 最高の汎用3Bモデル: Llama 3.2 3B -- 最も多くのコミュニティサポート、128Kコンテキスト、2.5 GB RAM。
- 2B以下のモデルはプロフェッショナルなタスクに適した出力品質を生成しません。実務では3B以上を使用してください。
📍 一文で説明
小型ローカルLLM(1B〜4Bパラメータ)は4〜8GBのRAMを搭載したマシンで秒間30〜70トークンで動作し、推論ではPhi-4 Mini 3.8Bが優れ、128Kコンテキストを持つ小型・エッジ用途にはGemma 4 E2B、コーディングにはQwen2.5 3B、汎用にはLlama 3.2 3Bが最適です。
💬 簡潔に説明
ノートパソコンのRAMが4〜8GBしかなくても、小型のAIモデルなら動かせます。これらの4B未満のモデルはリアルタイムチャットに十分な速度があり、要約、簡単な質疑応答、短い文章の翻訳などのシンプルなタスクをうまくこなしますが、複数ステップの推論や長く一貫した文章を書くのは苦手です。それでも、ほとんどのタスクではエントリーレベルのハードウェアに適した選択肢です。
「小規模」ローカルLLMとは何か、そしていつ使うべきか?
小規模ローカルLLMは、通常、40億未満のパラメータを持つモデルとして定義されます。 Q4_K_M量子化では、これらのモデルは1.5~3 GBのRAMを必要とします。これは、4~8 GBの総メモリを持つエントリーレベルノートパソコンの制約内です。
小規模モデルは以下に適しています:クイック要約、シンプルなQ&A、コードスニペット説明、短いテキストの翻訳、分類タスク。複数ステップの推論、複雑なコード生成、長い一貫した文書の作成には適していません。
3Bモデルと7Bモデル間の品質ギャップは重大です。GPT-4o miniとGPT-5.5間のギャップとほぼ同等です。8 GB RAMを持つユーザーの場合、マシンに余裕があれば、Q4_K_Mの7Bモデルがほぼ常に良い選択です。7B推奨については、最高の初心者向けローカルLLMモデルを参照してください。
どのモデルを使うべきか?簡単な決定ガイド
Phi-4 Mini 3.8B -- Sub-4Bクラスで最高の推論パフォーマンス
Microsoft Phi-4 MiniはMMLA68%、HumanEval70%を達成します。 これらのスコアは2025年より前にリリースされた多くの7Bモデルを上回っています。これが可能な理由は、Phi-4 Miniが広いウェブテキストではなく、推論と問題解決に焦点を当てた管理されたシンセティックデータセットで訓練されたためです。
Phi-4 Miniは、主に推論(数学、論理、段階的説明)またはコード支援が必要で、4~6 GB RAMのハードウェアを持つユーザーに推奨される選択肢です。
Spec | Value |
|---|---|
| MMLU | 68% |
| HumanEval | 70% |
| RAM (Q4_K_M) | ~2.5 GB |
| コンテキスト | 128Kトークン |
| CPU速度 | 30~50トークン/秒 |
| Ollamaコマンド | ollama run phi4-mini |
Gemma 4 E2B -- 最良の小型/エッジモデル
Google Gemma 4 E2Bは現行世代の小型モデルで、旧世代のGemma 2 2Bを置き換えます。 Google公式のモデルカードによると、MMLU Pro(従来のMMLUより難しいベンチマーク)で60%、LiveCodeBench v6で44%、GPQA Diamondで43.4%を記録しています。実効パラメータ数は2.3B(埋め込みを含めると5.1B)で、約2GBのRAMに収まります。
128Kのコンテキストウィンドウは、旧Gemma 2 2Bの8Kから大幅に向上し、Phi-4 MiniやLlama 3.2 3Bと同水準になりました。CPU速度はハードウェアと量子化によって異なります(Google公式ではRaspberry Pi 5でデコード約7.6トークン/秒、独立系のx86 CPUレポートでは8~48トークン/秒の幅があります)-- お使いのデバイスでの最新の数値を確認してください。Apache 2.0ライセンス。
Spec | Value |
|---|---|
| MMLU Pro | 60% |
| LiveCodeBench v6 | 44% |
| GPQA Diamond | 43.4% |
| RAM (Q4_K_M) | ~2 GB |
| コンテキスト | 128Kトークン |
| Ollamaコマンド | ollama pull gemma4:e2b |
Qwen2.5 3B -- コーディングタスク向けの最高の小規模モデル
Qwen2.5 3BはHumanEvalで65%のスコアを獲得し、Llama 3.2 3Bより5ポイント高く、3Bスケールでのコーディングタスクに最適です。JSONモードと関数呼び出しサポートを含み、29言語をネイティブに処理します。
英語での非コーディングタスクについては、Llama 3.2 3BとPhi-4 Miniはより自然なプロスを生成します。コーディングまたは多言語出力が主なユースケースの場合、特にQwen2.5 3Bを選択してください。
Spec | Value |
|---|---|
| MMLU | 62% |
| HumanEval | 65% |
| RAM (Q4_K_M) | ~2 GB |
| コンテキスト | 128Kトークン |
| CPU速度 | 25~40トークン/秒 |
| Ollamaコマンド | ollama run qwen2.5:3b |
Llama 3.2 3B -- 最高の汎用小規模モデル
Meta Llama 3 .2 3Bは、最も広くドキュメント化され、コミュニティがサポートする3Bモデルです。MMLU58%、HumanEval60%のスコアは、両方でPhi-4 Miniを若干下回りますが、最も広いツールサポート、最も利用可能なファインチューン、最大のコミュニティガイドコレクションを備えています。
128Kコンテキストウィンドウは、より大きなLlama 3.xモデルと同じで、中程度の長さの文書の要約に適しています。最初の小規模モデルとして、Llama 3.2 3Bは予測可能な動作と広範なドキュメンテーションのため、最も安全な選択のままです。
Spec | Value |
|---|---|
| MMLU | 58% |
| RAM (Q4_K_M) | ~2.5 GB |
| コンテキスト | 128Kトークン |
| CPU速度 | 25~45トークン/秒 |
| Ollamaコマンド | ollama run llama3.2:3b |
Llama 3.2 1B -- 有用な出力のための絶対最小値
Llama 3.2 1BはMetaが公開する最小のLlamaモデルです。わずか1.3 GBのRAMを必要とし、CPUで60~90トークン/秒を生成します -- このページで最も高速なローカル実行可能モデルです。出力品質は限界的です:非常にシンプルな分類とキーワード抽出を処理しますが、一貫した複数文の応答に苦労します。RAMが本当に制約(3 GB未満)である場合、またはツール統合をテストする場合のみ、Llama 3.2 1Bを使用してください。
完全比較:4B未満の最高の小規模ローカルLLM
モデル | MMLU | HumanEval | RAM | コンテキスト | 最適用途 |
|---|---|---|---|---|---|
| Phi-4 Mini 3.8B | 68% | 70% | 2.5 GB | 128K | 推論、コーディング |
| Qwen2.5 3B | 62% | 65% | 2 GB | 128K | コーディング、多言語 |
| Llama 3.2 3B | 58% | 60% | 2.5 GB | 128K | 汎用、最初のモデル |
| Gemma 4 E2B | — | — | 2 GB | 128K | エッジ用途(MMLU Pro 60%) |
| Llama 3.2 1B | 32% | 28% | 1.3 GB | 128K | 絶対最小RAM |

地域別の小規模ローカルLLM
日本(METI): 小規模モデルティアでの日本語タスクについては、この比較の唯一のモデルであるネイティブな日本語トークン化はQwen2.5 3Bです。Llama 3.2 3Bは日本語を処理しますが、トークン効率は低くなります。RAM制約の下での日本語要約または翻訳の場合:`ollama run qwen2.5:3b`。小規模モデルの速度の利点は日本企業の使用に特に関連しています。CPUで25~40トークン/秒は、標準的な職場ハードウェア上のチャットインターフェースに適切なリアルタイム応答を提供します。日本の独立系企業向けMETIガイダンスに準拠した小規模モデルの実装については、Ollama経由のローカル展開がすべてのテキスト処理をオンデバイスに保つため推奨されます。
中国: Qwen2.5 3B(Alibaba、Apache 2.0)は、中国語の小規模モデル展開の自然な選択です。ネイティブな中国語トークン化により、同等のパラメータ数のLlamaより30~40%効率的に中国語テキストを処理します。IoTおよび中国のデータセキュリティ法(数据安全法)下でのエッジ展開の場合:`ollama run qwen2.5:3b`は4 GB RAMを備えた任意のLinuxデバイスで動作し、外部APIコールなしですべてのテキストをオンデバイスで処理します。
その他の地域: 英語ユースケースの場合、Phi-4 Mini 3.8BはCPUベースのシステムで最高の推論品質を提供します。コストの最適化と速度が重要な場合、Gemma 4 E2Bはスケールできる推論基盤を最小限のメモリで提供します。
小規模ローカルLLMを実行する場合の一般的な誤り
- Q4_K_Mの代わりにQ8_0量子化を使用する: Q8_0は、小規模での品質改善がわずかなため、Q4_K_Mのほぼ2倍のRAMを必要とします。Llama 3.2 3BモデルのQ8_0は~3.8 GB RAMが必要で、Q4_K_Mでは~2.5 GBです。4 GBマシンではQ8_0はスワップ使用をトリガーし、推論を3~5倍遅くする可能性があります。Sub-4BモデルではデフォルトとしてQ4_K_Mを常に使用してください。
- 命令バリアント代わりにベースモデルを実行する: ベースモデル(例:`llama3.2:3b-text`)は、テキスト内の次のトークンを予測するようにトレーニングされた事前ファインチューニングチェックポイントです。指示に従いません。ベースモデルに「2+2は何ですか?」と聞くと、「4」と答える代わりにクイズとして文を完成させるかもしれません。常に命令バリアントを使用してください:`llama3.2:3b`(Ollamaは名前付きモデルのデフォルトで命令を使用)。
- 3Bモデルから7Bモデルの品質を期待する: 68% MMLU(Phi-4 Mini)の3Bモデルは、一般的なタスクで2023年のGPT-4o miniと同様にパフォーマンスします。複雑な推論チェーン、長文の作成、微妙なコード生成は、7Bモデルより顕著に低い品質を生成します。出力品質が不十分な場合は、7Bモデルにアップグレードしてください。RAMの差は~2 GB(2.5 GB → 4.5 GB)です。
量子化を理解する:RAMと品質のトレードオフ

小規模ローカルLLMモデルについてのよくある質問
有用な出力を生成する最小のローカルLLMは何ですか?
有用な出力の実用的な最小値はQ4_K_M量子化での3Bモデルです。2B以下のパラメータを持つモデル(Llama 3.2 1B、Gemma 4 E2B)は一貫した単一文を生成しますが、複数ステップの指示と複雑な推論に苦労しています。要約やシンプルなQ&Aなどのタスクの場合、Gemma 4 E2Bは使用可能です。より複雑な場合は、3Bモデルから始めてください。
3Bモデルを電話で実行できますか?
はい -- Llama 3.2 1Bと3Bは、オンデバイスのモバイル展開用に設計されています。Metaは、iOS(MLC LLM経由)およびAndroid向けの最適化されたビルドを提供します。モダンフォン(Snapdragon 8 Gen 3またはApple A17 Pro)での推論は、1Bモデルで15~30トークン/秒を生成します。LM StudioとOllamaは現在iOSまたはAndroidで動作しません。モバイルには別のフレームワークが必要です。
小規模モデルは要約に適していますか?
はい -- 要約は小規模モデルの最強のユースケースの1つです。Gemma 4 E2BとLlama 3.2 3Bは、~4,000語までのテキスト(品質出力の実用的なコンテキスト制限)の正確な要約を確実に生成します。より長い文書の場合は、Phi-4 MiniまたはLlama 3.2 3B(両方で128Kトークン)のような大きなコンテキストウィンドウを持つモデルを使用してください。
2Bモデルは同じハードウェアで7Bモデルより何倍速いですか?
ハードウェアと量子化に大きく依存します -- GoogleはRaspberry Pi 5でのGemma 4 E2Bのデコード速度を約7.6トークン/秒と報告しており、独立系のx86 CPUテストでは8~48トークン/秒の幅があります。GPUではスピード利点は狭くなります。スピード差はCPUのみのマシンで最も顕著です。
小規模モデルは関数呼び出しをサポートしていますか?
いくつかサポートしています。Qwen2.5 3Bは関数呼び出しとJSONモードをサポートしています。Llama 3.2 3Bは基本的なツール使用をサポートしています。Gemma 4 E2Bは関数呼び出しをサポートしていません。構造化された出力に依存するパイプラインを構築する前に、モデルのドキュメントを確認してください。
英語以外の言語に最適な小規模モデルはどれですか?
Qwen2.5 3Bは、中国語、日本語、韓国語、アラビア語を含む29言語をネイティブにサポートしています。Gemma 4 E2BとPhi-4 Miniは主に英語最適化されています。小規模モデルスケールでの非英語タスクの場合、Qwen2.5 3Bが明確な選択肢です。Qwen vs Llama vs Mistral 多言語比較で完全な言語比較を参照してください。
日常的なタスクでのPhi-4 MiniとLlama 3.2 3Bの違いは何ですか?
Phi-4 Miniはほぼ同じRAM(各2.5 GB)で推論、数学、コーディングでLlama 3.2 3Bを上回ります(68%対58% MMLU、70%対60% HumanEval)。日常的なタスク -- Q&A、要約、シンプルな説明 -- では、品質ギャップは顕著ですが劇的ではありません。Llama 3.2 3Bはより広いコミュニティサポートとより多くのファインチューンが利用可能です。構造化された推論にはPhi-4 Miniを選択し、汎用チャットと互換性にはLlama 3.2 3Bを選択してください。
2つの小規模モデルを同時に実行できますか?
はい、合計RAMが許可する場合。Q4_K_Mで2つの3Bモデルは~5 GB組み合わされて使用します。リーンなOSを備えた8 GBマシンでは実行可能です。Ollamaはデフォルトでプロセスごとに一度に1つのモデルをロードします。異なるポート(OLLAMA_HOST=:11434とOLLAMA_HOST=:11435)で2つのOllamaインスタンスを実行して、2つのモデルを並行して提供してください。これは出力をA/Bテストするのに役立ちます。
小規模モデルはRAG(検索拡張生成)に機能しますか?
シンプルなRAGの場合ははい。Llama 3.2 3BとPhi-4 Miniは、取得した文書チャンク上の質問に確実に答えることができます。複数ホップの推論が必要な大規模な知識ベース上のRAGの場合、7B+モデルはより一貫してパフォーマンスします。GPT4AllのLocalDocsフィーチャーはドキュメントQ&Aに3Bモデルを使用し、個人ドキュメント集合に対してうまく動作します。
Phi-4 MiniはコーディングでLlama 3.2 3Bより優れていますか?
はい。Phi-4 Miniはこのスケールで意味のある10ポイントギャップでLlama 3.2 3Bの60%対70% HumanEvalスコアを達成します。4~6 GB RAMマシンでのコーディング支援の場合、Phi-4 Miniが推奨される選択肢です。多言語コーディング(非Python)の場合、65% HumanEvalのQwen2.5 3Bはphi-4 Miniと競争力があり、関数呼び出しもサポートしています。
Q4_K_Mの代わりにQ8_0量子化を使用する場合
Q8_0は、この規模では品質向上がわずかであるにもかかわらず、Q4_K_Mのほぼ2倍のRAMを必要とします。Q8_0のLlama 3.2 3BモデルはQ4_K_Mの約2.5 GBに対して約3.8 GBのRAMが必要です。4 GBのマシンでは、Q8_0がスワップ使用を引き起こし、推論を3~5倍遅くする可能性があります。Sub-4Bモデルには常にQ4_K_Mをデフォルトとして使用してください。
instructバリアントの代わりにベースモデルを実行する場合
ベースモデル(例:llama3.2:3b-text)はファインチューニング前のチェックポイントで、テキスト中の次のトークンを予測するように学習されています。指示には従いません。ベースモデルに「2+2は何ですか?」と尋ねると、「4」と答える代わりに、クイズのように文を完成させることがあります。常にinstructバリアントを使用してください:llama3.2:3b(Ollamaは名前付きモデルに対してデフォルトでinstructを使用します)。
3Bモデルに7Bモデル相当の品質を期待する場合
MMLU 68%の3Bモデル(Phi-4 Mini)は、一般的なタスクにおいて2023年頃のGPT-3.5 Miniと同程度の性能です。複雑な推論の連鎖、長文の執筆、繊細なコード生成では、7Bモデルよりも明らかに品質が低くなります。出力品質が不十分な場合は、7Bモデルにアップグレードしてください -- RAMの差は約2 GB(2.5 GB → 4.5 GB)です。
実際に使える最小のローカルLLMは何ですか?
一貫した出力の下限は約1Bパラメータで、実務で動かす価値があるこのリストの中で最も小さいモデルはLlama 3.2 1Bです。それより小さいモデルはほぼどんなハードウェアでもロードして生成できますが、数文でテキストの一貫性が崩れるため、アシスタントというよりオートコンプリートとして扱う方が適しています。品質よりディスクとRAMの制約が優先される場合、フットプリントが小さく実用的な最小のローカルLLMはQ4量子化のsub-2Bモデルです。4GB以上使える場合は、4Bモデルがわずかな追加RAMで一貫性を大きく向上させます。
ローカルで実行できる最小のLLMモデルは何ですか?
Llama 3.2 1BはMetaが公開する最小のLlamaモデルであり、この比較の中で最も実用的な選択肢です。必要なRAMはわずか1.3 GBで、CPUで60~90トークン/秒動作します -- このページで最も高速なモデルです。短い分類やキーワード抽出タスクは処理できますが、長く複数ステップの出力には対応できません。日常的に実際に使える小型モデル(「ミニLLM」と呼ばれることもあります)をお探しなら、Llama 3.2 1Bはハードウェアの下限であって品質の下限ではないと考えてください -- 実務にはGemma 4 E2Bや、Qwen2.5 3BやLlama 3.2 3Bのような3Bモデルにステップアップしてください。
ソース
- Hugging Face Open LLM Leaderboard -- open-llm-leaderboard.hf.space(MMLUとHumanEvalスコア)
- Microsoft Phi-4技術レポート -- microsoft.com/en-us/research/publication/phi-4-technical-report/
- Meta Llama 3.2モデルカード -- huggingface.co/meta-llama/Llama-3.2-3B-Instruct
- Google Gemma 4 モデルカード -- huggingface.co/google/gemma-4-e2b-it
