重要なポイント
- 7Bモデル: Q4で約4 GBの重み、Q5で約5 GB、Q8で約7 GB。現実的な購入目安は6-8 GB。
- 13Bモデル: Q4で約8 GBの重み。12 GBのVRAMは「ぎりぎり」ではなく余裕があります。
- 70Bモデル: Q4で約42 GBの重み。Q8では約74 GB必要。
- Q4量子化: 完全精度比で約85%削減、実際のGGUFファイルサイズで検証済み。
📍 一文で説明
4ビット量子化では、パラメータ10億あたり約0.6 GBのVRAMを見込みます。7Bモデルは5 GB、70Bモデルは42 GBが目安です。
💬 簡潔に説明
計算はシンプルです。パラメータ数(10億単位)に0.6を掛けた値が4ビット時の必要GB数で、そこにコンテキストとOS用の1〜2 GBを足します。13Bなら約8 GB、22Bなら約13 GBが目安になります。
VRAM計算式
VRAM = 十億パラメータ × パラメータあたりバイト数 + KVキャッシュ + オーバーヘッド
パラメータあたりバイト数(実際のGGUFファイルで検証):Q4は約0.6バイト、Q5は約0.7バイト、Q8は約1.05バイト。
例:Llama-3.3 70B Q4 = 70 × 0.6 = 42 GB(実際のLlama-3.3-70B Q4_K_M GGUFは42.52 GB)
Q4: 理論値の0.5バイトではなく実測で約0.6バイト/パラメータ(Q4_K_Mなど実際の形式には若干のオーバーヘッドがある)。
Q8: 実測で約1.05バイト/パラメータ、ほぼ完全精度。
モデルサイズ別VRAM
モデルサイズ | FP32 | Q8 | Q5 | Q4 | 推奨GPU |
|---|---|---|---|---|---|
| 7B | 28 GB | 7 GB | 5 GB | 4 GB | RTX 4060 (8GB)、RTX 3060 (12GB) |
| 13B | 52 GB | 14 GB | 9 GB | 8 GB | RTX 3060 (12GB)、RTX 4070 (12GB) |
| 70B | 280 GB | 74 GB | 50 GB | 42 GB | デュアルRTX 4090 |
| Qwen 3.6 35B-A3B (3B有効, MoE)* | 12 GB | 3 GB | 2 GB | 2 GB | RTX 2060 6 GB または RTX 5070 12 GB |
| DeepSeek V4-Flash (13B有効 / 284B総パラメータ, MoE)* | 52 GB | 14 GB | 9 GB | 8 GB | RTX 3060 12 GB または RTX 5070 12 GB |
| Llama 4 Scout (17B有効 / 109B総パラメータ, MoE)† | 436 GB | 114 GB | 76 GB | 55 GB | 2× RTX 4090 (48 GB) — 24 GBには1.78ビット時のみ収まる(~20 tok/s) |
| gpt-oss:20b (3.6B有効 / 21B総パラメータ, MoE)* | 84 GB | 22 GB | 15 GB | 12 GB | RTX 5070 12 GB または16 GBのGPU |
| Kimi K2.6 (32B有効 / 1T総パラメータ, MoE)* | 128 GB | 34 GB | 22 GB | 19 GB | 2× RTX 4090 または RTX 5090 32 GB (Q4のみ) |
数値はHugging Face上の実際のGGUFファイルサイズで検証済みの重みのみのサイズです(例:Llama-2-7B Q4_K_M = 4.08 GB、Mistral-Small-24B Q4_K_M = 14.33 GB、Llama-3.3-70B Q4_K_M = 42.52 GB)。コンテキスト/KVキャッシュ用に1-2 GBの余裕を追加してください。* MoEモデル: VRAMはアクティブパラメータのみから計算され、総モデルサイズではありません。† Llama 4 Scoutは109Bパラメータすべてを常駐させるため、トークンあたり17Bしか有効でなくてもQ4で~55 GB必要です。

量子化
量子化はモデル重みを低精度に圧縮します。Q4が標準。
VRAMはモデルサイズを決定しますが、プロンプトの設計が出力品質を決定します。Chain-of-ThoughtやFew-Shotプロンプティングなどのテクニックは、小さなモデルと大きなモデルの品質差を縮めることができます。お使いのハードウェアがサポートするモデルから最大限を引き出すには、プロンプトエンジニアリング完全ツールキットをご覧ください。VRAM が 12–16 GB あり、このツールキットを試す具体的なコーディングワークロードを探しているなら、GitHub Copilot をローカル LLM で置き換えるで Continue.dev + Ollama + Qwen3-Coder のスタックがちょうどこれらの VRAM 帯にフィットする様子を解説しています。

バッチサイズ
シングルユーザー推論はbatch=1です。
オーバーヘッド
KVキャッシュ、アクティベーション、ランタイムが追加メモリを消費。
地域的背景
日本 (METI): ローカルLLM推論は主権データ管理として重要。
一般的な間違い
VRAM ≠ モデルサイズ。常に5 GB以上の余地が必要。
VRAM計算機
モデルサイズと量子化を選択してVRAM要件を推定します。
Popular Models
Base Model
6.50 GB
Context OH
1.50 GB
Batch OH
0.00 GB
System OH
1.00 GB
Total Minimum
9.00 GB
Recommended (with 25% safety margin)
11.25 GB
👉 Look for a GPU with at least 11.25 GB VRAM
Compatible GPUs
RTX 3060 (12 GB)
0.8 GB headroom
RTX 4060 Ti (16 GB)
4.8 GB headroom
RTX 4070 Ti Super (16 GB)
4.8 GB headroom
RTX 4080 Super (16 GB)
4.8 GB headroom
RTX 4090 (24 GB)
12.8 GB headroom
RTX 5090 (32 GB)
20.8 GB headroom
Mac Mini M6 (32 GB) (32 GB)
20.8 GB headroom
Mac Mini M5 Pro (64 GB) (64 GB)
52.8 GB headroom
Mac Studio M5 Max (128 GB) (128 GB)
116.8 GB headroom
Mac Studio M5 Ultra (96 GB+) (96 GB)
84.8 GB headroom
💡 Pro Tips:
- Always use the "with safety margin" figure when buying a GPU
- Q4 gives 90-95% quality with 25% size reduction. Q5 is better if you have room
- Context overhead grows with conversation length. Budget 1-3 GB for typical usage
- Batch size matters for multi-user APIs. Single-user chat can ignore batch overhead
📋 Share this configuration:
RTX 4060は7B Q4に十分?
十分です。7BはQ4で約4 GBの重みなので、RTX 4060の8 GBなら余裕があります。
70B用に24 GBは?
不十分です。Q4でも約42 GB必要です。
6GB GPUでMistral Smallを実行できますか?
いいえ。Mistral Smallは22-24Bモデルで、Q4でも重みだけで約13-14GBのVRAMが必要です。6GBや8GBのGPUではOOMになります。余裕を持って16GBを、または6-8GBのカードなら7B-8Bモデルを使ってください。
7BモデルのファインチューニングにはどのくらいのVRAMが必要ですか?
LoRA用: 12-16GB。フルファインチューニング: 28GB以上。ファインチューニングはオプティマイザー状態(モデルVRAMの2-4倍)が必要です。
Llama 3 13Bに12GBで十分ですか?
十分すぎるほどです。13BモデルはQ4で約8GBしか必要とせず、12GBなら実際に余裕があります。Q5(約9GB)でも快適で、Q8(約14GB)でぎりぎりになります。
70Bモデルに24GBが必要ですか?
いいえ、ただしそれに近い量が必要です。70Bモデルは重みだけでQ4で約42GB必要です。Q5以上では50GB以上必要になります。どの量子化レベルでも24GBでは不十分です。
バッチサイズを増やすと単一推論のVRAMが減りますか?
いいえ。単一推論は常にbatch=1 VRAMを使用します。バッチサイズはスループット(マルチユーザーシナリオ)にのみ役立ちます。
精度に最適な量子化は何ですか?
Q8はほぼ知覚できないロスです。Q5は~2%ロス。Q4は~1%ロス。ほとんどの場合、Q4がスイートスポットです。
VRAMの一部をCPU RAMにオフロードできますか?
はい、レイヤー分割を使用します。Llama.cppとOllamaがサポートしています。パフォーマンスは30-50%低下します。
ローカルLLM実行の最小VRAMは?
3B Q4なら4GB VRAM。実用的な最小値は8GB VRAM + 7B Q4。6GB以下では、ほとんどの7Bモデルでは不十分です。
Apple Silicon VRAMはGPU VRAMと同じですか?
Apple Siliconは共有メモリを使用します。M3 18GB = GPU 18GB VRAM。MacBook Pro M3 18GBはLlama 3 13B Q4(~7GB) + オーバーヘッドを実行できます。
異なる量子化レベルで7Bには何GBのVRAMが必要ですか?
7B FP32: ~28GB。7B Q8: ~7GB。7B Q5: ~5GB。7B Q4: ~5-6GB(4GBの重み + 1-2GBオーバーヘッド)。6GBはきついです、8GBが快適です。
参考資料
- NVIDIA CUDA ドキュメント
- Ollama ドキュメント
