Skip to main content
PromptQuorumBuilt for humans. Structured for AI.
ホーム/ローカルLLM/VRAM目安:7B=4GB、70B=42GB(2026ガイド)
GPU Buying Guides

VRAM目安:7B=4GB、70B=42GB(2026ガイド)

·7分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

7BモデルはQ4(4ビット)量子化で重みに約4 GBのVRAMが必要です。13Bは約8 GB、22Bは約13 GB、70Bは約42 GB必要です。これらは重みのみのサイズで、コンテキスト(KVキャッシュ)とシステム用に1-2 GBの余裕を追加してください。Q5(5ビット)では15-20%増、Q8(8ビット)では約75%増になります。数値はHugging Face上の実際のGGUFファイルサイズで検証済みです。

VRAM目安:7B=4GB、70B=42GB(2026ガイド)

重要なポイント

  • 7Bモデル: Q4で約4 GBの重み、Q5で約5 GB、Q8で約7 GB。現実的な購入目安は6-8 GB。
  • 13Bモデル: Q4で約8 GBの重み。12 GBのVRAMは「ぎりぎり」ではなく余裕があります。
  • 70Bモデル: Q4で約42 GBの重み。Q8では約74 GB必要。
  • Q4量子化: 完全精度比で約85%削減、実際のGGUFファイルサイズで検証済み。

📍 一文で説明

4ビット量子化では、パラメータ10億あたり約0.6 GBのVRAMを見込みます。7Bモデルは5 GB、70Bモデルは42 GBが目安です。

💬 簡潔に説明

計算はシンプルです。パラメータ数(10億単位)に0.6を掛けた値が4ビット時の必要GB数で、そこにコンテキストとOS用の1〜2 GBを足します。13Bなら約8 GB、22Bなら約13 GBが目安になります。

VRAM計算式

VRAM = 十億パラメータ × パラメータあたりバイト数 + KVキャッシュ + オーバーヘッド

パラメータあたりバイト数(実際のGGUFファイルで検証):Q4は約0.6バイト、Q5は約0.7バイト、Q8は約1.05バイト。

例:Llama-3.3 70B Q4 = 70 × 0.6 = 42 GB(実際のLlama-3.3-70B Q4_K_M GGUFは42.52 GB)

Q4: 理論値の0.5バイトではなく実測で約0.6バイト/パラメータ(Q4_K_Mなど実際の形式には若干のオーバーヘッドがある)。

Q8: 実測で約1.05バイト/パラメータ、ほぼ完全精度。

モデルサイズ別VRAM

モデルサイズ
FP32
Q8
Q5
Q4
推奨GPU
7B28 GB7 GB5 GB4 GBRTX 4060 (8GB)、RTX 3060 (12GB)
13B52 GB14 GB9 GB8 GBRTX 3060 (12GB)、RTX 4070 (12GB)
70B280 GB74 GB50 GB42 GBデュアルRTX 4090
Qwen 3.6 35B-A3B (3B有効, MoE)*12 GB3 GB2 GB2 GBRTX 2060 6 GB または RTX 5070 12 GB
DeepSeek V4-Flash (13B有効 / 284B総パラメータ, MoE)*52 GB14 GB9 GB8 GBRTX 3060 12 GB または RTX 5070 12 GB
Llama 4 Scout (17B有効 / 109B総パラメータ, MoE)†436 GB114 GB76 GB55 GB2× RTX 4090 (48 GB) — 24 GBには1.78ビット時のみ収まる(~20 tok/s)
gpt-oss:20b (3.6B有効 / 21B総パラメータ, MoE)*84 GB22 GB15 GB12 GBRTX 5070 12 GB または16 GBのGPU
Kimi K2.6 (32B有効 / 1T総パラメータ, MoE)*128 GB34 GB22 GB19 GB2× RTX 4090 または RTX 5090 32 GB (Q4のみ)

数値はHugging Face上の実際のGGUFファイルサイズで検証済みの重みのみのサイズです(例:Llama-2-7B Q4_K_M = 4.08 GB、Mistral-Small-24B Q4_K_M = 14.33 GB、Llama-3.3-70B Q4_K_M = 42.52 GB)。コンテキスト/KVキャッシュ用に1-2 GBの余裕を追加してください。* MoEモデル: VRAMはアクティブパラメータのみから計算され、総モデルサイズではありません。† Llama 4 Scoutは109Bパラメータすべてを常駐させるため、トークンあたり17Bしか有効でなくてもQ4で~55 GB必要です。

目安: モデルサイズ(十億単位)に0.6を掛けるとQ4のVRAM(GB)になる。そこに1-2 GBの余裕を追加。
目安: モデルサイズ(十億単位)に0.6を掛けるとQ4のVRAM(GB)になる。そこに1-2 GBの余裕を追加。

量子化

量子化はモデル重みを低精度に圧縮します。Q4が標準。

VRAMはモデルサイズを決定しますが、プロンプトの設計が出力品質を決定します。Chain-of-ThoughtやFew-Shotプロンプティングなどのテクニックは、小さなモデルと大きなモデルの品質差を縮めることができます。お使いのハードウェアがサポートするモデルから最大限を引き出すには、プロンプトエンジニアリング完全ツールキットをご覧ください。VRAM が 12–16 GB あり、このツールキットを試す具体的なコーディングワークロードを探しているなら、GitHub Copilot をローカル LLM で置き換えるで Continue.dev + Ollama + Qwen3-Coder のスタックがちょうどこれらの VRAM 帯にフィットする様子を解説しています。

Q4はほとんどのユーザーに最適 — FP32より87.5%小さく、精度低下は約1%のみ。
Q4はほとんどのユーザーに最適 — FP32より87.5%小さく、精度低下は約1%のみ。

バッチサイズ

シングルユーザー推論はbatch=1です。

オーバーヘッド

KVキャッシュ、アクティベーション、ランタイムが追加メモリを消費。

地域的背景

日本 (METI): ローカルLLM推論は主権データ管理として重要。

一般的な間違い

VRAM ≠ モデルサイズ。常に5 GB以上の余地が必要。

VRAM計算機

モデルサイズと量子化を選択してVRAM要件を推定します。

Popular Models

Base Model

6.50 GB

Context OH

1.50 GB

Batch OH

0.00 GB

System OH

1.00 GB

Total Minimum

9.00 GB

Recommended (with 25% safety margin)

11.25 GB

👉 Look for a GPU with at least 11.25 GB VRAM

Compatible GPUs

RTX 3060 (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4060 Ti (16 GB)

4.8 GB headroom

✅ Fits

RTX 4070 Ti Super (16 GB)

4.8 GB headroom

✅ Fits

RTX 4080 Super (16 GB)

4.8 GB headroom

✅ Fits

RTX 4090 (24 GB)

12.8 GB headroom

✅ Fits

RTX 5090 (32 GB)

20.8 GB headroom

✅ Fits

Mac Mini M6 (32 GB) (32 GB)

20.8 GB headroom

✅ Fits

Mac Mini M5 Pro (64 GB) (64 GB)

52.8 GB headroom

✅ Fits

Mac Studio M5 Max (128 GB) (128 GB)

116.8 GB headroom

✅ Fits

Mac Studio M5 Ultra (96 GB+) (96 GB)

84.8 GB headroom

✅ Fits

💡 Pro Tips:

  • Always use the "with safety margin" figure when buying a GPU
  • Q4 gives 90-95% quality with 25% size reduction. Q5 is better if you have room
  • Context overhead grows with conversation length. Budget 1-3 GB for typical usage
  • Batch size matters for multi-user APIs. Single-user chat can ignore batch overhead

📋 Share this configuration:

Loading...

RTX 4060は7B Q4に十分?

十分です。7BはQ4で約4 GBの重みなので、RTX 4060の8 GBなら余裕があります。

70B用に24 GBは?

不十分です。Q4でも約42 GB必要です。

6GB GPUでMistral Smallを実行できますか?

いいえ。Mistral Smallは22-24Bモデルで、Q4でも重みだけで約13-14GBのVRAMが必要です。6GBや8GBのGPUではOOMになります。余裕を持って16GBを、または6-8GBのカードなら7B-8Bモデルを使ってください。

7BモデルのファインチューニングにはどのくらいのVRAMが必要ですか?

LoRA用: 12-16GB。フルファインチューニング: 28GB以上。ファインチューニングはオプティマイザー状態(モデルVRAMの2-4倍)が必要です。

Llama 3 13Bに12GBで十分ですか?

十分すぎるほどです。13BモデルはQ4で約8GBしか必要とせず、12GBなら実際に余裕があります。Q5(約9GB)でも快適で、Q8(約14GB)でぎりぎりになります。

70Bモデルに24GBが必要ですか?

いいえ、ただしそれに近い量が必要です。70Bモデルは重みだけでQ4で約42GB必要です。Q5以上では50GB以上必要になります。どの量子化レベルでも24GBでは不十分です。

バッチサイズを増やすと単一推論のVRAMが減りますか?

いいえ。単一推論は常にbatch=1 VRAMを使用します。バッチサイズはスループット(マルチユーザーシナリオ)にのみ役立ちます。

精度に最適な量子化は何ですか?

Q8はほぼ知覚できないロスです。Q5は~2%ロス。Q4は~1%ロス。ほとんどの場合、Q4がスイートスポットです。

VRAMの一部をCPU RAMにオフロードできますか?

はい、レイヤー分割を使用します。Llama.cppとOllamaがサポートしています。パフォーマンスは30-50%低下します。

ローカルLLM実行の最小VRAMは?

3B Q4なら4GB VRAM。実用的な最小値は8GB VRAM + 7B Q4。6GB以下では、ほとんどの7Bモデルでは不十分です。

Apple Silicon VRAMはGPU VRAMと同じですか?

Apple Siliconは共有メモリを使用します。M3 18GB = GPU 18GB VRAM。MacBook Pro M3 18GBはLlama 3 13B Q4(~7GB) + オーバーヘッドを実行できます。

異なる量子化レベルで7Bには何GBのVRAMが必要ですか?

7B FP32: ~28GB。7B Q8: ~7GB。7B Q5: ~5GB。7B Q4: ~5-6GB(4GBの重み + 1-2GBオーバーヘッド)。6GBはきついです、8GBが快適です。

参考資料

  • NVIDIA CUDA ドキュメント
  • Ollama ドキュメント

VRAMの予算がわかりました。次はそれに合ったGPUを選びましょう。

ローカルLLM向けベストバジェットGPU →

サードパーティの情報に関する注意

この記事はサードパーティのAIモデル、ベンチマーク、価格、ライセンスを参照しています。AIの状況は急速に変化しています。ベンチマークスコア、ライセンス条件、モデル名、API価格は執筆時とお読みになる時の間で変わる可能性があります。この記事に基づいてデプロイやコンプライアンスに関する決定を下す前に、各プロバイダーの公式ソース(ライセンスとベンチマークはHugging Faceのモデルカード、API価格はプロバイダーのウェブサイト、現在のGDPRとEU AI法のテキストはEUR-Lex)で最新の数値を確認してください。

ローカルLLM、独自のAPIキー、またはその両方でPromptQuorumを使用できます — バックエンドはあなたが選択します。

PromptQuorumベータ版をダウンロード →

← ローカルLLMに戻る