Skip to main content
PromptQuorum
ホーム/ローカルLLM/ローカルLLM向けの最高のバジェットGPU
GPU Buying Guides

ローカルLLM向けの最高のバジェットGPU

·7分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

RTX 3060 12GBはQwen3 14Bを9–12トークン/秒、Qwen3 8Bを16–20トークン/秒、Gemma 4 E12Bを11–14トークン/秒、Mistral Smallを18トークン/秒、DeepSeek-R1 7Bを10–12トークン/秒で実行します — すべてQ4量子化。 (DeepSeekはその後、オープンウェイトの新世代としてDeepSeek-V4—Flash/Pro—をリリースしました。R1/V3は引き続きローカルで利用可能です。) 6GB版は3Bモデルのみ対応。2026年6月時点、RTX 3060 12GB(中古$200–250)はローカルLLM用の最良バジェットGPUです。12GB VRAMはすべての7B-8BモデルをQ4/Q5で、ほとんどの稠密13B-14BモデルをQ4で実行できます。(注:Llama 4 Scoutは17Bアクティブ/109B合計のMoEで、Q4で~55GB必要なため、通常12GBには収まりません。)

ローカルLLM向けの最高のバジェットGPU

重要なポイント

  • RTX 3060 12GB(中古$170–220):すべての7B-8BモデルをQ4/Q5で、ほとんどの稠密13B-14BをQ4で実行。最良の中古バジェット選択。
  • RTX 5060 Ti 16GB(新品約$390–400):RTX 3060より4GB多いVRAMを持つ現行世代カード。最良の新品バジェット選択。
  • RTX 3060 6GB:3Bモデルのみ(Phi-4 Mini、Llama 3.2 3B)。7Bには不足。
  • 12GBでの最良総合モデル: Qwen3 14B、~9GB VRAM、9–12トークン/秒。快適に収まる最良の稠密品質。
  • 12GBでの最良コーディングモデル: Qwen3 8B、16–20トークン/秒。
  • 12GBでの最良推論モデル: DeepSeek-R1 7B、10–12トークン/秒。
  • 対象外: 70Bモデル、Llama 4 Scout(~55GB必要)、13B Q8が必要な場合は24GB以上(RTX 4090)が必要。

📍 一文で説明

RTX 3060 12GB(中古$200–250)はQwen3 14Bを9–12トークン/秒で実行し、2026年のローカルLLM向け最良のバジェットGPUです。

💬 簡潔に説明

AI向けのバジェットGPUとは、$300未満で購入できながら、自分のパソコンで使えるAIモデルを実用的な速度で動かすのに十分なビデオメモリ(VRAM)を持つグラフィックカードのことです。

RTX 3060 12GBで何が動く?

RTX 3060 12GBは2026年のローカルLLM用最良バジェットGPUです。 12GB VRAMはQ4/Q5のすべての7Bモデルと、Q4のほとんどの13Bモデルに対応。モデルサイズ別のVRAM要件について詳しくは、VRAM要件ガイド →をご参照ください。期待できる正確なモデルと速度は次の通りです:

📍 一文で説明

RTX 3060 12GBはQ4でQwen3 14B(9GB、約9–12トークン/秒)、Qwen3 8B(5.5GB、約16–20トークン/秒)、すべての7Bモデルを余裕を持って実行します。

💬 簡潔に説明

RTX 3060 12GBは12ギガバイトのビデオメモリを搭載しており、約140億パラメータまでのAIモデルに十分です。それより大きなモデルは収まらず、動作が遅くなります。

モデルサイズ量子化VRAM使用速度最適用途
Qwen3 14B14B(稠密)Q4_K_M~9 GB9–12トークン/秒収まる範囲で最良総合品質
Qwen3 8B8BQ4_K_M~7 GB16–20トークン/秒コーディング、万能
Gemma 4 E12B26B MoEQ4_K_M~9 GB11–14トークン/秒ビジョン、マルチモーダル
Mistral Small v0.37BQ4_K_M~7 GB18トークン/秒指示従行
DeepSeek-R1 7B7BQ4_K_M~7 GB10–12トークン/秒推論、数学
Gemma 4 E4BE4B(マルチモーダル)Q4_K_M~5 GB18–22トークン/秒軽量ビジョン、高速チャット
Llama 3.2 13B13BQ4_K_M~11 GB8–10トークン/秒高品質チャット(Q4のみ)

Qwen3 14B(稠密)はQ4_K_MでRTX 3060 12GBに快適に収まる最高品質のモデルで、~9 GBを使用します。`ollama pull qwen3:14b`。注:Llama 4 Scout(17Bアクティブ/109B合計のMoE、10Mトークンコンテキスト、マルチモーダル)はQ4で~55GB必要で、通常12GBには収まりません — 大容量VRAM環境向けの長コンテキスト/大規模マルチモーダル用途であり、バジェットGPUの推奨ではありません。gpt-oss:20b(21B合計/3.6BアクティブMoE)は16GB必要なため、12GBカードでは僅かに手が届きません。すべての速度はOllama、RTX 3060 12GB、16GBシステムRAM、Ryzen 7 7700Xで計測。Q4_K_M量子化。速度は±15%変動。

RTX 3060 12GBはQwen3 14Bを9〜12 tok/秒、Qwen3 8Bを16〜20 tok/秒で実行します(いずれもQ4_K_M量子化)。
RTX 3060 12GBはQwen3 14Bを9〜12 tok/秒、Qwen3 8Bを16〜20 tok/秒で実行します(いずれもQ4_K_M量子化)。

RTX 3060 6GBで何が動く?

6GB版は大幅に制限されています。 3Bモデルのみ快適に動作。7BモデルのQ4は~7GB必要で、容量不足です。

  • Phi-4 Mini 3.8B(Q4): ~3GB VRAM、20–25トークン/秒。このサイズでの最良推論。
  • Llama 3.2 3B(Q4): ~2.5GB VRAM、25–35トークン/秒。最速オプション。
  • Gemma 2 2B(Q4): ~1.7GB VRAM、35–45トークン/秒。最軽量モデル。
  • 7Bオフローディング: 可能だが遅い。Llama 7BのCPUオフロード = ~5–8トークン/秒。
  • 推奨: 6GBカードをお持ちなら、12GB中古($200–250)にアップグレードを。

RTX 3060 vs 他のバジェットGPU

GPUVRAM価格(中古)7B速度最大モデル評価
RTX 3060 12GB ★12 GB¥25,000–33,00015–20トークン/秒13B(Q4)最良の中古バジェット
RTX 5060 Ti 16GB16 GB新品約¥58,000–60,00025–30トークン/秒20B(Q4)最良の新品バジェット選択
RTX 4060 Ti 8GB8 GB¥38,000–45,00020–25トークン/秒7B(Q5最大)高速だがVRAM少
RTX A400016 GB¥27,000–35,00012–15トークン/秒13B(Q5)VRAM/円最良
RTX 4070 Super12 GB¥60,000–68,00025–30トークン/秒13B(Q5)高速だが2倍の価格
RX 6700 XT12 GB¥23,000–30,00010–14トークン/秒13B(Q4)最安、AMDの手間

RTX 3060 12GBが中古の価格性能比で勝利:¥25,000–33,000の12GB VRAMですべての7Bとほとんどの13Bを実行。新品ならRTX 5060 Ti 16GB(約¥58,000–60,000)がVRAMに余裕のある現行世代の選択肢。

RTX 3060 12GB(中古200〜250ドル)は、ドルあたりVRAMでRTX 4060 Ti、RTX A4000、RTX 4070 Super、RX 6700 XTを上回ります。
RTX 3060 12GB(中古200〜250ドル)は、ドルあたりVRAMでRTX 4060 Ti、RTX A4000、RTX 4070 Super、RX 6700 XTを上回ります。

7Bモデルに必要なVRAMは?

Q4(4ビット)で量子化された7Bモデルは6~8GB VRAMを必要とし、Q5(5ビット)は8~10GB、Q8(8ビット)は14~16GBを必要とします。

実際には:8GBは最低限で、Q4で7Bモデルでの快適な推論とバッチ処理用のスペースがあります。

6GBカード(RTX 2060)は技術的に機能しますがアグレッシブな最適化が必要で、より高いバッチに余裕がありません。

GPUコストは経済性の一面であり、トークンコストはもう一面です。ローカル推論はAPIのトークン課金を排除しますが、プロンプト長は依然としてレイテンシとスループットに影響します。トークン、価格体系、最適化戦略を含むコスト全体像については、トークン、コスト、制限:AIプロンプティングの経済学をご覧ください。

RTX 3060でのユースケース別最適モデル

パラメータ数ではなく、実際のニーズに基づいてモデルを選択してください:

バジェットハードウェアは小さなモデルを実行しますが、巧みなプロンプティングが品質差を縮めます。プロンプトエンジニアリングガイドでは、Chain-of-Thoughtや構造化出力など、小さなモデルの実力を引き出すテクニックを解説しています。RTX 3060 12 GB の VRAM に収まる具体的なワークロードのひとつが、プルリクエストの自動レビューです。まさに同じハードウェア上で Qwen3 8B を PR にぶつける GitHub Actions のパターンは、CI/CD でのローカル LLM コードレビューで解説しています。

  • チャット / Q&A: `ollama run qwen3:14b` — 稠密14B、~9GB VRAM、12GBで最良品質。軽量オプションは `ollama run qwen3:8b`(~7GB)。
  • コーディング: `ollama run qwen3:8b` — 万能で強力なコーディング。~7GB VRAM。16–20トークン/秒。
  • 推論 / 数学: `ollama run deepseek-r1:7b` — Chain-of-Thought。10–12トークン/秒。
  • ライティング / クリエイティブ: `ollama run mistral:7b` — 最良の指示従行。18トークン/秒。
  • ビジョン / 画像: `ollama run gemma4:e12b` — マルチモーダル。11–14トークン/秒。~9GB VRAM。軽量な選択肢は `ollama run gemma4:e4b`(~5GB)。
  • プライバシー / オフライン: 上記すべて。100%ローカル。データは外部送信されません。
  • ホームオートメーション / 常時稼働AI: `ollama run phi4-mini` — Phi-4 Mini(3.8B、~3 GB VRAM)は専用GPUなしのミニPCでHome Assistantの音声クエリを処理します。ローカルスマートホームAIの最適ハードウェア →をご覧ください。

中古 vs 新品:どこで買う?

  • 中古(50~100ドル安い):eBay、Facebook Marketplace、Craigslist、地元のコンピュータ修理店。死んだカードまたは不良VRAMのリスクが高い。確約する前に常にテストしてください。
  • 新品(280~400ドル):Newegg、Amazon、Best Buy、Microcenter。保証付き。驚きなし。価格安定。リスク回避買い手に最適。
  • マイニングカード(暗号、超安い):極端なリスク。VRAM劣化は一般的。その場で完全にベンチテストできる場合のみ購入してください。

よくあるバジェットGPUの間違い

  • 4GB RTX 2060を購入してスムーズな7B推論を期待する。常にメモリ不足エラーが発生します。
  • 250ドルのGPUを30ドルのPSU(電源)と組み合わせます。電圧サグは安定性を殺します。80+ Gold認定、650W最小をバジェット化してください。
  • DDR5 RAMとi9 CPUがLLM推論を高速化すると想定する。それらは高速化しません。GPU VRAMバンド幅は推論速度に影響する唯一のボトルネックです。

次のステップ

よくある質問

RTX 3060 12GBは2026年でもまだ価値があるか?

はい。4年以上前のカードですが、12GB VRAMは今も色褪せません。Qwen3 14B、Qwen3 8B、Gemma 4 E12B、Mistral SmallをQ4で問題なく実行します。すべての7B-8Bモデルとほとんどの稠密13B-14Bモデルに対応します。

ローカルLLM用にRTX 5060 TiまたはRTX 4060 Tiを購入すべきか?

RTX 5060 Ti 16GB(約$390–400)が現在はより良い選択です:8GB RTX 4060 Tiより8GB多いVRAMを持ち、世代あたり10–15%高速です。新品カードでは現行世代のバジェット選択です。予算が厳しい場合、8GB RTX 4060 Tiも7Bモデルには十分実用的です。13B以上を実行する予定なら、ベースの4060/5060(8GB)と4070(12GB)はVRAMの余裕が乏しいため避けてください。

AMD RX 7900 XTまたはRX 7900 XTXを代わりに使用できるか?

はい、ただしAMDのドライバサポートはNVIDIA + CUDAより弱いです。HIP/ROCmのセットアップにはより多くの手間がかかります。初心者にはRTXの方が安全です。

12GB VRAMは13Bモデルに十分か?

かろうじて、Q4量子化でなら。Q5またはQ8はOOMエラーを起こします。13Bを快適に実行したいなら16GBを目指してください。

RTX A4000などの中古エンタープライズGPUを購入すべきか?

はい、入手できるなら。16GB VRAM、プロフェッショナルグレードの冷却、通常$180–230で中古入手可能。RTX 3060より若干遅いですが、VRAMの余裕には十分な価値があります。

$250のGPUに合わせるべきPSU電力は?

650W、80+ Gold認証以上が最低ライン。$250のGPU+CPU+マザーボードは400Wを超えませんが、スパイクへの余裕を持たせるべきです。

$200のバジェットGPUでOllamaを実行できるか?

はい。Ollamaは軽量です。4年落ちのRTX 3060にOllamaを組み合わせれば、Qwen3 14Bを9–12トークン/秒、Qwen3 8Bを16–20トークン/秒で実行できます — 対話的なチャットやコーディング支援に十分実用的です。

RTX 3060 12GBでLlama 4 Scoutを実行できるか?

通常はできません。Llama 4 Scoutは17Bアクティブ/109B合計のMoEで、Q4で約55GBのVRAMが必要です — 12GBカードでは全く足りません。24GBでも極端な1.78ビット量子化(約20トークン/秒)でようやく収まる程度です。RTX 3060 12GBでは代わりに稠密モデルを実行してください:`ollama pull qwen3:14b`(収まる範囲で最良品質)、Qwen3 8B、またはGemma 4 E12B。Scoutは48GB以上の環境向けの長コンテキスト(1000万トークン)・大規模マルチモーダル用途です。

$200未満の最良のバジェットGPUは?

中古RTX 2080(8GB、約$150)または RTX A2000(12GB、約$180–200)。どちらもQ4で7Bモデルを実行できます。12GBのVRAM余裕があるA2000がおすすめです。

購入前に中古GPUのVRAM不良をどうテストするか?

VRAMストレステストを実行してください:gpu-burn(Linux)、HWiNFO64のメモリストレステスト(Windows)、またはOllamaで大きなモデルを読み込みOOMエラーが出ないか確認します。返品可能な間にテストしてください。

後で大きなモデルを実行するためにGPUをアップグレードできるか?

はい、デスクトップPCでのGPUアップグレードは簡単です。RTX 3060 12GBから始めて、後でRTX 4090や5090にアップグレードできます。PCIeスロットは世代をまたいで後方互換性があります。

ローカルLLM推論に最適なバジェットNVIDIA GPUは?

7BモデルにはRTX 4060 Ti(8GB、約$250)、13BモデルにはRTX 4070 Super(12GB、約$350–400)。中古なら、RTX 3060 12GB($200–250)がQ4で7-13Bモデルを問題なく実行します。最良の価値はRTX 3060 12GB中古、または新品のRTX 4070 Super。

AMD 6800XTはAI推論でRTX 4070とどう比較されるか?

AMD RX 6800 XT(16GB)はVRAMとゲーム性能でRTX 4070(12GB)を上回りますが、LLM推論速度では劣ります(15–20%遅い)。llama.cpp向けのROCmドライバ設定もCUDAより複雑です。純粋なLLM作業にはRTX 4070の方が簡単で、ゲーム+LLMなら6800 XTの方がコストパフォーマンスに優れます。

2026年のローカルLLM向けGB単価が最良のGPUは?

中古RTX 3090(24GB、約$450–500)=1GBあたり$18–20。中古RTX 3060(12GB、約$150–180)=1GBあたり$12–15。RTX 4070 Ti(12GB、新品約$600)=1GBあたり$50。最良の価値:RTX 3060 12GB中古。1ドルあたりの最大容量:RTX 3090 24GB中古。価格と性能のバランス:新品のRTX 4070。

関連資料

ソース

  • TechPowerUp GPUデータベース:RTX 3060 / RTX 4060 Ti / RTX 4070 Super仕様と電力消費
  • NVIDIA CUDA能力マトリックス:推論ワークロード用GPU メモリバンド幅と理論的スループット
  • Ollama モデル要件:Llama 3.3 7B、Mistral Small、Qwen量子化レベルVRAM推奨

GPUは決まりましたか?次はモデルを動かすための最適なソフトウェアを選びましょう。

ローカルLLMベストフロントエンド2026 →

サードパーティの情報に関する注意

この記事はサードパーティのAIモデル、ベンチマーク、価格、ライセンスを参照しています。AIの状況は急速に変化しています。ベンチマークスコア、ライセンス条件、モデル名、API価格は執筆時とお読みになる時の間で変わる可能性があります。この記事に基づいてデプロイやコンプライアンスに関する決定を下す前に、各プロバイダーの公式ソース(ライセンスとベンチマークはHugging Faceのモデルカード、API価格はプロバイダーのウェブサイト、現在のGDPRとEU AI法のテキストはEUR-Lex)で最新の数値を確認してください。この記事は2026年5月時点で公開されている情報を反映しています。

ローカルLLM、独自のAPIキー、またはその両方でPromptQuorumを使用できます — バックエンドはあなたが選択します。

PromptQuorumベータ版をダウンロード →

← ローカルLLMに戻る