Skip to main content
PromptQuorumBuilt for humans. Structured for AI.
ホーム/ローカルLLM/ローカルLLM推論向け RTX 5090 vs RTX 4090
GPU Buying Guides

ローカルLLM推論向け RTX 5090 vs RTX 4090

·6分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

このページには参考用の第三者製品へのリンクが含まれています。PromptQuorumはいかなるアフィリエイトプログラムにも参加しておらず、これらはコミッションを得ない単なる参照リンクです。リンクのクリックと次のステップはご自身の責任です。これらのリンクはPromptQuorumによる推奨や検証を表すものではありません。

RTX 5090 32GB on Amazon製品リンク · 開示済みRTX 4090 24GB on Amazon製品リンク · 開示済み

RTX 4090は2026年に生産終了(EOL)となり、中古市場のみで入手可能で、現在は約$2,000-2,600です。RTX 5090は生産が続いていますが、2026年のGDDR7不足により実売価格は$4,300-$5,000以上まで上昇しました。RTX 5090は大型モデルで依然30-50%高速で32GB GDDR7を搭載(4090の24GB GDDR6Xに対して)していますが、中古4090はトークンあたりのコストで依然最も安価なカードです。

RTX 4090は現在生産終了(EOL)です — 市場に出回るのはすべて中古で、価格は2026年8月時点で約$2,000-2,600まで上昇しています。 RTX 5090は生産が続いていますが、2026年のGDDR7メモリ不足により実売価格は希望小売価格の$1,999の2倍以上となる$4,300-$5,000以上に達しています。ローカルLLMでは、RTX 5090は依然として70Bモデルで RTX 4090より30-50%高速で、VRAMも8GB多い(32GB対24GB)です。すでに4090を所有している場合は手放さず使い続けるべきです — 現在の価格ではアップグレードの費用対効果はこれまで以上に悪化しています。70B対応カードが必要でどちらも所有していない場合、生産終了プレミアムがあっても中古4090はトークンあたりのコストで依然として安価です。

ローカルLLM推論向け RTX 5090 vs RTX 4090

重要なポイント

  • RTX 4090は2026年に生産終了(EOL)となり、市場に出回るのはすべて中古で約$2,000-2,600 — 年初の約$999-1,299から大幅に上昇しています。
  • RTX 5090は生産が続いていますが、2026年のGDDR7メモリ不足により実売価格は希望小売価格$1,999の2倍以上の$4,300-$5,000以上まで上昇しています。
  • RTX 5090はローカルLLM推論で大型モデル(70B Q4)においてRTX 4090より約30-50%高速です。7B-13Bモデルでは差はより小さく(約20%)なります。
  • RTX 5090は32GB GDDR7を搭載し、RTX 4090の24GB GDDR6Xより8GB多いVRAMを持ちます — この差は34B Q8や大コンテキストの70B Q4実行で重要です。
  • 中古RTX 4090(トークン100万あたり約$56-72)は、現在の実売価格の新品RTX 5090(トークン100万あたり約$83-96)より依然としてトークンあたり安価です。
  • 7B-13Bモデルには: 価格に関わらず4090はオーバースペックです。GPUを使い切る前にCPUや冷却の限界に達します。
  • 70Bモデルには: 5090が輝きます。小型の70Bモデルを2-3個並列実行するか、単一の70Bをより大きなバッチサイズで実行できます。
  • RTX 5080はデュアルGPU構成が必要でない限り、ローカルLLMにおいて5090よりも優れた価値を提供することが多いですが、こちらも不足による価格上昇の影響を受けています。

📍 一文で説明

RTX 4090は生産終了となり中古市場でのみ入手可能で、RTX 5090はまだ生産中ですがGDDR7メモリ不足によりMSRPの2倍以上の価格になっています。RTX 5090は大型モデルで30〜50%高速で32GBのVRAM(4090の24GBに対して)を持ちますが、中古の4090はトークンあたりの生成コストが依然として安価です。

💬 簡潔に説明

すでにRTX 4090を持っているなら、今アップグレードする理由はあまりありません -- 5090の価格プレミアムは、ほとんどのローカルLLM用途において速度の向上に見合いません。新規購入で70B対応のカードが必要な場合、中古の4090は生産終了によるプレミアム価格でも依然として最良の価値です。なぜなら5090自体の価格もメモリ不足によって押し上げられているからです。

実際の速度差は?

RTX 5090: CUDAコア21,760基、1,457 TFLOPS、メモリ帯域幅約1,792 GB/秒、32GB GDDR7。希望小売価格$1,999だが、GDDR7不足により2026年8月時点の実売価格は$4,300-$5,000以上。

RTX 4090: CUDAコア16,384基、826 TFLOPS、メモリ帯域幅約1,008 GB/秒、24GB GDDR6X。生産終了(EOL) — NVIDIAは生産を停止しました。 販売されているのはすべて中古で、約$2,000-2,600です。

実環境でのLLM推論(Llama 3.3 70B、Q4、batch=1): RTX 5090は約50-55 tokens/秒、RTX 4090は約36 tokens/秒。70Bモデルで40-50%高速。 カードごとのこの速度は価格変動の影響を受けません — 変わったのはそれを得るためのコストだけです。

7Bモデル(計算よりメモリに制約される)では: RTX 5090は約90 tokens/秒、RTX 4090は約75 tokens/秒。約20%高速。 小型モデルではその差は小さくなります。

RTX 5090 vs RTX 4090 速度比較 -- 実環境でのLLM推論
RTX 5090 vs RTX 4090 速度比較 -- 実環境でのLLM推論

4090と5090でVRAMの差は重要か?

RTX 5090は32GB GDDR7を、RTX 4090は24GB GDDR6Xを搭載しています。 8GBの差は特定のモデルサイズにとって重要です — このVRAMの計算は4090の生産終了やどちらのカードの現在の価格によっても変わりません。

5090のVRAM優位性は本物です: 34B Q8(約28GB)は32GBに余裕をもって収まりますが、24GBではぎりぎりです。70B Q4(約38-40GB)はどちらのカード単体にも収まりません — デュアルGPUかApple Siliconが必要です。7B-13Bモデルには24GBで十分すぎるほどです。

トークンあたりコスト: 実際どちらが安い?

  • 中古RTX 4090: 約$2,000-2,600(EOLで中古市場のみ、2026年初めの約$999-1,299から上昇)。Llama 70Bで36 tokens/秒を達成。トークンあたりコスト: 100万トークンあたり約$56-72。
  • 新品RTX 5090: 実売価格$4,300-5,000以上(希望小売価格$1,999、2026年のGDDR7不足で高騰)。Llama 3.3 70B Q4で約52 tokens/秒を達成。トークンあたりコスト: 100万トークンあたり約$83-96。
  • 結論: 4090は生成トークンあたり依然として安価です。 生産終了による価格上昇後もなお、5090の不足プレミアムが4090のそれよりも速く成長しているためです。
トークンあたりコスト: どちらが安いか -- Llama 70Bでの価格対スループット
トークンあたりコスト: どちらが安いか -- Llama 70Bでの価格対スループット

実際にいつ4090から5090へアップグレードすべきか?

7B-13B推論のためには絶対にアップグレードしないでください。 価格に関わらず4090はこれらのモデルにはオーバースペックです。どのみちCPUか冷却の限界に達します。

すでに4090を所有している場合: 手放さないでください。 5090の実売価格が$4,300-5,000以上である現在、アップグレードの費用対効果はこれまで以上に悪化しています。70Bで40 tok/秒超が必要か、34B Q8のために32GBが必要で、かつコストが障害にならない場合のみ移行してください。

どちらも所有しておらず70B対応カードが必要な場合: 現在の出品を比較してください。中古4090(約$2,000-2,600、EOL/中古のみ)は、30-50%低いスループットと引き換えに、新品5090(約$4,300-5,000以上)よりトークンあたりコストで依然優れています。

デュアルGPUの代替案は変化しました: 中古RTX 4090を2枚合わせて購入すると現在では合計約$4,000-5,200 — 単一の5090の実売価格に近い水準です — で、70B Q4で合計約65-72 tokens/秒(単一5090と同等かそれ以上)を得られます。トレードオフは中古のみの調達(保証なし、EOL供給)と、より複雑な構成(テンソル並列)です。

5090に関するよくある誤解

  • RTX 4090がまだ新品で販売されていると思い込むこと — そうではありません。NVIDIAは2026年にRTX 40シリーズの生産を終了しました。市場のすべての4090は中古で、年初よりもはるかに高い価格です。
  • RTX 5090の希望小売価格$1,999が実際に支払う金額だと思うこと — 2026年8月時点で、GDDR7不足により実売価格は$4,300-$5,000以上です。
  • RTX 5090が4090の2倍速いと思うこと — 70Bで40-50%、7Bモデルではわずか約20%しか速くありません。
  • 両カードのVRAMが同じだと思い込むこと — 違います。5090は32GB、4090は24GBです。8GBの差は34B Q8モデルにとって重要です。
  • 70Bモデルの実行に5090が必要だと信じること — 4090は36 tokens/秒でうまく実行でき、これはほとんどのユーザーにとって「十分」です。生産終了による価格上昇後もなお、トークンあたり最も安価なカードです。

よくある質問

RTX 4090は2026年もまだ新品で販売されていますか?

いいえ。NVIDIAは2026年にRTX 40シリーズの生産を終了しました。現在販売されているRTX 4090はすべて中古で、EOLの希少性とRTX 50シリーズ自体のGDDR7不足による需要増加により、価格は約$2,000-2,600まで上昇しています。

Llama 3.3 70Bの実行にRTX 5090は価値がありますか?

価格次第という要素がこれまで以上に強まっています。4090は中古約$2,000-2,600で約36 tok/秒を提供します。5090は約52 tok/秒を提供しますが、2026年8月時点の実売価格は$4,300-$5,000以上です。70Bを継続的に使用するなら価値がありますが、それ以外なら中古4090が現実的な選択です。

RTX 5090を1枚買うべきか、RTX 4090を2枚買うべきか?

中古4090を2枚(合計約$4,000-5,200)は、単一の5090(実売約$4,300-5,000以上)を70Bの生の速度(合計約72 tok/秒対約52)で上回ります。しかしデュアルGPU構成はテンソル並列などの複雑さを伴い、中古カードには保証がありません。5090はより簡単で生産が続いており、34B Q8向けに32GBの統合VRAMを提供します。

RTX 5090は4090よりVRAMが多いですか?

はい。RTX 5090は32GB GDDR7を、RTX 4090は24GB GDDR6Xを搭載しています。8GBの追加分により34B Q8モデル(約28GB必要)を余裕を持って実行できます。どちらのカードも複数GPUに分割せずに70B Q4(約38-40GB必要)を収めることはできません。このVRAMの差は4090の生産終了とは無関係です。

14BモデルにRTX 5090はオーバースペックですか?

ほとんどの場合、はい。14B Q4モデルは約9GBのVRAMを必要とし、4090上で既に高速な約55-65 tok/秒で動作します。5090なら約65-75 tok/秒となりますが、改善はわずかです。中古4090(あるいは3090でさえ)の方が14B推論には遥かに費用対効果が高く、現在の5090の価格では特にそうです。

RTX 5090ラップトップGPUは32GBのVRAMを搭載していますか?

いいえ。RTX 5090 Laptop GPUは電力と熱の制約により、デスクトップ版の32GBから減らされた24GB GDDR7を搭載しています。デスクトップの5090よりかなり遅いですが、同じタスクでも4090よりは依然として高速です。

5090の価格は希望小売価格の$1,999まで下がりますか?

2026年のGDDR7メモリ不足が緩和されない限り下がりません — 明確な時期は決まっていません。現在の実売価格は$4,300-$5,000以上と、希望小売価格の2倍以上です。4090の価格推移を見ると、中古市場は必ずしも下落するとは限らないことがわかります。2022年の発売時の$1,499から中古最低約$999まで下落した後、2026年の生産終了後に約$2,000-2,600まで再び上昇しました。

RTX 5090を750Wの電源で使用できますか?

ぎりぎりです。RTX 5090単体で575Wを消費します。負荷時の電圧降下を避けるため、850Wまたは1000Wの電源と組み合わせてください。

RTX 5080は5090より価値がありますか?

多くの場合そうです — 5080は5090の速度の約80%をかなり低い価格で実現しますが、2026年のGDDR7不足による価格上昇の影響も受けています。ローカルLLMには、5080が通常最適なバランスポイントです。

Qwen-VL 70Bのようなマルチモーダルモデルで5090はどれくらい高速ですか?

同様に20-25%の向上があります。マルチモーダル計算は依然としてメモリに制約されるため、5090の帯域幅優位性は役立ちますが、劇的ではありません。

出典

  • NVIDIA RTX 5090および4090の公式仕様: CUDAコア数、TFLOPS、メモリ帯域幅
  • MLCommons MLPerf推論ベンチマーク: LLaMA 70BおよびMistralモデルでのトークン生成速度
  • TechPowerUp GPUデータベース: RTX 5090 vs 4090の消費電力とメモリ帯域幅の比較

サードパーティの情報に関する注意

この記事はサードパーティのAIモデル、ベンチマーク、価格、ライセンスを参照しています。AIの状況は急速に変化しています。ベンチマークスコア、ライセンス条件、モデル名、API価格は執筆時とお読みになる時の間で変わる可能性があります。この記事に基づいてデプロイやコンプライアンスに関する決定を下す前に、各プロバイダーの公式ソース(ライセンスとベンチマークはHugging Faceのモデルカード、API価格はプロバイダーのウェブサイト、現在のGDPRとEU AI法のテキストはEUR-Lex)で最新の数値を確認してください。

ローカルLLM、独自のAPIキー、またはその両方でPromptQuorumを使用できます — バックエンドはあなたが選択します。

PromptQuorumベータ版をダウンロード →

← ローカルLLMに戻る