Skip to main content
PromptQuorumBuilt for humans. Structured for AI.
ホーム/ローカルLLM/GPU vs CPU vs Apple Silicon ローカルLLM 2026:どれが勝つ?
ハードウェア・パフォーマンス

GPU vs CPU vs Apple Silicon ローカルLLM 2026:どれが勝つ?

·11分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

Apple M5 Pro(64GB)が2026年のベストオールラウンド — 30B+モデルをネイティブ実行、RTX 5090より10倍省電力。RTX 50シリーズは7B–14Bの最高速度や本番ワークロードに特化した場合のみ選択。

Apple M5 Pro(64GB、約2,399ドル)は2026年のローカルLLMに最もバランスの取れたプラットフォームです。統合メモリで30B+モデルを40–60 Tok/sで低消費電力(~25W)実行できます。NVIDIA RTX 5090は7B–14Bモデルでは高速ですが、30B+はCPUオフロードなしに入りません。CPUのみ:現代のハードウェアで7Bモデルを10–20 Tok/sで利用可能。

スライドデッキ: GPU vs CPU vs Apple Silicon ローカルLLM 2026:どれが勝つ?

以下のスライドデックは:NVIDIA RTX 50シリーズ対Apple M5対CPUのみのパフォーマンス(M5 Pro 307 GB/s、M5 Max 460〜614 GB/s、RTX 5090 1,792 GB/s)、消費電力比較(25W対450W)、tok/sあたりコスト分析、予算帯ごとの明確な結論をカバーしています。PDFを2026年版GPU vs Apple Siliconリファレンスカードとしてダウンロードしてください。

以下のスライドを閲覧するか、PDFとしてダウンロードしてください。 リファレンスカードをダウンロード(PDF)

GPU vs CPU vs Apple Silicon ローカルLLM 2026:どれが勝つ?

重要なポイント

  • Apple M5 Pro(64GB、約2,399ドル):ほとんどのユーザーに最適なオールラウンド機。30Bモデルで40〜60 tok/s、低消費電力(推論時約25W)、VRAM上限なし。
  • NVIDIA RTX 5090(32GB、2,000ドル):7B〜14Bモデルで最速の150〜200 tok/s。CPUオフロードなしに30B以上は不可。本番ワークロード向け。
  • NVIDIA RTX 5070(12GB、約600ドル):最高コスパGPU。8Bモデルで60〜80 tok/s。7B〜8Bのフル精度に限定。
  • Apple M5 Max(64〜128GB、約3,199ドル〜):460〜614 GB/sの帯域幅。30B〜70Bをネイティブ実行。研究者や30B以上のヘビーユーザー向け最適。
  • CPUのみ(最新Ryzen/Intel):高速DDR5 RAM搭載で7Bモデル10〜20 tok/s。たまの利用には可、リアルタイムチャットには非実用的。
  • 結論:ほとんどのユーザーにとってApple M5 Pro 64GBが勝者 — 単体GPUより大きなモデルを、GPU構成より低コストで、消費電力は10分の1。RTX 50シリーズを選ぶのは7B〜14Bの最高速度または本番ワークロードに限る場合のみ。

📍 一文で説明

ローカルLLM向け:Apple M5 Pro 64GB(約2,399ドル)が30Bモデルで40〜60トークン/秒のオールラウンド最良;RTX 5090 32GB(約2,000ドル)は7B〜14Bで最速(150〜200トークン/秒)だが30B以上は不可;RTX 5070 12GB(約600ドル)が最高コスパGPU;CPU単独は7Bで10〜20トークン/秒。

💬 簡潔に説明

GPUは小型モデル(14B未満)で最速です。Apple Siliconはメモリと計算を一体化し低消費電力で大型モデル(30B+)に最適。CPU単独は最も遅いですがあらゆるノートPCで動作します。

パフォーマンス比較:速度、帯域幅、コスト

*CPUオフロードが必要 — 大幅な速度低下と低ビット幅での品質劣化

ハードウェア
Qwen3 8B
Qwen3 30B
消費電力
コスト
RTX 5090(GPU、32GB GDDR7)150–200 tok/s実行不可*約450W2,000 ドル
RTX 5080(GPU、16GB GDDR7)100–130 tok/s実行不可*約360W1,000 ドル
RTX 5070 Ti(GPU、16GB)80–100 tok/s実行不可*約300W750 ドル
RTX 5070(GPU、12GB)60–80 tok/s実行不可*約250W600 ドル
MacBook Pro M5 Pro(36〜64GB、307 GB/s)40–60 tok/s20–30 tok/s約25W2,399 ドル〜
MacBook Pro M5 Max(64〜128GB、460〜614 GB/s)60–80 tok/s35–50 tok/s約35W3,199 ドル〜
Mac mini M5 base(16〜32GB、200 GB/s)25–35 tok/sオフロード*約15W599 ドル〜
Intel Core Ultra 9 / AMD Ryzen 9(CPU、DDR5)10–20 tok/s3–5 tok/s約65W内蔵
Apple M5 Proは30Bモデルを消費電力25Wで20〜30 tok/s実行。RTX 5090は8Bでは高速だがオフロードなしに30BをVRAMへ読み込めない。
Apple M5 Proは30Bモデルを消費電力25Wで20〜30 tok/s実行。RTX 5090は8Bでは高速だがオフロードなしに30BをVRAMへ読み込めない。

GPUを選ぶべき場合(RTX 50シリーズ)

7B〜14Bモデルで最高速度が必要、または24時間365日の本番ワークロードを実行する場合はRTX 50シリーズのNVIDIA GPUを選びましょう。

  • RTX 5090(32GB GDDR7、1,792 GB/s):8Bモデルで150〜200 tok/s。2,000ドル。本番パイプライン、ファインチューニング、速度重視のアプリケーションに最適。
  • RTX 5080(16GB GDDR7):8Bで100〜130 tok/s。1,000ドル。8B〜13Bで速度とコストのバランスが良い。
  • RTX 5070 Ti / 5070(12〜16GB):8Bで60〜100 tok/s。600〜750ドル。個人利用のチャット・コーディング向け最高コスパ。
  • CUDAエコシステムの強み:vLLM、llama.cpp、LM Studioはすべてネイティブ最適化済み。ネイティブ精度で最速の推論。
  • 構造的な限界:RTX 50シリーズのどのカードも30Bモデルをフル品質でロードできない(20GB以上のVRAMが必要)。システムRAMへのオフロードは5〜10倍の速度低下を招く。

消費電力が最大のトレードオフ:RTX 5090は負荷時450Wを消費、M5 Proはわずか25W。0.35ドル/kWhの場合、1日8時間使用でRTX 5090は月額約55ドル多く電気代がかかる。

Apple Siliconを選ぶべき場合(M5)

14B〜70Bモデルの実行が必要、省電力を重視する、またはmacOSをメインOSとして使う場合はApple Silicon M5を選びましょう。

  • M5 base(16〜32GB、200 GB/s):7B〜8Bをネイティブで25〜35 tok/s実行。599ドル〜(Mac mini)。良い入門機。
  • M5 Pro(36〜64GB、307 GB/s):最大30Bをネイティブで20〜30 tok/s実行。約2,399ドル(MacBook Pro)。最高のオールラウンド価値。
  • M5 Max(64〜128GB、460〜614 GB/s):30B〜70Bをネイティブで35〜50 tok/s実行。約3,199ドル〜。研究者や70Bのヘビーワークロード向け最適。
  • 統合メモリの利点:VRAM上限なし。64GBのM5 Proは30Bモデルをネイティブでロード可能、128GBのM5 Maxは70Bモデルをネイティブでロード可能。
  • Appleの発表:M5世代のLLM推論はM4比で4倍高速。
  • MLXフレームワーク:AppleのMLXはApple Silicon向けに最適化。Qwen3モデルはMLXで優れた動作。DeepSeek-R1 14Bも良好な性能。

トレードオフ:7BではRTX 5090の生の速度に及ばない。ファインチューニングは遅い。CUDA専用ツールは使えない。

CPUのみで十分な場合

たまの応答だけで十分で小型モデル(7B Q4)を実行するならCPUのみの推論も実用的です。

  • DDR5-5600搭載の最新Intel Core Ultra 9 / AMD Ryzen 9:Qwen3 8BやLlama 3.2 8Bで10〜20 tok/s。非対話的なバッチタスクに利用可能。
  • 旧型CPU / DDR4:5〜8 tok/s。応答ごとに目立つ遅延(5〜8秒)で対話的チャットには不快。
  • 追加ハードウェアコストゼロ:既に使えるデスクトップがあれば、llama.cppやOllamaはすぐに動作。
  • 消費電力:フル推論負荷時のCPUは65〜125Wを消費 — GPUより少なく、Apple Siliconより多い。

CPU推論が向いているのは:ドキュメント要約のバッチ処理、夜間処理、たまの質問応答。リアルタイムチャット、コーディングアシスタント、8B超のモデルにはCPUのみを避けましょう。

メモリ帯域幅:本当のボトルネック

LLM推論はメモリ律速であり、計算律速ではありません。 トークン生成速度はモデルの重みをメモリからどれだけ速く読み込めるかで決まります。メモリ帯域幅が高いほど、トークン生成は速くなります。

計算式:推論速度 ≈ メモリ帯域幅 ÷ メモリ上のモデル重み

  • RTX 5090の1,792 GB/sは2026年時点で入手可能な単体GPUとして最速の帯域幅。
  • M5 Maxの460〜614 GB/sはRTX 5080の帯域幅に匹敵または上回る — 16GBのVRAMに対し128GBの統合メモリで。
  • M5 Proの307 GB/sはスイートスポット:30Bモデルに十分な帯域幅を、M5 Maxの半分のコストで実現。
  • CPUのDDR5は89 GB/sでRTX 5090より20倍遅いが、DDR4より4倍速い — CPU推論にとって意味のある改善。
  • 統合メモリの利点:CPU↔GPU間の転送オーバーヘッドなし。M5 Proは30Bモデルを64GBのプール内に丸ごと保持。
プラットフォーム
メモリ帯域幅
実効速度(8B)
RTX 5090(GDDR7)1,792 GB/s150–200 tok/s
RTX 5080(GDDR7)960 GB/s100–130 tok/s
RTX 5070(GDDR7)672 GB/s60–80 tok/s
M5 Max(統合、128GB)460–614 GB/s60–80 tok/s
M5 Pro(統合、64GB)307 GB/s40–60 tok/s
M5 base(統合、32GB)200 GB/s25–35 tok/s
DDR5-5600 RAM(CPUのみ)89 GB/s10–20 tok/s
DDR4-3200 RAM(CPUのみ)51 GB/s5–8 tok/s

tok/sあたりのコスト:真の価値分析

tok/sあたりのコストはハードウェアの価値を比較します:初期コストを持続的なトークン速度で割ったもの。

純粋な速度ではRTX 5070がtok/sあたりのコストで最良。 M5 Proは電力面で有利:0.15ドル/kWhで1日8時間使用した場合、M5 Proは月額約1.10ドル、RTX 5090は約16.50ドル。

すでにM5 Pro搭載のMacを持っている場合、ハードウェア分のtok/sあたりコストは実質0ドル。

ハードウェア
初期コスト
Tok/s(8B)
tok/sあたりコスト
消費電力(推論時)
RTX 5090(32GB)2,000 ドル17511.4 ドル450W
RTX 5070(12GB)600 ドル708.6 ドル250W
M5 Pro MacBook Pro(64GB)2,399 ドル5048 ドル25W
M5 Max MacBook Pro(128GB)3,199 ドル7046 ドル35W
CPU(最新DDR5デスクトップ)内蔵150 ドル65W

プラットフォーム選択ガイド

モデルサイズ、予算、用途に基づく判断フレームワーク:

  • RTX 5090 / 5080を選ぶ:7B〜14Bの最高速度、本番パイプライン、ファインチューニング、24時間稼働のサーバーワークロード。
  • RTX 5070 / 5070 Tiを選ぶ:7B〜13Bでの個人利用のチャット・コーディングに最高コスパのGPU。600〜750ドル。
  • M5 Pro(64GB)を選ぶ:ほとんどのユーザーに最適なオールラウンド。30Bをネイティブ実行、低消費電力、macOSワークフロー。約2,399ドル。
  • M5 Max(128GB)を選ぶ:研究用途、70Bをネイティブ実行、Apple Silicon最高性能。約3,199ドル〜。
  • CPUのみ:追加投資ゼロ、7Bのたまの利用、夜間バッチ処理。

ハードウェア選択でよくある誤解

  1. 1
    「30B以上にはGPUを選ぶべき」 — 誤り。RTX 50シリーズのどのカードも30BをVRAMにロードできない。RAMへのオフロードは5〜10倍の速度低下を招く。代わりにM5 ProやM5 Maxを使う。
  2. 2
    「M5 base(16GB)で十分」 — 誤り。7Bしかロードできない。14Bモデルには32GB、30Bには64GB(M5 Pro)が必要。
  3. 3
    「常時稼働GPUサーバーの電気代を軽視」 — RTX 5090を1日8時間使うと0.15ドル/kWhで年間約200ドルの電気代。M5 Proなら約14ドル。
  4. 4
    「8Bチャット用にRTX 5090を買う」 — 600ドルのRTX 5070でも8Bで70 tok/s出せる — 速度の80%をコストの30%で実現。
  5. 5
    「CPUでもリアルタイムチャットに使える」 — 20 tok/sでも遅く感じる。DDR4での5〜8 tok/sは対話用途には使い物にならない。

よくある質問

ローカルLLM実行にはGPUとCPUどちらが良い?

リアルタイム推論にはNVIDIA GPUの方が速い:RTX 5070は8Bモデルを60〜80 tok/sで実行、DDR5搭載の最新CPUでは10〜20 tok/s。Apple M5 Proも40〜60 tok/sでCPUを上回り、さらに30Bモデルをネイティブ実行できる。

Apple Siliconはローカル LLM を実行できる?

はい。Apple M5シリーズはチップの等級により7Bモデルを25〜80 tok/sで実行。M5 Pro(64GB)は30Bモデルをネイティブで20〜30 tok/s実行 — これはどの一般向けGPUでも実現できない。M5 Max(128GB)は70Bモデルをネイティブで35〜50 tok/s実行。

ローカルLLMに必要な最低限のGPU VRAMは?

12GBのVRAM(RTX 5070)は7B〜8BモデルをQ4〜Q8量子化で問題なく実行。16GB(RTX 5080)は13Bモデルに対応。単体の一般向けGPUで30Bを完全にロードできるものはなく、その場合は64GBのApple M5 Proを使う。

GPUはLLM推論でCPUより何倍速い?

RTX 5090はDDR5搭載の最新CPUより8〜15倍速い(8Bモデルで175 tok/s対15 tok/s)。差はメモリ帯域幅から生じる:1,792 GB/s(GDDR7)対89 GB/s(DDR5)。307 GB/sのApple M5 Proはその中間、40〜60 tok/s。

ローカルLLMのためだけにGPUを買う価値はある?

RTX 5070(600ドル)は3年償却で、1日2時間以上使うヘビーユーザーにとってOpenAI APIの利用料より安くなる。70 tok/sでリアルタイムチャットとコーディング支援に対応。30B以上のモデルが必要ならM5 Proの方が初期コストは高くても価値がある。

メモリ帯域幅とは何か、なぜLLMにとって重要?

LLM推論はメモリ律速。トークン速度 ≈ メモリ帯域幅 ÷ モデル重み。RTX 5090:1,792 GB/s。M5 Max:460〜614 GB/s。M5 Pro:307 GB/s。CPU DDR5:89 GB/s。だからこそ統合メモリを持つApple Siliconは、トップGPUより生の帯域幅が低くても大型モデルを効率的に実行できる。

2026年のローカルLLMに最適なApple Siliconチップは?

M5 Pro(64GB、307 GB/s)はほとんどのユーザーに最適なオールラウンド機 — 約2,399ドルで30Bモデルをネイティブ20〜30 tok/s実行。M5 Max(128GB、460〜614 GB/s)は70Bモデルを35〜50 tok/s(約3,199ドル〜)。7B超の用途にはM5 base(16GB)を避ける。

Apple Siliconは30Bや70Bモデルを実行できる?

M5 Pro(64GB)は30Bモデルをネイティブで20〜30 tok/s実行。M5 Max(128GB)は70Bモデルをネイティブで35〜50 tok/s実行。これはCPUオフロードなしの実際のスループット値であり、30B以上でこれに匹敵する一般向けGPUは存在しない。

2,000ドルのRTX 5090はローカルLLMに価値がある?

7B〜14Bモデルを最高速度で使うワークフロー、または本番推論パイプラインを運用する場合のみ。ほとんどのユーザーには、RTX 5070(600ドル)が速度の80%をコストの30%で提供する。30B以上のモデルには、予算に関わらずM5 Proの方が良い選択。

GPUとApple Siliconの消費電力はどう比較される?

RTX 5090は推論負荷時に約450Wを消費。M5 Proは約25W。1日8時間、0.15ドル/kWhの場合、年間200ドル(RTX 5090)対14ドル(M5 Pro)に相当する。家庭用途や商用電気料金を支払うユーザーにとって、M5 Proの電力効率は明確なコスト優位性となる。

Intel MacBook Pro(i9、16GB RAM)でのLLM推論速度は?

Apple Siliconより遅く、最新のDDR5デスクトップよりも遅い。Intel MacBook ProにはllamacppのGPU統合メモリ経路がなく、推論はDDR4上でCPUのみで実行される。DDR4のデュアルチャネル帯域幅は約38〜45 GB/sで、最新のDDR5デスクトップCPUの89 GB/sを大きく下回る。上記のメモリ帯域幅÷モデルサイズの式を使うと、量子化された7Bモデル(Q4で約4.5GB)は理論上約8〜10 tok/s、CPUの計算オーバーヘッドを考慮した実質値では4〜7 tok/sとなる。合計16GBのRAMではOS用の余裕を残すと7B〜8B(Q4)程度が限界で、大幅なスワップと速度低下なしに13B以上のモデルを実行することは期待できない。

pp tok/sとtg tok/sの違いは?

pp tok/s(プロンプト処理)は、モデルが入力プロンプトをどれだけ速く取り込むかを測る指標で、「プリフィル」フェーズにあたる。これは計算負荷が支配的で、GPUのような並列ハードウェアでよくスケールする。tg tok/s(トークン生成)は、新しい出力トークンをどれだけ速く生成するかを測る指標で、「デコード」フェーズにあたる。これは上記の帯域幅の式が示す通り、メモリ帯域幅が支配的である。GPUは通常pp/tgの差が大きく(プリフィルは速いが、生成は帯域幅に制限される)、Apple Siliconの統合メモリは両者の値をより近づける。ベンチマークを比較する際は、どちらの数値を読んでいるかを必ず確認すること — 同じハードウェアでもppとtgは5〜20倍異なることがある。

サードパーティの情報に関する注意

この記事はサードパーティのAIモデル、ベンチマーク、価格、ライセンスを参照しています。AIの状況は急速に変化しています。ベンチマークスコア、ライセンス条件、モデル名、API価格は執筆時とお読みになる時の間で変わる可能性があります。この記事に基づいてデプロイやコンプライアンスに関する決定を下す前に、各プロバイダーの公式ソース(ライセンスとベンチマークはHugging Faceのモデルカード、API価格はプロバイダーのウェブサイト、現在のGDPRとEU AI法のテキストはEUR-Lex)で最新の数値を確認してください。

ローカルLLM、独自のAPIキー、またはその両方でPromptQuorumを使用できます — バックエンドはあなたが選択します。

PromptQuorumベータ版をダウンロード →

← ローカルLLMに戻る