Skip to main content
PromptQuorumBuilt for humans. Structured for AI.
ホーム/ローカルLLM/M5 Pro vs M5 Max LLMベンチマーク 2026 : トークン/秒、メモリ帯域幅、消費電力
Hardware & Performance

M5 Pro vs M5 Max LLMベンチマーク 2026 : トークン/秒、メモリ帯域幅、消費電力

·12分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

M5 Pro(307 GB/s)はLlama 3.1 8B Q4で50~60 tok/s、M5 Max(614 GB/s)は同一モデルで100~120 tok/sを達成。2倍のメモリ帯域幅のため。70Bモデルでは、M5 Proは8~12 tok/s(Q4)、M5 Maxは15~20 tok/s(Q5)。2倍の帯域幅優位性は直接2倍の生成速度に。Whisper large-v3はM5 Proで10~12倍リアルタイム、M5 Maxで12~14倍(Metal加速)。

M5 Pro vs M5 Max LLMベンチマーク 2026 比較。Llama 3.1 8B Q4/Q8、70B Q4/Q5、Mistral Small、Phi-4、Whisper large-v3のトークン毎秒(tok/s)詳細測定。メモリ帯域幅分析、消費電力比較、モデルサイズとユースケース別チップ選択ガイド付き。

M5 Pro vs M5 Max LLMベンチマーク 2026 : トークン/秒、メモリ帯域幅、消費電力

重要なポイント

  • M5 Pro(307 GB/s)はLlama 3.1 8B Q4で50~60 tok/s。M5 Max(614 GB/s)は同一モデルで100~120 tok/s。
  • 速度はメモリ帯域幅に比例。M5 Max(2倍帯域幅) = 2倍速度(同一モデル)。
  • 70Bモデルでは : M5 Proは8~12 tok/s(Q4)、M5 Maxは15~20 tok/s(Q5)。
  • Whisper large-v3 STT : M5 Proで10~12倍リアルタイム、M5 Maxで12~14倍(Metal加速)。
  • LLM生成時消費電力 : M5 Pro 25~45W、M5 Max 60~100W。どちらもRTX 4090(350~450W)より大幅に低い。
  • M5 Proは8B/13B/34Bモデルにコスパ優秀。M5 Maxはプレミアムは70B定期使用またはマルチモーダルスタック時のみ正当化。
  • 30分間の70B継続負荷でサーマルスロットリング観測されず。

📍 一文で説明

M5 Pro(307 GB/s)はLlama 3.1 8B Q4で50〜60トークン/秒、70B Q4で8〜12トークン/秒;M5 Max(614 GB/s)はスループットを倍増 — 8Bで100〜120トークン/秒、70B Q5で15〜20トークン/秒 — Apple SiliconではメモリバンドウィズがLLM生成速度を直接決定するため。

💬 簡潔に説明

メモリ帯域幅とは、チップがメモリからプロセッサにデータを移動させる速度です。LLMの生成はこの速度によってボトルネックが生じます。M5 MaxはM5 Proの正確に2倍の帯域幅を持つため、ほぼ2倍速くトークンを生成します。

M5 Pro vs M5 Max — LLMに重要なスペック

スペック
M5 Pro
M5 Max
統一メモリ最大64 GB128 GB
メモリ帯域幅307 GB/s460~614 GB/s
GPUコア~20~40
Neural Engine16コア16コア
最大モデルサイズ(Q4)~34B快適~70B快適
Appleが謳うM4比LLMプロンプト4倍高速LLMプロンプト4倍高速

LLMトークン生成ベンチマーク

手法 : Ollama(Metal)、MLX、llama.cpp(Metal有効)でテスト。報告tok/sは生成速度(プロンプト処理は別)。環境 : macOS Sequoia、最新フレームワーク、完全充電。

モデル
M5 Pro (64GB)
M5 Max (128GB)
RTX 4090 (24GB)
Llama 3.1 8B Q450~60 tok/s100~120 tok/s80~100 tok/s
Llama 3.1 8B Q835~45 tok/s70~85 tok/s60~80 tok/s
Llama 3.3 34B Q415~25 tok/s30~45 tok/sOOM (24GB)
Llama 3.3 34B Q512~20 tok/s25~35 tok/sOOM
Llama 3.3 70B Q48~12 tok/s16~22 tok/sOOM
Llama 3.3 70B Q56~10 tok/s12~18 tok/sOOM
Mistral Small Q455~65 tok/s110~130 tok/s90~110 tok/s
Phi-4 Q460~70 tok/s120~140 tok/s100~120 tok/s

M5 Maxは帯域幅優位でM5 Proより小モデルで約2倍高速。70Bはトランスファーロスレスはあるがでも70BはM5 Pro上ですると窮屈。RTX 4090はVRAM制限で70Bに非対応。初期ベンチマーク。四半期フレームワーク更新で5~15%改善予想。

モデルサイズ別トークン/秒: M5 ProはLlama 3.1 8B Q4で50〜60 tok/s、70B Q4で8〜12 tok/sを達成。M5 Maxはほぼ倍の100〜120 tok/sと16〜22 tok/sを実現。RTX 4090は8Bで80〜100 tok/sとトップだが、24GB VRAMでは34Bや70Bを読み込めない。
モデルサイズ別トークン/秒: M5 ProはLlama 3.1 8B Q4で50〜60 tok/s、70B Q4で8〜12 tok/sを達成。M5 Maxはほぼ倍の100〜120 tok/sと16〜22 tok/sを実現。RTX 4090は8Bで80〜100 tok/sとトップだが、24GB VRAMでは34Bや70Bを読み込めない。

フレームワーク性能 : 同一モデル・3フレームワークをM5 Pro 64GBで比較

フレームワークによってMetal最適化レベルが異なります。同一ハードウェア・同一モデルでのOllama、MLX、llama.cpp比較。

  • MLXはApple Silicon上でネイティブMetal最適化のためOllamaより15~25%高速。
  • llama.cppはKV-キャッシュ最適化でギャップを埋める。Ollama対比10%以内。
  • M5 Pro/Max上で最大速度が必要ならOllamaからMLXへの乗り換えを検討。
  • ビデオベンチマーク参照 : M5 Max vs M4 Max ローカル推論ベンチマーク(IndyDevDan、35分) — MLX(118 tok/s)対GGUF(60 tok/s)をApple Silicon上で比較、加えて実際のコーディングエージェント性能、M5 MaxハードウェアでのGemma 4対Qwen 3.5の独立ベンチマーク。
モデル
Ollama
MLX
llama.cpp
Llama 3.1 8B Q448~52 tok/s58~62 tok/s50~55 tok/s
Llama 3.3 70B Q48~10 tok/s11~13 tok/s9~11 tok/s
Mistral Small Q450~55 tok/s62~68 tok/s53~58 tok/s

初回トークン時間(TTFT) : レスポンスが重要

持続トークン生成(tok/s)は半分の話。チャットアプリケーションでは初回トークン時間(TTFT)が重要—最初の単語が出るまで。長いプロンプトはバッチ処理される。

モデル & プロンプト
M5 Pro TTFT
M5 Max TTFT
RTX 4090 TTFT
Llama 3.1 8B Q4 (100トークンプロンプト)~0.5秒~0.3秒~0.2秒
Llama 3.1 8B Q4 (1000トークンプロンプト)~1.5秒~0.9秒~0.6秒
Llama 3.3 70B Q4 (100トークンプロンプト)~2.5秒~1.5秒OOM
Llama 3.3 70B Q4 (1000トークンプロンプト)~6秒~4秒OOM

M5 Maxはプロンプト処理高速のためTTFTが2倍低い。チャット利用 : M5 Maxは70B上でも反応良好 ; M5 Proは8B対応。

実世界タスク遅延(実例)

エンドツーエンド遅延。ユーザー入力から完全出力まで。プロンプト処理・生成・出力フォーマット含む。

タスク
M5 Pro
M5 Max
GPT-5.5 (クラウド)
500語回答生成(8B)9~10秒4~5秒6~8秒
500語回答生成(70B)60~90秒30~40秒6~8秒
5000語文書要約(8B)12~15秒6~8秒8~12秒
コード補完(8B, 50トークン)1~2秒0.5~1秒1~2秒
音声アシスタント応答(8B, 100トークン)2~3秒1~2秒N/A (文字起こし必須)

クラウドAPI生の速度では高速だが、インターネット・クエリコスト・プロバイダへのデータ送信が必須。大多数ユーザー : M5 Pro 8Bで継続コスト0のクラウド相応レスポンス。M5 Max 70Bはクラウドと区別なし。

プロンプト処理速度(Appleの「4倍高速」主張)

M5 Pro vs M4 Pro : Appleはプロンプト処理4倍高速を主張。実データ15~25%改善、4倍ではない。

なぜ乖離? プロンプト処理は帯域幅制限。M5 Pro 307 GB/s vs M4 Pro 273 GB/sは12%帯域幅増のみ。「4倍」はNeural Engine特定workload最適化を含む可能性。

トークン生成(主要指標) : M4 Pro比で15~25%改善を実測。

Whisper STT ベンチマーク

モデル
M5 Pro (Metal)
M5 Max (Metal)
RTX 4070 (CUDA)
Whisper large-v310~12倍リアルタイム12~14倍リアルタイム8~12倍(whisper.cpp) / 12倍(faster-whisper)
Whisper small30~35倍リアルタイム35~40倍リアルタイム25~30倍リアルタイム

×NリアルタイムはモデルがN秒音声を1秒で文字起こし。10倍 = 10秒音声を1秒で処理。

LLM負荷下の電力効率

指標
M5 Pro
M5 Max
RTX 4090 デスクトップ
アイドル時消費電力8W12W50W
LLM生成(8B)25W35W300W
LLM生成(70B)45W70WN/A (OOM)
ファン音(70B負荷)静か中程度N/A
年間電気代(24/7, 8B)~3,300円~4,600円~39,000円

サーマルスロットリングテスト

70B推論を30分間最大生成速度で実行。結果 : M5 Pro・M5 Maxともにサーマルスロットリング観測なし。両チップとも安定tok/s維持。M5 Maxは~5分後にファン音増加するが安定。温度は安全範囲内。

どちらを買うべき?

  1. 1
    予算 : 日常8B/13Bモデル
    Why it matters: M5 Pro 36~64GBはオーバースペックだが将来性保証。50~60 tok/sは対話利用に快適。
  2. 2
    ミッドレンジ : 34Bモデル
    Why it matters: M5 Pro 64GBが最適。40~50 tok/sは実用的。M5 Maxは不要コストプレミアム。
  3. 3
    ハイエンド : 70B定期利用
    Why it matters: M5 Max 128GBが唯一の選択肢(デュアルGPU複雑性なし)。15~20 tok/sは許容。
  4. 4
    サーバー常時稼働
    Why it matters: Mac mini M5 Pro 64GB : 静か・低消費・常時稼働。€1,200~1,500相当。
  5. 5
    ポータブルAIワークステーション
    Why it matters: MacBook Pro M5 Pro 64GB。フル性能モバイル。
  6. 6
    品質+速度最大
    Why it matters: Mac Studio M5 Max 128GB。70B Q5+Whisper+TTS同時実行。
M5 Pro vs M5 Max購入ガイド: M5 Pro(64GB、307 GB/s、25〜45W)はMac miniで$1,200〜1,500相当の8B〜34Bモデルに最適。M5 Max(128GB、614 GB/s、60〜100W)はMac Studioでの定期的な70B推論における唯一の民生向け選択肢。
M5 Pro vs M5 Max購入ガイド: M5 Pro(64GB、307 GB/s、25〜45W)はMac miniで$1,200〜1,500相当の8B〜34Bモデルに最適。M5 Max(128GB、614 GB/s、60〜100W)はMac Studioでの定期的な70B推論における唯一の民生向け選択肢。

M5 ProとM5 Max、デスクトップMacにも登場

2026年8月25日、Appleはこのページでベンチマークしているのと同じM5 ProとM5 Maxチップを、この世代で初めてデスクトップMacに搭載した:Mac mini M5 ProとMac Studio M5 Max、さらに新しいMac Studio M5 Ultra。3機種すべて2026年9月22日発売(512GB構成のMac Studio M5 Ultraのみ2026年10月下旬に別途発売)。

デスクトップMac
開始価格(米国)
最大メモリ
発売時期
Mac mini M5 Pro$1,69964GB(307 GB/s)2026年9月22日
Mac Studio M5 Max$2,499128GB2026年9月22日
Mac Studio M5 Ultra$5,49996GB(256/512GBまで)9月22日/10月下旬

この価格はApple発表の米国開始価格。本更新時点で公式な国内価格は未発表のため換算していない。これらのデスクトップ構成は、このページの他の箇所でベンチマークしているのと同一のM5 Pro/M5 Maxシリコンを使用している — 違いは筐体であってチップではない。本記事のtok/s数値はすべてMacBook Proで測定したもの。デスクトップ筐体はノートPCより熱的余裕が大きいため、数分間続く推論負荷ではMac mini/Mac Studioが同等のMacBook Proチップよりやや高速に動作する可能性があるが、これらの機種はまだ発売されていないため独立したデスクトップ筐体でのベンチマークは存在しない。市販機が入手・検証され次第、実測のデスクトップ数値でこのセクションを更新する。なおMac mini M5 ProはThunderbolt 5にも対応する。

ベンチマークの再現方法

これらのベンチマークはM5 Pro・M5 Max上で完全再現可能。このPythonスニペットをMLXで使用してシステム性能を検証。数値は報告範囲内±10%で一致するはず。

python
from mlx_lm import load, generate
import time

model, tokenizer = load("mlx-community/Llama-3.1-8B-Instruct-4bit")

prompt = "Explain quantum computing in 200 words."
start = time.time()
response = generate(model, tokenizer, prompt=prompt, max_tokens=200)
elapsed = time.time() - start

tokens = len(tokenizer.encode(response))
print(f"Speed: {tokens/elapsed:.1f} tok/s")
print(f"Time to first token: ~{elapsed - tokens * (elapsed/tokens):.2f}s")

M5 Ultra: 価格は確定、性能はまだ予測値

Appleは2026年8月25日にMac Studio M5 Ultraを発表した:開始価格$5,499(米国、96GB統合メモリ、同一筐体で256GBまで拡張可能。512GB構成は2026年10月下旬に別途発売され、価格は$10,000を大きく超える見込み)。発売は2026年9月22日(512GB構成は2026年10月下旬)。以下の価格とメモリ上限はApple発表の確定情報だが、tok/s数値は依然として過去のApple SoCスケーリングパターン(UltraはMaxの2倍の仕様を反映するのが一般的)に基づく予測値にとどまる — Appleは本記事執筆時点でレビュアーにも一般向けにもM5 Ultra実機を出荷しておらず、独立したベンチマークはまだ存在しない。

スペック
M5 Ultra
統一メモリ最大256GB(別構成で512GB、2026年10月下旬)
メモリ帯域幅~1,200 GB/s(予測)
GPUコア~80(予測)
Llama 3.1 8B Q4 (予測)180~220 tok/s
Llama 3.3 70B Q4 (予測)30~40 tok/s
Llama 3.3 70B FP16 (予測)12~16 tok/s
Llama 3.3 405B Q3 (予測)4~6 tok/s
開始価格(確定)$5,499(96GB)、512GB構成は別価格
発売日(確定)2026年9月22日(512GB:10月下旬)
初の405B コンシューマーローカルはい(Q3、完全ローカル)— 予測

M5 Ultraは70Bモデルをロスレスで実行できる初のコンシューマー向けハードウェアとなり、405Bパラメータモデルを意味のある速度でローカル実行できる初の製品になると見込まれる — ただしこれは独立して測定されるまでは予測にとどまる。M5 Ultraの発売・検証が完了次第、実測のtok/s数値で本記事を更新する。

ベンチマーク方法論と鮮度

  • テスト完了 : 2026年4月~5月、M5 Pro・M5 Max量産機(macOS 15.x Sequoia)。
  • フレームワーク : Ollama 0.7.x、MLX 0.22.x、llama.cpp b3460+(全てMetal加速有効)。
  • モデル : 公式llama.gguf、MLX community量子化、Q4_K_M(デフォルト)とQ5_K_M(高忠実度)使用。
  • 最後に確認 : 2026-05-15(M5 Pro/M5 Maxのtok/s数値)。Mac mini/Mac Studioのデスクトップ提供は2026-08-25に確認済みだが、独立ベンチマークはまだ未実施。
  • フレームワーク更新頻度 : 月次リリースで四半期当たり5~15%速度向上。このページは四半期毎に再ベンチマーク、新Apple Silicon チップ発表時に更新。
  • ハードウェア変動 : ±10%内の結果は正常(サーマル・システムロード・ファイルシステムキャッシュ状態)。

M5 Max(2倍帯域幅)が~2倍しか高速ではない理由は?

メモリ帯域幅がトークン生成速度を線形制限。M5 Max 614 GB/s vs M5 Pro 307 GB/s = 2倍理論速度。実世界では1.8~2.1倍に。アーキテクチャ相違とキャッシュ効果が理由。

8BモデルでRTX 4090がM5 Maxより高速のはなぜ?

RTX 4090が高い帯域幅(1,008 GB/s) vs M5 Max(614 GB/s)。だがRTX 4090は70B搭載不可(VRAM 24GB制限)、M5 Maxは可能。トレードオフ : 小モデル速度 vs モデルサイズ柔軟性。

M5 Proで十分、またはM5 Max購入すべき?

M5 Proは8B/13B/34Bで優良コスパ。M5 Max(€1,440+プレミアム)は70B定期利用かマルチモーダルスタック(Vision+LLM+TTS同時)のみ正当化。

M5 Ultra ベンチマークは劇的に高速?

Mac Studio M5 Ultraは2026年9月22日発売、開始価格$5,499(96GB、256GB/512GBまで)、予測帯域幅は~1,200 GB/s(M5 Max比2倍)。~2倍のトークン生成高速化が見込まれ、70B Q8(ロスレス)や120B+モデルの高速実行も実現するはずだが、これらは独立ベンチマークが存在するまでは予測であって実測ではない。

新しいMac mini M5 ProやMac Studio M5 Maxは、このページのMacBook Proベンチマークより高速か?

可能性はあるが未確認。このページのベンチマークはすべてMacBook Pro実機で測定したもの。デスクトップMacはノートPCより冷却に余裕があるため、長時間の推論実行でチップがより高いクロックを維持できる可能性がある。本記事執筆時点でAppleはデスクトップ版のMac mini M5 ProやMac Studio M5 Max/M5 Ultraをまだ出荷していない(発売は2026年9月22日)ため、独立したデスクトップ実測tok/sはまだ存在しない。デスクトップのベンチマークが公開されるまでは、このページのtok/s数値はMacBook Proの結果として扱ってほしい。

M5をMEIT AI採用ガイドラインで使用する場合は?

日本経済産業省(METI)が公開するAI利用ガイドラインに沿った運用が望ましい。M5 Pro/Maxのようなローカルインファレンスはデータ外部送信がないため、METI AI ガバナンスガイドの「信頼性・透明性」要件を多くの場面で満たす。ただし用途によってはセキュリティ監査(IPA制度)推奨。

サードパーティの情報に関する注意

この記事はサードパーティのAIモデル、ベンチマーク、価格、ライセンスを参照しています。AIの状況は急速に変化しています。ベンチマークスコア、ライセンス条件、モデル名、API価格は執筆時とお読みになる時の間で変わる可能性があります。この記事に基づいてデプロイやコンプライアンスに関する決定を下す前に、各プロバイダーの公式ソース(ライセンスとベンチマークはHugging Faceのモデルカード、API価格はプロバイダーのウェブサイト、現在のGDPRとEU AI法のテキストはEUR-Lex)で最新の数値を確認してください。

M5 Pro・M5 Maxをベンチマークした? PromptQuoRUMでGPT-4、Claude、Gemini他22モデルを単一dispatchで比較し、Apple Silicon環境がクラウド品質に相当するか検証。ユースケース固有の検証を。

PromptQuorumベータ版をダウンロード →

← ローカルLLMに戻る