現在最良のLLMは何ですか?

クイック回答
2026年7月に3つの旗艦モデルが登場し、それぞれ別の領域で先行しています。Claude Opus 5(7月24日)はFrontier-Bench v0.1で首位、コーディング向けの選択です。GPT-5.6 Sol(7月9日)はコマンドラインとエージェント作業を測るTerminal-Bench 2.1で最高水準を打ち立てました。Gemini 3.1 Proはネイティブなマルチモーダル処理で先行し、ARC-AGI-2の検証済みスコアは77.1%です。ローカルではqwen3.5:9bがダウンロード6.6 GBです。
- ▸クラウドのコーディング:Claude Opus 5 — Frontier-Bench v0.1で首位
- ▸クラウドのエージェント/CLI:GPT-5.6 Sol — Terminal-Bench 2.1で最高水準
- ▸マルチモーダル:Gemini 3.1 Pro — ARC-AGI-2で検証済み77.1%
- ▸ローカル:qwen3.5:9b — ダウンロード6.6 GB
重要なポイント
- ✓すべての作業で勝つ単一のLLMはありません — Claude Opus 5はFrontier-Bench v0.1、GPT-5.6 SolはTerminal-Bench 2.1、Gemini 3.1 Proはマルチモーダルで先行します
- ✓3つの旗艦モデルはいずれも2026年7月に登場したため、それ以前に書かれた比較は一世代古いことになります
- ✓GPT-5.6は単一モデルではなくファミリーです。Solが旗艦、TerraはGPT-5.5相当の知能を半額で、LunaはSolより80%安価です
- ✓ローカルではqwen3.5:9b(6.6 GB)が汎用を、qwen2.5-coder:7b(4.7 GB)がコーディングを担います。いずれも多くの記事が前提とするハードウェアよりはるかに軽量です
- ✓クラウドモデルはAPIキーが必要でトークン単位の費用がかかりますが、ローカルモデルはハードウェア購入後は無償で動きます
最良のLLMは用途で決まる — その地図
2026年7月、3つの旗艦モデルが約2週間のうちに登場しました。コーディングにはClaude Opus 5(7月24日)、エージェントとコマンドライン作業にはGPT-5.6 Sol(7月9日)、マルチモーダル全般にはGemini 3.1 Proです。以下では、それぞれがどこで勝つか、作業内容ごとにどれを選ぶかを示します。
各社はもはや共通の主要ベンチマークを公表しておらず、比較とは異なる評価同士を比べることを意味します。AnthropicはOpus 5がFrontier-Bench v0.1で他のすべてのモデルを上回り、1タスクあたりの費用を抑えつつOpus 4.8の2倍以上になったと報告しています。OpenAIはGPT-5.6 Solが、コマンドライン作業での計画とツール連携を測るTerminal-Bench 2.1で最高水準を打ち立てたと報告しています。GoogleはGemini 3.1 ProがARC-AGI-2で検証済み77.1%だと報告しています。
構造上の変化も触れておく価値があります。GPT-5.6は単一のリリースではなく3モデルのファミリーです。Solが最先端モデル、TerraはGPT-5.5と同等の知能ベンチマークを半額で、LunaはSolより80%低い価格です。費用が制約になっているなら、比べるべきはSolではなく、TerraやLunaと競合の旗艦モデルです。
| 用途 | 最良のLLM | 理由 |
|---|---|---|
| コーディング | Claude Opus 5 | Frontier-Bench v0.1で首位。1タスクあたり低コストでOpus 4.8の2倍超 |
| エージェント/コマンドライン | GPT-5.6 Sol | Terminal-Bench 2.1で最高水準 |
| マルチモーダル(動画・画像・音声) | Gemini 3.1 Pro | ネイティブにマルチモーダル。ARC-AGI-2で検証済み77.1% |
| 費用重視のスループット | GPT-5.6 LunaまたはTerra | LunaはSolより80%低価格、TerraはGPT-5.5相当を半額で |
| ローカル/オフライン汎用 | qwen3.5:9b | ダウンロード6.6 GB、Ollamaで入手できる最新のQwen |
| ローカル/オフラインのコーディング | qwen2.5-coder:7b | ダウンロード4.7 GB、8 GBのカードで動作 |
レビューを50本読まずに選ぶ方法
制約から始めてください。予算、プライバシー、レイテンシ、能力のどれでしょうか。最も厳しい制約を先に満たすモデルを選びます。プライバシーが制約なら、クラウドの旗艦はいずれも該当せず、問いは「どのローカルモデルが自分のカードに載るか」に変わります。
実際の作業で2つのモデルを試してください。公表されたベンチマークはあなたの用途を予測しません。しかも1年前より事情は厳しく、3社は3つの異なる評価で報告しているため、順位づけできる同一指標が存在しません。クラウドは無料のAPI枠を、ローカルはOllamaを使ってください。
見直しは毎月ではなく四半期ごとに。3つの旗艦はいずれも2026年7月、約2週間のうちに登場しました。この固まり方こそ計画の前提にすべきものです。市場は波でしか動かず、波の前に書かれた比較は「少し古い」ではなく「一世代古い」ものになります。