Skip to main content
PromptQuorumBuilt for humans. Structured for AI.

現在最良のLLMは何ですか?

現在最良のLLMは何ですか?

クイック回答

2026年7月に3つの旗艦モデルが登場し、それぞれ別の領域で先行しています。Claude Opus 5(7月24日)はFrontier-Bench v0.1で首位、コーディング向けの選択です。GPT-5.6 Sol(7月9日)はコマンドラインとエージェント作業を測るTerminal-Bench 2.1で最高水準を打ち立てました。Gemini 3.1 Proはネイティブなマルチモーダル処理で先行し、ARC-AGI-2の検証済みスコアは77.1%です。ローカルではqwen3.5:9bがダウンロード6.6 GBです。

  • ▸クラウドのコーディング:Claude Opus 5 — Frontier-Bench v0.1で首位
  • ▸クラウドのエージェント/CLI:GPT-5.6 Sol — Terminal-Bench 2.1で最高水準
  • ▸マルチモーダル:Gemini 3.1 Pro — ARC-AGI-2で検証済み77.1%
  • ▸ローカル:qwen3.5:9b — ダウンロード6.6 GB
Prompt Engineering

重要なポイント

  • ✓すべての作業で勝つ単一のLLMはありません — Claude Opus 5はFrontier-Bench v0.1、GPT-5.6 SolはTerminal-Bench 2.1、Gemini 3.1 Proはマルチモーダルで先行します
  • ✓3つの旗艦モデルはいずれも2026年7月に登場したため、それ以前に書かれた比較は一世代古いことになります
  • ✓GPT-5.6は単一モデルではなくファミリーです。Solが旗艦、TerraはGPT-5.5相当の知能を半額で、LunaはSolより80%安価です
  • ✓ローカルではqwen3.5:9b(6.6 GB)が汎用を、qwen2.5-coder:7b(4.7 GB)がコーディングを担います。いずれも多くの記事が前提とするハードウェアよりはるかに軽量です
  • ✓クラウドモデルはAPIキーが必要でトークン単位の費用がかかりますが、ローカルモデルはハードウェア購入後は無償で動きます

最良のLLMは用途で決まる — その地図

2026年7月、3つの旗艦モデルが約2週間のうちに登場しました。コーディングにはClaude Opus 5(7月24日)、エージェントとコマンドライン作業にはGPT-5.6 Sol(7月9日)、マルチモーダル全般にはGemini 3.1 Proです。以下では、それぞれがどこで勝つか、作業内容ごとにどれを選ぶかを示します。

各社はもはや共通の主要ベンチマークを公表しておらず、比較とは異なる評価同士を比べることを意味します。AnthropicはOpus 5がFrontier-Bench v0.1で他のすべてのモデルを上回り、1タスクあたりの費用を抑えつつOpus 4.8の2倍以上になったと報告しています。OpenAIはGPT-5.6 Solが、コマンドライン作業での計画とツール連携を測るTerminal-Bench 2.1で最高水準を打ち立てたと報告しています。GoogleはGemini 3.1 ProがARC-AGI-2で検証済み77.1%だと報告しています。

構造上の変化も触れておく価値があります。GPT-5.6は単一のリリースではなく3モデルのファミリーです。Solが最先端モデル、TerraはGPT-5.5と同等の知能ベンチマークを半額で、LunaはSolより80%低い価格です。費用が制約になっているなら、比べるべきはSolではなく、TerraやLunaと競合の旗艦モデルです。

用途最良のLLM理由
コーディングClaude Opus 5Frontier-Bench v0.1で首位。1タスクあたり低コストでOpus 4.8の2倍超
エージェント/コマンドラインGPT-5.6 SolTerminal-Bench 2.1で最高水準
マルチモーダル(動画・画像・音声)Gemini 3.1 Proネイティブにマルチモーダル。ARC-AGI-2で検証済み77.1%
費用重視のスループットGPT-5.6 LunaまたはTerraLunaはSolより80%低価格、TerraはGPT-5.5相当を半額で
ローカル/オフライン汎用qwen3.5:9bダウンロード6.6 GB、Ollamaで入手できる最新のQwen
ローカル/オフラインのコーディングqwen2.5-coder:7bダウンロード4.7 GB、8 GBのカードで動作

レビューを50本読まずに選ぶ方法

制約から始めてください。予算、プライバシー、レイテンシ、能力のどれでしょうか。最も厳しい制約を先に満たすモデルを選びます。プライバシーが制約なら、クラウドの旗艦はいずれも該当せず、問いは「どのローカルモデルが自分のカードに載るか」に変わります。

実際の作業で2つのモデルを試してください。公表されたベンチマークはあなたの用途を予測しません。しかも1年前より事情は厳しく、3社は3つの異なる評価で報告しているため、順位づけできる同一指標が存在しません。クラウドは無料のAPI枠を、ローカルはOllamaを使ってください。

見直しは毎月ではなく四半期ごとに。3つの旗艦はいずれも2026年7月、約2週間のうちに登場しました。この固まり方こそ計画の前提にすべきものです。市場は波でしか動かず、波の前に書かれた比較は「少し古い」ではなく「一世代古い」ものになります。

2026年8月時点で確認。Claude Opus 5は2026年7月24日、GPT-5.6ファミリーは2026年7月9日に登場しました。ベンチマークの数値は各社が自ら選んだ評価で公表した自社結果であり、相互に直接比較できるものではありません。

最良のLLMに関するクイックアンサー

Claude Opus 5とGPT-5.6ではどちらが優れていますか?▾
両者は別々の評価で先行しており、どちらの提供元も相手のベンチマークでの数値を公表していません。AnthropicはClaude Opus 5がFrontier-Bench v0.1で他のすべてのモデルを上回り、1タスクあたり低コストでOpus 4.8の2倍以上になったと報告しています。OpenAIはGPT-5.6 SolがTerminal-Bench 2.1で最高水準を打ち立てたと報告しています。コード生成と分析にはOpus 5を、ターミナルを操作するエージェント処理にはSolを選んでください。
GPT-5.6のSol、Terra、Lunaの違いは何ですか?▾
Solはファミリーの最先端モデルです。Terraはバランス型で、知能ベンチマークではGPT-5.5と同等の性能を半額で提供します。Lunaは費用効率型で、Solより80%低い価格です。日常業務の多くはSolを必要としないため、トークン単位で支払うなら出発点はTerraが妥当です。
VRAMが8 GBしかない場合、最適なローカルLLMは何ですか?▾
コーディングにはダウンロード4.7 GBのqwen2.5-coder:7b、汎用には2.0 GBのllama3.2:3bが余裕をもって動きます。これらはVRAM要件ではなくダウンロードサイズなので、コンテキストウィンドウのぶん数GB多めに見てください。8 GBのカードなら両方とも快適に扱えます。
Gemini 3.1 Proは他の2つと比べてどうですか?▾
入力がテキストだけではない場合にGemini 3.1 Proが選択肢になります。テキスト、音声、画像、動画、コードリポジトリ全体にわたってネイティブにマルチモーダルで、GoogleはARC-AGI-2で検証済み77.1%と報告しています。純粋なテキスト推論とコード生成では、Claude Opus 5とGPT-5.6 Solのほうが強力です。クラウドモデルからよりよい出力を得るコツはCO-STARフレームワークガイドをご覧ください。