当前最好的 LLM 是什么?

快速回答
2026 年 7 月有三款旗舰接连发布,各自在不同领域领先。Claude Opus 5(7 月 24 日)在 Frontier-Bench v0.1 上居首,是编程之选。GPT-5.6 Sol(7 月 9 日)在考察命令行与智能体工作的 Terminal-Bench 2.1 上确立了新的技术水准。Gemini 3.1 Pro 在原生多模态任务上领先,ARC-AGI-2 的核实成绩为 77.1%。本地方面,qwen3.5:9b 下载体积为 6.6 GB。
- ▸云端编程:Claude Opus 5 — 领先 Frontier-Bench v0.1
- ▸云端智能体/命令行:GPT-5.6 Sol — Terminal-Bench 2.1 新水准
- ▸多模态:Gemini 3.1 Pro — ARC-AGI-2 核实 77.1%
- ▸本地:qwen3.5:9b — 下载 6.6 GB
关键要点
- ✓没有哪一个 LLM 能在所有任务上取胜——Claude Opus 5 领先 Frontier-Bench v0.1,GPT-5.6 Sol 领先 Terminal-Bench 2.1,Gemini 3.1 Pro 领先多模态
- ✓三款旗舰都在 2026 年 7 月发布,因此此前撰写的任何对比都落后了一代
- ✓GPT-5.6 是一个系列而非单一模型:Sol 为旗舰,Terra 以半价达到 GPT-5.5 的水平,Luna 价格比 Sol 低 80%
- ✓本地方面,qwen3.5:9b(6.6 GB)覆盖通用工作,qwen2.5-coder:7b(4.7 GB)覆盖编程——两者都远低于多数指南所假设的硬件
- ✓云端模型需要 API 密钥并按令牌计费;本地模型在购置硬件后可免费运行
最好的 LLM 取决于任务——这是一张地图
2026 年 7 月,三款旗舰在半个月内相继登场。编程选 Claude Opus 5(7 月 24 日),智能体与命令行工作选 GPT-5.6 Sol(7 月 9 日),一切多模态选 Gemini 3.1 Pro。下文说明各自何时胜出,以及按工作流该选哪一个。
各厂商不再发布共同的头部基准,因此比较它们意味着比较不同的评测。Anthropic 称 Opus 5 在 Frontier-Bench v0.1 上超越所有其他模型,并以更低的单任务成本达到 Opus 4.8 的两倍以上。OpenAI 称 GPT-5.6 Sol 在考察命令行工作流中规划与工具协调能力的 Terminal-Bench 2.1 上确立了新的技术水准。Google 称 Gemini 3.1 Pro 在 ARC-AGI-2 上取得 77.1% 的核实成绩。
有一项结构性变化值得注意:GPT-5.6 是三款模型组成的系列,而非单次发布。Sol 是前沿模型,Terra 在智能基准上以半价达到 GPT-5.5 的水平,Luna 的价格比 Sol 低 80%。如果成本是你的硬约束,值得比较的是 Terra 或 Luna 与竞品旗舰,而不是 Sol。
| 使用场景 | 最佳 LLM | 原因 |
|---|---|---|
| 编程 | Claude Opus 5 | 居首 Frontier-Bench v0.1;以更低单任务成本达 Opus 4.8 两倍以上 |
| 智能体 / 命令行 | GPT-5.6 Sol | Terminal-Bench 2.1 新技术水准 |
| 多模态(视频、图像、音频) | Gemini 3.1 Pro | 原生多模态;ARC-AGI-2 核实 77.1% |
| 成本敏感的吞吐 | GPT-5.6 Luna 或 Terra | Luna 低于 Sol 80%;Terra 以半价达 GPT-5.5 水平 |
| 本地 / 离线通用 | qwen3.5:9b | 下载 6.6 GB,Ollama 中可获取的最新 Qwen |
| 本地 / 离线编程 | qwen2.5-coder:7b | 下载 4.7 GB,8 GB 显卡即可运行 |
不读 50 篇评测该如何选择
从约束出发。预算、隐私、延迟还是能力?先选能解开你最硬约束的那个模型。如果约束是隐私,那么没有任何云端旗舰符合条件,问题就变成了哪款本地模型装得进你的显卡。
用你真实的任务测试两个模型。公开基准无法预测你的用例,而且今天比一年前更是如此:三家厂商各自报告三种不同的评测,因此不存在可用于排序的同口径数字。云端用免费 API 额度,本地用 Ollama。
按季度复查,而非按月。三款旗舰都在 2026 年 7 月、前后约两周内发布。这种扎堆正是规划时该考虑的模式:这个领域是成批推进的,而在一批发布之前写下的对比,落后的是整整一代,而不是稍显陈旧。