Skip to main content
PromptQuorumBuilt for humans. Structured for AI.

当前最好的 LLM 是什么?

当前最好的 LLM 是什么?

快速回答

2026 年 7 月有三款旗舰接连发布,各自在不同领域领先。Claude Opus 5(7 月 24 日)在 Frontier-Bench v0.1 上居首,是编程之选。GPT-5.6 Sol(7 月 9 日)在考察命令行与智能体工作的 Terminal-Bench 2.1 上确立了新的技术水准。Gemini 3.1 Pro 在原生多模态任务上领先,ARC-AGI-2 的核实成绩为 77.1%。本地方面,qwen3.5:9b 下载体积为 6.6 GB。

  • ▸云端编程:Claude Opus 5 — 领先 Frontier-Bench v0.1
  • ▸云端智能体/命令行:GPT-5.6 Sol — Terminal-Bench 2.1 新水准
  • ▸多模态:Gemini 3.1 Pro — ARC-AGI-2 核实 77.1%
  • ▸本地:qwen3.5:9b — 下载 6.6 GB
Prompt Engineering

关键要点

  • ✓没有哪一个 LLM 能在所有任务上取胜——Claude Opus 5 领先 Frontier-Bench v0.1,GPT-5.6 Sol 领先 Terminal-Bench 2.1,Gemini 3.1 Pro 领先多模态
  • ✓三款旗舰都在 2026 年 7 月发布,因此此前撰写的任何对比都落后了一代
  • ✓GPT-5.6 是一个系列而非单一模型:Sol 为旗舰,Terra 以半价达到 GPT-5.5 的水平,Luna 价格比 Sol 低 80%
  • ✓本地方面,qwen3.5:9b(6.6 GB)覆盖通用工作,qwen2.5-coder:7b(4.7 GB)覆盖编程——两者都远低于多数指南所假设的硬件
  • ✓云端模型需要 API 密钥并按令牌计费;本地模型在购置硬件后可免费运行

最好的 LLM 取决于任务——这是一张地图

2026 年 7 月,三款旗舰在半个月内相继登场。编程选 Claude Opus 5(7 月 24 日),智能体与命令行工作选 GPT-5.6 Sol(7 月 9 日),一切多模态选 Gemini 3.1 Pro。下文说明各自何时胜出,以及按工作流该选哪一个。

各厂商不再发布共同的头部基准,因此比较它们意味着比较不同的评测。Anthropic 称 Opus 5 在 Frontier-Bench v0.1 上超越所有其他模型,并以更低的单任务成本达到 Opus 4.8 的两倍以上。OpenAI 称 GPT-5.6 Sol 在考察命令行工作流中规划与工具协调能力的 Terminal-Bench 2.1 上确立了新的技术水准。Google 称 Gemini 3.1 Pro 在 ARC-AGI-2 上取得 77.1% 的核实成绩。

有一项结构性变化值得注意:GPT-5.6 是三款模型组成的系列,而非单次发布。Sol 是前沿模型,Terra 在智能基准上以半价达到 GPT-5.5 的水平,Luna 的价格比 Sol 低 80%。如果成本是你的硬约束,值得比较的是 Terra 或 Luna 与竞品旗舰,而不是 Sol。

使用场景最佳 LLM原因
编程Claude Opus 5居首 Frontier-Bench v0.1;以更低单任务成本达 Opus 4.8 两倍以上
智能体 / 命令行GPT-5.6 SolTerminal-Bench 2.1 新技术水准
多模态(视频、图像、音频)Gemini 3.1 Pro原生多模态;ARC-AGI-2 核实 77.1%
成本敏感的吞吐GPT-5.6 Luna 或 TerraLuna 低于 Sol 80%;Terra 以半价达 GPT-5.5 水平
本地 / 离线通用qwen3.5:9b下载 6.6 GB,Ollama 中可获取的最新 Qwen
本地 / 离线编程qwen2.5-coder:7b下载 4.7 GB,8 GB 显卡即可运行

不读 50 篇评测该如何选择

从约束出发。预算、隐私、延迟还是能力?先选能解开你最硬约束的那个模型。如果约束是隐私,那么没有任何云端旗舰符合条件,问题就变成了哪款本地模型装得进你的显卡。

用你真实的任务测试两个模型。公开基准无法预测你的用例,而且今天比一年前更是如此:三家厂商各自报告三种不同的评测,因此不存在可用于排序的同口径数字。云端用免费 API 额度,本地用 Ollama。

按季度复查,而非按月。三款旗舰都在 2026 年 7 月、前后约两周内发布。这种扎堆正是规划时该考虑的模式:这个领域是成批推进的,而在一批发布之前写下的对比,落后的是整整一代,而不是稍显陈旧。

2026 年 8 月核实。Claude Opus 5 于 2026 年 7 月 24 日发布,GPT-5.6 系列于 2026 年 7 月 9 日发布。基准数字均为各厂商在自选评测上公布的自家结果——彼此之间不可直接比较。

关于当前最佳 LLM 的快速解答

Claude Opus 5 和 GPT-5.6 哪个更好?▾
它们在不同评测上领先,而且两家厂商都没有在对方的基准上公布数字。Anthropic 称 Claude Opus 5 在 Frontier-Bench v0.1 上超越所有其他模型,并以更低的单任务成本达到 Opus 4.8 的两倍以上。OpenAI 称 GPT-5.6 Sol 在 Terminal-Bench 2.1 上确立了新的技术水准。代码生成与分析选 Opus 5,驱动终端的智能体流程选 Sol。
GPT-5.6 的 Sol、Terra 和 Luna 有什么区别?▾
Sol 是该系列的前沿模型。Terra 是均衡之选,在智能基准上以半价达到 GPT-5.5 的表现。Luna 是经济之选,价格比 Sol 低 80%。多数日常工作用不上 Sol,因此若按令牌付费,诚实的起点是 Terra。
只有 8 GB 显存时最好的本地 LLM 是哪个?▾
编程选下载 4.7 GB 的 qwen2.5-coder:7b,通用选 2.0 GB 的 llama3.2:3b,都很宽裕。这些是下载体积而非显存需求,因此请在其之上再留出几 GB 给上下文窗口。8 GB 显卡运行两者都很从容。
Gemini 3.1 Pro 与另外两款相比如何?▾
当输入不只是文本时,Gemini 3.1 Pro 是首选。它在文本、音频、图像、视频以及整个代码仓库上原生多模态,Google 公布其 ARC-AGI-2 核实成绩为 77.1%。若是纯文本推理与代码生成,Claude Opus 5 与 GPT-5.6 Sol 更强。想从任何云端模型获得更好输出,请参阅我们的 CO-STAR 提示框架指南。