Skip to main content
PromptQuorum
主页/本地LLM/2026 年最佳 LLM 评估工具:Braintrust、Weave 与 Promptfoo
Tools & Interfaces

2026 年最佳 LLM 评估工具:Braintrust、Weave 与 Promptfoo

·阅读时长 13 分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

本页包含指向第三方产品的参考链接。PromptQuorum 未加入任何联盟计划——这些是不产生佣金的普通链接。点击链接和后续步骤由您自行承担责任。这些链接不代表 PromptQuorum 的任何认可或验证。

对把大模型功能推向生产的团队来说,Braintrust 是综合实力最强的评估平台:每月 1 万次评分内免费,Pro 为 249 美元。如果你已经在用 Weights & Biases,Weave 是自然之选,每月 60 美元起,但仅限员工少于 50 人的组织。Promptfoo 是最好的免费且 CI 原生的选择:采用 MIT 许可,因为跑在你自己的机器上而在任意规模下免费,并且自 2026 年 3 月起归 OpenAI 所有,OpenAI 已公开承诺在现有许可下保持其开源。

关键要点

  • Braintrust — 免费的 Starter 档含每月 1 万次评分、1 GB 处理数据、14 天留存、10 美元模型额度以及不限数量的用户。Pro 每月 249 美元,含 249 美元模型额度、5 GB 数据、5 万次评分和 30 天留存。Enterprise 增加自定义留存以及本地或托管部署。
  • Weave — 隶属 Weights & Biases。免费档提供不限数量的 Weave 席位和每月 1 GB 数据摄入。Pro 每月 60 美元起、含 1.5 GB,但资格被明确限定为「early-stage teams fewer than 50 employees」;更大的组织必须转入 Enterprise。额外摄入为每 MB 0.10 美元。
  • Promptfoo — GitHub 星标 2.46 万,MIT 许可,且在任意规模下免费,因为它以 CLI 和库的形式运行在你已经拥有的基础设施上。你唯一的成本是评估本身消耗的模型 API 支出,而任何平台上的「大模型作为评判者」流程都会产生这笔费用。
  • OpenAI 于 2026 年 3 月 9 日宣布收购 Promptfoo,并公开表示:「Promptfoo will remain open source under the current license, and we will continue to service and support current customers。」该仓库目前仍为 MIT 许可,并在本页核实当天有过更新。
  • 有一处值得订正: 多篇文章把 Braintrust Pro 的模型额度描述为促销价,称 2026 年 9 月 1 日后降至每月 100 美元。Braintrust 的定价页上并没有这样的到期日。页面列出的唯一促销是「6–12 months free for qualifying startups」。请按厂商页面编列预算。
  • Promptfoo 既是评估工具,也是安全工具。 它自己的描述以红队测试、渗透测试和漏洞扫描开头,OpenAI 也把这次收购放在智能体安全测试的语境下。这与 Braintrust 和 Weave 是实实在在的侧重差异。
  • 三者都没有面向内容创作者的公开联盟或推荐计划。Weights & Biases 确有合作伙伴计划,但那是面向咨询公司的分销与技术集成机制,而非按推荐付费。PromptQuorum 不会从本页获得任何收入。

🏆 按场景选择

请按评估在哪里运行、由谁阅读结果来选,而不是按打分功能清单——三者覆盖的打分基本能力是一样的。 往下读,在第一条符合你情况的地方停下。

  • 不写代码的人需要复核失败样例 → Braintrust。托管界面、人工复核队列与数据集版本管理正是为此存在,而免费档能覆盖早期阶段的大部分用量。
  • 你已经在用 Weights & Biases → Weave。评估会出现在你既有的实验跟踪旁边,免费档还提供不限数量的席位。在指望 Pro 之前,先确认 50 人的限制。
  • 你想要不依赖厂商、受版本控制的评估配置 → Promptfoo。代码旁的 YAML 或 JS,可在拉取请求里比对差异,且无论规模都免费。
  • 你测试的是提示注入与智能体安全,而不只是质量 → Promptfoo。红队测试与漏洞扫描是它宣称的用途;参见提示安全与注入测试工具
  • 你只有寥寥几个测试用例、一位工程师 → 暂时都不需要。在数据集大到需要管理之前,CI 里一个带评分的脚本就够了。
Braintrust — 查看价格产品链接 · 已披露Promptfoo — 开源仓库产品链接 · 已披露

评估工具究竟做什么

LLM 评估工具把一组测试用例送进你的提示或智能体并为每个输出打分,让你在改动抵达用户之前就知道它是变好了还是变差了。 数据集通常是一组「输入与期望输出」的配对,可能取自生产日志、作为边界情况手写,或由模型生成。评分器的范围很广:从字符串匹配、JSON 模式校验这类确定性检查,到由第二个模型依据评分标准打分的「大模型作为评判者」,再到你自己编写的自定义函数。

这与观察系统上线后的行为是两码事。评估回答的是「这次改动能否安全发布」,生产监控回答的是「它现在正在做什么」。本页讨论前者。若想从提示层面看同一问题,参见如何评估提示质量

📍 简单一句话

LLM 评估工具会把一组固定的测试用例送进你的提示或智能体,用确定性检查、「大模型作为评判者」打分或自定义函数为每个输出评分,并在发布前报告某次改动提升还是拉低了质量。

💬 简单来说

它是给「同一个问题不会给出两次相同答案」的东西准备的测试套件。你不再断言精确输出,而是给它打分,并观察改动提示时平均分是否往错误的方向走。

Braintrust、Weave 与 Promptfoo 对比

三者都支持「大模型作为评判者」、自定义评分器和基于数据集的回归测试,因此比较的重点是托管方式、成本结构与资格限制。 价格于 2026 年 8 月 28 日读取自各厂商自己的页面,仓库数据同日取自 GitHub API。

评估维度BraintrustWeavePromptfoo
形态带界面的托管平台托管,隶属 W&B由你运行的 CLI 与库
许可证商业SDK 为 Apache-2.0,服务为托管MIT
免费档每月 1 万次评分、1 GB、14 天每月 1 GB 摄入、席位不限任意规模免费
付费入门Pro 每月 249 美元,含 249 美元额度每月 60 美元起,1.5 GBEnterprise 档,定制报价
资格上限未声明Pro 仅限员工少于 50 人
超量计费Pro 每 1,000 次评分 1.50 美元每 MB 摄入 0.10 美元仅你的模型 API 支出
自托管Enterprise,本地或托管Enterprise,单租户默认——跑在你的机器上
联盟计划未找到未找到未找到

⚠️Warning: Weave 的 Pro 档并不只是更便宜的套餐:Weights & Biases 明确表示它面向「early-stage teams fewer than 50 employees」,超出该指引的客户必须转入 Enterprise。如果你的人数超过这一线,真正的比较是 Braintrust Pro 的 249 美元对上一份定制的 Enterprise 报价,而不是对上 60 美元。

Braintrust:生产之选

当不写代码的人需要查看评估结果时,就该选 Braintrust。 它的价值集中在托管界面、数据集版本管理与人工复核流程上,而这恰恰是你否则必须自己搭建的部分。

1

Braintrust — 跨职能生产团队最佳

每月 1 万次评分内免费,Pro 249 美元含 249 美元额度

对一个托管平台而言,免费的 Starter 档慷慨得不寻常:每月 1 万次评分、1 GB 处理数据、14 天留存、10 美元模型额度,以及不限数量的用户、项目、数据集与实验。免费档就提供不限席位在这里尤其重要,因为选择 Braintrust 的全部理由,正是让产品经理和领域专家无需为其购买许可就能复核失败样例。每月 249 美元的 Pro 把上限提到 5 万次评分、5 GB 与 30 天留存,并含 249 美元模型额度,对中等规模负载而言基本抵消了评判模型的开销。超量是计费而非阻断:Pro 档每 1,000 次评分 1.50 美元、每 GB 3 美元。Enterprise 增加自定义留存与导出、RBAC,以及本地或托管部署。

优点

  • +免费档即不限用户数量,而这正是选择它的意义所在
  • +每月 1 万次评分的免费档确实能覆盖早期项目
  • +Pro 含 249 美元模型额度,很大程度上抵消了评判模型的开销
  • +面向隐私敏感负载提供本地或托管部署

缺点

  • 免费档 14 天留存,若想与上个月对比就偏短
  • 自托管需要 Enterprise 并经商务沟通,且未公开价格
  • 商业平台,不像 Promptfoo 那样在价格变动时还有退路
Braintrust — 查看价格产品链接 · 已披露

Weave:Weights & Biases 之选

如果你的团队已经在 Weights & Biases 里跟踪实验,Weave 是显而易见的答案;如果没有,说服力就弱得多。 论据就是集成本身:评估会落在你本来就在看的运行记录旁边。

1

Weave — 在 Weights & Biases 生态内最佳

每月 1 GB 免费且席位不限,Pro 在员工少于 50 人时每月 60 美元起

Weave 覆盖应用评估、追踪与评分器,免费档提供不限数量的 Weave 席位和每月 1 GB 摄入,对小团队而言是合理的起点。Pro 按月计费、每月 60 美元起并含 1.5 GB,额外摄入为每 MB 0.10 美元。真正的门槛在资格而非价格:Weights & Biases 表示 Pro 面向「early-stage teams fewer than 50 employees」,超出该指引的客户必须转入 Enterprise。严肃的部署选项都在 Enterprise 里,包括单租户、HIPAA 合规、客户自管加密密钥、SSO 与审计日志。请注意,单租户更接近专用实例而非真正的本地部署,因此在认定它满足仅限本地的合规要求之前,请向 W&B 确认细节。

优点

  • +免费档提供不限数量的 Weave 席位与每月 1 GB 摄入
  • +评估与既有的 W&B 实验跟踪和注册表并存
  • +Enterprise 提供单租户、HIPAA、客户自管密钥与 SSO
  • +每月 60 美元是三者中最低的付费入门价

缺点

  • Pro 仅限员工少于 50 人的组织,这是一道硬性上限
  • 按 0.10 美元/MB 摄入计费比按评分次数更难预估
  • 若你尚未使用 Weights & Biases,它作为独立方案的说服力最弱

Promptfoo:免费且 CI 原生之选

Promptfoo 是那个在任何规模下都不花钱的选择,原因是你自己运行它。 它是 CLI 和库而非平台,因此评估以配置的形式与代码放在一起,并在你的测试本来就运行的地方执行。

1

Promptfoo — 最佳免费且 CI 原生的选择

2.46 万星标,MIT 许可,任意规模免费,现归 OpenAI 所有

Promptfoo 有 24,638 个 GitHub 星标和 MIT 许可,并在本页核实当天有更新,活跃度毫无疑问。由于它跑在你已经拥有的基础设施上,不存在按评分或按 GB 的计量:你唯一的成本是评估消耗的模型 API 调用,而这在任何平台上都要付。把数据集定义为 YAML、CSV 或 JS 比在界面里点击更费事,但也让评估能在拉取请求里比对差异——当评估配置理应像其他代码一样被评审时,这是实打实的优势。值得弄清它究竟是什么:项目自述为测试提示、智能体与 RAG,并提供面向 AI 的红队测试、渗透测试与漏洞扫描。安全在这里不是附带功能,OpenAI 也把这次收购放在智能体安全测试的语境下。

优点

  • +任意规模免费,没有评分或摄入计量
  • +评估作为受版本控制的配置,可在拉取请求中比对与评审
  • +MIT 许可,因此条款变动时不存在必须依赖的厂商
  • +红队测试与漏洞扫描是一等能力,而非事后加装

缺点

  • 默认没有托管界面,不写代码的人无处可点
  • YAML 与 CSV 数据集比在浏览器里搭建更费准备工夫
  • 如今归 OpenAI 所有,即便有开源承诺,这仍是一个治理层面的考量
Promptfoo — 开源仓库产品链接 · 已披露

被 OpenAI 收购对 Promptfoo 意味着什么

OpenAI 于 2026 年 3 月 9 日宣布收购 Promptfoo,并公开承诺保持其开源。 OpenAI 自己的表述是:「Promptfoo will remain open source under the current license, and we will continue to service and support current customers。」这笔收购当时由 TechCrunch、CNBC 与 Forbes 报道,并在 OpenAI 与 Promptfoo 各自的网站上得到确认。

目前的实际情况支持这一承诺。近六个月过去,仓库仍在 `promptfoo` 组织之下,仍为 MIT 许可,并在本页核实当天有更新。这正是人们希望看到的。

但仍值得思考的理由在于治理,而非许可。评估工具是你用来评判模型的东西,而它如今归一家制造模型的公司所有。MIT 许可意味着,一旦项目方向不再服务于你,你可以分叉——这是 Braintrust 与 Weave 都不提供的实质保护。不过,如果你的评估策略依赖于在模型厂商之间保持中立,那就该是一个有意识的决定,而不是一个默认假设。

📌Note: OpenAI 表示 Promptfoo 的技术将被整合进 OpenAI Frontier,用于自动化红队测试与智能体安全检测。这与 Promptfoo 原有的安全侧重一致,也意味着安全方向可能比通用评估获得更多投入。

价格如何比较

成本随数据量与评判模型支出增长,而不是随席位增长——这也是免费档「不限用户」比乍看之下更有用的原因。 下表按每月约 5 万次评估评分的中等负载测算。

场景BraintrustWeavePromptfoo
免费档上限1 万次评分、1 GB、14 天每月 1 GB 摄入、席位不限无上限
付费档Pro 每月 249 美元每月 60 美元起无需付费
该档包含5 万次评分、5 GB、249 美元额度1.5 GB 摄入不适用
每月 5 万次评分249 美元的 Pro 可覆盖取决于 GB,很可能超过 1.5 GB仅模型 API 支出
超量单价每 1,000 次评分 1.50 美元、每 GB 3 美元每 MB 0.10 美元
资格上限未声明Pro 限员工少于 50 人

Braintrust 按评分计费,Weave 按摄入的 GB 计费。这不是可比的单位,因此在认定 60 美元比 249 美元便宜之前,请用你自己的负载把两者都估一遍。

⚠️Warning: 多篇对比称 Braintrust Pro 的 249 美元额度是 2026 年促销,2026 年 9 月 1 日后降至每月 100 美元。该到期日并未出现在 Braintrust 的定价页上,页面列出的促销只有「6–12 months free for qualifying startups」。请按厂商页面而非对比文章测算,本文亦不例外。

自托管与数据驻留

三者之中,只有 Promptfoo 把自托管作为默认形态,而非企业版的升级项。 因为它是 CLI 和库,除非你刻意选择托管档位,否则测试用例与模型输出永远不会离开你的环境。对受数据驻留规则约束的团队来说,这是消除了问题,而不是回答了问题。

Braintrust 提供本地或托管部署,但仅限 Enterprise,这意味着定制报价与商务沟通。它是真实的部署选项而非营销措辞,只是你无法自助评估。

Weave 的 Enterprise 档提供单租户选项,配合客户自管加密密钥、HIPAA 合规与安全私有连接。请仔细读:带自管密钥的单租户是一个专用实例,和运行在你自己的边界之内并不是一回事。如果你的要求严格限定为本地部署,请向 Weights & Biases 确认细节,而不要假定单租户就能满足。

谁该用哪一个

团队形态比功能清单更能决定结果。 五类情形覆盖了大多数读者。

  • 独立开发者做 MVP → Promptfoo。无需账号、没有计量,项目改变方向时也没有东西需要清理。
  • 带产品与测试复核、发布大模型功能的产品团队 → Braintrust。免费档不限用户数,正是让跨职能复核得以成立的那个具体条件。
  • 已经在用 Weights & Biases 的团队 → Weave,前提是 Pro 所要求的员工少于 50 人。超过则先为 Enterprise 报价再作比较。
  • 测试提示注入的安全或平台团队 → Promptfoo,其红队测试的侧重与任务相符。另见提示安全与注入测试工具
  • 跨多家模型供应商做评估的团队 → Promptfoo 或 Braintrust,并把调用经由网关路由,使供应商比较只是一次配置改动;参见最佳 LLM API 网关

欧盟、日本与中国的评估工具

评估数据集通常由生产流量构建而成,因而属于大模型技术栈中最敏感的数据之一。这使得托管与本地之间的选择,在三个主要市场都成为合规问题。

选择评估工具时的常见错误

  1. 1
    不查资格就拿 60 美元与 249 美元相比
    Why it matters: Weave Pro 仅限员工少于 50 人的组织。超过这一人数,真正的比较是 Braintrust Pro 对上一份定制的 Weave Enterprise 报价,而 60 美元这个数字对你根本不可用。
  2. 2
    围绕一个并未公布的 Braintrust 促销到期日编列预算
    Why it matters: 「Pro 额度在 2026 年 9 月 1 日后降至每月 100 美元」这一说法并未出现在 Braintrust 的定价页上。围绕厂商从未宣布的到期日去规划迁移是白费力气;请重新阅读定价页。
  3. 3
    把评分次数与 GB 当作可比单位
    Why it matters: Braintrust 计量评分,Weave 计量摄入。一个在 5 万次评分内绰绰有余的负载,能否装进 1.5 GB 取决于你的追踪记录有多大。在按价格排序之前,请用你自己的数据把两者都估算一遍。
  4. 4
    为十五个用例的数据集引入平台
    Why it matters: 在大约二十个测试用例以下,CI 里一个带评分的脚本能完成同样的工作,且无需账号、没有计量、也没有留存期限制。平台真正值回票价,是在数据集管理而非打分成为瓶颈之时。
  5. 5
    把单租户当成本地部署
    Why it matters: Weave 带客户自管密钥的 Enterprise 单租户选项是一个专用实例,而不是部署在你自己的边界之内。如果你的要求严格限定为本地部署,请向 W&B 确认,而不要把单租户读作等价物。

什么情况下不必用

如果你的测试集只有十来条提示、由一位工程师运行,那就把三者都跳过,在 CI 里写个带评分的脚本。 你能得到同样的回归信号,却不需要账号、计量或留存窗口;日后转向平台也不会有任何损失,因为真正的资产是数据集,而它会随你一起走。

值得等待的门槛,是数据集管理本身变成工作的时候:当你想例行地把生产中失败的样例收进测试集,当不写代码的人需要为输出评级,或当你需要把本月结果与上季度对比。这些都是数据管理问题,而那才是你真正在购买的东西。打分本身一直都是容易的那部分。

💡Tip: 一个实用的触发条件:当你发现自己开始做一张表格来记录哪个提示版本得了多少分时,就该引入平台了。那张表格正是你即将购买的产品,而买下来比自己维护更便宜。

常见问题

2026 年最好的 LLM 评估工具是哪个?

对需要非技术人员复核结果的团队是 Braintrust,因为免费档就不限用户数量。若你已在用 Weights & Biases 且员工少于 50 人,则是 Weave。若你想要在自己基础设施上免费运行、受版本控制的评估配置,则是 Promptfoo。三者都覆盖「大模型作为评判者」、自定义评分器与回归测试。

OpenAI 收购 Promptfoo 了吗?

是的。OpenAI 于 2026 年 3 月 9 日宣布收购,并表示 Promptfoo 将在现有许可下保持开源,现有客户也将继续获得服务与支持。截至 2026 年 8 月下旬,该仓库仍在 promptfoo 组织之下、仍为 MIT 许可,并处于活跃维护中。

Braintrust 多少钱?

免费的 Starter 档包含每月 1 万次评分、1 GB 处理数据、14 天留存、10 美元模型额度与不限数量的用户。Pro 每月 249 美元,含 249 美元额度、5 万次评分、5 GB 与 30 天留存,超量为每 1,000 次评分 1.50 美元。Enterprise 为定制报价,并增加本地或托管部署。

Weave 免费吗,限制是什么?

Weave 有一个免费档,提供不限数量的席位与每月 1 GB 数据摄入。Pro 每月 60 美元起、含 1.5 GB,但 Weights & Biases 将其限定为员工少于 50 人的早期团队;更大的组织必须转入 Enterprise。额外摄入为每 MB 0.10 美元。

Promptfoo 真的在任意规模下免费吗?

是的,就工具本身而言:它采用 MIT 许可并运行在你自己的机器上,因此没有按评分或按 GB 的收费。你仍需为评估发起的模型 API 调用付费,但这笔成本在任何平台上都存在,并非 Promptfoo 特有。此外还有一个可选的托管 Enterprise 档位。

哪一个可以自托管?

默认是 Promptfoo,因为它是 CLI 和库,你在哪里运行它就在哪里跑。Braintrust 在其 Enterprise 套餐中提供本地或托管部署。Weave 提供带客户自管密钥的 Enterprise 单租户选项,那是专用实例而非真正的本地部署,若你有严格要求请确认细节。

它们有联盟计划吗?

我们在 Braintrust、Weights & Biases 与 Promptfoo 都没有找到面向创作者的公开联盟或推荐计划。Weights & Biases 确有合作伙伴计划,但其公开页面描述的是面向咨询公司的分销与技术集成合作,而非按推荐付费。另请注意 usebraintrust.com 是一个独立的人才市场,与 braintrust.dev 无关。PromptQuorum 不会从本页获得任何收入。

评估与监控有什么区别?

评估在发布前运行一个固定的数据集,告诉你某次改动提升还是拉低了质量。监控在发布后观察真实流量,告诉你系统现在正在做什么。本页讨论前者。两者互补,很多团队都会做,但工具与要回答的问题并不相同。

最终结论

  • 选 Braintrust,如果不写代码的人需要复核评估结果——下一步:从允许不限用户数的免费档开始,先看你的产品经理是否真的会打开它,再决定要不要付费升级到 Pro。
  • 选 Weave,如果 Weights & Biases 已是你的记录系统——下一步:在指望 60 美元那一档之前先确认你在 50 人上限之内,若不在则为 Enterprise 报价。
  • 选 Promptfoo,如果你想要不带厂商计量、可评审的评估配置——下一步:先用 YAML 写出第一个数据集并在 CI 里跑通,再去评估任何托管方案。
  • 尤其选 Promptfoo,如果你测试的是提示注入与智能体安全,而不只是输出质量——下一步:从它的红队测试功能入手,那正是 OpenAI 投入资源的方向。
  • 三者都跳过,如果你只有十来个测试用例和一位工程师——下一步:在 CI 里写个带评分的脚本,等数据集管理成为瓶颈时再回头考虑。

来源

关于第三方事实的说明

本文引用了第三方AI模型、基准测试、价格和许可证。AI领域变化迅速。基准分数、许可条款、模型名称和API价格可能在写作时间和您阅读时之间发生变化。在根据本文做出部署或合规决策之前,请在每个提供商的官方来源核实当前数据:Hugging Face模型卡用于许可证和基准测试,提供商网站用于API定价,EUR-Lex用于当前GDPR和EU AI法案文本。

使用本地LLM、您自己的API密钥或两者运行PromptQuorum — 您来决定使用哪个后端。

下载 PromptQuorum 测试版 →

← 返回本地LLM