这些工具能做什么(不能做什么)
📍 In One Sentence
LangSmith、Helicone、Langfuse 和 PromptLayer 记录并追踪已在生产环境运行的LLM调用 —— 这与部署前的prompt测试和评估是不同的工作。
💬 In Plain Terms
可以把它们理解为应用监控:这些工具相当于你的LLM调用版本的Datadog或Sentry,而不是部署前运行的测试套件。两者都需要 —— 只是覆盖不同阶段。
LangSmith、Helicone、Langfuse 和 PromptLayer 是生产环境LLM可观测性平台 —— 它们在应用发起API调用后进行记录,追踪多步骤链路,并随时间跟踪成本和延迟。它们回答的是"这次生产运行时发生了什么?"
这与"部署前这个prompt好不好?"是不同的问题 —— 部署前测试与评估是Promptfoo、Braintrust、Vellum等工具的职责,详见Prompt测试与评估工具2026。部署前的prompt版本管理与团队共享详见最佳Prompt管理平台。本页的工具从prompt上线、真实用户开始调用的那一刻起才真正发挥价值。
重叠之处:这四款工具都提供一定的评估和数据集功能,因为知道prompt在生产环境出了问题固然有用,但如果还能评估问题有多严重会更有用。但评分在这里是次要功能,不是主要功能 —— 主要工作是对实时流量进行追踪、记录和成本可见性管理。
披露说明:本页每个供应商链接(LangSmith、Langfuse、Helicone、PromptLayer)都直接指向该供应商自己的网站。这些都是纯粹的产品链接 —— 四者目前均未运营公开的联盟或佣金计划,除此说明外没有其他需要披露的联盟关系。
我们如何比较这些工具
我们按照五项专属于生产追踪的标准评估这四款工具:接入成本、是否支持自托管、框架覆盖广度、规模化后的成本透明度,以及在日志记录之上的评估深度。
标准 | 衡量内容 | 重要原因 |
|---|---|---|
| 接入成本 | SDK封装 vs 代理 vs 一行请求头修改 | 决定为接入追踪需要改动多少代码库 |
| 自托管 | 工具能否运行在自有基础设施上,以及成本如何 | 数据驻留、合规性和长期成本控制 |
| 框架覆盖广度 | 拥有原生集成的SDK/框架数量 | 使用多个供应商的团队需要广度而非深度 |
| 规模化成本 | 真实生产规模下超出免费层后的价格变化 | 免费层定价页往往隐藏了真正重要的数字 |
| 评估深度 | 在原始日志之上的数据集驱动评分 | 日志记录能告诉你出了问题,评估能告诉你问题有多严重 |
LangSmith:最深的LangChain集成
LangSmith是LangChain自家的可观测性平台 —— 对LangChain和LangGraph应用而言追踪是自动的,如果你已经基于这些框架构建,所需的配置在所有工具中最少。在LangChain生态之外,LangSmith仍可通过其SDK使用,但自动追踪的优势就消失了。可从免费的Developer层开始 —— 前5,000条追踪/月无需绑卡。
免费Developer层:1个席位,最多5,000条基础追踪/月,超出后按量计费。Plus层:$39/席位/月,席位数不限,最多10,000条基础追踪/月包含在内,超出后叠加按量计费 —— 每个LangChain计算单元(LCU)$1.50、每个LangChain存储单元(LSU)$1.00,用于计量Engine、Fleet、Deployment和Sandbox的使用量。Enterprise为定制报价,支持自托管和混合部署、SSO和RBAC。
最佳团队功能:基于数据集的评估配合LLM-as-judge评分、针对已保存追踪记录的回归测试,以及prompt hub集成,使评估与版本管理集中在同一处。权衡:最深层的价值仅限于LangChain/LangGraph —— 使用其他框架的团队会得到一个能用但通用的追踪器,而非LangChain用户所体验到的一体化体验。
对于还在考虑是否要以LangChain为标准的团队,在锁定框架专属的可观测性技术栈之前,可参考GPT、Claude还是Gemini?如何选择合适的模型。
- LangChain和LangGraph自动追踪 —— 用这些框架构建的链路无需手动埋点
- 免费Developer层:1个席位,5,000条基础追踪/月,超出后按量计费
- Plus层:$39/席位/月,包含10,000条基础追踪/月,席位数不限
- 按量计费:基础方案之外另计$1.50/LCU(计算)和$1.00/LSU(存储)
- 内置LLM-as-judge评分的数据集驱动评估
- Enterprise:自托管或混合部署,定制SSO/RBAC,支持SLA
⚠️ 用量单位会累加
LCU和LSU费用叠加在$39/席位的基础费用之上 —— 链路较重或追踪量较高的团队,按量计费部分可能超过席位费用。在按团队规模承诺Plus之前,先从试点项目估算LCU/LSU消耗量。
Langfuse:免费自托管,无功能付费墙
Langfuse采用MIT协议,免费自托管且包含全部核心功能 —— 免费自托管版与付费云端层之间没有功能付费墙。Langfuse于2026年1月被ClickHouse, Inc.收购;产品保持开源和可自托管,Langfuse Cloud也照常运行。可通过自托管或云端Hobby层免费开始 —— 无需绑卡。
自托管(开源):免费、无限量、MIT协议,包含全部核心可观测性/评估/prompt管理功能。云端Hobby:免费,50,000单位/月,2个用户,数据保留30天。云端Core:$29/月,包含100,000单位/月,用户数不限,保留90天,每额外100,000单位$8。云端Pro:$199/月,包含100,000单位/月,用户数不限,数据保留3年,另有$300/月的Teams附加包提供SSO/RBAC。云端Enterprise:$2,499/月,专属支持工程师,审计日志,定制SLA。自托管Enterprise(单独定价,与ClickHouse商业方案捆绑)在免费自托管核心基础上增加管理API、项目级RBAC和服务端数据脱敏。
四款中框架集成最广:OpenAI SDK、LangChain、LlamaIndex、Haystack、LiteLLM、Vercel AI SDK、Ollama和Amazon Bedrock均有原生集成。评估深度可与LangSmith相媲美 —— 基于数据集、配合LLM-as-judge评分的评估以及回归数据集都很成熟,不是事后加装的日志附加功能。
权衡:自托管意味着你要自己承担正常运行时间、升级和基础设施成本 —— "免费"软件仍需要有人来运维。云端Hobby层2个用户的上限,对超出个人项目的场景来说比较紧张,一旦超过两人需要访问权限,团队往往很快就会被推向$29/月的Core层。
- 自托管,MIT协议,永久免费 —— 相对付费云端层没有功能差异
- 云端Hobby:免费,50,000单位/月,2个用户,保留30天
- 云端Core:$29/月,100,000单位/月,用户数不限,保留90天
- 云端Pro:$199/月,数据保留3年,用户数不限
- 集成最广:OpenAI SDK、LangChain、LlamaIndex、Haystack、LiteLLM、Vercel AI SDK、Ollama、Amazon Bedrock
- 被ClickHouse, Inc.收购(2026年1月);截至2026-08-27拥有33,800个GitHub星标
📌 你知道吗
Langfuse的自托管版本没有功能付费墙 —— $2,499/月的Enterprise云端方案所提供的评估与追踪能力,只要你愿意自己运维,就能在你掌控的基础设施上免费获得。
Helicone:一行代理配置,最快上手
Helicone是一个反向代理 —— 你把API基础URL指向Helicone并添加一个请求头,每次调用就会自动被记录,无需安装SDK封装。这是四款工具中接入现有代码库最快的方式,因为大多数团队本来就只有一处配置API基础URL的地方。可从免费的Hobby层开始 —— 前10,000请求/月无需绑卡。
Hobby(免费):10,000请求/月,1GB存储,保留7天,1个席位。Pro:$79/月,席位数不限,保留1个月,提供告警和报表、HQL查询语言。Team:$799/月,SOC-2和HIPAA合规,保留3个月,专属Slack频道。Enterprise:定制报价,支持本地部署、SAML SSO、定制MSA。
由于工作在代理层,Helicone与LangSmith或Langfuse的SDK集成方式不同,以另一种方式实现供应商无关 —— 只要是OpenAI兼容的端点即可使用,无需框架专属的适配器。评估和测试功能虽然存在,但比LangSmith或Langfuse的数据集驱动评分要轻量 —— Helicone的核心优势在于日志记录和成本可见性,而非评估深度。
- 基于代理:只需更换基础URL加一个请求头,无需SDK
- Hobby(免费):10,000请求/月,1GB存储,保留7天,1个席位
- Pro:$79/月,席位数不限,保留1个月
- Team:$799/月,SOC-2/HIPAA,保留3个月
- 适用于任何OpenAI兼容端点 —— 无需框架专属适配器
- 评估功能比LangSmith/Langfuse轻量 —— 日志记录和成本可见性是核心优势
💡 最快获得第一条追踪记录的路径
如果你的团队眼下只需要成本和延迟可见性,不想动除环境变量之外的应用代码,Helicone的代理式接入能比本页任何基于SDK的工具更快得到一条可用的追踪记录。
PromptLayer:精简日志工具
PromptLayer是四款中最精简的 —— 提供请求日志和prompt版本管理,不含完整评估框架,面向不需要数据集驱动评分的小团队。它直接封装OpenAI和Anthropic的SDK,而非作为代理或深度框架集成运作。可免费开始 —— 前2,500请求/月无需绑卡。
免费:5用户,2,500请求/月,10个prompt,1个工作区,250次评估单元执行/月。Pro:$49/月,Playground和工作区数量不限,超额$0.003/笔交易。Team:$500/月,25用户,100,000+请求/月,超额$0.002/笔交易,含Webhook。Enterprise:定制报价,RBAC,部署审批,配备BAA的HIPAA,以及PromptLayer提供的唯一自托管部署选项 —— 仅在Enterprise层可用,支持GCP、AWS和Azure。
权衡:Enterprise以下任何价位都没有自托管或开源层 —— 四款中唯一如此 —— 且其框架集成列表最薄弱(仅有OpenAI/Anthropic SDK封装,而非Langfuse提供的广泛原生集成列表)。最适合想要记录请求、管理prompt版本、又不想引入更重评估平台的小团队。
- 免费:5用户,2,500请求/月,10个prompt
- Pro:$49/月,超额$0.003/笔交易
- Team:$500/月,25用户,100,000+请求/月
- Enterprise以下无自托管/开源层 —— 四款中唯一如此
- 框架列表最薄弱:仅有OpenAI/Anthropic SDK封装
- Enterprise:可在GCP/AWS/Azure自托管,配备BAA的HIPAA,定制报价
PromptQuorum:追踪前先比较模型
在把LangSmith、Langfuse、Helicone或PromptLayer接入特定模型供应商的调用之前,先用PromptQuorum将一个prompt同时分发给25+模型,确认你首先选对了要追踪的供应商。提供免费层。
可观测性工具衡量的是你已经决定在生产环境运行的东西 —— 它们不会帮你选模型。PromptQuorum在你投入工程时间为某个模型接入生产追踪之前,先回答"哪个模型最能处理这个prompt?"
- 25+模型,包括GPT-5.6、Claude Opus 5、Gemini 3.1 Pro,以及通过Ollama和LM Studio运行的本地模型
- 9种内置prompt框架 —— TRACE、CO-STAR、CRAFT等
- 并排响应对比,配合共识评分
- 每个模型的token数 —— 在为某个供应商投入生产追踪成本之前先看清成本差异
- 免费层 —— 无需工程配置
正面对比:4款工具全面比较
没有哪款工具在所有标准上都领先。LangSmith对LangChain支持最深;Langfuse灵活性最高(免费自托管、集成最广);Helicone上手最快;PromptLayer在小规模场景下最精简、最便宜。
工具 | 接入方式 | 免费层 | 付费起点 | 自托管 |
|---|---|---|---|---|
| LangSmith | SDK / LangChain中自动 | 5,000条追踪,1席位 | $39/席位+按量 | 仅Enterprise |
| Langfuse | SDK,集成最广 | 50,000单位,2用户 | $29/月 Core | 免费(MIT),无限量 |
| Helicone | 代理,一个请求头 | 10,000请求,1席位 | $79/月 Pro | 仅Enterprise |
| PromptLayer | SDK封装 | 2,500请求,5用户 | $49/月 Pro | 仅Enterprise |
| PromptQuorum | Web应用,无需代码 | 模型比较+额度 | N/A | N/A |
📌 免费层的天花板
四款工具中有三款目前在免费层背后设置了真实的按量计费。"永久免费"的说法只在Langfuse的自托管版本上完全成立 —— 这里的每个云端免费层(LangSmith、Helicone、Langfuse Hobby)都有约5,000至50,000事件/月的真实上限。
谁该用哪款工具
根据你的框架、合规需求和团队规模来匹配工具 —— 而不是看纸面上哪款功能最多。
- 1基于LangChain或LangGraph构建的团队 → LangSmith
Why it matters: 追踪自动完成,无需手动埋点;评估和prompt hub集成在同一产品中。 - 2需要自托管或最慷慨免费层的团队 → Langfuse
Why it matters: MIT协议,自托管永久免费,四款中框架集成列表最广。 - 3想要成本可见性但几乎不改代码的团队 → Helicone
Why it matters: 代理式接入意味着只需修改基础URL和一个请求头,而非SDK迁移。 - 4只需要日志和prompt版本管理的小团队 → PromptLayer
Why it matters: 小规模场景下最精简、最便宜;如需数据集驱动评估请跳过。 - 5还在选择模型供应商的团队 → 先用PromptQuorum
Why it matters: 在为某个供应商投入生产追踪工程时间之前,先跨25+模型对prompt做基准测试。
哪些情况应跳过
如果你还没有任何LLM功能上线生产环境,请跳过这四款工具 —— 部署前测试与评估(Promptfoo、Braintrust、Vellum —— 参见Prompt测试与评估工具2026)解决的是上线前就存在的真实问题;可观测性工具解决的是你还没遇到的问题。在还没有需要追踪的生产流量之前就接入追踪,是白白浪费配置时间,而这里的免费层足够慷慨,等到真正有实时流量后再添加,也只需要一天的集成工作。
常见错误
❌ 在prompt尚未经过部署前测试时就添加生产追踪
Why it hurts: 你会得到一个从未系统评估过的prompt的干净追踪记录 —— 只能看到它运行了,看不出输出是否好。
Fix: 在把LangSmith、Langfuse、Helicone或PromptLayer接入生产流量之前,先构建评估数据集并通过Promptfoo或Braintrust运行。
❌ 在非LangChain技术栈中选择LangSmith
Why it hurts: 你会失去让LangSmith物有所值的自动追踪优势,最终还是得手动埋点一个通用SDK。
Fix: 如果你不在LangChain/LangGraph上,先评估Langfuse或Helicone —— 两者都能同样广泛地集成而不依赖该框架。
❌ 低估LangSmith Plus的LCU/LSU按量计费费用
Why it hurts: $39/席位的标价不包含计算和存储单元,在高流量或长链路工作负载下,这部分费用可能超过席位费用。
Fix: 在按团队规模承诺Plus之前,根据实际追踪量估算用量,或先从免费Developer层开始衡量真实消耗量。
❌ 自托管Langfuse却未预留运维成本
Why it hurts: "免费自托管"仍然需要有人负责升级、备份和正常运行时间 —— 有些团队把这当成零成本决策,结果被运维负担打了个措手不及。
Fix: 在假定自托管对团队更省钱之前,先比较自行运维Langfuse所需的工程工时与$29–$199/月的云端层费用。
❌ 为需要数据集驱动评估的团队选择PromptLayer
Why it hurts: PromptLayer的评估单元执行比完整评估框架轻量 —— 一旦团队需要LLM-as-judge评分或回归数据集,很快就会超出其能力范围。
Fix: 仅将PromptLayer用于日志记录和版本管理;如需真正的评估深度,可搭配Promptfoo(免费)使用,或直接迁移到LangSmith/Langfuse。
如何选择
- 1确认你有需要追踪的实时生产流量 —— 如果没有,先从部署前测试开始。
- 2检查你的主要框架:LangChain/LangGraph → LangSmith可获得自动追踪;其他情况 → Langfuse或Helicone。
- 3尽早确定自托管需求 —— 只有Langfuse提供真正免费、功能完整的自托管层。
- 4将月度事件量与每个免费层的真实上限(5,000–50,000事件)对比,不要假设"免费"能长期覆盖你的需求。
- 5先在首选工具的免费层用真实流量跑2–4周,再升级到付费方案。
- 6每90天重新评估一次 —— 四款工具的定价和层级上限在2026年都至少调整过一次。
💡 先免费开始,确认是否合适,再付费
四款工具都有可用的免费层。在为任何东西付费之前,先让真实生产流量跑几周 —— 仅凭免费层,通常就足以判断该工具的框架适配度和界面是否符合团队实际的工作方式。
常见问题
什么是LLM可观测性?
LLM可观测性是指在大语言模型API调用进入生产环境运行后,对其进行记录、追踪和监控的实践 —— 跟踪发送了什么、返回了什么、耗时多久以及花费多少。它回答的是"生产环境中发生了什么?"而不是"这个prompt好不好?",后者是部署前测试工具的职责。
Langfuse真的免费吗,还是只是试用?
Langfuse的自托管是真正永久免费的 —— 它采用MIT协议,免费自托管版与付费云端层之间没有功能付费墙。Langfuse Cloud也有一个免费的Hobby层(50,000单位/月,2个用户),这不是限时试用,只是有上限而非无限量。
如果我已经在用LangChain,应该选LangSmith还是Langfuse?
如果你在用LangChain或LangGraph,LangSmith能实现无需手动埋点的自动追踪,这是配置时间上的真实优势。Langfuse同样能原生集成LangChain,并额外提供免费自托管以及超越LangChain的更广泛集成列表 —— 如果追求与LangChain最紧密的体验就选LangSmith,如果希望以后添加其他框架或供应商时无需更换工具就选Langfuse。
典型小团队每月要为LLM可观测性支付多少?
5人团队使用Langfuse Core大约每月$29。同样的团队使用LangSmith Plus,在按量计费的LCU/LSU费用之外,仅席位费就从$195/月起(39美元×5)。使用Helicone,小团队可控制在$79/月的Pro层内。使用PromptLayer,5人团队在2,500请求/月以内可用免费层,超出后为Pro层$49/月。
如何用Langfuse搭建基础追踪?
创建一个免费的Langfuse Cloud项目(或用Docker自托管),安装Langfuse SDK或使用其原生集成之一(OpenAI SDK、LangChain、LlamaIndex、LiteLLM、Vercel AI SDK等),并将Langfuse的公开/私密API密钥添加为环境变量。经过埋点的调用产生的追踪记录会立即出现在Langfuse仪表盘中 —— 无需另外搭建数据接入管道。
PromptLayer和LangSmith或Langfuse是一回事吗?
不是。PromptLayer涵盖请求日志和prompt版本管理,不含完整的数据集驱动评估框架,且在Enterprise以下没有自托管层。LangSmith和Langfuse都在日志记录之上增加了成熟的评估功能(LLM-as-judge评分、回归数据集)。如果日志记录和版本管理真的就是你的全部需求,用PromptLayer;如果你还需要系统评估输出质量,用LangSmith或Langfuse。
可以同时使用这几款工具中的多个吗?
可以,不过成本和维护上的重叠很少值得。一种常见组合是用Langfuse或LangSmith做追踪加评估,再单独用Helicone为某个高流量端点提供代理层级的成本仪表盘。同时运行全部四款是冗余的 —— 为你的主要追踪和评估需求选一款即可。
自托管Langfuse会自动满足GDPR或HIPAA要求吗?
不会。自托管把数据保留在你控制的基础设施上,这有助于满足数据驻留要求,但GDPR和HIPAA合规还取决于你自己的访问控制、加密、审计日志和数据处理协议 —— 自托管对某些合规态势是必要条件,但本身并不充分。Langfuse的Pro云端层列出了HIPAA可用性以及SOC2/ISO27001报告,供更倾向合规就绪型托管方案的团队选择。
这四款工具有正在运营的联盟或推荐计划吗?
截至本文最后一次事实核查(2026-08-27),这四款工具都没有在自家网站上公布正在运营的公开佣金制联盟计划。LangChain运营着面向技术和服务集成的Partner Network,这是一种合作伙伴结构,而非按推荐计佣的计划。本文中的链接均为指向各供应商自有网站的纯产品链接,不涉及现有的联盟关系。
这些价格在全球都一样吗?
是的 —— 四款工具都是以美元计费的全球性SaaS订阅。LangSmith、Langfuse、Helicone和PromptLayer均未公布区域定价;欧盟、日本或巴西的团队支付的美元标价与美国团队相同,不过自己银行或支付机构的货币兑换和刷卡手续费可能会额外增加一小笔浮动金额。
来源
- LangSmith Pricing — LangChain —— 官方定价页面;Developer/Plus层上限、$39/席位以及$1.50/LCU + $1.00/LSU按量计费价格的依据
- Helicone Pricing —— 官方定价页面;Hobby/Pro/Team层上限和$79/$799月费的依据
- Langfuse Pricing —— 官方云端定价页面;Hobby/Core/Pro/Enterprise层上限和价格的依据
- Langfuse Self-Hosting Pricing —— 官方自托管页面;MIT协议、免费自托管核心和自托管Enterprise功能列表的依据
- PromptLayer Pricing —— 官方定价页面;Free/Pro/Team层上限以及Enterprise以下无自托管层的依据
- ClickHouse收购Langfuse — 官方公告 —— 2026年1月收购说法的依据
- Langfuse GitHub仓库 —— 33,800个GitHub星标和MIT协议的依据,于2026-08-27验证
- PromptQuorum — Multi-Model Dispatch —— 多模型比较工具;25+模型分发说法的依据
