Skip to main content
PromptQuorum
主页/本地LLM进阶/本地模型训练与运维工具对比(2026):微调与可观测性
Overview & Reference

本地模型训练与运维工具对比(2026):微调与可观测性

·阅读约7分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

PromptQuorum目录中的7款本地训练与运维工具分为两类,应分别比较:微调工具(4款)以及可观测性与评估工具(3款)。 在微调工具中,LLaMA-FactoryUnsloth在文档中说明支持LoRA或QLoRA训练;在可观测性工具中,LangfusePlano在文档中说明支持对LLM调用进行追踪。请使用下方的对比表,并在安装前阅读各工具自己的评测。

用于训练和运维本地语言模型的工具属于两类不同的产品——用于调整模型的微调工具,以及展示模型在实际使用中表现的可观测性与评估工具——没有哪一份统一的功能清单能公平地比较它们。本指南对比7款免费和免费增值工具,按类别逐一比较,所用对比表与各工具自己的PromptQuorum评测生成自同一份数据,因此表格与评测不会互相矛盾。

本页包含指向第三方产品的参考链接。PromptQuorum 未加入任何联盟计划——这些是不产生佣金的普通链接。点击链接和后续步骤由您自行承担责任。这些链接不代表 PromptQuorum 的任何认可或验证。

关键要点

  • 7款工具,两个类别:微调(4款)以及可观测性与评估(3款)。身兼多职的工具会出现在它所属的每个类别中。
  • 表格生成自各工具的记录,并对照其官方README或网站核对;短横线表示"文档中未说明",绝不表示"没有"。
  • 这是一个很小的群组:目录中尚无已评测的数据集和模型中心子类别工具,因此这里不对它们进行比较。
  • 表格中的每个工具名称都链接到其自己的PromptQuorum评测,安装步骤和局限都在评测中介绍。

📍 简单一句话

本地训练与运维工具属于两类不同的产品——微调工具以及可观测性与评估工具——因此PromptQuorum目录中的7款工具在各自类别内进行比较,所用表格与各工具自己的评测生成自同一份工具数据。

💬 简单来说

有些工具通过用你的数据进行微调来教会模型新的行为,另一些工具则观察模型应用的表现并为其回答打分。用同一组功能去比较训练工具和监控面板没有意义,所以本指南只比较同类工具。

我们如何比较

每款工具的事实信息——价格、许可证、平台、硬件需求以及类别专属属性——都只在该工具的目录记录中存储一次。下方的对比表生成自这些记录,而该工具自己的评测也采用同一份记录,因此两者不会给出不同的数值。

类别专属属性(例如LoRA与QLoRA支持或追踪)取自各项目的官方README或网站,并对照其中的确切措辞核对。文档没有提及的地方,表格显示短横线而不是猜测;若某项声明带有限定条件(仅在路线图中、企业版,或需要单独的软件包),则该属性不列入表格,而在该工具的评测中说明。

表格中只包含拥有自己PromptQuorum评测的工具。本对比不对工具排名,因为合适的选择取决于你的具体约束。

对比表

请在下方选择一个工具类别,然后横向阅读每一行。点击工具名称即可打开其完整的PromptQuorum评测。

工具价格许可证平台运行方式硬件版本LoRA / QLoRAWeb UI多GPU训练低显存(VRAM)模式导出为 GGUF / Ollama评测产品链接 · 已披露
LLaMA-Factory免费Apache-2.0macOS, Windows, Linux本地16 GB显存v0.9.5阅读评测LLaMA-Factory
LoRAX免费Apache-2.0Linux本地因模型而异v0.12.1阅读评测LoRAX
Second Me免费Apache-2.0macOS, Windows, Linux本地因模型而异阅读评测Second Me
Unsloth免费Apache-2.0macOS, Windows, Linux本地因模型而异阅读评测Unsloth

“—”表示该项目自己的文档未说明,并不代表该功能不存在。数值取自各项目的官方README或网站,并在更新该工具评测时重新核对。

微调工具:差异所在

  • LoRA与QLoRA。 LLaMA-FactoryUnsloth在文档中说明支持LoRA或QLoRA微调。
  • Web界面。 LLaMA-FactoryUnsloth在文档中说明提供用于训练的Web界面。
  • 多GPU训练。 LLaMA-FactoryUnsloth在文档中说明支持多GPU训练。
  • 低显存训练。 LLaMA-FactoryUnsloth在文档中说明提供低显存或节省内存的模式。
  • 导出为GGUF或Ollama。 LLaMA-FactoryUnsloth在文档中说明支持将模型导出为GGUF或Ollama。
  • 信息稀少的行。 LoRAXSecond Me因其与微调相关的功能而出现在这里,但它们的文档没有说明所比较的任何属性,因此它们的单元格为短横线;请参阅它们的评测。

可观测性与评估:差异所在

  • 追踪。 LangfusePlano在文档中说明支持对LLM调用进行追踪。
  • 评估。 Langfuse在文档中说明支持评估或打分。
  • 提示词管理。 Langfuse在文档中说明支持提示词管理。
  • OpenTelemetry。 Plano在文档中说明支持OpenTelemetry。
  • Docker与自托管。 LangfuseMission Control在文档中说明支持Docker或自托管部署。
  • 本地LLM。 Langfuse在文档中说明可与本地或自托管的LLM配合使用。

本对比无法告诉你的事

  • 它比较的是文档中说明的功能,而不是实际结果。它无法说明微调后的模型质量如何、训练在你的硬件上跑得多快,或评估分数有多准确——PromptQuorum没有对所列工具测量过这些。
  • 短横线表示我们查阅的文档存在空白,并不是否定性的结论。有些工具可能支持某项功能,只是其README没有提及。
  • 微调所需的硬件在很大程度上取决于模型和设置;在开始训练之前,请阅读该工具的评测,了解切合实际的需求。
  • 工具更新很快。每款工具的评测都会注明其所核对的版本,当评测更新时,本指南也会随之更新。

常见问题

微调工具和可观测性工具有什么区别?

微调工具通过用你的数据训练来调整模型,通常采用LoRA或QLoRA等参数高效的方法。可观测性或评估工具则记录并评价LLM应用在实际使用中的表现,例如追踪每一次请求。它们承担不同的工作,因此分开比较。

对比表中的短横线是什么意思?

它表示该项目自己的文档没有说明该属性。并不表示缺少该功能;请查看该工具的评测或其代码仓库。

为什么这里的工具这么少?

目前目录中这一领域已评测的工具还很少,数据集和模型中心方面尚无。本对比涵盖已评测的工具;随着更多评测的完成,会陆续加入更多工具。

这些工具有联盟推广链接吗?

没有。截至本文撰写时,PromptQuorum与本对比中的任何工具都没有联盟推广关系,这里的任何链接都不会带来佣金。

这份对比多久更新一次?

每年更新两次,并且每当所列工具的评测有更新时也会更新,因为表格与这些评测生成自同一份数据。

资料来源

  • 各工具的官方README或网站,列在该工具的PromptQuorum评测中(可从对比表链接进入)。
  • PromptQuorum本地AI应用目录——表格每一行所依据的记录。

← 返回 本地LLM进阶