Skip to main content
PromptQuorum
主页/本地LLM/2026 年最佳 LLM 微调框架:Unsloth、Axolotl 还是云端
Tools & Interfaces

2026 年最佳 LLM 微调框架:Unsloth、Axolotl 还是云端

·阅读时长 13 分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

本页包含指向第三方产品的参考链接。PromptQuorum 未加入任何联盟计划——这些是不产生佣金的普通链接。点击链接和后续步骤由您自行承担责任。这些链接不代表 PromptQuorum 的任何认可或验证。

2026 年,对多数开发者而言最好的微调框架是 Unsloth:这套 Apache-2.0 库免费,如今已覆盖多卡配置以及 NVIDIA、AMD、Intel、CPU 与 Vulkan 后端,可在 Windows、Linux、WSL 与 macOS 上运行,并提供桌面应用。当一台机器不够用时,Axolotl 是更好的选择,因为三者中只有它具备多节点训练与 ND 并行,对齐方法的覆盖面也最广。MLX-LM 是 Apple Silicon 上最轻量的选项,直接构建在苹果的 MLX 之上。如果你根本不想自己跑训练任务,Together.ai 对 16B 以内模型的 LoRA 收费为每百万训练 token 0.48 美元,每个任务最低 4 美元。

关键要点

  • Unsloth — GitHub 星标 7.50 万,Apache-2.0。其 README 声明支持多卡配置,以及 NVIDIA、AMD 与 Intel 的 GPU、CPU 和 Vulkan 后端,运行于 Windows、Linux、WSL 与 macOS,并提供桌面版。在这个开源项目里,多卡并未被置于付费墙之后。
  • Axolotl — 星标 1.24 万,Apache-2.0。三者中唯一记录了多节点训练(Torchrun、Ray)以及在单节点内与跨多节点组合上下文并行、张量并行和完全分片数据并行的 ND 并行。
  • MLX-LM — 星标 0.68 万,MIT,来自苹果的 `ml-explore` 组织,该组织自己的简介写着「by Apple」。支持 LoRA 与全参数微调、量化模型,以及通过 `mx.distributed` 进行的分布式推理与微调。
  • Together.ai — 有监督 LoRA 微调在 16B 参数以内为每百万训练 token 0.48 美元,17–69B 为 1.50 美元,70–100B 为 2.90 美元。全参数有监督微调贵得多:同样这三档分别为 1.20、3.75 与 7.25 美元。每个任务适用 4.00 美元最低消费。
  • Fireworks.ai — LoRA SFT 从 16B 以内每百万 token 0.50 美元起,超过 300B 升至 10.00 美元;最高档的全参数 DPO 达到每百万 40.00 美元。其定价页写得很直白:「Serve fine-tuned models for the same price as base models。」
  • Predibase 已不再是独立产品。 Rubrik 于 2025 年 6 月 25 日宣布收购,截至 2026 年 8 月 28 日,predibase.com 会返回一个指向 Rubrik Agent Cloud 页面的 HTTP 301 重定向。不要把读者送往一个已不存在的注册入口。
  • 截至 2026 年 8 月,我们没有找到 Together.ai 或 Fireworks.ai 的任何公开联盟或推荐计划,两者也都未出现在主要的 AI 联盟计划盘点中。本页所有链接均无报酬。

🏆 按场景选择

真正的分野在于你自己跑训练任务,还是付钱让别人跑。 按顺序往下读,在第一条符合你情况的地方停下。

  • 你有一块够用的 GPU,想要通往可用微调的最短路径 → Unsloth。免费、Apache-2.0,如今还支持多卡与非 NVIDIA 硬件,过去让人转投他处的理由基本已经消失。
  • 你的训练任务装不下一台机器了 → Axolotl。通过 Torchrun 与 Ray 的多节点加上 ND 并行,才是 2026 年它与 Unsloth 之间真正的分界线。
  • 你在用 M 系列芯片的 Mac → 若想要最轻量、原生于 MLX 的路径,选 MLX-LM;不过 Unsloth 现在也能在 macOS 上运行,所以这已是偏好问题,而非唯一选项。
  • 你需要 DPO、ORPO、KTO、GRPO 或奖励建模 → Axolotl。它记录在案的方法覆盖面明显是三者中最广的。
  • 你没有 GPU 也不想租 → 想要透明的 token 计价就选 Together.ai;若之后要部署微调后的模型且不想要托管附加费,就选 Fireworks.ai。
Together.ai — 查看微调价格产品链接 · 已披露Fireworks.ai — 查看微调价格产品链接 · 已披露

本地微调还是云端微调

如果你已经有一块够用的 GPU 并打算反复迭代,就在本地微调;如果没有硬件,或者微调频率低到按任务计费比你自己的配置时间更划算,就用云 API。 这个问题排在「选哪个框架」之前,因为它决定本页哪一半与你相关。

诚实的权衡是:本地训练按次算便宜,按你的注意力小时算昂贵,而云 API 恰好相反。每季度微调一次的人,确实会因为不必在晚上十一点排查驱动不兼容而获益。每周迭代两次同一数据集的人,会很快看到 token 计费超过硬件成本。

📍 简单一句话

当你拥有一块够用的 GPU 且频繁迭代时在本地微调,而当你没有硬件、或训练频率低到按任务计费比自己的配置时间更便宜时,使用云端微调 API。

💬 简单来说

拥有硬件让每次运行几乎免费,但要付出配置的代价。租用服务每次运行花几美元,但几分钟就能开始。哪个更便宜,完全取决于你训练的频率。

  • 在本地训练,如果你有 RTX 3090/4090 级别或更好的显卡,每周在同一数据集上迭代,或者出于隐私与知识产权原因训练数据不能离开你的机器。
  • 使用云 API,如果你没有 GPU,需要即便 4 位量化也装不下的更大模型,或者希望训练时一并获得托管服务。
  • 两者都可以,如果你每月微调一次 7B 模型:在这个节奏下成本差异足够小,让便利性来决定就好。

三个本地框架对比

Unsloth、Axolotl 与 MLX-LM 是 2026 年值得使用的三个本地微调框架,而它们之间的界线已经移动。 Unsloth 曾是单卡 CUDA 的选项,如今覆盖面最广;Axolotl 的主张是分布式训练的深度,而不只是多卡;MLX-LM 在 Apple Silicon 上仍最轻量,但已不再是 Mac 上的唯一选择。三者都免费开源,而且都不要求你的训练数据离开本地。

星标与许可证读取自 2026 年 8 月 28 日的 GitHub API。能力方面的表述来自各项目自己的 README。

评估维度UnslothAxolotlMLX-LM
GitHub 星标7.50 万1.24 万0.68 万
许可证Apache-2.0Apache-2.0MIT
最适合自有硬件上最快的路径扩展到单机之外Mac 上原生于 MLX 的轻量工作
多卡支持,在开源项目中支持 — FSDP1、FSDP2、DeepSpeed通过 mx.distributed
多节点README 未记录支持 — Torchrun 与 Ray通过 mx.distributed
硬件NVIDIA、AMD、Intel、CPU、Vulkan以 CUDA 技术栈为主仅 Apple Silicon
操作系统Windows、Linux、WSL、macOS实际上是 Linux 与 WSLmacOS
安装难度低 — 安装器与桌面版中 — 由 YAML 配置驱动低 — pip install

📌Note: 较早的对比文章,包括本页据以重写的那份草稿,把多卡描述成 Unsloth 的付费功能,把 MLX-LM 说成社区项目而非苹果项目。这两点都与当前的 README 和组织简介相矛盾。若你在别处读到这些说法,请先看日期。

Unsloth:本地的默认之选

大多数人应该从 Unsloth 开始,而且理由是变多了而不是变少了。 它的星标在三者中遥遥领先,许可证是 Apache-2.0,硬件与操作系统的覆盖面如今也是这里最广的。

1

Unsloth — 综合最佳本地框架

Apache-2.0 免费,含多卡支持,可在 NVIDIA、AMD、Intel、CPU 与 macOS 上运行

Unsloth 重写了注意力与梯度内核以降低显存占用、加速 LoRA 与 QLoRA 训练,这仍是它的核心吸引力。变化的是覆盖面。其 README 现在声明支持跨 NVIDIA、AMD 与 Intel GPU、CPU 以及 Vulkan 后端的多卡配置,可运行于 Windows、Linux、WSL 与 macOS,并为每个系统提供桌面版。这份 22 KB 的 Apache-2.0 README 里没有任何内容把上述能力锁在付费档之后。该项目也已从一个训练库扩展成更接近本地工作台的东西,带有 Studio 界面和兼容 OpenAI 的服务端点。付费的 Pro 与 Enterprise 档位确实存在,但价格未公开,因此你在别处看到的任何具体金额都应视为未经核实。

优点

  • +免费且采用 Apache-2.0,开源项目中即包含多卡支持
  • +这里最广的硬件覆盖:NVIDIA、AMD、Intel、CPU 与 Vulkan
  • +可运行于 Windows、Linux、WSL 与 macOS,并有桌面版
  • +三者中安装成本最低——是一个安装器而不是一棵配置树

缺点

  • README 未记录多节点训练,这一点 Axolotl 更清晰
  • Pro 与 Enterprise 价格未公开,编列预算需要联系销售
  • 功能范围扩大意味着,对只想要一个训练库的团队来说负担偏重
Unsloth — 开源仓库产品链接 · 已披露

Axolotl:扩展规模之选

Axolotl 靠分布式训练与方法广度立足,而不是靠多卡本身。 既然 Unsloth 已能覆盖同一台机器里的多块 GPU,诚实的分界线就落在一台机器不够用之后会发生什么。

1

Axolotl — 超越单机的最佳选择

通过 Torchrun 与 Ray 实现多节点、ND 并行,以及最广的方法覆盖面

Axolotl 由配置文件驱动,而当一次训练必须在集群上可复现、而不是从笔记本里重新拼凑出来时,这正是你想要的。其 README 记录了通过 FSDP1、FSDP2 与 DeepSpeed 的多卡训练,通过 Torchrun 与 Ray 的多节点训练,以及在单节点内和跨多节点组合上下文并行、张量并行与完全分片数据并行的 ND 并行。用于分布式专家混合训练的专家并行同样具备。训练方法清单在三者中明显最广:全参数微调、LoRA、QLoRA、GPTQ、量化感知训练、FP8 混合精度、使用 DPO、IPO、KTO 与 ORPO 的偏好调优、使用 GRPO 与 GDPO 的强化学习,以及奖励建模与过程奖励建模。

优点

  • +通过 Torchrun 与 Ray 记录在案的多节点训练
  • +ND 并行组合上下文、张量与分片数据并行
  • +最广的方法覆盖面:DPO、IPO、KTO、ORPO、GRPO、GDPO 与奖励建模
  • +配置驱动的运行可复现、可评审,这对团队很重要

缺点

  • 学习曲线更陡——首次成功之前要预留实打实的读文档时间
  • 实际上以 CUDA 为中心,因此在 AMD、Intel 或苹果硬件上并非答案
  • 对独自微调一个 7B 模型的人来说,机制过于繁重
Axolotl — 开源仓库产品链接 · 已披露

MLX-LM:Apple Silicon 之选

MLX-LM 是在 M 系列 Mac 上微调最轻量的方式,直接构建在苹果的 MLX 数组框架之上,而不是移植过去的。 有必要说清楚它究竟是什么:维护它的 `ml-explore` 组织自称「by Apple」,所以这是苹果自己的机器学习工作,而不是无关联的社区移植。

1

MLX-LM — Apple Silicon 上最佳的轻量选项

MIT 许可,集成 Hugging Face Hub,通过 mx.distributed 分布式训练

MLX-LM 是一个 Python 包,用于在 Apple Silicon 上借助 MLX 生成文本并微调语言模型。它集成 Hugging Face Hub,使数千个模型只需一条命令即可取用,支持量化模型并上传回 Hub,同时处理低秩微调与全模型微调,包括在量化模型上进行。它还通过 `mx.distributed` 支持分布式推理与微调,这意味着「它严格来说只是单机工具」的常见说法已经过时。它不是跨平台的:依赖 MLX 与 Apple Silicon 的统一内存,因此在 Windows 或 Linux 上根本不在候选之列。

优点

  • +原生构建于 MLX 与 Apple Silicon 统一内存之上,而非移植
  • +MIT 许可,是三者中最宽松的
  • +通过 mx.distributed 进行分布式推理与微调
  • +集成 Hugging Face Hub,可拉取也可发布模型

缺点

  • 仅限 Apple Silicon——在 Windows 或 Linux 上不是选项
  • 以 0.68 万星标计是三者中社区最小的,可参考的完整示例较少
  • 自 Unsloth 提供 macOS 版本后,它已不再是 Mac 上的唯一选择
MLX-LM — 开源仓库产品链接 · 已披露

云平台与真实价格

Together.ai 与 Fireworks.ai 都按训练 token 而非 GPU 小时计费,因此一次任务的成本在开始前就能估算。 下列价格于 2026 年 8 月 28 日读取自各厂商公开的定价页。请留意 LoRA 与全参数微调之间的差距,绝大多数成本意外都源于此。

档位与方法Together.aiFireworks.ai
LoRA SFT,16B 以内0.48 美元 / 100 万 token0.50 美元 / 100 万 token
全参数 SFT,16B 以内1.20 美元 / 100 万 token1.00 美元 / 100 万 token
LoRA SFT,中档1.50 美元(17–69B)3.00 美元(16.1–80B)
LoRA SFT,大档2.90 美元(70–100B)6.00 美元(80–300B)
全参数 SFT,大档7.25 美元(70–100B)12.00 美元(80–300B)
公开价格上限全参数 DPO 8.00 美元,70–100B全参数 DPO 40.00 美元,300B 以上
每任务最低消费4.00 美元未公开
部署微调后的模型作为推理另行计费与基础模型同价

若看重最清晰的公开档位结构与更低的入门价,选 Together.ai。若之后要部署该模型,选 Fireworks.ai,因为它明确声明按基础模型价格提供微调后模型的服务。

⚠️Warning: 一个被广泛转抄的数字把 Together.ai 的全参数微调描述为每百万 token 0.54 至 3.20 美元。那其实是它的 LoRA DPO 区间。全参数有监督微调在同样的参数档位上为 1.20 至 7.25 美元,比被误引的上限高出一倍多。请照厂商页面编列预算,而不是照对比文章。

Predibase 后来怎么了

Predibase 已不再是一个独立的自助式微调平台,任何仍把你送去那里注册的指南都已过时。 Rubrik 于 2025 年 6 月 25 日宣布收购,当时由 TechCrunch 与 CNBC 报道,并经 Rubrik 自己的新闻室确认。

截至 2026 年 8 月 28 日,请求 predibase.com 会返回一个指向 Rubrik Agent Cloud 产品页的 HTTP 301 永久重定向。我们无法直接读取该目标页面——它对自动化请求返回 HTTP 403——因此本页不对其当前提供的内容作任何断言。可核实的是重定向本身,以及其背后的收购。如果你需要 Predibase 式的托管微调服务,请向 Rubrik 询问还剩下什么,而不要假定旧的注册流程仍然可用。

💡Tip: 这对任何云平台对比都是一个有用的提醒:一年半前还是稳妥推荐的产品,今天可能已是死链。请在每次更新时重新核实厂商状态,而不是凭记忆把推荐一路沿用下去。

微调一个 7B 实际要花多少

一次现实的指令微调在云端比多数人预期的更便宜,在本地则几乎免费,因此通常是配置时间而非算力在做决定。 取 10,000 条平均 300 token 的样本:即 300 万训练 token,三个 epoch 约处理 900 万 token。下表是按上面公开价格所做的算术。

路径所用费率900 万 token 的成本
Together.ai,LoRA SFT每百万 0.48 美元,16B 以内4.32 美元,因此 4 美元最低消费不起作用
Together.ai,全参数 SFT每百万 1.20 美元,16B 以内10.80 美元
Fireworks.ai,LoRA SFT每百万 0.50 美元,16B 以内4.50 美元
Fireworks.ai,全参数 SFT每百万 1.00 美元,16B 以内9.00 美元
租用的 24GB GPU按小时租用,因供应商而异算力常不足一小时,另加配置时间
你已拥有的 GPU仅边际电费每次运行实际为零

在你已经拥有的硬件上,除第一次之外每次运行本地都更划算。对于租用硬件的偶尔运行,请拿租金加配置时间,与你实际数据集规模对应的固定 token 价格作比较。

💡Tip: 这里的云端金额小到,对一次性实验而言决定因素几乎从来不是钱,而是你更愿意花一个晚上配置环境,还是花五美元。老老实实把自己的时间算进去,答案通常就清楚了。

谁该用哪一个

决定因素是你训练的频率以及是否拥有硬件,而不是星标数量。 四类情形覆盖了大多数读者。

  • 只做一次实验的爱好者 → Together.ai 以完全跳过基础设施,或在租用的 GPU 上使用 Unsloth。不要为一次实验购买硬件。
  • 每周迭代的机器学习工程师 → 自有硬件上的 Unsloth。高频迭代下 token 计费累积很快,而 Unsloth 现在无需付费档即可支持多卡。
  • 跨多台机器训练的团队 → Axolotl,因为多节点与 ND 并行,也因为配置驱动的运行具备笔记本所没有的可复现性与可评审性。
  • 把微调模型推向生产的初创公司 → 若最看重服务经济性就选 Fireworks.ai,因为微调后模型按基础模型价格提供服务;若更喜欢更清晰的档位结构就选 Together.ai。另见在生产环境中运行本地 LLM

欧盟、日本与中国的微调实践

微调会把你的训练数据上传给执行任务的一方。因此在三个主要市场,本地与云端之间的选择是数据治理决策,而不只是成本比较。

选择微调技术栈时的常见错误

  1. 1
    以为多卡需要 Unsloth 的付费档
    Why it matters: 这个说法流传很广,却与该项目当前的 README 相矛盾:README 把多卡支持与 AMD、Intel、CPU 和 Vulkan 后端并列,而 Apache-2.0 仓库中任何地方都没有付费墙。有团队仅仅为了获得自己早已具备的多卡能力,就引入了更重的框架。
  2. 2
    把 Together.ai 的全参数微调引作每百万 token 0.54 至 3.20 美元
    Why it matters: 该区间对应的是 LoRA DPO,而非全参数有监督微调;后者在同样档位上实际为 1.20 至 7.25 美元。基于错误行编列的预算,会把一次大规模全参数微调低估一半以上。
  3. 3
    把读者送往 Predibase
    Why it matters: Rubrik 已于 2025 年 6 月收购它,predibase.com 现在以 301 跳转离开。任何仍在描述 Predibase 自助注册流程的指南,自收购以来都没有重新核实过。
  4. 4
    把 MLX-LM 当作非官方社区项目
    Why it matters: `ml-explore` 组织将自身工作描述为「by Apple」。把它当成社区移植而排除,等于用一个并不存在的维护风险否定了它。
  5. 5
    在检索才是答案时去做微调
    Why it matters: 微调教的是格式、语气与狭窄技能。用它注入会变化的事实既低效又昂贵,因为每次更新都意味着重新训练。事实属于检索管线——参见[基于自有文档的本地 RAG](/zh/local-llms/local-rag-2026)。

什么情况下不必微调

如果你的抱怨是模型不了解公司的文档,那么微调就是错误的工具,而你要花掉一个训练周期才会发现这一点。 那是检索问题。构建良好的 RAG 管线依据你今天下午就能更新的文档作答,而微调则把这些内容烘进权重,要更正就得重新训练。

微调值得做,是在你需要稳定的输出格式、特定语气,或提示无法可靠产生的某项狭窄技能时。这些都是行为层面的改变,而行为正是训练能够很好改变的东西。先试结构化的系统提示,再试检索,只有当两者在你真正需要的那件事上明显失败时,才动用训练。

💡Tip: 一个实用判据:如果你能写下正确答案并把它粘进提示里,那你面对的是检索或提示问题。如果你只能描述一个好答案的形态却写不出其内容,那才是微调问题。

常见问题

2026 年最好的 LLM 微调框架是哪个?

对多数在自有硬件上训练的人来说是 Unsloth,因为这套 Apache-2.0 库免费,且已覆盖 Windows、Linux、WSL 与 macOS 上跨 NVIDIA、AMD、Intel、CPU 与 Vulkan 的多卡配置。当训练跨越多台机器时 Axolotl 更合适,因为它记录了多节点训练与 ND 并行。MLX-LM 则是 Apple Silicon 上最轻量的选项。

Unsloth 免费吗,免费版支持多卡吗?

Unsloth 库在 Apache-2.0 下免费,其 README 列出了多卡支持,仓库中没有付费墙。付费的 Pro 与 Enterprise 档位确实存在,但价格未公开,因此别处引用的任何具体金额都应视为未经核实。「多卡需要付费档」这一常见说法与该项目当前文档相矛盾。

云端微调每百万 token 要多少钱?

在 Together.ai,有监督 LoRA 微调在 16B 参数以内为每百万训练 token 0.48 美元,17 至 69B 为 1.50 美元,70 至 100B 为 2.90 美元,每任务最低 4.00 美元。全参数有监督微调在这些档位上分别为 1.20、3.75 与 7.25 美元。在 Fireworks.ai,LoRA SFT 从 16B 以内每百万 token 0.50 美元起,300B 以上升至 10.00 美元。

我能在 Windows 或 Linux 上用 MLX-LM 吗?

不能。MLX-LM 构建在苹果的 MLX 框架与 Apple Silicon 的统一内存之上,因此在其他平台上不在候选之列。请在 Windows 或 Linux 上使用 Unsloth 或 Axolotl。请注意 Unsloth 现在也提供 macOS 版本,所以在 Mac 上你确实可以在两者之间选择。

Predibase 后来怎么了?

Rubrik 于 2025 年 6 月 25 日宣布收购 Predibase。截至 2026 年 8 月 28 日,predibase.com 返回指向 Rubrik Agent Cloud 页面的 HTTP 301 重定向,而不是提供独立产品。在新项目中依赖它之前,请直接向 Rubrik 确认当前可用性。

Together.ai 或 Fireworks.ai 有联盟计划吗?

截至 2026 年 8 月,我们没有为两者找到任何公开的联盟或推荐计划,两者也都未出现在主要盘点中。它们的合作伙伴页面描述的是企业集成,而不是面向创作者的推荐机制。PromptQuorum 不会从本页链接中获得任何收入。

云端微调一定比本地贵吗?

这取决于你训练的频率。对小数据集上的一次性运行,云端费用只有几美元,通常低于你花一个晚上配置环境的价值。对已有硬件上的高频迭代,除第一次外每次运行本地都更便宜,因为边际算力成本接近于零。

微调 7B 模型需要多卡吗?

通常不需要。一块 24GB 级别的显卡配合 QLoRA 就能从容处理 7B 模型。多卡在更大的模型或不使用 LoRA 的全参数微调中更重要。显存规模请参见硬件需求指南

最终结论

  • 选 Unsloth,如果你在自有硬件上训练并想要通往可用运行的最短路径——下一步:装上它,先跑通一次 QLoRA 微调,再去评估更重的方案。
  • 选 Axolotl,如果你的训练必须跨越多台机器,或你需要 DPO、ORPO、KTO、GRPO 或奖励建模——下一步:在投入之前先读多节点文档,因为配置系统才是真正的入门成本。
  • 选 MLX-LM,如果你在 Apple Silicon 上工作并想要通往 MLX 最直接的路径——下一步:与 Unsloth 的 macOS 版本作比较,而不要假定它是唯一选择。
  • 选 Together.ai 或 Fireworks.ai,如果你宁可不拥有 GPU——下一步:拿你真实的数据集对照公开的 token 档位测算,若要做全参数微调请用全参数那一行,而不是 LoRA DPO 那一行。
  • 跳过微调,如果模型只是不了解你的文档——下一步:改为构建检索管线,无需重新训练即可更正。

来源

关于第三方事实的说明

本文引用了第三方AI模型、基准测试、价格和许可证。AI领域变化迅速。基准分数、许可条款、模型名称和API价格可能在写作时间和您阅读时之间发生变化。在根据本文做出部署或合规决策之前,请在每个提供商的官方来源核实当前数据:Hugging Face模型卡用于许可证和基准测试,提供商网站用于API定价,EUR-Lex用于当前GDPR和EU AI法案文本。

使用本地LLM、您自己的API密钥或两者运行PromptQuorum — 您来决定使用哪个后端。

下载 PromptQuorum 测试版 →

← 返回本地LLM