Chatterbox 是 Resemble AI 于 2025 年 5 月以 MIT 许可发布的免费开源语音克隆模型。它能从一段短参考音频克隆声音,在你自己的硬件上运行,并提供可调节的"exaggeration"旋钮来控制情感强度——这是大多数云端 TTS 平台不会直接开放的功能。2025 年 9 月推出了支持 23 种语言的多语言版本。
ElevenLabs 是一个托管语音平台。其现有套餐将文本转语音、语音克隆及其他语音/媒体功能整合在共享使用积分之下。免费套餐标注为每月 10,000 积分;付费套餐增加商业许可权限和更高额度。请在依赖任何数字之前查看实时定价页面,因为服务商会在不通知的情况下变更套餐和积分额度。
这里的问题不是"哪个声音更好听"——两者都可以做到令人信服。真正的问题是:你想要一个自己安装、运行并负责的免费模型,还是想用持续付费和使用限额来换取由服务商承担基础设施工作的付费服务?
我们的结论
🏆 今天就想省心获得专业效果的最佳选择: ElevenLabs——无需安装,音色精选,付费套餐含商业许可。 💰 最佳免费自托管选择: Chatterbox——MIT 许可,一旦运行起来无持续费用。 🎭 最佳情感强度控制选择: Chatterbox——其 exaggeration 调节功能在 ElevenLabs 中没有直接对应项。 🔒 最佳离线/隔离网络语音克隆选择: Chatterbox——模型下载后推理可留在你自己的硬件上。 ⚡ 最佳一周内零搭建获得配音的选择: ElevenLabs。 🧑💻 最适合想检查、调整或自托管模型的开发者: Chatterbox。
对于大多数今天就需要结果、又不想管理 GPU 的创作者而言,ElevenLabs 是更快的路径。对于想要免费、可控、自托管模型,且能接受 GPU 和 Python 环境的开发者和团队而言,Chatterbox 是更有意思的选择。
选择你的语音克隆方式
以下情况使用本地LLM:
- •你想要一个可以检查、修改且无需订阅的免费 MIT 许可模型。
- •你需要离线或隔离网络的语音克隆,并能提供 GPU 以获得实时速度。
- •你希望直接控制情感/exaggeration 参数,而不是由平台管理的设置。
以下情况使用云端模型:
- •你想今天就获得一个成熟的语音克隆效果,无需安装、无需 GPU、无需管理依赖。
- •你需要精选的托管音色、浏览器/API 工作流程,以及由服务商处理的商业许可条款。
- •你正在制作有发布截止日期的客户项目或内容。
快速决策:
- →一周内零搭建获得配音:ElevenLabs 胜出。
- →想要一个免费、自托管、GPU 加速且由你掌控的模型:Chatterbox 胜出。
- →情感强度控制:两者中只有 Chatterbox 直接开放了该功能。
关键要点
- Chatterbox 是 Resemble AI 推出的免费 MIT 许可语音克隆模型,基于 Llama 式架构,约 5 亿参数,2025 年 5 月发布;2025 年 9 月推出支持 23 种语言的多语言版本。
- ElevenLabs 是付费托管云平台:Free(每月 10,000 积分)、Starter 每月 6 美元、Creator 每月 22 美元、Pro 每月 99 美元、Scale 每月 299 美元、Business 每月 990 美元——请以实时定价页面上的当前数据为准。
- Resemble AI 报告称,在其通过 Podonos 进行的自有评测中,63.75% 的盲测评审员更青睐 Chatterbox 而非 ElevenLabs 的输出——这是厂商 Resemble AI 自己发布的说法,不是独立测试或 PromptQuorum 验证的结果,应当据此解读。
- Chatterbox 能从一段短参考音频克隆声音,并提供"exaggeration"控制情感强度;实时生成建议使用 GPU,每段输出都嵌有不可听见的 PerTh 水印。
- ElevenLabs 无需本地硬件或搭建,付费套餐提供精选音色和商业许可条款,并通过自有云基础设施处理请求。
- 两款工具都能从一段短音频克隆声音——切勿在未获得明确许可和适当保护措施的情况下克隆、模仿或部署真实人物的声音。
一览表
场景 | 更佳选择 | 原因 |
|---|---|---|
| 你今天就需要一个克隆配音,且不想搭建环境 | ElevenLabs | 无需安装、无需 GPU、无需下载模型——创建账号即可生成。 |
| 你想要一个免费的自托管语音克隆模型 | Chatterbox | MIT 许可,无需订阅,在你掌控的硬件上运行。 |
| 你需要离线或隔离网络的语音克隆 | Chatterbox | 模型下载后推理可以留在你自己的设备上。 |
| 你需要精选音色以及处理好的商业许可 | ElevenLabs | 付费套餐已含商业许可权限;你无需自行审查模型条款。 |
| 你想直接控制输出的情感强度 | Chatterbox | exaggeration 参数可直接调节;ElevenLabs 通过平台设置来管理这一点。 |
| 你没有 GPU 或不想为此任务管理一块 GPU | ElevenLabs | 生成过程在 ElevenLabs 的基础设施上运行,而非你自己的硬件。 |
| 你需要为商业用途克隆一个声音 | 仔细比较 | 无论用哪种工具,同意、服务商条款和许可都至关重要。 |
Chatterbox 是什么?
Chatterbox 是 Resemble AI 于 2025 年 5 月以 MIT 许可发布的免费开源文本转语音及语音克隆模型。 原始英语模型基于 Llama 式 Transformer 架构,约有 5 亿参数。多语言版本 Chatterbox Multilingual V3 于 2025 年 9 月推出,支持 23 种语言;更小更快的"Turbo"变体(约 3.5 亿参数)则面向低延迟部署场景。
- 零样本语音克隆: Chatterbox 能从一段短参考音频克隆声音——无需微调过程或训练数据集。
- exaggeration 控制: 一个可调参数(默认 0.5)用于调节情感强度,从平淡单调到极具戏剧性的表现力——这是大多数商用 TTS 平台不会作为直接控制项开放的功能。
- MIT 许可: 模型本身可免费商用,Resemble AI 不收取版税或分成——但使用第三方参考音色时,仍需自行核实其许可条款。
- PerTh 水印: 每段音频输出都嵌有不可听见的水印,Resemble AI 表示该水印设计为可在常见音频处理(压缩、剪辑)后依然存在,从而可以将生成音频追溯到该模型。
- 硬件: 支持 CUDA(NVIDIA GPU)、Apple Silicon(MPS)和 CPU 推理;建议使用 GPU 以达到实时生成速度。
•Key Point: Chatterbox 是一个需要你下载并运行的模型——通过 Python 包、社区 Web UI 或自托管服务器——而不是一个带注册页面的托管产品。预计需要安装依赖并管理 Python/GPU 环境。
"Chatterbox 胜过 ElevenLabs"的说法究竟说了什么?
Chatterbox 背后的公司 Resemble AI 报告称,在其通过第三方平台 Podonos 进行的评测中,63.75% 的盲测评审员更青睐 Chatterbox 的输出而非 ElevenLabs。 这是 Resemble AI 自己发布的厂商说法,并非独立研究,也不是 PromptQuorum 测试或验证过的结果——请像对待任何厂商自有基准测试一样看待它。
- 根据 Resemble AI 公布的方法,两个系统均使用相同的文本输入生成音频,参考音频时长为 7 至 20 秒,描述为零样本、无提示工程、无后期处理。
- Resemble AI 报告的分布:38.75% 强烈偏好 Chatterbox,25% 偏好 Chatterbox,8.75% 无偏好,16.25% 偏好 ElevenLabs,11.25% 强烈偏好 ElevenLabs。
- 这项对比仅覆盖一个维度——在该次评测时,听众对被测音频的盲选偏好。它未涵盖大规模可靠性、超出测试范围的语言覆盖、生产负载下的延迟,或长篇叙述质量。
- 此类盲选偏好测试也对所选文本、音色和参考音频较为敏感,且结果可能随任一方模型版本更新而变化。
•Warning: 这是厂商 Resemble AI 的说法,此处连同其公布的方法和完整来源链接一并呈现,方便你自行评估——它不是 PromptQuorum 的测试结果,不应被当作独立基准测试对待。
赞助内容
使用 ElevenLabs 你在为什么付费
明天就需要克隆配音,又没有 GPU 或不想安装? 从 ElevenLabs 的免费套餐开始——每月 10,000 积分,无需信用卡。免费试用 ElevenLabs →
ElevenLabs 替你承担了自托管 Chatterbox 时需要自己处理的多项任务:
无需本地安装
- 实际影响:
- 你无需管理 GPU、Python 环境或模型权重
精选音色库
- 实际影响:
- 你可以从托管目录中选择,而无需自行获取和克隆参考音频
商业许可已处理
- 实际影响:
- 付费套餐包含商业许可权限;你无需自行审查模型条款
浏览器和 API 工作流
- 实际影响:
- 无需搭建或维护自己的推理服务器即可生成语音
托管扩展
- 实际影响:
- 由 ElevenLabs 运营基础设施,而不是你自己管理 GPU 容量和正常运行时间
更快上手
- 实际影响:
- 你可以在投资本地硬件之前先用免费套餐评估工作流程
•Key Point: ElevenLabs 目前的套餐为:Free(0 美元,每月 10,000 积分,不含商业许可)、Starter(每月 6 美元,3万积分,含商业许可)、Creator(每月 22 美元,12.1万积分)、Pro(每月 99 美元,60万积分,192kbps 音质)、Scale(每月 299 美元,180万积分)和 Business(每月 990 美元,600万积分)。Enterprise 套餐采用定制价格。文本转语音和语音克隆的使用消耗共享积分,具体积分消耗取决于所用模型和功能——决定前请以实时定价页面为准。
•Key Point: 2026 年 5 月 7 日,ElevenLabs 下调了自助 API 价格——文本转语音最高降幅达 55%——并为不想按月订阅的开发者推出了按量付费积分。来源:ElevenLabs — We've lowered API & Agents pricing and introduced PAYG。
运行 Chatterbox 的真实成本
Chatterbox 本身在 MIT 许可下是免费的,但"模型 0 美元"只是自行运行它的真实成本中的一项:
硬件
- 意味着什么:
- 实时生成建议使用 GPU;CPU 和 Apple Silicon(MPS)也能运行,但明显更慢
安装
- 意味着什么:
- 需要搭建 Python 环境、依赖项和模型权重(或社区服务器/Web UI)
参考音频准备
- 意味着什么:
- 语音克隆需要一段干净的短参考音频,商业用途还需要有据可查的同意
模型更新
- 意味着什么:
- 新的检查点(Turbo、Multilingual V3 及未来版本)需要你自行跟踪和重新测试
运维
- 意味着什么:
- 正常运行时间、存储、日志和并发请求的扩展是你自己的责任,而非服务商的
可靠性
- 意味着什么:
- 依赖冲突、驱动问题和负载下的延迟等故障都由你自己承担
•Key Point: Chatterbox 用前期硬件和搭建时间加上持续运维责任,换取了对 ElevenLabs 持续订阅费用的免除。如果你已经有 GPU,并想要一个免费、可控、自托管的模型,这是一笔划算的交易;如果你只是在截止日期前需要一段配音,这就是一笔不划算的交易。
Chatterbox vs ElevenLabs 并排对比
维度 | Chatterbox | ElevenLabs |
|---|---|---|
| 产品类型 | 开源、自托管模型 | 托管云平台 |
| 成本 | 免费(MIT 许可) | 免费套餐 + 付费套餐(起价每月 6 美元) |
| 搭建 | 安装软件、下载权重、建议使用 GPU | 创建账号即可生成——无需安装 |
| 语音克隆 | 从短参考音频进行零样本克隆 | 相关套餐/功能中提供托管克隆 |
| 情感控制 | 直接的 exaggeration 参数 | 平台管理的音色设置 |
| 联网需求 | 搭建后无需联网——可完全离线运行 | 需要连接服务 |
| 算力 | 你自己的 GPU/CPU(实时场景建议 GPU) | 由服务商运营 |
| 水印 | 每段输出都嵌有不可听见的 PerTh 水印 | 请查看最新平台文档 |
| 语言 | 23 种(Multilingual V3),基础模型更少 | 多种(数十种,取决于平台——请查看最新文档) |
| 商业用途 | MIT 许可;所用参考音色的条款需另行核实 | 包含在付费套餐中;请核实最新条款 |
| 最适合 | 想要免费、可控、自托管模型的开发者 | 需要快速、成熟效果且不想搭建环境的创作者和团队 |
两款工具都能从一段短参考音频克隆声音。无论选择哪条路径,同意、许可和披露义务都同样重要——参见下方的隐私、同意与水印部分。
Chatterbox 实际需要什么硬件?
正在为本地 AI 语音或 LLM 工作购买硬件?请参阅我们的本地 AI 最佳 GPU 指南,获取不同预算下的购买建议。
Resemble AI 没有公布单一的官方最低配置,而报告的显存(VRAM)使用量因所用 Chatterbox 变体和打包方式而异。请将以下内容视为社区层面的参考指引,而非有保证的规格——在入手硬件前请用自己的硬件和工作负载进行测试。
硬件 | Chatterbox(基础/Multilingual) | Chatterbox-Turbo |
|---|---|---|
| 纯 CPU 笔记本电脑 | 可以运行,但远低于实时速度 | 更快,在强劲 CPU 上可能接近实时速度 |
| Apple Silicon(MPS) | 支持,比独立 GPU 慢 | 支持,响应更快 |
| NVIDIA 8–12GB GPU | 良好——社区普遍报告的流畅运行最低配置 | 有较充裕的余量 |
| RTX 4090 级别 GPU | 实时或更快 | Resemble AI 报告的延迟低于 200 毫秒 |
以上数据来自 Resemble AI 自身的资料和社区部署指南,并非 PromptQuorum 独立进行的基准测试。实际吞吐量取决于模型变体、文本长度、批处理方式和并发请求数——购买硬件前请用你自己的脚本进行测试。
隐私、同意与水印
在本地运行 Chatterbox 可以减少发送给第三方的音频和参考数据量,但并不会自动带来合规性,也不能免除你对克隆声音使用方式的责任。ElevenLabs 会按照其当前的条款和账户设置处理语音数据——在做出任何隐私方面的假设之前,也请同样核实这些内容。
- 你可以使用某个特定声音吗? 无论用哪种工具克隆,克隆的声音都可能涉及单独的权利、同意、合同和冒用身份等问题。
- 音频和参考音频去了哪里? 一旦按此方式配置,Chatterbox 可以将推理和参考音频保留在你自己的设备上。ElevenLabs 会依据其当前条款和基础设施处理请求——请确认适用于你账户的具体细节。
- 输出是否带水印? Chatterbox 的每段输出都带有 Resemble AI 的不可听见 PerTh 水印,该公司表示其设计目的是在常见音频处理后依然存在,使生成音频可追溯到该模型。请查看 ElevenLabs 的最新文档,了解其自身的水印或来源认证功能。
•Warning: 无论是使用 Chatterbox、ElevenLabs 还是任何其他工具,都切勿在未获得明确许可和适当保护措施的情况下克隆、模仿或部署真实人物的声音。本文提供技术指导,不构成法律建议。
以下情况适合选择 Chatterbox
如果以下大多数描述符合你的情况,自托管模型很可能更适合你:
- 你想要一个免费的 MIT 许可语音克隆模型,无需订阅。
- 你需要离线或隔离网络的语音克隆,并能提供 GPU 以获得实时速度。
- 你希望通过 exaggeration 参数直接控制情感强度。
- 你能接受安装 Python 依赖并管理 GPU/模型环境。
- 你想检查、修改或自托管模型,而不是依赖第三方服务。
- 你正在构建一个产品或流程,在你的使用量下,按请求计费的云服务定价会变得不划算。
•Key Point: Chatterbox 是一个模型,而不是一个成熟的消费级产品——在生成第一段音频之前,请预留出搭建环境的步骤。
以下情况适合选择 ElevenLabs
如果以下大多数描述符合你的情况,托管云平台更适合你:
- 你本周就需要一个听起来专业的声音克隆,而不是一个本地基础设施项目。
- 你没有 GPU,或不想为此任务专门管理一块 GPU。
- 你定期发布视频、广告、课程或客户项目。
- 你希望商业许可条款由服务商统一处理,而不是逐个模型自行审查。
- 你想在一个产品中获得精选音色库和托管工具。
- 你在了解当前条款和数据处理方式后,愿意使用第三方平台。
•Key Point: 每月 10,000 积分即可免费开始使用。无需信用卡。今天就用你自己的文本试一试。
合理的测试流程
不要仅凭营销说法做决定——包括上文提到的盲测数字。用两款工具生成同一段短文本,并直接对比:
- 姓名、缩写、数字和外来词的发音。
- 自然的停顿、语速,以及 exaggeration/情感设置与你想要的语气是否匹配。
- 在你实际发布所用的音频格式下的质量表现。
- 从文本到可用成品之间的耗时,包括重试次数,以及 Chatterbox 情况下的安装/搭建时间。
- 你能否将输入和输出保留在项目所要求的环境内。
- 总成本:ElevenLabs 的订阅费用与 Chatterbox 的硬件、搭建时间和运维成本对比。
- 你打算克隆的特定声音所需的同意和许可要求。
•Key Point: 对大多数内容截止日期而言,决定性因素是从文本到可发布成品所需的时间——而不是单一报告基准测试上的模型原始质量。
常见问题
Chatterbox 商用真的免费吗?
是的——Chatterbox 以 MIT 许可发布,该许可允许商业使用,模型本身无需向 Resemble AI 支付版税或分成。但你仍需对用作输入的任何参考声音的许可和同意状态负责,这与模型自身的许可是两个不同的问题。
Chatterbox 真的在盲测中胜过 ElevenLabs 吗?
Chatterbox 背后的公司 Resemble AI 报告称,在其通过第三方平台 Podonos 进行的评测中,63.75% 的盲测评审员更青睐其输出而非 ElevenLabs。这是 Resemble AI 自己发布的说法,并非独立测试或 PromptQuorum 验证的结果——在将其视为对你的使用场景具有决定性意义之前,请先阅读源头的测试方法。
Chatterbox 需要多少显存(VRAM)?
Resemble AI 没有公布单一的官方最低要求,社区报告的数字因变体和打包方式而异——通常在 6 到 12GB 之间可实现流畅的实时使用,Turbo 变体所需更少。在做出部署决定前,请用你自己的硬件进行测试。
我可以在没有 GPU 的情况下运行 Chatterbox 吗?
可以。Chatterbox 支持 CPU 和 Apple Silicon(MPS)推理,但在纯 CPU 硬件上生成速度明显慢于实时。如果需要实时或接近实时的输出,建议使用 GPU。
Chatterbox 的语音克隆与 ElevenLabs 有何不同?
两者都能从一段短参考音频克隆声音,无需训练过程。Chatterbox 在你自己的硬件上本地执行克隆,并开放一个直接的"exaggeration"参数来控制情感强度。ElevenLabs 在自己的云基础设施上执行克隆,通过平台管理音色设置,而不是一个你可以直接控制的单一可调参数。
Chatterbox 的音频带水印吗?
是的。Resemble AI 将其 PerTh(Perceptual Threshold)水印嵌入每段 Chatterbox 输出中,该水印被描述为不可听见,并设计为在压缩、剪辑等常见音频处理后依然存在,从而可以将生成音频追溯到该模型。
Chatterbox 支持哪些语言?
最初的英语模型仅支持英语。2025 年 9 月发布的 Chatterbox Multilingual V3 支持 23 种语言。由于语言支持可能随新版本扩展,请查看 Resemble AI 的最新文档以获取准确列表。
YouTube 配音方面,ElevenLabs 比 Chatterbox 更好吗?
对于大多数想要无需本地搭建就获得成熟声音的创作者而言,ElevenLabs 是更快的路径——它在付费层级中提供含商业许可权限的文本转语音套餐。如果你已经有 GPU、想要零持续成本,并能接受一个搭建步骤,Chatterbox 是可行的替代方案。无论选择哪种,发布变现内容之前都请核实具体的套餐条款和披露规范。
我可以用 Chatterbox 或 ElevenLabs 克隆别人的声音吗?
只有在获得该人士明确许可并采取适当保护措施的情况下才可以。两款工具都能让从一段短参考音频克隆声音在技术上变得简单,但无论是模型许可还是平台的服务条款,都不能替代你所克隆声音所有者的同意。这是技术指导,不构成法律建议。
在大批量使用时,哪个更便宜,Chatterbox 还是 ElevenLabs?
这取决于你的实际使用量以及你已经拥有的硬件。ElevenLabs 的按量计积分定价会随使用量增长,而 Chatterbox 的成本主要是前期投入(GPU、搭建时间)加上运行后的持续运维。在切换之前,请用你实际的请求量而非假设量来计算。
