关键要点
- 仅需 6 秒参考音频即可克隆声音,支持 17 种语言。
- 通过 Coqui TTS 工具包(
pip install coqui-tts)运行,或直接使用其 Hugging Face 模型权重。 - 许可证:Coqui Public Model License(CPML)——仅限非商业用途。
- 没有有效的商业许可途径:Coqui AI 已于 2023 年 12 月关闭其付费服务。
- 记录在案的首个音频流式传输延迟低于 200 毫秒;强烈建议使用 GPU。
- 需要接受 CPML——在 Docker 或 CI 中设置
COQUI_TOS_AGREED=1以非交互方式接受。
📍 简单一句话
XTTS v2 是 Coqui 的多语言声音克隆模型,可从 6 秒参考音频中克隆声音并用 17 种语言说话,采用非商业性质的 Coqui Public Model License(CPML)授权,自发布公司 Coqui AI 于 2023 年 12 月关闭其付费服务以来,没有有效的商业许可途径。
💬 简单来说
这是一个 AI 模型,它听一小段某人说话的音频片段,然后就能用同样的声音、以 17 种不同语言生成新的句子——个人和研究用途免费,但未经目前尚不存在的单独协议,不能用于付费产品。
📌注: CPML 与运行 XTTS v2 的 Coqui TTS 工具包所用的许可证不同——工具包本身采用 MPL-2.0,但这个特定模型的权重和输出是非商业性质的。详见下方的许可证与商业使用部分。
XTTS v2 实际能做什么
XTTS v2 是一个基于 GPT 的跨语言声音克隆文本转语音模型。给定一段简短的参考音频片段和目标文本,它会用克隆的声音生成语音,甚至可以使用与参考音频不同的语言。
- 几秒钟内完成声音克隆。 根据 Coqui 的官方模型卡,仅需一段 6 秒的参考音频片段即可克隆声音——无需为新声音进行微调或训练。
- 支持 17 种语言并可跨语言克隆。 支持的语言包括英语、西班牙语、法语、德语、意大利语、葡萄牙语、波兰语、土耳其语、俄语、荷兰语、捷克语、阿拉伯语、中文(zh-cn)、日语、匈牙利语、韩语和印地语——你可以用英语音频克隆一个声音,然后用同一个克隆声音以其余 16 种语言中的任意一种生成语音。
- 流式推理。 XTTS v2 支持流式合成,首个音频的延迟低于 200 毫秒,这一特性自 Coqui TTS v0.20.0 引入以来一直有文档记录——适用于等待完整音频文件渲染太慢的交互式语音应用。
- 通过 Coqui TTS 工具包运行。 运行 XTTS v2 的主要且受支持的方式是通过 Coqui TTS(
pip install coqui-tts),它将其公开为TTS("tts_models/multilingual/multi-dataset/xtts_v2")。 - 说话人嵌入复用。 除了每次传入原始参考片段外,该工具包还支持计算并复用说话人的潜在嵌入,避免在使用同一克隆声音重复合成时进行重复计算。
真实使用示例
以下命令使用 Coqui TTS 工具包已记录的 Python API,这是运行 XTTS v2 的主要且受支持的方式。
- 参考音频质量很重要。 一段干净的 6 秒单一说话人片段(无背景噪音或音乐)产生的克隆效果,明显优于短促、嘈杂或多说话人的片段。
- 非交互式接受 CPML 是 XTTS v2 首次在无人值守环境(Docker、CI)中加载时所必需的——请在首次加载前设置
COQUI_TOS_AGREED=1。
# 安装工具包
pip install coqui-tts
# 以非交互方式接受 CPML(Docker/CI 环境中必需;否则
# 首次加载时会出现交互式提示)
export COQUI_TOS_AGREED=1
# Python API:克隆声音并生成语音
import torch
from TTS.api import TTS
device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)
# 同语言克隆
tts.tts_to_file(
text="This is a cloned voice speaking a new sentence.",
speaker_wav="reference_voice.wav",
language="en",
file_path="output_en.wav",
)
# 跨语言克隆:从英语音频克隆,用西班牙语说话
tts.tts_to_file(
text="Esta es la misma voz clonada, ahora hablando en español.",
speaker_wav="reference_voice.wav",
language="es",
file_path="output_es.wav",
)
# 流式合成(首个音频延迟较低)
for chunk in tts.tts_stream(
text="Streaming audio, chunk by chunk, for interactive use.",
speaker_wav="reference_voice.wav",
language="en",
):
play_audio(chunk)许可证与商业使用
XTTS v2 的模型权重和生成的音频输出根据 Coqui Public Model License(CPML)1.0.0 授权,这已通过与模型一同发布在 Hugging Face 上的许可证文件得到确认。CPML 明确指出它"仅允许对机器学习模型及其输出进行非商业使用"——允许的用途包括个人项目、学术研究和业余工作,前提是你不会因该用途获得直接或间接报酬。
目前 XTTS v2 没有有效的商业许可途径。 模型卡列出了一个用于商业许可咨询的联系地址 info@coqui.ai,但公司 Coqui AI 已于 2023 年 12 月关闭其付费服务——PromptQuorum 无法确认该地址目前是否仍有人负责处理,也无法确认今天是否真的能获得商业许可证。除非你在发布付费产品之前独立确认了相反的情况,否则请将 XTTS v2 视为仅限非商业使用。
CPML 仅适用于 XTTS v2 的模型权重及其输出——不适用于运行该模型的 Coqui TTS 工具包代码,后者单独采用 MPL-2.0 授权,并且确实允许商业使用,但对工具包的修改需附带源代码公开条件。本段仅解释许可证的大致框架;这不是法律建议——在任何商业部署之前,请自行阅读 CPML 并咨询律师。
XTTS v2 使用什么许可证?
XTTS v2 依据 Coqui Public Model License(CPML)1.0.0 发布,这是一个适用于模型权重及其生成音频输出的非商业许可证。它允许个人、研究和业余用途,但禁止商业使用——任何付费产品、SaaS 工具或客户交付成果——除非有单独的协议。这不是法律建议;在商业使用前请自行阅读 CPML。
XTTS v2 不适合的场景
XTTS v2 是一个高质量的声音克隆模型,而不是一个可用于商业部署的通用 TTS 引擎。在以下情况下它是错误的选择:
- 任何没有确认许可证的商业产品。 CPML 是非商业性质的,自 2023 年 Coqui AI 关闭以来,目前没有确认存在的、有效的商业许可途径。在没有事先独立确认许可条款的情况下,不要将 XTTS v2 部署到付费产品、带广告的应用或客户交付成果中。
- 仅使用 CPU、资源受限的实时场景。 XTTS v2 确实支持低延迟流式传输,但这一性能是以 GPU 加速为前提的;仅使用 CPU 时,它明显比 Piper 这样的轻量级引擎更慢,在 Raspberry Pi 等性能有限的硬件上可能无法用于实时场景。
- 从很短或嘈杂的音频克隆声音。 虽然 6 秒是记录在案的最低要求,但嘈杂、压缩过或多说话人的参考片段所产生的克隆效果,明显比干净的单说话人录音差。
- 支持的 17 种语言以外的语言。 XTTS v2 恰好支持英语、西班牙语、法语、德语、意大利语、葡萄牙语、波兰语、土耳其语、俄语、荷兰语、捷克语、阿拉伯语、中文(zh-cn)、日语、匈牙利语、韩语和印地语——截至本文发布时,没有官方的语言扩展路线图。
- 未经同意冒充他人。 在未经本人知情或同意的情况下克隆真人的声音,会引发同意、形象权,以及潜在的欺诈或冒充问题,这些问题独立于 CPML 的非商业限制——无论许可条款如何,也无论是个人使用还是商业使用,这些问题都同样适用。
XTTS v2 的替代方案
Piper
- 最适合场景:
- 仅CPU下最快的合成速度,不支持声音克隆,可在树莓派上实时运行
- 许可证:
- GPL-3.0-or-later
Coqui TTS 工具包
- 最适合场景:
- 运行 XTTS v2(及其他模型)的软件,拥有更广泛、许可更宽松的代码库
- 许可证:
- MPL-2.0(仅工具包)
Bark
- 最适合场景:
- 富有表现力的非语音音频——笑声、叹息、环境音
- 许可证:
- MIT
StyleTTS 2
- 最适合场景:
- 最高水准的自然英语朗读质量(不支持声音克隆)
- 许可证:
- MIT
ElevenLabs
- 最适合场景:
- 具有商业声音克隆和明确商业许可的托管云端 API
- 许可证:
- 专有(付费云端 API)
常见问题
XTTS v2 是什么?
XTTS v2 是 Coqui 发布的多语言声音克隆文本转语音模型,仅需 6 秒参考音频即可克隆一个声音,并用该声音生成 17 种语言的语音,包括跨语言克隆。
我可以将 XTTS v2 用于商业用途吗?
未经单独协议不可以。XTTS v2 依据 Coqui Public Model License(CPML)授权,允许个人、研究和业余用途,但禁止商业使用——任何付费产品、SaaS、带广告的内容或客户工作。发布它的公司 Coqui AI 已于 2023 年 12 月关闭其付费服务,PromptQuorum 无法确认今天是否存在有效的商业许可途径。请将 XTTS v2 视为仅限非商业使用。
XTTS v2 克隆一个声音需要多少参考音频?
根据其官方 Hugging Face 模型卡,仅需 6 秒干净的单说话人参考音频。更长、更干净的片段通常会产生更准确的克隆效果。
XTTS v2 支持多少种语言?
恰好 17 种:英语、西班牙语、法语、德语、意大利语、葡萄牙语、波兰语、土耳其语、俄语、荷兰语、捷克语、阿拉伯语、中文(zh-cn)、日语、匈牙利语、韩语和印地语。它支持跨语言克隆——用这些语言中某一种的音频克隆声音,并用其余任意一种语言生成语音。
我该如何运行 XTTS v2?
使用 pip install coqui-tts 安装 Coqui TTS 工具包,然后用 TTS("tts_models/multilingual/multi-dataset/xtts_v2") 加载模型。如果需要在 Docker 容器或 CI 流水线等场景中以非交互方式接受 CPML 许可证,请先设置环境变量 COQUI_TOS_AGREED=1。
运行 XTTS v2 需要 GPU 吗?
强烈建议使用 GPU。XTTS v2 可以在 CPU 上运行,但速度会明显变慢——其记录在案的低于 200 毫秒的流式传输延迟是以 GPU 加速为前提的,仅使用 CPU 并不适合实时应用。
XTTS v2 和 Coqui TTS 工具包有什么区别?
XTTS v2 是一个特定的声音克隆模型,依据非商业性质的 CPML 授权。Coqui TTS 工具包是运行 XTTS v2 及其他模型的软件——一个 Python 包和命令行工具——单独依据 MPL-2.0 授权,该许可证确实允许对工具包代码本身进行商业使用。
结论
XTTS v2 在 2026 年仍然是可用的最高质量本地声音克隆模型之一,6 秒克隆要求、17 种语言的跨语言支持,以及低于 200 毫秒的流式传输延迟三者的结合,对于个人、研究和原型开发用途而言确实具有实用能力。对大多数读者来说真正重要的决定因素是许可证:Coqui Public Model License 毫无疑问是非商业性质的,而且由于 Coqui AI 已在 2023 年 12 月关闭,如今没有确认存在的、有效的商业许可途径。如果你的用例是个人、学术或非商业原型,XTTS v2 是一个稳健且文档完善的选择。如果你需要商业声音克隆,请在基于它构建之前独立核实许可条款,或者结合 PromptQuorum 对 Piper 和 Bark 等宽松许可替代方案的报道,或查看与 ElevenLabs 的比较以了解托管商业选项。
来源
- Hugging Face 上的 XTTS v2——模型卡:语言、克隆要求和许可证参考。
- XTTS v2 LICENSE.txt——Coqui Public Model License(CPML)1.0.0 全文。
- GitHub 上的 idiap/coqui-ai-TTS——运行 XTTS v2 的积极维护工具包,附带使用文档。
- Coqui TTS 评测——PromptQuorum 对该工具包的专门评测,包括其关闭后的维护历史。
- 本地 TTS 与声音克隆许可证——本地 TTS 引擎间的完整许可证比较。
