Skip to main content
PromptQuorum
主页/本地LLM进阶/XTTS v2 评测(2026):仅需6秒音频即可实现多语言声音克隆
Voice, Speech & Multimodal

XTTS v2 评测(2026):仅需6秒音频即可实现多语言声音克隆

·阅读时间12分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

XTTS v2 是 Coqui 推出的多语言声音克隆模型,仅需 6 秒参考音频即可克隆一个声音,并用该声音生成 17 种语言的语音。 它通过 Coqui TTS 工具包 运行(pip install coqui-tts,然后执行 TTS("tts_models/multilingual/multi-dataset/xtts_v2"))。其许可证 Coqui Public Model License(CPML)是非商业性质的——由于公司 Coqui AI 已于 2023 年 12 月关闭其付费服务,目前没有获取商业许可证的有效途径。关于本地 TTS 引擎间的完整许可证比较,请参见 PromptQuorum 的本地 TTS 许可证指南

XTTS v2 是 Coqui 发布的多语言声音克隆模型,发布于 Hugging Face,仅需 6 秒参考音频即可克隆一个声音,并让其用 17 种语言说话。它通过 Coqui TTS 工具包 运行——目前积极维护的分支是 idiap/coqui-ai-TTS——也可以直接使用模型权重独立运行。本评测介绍 XTTS v2 实际能做什么、真实的使用命令、其许可证(非商业性质的 Coqui Public Model License,CPML),以及它适合与不适合的场景,因为最初发布它的公司 Coqui AI 已于 2023 年 12 月关闭了其付费服务。

XTTS v2 评测(2026):仅需6秒音频即可实现多语言声音克隆

关键要点

  • 仅需 6 秒参考音频即可克隆声音,支持 17 种语言。
  • 通过 Coqui TTS 工具包(pip install coqui-tts)运行,或直接使用其 Hugging Face 模型权重。
  • 许可证:Coqui Public Model License(CPML)——仅限非商业用途。
  • 没有有效的商业许可途径:Coqui AI 已于 2023 年 12 月关闭其付费服务。
  • 记录在案的首个音频流式传输延迟低于 200 毫秒;强烈建议使用 GPU。
  • 需要接受 CPML——在 Docker 或 CI 中设置 COQUI_TOS_AGREED=1 以非交互方式接受。

📍 简单一句话

XTTS v2 是 Coqui 的多语言声音克隆模型,可从 6 秒参考音频中克隆声音并用 17 种语言说话,采用非商业性质的 Coqui Public Model License(CPML)授权,自发布公司 Coqui AI 于 2023 年 12 月关闭其付费服务以来,没有有效的商业许可途径。

💬 简单来说

这是一个 AI 模型,它听一小段某人说话的音频片段,然后就能用同样的声音、以 17 种不同语言生成新的句子——个人和研究用途免费,但未经目前尚不存在的单独协议,不能用于付费产品。

📌: CPML 与运行 XTTS v2 的 Coqui TTS 工具包所用的许可证不同——工具包本身采用 MPL-2.0,但这个特定模型的权重和输出是非商业性质的。详见下方的许可证与商业使用部分。

XTTS v2 实际能做什么

XTTS v2 是一个基于 GPT 的跨语言声音克隆文本转语音模型。给定一段简短的参考音频片段和目标文本,它会用克隆的声音生成语音,甚至可以使用与参考音频不同的语言。

  • 几秒钟内完成声音克隆。 根据 Coqui 的官方模型卡,仅需一段 6 秒的参考音频片段即可克隆声音——无需为新声音进行微调或训练。
  • 支持 17 种语言并可跨语言克隆。 支持的语言包括英语、西班牙语、法语、德语、意大利语、葡萄牙语、波兰语、土耳其语、俄语、荷兰语、捷克语、阿拉伯语、中文(zh-cn)、日语、匈牙利语、韩语和印地语——你可以用英语音频克隆一个声音,然后用同一个克隆声音以其余 16 种语言中的任意一种生成语音。
  • 流式推理。 XTTS v2 支持流式合成,首个音频的延迟低于 200 毫秒,这一特性自 Coqui TTS v0.20.0 引入以来一直有文档记录——适用于等待完整音频文件渲染太慢的交互式语音应用。
  • 通过 Coqui TTS 工具包运行。 运行 XTTS v2 的主要且受支持的方式是通过 Coqui TTS(pip install coqui-tts),它将其公开为 TTS("tts_models/multilingual/multi-dataset/xtts_v2")
  • 说话人嵌入复用。 除了每次传入原始参考片段外,该工具包还支持计算并复用说话人的潜在嵌入,避免在使用同一克隆声音重复合成时进行重复计算。

真实使用示例

以下命令使用 Coqui TTS 工具包已记录的 Python API,这是运行 XTTS v2 的主要且受支持的方式。

  • 参考音频质量很重要。 一段干净的 6 秒单一说话人片段(无背景噪音或音乐)产生的克隆效果,明显优于短促、嘈杂或多说话人的片段。
  • 非交互式接受 CPML 是 XTTS v2 首次在无人值守环境(Docker、CI)中加载时所必需的——请在首次加载前设置 COQUI_TOS_AGREED=1
python
# 安装工具包
pip install coqui-tts

# 以非交互方式接受 CPML(Docker/CI 环境中必需;否则
# 首次加载时会出现交互式提示)
export COQUI_TOS_AGREED=1

# Python API:克隆声音并生成语音
import torch
from TTS.api import TTS

device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)

# 同语言克隆
tts.tts_to_file(
    text="This is a cloned voice speaking a new sentence.",
    speaker_wav="reference_voice.wav",
    language="en",
    file_path="output_en.wav",
)

# 跨语言克隆:从英语音频克隆,用西班牙语说话
tts.tts_to_file(
    text="Esta es la misma voz clonada, ahora hablando en español.",
    speaker_wav="reference_voice.wav",
    language="es",
    file_path="output_es.wav",
)

# 流式合成(首个音频延迟较低)
for chunk in tts.tts_stream(
    text="Streaming audio, chunk by chunk, for interactive use.",
    speaker_wav="reference_voice.wav",
    language="en",
):
    play_audio(chunk)

许可证与商业使用

XTTS v2 的模型权重和生成的音频输出根据 Coqui Public Model License(CPML)1.0.0 授权,这已通过与模型一同发布在 Hugging Face 上的许可证文件得到确认。CPML 明确指出它"仅允许对机器学习模型及其输出进行非商业使用"——允许的用途包括个人项目、学术研究和业余工作,前提是你不会因该用途获得直接或间接报酬。

目前 XTTS v2 没有有效的商业许可途径。 模型卡列出了一个用于商业许可咨询的联系地址 info@coqui.ai,但公司 Coqui AI 已于 2023 年 12 月关闭其付费服务——PromptQuorum 无法确认该地址目前是否仍有人负责处理,也无法确认今天是否真的能获得商业许可证。除非你在发布付费产品之前独立确认了相反的情况,否则请将 XTTS v2 视为仅限非商业使用。

CPML 仅适用于 XTTS v2 的模型权重及其输出——不适用于运行该模型的 Coqui TTS 工具包代码,后者单独采用 MPL-2.0 授权,并且确实允许商业使用,但对工具包的修改需附带源代码公开条件。本段仅解释许可证的大致框架;这不是法律建议——在任何商业部署之前,请自行阅读 CPML 并咨询律师。

XTTS v2 使用什么许可证?

XTTS v2 依据 Coqui Public Model License(CPML)1.0.0 发布,这是一个适用于模型权重及其生成音频输出的非商业许可证。它允许个人、研究和业余用途,但禁止商业使用——任何付费产品、SaaS 工具或客户交付成果——除非有单独的协议。这不是法律建议;在商业使用前请自行阅读 CPML。

XTTS v2 不适合的场景

XTTS v2 是一个高质量的声音克隆模型,而不是一个可用于商业部署的通用 TTS 引擎。在以下情况下它是错误的选择:

  • 任何没有确认许可证的商业产品。 CPML 是非商业性质的,自 2023 年 Coqui AI 关闭以来,目前没有确认存在的、有效的商业许可途径。在没有事先独立确认许可条款的情况下,不要将 XTTS v2 部署到付费产品、带广告的应用或客户交付成果中。
  • 仅使用 CPU、资源受限的实时场景。 XTTS v2 确实支持低延迟流式传输,但这一性能是以 GPU 加速为前提的;仅使用 CPU 时,它明显比 Piper 这样的轻量级引擎更慢,在 Raspberry Pi 等性能有限的硬件上可能无法用于实时场景。
  • 从很短或嘈杂的音频克隆声音。 虽然 6 秒是记录在案的最低要求,但嘈杂、压缩过或多说话人的参考片段所产生的克隆效果,明显比干净的单说话人录音差。
  • 支持的 17 种语言以外的语言。 XTTS v2 恰好支持英语、西班牙语、法语、德语、意大利语、葡萄牙语、波兰语、土耳其语、俄语、荷兰语、捷克语、阿拉伯语、中文(zh-cn)、日语、匈牙利语、韩语和印地语——截至本文发布时,没有官方的语言扩展路线图。
  • 未经同意冒充他人。 在未经本人知情或同意的情况下克隆真人的声音,会引发同意、形象权,以及潜在的欺诈或冒充问题,这些问题独立于 CPML 的非商业限制——无论许可条款如何,也无论是个人使用还是商业使用,这些问题都同样适用。

XTTS v2 的替代方案

Piper

最适合场景:
仅CPU下最快的合成速度,不支持声音克隆,可在树莓派上实时运行
许可证:
GPL-3.0-or-later

Coqui TTS 工具包

最适合场景:
运行 XTTS v2(及其他模型)的软件,拥有更广泛、许可更宽松的代码库
许可证:
MPL-2.0(仅工具包)

Bark

最适合场景:
富有表现力的非语音音频——笑声、叹息、环境音
许可证:
MIT

StyleTTS 2

最适合场景:
最高水准的自然英语朗读质量(不支持声音克隆)
许可证:
MIT

ElevenLabs

最适合场景:
具有商业声音克隆和明确商业许可的托管云端 API
许可证:
专有(付费云端 API)

常见问题

XTTS v2 是什么?

XTTS v2 是 Coqui 发布的多语言声音克隆文本转语音模型,仅需 6 秒参考音频即可克隆一个声音,并用该声音生成 17 种语言的语音,包括跨语言克隆。

我可以将 XTTS v2 用于商业用途吗?

未经单独协议不可以。XTTS v2 依据 Coqui Public Model License(CPML)授权,允许个人、研究和业余用途,但禁止商业使用——任何付费产品、SaaS、带广告的内容或客户工作。发布它的公司 Coqui AI 已于 2023 年 12 月关闭其付费服务,PromptQuorum 无法确认今天是否存在有效的商业许可途径。请将 XTTS v2 视为仅限非商业使用。

XTTS v2 克隆一个声音需要多少参考音频?

根据其官方 Hugging Face 模型卡,仅需 6 秒干净的单说话人参考音频。更长、更干净的片段通常会产生更准确的克隆效果。

XTTS v2 支持多少种语言?

恰好 17 种:英语、西班牙语、法语、德语、意大利语、葡萄牙语、波兰语、土耳其语、俄语、荷兰语、捷克语、阿拉伯语、中文(zh-cn)、日语、匈牙利语、韩语和印地语。它支持跨语言克隆——用这些语言中某一种的音频克隆声音,并用其余任意一种语言生成语音。

我该如何运行 XTTS v2?

使用 pip install coqui-tts 安装 Coqui TTS 工具包,然后用 TTS("tts_models/multilingual/multi-dataset/xtts_v2") 加载模型。如果需要在 Docker 容器或 CI 流水线等场景中以非交互方式接受 CPML 许可证,请先设置环境变量 COQUI_TOS_AGREED=1

运行 XTTS v2 需要 GPU 吗?

强烈建议使用 GPU。XTTS v2 可以在 CPU 上运行,但速度会明显变慢——其记录在案的低于 200 毫秒的流式传输延迟是以 GPU 加速为前提的,仅使用 CPU 并不适合实时应用。

XTTS v2 和 Coqui TTS 工具包有什么区别?

XTTS v2 是一个特定的声音克隆模型,依据非商业性质的 CPML 授权。Coqui TTS 工具包是运行 XTTS v2 及其他模型的软件——一个 Python 包和命令行工具——单独依据 MPL-2.0 授权,该许可证确实允许对工具包代码本身进行商业使用。

结论

XTTS v2 在 2026 年仍然是可用的最高质量本地声音克隆模型之一,6 秒克隆要求、17 种语言的跨语言支持,以及低于 200 毫秒的流式传输延迟三者的结合,对于个人、研究和原型开发用途而言确实具有实用能力。对大多数读者来说真正重要的决定因素是许可证:Coqui Public Model License 毫无疑问是非商业性质的,而且由于 Coqui AI 已在 2023 年 12 月关闭,如今没有确认存在的、有效的商业许可途径。如果你的用例是个人、学术或非商业原型,XTTS v2 是一个稳健且文档完善的选择。如果你需要商业声音克隆,请在基于它构建之前独立核实许可条款,或者结合 PromptQuorum 对 PiperBark 等宽松许可替代方案的报道,或查看与 ElevenLabs 的比较以了解托管商业选项。

来源

← 返回 本地LLM进阶