Skip to main content
PromptQuorum
主页/本地LLM进阶/Coqui TTS评测(2026):由社区维护的声音克隆工具包
Voice, Speech & Multimodal

Coqui TTS评测(2026):由社区维护的声音克隆工具包

·阅读约12分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

Coqui TTS是一个开源的本地文本转语音与声音克隆工具包,最初由初创公司Coqui AI打造,该公司已于2023年12月关闭其付费服务。 原始仓库coqui-ai/TTS自2024年8月起未再更新。请改为安装积极维护的社区分支:pip install coqui-tts,它来自idiap/coqui-ai-TTS,由Idiap研究所维护。该工具包采用MPL-2.0许可证,是运行声音克隆模型XTTS v2的软件 —— 工具包与模型是两个独立事物,各自拥有独立许可证(见许可证与成本一节)。要查看本地TTS引擎之间的完整许可证对比,请参阅PromptQuorum的本地TTS许可证指南

Coqui TTS是一个开源的本地文本转语音与声音克隆工具包,起源于Mozilla的TTS项目,最初由初创公司Coqui AI打造,该公司已于2023年12月关闭其付费服务。原始仓库coqui-ai/TTS自2024年8月起没有新提交,已不再积极维护,但仍以MPL-2.0许可证公开可用。开发工作在社区分支idiap/coqui-ai-TTS中继续进行,由Idiap研究所维护,并以coqui-tts包名发布在PyPI上。本评测涵盖这段历史、该工具包与声音克隆模型XTTS v2的关系、真实的安装与使用命令、其MPL-2.0许可证,以及这次维护权转移在2026年真正重要的地方。

Coqui TTS评测(2026):由社区维护的声音克隆工具包

关键要点

  • 源自Mozilla的TTS研究项目;由2021年成立的初创公司Coqui AI开发,创始人是前Mozilla TTS工程师。
  • Coqui AI于2023年12月关闭付费云服务;原始GitHub仓库coqui-ai/TTS自2024年8月起没有新提交。
  • 积极维护的分支:idiap/coqui-ai-TTS,由Idiap研究所维护,以coqui-tts包名发布在PyPI上。
  • 许可证:工具包本身为MPL-2.0。可在其上运行的XTTS v2模型另外采用非商业的CPML许可证——不要将两者混淆。
  • 免费,无付费方案;可在CPU上运行,对于更大的声音克隆模型建议使用GPU。
  • 最新软件包版本:coqui-tts v0.27.5,发布于2026年1月26日。

📍 简单一句话

Coqui TTS是一个源自Mozilla TTS项目的开源本地文本转语音与声音克隆工具包,其原始公司Coqui AI已于2023年12月关闭付费服务,使原始仓库自2024年8月起处于无人维护状态——但积极维护的社区分支idiap/coqui-ai-TTS仍在Idiap研究所的支持下持续开发。

💬 简单来说

这是一个通过pip install安装的程序,可以借助多种不同的AI模型将文本转换为语音,其中包括一个名为XTTS v2的声音克隆模型 —— 打造它的公司已经关闭,但如今有一家研究机构在持续更新这款软件。

📌: 如果你想要一个能接收更新的版本,请安装coqui-tts(受维护的分支),而不是来自如今无人维护的coqui-ai/TTS仓库的原始包名TTS。参见下方的"安装与运行"部分。

历史:从Mozilla TTS到社区分支

**Coqui TTS可追溯至Mozilla的TTS项目**,这是Mozilla内部针对开源语音技术的研究项目。当Mozilla于2021年解散该研究团队时,包括Eren Gölge、Kelly Davis、Josh Meyer和Reuben Morais在内的多名工程师创立了初创公司Coqui AI,以独立公司的身份继续这项工作,推出了文本转语音工具包(Coqui TTS)和语音转文本工具包(Coqui STT)。

Coqui AI于2023年3月完成330万美元的种子轮融资,同时提供开源工具包和付费云服务,包括对其声音克隆模型XTTS的托管访问。该公司未能在开源软件之上找到可持续的商业模式,于2023年12月宣布关闭付费服务,其服务器于2023年12月11日下线。

**原始仓库coqui-ai/TTS在MPL-2.0许可证下仍在GitHub上公开可用**,但自2024年8月起没有新提交,GitHub也未将其正式标记为已归档——实际上,它已不再获得积极开发或错误修复。

**社区分支idiap/coqui-ai-TTS延续了开发工作。** 它由瑞士研究机构Idiap研究所维护,并以coqui-tts这一包名发布在PyPI上(区别于原始包名TTS)。其README明确说明这是"原始未维护仓库的分支",其发布历史显示持续的更新,包括添加了声音克隆缓存的v0.27.0版本,以及2026年1月26日发布的v0.27.5版本。

谁创建了Coqui TTS?

Coqui TTS由初创公司Coqui AI创建,该公司于2021年由Mozilla TTS研究项目的前工程师创立,包括Eren Gölge、Kelly Davis、Josh Meyer和Reuben Morais。Coqui AI于2023年12月关闭付费服务后,开发工作在由Idiap研究所维护的社区分支中得以延续。

Coqui TTS实际能做什么

Coqui TTS是一个工具包,而不是单一模型——它提供统一的Python接口、命令行界面(CLI)和训练流水线,用于运行(以及历史上曾用于训练)多种不同的文本转语音模型架构。

  • 多模型接口。 单一的Python类TTS()可加载并运行不同的模型架构,包括基于VITS的单说话人和多说话人模型、基于Tacotron2的模型,以及声音克隆模型XTTS v2,无需更改周围的应用代码。
  • 命令行合成。 tts命令行工具可直接从终端合成语音,使用tts --list_models列出所有可用的预训练模型。
  • 通过XTTS v2进行声音克隆。 向已加载的XTTS v2模型传入speaker_wav参数,即可从一段简短的参考音频克隆声音,并以XTTS v2支持的语言生成该克隆声音的语音。
  • 丰富的预训练模型库。 该工具包提供对预训练模型的访问,据文档介绍,通过底层基于Fairseq的大规模多语言模型可覆盖1,100多种语言,此外还为特定语言提供质量更高的精选模型。
  • 模型训练与微调。 除了运行预训练模型外,该工具包还包含训练脚本和数据集分析工具,用于构建或微调自定义语音模型——在Coqui AI的托管训练服务关闭之前,这在历史上是其使用最多的功能之一。
  • XTTS v2的流式推理。 该工具包记录了XTTS v2的低延迟流式合成功能(维护中的分支文档称首个音频延迟低于200毫秒),适用于交互式语音应用。

Coqui TTS与XTTS v2的关系

Coqui TTS(工具包)与XTTS v2(模型)是两个各自拥有独立许可证的不同事物,混淆两者是常见的许可证错误。 Coqui TTS工具包——即Python包、CLI和训练代码——采用MPL-2.0许可证,这是一种宽松许可证,允许商业使用,但对工具包本身的修改附有源代码公开条件。XTTS v2是一个具体的预训练模型,其权重以Coqui Public Model License(CPML)分发,这是一种非商业许可证,与工具包的MPL-2.0许可证是分开的。

实际上,这意味着你可以将Coqui TTS工具包与宽松许可的模型一起用于商业用途(在兼容许可证下训练的VITS或Tacotron2模型),而"Coqui TTS工具包运行XTTS v2模型"这一特定组合,则会继承XTTS v2对该模型权重和输出的非商业限制。通过同一工具包运行另一个宽松许可的模型,不会带有该限制。

coqui-tts包直接记录了XTTS v2的使用方法**,模型通过TTS("tts_models/multilingual/multi-dataset/xtts_v2")加载,因为除了通过其他推理栈直接使用模型权重之外,该工具包是运行XTTS v2的主要受支持方式。有关该模型许可证和能力的完整分解,请参阅PromptQuorum专门的XTTS v2评测

安装与运行Coqui TTS:分步指南

本指南将安装积极维护的coqui-tts包,并按照受维护分支自身README中记录的语法执行首次合成。

  1. 1
    安装受维护的包。
    Why it matters: 在Python环境中运行`pip install coqui-tts`(如果使用uv,则运行`uv pip install coqui-tts`)。请专门安装`coqui-tts`包——而不是指向如今无人维护的原始仓库的旧包名`TTS`。
  2. 2
    列出可用的预训练模型。
    Why it matters: 运行`tts --list_models`,即可看到按语言和架构(VITS、Tacotron2、XTTS等)组织的完整可下载预训练模型目录。
  3. 3
    从命令行合成语音。
    Why it matters: 运行`tts --text "Hello world" --out_path output.wav`即可使用默认模型合成语音,或添加`--model_name <模型>`从列表中选择特定模型。
  4. 4
    (可选)使用Python API进行XTTS v2声音克隆。
    Why it matters: 使用`TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)`加载模型,然后调用`.tts_to_file()`,传入指向简短参考音频的`speaker_wav`参数以及用于克隆声音的`language`参数。
  5. 5
    (可选)启用GPU加速。
    Why it matters: 向`TTS()`构造函数传入`gpu=True`,或在已加载的模型对象上调用`.to("cuda")`,即可在NVIDIA GPU上运行推理——对于仅用CPU时明显较慢的XTTS v2尤为推荐。
  6. 6
    (可选)为XTTS v2非交互式地接受CPML许可证。
    Why it matters: 首次加载XTTS v2会提示一个交互式的CPML接受步骤。设置环境变量`COQUI_TOS_AGREED=1`即可非交互式地接受它,这是在Docker容器或CI流水线中无人值守使用所必需的。

真实使用示例

除了上面的基本安装指南外,以下是来自受维护分支自身文档的常见实际使用模式。

  • 为自动化环境非交互式接受CPML:在首次加载XTTS v2之前设置COQUI_TOS_AGREED=1,这样Docker构建和CI流水线就不会卡在交互式提示上。
  • 说话人与语言自检:加载多说话人或多语言模型后,tts.speakerstts.languages会列出已加载模型实际支持的内容——便于在合成前验证输入。
python
# 命令行:列出可用的预训练模型
tts --list_models

# 命令行:使用默认模型合成
tts --text "Hello world" --out_path output.wav

# 命令行:使用指定模型合成
tts --model_name "tts_models/en/ljspeech/tacotron2-DDC" \
    --text "This is a test." --out_path output.wav

# Python API:基本合成
from TTS.api import TTS

tts = TTS("tts_models/en/ljspeech/tacotron2-DDC")
tts.tts_to_file(text="Hello world", file_path="output.wav")

# Python API:使用XTTS v2进行声音克隆(先非交互式接受CPML)
# export COQUI_TOS_AGREED=1
import torch
from TTS.api import TTS

device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)

tts.tts_to_file(
    text="Hola, esto es una prueba.",
    speaker_wav="reference_voice.wav",
    language="es",
    file_path="cloned_output.wav",
)

# Python API:列出已加载模型可用的说话人和语言
print(tts.speakers)
print(tts.languages)

许可证与成本

Coqui TTS工具包采用MPL-2.0(Mozilla Public License 2.0)许可证,这一点通过PyPIcoqui-tts包发布的元数据以及idiap/coqui-ai-TTS仓库中的许可证文件得到确认。MPL-2.0是一种附带条件的宽松许可证:你可以将该工具包用于商业用途,但如果你修改并分发工具包自身的源文件,则必须将这些特定的修改文件同样以MPL-2.0发布。将工具包作为未修改的依赖项使用,不会使你自己的应用代码受MPL-2.0约束。

XTTS v2模型另外采用Coqui Public Model License(CPML)许可证,该许可证为非商业性质 —— 这适用于模型权重及其生成的音频输出,而不适用于运行它们的Coqui TTS工具包代码。有关该许可证的完整分解,请参阅PromptQuorum的XTTS v2评测

Coqui TTS工具包本身没有付费方案、订阅或许可费用。 Coqui AI的付费托管服务已于2023年12月关闭,无论何种价格都不再提供;如今使用Coqui TTS的唯一方式是自托管,可以选择无人维护的原始包,也可以选择积极维护的coqui-tts分支。

Coqui TTS使用什么许可证?

Coqui TTS工具包本身采用MPL-2.0许可证,允许商业使用,条件是对工具包自身源文件的修改需以相同许可证发布。这与它所运行的任何特定模型的许可证是分开的——例如XTTS v2模型采用非商业性质的Coqui Public Model License(CPML),适用于模型权重和输出,而不适用于工具包代码。

Coqui TTS不适合哪些场景

Coqui TTS是一个灵活的多模型工具包,并非在每种使用场景下都是最快或最简单的选择。以下情况不适合使用它:

  • 基于原始的、无人维护的仓库进行构建。 如果你运行pip install TTS(原始包名)而不是pip install coqui-tts(受维护的分支),你所构建的代码自2024年8月起就没有获得过更新——在依赖某个教程或依赖项之前,请先确认它实际引用的是哪个包。
  • 尽可能最快的纯CPU合成。 如果你的优先事项是在没有GPU的Raspberry Pi等入门级硬件上实现实时语音,Piper正是为此专门打造且部署更简单;Coqui TTS的更大模型,尤其是XTTS v2,仅用CPU时明显更慢。
  • 未经单独许可证检查的商业声音克隆。 通过Coqui TTS工具包运行XTTS v2,仍然带有XTTS v2自身对模型权重和输出的非商业CPML限制——工具包的MPL-2.0许可证并不能凌驾于此之上。参见上方的"许可证与成本"一节。
  • 长期有保障的企业支持。 Coqui AI这家公司自2023年12月起已不复存在。目前的分支由一家研究机构以社区方式维护,这与由资金充足、附带支持合同的公司维护是不同的维护模式——在做关键生产基础设施决策时应将此纳入考虑。
  • 跨版本统一稳定的API。 由于开发在无人维护的原始版本和积极开发的分支之间转移,网上一些教程、Stack Overflow回答和博客文章仍引用较旧的API接口或原始包名——请以当前coqui-tts文档为准,而非较旧的搜索结果。

Coqui TTS的替代方案

Piper

最适合:
最快的纯CPU合成,无声音克隆,在Raspberry Pi上实时运行
许可证:
GPL-3.0-or-later

XTTS v2

最适合:
如果你只需要XTTS v2而不需要更广泛的工具包,则可直接使用该声音克隆模型本身
许可证:
CPML(非商业)

Bark

最适合:
富有表现力的非语音音频——笑声、叹息、环境声音
许可证:
MIT

StyleTTS 2

最适合:
最自然的英语朗读质量(无声音克隆)
许可证:
MIT

ElevenLabs

最适合:
面向不想自托管、需要商业声音克隆的团队的托管云API
许可证:
专有(付费云API)

常见问题

Coqui TTS是什么?

Coqui TTS是一个源自Mozilla TTS研究项目的开源本地文本转语音与声音克隆工具包,最初由初创公司Coqui AI打造。它通过单一的Python接口和CLI支持多种模型架构,包括声音克隆模型XTTS v2。

Coqui TTS还在维护吗?

原始的coqui-ai/TTS仓库已不再积极维护——自公司Coqui AI于2023年12月关闭付费服务后,自2024年8月起没有新提交。积极维护的社区分支idiap/coqui-ai-TTS在Idiap研究所的支持下继续开发,并以coqui-tts包名发布在PyPI上,发布记录一直延续到2026年1月。

Coqui TTS是免费的吗?

是的,该工具包本身没有付费方案或许可费用。Coqui AI此前的付费托管服务已于2023年12月关闭,无论何种价格都不再提供。一些在该工具包上运行的特定模型,例如XTTS v2,拥有自己独立的许可证(CPML),限制该模型权重和输出的商业使用。

coqui-tts包和TTS包有什么区别?

TTS是原始的PyPI包名,与无人维护的coqui-ai/TTS仓库绑定,自2024年8月起没有更新。coqui-tts是积极维护的分支的包名,从Idiap研究所旗下的idiap/coqui-ai-TTS仓库发布,有定期发布记录,包括2026年1月的v0.27.5。安装coqui-tts可获得能持续接收更新的版本。

Coqui TTS支持声音克隆吗?

支持,通过该工具包可加载并运行的XTTS v2模型实现。XTTS v2会从作为speaker_wav参数传入的简短参考音频中克隆声音。请注意,XTTS v2自身的许可证——Coqui Public Model License(CPML)——为非商业性质,与工具包的MPL-2.0许可证是分开的。

为什么Coqui AI关闭了?

Coqui TTS背后的公司Coqui AI在未能于开源语音技术之上建立可持续商业模式后,于2023年12月宣布关闭其付费托管服务,其服务器于2023年12月11日下线。开源工具包本身仍保持可用,开发工作此后在社区分支中得以延续。

Coqui TTS的最新版本是什么?

根据PyPI页面显示,积极维护的coqui-tts包最新版本为v0.27.5,发布于2026年1月26日。

结论

Coqui TTS是一个非常有价值的案例研究,展示了当背后的公司关闭后开源基础设施会发生什么:原始仓库在2024年8月归于沉寂,但软件本身并未消失——一家研究机构接手了维护工作,重新命名了包,并持续发布版本直至2026年。对于今天评估它的任何人来说,实用的结论很简单:安装coqui-tts,而不是原始的TTS包,并要理解该工具包的MPL-2.0许可证与它可运行的XTTS v2模型的非商业CPML许可证是相互独立的。作为一个工具包,它的优势在于跨模型架构的灵活性,而不是在任何单一使用场景下都是最快或最简单的选择——为此,可将本评测与PromptQuorum关于Piper(速度方面)、专门针对克隆模型的XTTS v2,或涵盖所有引擎全貌的本地TTS许可证指南结合参考。

来源

← 返回 本地LLM进阶