关键要点
- 源自Mozilla的TTS研究项目;由2021年成立的初创公司Coqui AI开发,创始人是前Mozilla TTS工程师。
- Coqui AI于2023年12月关闭付费云服务;原始GitHub仓库coqui-ai/TTS自2024年8月起没有新提交。
- 积极维护的分支:idiap/coqui-ai-TTS,由Idiap研究所维护,以
coqui-tts包名发布在PyPI上。 - 许可证:工具包本身为MPL-2.0。可在其上运行的XTTS v2模型另外采用非商业的CPML许可证——不要将两者混淆。
- 免费,无付费方案;可在CPU上运行,对于更大的声音克隆模型建议使用GPU。
- 最新软件包版本:coqui-tts v0.27.5,发布于2026年1月26日。
📍 简单一句话
Coqui TTS是一个源自Mozilla TTS项目的开源本地文本转语音与声音克隆工具包,其原始公司Coqui AI已于2023年12月关闭付费服务,使原始仓库自2024年8月起处于无人维护状态——但积极维护的社区分支idiap/coqui-ai-TTS仍在Idiap研究所的支持下持续开发。
💬 简单来说
这是一个通过pip install安装的程序,可以借助多种不同的AI模型将文本转换为语音,其中包括一个名为XTTS v2的声音克隆模型 —— 打造它的公司已经关闭,但如今有一家研究机构在持续更新这款软件。
📌注: 如果你想要一个能接收更新的版本,请安装coqui-tts(受维护的分支),而不是来自如今无人维护的coqui-ai/TTS仓库的原始包名TTS。参见下方的"安装与运行"部分。
历史:从Mozilla TTS到社区分支
**Coqui TTS可追溯至Mozilla的TTS项目**,这是Mozilla内部针对开源语音技术的研究项目。当Mozilla于2021年解散该研究团队时,包括Eren Gölge、Kelly Davis、Josh Meyer和Reuben Morais在内的多名工程师创立了初创公司Coqui AI,以独立公司的身份继续这项工作,推出了文本转语音工具包(Coqui TTS)和语音转文本工具包(Coqui STT)。
Coqui AI于2023年3月完成330万美元的种子轮融资,同时提供开源工具包和付费云服务,包括对其声音克隆模型XTTS的托管访问。该公司未能在开源软件之上找到可持续的商业模式,于2023年12月宣布关闭付费服务,其服务器于2023年12月11日下线。
**原始仓库coqui-ai/TTS在MPL-2.0许可证下仍在GitHub上公开可用**,但自2024年8月起没有新提交,GitHub也未将其正式标记为已归档——实际上,它已不再获得积极开发或错误修复。
**社区分支idiap/coqui-ai-TTS延续了开发工作。** 它由瑞士研究机构Idiap研究所维护,并以coqui-tts这一包名发布在PyPI上(区别于原始包名TTS)。其README明确说明这是"原始未维护仓库的分支",其发布历史显示持续的更新,包括添加了声音克隆缓存的v0.27.0版本,以及2026年1月26日发布的v0.27.5版本。
谁创建了Coqui TTS?
Coqui TTS由初创公司Coqui AI创建,该公司于2021年由Mozilla TTS研究项目的前工程师创立,包括Eren Gölge、Kelly Davis、Josh Meyer和Reuben Morais。Coqui AI于2023年12月关闭付费服务后,开发工作在由Idiap研究所维护的社区分支中得以延续。
Coqui TTS实际能做什么
Coqui TTS是一个工具包,而不是单一模型——它提供统一的Python接口、命令行界面(CLI)和训练流水线,用于运行(以及历史上曾用于训练)多种不同的文本转语音模型架构。
- 多模型接口。 单一的Python类
TTS()可加载并运行不同的模型架构,包括基于VITS的单说话人和多说话人模型、基于Tacotron2的模型,以及声音克隆模型XTTS v2,无需更改周围的应用代码。 - 命令行合成。
tts命令行工具可直接从终端合成语音,使用tts --list_models列出所有可用的预训练模型。 - 通过XTTS v2进行声音克隆。 向已加载的XTTS v2模型传入
speaker_wav参数,即可从一段简短的参考音频克隆声音,并以XTTS v2支持的语言生成该克隆声音的语音。 - 丰富的预训练模型库。 该工具包提供对预训练模型的访问,据文档介绍,通过底层基于Fairseq的大规模多语言模型可覆盖1,100多种语言,此外还为特定语言提供质量更高的精选模型。
- 模型训练与微调。 除了运行预训练模型外,该工具包还包含训练脚本和数据集分析工具,用于构建或微调自定义语音模型——在Coqui AI的托管训练服务关闭之前,这在历史上是其使用最多的功能之一。
- XTTS v2的流式推理。 该工具包记录了XTTS v2的低延迟流式合成功能(维护中的分支文档称首个音频延迟低于200毫秒),适用于交互式语音应用。
Coqui TTS与XTTS v2的关系
Coqui TTS(工具包)与XTTS v2(模型)是两个各自拥有独立许可证的不同事物,混淆两者是常见的许可证错误。 Coqui TTS工具包——即Python包、CLI和训练代码——采用MPL-2.0许可证,这是一种宽松许可证,允许商业使用,但对工具包本身的修改附有源代码公开条件。XTTS v2是一个具体的预训练模型,其权重以Coqui Public Model License(CPML)分发,这是一种非商业许可证,与工具包的MPL-2.0许可证是分开的。
实际上,这意味着你可以将Coqui TTS工具包与宽松许可的模型一起用于商业用途(在兼容许可证下训练的VITS或Tacotron2模型),而"Coqui TTS工具包运行XTTS v2模型"这一特定组合,则会继承XTTS v2对该模型权重和输出的非商业限制。通过同一工具包运行另一个宽松许可的模型,不会带有该限制。
coqui-tts包直接记录了XTTS v2的使用方法**,模型通过TTS("tts_models/multilingual/multi-dataset/xtts_v2")加载,因为除了通过其他推理栈直接使用模型权重之外,该工具包是运行XTTS v2的主要受支持方式。有关该模型许可证和能力的完整分解,请参阅PromptQuorum专门的XTTS v2评测。
安装与运行Coqui TTS:分步指南
本指南将安装积极维护的coqui-tts包,并按照受维护分支自身README中记录的语法执行首次合成。
- 1安装受维护的包。
Why it matters: 在Python环境中运行`pip install coqui-tts`(如果使用uv,则运行`uv pip install coqui-tts`)。请专门安装`coqui-tts`包——而不是指向如今无人维护的原始仓库的旧包名`TTS`。 - 2列出可用的预训练模型。
Why it matters: 运行`tts --list_models`,即可看到按语言和架构(VITS、Tacotron2、XTTS等)组织的完整可下载预训练模型目录。 - 3从命令行合成语音。
Why it matters: 运行`tts --text "Hello world" --out_path output.wav`即可使用默认模型合成语音,或添加`--model_name <模型>`从列表中选择特定模型。 - 4(可选)使用Python API进行XTTS v2声音克隆。
Why it matters: 使用`TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)`加载模型,然后调用`.tts_to_file()`,传入指向简短参考音频的`speaker_wav`参数以及用于克隆声音的`language`参数。 - 5(可选)启用GPU加速。
Why it matters: 向`TTS()`构造函数传入`gpu=True`,或在已加载的模型对象上调用`.to("cuda")`,即可在NVIDIA GPU上运行推理——对于仅用CPU时明显较慢的XTTS v2尤为推荐。 - 6(可选)为XTTS v2非交互式地接受CPML许可证。
Why it matters: 首次加载XTTS v2会提示一个交互式的CPML接受步骤。设置环境变量`COQUI_TOS_AGREED=1`即可非交互式地接受它,这是在Docker容器或CI流水线中无人值守使用所必需的。
真实使用示例
除了上面的基本安装指南外,以下是来自受维护分支自身文档的常见实际使用模式。
- 为自动化环境非交互式接受CPML:在首次加载XTTS v2之前设置
COQUI_TOS_AGREED=1,这样Docker构建和CI流水线就不会卡在交互式提示上。 - 说话人与语言自检:加载多说话人或多语言模型后,
tts.speakers和tts.languages会列出已加载模型实际支持的内容——便于在合成前验证输入。
# 命令行:列出可用的预训练模型
tts --list_models
# 命令行:使用默认模型合成
tts --text "Hello world" --out_path output.wav
# 命令行:使用指定模型合成
tts --model_name "tts_models/en/ljspeech/tacotron2-DDC" \
--text "This is a test." --out_path output.wav
# Python API:基本合成
from TTS.api import TTS
tts = TTS("tts_models/en/ljspeech/tacotron2-DDC")
tts.tts_to_file(text="Hello world", file_path="output.wav")
# Python API:使用XTTS v2进行声音克隆(先非交互式接受CPML)
# export COQUI_TOS_AGREED=1
import torch
from TTS.api import TTS
device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)
tts.tts_to_file(
text="Hola, esto es una prueba.",
speaker_wav="reference_voice.wav",
language="es",
file_path="cloned_output.wav",
)
# Python API:列出已加载模型可用的说话人和语言
print(tts.speakers)
print(tts.languages)许可证与成本
Coqui TTS工具包采用MPL-2.0(Mozilla Public License 2.0)许可证,这一点通过PyPI上coqui-tts包发布的元数据以及idiap/coqui-ai-TTS仓库中的许可证文件得到确认。MPL-2.0是一种附带条件的宽松许可证:你可以将该工具包用于商业用途,但如果你修改并分发工具包自身的源文件,则必须将这些特定的修改文件同样以MPL-2.0发布。将工具包作为未修改的依赖项使用,不会使你自己的应用代码受MPL-2.0约束。
XTTS v2模型另外采用Coqui Public Model License(CPML)许可证,该许可证为非商业性质 —— 这适用于模型权重及其生成的音频输出,而不适用于运行它们的Coqui TTS工具包代码。有关该许可证的完整分解,请参阅PromptQuorum的XTTS v2评测。
Coqui TTS工具包本身没有付费方案、订阅或许可费用。 Coqui AI的付费托管服务已于2023年12月关闭,无论何种价格都不再提供;如今使用Coqui TTS的唯一方式是自托管,可以选择无人维护的原始包,也可以选择积极维护的coqui-tts分支。
Coqui TTS使用什么许可证?
Coqui TTS工具包本身采用MPL-2.0许可证,允许商业使用,条件是对工具包自身源文件的修改需以相同许可证发布。这与它所运行的任何特定模型的许可证是分开的——例如XTTS v2模型采用非商业性质的Coqui Public Model License(CPML),适用于模型权重和输出,而不适用于工具包代码。
Coqui TTS不适合哪些场景
Coqui TTS是一个灵活的多模型工具包,并非在每种使用场景下都是最快或最简单的选择。以下情况不适合使用它:
- 基于原始的、无人维护的仓库进行构建。 如果你运行
pip install TTS(原始包名)而不是pip install coqui-tts(受维护的分支),你所构建的代码自2024年8月起就没有获得过更新——在依赖某个教程或依赖项之前,请先确认它实际引用的是哪个包。 - 尽可能最快的纯CPU合成。 如果你的优先事项是在没有GPU的Raspberry Pi等入门级硬件上实现实时语音,Piper正是为此专门打造且部署更简单;Coqui TTS的更大模型,尤其是XTTS v2,仅用CPU时明显更慢。
- 未经单独许可证检查的商业声音克隆。 通过Coqui TTS工具包运行XTTS v2,仍然带有XTTS v2自身对模型权重和输出的非商业CPML限制——工具包的MPL-2.0许可证并不能凌驾于此之上。参见上方的"许可证与成本"一节。
- 长期有保障的企业支持。 Coqui AI这家公司自2023年12月起已不复存在。目前的分支由一家研究机构以社区方式维护,这与由资金充足、附带支持合同的公司维护是不同的维护模式——在做关键生产基础设施决策时应将此纳入考虑。
- 跨版本统一稳定的API。 由于开发在无人维护的原始版本和积极开发的分支之间转移,网上一些教程、Stack Overflow回答和博客文章仍引用较旧的API接口或原始包名——请以当前
coqui-tts文档为准,而非较旧的搜索结果。
Coqui TTS的替代方案
Piper
- 最适合:
- 最快的纯CPU合成,无声音克隆,在Raspberry Pi上实时运行
- 许可证:
- GPL-3.0-or-later
XTTS v2
- 最适合:
- 如果你只需要XTTS v2而不需要更广泛的工具包,则可直接使用该声音克隆模型本身
- 许可证:
- CPML(非商业)
Bark
- 最适合:
- 富有表现力的非语音音频——笑声、叹息、环境声音
- 许可证:
- MIT
StyleTTS 2
- 最适合:
- 最自然的英语朗读质量(无声音克隆)
- 许可证:
- MIT
ElevenLabs
- 最适合:
- 面向不想自托管、需要商业声音克隆的团队的托管云API
- 许可证:
- 专有(付费云API)
常见问题
Coqui TTS是什么?
Coqui TTS是一个源自Mozilla TTS研究项目的开源本地文本转语音与声音克隆工具包,最初由初创公司Coqui AI打造。它通过单一的Python接口和CLI支持多种模型架构,包括声音克隆模型XTTS v2。
Coqui TTS还在维护吗?
原始的coqui-ai/TTS仓库已不再积极维护——自公司Coqui AI于2023年12月关闭付费服务后,自2024年8月起没有新提交。积极维护的社区分支idiap/coqui-ai-TTS在Idiap研究所的支持下继续开发,并以coqui-tts包名发布在PyPI上,发布记录一直延续到2026年1月。
Coqui TTS是免费的吗?
是的,该工具包本身没有付费方案或许可费用。Coqui AI此前的付费托管服务已于2023年12月关闭,无论何种价格都不再提供。一些在该工具包上运行的特定模型,例如XTTS v2,拥有自己独立的许可证(CPML),限制该模型权重和输出的商业使用。
coqui-tts包和TTS包有什么区别?
TTS是原始的PyPI包名,与无人维护的coqui-ai/TTS仓库绑定,自2024年8月起没有更新。coqui-tts是积极维护的分支的包名,从Idiap研究所旗下的idiap/coqui-ai-TTS仓库发布,有定期发布记录,包括2026年1月的v0.27.5。安装coqui-tts可获得能持续接收更新的版本。
Coqui TTS支持声音克隆吗?
支持,通过该工具包可加载并运行的XTTS v2模型实现。XTTS v2会从作为speaker_wav参数传入的简短参考音频中克隆声音。请注意,XTTS v2自身的许可证——Coqui Public Model License(CPML)——为非商业性质,与工具包的MPL-2.0许可证是分开的。
为什么Coqui AI关闭了?
Coqui TTS背后的公司Coqui AI在未能于开源语音技术之上建立可持续商业模式后,于2023年12月宣布关闭其付费托管服务,其服务器于2023年12月11日下线。开源工具包本身仍保持可用,开发工作此后在社区分支中得以延续。
Coqui TTS的最新版本是什么?
根据PyPI页面显示,积极维护的coqui-tts包最新版本为v0.27.5,发布于2026年1月26日。
结论
Coqui TTS是一个非常有价值的案例研究,展示了当背后的公司关闭后开源基础设施会发生什么:原始仓库在2024年8月归于沉寂,但软件本身并未消失——一家研究机构接手了维护工作,重新命名了包,并持续发布版本直至2026年。对于今天评估它的任何人来说,实用的结论很简单:安装coqui-tts,而不是原始的TTS包,并要理解该工具包的MPL-2.0许可证与它可运行的XTTS v2模型的非商业CPML许可证是相互独立的。作为一个工具包,它的优势在于跨模型架构的灵活性,而不是在任何单一使用场景下都是最快或最简单的选择——为此,可将本评测与PromptQuorum关于Piper(速度方面)、专门针对克隆模型的XTTS v2,或涵盖所有引擎全貌的本地TTS许可证指南结合参考。
来源
- GitHub上的idiap/coqui-ai-TTS —— 积极维护的分支:README、文档、许可证及发布历史。
- PyPI上的coqui-tts —— 已发布的包元数据,包括当前的MPL-2.0许可证和版本历史。
- GitHub上的coqui-ai/TTS —— 如今无人维护的原始仓库(MPL-2.0许可证)。
- Hugging Face上的XTTS v2 —— 该声音克隆模型的模型卡片和CPML许可证正文。
- Idiap研究所 —— 维护该社区分支的瑞士研究机构。
