Skip to main content
PromptQuorum
主页/本地LLM进阶/Piper vs Kokoro TTS(2026):该用哪个本地语音引擎?
Voice, Speech & Multimodal

Piper vs Kokoro TTS(2026):该用哪个本地语音引擎?

·阅读约11分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

如果需要两者中速度更快、资源占用更低的本地文本转语音引擎,用 Piper——它可以在没有 GPU 的树莓派上实时运行。如果音质比纯速度更重要,用 Kokoro——其 8200 万参数模型在 CPU 上运行的同时能生成明显更自然的音频。 Piper 采用 GPL-3.0-or-later 许可证(其原始的已归档仓库为 MIT 许可);Kokoro 采用 Apache-2.0 许可证。两款引擎都不能从样本片段克隆声音——都提供固定的预训练声音集合。如需声音克隆,请改为参考 PromptQuorum 的 XTTS v2 评测

Piper 和 Kokoro 是两款开放权重、完全本地运行的文本转语音引擎,解决的是不同的问题:Piper 最初在 Rhasspy 语音助手项目中开发,现由 Open Home FoundationOHF-Voice/piper1-gpl 维护,是两者中速度更快、资源占用更低的选项,在没有 GPU 的树莓派上也能流畅运行。Kokoro 是化名开发者 hexgrad 发布的一款 8200 万参数模型,以牺牲部分纯效率为代价换取明显更自然的音质,同时体量仍小到可以在 CPU 上运行。两款引擎都不能从简短音频样本中克隆声音——都只提供固定的预训练声音集合。本文比较真实的安装命令、现行许可证、硬件要求,以及各自适合的使用场景。

Piper vs Kokoro TTS(2026):该用哪个本地语音引擎?

关键要点

  • Piper:最初源自 Rhasspy/Home Assistant 生态系统,现由 Open Home Foundation 维护;基于 ONNX Runtime;在无 GPU 的树莓派上运行流畅。
  • Kokoro:hexgrad 发布的 8200 万参数模型,源自 StyleTTS2 与 ISTFTNet,采用 Apache-2.0 许可证;在 CPU 或一般 GPU 上表现良好。
  • 两款引擎都不支持零样本声音克隆;都提供固定的预训练声音集合。
  • Piper 许可证:GPL-3.0-or-later(现行仓库);原始的已归档仓库为 MIT 许可。Kokoro 许可证:Apache-2.0。
  • Piper 在纯速度和最低资源占用上占优;Kokoro 在社区听感对比中被广泛认为更自然。
  • 嵌入式/边缘设备和语音助手用 Piper;当音质比压缩到最小硬件更重要时用 Kokoro。

📍 简单一句话

Piper 是更快、更轻量的本地文本转语音引擎,可在无 GPU 的树莓派上运行(GPL-3.0-or-later 许可证);Kokoro 是一款 8200 万参数的开放权重模型(Apache-2.0),以少量速度换取明显更自然的音频;两者都不能从样本克隆声音。

💬 简单来说

两者都完全在你自己的电脑上把文本变成语音,不调用云端 API。Piper 更小更快,因此可以在树莓派这类廉价硬件上运行,但听起来稍显机械。Kokoro 是稍大一些的模型,听起来明显更接近人声,代价是需要多一点计算能力。

📌: Piper 和 Kokoro 都不能从简短参考片段克隆声音。如需此功能,请参考 PromptQuorum 的 XTTS v2 评测——需要注意的是,与 Piper 和 Kokoro 不同,XTTS v2 的许可证是非商业性质的。

两款引擎究竟是什么

Piper 和 Kokoro 解决的是同一个基本问题——在本地硬件上把文本转换为语音,且数据不离开设备——但两者的技术脉络不同,在体量与音质之间的取舍也不同。

  • Piper 是一款神经网络文本转语音引擎,最初由 Michael Hansen 在 Rhasspy(一个面向离线语音助手的开源工具包)中创建。它使用 espeak-ng 将文本转换为音素,再用一个 VITS 风格的模型从这些音素合成波形,该模型被导出为 ONNX Runtime 格式以实现快速推理,包括在纯 CPU 硬件上。它已成为 Home Assistant 语音管线中默认的本地 TTS 引擎,目前由 Open Home FoundationOHF-Voice/piper1-gpl 维护。PromptQuorum 在一篇专门的 Piper 评测中作了完整介绍。
  • Kokoro 是一款开放权重的 TTS 模型,拥有 8200 万参数,由化名 hexgrad 的开发者发布在 Hugging Face。其架构基于 StyleTTS 2,搭配 ISTFTNet 声码器,采用纯解码器设计,没有扩散步骤——比许多参数量更高的 TTS 模型的管线更小、更简单。根据其 Hugging Face 模型卡,它使用数百小时具有宽松许可或属于公共领域的音频训练,1.0 版本于 2025 年 1 月 27 日发布。
  • 两款模型都不能从简短参考片段克隆声音。 Piper 和 Kokoro 各自提供一组固定的、可供选择的预训练声音——这与像 XTTS v2 这样的声音克隆模型(能从 6 秒样本音频合成一个全新声音,但许可证为非商业性质)是根本不同的能力。
  • 两者都完全离线运行,在你自己的硬件上。 两款引擎都不会把文本或音频发送到云端 API——整个合成管线都在本地运行,这对隐私敏感的应用以及避免按字符计费的云端 TTS 费用都很重要。

Piper vs Kokoro:并排对比

Piper 在速度和最小硬件占用上占优;Kokoro 在感知音质上占优。 下表总结了两者真实的权衡——请把"语音质量"一行当作一种定性的、被广泛报告的社区印象,而非具体的基准分数,因为 PromptQuorum 未能找到一份权威的、直接对比两者的单一数值基准测试。

起源/维护方

Piper:
Rhasspy 项目 → Open Home Foundation
Kokoro:
独立开发者(hexgrad)

参数量

Piper:
未公布单一代表数字(VITS 风格,按声音分别建模)
Kokoro:
8200 万参数

架构

Piper:
VITS 风格,ONNX Runtime
Kokoro:
StyleTTS 2 + ISTFTNet,纯解码器

许可证

Piper:
GPL-3.0-or-later(现行仓库)
Kokoro:
Apache-2.0

硬件需求

Piper:
仅 CPU,在树莓派上实时运行
Kokoro:
CPU 或一般 GPU

语音质量(社区反馈)

Piper:
速度快,就其体量而言表现不错,偏机械感
Kokoro:
被广泛认为更自然/更富表现力

声音克隆

Piper:
不支持——固定的预训练声音
Kokoro:
不支持——固定的预训练声音

安装

Piper:
pip install piper-tts
Kokoro:
pip install kokoro

真实使用示例

以下命令遵循各项目自己文档记录的安装和 API 模式。部署前请查阅各项目当前的 GitHub/Hugging Face 文档,因为 CLI 参数和包名可能在不同版本间发生变化。

  • Piper 启动更快。 其按声音划分的 ONNX 模型加载迅速,在 CPU 上合成几乎瞬时完成,因此常被用于受限硬件上的交互式语音助手。
  • Kokoro 的管线将合成结果按块分组(上文的 gs/ps/audio 三元组),这一点值得了解,以免误以为对长文本单次调用会返回一个连续的音频缓冲区。
python
# ── Piper:安装与合成 ─────────────────────────────
pip install piper-tts
python3 -m piper.download_voices en_US-lessac-medium
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."

# Piper Python API
from piper import PiperVoice
voice = PiperVoice.load("en_US-lessac-medium.onnx")
with open("test.wav", "wb") as wav_file:
    voice.synthesize_wav("Fast, local speech synthesis.", wav_file)

# ── Kokoro:安装与合成 ────────────────────────────
pip install kokoro soundfile

# Kokoro Python API(参考 Hugging Face 上的 hexgrad/Kokoro-82M)
from kokoro import KPipeline
import soundfile as sf

pipeline = KPipeline(lang_code="a")  # "a" = 美式英语
generator = pipeline(
    "Kokoro produces noticeably natural-sounding speech from a small model.",
    voice="af_heart",
)
for i, (gs, ps, audio) in enumerate(generator):
    sf.write(f"output_{i}.wav", audio, 24000)

许可证与成本

Piper 目前积极维护的仓库 OHF-Voice/piper1-gpl 采用 GPL-3.0-or-later 许可证。 这相较于原始的 rhasspy/piper 仓库是一个变化——后者在 2025 年 10 月 6 日被归档(设为只读)前采用 MIT 许可证,归档后仍可在该 MIT 许可证下获取,但已不再维护。GPL-3.0 是一种 copyleft 许可证:你可以免费使用 Piper 来生成语音,包括商业用途,但如果你分发经过修改的 Piper 自身源代码版本,就必须以相同的 GPL-3.0 条款公开该修改。将 Piper 作为未修改的外部工具使用(其 CLI、Python 包,或作为独立进程调用的 Web 服务器)一般不会使你应用的其余部分落入 GPL 范畴,但确切边界取决于你的代码与 Piper 代码的耦合程度——这不是法律建议,具体部署请咨询律师。

Kokoro 采用 Apache-2.0 许可证,这在其 Hugging Face 模型卡 中得到确认。Apache-2.0 是一种没有 copyleft 义务的宽松许可证——你可以使用、修改和再分发 Kokoro,包括用于闭源商业产品,而无需公开自己的源代码,但须遵守该许可证标准的署名和专利授权条款。

两款引擎都没有付费层级、订阅或许可费用。 唯一的成本是你运行它们所用的硬件和自己的开发时间。如果你想要的是一个带商业声音克隆的托管付费云端 TTS API,请参考 PromptQuorum 的 ElevenLabs 与本地 TTS 对比

Kokoro TTS 可以免费商用吗?

可以。Kokoro 采用 Apache-2.0 许可证,这是一种没有 copyleft 义务的宽松许可证,因此可以在闭源商业产品中使用,而无需公开你自己的源代码,但须遵守该许可证标准的署名和专利授权条款。这不是法律建议——商业部署前请自行阅读 Apache-2.0 许可证。

Piper 可以免费商用吗?

可以,使用 Piper 生成语音可免费商用。其现行许可证 GPL-3.0-or-later 是一种 copyleft 许可证,只有在你分发经过修改的 Piper 自身源代码版本时才会施加条件——将其作为外部工具使用,一般不会使你自己应用的其他代码落入 GPL 范畴。这不是法律建议——具体部署请咨询律师。

谁该用哪个

在 CPU 周期或内存高度受限的嵌入式设备、语音助手及任何部署场景中,选 Piper。 当音质是首要考虑,且你至少有一般水平的 CPU 或 GPU 预算可投入时,选 Kokoro。

  • 以下情况选 Piper: 你在树莓派或类似受限设备上运行、需要到第一段音频的延迟尽可能低,或正在与 Home Assistant 的语音管线集成(Piper 是其默认的本地 TTS 引擎)。
  • 以下情况选 Kokoro: 你在制作有声书、配音,或任何听众会察觉到机械感语音的内容,且拥有超出绝对最低限度的 CPU 或 GPU 余量。
  • 以下情况两者都不选,改为参考 XTTS v2: 你需要从简短参考片段克隆特定人物的声音——Piper 和 Kokoro 都只使用固定的预训练声音,都不支持声音克隆。支持克隆的替代方案及其许可证,请参考 PromptQuorum 的 XTTS v2 评测(非商业许可证)或 本地 TTS 许可证指南
  • 以下情况两者都不选,改为参考 ElevenLabs 对比: 你需要许可证明确的商业级声音克隆,且不想自行托管。请参考 PromptQuorum 的 ElevenLabs 与本地 TTS 对比。

两者都不适合的场景

Piper 和 Kokoro 都是固定声音、不支持克隆的 TTS 引擎。对以下场景,两者都不是合适的工具:

  • 从样本片段克隆特定人物的声音。 两款引擎都只提供预训练声音——两者都没有从简短参考录音生成一个从未听过的新声音的机制。请改为参考 XTTS v2,并注意其非商业许可证。
  • 富有情感表现力的非语音音频(笑声、叹息、环境音)。 两款引擎都只合成语音,并不涉及像 Bark 这类模型所面向的更广泛的表现性音频范围。
  • 不计资源成本的最高音频保真度。 对于特别希望获得最高质量英语配音、且不受资源限制的读者,PromptQuorum 的 StyleTTS 2 评测 介绍了一款底层架构与 Kokoro 相当、但体量/音质取舍不同的模型。
  • 在修改 Piper 自身源代码的闭源产品中使用 GPL-3.0 代码库。 如果你的部署计划涉及分叉或静态链接修改过的 Piper 源代码到闭源二进制文件中,Piper 现行的 GPL-3.0-or-later 许可证会构成实质性限制——Kokoro 的 Apache-2.0 许可证没有这一限制。

替代方案

XTTS v2

最适合:
从 6 秒参考音频克隆声音
许可证:
CPML(非商业)

Coqui TTS 工具包

最适合:
运行 XTTS v2 及其他模型的软件
许可证:
MPL-2.0(仅工具包)

Bark

最适合:
富有表现力的非语音音频——笑声、叹息、环境音
许可证:
MIT

StyleTTS 2

最适合:
最自然的英语配音(不支持声音克隆)
许可证:
MIT

ElevenLabs

最适合:
带商业声音克隆的托管云端 API
许可证:
专有(付费云端 API)

常见问题

Piper 和 Kokoro TTS 的主要区别是什么?

Piper 是一款轻量、完全本地的神经网络 TTS 引擎,针对速度和最低资源占用做了优化——可在包括树莓派在内的纯 CPU 硬件上实时运行。Kokoro 是一款 8200 万参数的开放权重模型,能生成明显更自然的音频,代价是需要多一点计算能力,但仍可在 CPU 或一般 GPU 上运行。

Piper 和 Kokoro,哪个听起来更自然?

在社区听感对比中,Kokoro 被广泛认为比 Piper 更自然。PromptQuorum 未能找到一份权威、经独立验证、直接对比两款引擎的单一数值基准测试——因此请把这视为一种定性的、被广泛报告的社区印象,而非经过测量的分数。

Piper 或 Kokoro 支持声音克隆吗?

不支持。两款引擎都只提供一组固定的预训练声音供你选择——都不能从简短的参考音频样本克隆出新声音。如需声音克隆,请参考 PromptQuorum 的 XTTS v2 评测,并注意其非商业许可证。

我可以在没有 GPU 的情况下运行 Kokoro 吗?

可以。拥有 8200 万参数的 Kokoro 可在 CPU 上运行,不过一般水平的 GPU 能加快合成速度。它不像许多更大的 TTS 或声音克隆模型那样需要 GPU 硬件。

Piper 可以在树莓派上运行吗?

可以——在树莓派上进行纯 CPU 实时合成是 Piper 的主要设计目标之一,它也是 Home Assistant 语音管线中默认的本地文本转语音引擎,而该管线经常运行在树莓派硬件上。

Kokoro 使用什么许可证?

Kokoro 采用 Apache-2.0 许可证,这是一种没有 copyleft 义务的宽松许可证,已在其 Hugging Face 模型卡中确认。它可以用于闭源商业产品,而无需公开你自己的源代码,但须遵守该许可证标准的署名和专利授权条款。

Piper 使用什么许可证?

Piper 目前积极维护的仓库(OHF-Voice/piper1-gpl)采用 GPL-3.0-or-later 许可证。原始的、现已归档的 rhasspy/piper 仓库采用 MIT 许可证。GPL-3.0 只有在你分发经过修改的 Piper 自身源代码版本时才会施加条件;将 Piper 作为外部工具使用,一般不会使你自己的应用落入 GPL 范畴。

Piper 和 Kokoro 由谁维护?

Piper 最初由 Michael Hansen 在 Rhasspy 语音助手项目中创建;目前的积极开发由 Home Assistant 背后的非营利组织 Open Home Foundation 维护。Kokoro 由化名 hexgrad 的开发者发布,并通过 Hugging Face 分发。

Piper 和 Kokoro 支持多少种语言?

根据其 Hugging Face 模型卡,Kokoro 内置的 54 种声音涵盖 8 个语言/口音组,包括美式和英式英语、西班牙语、法语、印地语、意大利语、日语、巴西葡萄牙语和普通话。Piper 的声音库更大、也更分散——数十种语言和地区变体由不同社区成员贡献,各声音质量参差不齐。

结论

Piper 和 Kokoro 争夺的并不是完全相同的用途。当约束条件是硬件时——树莓派、嵌入式设备,或必须仅凭 CPU 就能即时响应的语音助手——Piper 是正确选择,而且只要你不再分发修改过的 Piper 源代码,其 GPL-3.0-or-later 许可证在商业使用上也是免费的。当约束条件是音质时,Kokoro 是正确选择:以 8200 万参数而言它依然体量小、对 CPU 友好,但社区听感对比一致认为它比 Piper 更自然,而且其 Apache-2.0 许可证完全没有 copyleft 限制。两款工具都不能从样本片段克隆声音——如果这才是你的真实需求,那么这篇对比文章给不了答案;请改为参考 PromptQuorum 的 XTTS v2 评测,或参考托管商业方案的 ElevenLabs 对比。如果拿不准,先从 Piper 开始,它安装最顺畅、结果最快,若输出质量达不到你的标准,再转向 Kokoro。

信息来源

← 返回 本地LLM进阶