关键要点
- Piper:专为嵌入式/纯CPU硬件打造,不需要GPU,能在Raspberry Pi 4上实时运行。
- Kokoro(82M参数,Apache-2.0):语音质量更自然,但没有Pi实时基准记录——Pi 5比Pi 4更现实。
- Coqui TTS / XTTS v2:增加语音克隆,假定有GPU加速,不适合纯CPU的Pi。
- espeak-ng:最轻量的选项,听起来机械化,是备选而非首选。
- 在这些方案中,Pi 5(Cortex-A76,2.4GHz)的CPU明显快于Pi 4(Cortex-A72,最高1.8GHz)。
- Piper安装只需一条命令:
pip install piper-tts,然后下载一个语音模型。
📍 简单一句话
Piper是Raspberry Pi上最好的本地TTS引擎,因为它在离线语音助手项目Rhasspy内部专为纯CPU的嵌入式硬件打造,不需要GPU,也正因如此是Home Assistant默认的本地语音;Kokoro听起来更自然,但没有针对Pi的实时基准记录,而Coqui TTS/XTTS v2假定有GPU加速。
💬 简单来说
如果你想让Raspberry Pi在没有网络连接的情况下开口说话,Piper正是为这项任务而生的工具——安装、下载一个语音包,它就能在一块35美元起的开发板上实时说话。更高级的选项(Kokoro、XTTS v2)听起来更好,但设计时并未考虑Raspberry Pi有限的CPU能力。
📌注: 本指南只涉及纯CPU合成速度和Pi适配性,不涉及语音克隆。关于语音克隆,请参阅PromptQuorum专门的XTTS v2评测,其中明确指出不推荐在Pi级CPU上使用。
TTS引擎适配Raspberry Pi需要具备哪些条件?
一款适配Raspberry Pi的TTS引擎需要不依赖GPU即可运行,模型和运行时要能装进几百MB的RAM,并且要在四核ARM CPU上以快于实时的速度生成音频。 Raspberry Pi没有值得用于TTS推理的独立GPU——这里列出的每个引擎都运行在CPU上,因此决定成败的关键在于每款引擎针对这一约束条件的构建效率,而不是孤立的模型质量本身。
- 不依赖GPU。 Raspberry Pi没有支持CUDA的GPU;任何为达到可接受速度而假定有GPU加速的引擎,即便技术上能以CPU方式作为后备运行,也不适合实时使用。
- RAM占用。 Raspberry Pi 4总共最多8GB RAM,还要与操作系统及其他正在运行的服务(Home Assistant、唤醒词检测器)共享;一款仅加载就需要多GB内存的TTS引擎,几乎不会给其他任务留下空间。
- 安装复杂度。 一条带预编译ARM wheel的
pip install,与一个期望GPU导向依赖链(CUDA、cuDNN,而这些在Pi上并不适用)的工具包,完全是两回事。 - 语音质量的取舍。 这份列表中的每款引擎都在用一定质量换取速度;关键在于哪种取舍适合你的用例——智能音箱播报所需的质量与语音克隆项目不同。
Piper对比Kokoro对比Coqui TTS/XTTS v2对比espeak-ng的Pi适配性
除了原始语音质量(Kokoro和XTTS v2在此领先)之外,Piper在每一项Pi专属指标上得分最高。 下表按照对Raspberry Pi部署真正重要的四项标准对每款引擎打分,而不是桌面或服务器硬件上的通用TTS基准测试。
引擎 | RAM占用 | 纯CPU可行性 | 安装复杂度 | 语音质量 |
|---|---|---|---|---|
| Piper | 低(模型文件通常每个语音远小于100MB) | 专为此设计;广泛报告能在Pi 4上实时运行 | 一条命令:pip install piper-tts | 良好,神经网络语音足够自然;不支持克隆 |
| Kokoro | 中等(8200万参数模型,约327MB权重) | 可在CPU上运行;无Pi实时基准记录 | Python包+模型下载;依赖项比Piper更多 | 更高——位居独立TTS质量排行榜前列 |
| Coqui TTS / XTTS v2 | 高;有据可查的延迟数据均假定使用GPU显存 | 差;PromptQuorum自己的XTTS v2评测指出纯CPU的Pi使用不切实际 | 工具包安装加许可协议(XTTS v2为CPML) | 最高——支持17种语言的6秒语音克隆 |
| espeak-ng | 极小(几MB) | 轻而易举;能在包括微控制器在内的几乎任何硬件上运行 | 通过大多数Linux包管理器即可直接获取 | 机械化的共振峰合成音——不是自然语音 |
Piper为何是Raspberry Pi的默认推荐
Piper之所以成为默认推荐,是因为它正是为这一硬件类别而设计的,而不是事后适配上去的。 它诞生于开源工具包Rhasspy内部,该项目致力于构建完全离线运行的语音助手——其整个前提就是在本地、往往配置不高的硬件(包括Raspberry Pi开发板)上运行语音识别和合成,无需往返云端API。
- 为嵌入式和资源受限设备打造。 Piper采用神经网络化的VITS风格架构,导出为ONNX Runtime以实现快速的CPU推理——这是针对没有GPU可退而求其次的硬件所做的刻意选择。
- 至今仍是Home Assistant的默认选项。 Piper是Home Assistant语音管道中默认的本地文本转语音引擎,由维护Home Assistant的同一家非营利组织Open Home Foundation负责维护——而大量Home Assistant安装都运行在Raspberry Pi上。
- 从不需要GPU。 桌面硬件上存在可选的CUDA GPU加速以获得更高吞吐量,但并非必需——Piper的设计目标就是仅靠CPU实时运行。
- 没有语音克隆——而是固定的语音库。 Piper提供覆盖20多种语言的数十种预训练语音,而不是从样本中克隆语音;相较于XTTS v2,这是一项真实的取舍,但也正是这一点让Piper的资源占用足够小,能装进Raspberry Pi。
Kokoro:更高质量,更高成本
Kokoro是一款8200万参数、Apache-2.0许可的TTS模型,源自StyleTTS2,能生成明显比Piper更自然的语音,但其真实的资源成本尚未针对Raspberry Pi硬件专门做过记录。 与Piper不同,Kokoro并非以嵌入式ARM设备为主要目标构建——它的构建目标是相对于更大的TTS模型,在通用硬件上做到更小更快,这与专门针对Raspberry Pi CPU的实时性能是不同的设计目标。
- 82M参数,约327MB权重。 相比大型语音克隆模型,这个体积算小,但相比通常远小于100MB的单个Piper语音,仍然明显更重。
- Apache-2.0许可。 宽松且对商业友好——不像XTTS v2那样有CPML式的非商业限制。
- 没有Raspberry Pi的实时基准记录。 PromptQuorum未能找到已发表、有据可查的基准测试,证明Kokoro能专门在Raspberry Pi 4或Raspberry Pi 5硬件上实时运行。在自己完成基准测试之前,应将Kokoro在Pi上的任何实时性说法视为未经验证。
- Raspberry Pi 5是更现实的目标。 其2.4GHz的Cortex-A76 CPU比Raspberry Pi 4的Cortex-A72提供明显更多的算力,这对Kokoro这样较重的模型比对更轻量的Piper更为重要。
Coqui TTS与XTTS v2:何时需要语音克隆
Coqui TTS及其XTTS v2模型只需短至6秒的参考音频即可增加语音克隆功能,但两者都假定有GPU加速,并不适合纯CPU的Raspberry Pi硬件。 如果你的项目确实需要克隆特定语音,而不是使用预训练语音,这是本清单中唯一能做到这一点的选项——但请计划在别处运行它,再把音频流式传输到Pi,而不是在Pi本身上运行。
- XTTS v2可从6秒音频克隆语音,支持17种语言,依据其官方Hugging Face模型卡——安装命令和许可细节请参阅PromptQuorum的XTTS v2完整评测。
- 强烈建议使用GPU,纯CPU对实时应用并不实用,这是PromptQuorum自己的XTTS v2评测得出的结论——Raspberry Pi没有独立GPU,因此在设备上实时运行XTTS v2推理并不现实。
- XTTS v2的许可协议——Coqui公共模型许可(CPML)——为非商业性质,这是与硬件适配性分开的一项考量。完整对比请参阅本地TTS许可指南。
- 需要克隆语音的Pi项目常见做法: 在一台配有GPU、独立常驻运行的服务器或桌面机上运行XTTS v2,在那里生成音频,再将生成的音频文件或流发送到Raspberry Pi播放——而不是在Pi本身上执行推理。
espeak-ng:轻量级备选方案
espeak-ng是一款几乎能在任何硬件(包括微控制器)上运行的共振峰合成TTS引擎,但听起来机械化,而非自然。 它比这份清单中的神经网络TTS引擎早出现了十多年,在语音质量上算不上真正的竞争者——之所以列入,是因为它是底线:几乎没有任何资源要求的选项。
- 几乎能在任何设备上运行。 espeak-ng只需几MB内存,也不需要神经网络运行时,即使在规格远低于Raspberry Pi的硬件上也能使用。
- 听起来机械化。 它的共振峰合成方法——依据声学规则而非训练过的神经网络模型生成语音——产生的语音可理解,但明显带有合成感,不适合追求自然感的语音助手或播报系统。
- 仍可作为音素转换工具使用。 Piper自身在文本转音素环节内部就使用了espeak-ng,不过Piper自己的音频输出来自其神经网络模型,而非直接来自espeak-ng。
- 仅在RAM或CPU极度受限、连Piper都无法运行时选择,例如微控制器级别的设备,而非Raspberry Pi。
如何在Raspberry Pi上安装Piper
在Raspberry Pi上安装Piper只需一条pip install命令,再下载一个语音模型——不需要GPU驱动、不需要CUDA、不需要编译步骤。 这些命令与PromptQuorum的Piper TTS专门评测中记录的相同,这里专门应用于运行Raspberry Pi OS(或其他基于Debian的ARM Linux发行版)的Raspberry Pi。
- 1更新系统并安装Python 3
Why it matters: 较新版本的Raspberry Pi OS镜像已预装Python 3,但在安装任何新软件前,先运行`sudo apt update && sudo apt upgrade`,确保pip和系统包是最新的。 - 2用pip安装Piper
Why it matters: 运行`pip install piper-tts`(视镜像而定,也可能是`pip3 install piper-tts`)。这会安装`piper`包及其ONNX Runtime依赖项——预编译的ARM wheel意味着在Raspberry Pi上无需编译步骤。 - 3下载一个语音模型
Why it matters: 运行`piper --download-dir voices --update-voices --voice en_US-lessac-medium`(可替换为Hugging Face上Piper语音库中的任意语音)。中等质量的语音是Raspberry Pi上合适的默认选择——它比高质量语音更快,而在普通扬声器上输出差异可以忽略不计。 - 4从文本生成语音
Why it matters: 从命令行将文本传给Piper,例如`echo "Hello from the Raspberry Pi." | piper --model voices/en_US-lessac-medium.onnx --output_file output.wav`,然后用`aplay output.wav`播放生成的WAV文件。 - 5将其接入项目
Why it matters: 要构建完整的语音助手管道(唤醒词、语音识别、LLM以及负责回复的Piper),请参阅PromptQuorum的[离线语音助手分步构建指南](/zh/power-local-llm/build-local-voice-assistant-2026);对于Home Assistant,Piper已经是语音管道设置中默认的TTS引擎。
TTS场景下的Raspberry Pi 4对比Raspberry Pi 5
Raspberry Pi 5的CPU明显快于Raspberry Pi 4,这对Kokoro这类较重的引擎比对本已轻量的Piper更为重要。 两款开发板都能实时运行Piper,但一旦考虑更重的方案,CPU差距就会拉开现实可行的选项范围。
- Raspberry Pi 4: 四核Arm Cortex-A72 CPU,最高1.8GHz,RAM配置最高8GB。足以支持Piper的实时合成;对Kokoro或XTTS v2的实时运行而言不是现实的目标。
- Raspberry Pi 5: 四核Arm Cortex-A76 CPU(BCM2712),2.4GHz,RAM配置最高16GB——相比Raspberry Pi 4有记录在案的2至3倍CPU性能提升。如果想尝试用Kokoro替代Piper,这是应该选择的开发板。
- 两款开发板都没有改变GPU加速的局面。 两者都缺少独立、支持CUDA的GPU,因此在这两代产品上,Coqui TTS和XTTS v2在设备上实时推理都仍不现实。
- RAM的重要性不止于TTS引擎本身。 如果同一块板子还要运行Home Assistant、唤醒词检测器,或用于完整语音助手管道的本地LLM,轻量级引擎(Piper,其次是espeak-ng)会为这些其他进程留出比Kokoro或Coqui TTS更多的余量。
常见问题
Raspberry Pi上最好的本地TTS引擎是什么?
对大多数使用场景而言,Piper是Raspberry Pi上最好的本地TTS引擎。它诞生于离线语音助手项目Rhasspy内部,专为纯CPU的嵌入式硬件打造,不需要GPU,也正因如此仍是Home Assistant默认的本地TTS引擎。它被广泛报告能在Raspberry Pi 4上实时运行。
Piper在Raspberry Pi上运行需要GPU吗?
不需要。Piper的设计目标是在包括Raspberry Pi在内的纯CPU硬件上实时运行。桌面硬件上存在可选的CUDA GPU加速以获得更高吞吐量,但并非必需,而且Raspberry Pi本来就没有可用于此的独立GPU。
Kokoro能在Raspberry Pi上实时运行吗?
PromptQuorum未能找到专门针对Raspberry Pi硬件的、有据可查的实时基准测试。Kokoro是一款8200万参数的模型,总体上可以在CPU上运行,但它并未像Piper那样专为嵌入式ARM设备打造。在配备更快Cortex-A76 CPU的Raspberry Pi 5上测试,比在Raspberry Pi 4上测试更现实——在将其用于实时交互场景之前,请自行完成基准测试。
为什么不在Raspberry Pi上用XTTS v2做语音克隆?
XTTS v2要达到其记录在案的低延迟性能,需要依赖GPU加速,而PromptQuorum自己对XTTS v2的评测指出,纯CPU使用对实时应用并不实用。Raspberry Pi没有独立GPU,因此在设备上实时运行XTTS v2推理并不现实。一种常见的变通方法是在配有GPU的独立服务器上运行XTTS v2,再将生成的音频流式传输到Raspberry Pi。
Piper可以免费用于商业用途吗?
目前处于活跃维护状态的Piper代码库OHF-Voice/piper1-gpl采用GPL-3.0-or-later许可,这是相对于最初的、现已归档的rhasspy/piper代码库所用MIT许可的变更。GPL-3.0允许将Piper作为工具用于商业用途,但如果你分发对Piper自身源代码所做的修改,则要求以相同许可发布。完整的许可历史请参阅PromptQuorum的Piper TTS完整评测——本文不构成法律建议。
在文本转语音方面,Raspberry Pi 4和Raspberry Pi 5有什么区别?
Raspberry Pi 5采用四核Arm Cortex-A76 CPU(BCM2712),主频2.4GHz,RAM配置最高16GB,相比Raspberry Pi 4最高1.8GHz、RAM最高8GB的四核Cortex-A72,有记录在案的2至3倍CPU性能提升。两者都能实时运行Piper;如果想尝试Kokoro这样更重的引擎,Pi 5多出的余量会更重要。
Piper支持英语以外的语言吗?
支持。Piper提供覆盖20多种语言的预训练语音,不过它并不会克隆特定人物的声音——它按语言使用固定的预训练语音,而不是像XTTS v2那样从样本中克隆。
espeak-ng是什么,什么时候应该用它代替Piper?
espeak-ng是一款几乎能在任何硬件上运行的共振峰合成TTS引擎,包括规格低于Raspberry Pi的设备,但听起来机械化,而非自然。仅在RAM或CPU极度受限、连Piper都无法运行时才使用它——对大多数Raspberry Pi项目来说,Piper是更好的默认选择。Piper自身在文本转音素环节内部也使用了espeak-ng。
Piper在Raspberry Pi上需要多少RAM?
Piper每个语音的模型文件通常远小于100MB,该引擎运行时不需要多GB的RAM,这在总共只有2GB RAM、还要与操作系统及其他运行中服务共享的Raspberry Pi 4上是一项实实在在的优势。
结论
在Raspberry Pi上进行本地文本转语音,Piper是正确的默认选择,而且这不是一个势均力敌的决定:它在离线语音助手项目Rhasspy内部专为纯CPU的嵌入式硬件而设计,不需要GPU,一条命令即可安装,也正因如此仍是Home Assistant默认的本地语音。如果语音质量比保证的实时响应更重要,可以改用Kokoro,但要先在你的具体Raspberry Pi型号上亲自做基准测试——它记录在案的实时性能是在通用硬件上取得的,而非专门针对Pi级ARM开发板。只有在你确实需要语音克隆时才使用Coqui TTS或XTTS v2,并计划在配有GPU的独立机器上而非Pi本身上运行推理。只有在硬件连Piper都难以承受时,才将espeak-ng作为最后手段。如果拿不定主意,就从Piper开始——它正是为这类硬件而打造的工具。
资料来源
- Piper TTS评测 — PromptQuorum的完整评测,包含许可历史、安装命令和Home Assistant集成方式。
- GitHub上的OHF-Voice/piper1-gpl — Open Home Foundation旗下持续活跃维护的Piper代码库。
- Hugging Face上的Kokoro-82M — 官方模型卡:参数量、许可协议和架构。
- XTTS v2评测 — PromptQuorum的评测,包含本文引用的纯CPU性能和许可注意事项。
- Raspberry Pi 5产品页面 — BCM2712处理器和RAM配置的官方规格。
- 构建完全离线的语音助手 — PromptQuorum的分步指南,包含Whisper+LLM+Piper完整管道在Raspberry Pi 5上的实测延迟。
