Skip to main content
PromptQuorum
主页/本地LLM进阶/Raspberry Pi最佳本地TTS引擎(2026)
Voice, Speech & Multimodal

Raspberry Pi最佳本地TTS引擎(2026)

·阅读约13分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

Piper是Raspberry Pi上最好的本地文本转语音引擎。 它是一款基于ONNX Runtime的神经网络TTS引擎,由Michael Hansen在离线语音助手项目Rhasspy内部专为资源受限的嵌入式硬件打造,不需要GPU,也正因如此它至今仍是Home Assistant的默认本地语音。使用pip install piper-tts即可安装。如果想以真实的资源成本换取更高的语音质量,请参阅下方的KokoroCoqui TTS/XTTS v2部分——两者都更重,且在Pi级CPU上的可靠性证据更少。

为Raspberry Pi选择本地文本转语音引擎,意味着为一块仅有CPU、内存受限的ARM开发板做选择——而不是为桌面GPU做选择。Piper正是这类硬件的明确首选:它诞生于离线语音助手项目Rhasspy内部,专为在Raspberry Pi这样的设备上实时运行而打造,至今仍是Home Assistant语音管道中默认的本地TTS引擎。本指南将Piper与现实可行的替代方案进行比较——KokoroCoqui TTS工具包XTTS v2,以及更老旧的espeak-ng合成器——专门针对Pi适配性打分:RAM占用、纯CPU可行性、安装复杂度,以及语音质量的取舍。

Raspberry Pi最佳本地TTS引擎(2026)

关键要点

  • Piper:专为嵌入式/纯CPU硬件打造,不需要GPU,能在Raspberry Pi 4上实时运行。
  • Kokoro(82M参数,Apache-2.0):语音质量更自然,但没有Pi实时基准记录——Pi 5比Pi 4更现实。
  • Coqui TTS / XTTS v2:增加语音克隆,假定有GPU加速,不适合纯CPU的Pi。
  • espeak-ng:最轻量的选项,听起来机械化,是备选而非首选。
  • 在这些方案中,Pi 5(Cortex-A76,2.4GHz)的CPU明显快于Pi 4(Cortex-A72,最高1.8GHz)。
  • Piper安装只需一条命令:pip install piper-tts,然后下载一个语音模型。

📍 简单一句话

Piper是Raspberry Pi上最好的本地TTS引擎,因为它在离线语音助手项目Rhasspy内部专为纯CPU的嵌入式硬件打造,不需要GPU,也正因如此是Home Assistant默认的本地语音;Kokoro听起来更自然,但没有针对Pi的实时基准记录,而Coqui TTS/XTTS v2假定有GPU加速。

💬 简单来说

如果你想让Raspberry Pi在没有网络连接的情况下开口说话,Piper正是为这项任务而生的工具——安装、下载一个语音包,它就能在一块35美元起的开发板上实时说话。更高级的选项(Kokoro、XTTS v2)听起来更好,但设计时并未考虑Raspberry Pi有限的CPU能力。

📌: 本指南只涉及纯CPU合成速度和Pi适配性,不涉及语音克隆。关于语音克隆,请参阅PromptQuorum专门的XTTS v2评测,其中明确指出不推荐在Pi级CPU上使用。

TTS引擎适配Raspberry Pi需要具备哪些条件?

一款适配Raspberry Pi的TTS引擎需要不依赖GPU即可运行,模型和运行时要能装进几百MB的RAM,并且要在四核ARM CPU上以快于实时的速度生成音频。 Raspberry Pi没有值得用于TTS推理的独立GPU——这里列出的每个引擎都运行在CPU上,因此决定成败的关键在于每款引擎针对这一约束条件的构建效率,而不是孤立的模型质量本身。

  • 不依赖GPU。 Raspberry Pi没有支持CUDA的GPU;任何为达到可接受速度而假定有GPU加速的引擎,即便技术上能以CPU方式作为后备运行,也不适合实时使用。
  • RAM占用。 Raspberry Pi 4总共最多8GB RAM,还要与操作系统及其他正在运行的服务(Home Assistant、唤醒词检测器)共享;一款仅加载就需要多GB内存的TTS引擎,几乎不会给其他任务留下空间。
  • 安装复杂度。 一条带预编译ARM wheel的pip install,与一个期望GPU导向依赖链(CUDA、cuDNN,而这些在Pi上并不适用)的工具包,完全是两回事。
  • 语音质量的取舍。 这份列表中的每款引擎都在用一定质量换取速度;关键在于哪种取舍适合你的用例——智能音箱播报所需的质量与语音克隆项目不同。

Piper对比Kokoro对比Coqui TTS/XTTS v2对比espeak-ng的Pi适配性

除了原始语音质量(Kokoro和XTTS v2在此领先)之外,Piper在每一项Pi专属指标上得分最高。 下表按照对Raspberry Pi部署真正重要的四项标准对每款引擎打分,而不是桌面或服务器硬件上的通用TTS基准测试。

引擎
RAM占用
纯CPU可行性
安装复杂度
语音质量
Piper低(模型文件通常每个语音远小于100MB)专为此设计;广泛报告能在Pi 4上实时运行一条命令:pip install piper-tts良好,神经网络语音足够自然;不支持克隆
Kokoro中等(8200万参数模型,约327MB权重)可在CPU上运行;无Pi实时基准记录Python包+模型下载;依赖项比Piper更多更高——位居独立TTS质量排行榜前列
Coqui TTS / XTTS v2高;有据可查的延迟数据均假定使用GPU显存差;PromptQuorum自己的XTTS v2评测指出纯CPU的Pi使用不切实际工具包安装加许可协议(XTTS v2为CPML)最高——支持17种语言的6秒语音克隆
espeak-ng极小(几MB)轻而易举;能在包括微控制器在内的几乎任何硬件上运行通过大多数Linux包管理器即可直接获取机械化的共振峰合成音——不是自然语音

Piper为何是Raspberry Pi的默认推荐

Piper之所以成为默认推荐,是因为它正是为这一硬件类别而设计的,而不是事后适配上去的。 它诞生于开源工具包Rhasspy内部,该项目致力于构建完全离线运行的语音助手——其整个前提就是在本地、往往配置不高的硬件(包括Raspberry Pi开发板)上运行语音识别和合成,无需往返云端API。

  • 为嵌入式和资源受限设备打造。 Piper采用神经网络化的VITS风格架构,导出为ONNX Runtime以实现快速的CPU推理——这是针对没有GPU可退而求其次的硬件所做的刻意选择。
  • 至今仍是Home Assistant的默认选项。 Piper是Home Assistant语音管道中默认的本地文本转语音引擎,由维护Home Assistant的同一家非营利组织Open Home Foundation负责维护——而大量Home Assistant安装都运行在Raspberry Pi上。
  • 从不需要GPU。 桌面硬件上存在可选的CUDA GPU加速以获得更高吞吐量,但并非必需——Piper的设计目标就是仅靠CPU实时运行。
  • 没有语音克隆——而是固定的语音库。 Piper提供覆盖20多种语言的数十种预训练语音,而不是从样本中克隆语音;相较于XTTS v2,这是一项真实的取舍,但也正是这一点让Piper的资源占用足够小,能装进Raspberry Pi。

Kokoro:更高质量,更高成本

Kokoro是一款8200万参数、Apache-2.0许可的TTS模型,源自StyleTTS2,能生成明显比Piper更自然的语音,但其真实的资源成本尚未针对Raspberry Pi硬件专门做过记录。 与Piper不同,Kokoro并非以嵌入式ARM设备为主要目标构建——它的构建目标是相对于更大的TTS模型,在通用硬件上做到更小更快,这与专门针对Raspberry Pi CPU的实时性能是不同的设计目标。

  • 82M参数,约327MB权重。 相比大型语音克隆模型,这个体积算小,但相比通常远小于100MB的单个Piper语音,仍然明显更重。
  • Apache-2.0许可。 宽松且对商业友好——不像XTTS v2那样有CPML式的非商业限制。
  • 没有Raspberry Pi的实时基准记录。 PromptQuorum未能找到已发表、有据可查的基准测试,证明Kokoro能专门在Raspberry Pi 4或Raspberry Pi 5硬件上实时运行。在自己完成基准测试之前,应将Kokoro在Pi上的任何实时性说法视为未经验证。
  • Raspberry Pi 5是更现实的目标。 其2.4GHz的Cortex-A76 CPU比Raspberry Pi 4的Cortex-A72提供明显更多的算力,这对Kokoro这样较重的模型比对更轻量的Piper更为重要。

Coqui TTS与XTTS v2:何时需要语音克隆

Coqui TTS及其XTTS v2模型只需短至6秒的参考音频即可增加语音克隆功能,但两者都假定有GPU加速,并不适合纯CPU的Raspberry Pi硬件。 如果你的项目确实需要克隆特定语音,而不是使用预训练语音,这是本清单中唯一能做到这一点的选项——但请计划在别处运行它,再把音频流式传输到Pi,而不是在Pi本身上运行。

  • XTTS v2可从6秒音频克隆语音,支持17种语言,依据其官方Hugging Face模型卡——安装命令和许可细节请参阅PromptQuorum的XTTS v2完整评测
  • 强烈建议使用GPU,纯CPU对实时应用并不实用,这是PromptQuorum自己的XTTS v2评测得出的结论——Raspberry Pi没有独立GPU,因此在设备上实时运行XTTS v2推理并不现实。
  • XTTS v2的许可协议——Coqui公共模型许可(CPML)——为非商业性质,这是与硬件适配性分开的一项考量。完整对比请参阅本地TTS许可指南
  • 需要克隆语音的Pi项目常见做法: 在一台配有GPU、独立常驻运行的服务器或桌面机上运行XTTS v2,在那里生成音频,再将生成的音频文件或流发送到Raspberry Pi播放——而不是在Pi本身上执行推理。

espeak-ng:轻量级备选方案

espeak-ng是一款几乎能在任何硬件(包括微控制器)上运行的共振峰合成TTS引擎,但听起来机械化,而非自然。 它比这份清单中的神经网络TTS引擎早出现了十多年,在语音质量上算不上真正的竞争者——之所以列入,是因为它是底线:几乎没有任何资源要求的选项。

  • 几乎能在任何设备上运行。 espeak-ng只需几MB内存,也不需要神经网络运行时,即使在规格远低于Raspberry Pi的硬件上也能使用。
  • 听起来机械化。 它的共振峰合成方法——依据声学规则而非训练过的神经网络模型生成语音——产生的语音可理解,但明显带有合成感,不适合追求自然感的语音助手或播报系统。
  • 仍可作为音素转换工具使用。 Piper自身在文本转音素环节内部就使用了espeak-ng,不过Piper自己的音频输出来自其神经网络模型,而非直接来自espeak-ng。
  • 仅在RAM或CPU极度受限、连Piper都无法运行时选择,例如微控制器级别的设备,而非Raspberry Pi。

如何在Raspberry Pi上安装Piper

在Raspberry Pi上安装Piper只需一条pip install命令,再下载一个语音模型——不需要GPU驱动、不需要CUDA、不需要编译步骤。 这些命令与PromptQuorum的Piper TTS专门评测中记录的相同,这里专门应用于运行Raspberry Pi OS(或其他基于Debian的ARM Linux发行版)的Raspberry Pi。

  1. 1
    更新系统并安装Python 3
    Why it matters: 较新版本的Raspberry Pi OS镜像已预装Python 3,但在安装任何新软件前,先运行`sudo apt update && sudo apt upgrade`,确保pip和系统包是最新的。
  2. 2
    用pip安装Piper
    Why it matters: 运行`pip install piper-tts`(视镜像而定,也可能是`pip3 install piper-tts`)。这会安装`piper`包及其ONNX Runtime依赖项——预编译的ARM wheel意味着在Raspberry Pi上无需编译步骤。
  3. 3
    下载一个语音模型
    Why it matters: 运行`piper --download-dir voices --update-voices --voice en_US-lessac-medium`(可替换为Hugging Face上Piper语音库中的任意语音)。中等质量的语音是Raspberry Pi上合适的默认选择——它比高质量语音更快,而在普通扬声器上输出差异可以忽略不计。
  4. 4
    从文本生成语音
    Why it matters: 从命令行将文本传给Piper,例如`echo "Hello from the Raspberry Pi." | piper --model voices/en_US-lessac-medium.onnx --output_file output.wav`,然后用`aplay output.wav`播放生成的WAV文件。
  5. 5
    将其接入项目
    Why it matters: 要构建完整的语音助手管道(唤醒词、语音识别、LLM以及负责回复的Piper),请参阅PromptQuorum的[离线语音助手分步构建指南](/zh/power-local-llm/build-local-voice-assistant-2026);对于Home Assistant,Piper已经是语音管道设置中默认的TTS引擎。

TTS场景下的Raspberry Pi 4对比Raspberry Pi 5

Raspberry Pi 5的CPU明显快于Raspberry Pi 4,这对Kokoro这类较重的引擎比对本已轻量的Piper更为重要。 两款开发板都能实时运行Piper,但一旦考虑更重的方案,CPU差距就会拉开现实可行的选项范围。

  • Raspberry Pi 4: 四核Arm Cortex-A72 CPU,最高1.8GHz,RAM配置最高8GB。足以支持Piper的实时合成;对Kokoro或XTTS v2的实时运行而言不是现实的目标。
  • Raspberry Pi 5: 四核Arm Cortex-A76 CPU(BCM2712),2.4GHz,RAM配置最高16GB——相比Raspberry Pi 4有记录在案的2至3倍CPU性能提升。如果想尝试用Kokoro替代Piper,这是应该选择的开发板。
  • 两款开发板都没有改变GPU加速的局面。 两者都缺少独立、支持CUDA的GPU,因此在这两代产品上,Coqui TTS和XTTS v2在设备上实时推理都仍不现实。
  • RAM的重要性不止于TTS引擎本身。 如果同一块板子还要运行Home Assistant、唤醒词检测器,或用于完整语音助手管道的本地LLM,轻量级引擎(Piper,其次是espeak-ng)会为这些其他进程留出比Kokoro或Coqui TTS更多的余量。

常见问题

Raspberry Pi上最好的本地TTS引擎是什么?

对大多数使用场景而言,Piper是Raspberry Pi上最好的本地TTS引擎。它诞生于离线语音助手项目Rhasspy内部,专为纯CPU的嵌入式硬件打造,不需要GPU,也正因如此仍是Home Assistant默认的本地TTS引擎。它被广泛报告能在Raspberry Pi 4上实时运行。

Piper在Raspberry Pi上运行需要GPU吗?

不需要。Piper的设计目标是在包括Raspberry Pi在内的纯CPU硬件上实时运行。桌面硬件上存在可选的CUDA GPU加速以获得更高吞吐量,但并非必需,而且Raspberry Pi本来就没有可用于此的独立GPU。

Kokoro能在Raspberry Pi上实时运行吗?

PromptQuorum未能找到专门针对Raspberry Pi硬件的、有据可查的实时基准测试。Kokoro是一款8200万参数的模型,总体上可以在CPU上运行,但它并未像Piper那样专为嵌入式ARM设备打造。在配备更快Cortex-A76 CPU的Raspberry Pi 5上测试,比在Raspberry Pi 4上测试更现实——在将其用于实时交互场景之前,请自行完成基准测试。

为什么不在Raspberry Pi上用XTTS v2做语音克隆?

XTTS v2要达到其记录在案的低延迟性能,需要依赖GPU加速,而PromptQuorum自己对XTTS v2的评测指出,纯CPU使用对实时应用并不实用。Raspberry Pi没有独立GPU,因此在设备上实时运行XTTS v2推理并不现实。一种常见的变通方法是在配有GPU的独立服务器上运行XTTS v2,再将生成的音频流式传输到Raspberry Pi。

Piper可以免费用于商业用途吗?

目前处于活跃维护状态的Piper代码库OHF-Voice/piper1-gpl采用GPL-3.0-or-later许可,这是相对于最初的、现已归档的rhasspy/piper代码库所用MIT许可的变更。GPL-3.0允许将Piper作为工具用于商业用途,但如果你分发对Piper自身源代码所做的修改,则要求以相同许可发布。完整的许可历史请参阅PromptQuorum的Piper TTS完整评测——本文不构成法律建议。

在文本转语音方面,Raspberry Pi 4和Raspberry Pi 5有什么区别?

Raspberry Pi 5采用四核Arm Cortex-A76 CPU(BCM2712),主频2.4GHz,RAM配置最高16GB,相比Raspberry Pi 4最高1.8GHz、RAM最高8GB的四核Cortex-A72,有记录在案的2至3倍CPU性能提升。两者都能实时运行Piper;如果想尝试Kokoro这样更重的引擎,Pi 5多出的余量会更重要。

Piper支持英语以外的语言吗?

支持。Piper提供覆盖20多种语言的预训练语音,不过它并不会克隆特定人物的声音——它按语言使用固定的预训练语音,而不是像XTTS v2那样从样本中克隆。

espeak-ng是什么,什么时候应该用它代替Piper?

espeak-ng是一款几乎能在任何硬件上运行的共振峰合成TTS引擎,包括规格低于Raspberry Pi的设备,但听起来机械化,而非自然。仅在RAM或CPU极度受限、连Piper都无法运行时才使用它——对大多数Raspberry Pi项目来说,Piper是更好的默认选择。Piper自身在文本转音素环节内部也使用了espeak-ng。

Piper在Raspberry Pi上需要多少RAM?

Piper每个语音的模型文件通常远小于100MB,该引擎运行时不需要多GB的RAM,这在总共只有2GB RAM、还要与操作系统及其他运行中服务共享的Raspberry Pi 4上是一项实实在在的优势。

结论

在Raspberry Pi上进行本地文本转语音,Piper是正确的默认选择,而且这不是一个势均力敌的决定:它在离线语音助手项目Rhasspy内部专为纯CPU的嵌入式硬件而设计,不需要GPU,一条命令即可安装,也正因如此仍是Home Assistant默认的本地语音。如果语音质量比保证的实时响应更重要,可以改用Kokoro,但要先在你的具体Raspberry Pi型号上亲自做基准测试——它记录在案的实时性能是在通用硬件上取得的,而非专门针对Pi级ARM开发板。只有在你确实需要语音克隆时才使用Coqui TTS或XTTS v2,并计划在配有GPU的独立机器上而非Pi本身上运行推理。只有在硬件连Piper都难以承受时,才将espeak-ng作为最后手段。如果拿不定主意,就从Piper开始——它正是为这类硬件而打造的工具。

资料来源

← 返回 本地LLM进阶