关键要点
- Kokoro-82M:Apache-2.0,8200 万参数,通过社区 mlx-audio 项目经由 Apple 的 MLX 框架运行 —— 真正的 Apple Silicon 加速路径。
- Piper:GPL-3.0-or-later,通过 ONNX Runtime 在设计上只用 CPU —— 在 Intel 和 Apple Silicon Mac 上性能表现一致。
- XTTS v2:非商用 CPML 许可,可从约 6 秒音频克隆声音,但其 Metal(MPS)支持是已跟踪但未解决的 GitHub issue —— 在 Mac 上只用 CPU 运行。
- Bark:MIT 许可,通过环境变量提供实验性的 Apple Silicon MPS 支持,公开仓库自 2024 年 4 月起无提交。
- Intel Mac 完全无法使用 MLX 加速的 Kokoro 路径 —— MLX 需要 Apple Silicon。
📍 简单一句话
在 Apple Silicon 上做本地文本转语音,四大本地引擎中只有 Kokoro-82M 拥有真正的 Metal GPU 路径(通过社区 mlx-audio 项目跑在 Apple 自家的 MLX 框架上);Piper 是在 Intel Mac 上表现一致的简单纯 CPU 选项;XTTS v2 提供声音克隆,但其 Apple Silicon MPS 支持是已记录的失效 GitHub issue;Bark 的 MPS 支持则明确是实验性的。
💬 简单来说
并不是所有能在 Mac 上运行的免费文本转语音程序都真正用上了 Mac 的显卡芯片——有些只在普通处理器上运行,虽然能用,但比本可以达到的速度要慢。Kokoro 是通过一个叫 MLX 的项目专门设计来利用 Apple 自家芯片架构的;其他引擎要么在设计上直接跳过 GPU(Piper),要么试图使用 GPU 却遇到了尚未解决的问题(XTTS v2、Bark)。
📌注: 本指南比较 PromptQuorum 独立评测过的四款本地 TTS 引擎(Piper、Kokoro、XTTS v2、Bark)。每一款都有各自的专门评测链接,可查看安装命令、许可细节和完整的局限说明。
究竟该安装哪一款本地 TTS 引擎?
正确的引擎取决于你是否需要 GPU 加速、声音克隆,还是最广泛的 Mac 兼容性 —— 没有一款引擎能在三者上全部胜出。 Kokoro 是这里唯一拥有真正 Apple Silicon GPU 路径的引擎;Piper 可移植性最强;XTTS v2 是唯一能克隆声音的。
- 🏆 Apple Silicon 上的综合最佳: 通过 mlx-audio 运行的 Kokoro-82M —— 这里唯一拥有真正 Metal GPU 路径的引擎,体积足够小(8200 万参数),能在任何 Apple Silicon Mac 上流畅运行。
- 简单性和 Intel 兼容性最佳: Piper —— 设计上只用 CPU,因此无论是在 M 系列芯片还是老款 Intel Mac 上,安装和性能都完全一致。
- 需要声音克隆时最佳: XTTS v2 —— 可从约 6 秒的参考音频克隆声音,但在任何 Mac 上都只能用 CPU 运行,且许可仅限非商用。
- 富有表现力的非语音音效最佳: Bark —— 能从文本生成笑声、叹息和简单音乐,Apple Silicon 上的 GPU 支持是实验性(部分)的,且其仓库自 2024 年 4 月起已处于休眠状态。
谁应该用哪一款引擎?
把引擎匹配到你的 Mac 和实际需求上,而不是匹配到 GitHub 星标最多的那一款。 只有当你生成音频的数量和频率足以让纯 CPU 合成显得慢时,GPU 加速才真正重要。
- 🧭 Apple Silicon Mac,想要最快的本地选项: 通过 mlx-audio 运行的 Kokoro —— 这里唯一专门编写以通过 MLX 使用 Metal 的引擎。
- 🧭 包括老款 Intel 机型在内的任何 Mac: Piper —— 设计上只用 CPU,没有任何 Apple Silicon 专属配置或排查问题需要处理。
- 🧭 需要从一段短录音克隆特定声音: XTTS v2 —— 接受它在 Mac 上实际只能用 CPU 运行,且其许可为非商用。
- 🧭 想要笑声、叹息或环境音,而不只是语音: Bark —— 但要为其实验性的 Apple Silicon 路径预留额外的安装时间,并先确认当前的维护状态。
- ❌ 如果你需要活跃维护或有保证的性能,跳过 Bark —— 其公开仓库自 2024 年 4 月起没有任何提交,这与 Apple Silicon 问题无关。
- ❌ 如果你在构建商业产品,跳过 XTTS v2 —— 其 Coqui Public Model License(CPML)为非商用,发布该模型的公司 Coqui AI 已于 2023 年 12 月终止付费服务。
Piper、Kokoro、XTTS v2 和 Bark 在 Apple Silicon 适配度上如何比较?
Kokoro 是这个比较中唯一拥有真正、专门构建的 Apple Silicon GPU 路径的引擎;其余引擎要么设计上只用 CPU,要么因未解决的 bug 而只能用 CPU。 下表从真正决定 Mac 适配度的四个因素为各引擎打分:是否使用 Apple Silicon 加速、所需内存量、macOS 安装的繁琐程度,以及音质。
引擎 | Apple Silicon 加速 | RAM 占用 | macOS 安装 | 音质 |
|---|---|---|---|---|
| Kokoro-82M | 有 —— 通过 MLX 使用 Metal(mlx-audio) | 低(8200 万参数,有量化版本) | pip install + mlx-audio,仅限 Apple Silicon | 自然,接近大型云端模型 |
| Piper | 设计上无 —— 纯 CPU ONNX Runtime | 非常低(每个声音约 50~100MB) | pip install piper-tts,无需 GPU 配置 | 清晰,但语调略显机械 |
| XTTS v2 | 无 —— MPS 会卡死(GH issue #3649) | 中到高(完整克隆模型) | pip install coqui-tts,Mac 上只用 CPU | 高品质,可克隆特定声音 |
| Bark | 实验性 —— SUNO_ENABLE_MPS=True | 高(可用 small-models 标志降低) | 从 GitHub pip install,无 PyPI 包 | 富有表现力,非确定性 |
音质评分是基于各引擎已公开的架构和 PromptQuorum 的专门评测(每行均有链接)所作的定性描述,并非 PromptQuorum 进行的盲听测试,这里没有给出任何数值化的 MOS(平均意见得分)或基准测试数字。
哪些引擎真正在 Mac 上用 GPU?
只有 Kokoro 拥有一条真正、专门构建通往 Apple Silicon Metal GPU 的路径;Piper 在设计上完全跳过 GPU,而 XTTS v2 和 Bark 在 Mac 上的 GPU 支持都是未解决或部分的。 这是在 Apple Silicon 上区分这些引擎的最大因素,人们很容易以为"能在 Mac 上运行"就等于"用上了 Mac 的 GPU"——但通常并非如此。
- Kokoro-82M 通过社区项目 mlx-audio,经由 Apple 自家的 MLX 框架运行,需要 Apple Silicon 和 Python 3.10~3.12。 MLX 是 Apple 的开源机器学习框架,从底层为 Apple Silicon 统一内存架构上的 Metal 打造 —— 与本站 Apple Silicon 本地 LLM 指南 和 MLX 对比 Ollama 对比 llama.cpp 中针对语言模型讲解的是同一个框架。hexgrad 在 Hugging Face 上发布的官方 Kokoro-82M 权重原生是 PyTorch 模型;MLX 路径是社区移植版本,并非 Apple 或 hexgrad 的官方发布,mlx-audio 还提供 bf16、8 位、4 位量化版本以降低内存占用。
- Piper 在任何平台(包括 Apple Silicon)上都从不触碰 GPU —— 这是设计使然,而非局限。 Piper 用 espeak-ng 将文本转换为音素,再通过导出到 ONNX Runtime 的模型进行快速 CPU 推理合成音频。正是这个设计选择让 Piper 即便在 Raspberry Pi 上也能实时运行 —— 完整架构和安装步骤参见 PromptQuorum 的 Piper TTS 评测。
- XTTS v2 的 Apple Silicon Metal(MPS)支持目前并不能正常工作。 coqui-ai/TTS GitHub 仓库 中跟踪的一个 issue,标题为"Unable to use xtts_v2 with mps device on Apple Silicon",记录了在 MPS 设备上尝试运行 XTTS v2 只会卡死而无法完成。Coqui 自己的项目也没有将 Apple Silicon GPU 支持列为正式支持。实际上,这意味着 XTTS v2 在 Mac 上只能用 CPU 运行,而运行它所用的正是在其他平台上运行它的同一个 Coqui TTS 工具包(MPL-2.0 许可)。
- Bark 有实验性的 Apple Silicon MPS 支持,隐藏在一个环境变量背后。 设置
SUNO_ENABLE_MPS=True可启用 Metal 加速,依据是 suno-ai/bark GitHub 仓库 上的讨论,但 Bark 依赖的一部分 PyTorch 算子当时尚未针对 MPS 实现,导致这些步骤部分退回到 CPU。Bark 还支持SUNO_USE_SMALL_MODELS=True标志,专门用来降低统一内存较少的 Mac 上的内存压力。
如何在 Mac 上用 MLX 加速安装 Kokoro?
本教程安装社区 mlx-audio 项目,使用 mlx-audio GitHub 仓库 中记录的配置方法,通过 Apple 的 MLX 框架运行 Kokoro-82M。
- 1确认你使用的是 Apple Silicon,且 Python 版本受支持。
Why it matters: mlx-audio 需要 Apple Silicon Mac(M 系列芯片)和 Python 3.10~3.12;MLX 在 Intel Mac 上完全无法运行,因此这条路径仅限 Apple Silicon。 - 2安装 mlx-audio。
Why it matters: 在 Python 虚拟环境中运行 `pip install mlx-audio`。这会连同音频流水线一起拉取 MLX 本体(0.31 或更高版本)。 - 3从命令行运行首次合成。
Why it matters: 该软件包自带一个 CLI 入口,首次使用时会下载 Kokoro-82M 权重,并从文本字符串合成 WAV 文件 —— CLI 参数可能随版本变化,请在部署前查阅项目当前的 README 确认准确命令。 - 4选择一个声音,并可选择量化模型版本。
Why it matters: Kokoro-82M 内置 54 种覆盖多种语言的声音预设。mlx-audio 还提供 bf16、8 位、4 位量化版本 —— 以略微牺牲质量为代价换取更小的内存占用,对统一内存较少的 Mac 很有用。 - 5集成到你自己的 Python 应用中。
Why it matters: 如果需求超出一次性的命令行合成,请直接调用 mlx-audio 的 Python API,而不是反复调用 CLI,以避免每次调用都重新加载模型的开销。
Intel Mac 上有何不同?
在 Intel Mac 上,MLX 加速的 Kokoro 路径完全不可用 —— MLX 需要 Apple Silicon,在 Intel 硬件上根本无法运行。 这里介绍的其他所有引擎在 Intel 上仍能正常工作,因为它们都不依赖 Apple 的神经网络引擎或 Apple Silicon 专属的 GPU 加速才能运行,只是单纯在 CPU 上运行而已。
- Piper 不受 Intel 与 Apple Silicon 区别的影响。 它在所有平台上设计上都只用 CPU,因此单就 Piper 而言,Intel Mac 的表现与 Apple Silicon Mac 相当,硬件世代差异除外。
- Kokoro 通过其官方 PyTorch 权重仍能在 Intel Mac 上运行,只是没有 MLX 加速路径。 你会失去通过 mlx-audio 使用的 Apple Silicon 专属 Metal 路径,但模型本身(8200 万参数)足够小,在 CPU 上也能可接受地运行。
- XTTS v2 和 Bark 在 Intel 和 Apple Silicon Mac 上表现一致,因为两者目前在任何 Mac 上本来就只用 CPU 运行 —— XTTS v2 是因为 MPS 支持已损坏,Bark 是因为 MPS 支持是实验性且部分的。由于两者在 Apple Silicon 上本来就没有成熟的加速路径,从 Apple Silicon 换到 Intel 都不会有实质性的能力损失。
什么时候都不该使用这些引擎?
这个比较中的四款引擎没有一款适合所有 Mac TTS 使用场景 —— 每一款都有更适合用其他工具或云端 API 的情况。
- ❌ 需要带声音克隆功能且有保证的商业许可。 XTTS v2 的 CPML 许可为非商用,自 Coqui AI 于 2023 年 12 月终止付费服务以来,没有已确认的有效商业许可途径 —— 如需托管式商业云端替代方案,参见 PromptQuorum 的 ElevenLabs 对比。
- ❌ 需要有保证的活跃维护。 Bark 的公开 GitHub 仓库自 2024 年 4 月 5 日起没有任何提交;如果持续的修复和更新对你的项目很重要,Piper(由 Open Home Foundation 积极维护)或 Kokoro(围绕 mlx-audio 形成的活跃社区生态)是更安全的选择。
- ❌ 需要今天就有生产级 Apple Silicon GPU 支持,且不依赖社区项目。 Kokoro 的 MLX 路径是通过一个社区项目运行的,并非 Apple 或 hexgrad 的官方发布 —— 把它当作是好用、但没有厂商保证的方案。
- ❌ 需要在内存非常有限的 Apple Silicon(8GB 基础配置)上,同时运行一个大型本地 LLM 并进行实时交互式语音。 在内存受限的 Mac 上同时运行大型 XTTS v2 或 Bark 进程和 LLM 可能会很吃紧;Piper 和 Kokoro 更小的内存占用能留出更多余量。
常见问题
Apple Silicon Mac 上最好的本地 TTS 引擎是什么?
如果你特别想要通过 Apple 自家 MLX 框架实现 Apple Silicon GPU(Metal)加速,通过社区 mlx-audio 项目运行的 Kokoro-82M 是最佳选择。如果你想要在任何 Mac 上表现一致的最简单安装方式,Piper 是更好的选择,因为它在所有平台上设计上都只用 CPU。
Piper 在 Mac 上使用 GPU 吗?
不。Piper 在包括 Apple Silicon 和 Intel Mac 在内的所有平台上,设计上都只用 CPU。它用 espeak-ng 将文本转换为音素,并通过 ONNX Runtime 合成音频,这正是它即使没有任何 GPU 也能在 Raspberry Pi 上实时运行的原因。
Kokoro-82M 能在 Apple Silicon 上使用 GPU 加速运行吗?
可以,通过社区项目 mlx-audio,它经由 Apple 自家的 MLX 框架运行 Kokoro-82M —— 该框架专为 Apple Silicon 统一内存架构上的 Metal 打造。hexgrad 发布的官方 Kokoro-82M 权重是 PyTorch 模型;MLX 路径是社区移植版本,而非官方发布,需要 Apple Silicon Mac(Intel Mac 无法使用)以及 Python 3.10~3.12。
XTTS v2 能在 Apple Silicon 上运行吗?
能运行,但只能用 CPU。XTTS v2 的 Metal(MPS)设备支持是一个已记录但未解决的问题,在 coqui-ai/TTS 的 GitHub 仓库中被跟踪(issue #3649),尝试使用 MPS 设备只会卡死而无法完成。Coqui 的项目没有正式支持 XTTS v2 的 Apple Silicon GPU 加速,因此请预期在任何 Mac 上都只有 CPU 性能。
Bark 在 Apple Silicon 上有加速吗?
部分且实验性地有。设置 SUNO_ENABLE_MPS=True 环境变量可启用 Bark 的 Metal GPU 加速,但其依赖的一部分 PyTorch 算子尚未针对 MPS 实现,因此部分处理步骤仍会退回到 CPU。Bark 自己的维护者也将其描述为实验性,尚未达到生产级别。
我能在 Intel Mac 上使用这些引擎吗?
Piper、XTTS v2 和 Bark 都能在 Intel Mac 上运行,因为它们都不需要 Apple Silicon 专属加速才能运行 —— 要么是设计上就用 CPU(Piper),要么是因为其 GPU 加速路径本来就未解决或只是部分实现,所以反正也是用 CPU(XTTS v2、Bark)。Kokoro 的 MLX 加速路径专门需要 Apple Silicon,在 Intel Mac 上完全无法运行,但 Kokoro 的官方 PyTorch 权重在没有 MLX 加速的情况下仍能在 Intel 上运行。
这些引擎中哪一个可以克隆特定声音?
在这里介绍的四款引擎中,只有 XTTS v2 能从一段简短的参考音频片段(根据官方模型卡,最短仅需 6 秒)克隆声音。Piper、Kokoro 和 Bark 都使用预训练或预设声音,而不是即时克隆任意声音。完整的克隆细节和许可信息,参见 PromptQuorum 的专门 XTTS v2 评测。
这些本地 TTS 引擎中,是否有任何一个在 Apple Silicon Mac 上使用需要付费许可?
这里介绍的引擎中,没有任何一个专门针对 macOS 或 Apple Silicon 使用收费。Piper(GPL-3.0-or-later)、Kokoro(Apache-2.0)和 Bark(MIT)无论平台如何都是免费开源软件。XTTS v2 本身可以免费使用,但采用非商用许可(CPML)—— 这一限制在 Apple Silicon、Intel、Windows 或 Linux 上同等适用,与你使用哪种 Mac 无关。
结论
单就 Apple Silicon 而言,Kokoro-82M 在这四款引擎中脱颖而出,因为它是唯一通过社区 mlx-audio 项目、建立在 Apple 自家 MLX 框架之上,拥有一条真正、专门构建通往 Mac Metal GPU 的路径的引擎 —— 而且它体积足够小(8200 万参数,Apache-2.0 许可),值得为此配置这份加速。当简单性和跨硬件一致性比原始速度更重要时,Piper 仍是正确的默认选择:它在任何平台上都只用 CPU,因此没有任何 Apple Silicon 专属配置、排查或在 Intel Mac 上出现退步的担忧。只有在你特别需要声音克隆、且能接受其非商用许可的情况下,XTTS v2 才值得承受纯 CPU 带来的性能损失;Bark 只值得因其独特的非语音音效而考虑,但要注意它的 Apple Silicon 加速和整体维护状态都不稳定。如果拿不定主意,先从 Piper 开始安装最简单的方案,确认自己确实想要 Metal 加速后再迁移到通过 mlx-audio 运行的 Kokoro,只有在声音克隆成为硬性需求时才转向 XTTS v2。
来源
- Hugging Face 上的 Kokoro-82M —— 官方模型卡:参数、许可和架构。
- GitHub 上的 mlx-audio —— 在 Apple Silicon 上通过 Apple 的 MLX 框架运行 Kokoro-82M 的社区项目。
- coqui-ai/TTS GitHub issue #3649 —— "Unable to use xtts_v2 with mps device on Apple Silicon",记录了未解决的 MPS 卡死问题。
- suno-ai/bark GitHub 仓库 —— 记录通过 SUNO_ENABLE_MPS 实现实验性 Apple Silicon MPS 支持的 issue 与 pull request。
- Apple MLX 框架 —— Apple 的官方开源机器学习框架,为 Apple Silicon 提供原生 Metal GPU 加速。
- Piper TTS 评测 —— PromptQuorum 的专门评测,包含安装命令和许可历史。
- XTTS v2 评测、Coqui TTS 评测 和 Bark TTS 评测 —— PromptQuorum 对本文涉及的其他引擎的专门评测。
