关键要点
- 仅凭文本提示即可生成逼真的多语言语音以及非语音声音(笑声、叹息、喘息、音乐)。
- 许可证:MIT——自 2023 年 5 月 1 日起完全可用于商业用途。
- 根据 Suno 自己的文档,不支持自定义声音克隆。
- 自 2024 年 4 月 5 日以来,公开的 GitHub 仓库没有任何提交;未被标记为已归档,但看起来处于停滞状态。
- 出于架构设计原因,输出被限制在每次生成约 13-14 秒。
- 切勿运行
pip install bark——那会安装一个不相关的软件包;请使用pip install git+https://github.com/suno-ai/bark.git。
📍 简单一句话
Bark 是 Suno 推出的开源、MIT 许可的生成式音频模型,能够从文本提示生成多语言语音以及笑声、叹息等非语音声音,但不支持自定义声音克隆,其公开的 GitHub 仓库自 2024 年 4 月 5 日以来没有任何提交。
💬 简单来说
这是一个将文本转换为口语音频的 AI 模型,还可以根据你输入的提示添加笑声、叹气等人类声音,甚至简单的音乐——可免费商用,但它无法复制特定人物的声音,而且看起来 Suno 已经没有人在积极开发它了。
📌注: 打造 Bark 的公司 Suno 如今主要以其 AI 音乐生成产品闻名。PromptQuorum 无法确认 Suno 是否仍在为 Bark 分配工程资源;公开的提交历史是唯一可用的证据,而它自 2024 年 4 月以来没有显示任何活动。
Bark 实际能做什么
Bark 是一个基于 Transformer、GPT 风格的文本转音频生成式模型,而非传统的文本转语音流水线。它不是简单地将文本映射到音素和波形,而是直接从文本生成音频 token,这使它能够生成传统 TTS 引擎无法提供的非语音声音和富有表现力的韵律。
- 多语言语音。 根据其官方 README,Bark 支持 13 种语言:英语、德语、西班牙语、法语、印地语、意大利语、日语、韩语、波兰语、葡萄牙语、俄语、土耳其语和简体中文。
- 非语音声音生成。 Bark 可以生成 `[laughter]
、[laughs]、[sighs]、[gasps]和[clears throat]等内嵌文本提示,以及简单的[music]`,这些都直接记录在其官方 README 中——这是使它区别于 PromptQuorum 所涵盖的任何其他本地 TTS 引擎的特性。 - 超过 100 种说话人预设。 Bark 内置超过 100 种跨支持语言的说话人预设,可通过
history_prompt参数(例如v2/en_speaker_6)选择,而不是通过参考音频片段。 - 不支持自定义声音克隆。 Suno 自己的文档明确指出 Bark "目前不支持自定义声音克隆"——它可以匹配给定预设的音调、音高、情感和韵律,但无法像 XTTS v2 那样从参考录音中克隆任意人物的声音。
- 输出不确定。 Bark 自己的 README 将其描述为在生成中"采取一定的创造性自由,导致模型输出的方差高于传统文本转语音方法"——两次运行相同的提示可能会产生明显不同的结果。
真实使用示例
以下命令遵循 Bark 官方文档中的 Python 快速入门指南。请注意下方的安装警告——它直接来自该项目的 README。
- 将提示控制在约 13-14 秒的口语文本以内。 Bark 自己的 README 解释说这是架构限制,而非缺陷:"Bark 是一个 GPT 风格的模型,其架构/上下文窗口经过优化,以输出大约这个长度的生成结果。" 更长的旁白内容需要拆分成多个片段,然后再拼接起来。
- 预期不同运行之间存在差异。 由于输出是不确定的,对于任何需要以特定方式呈现的台词,请生成几次并从中挑选最佳版本,而不是假设第一次生成就具有代表性。
# 安装 Bark —— 不要使用 "pip install bark",那会安装一个
# 不相关的软件包,且不由 Suno 管理。
pip install git+https://github.com/suno-ai/bark.git
# Python API:基本生成
from bark import SAMPLE_RATE, generate_audio, preload_models
from scipy.io.wavfile import write as write_wav
preload_models()
text_prompt = "Hello, my name is Suno. And, uh — and I like pizza. [laughs]"
audio_array = generate_audio(text_prompt)
write_wav("bark_generation.wav", SAMPLE_RATE, audio_array)
# 使用特定的说话人预设而非随机声音
audio_array = generate_audio(
"This is a specific preset voice speaking a new sentence.",
history_prompt="v2/en_speaker_6",
)
# 在较小显卡上减少 GPU 内存占用
import os
os.environ["SUNO_OFFLOAD_CPU"] = "True"
os.environ["SUNO_USE_SMALL_MODELS"] = "True"许可证与维护状态
Bark 采用 MIT 许可证授权。 其 README 明确指出:"Bark is now licensed under the MIT License, meaning it's now available for commercial use!"——日期为 2023 年 5 月 1 日。与 XTTS v2(非商业性质的 CPML)或 F5-TTS(CC-BY-NC-4.0)不同,Bark 的模型权重或输出没有任何商业限制。这只是对许可证大致框架的事实性总结,不是法律建议——在任何商业部署之前,请自行阅读 MIT 许可证文本。
维护才是真正悬而未决的问题,而不是许可证。 截至本评测发布时,公开的 suno-ai/bark 仓库的提交历史显示自 2024 年 4 月 5 日以来没有任何提交。GitHub 并未将该仓库显示为已归档,社区仍在继续提交问题(issue),但 PromptQuorum 未发现该期间有维护者活动、版本发布或修复的证据。Suno 公司如今主要以其 AI 音乐生成产品闻名,而非 Bark,PromptQuorum 无法确认 Suno 目前是否仍为 Bark 仓库分配任何工程资源。
将"积极维护"视为未经证实。 如果你依赖 Bark 用于生产场景,请为可能不再有任何更新、安全补丁或错误修复的情况做好准备,并在持续维护对你的用例很重要时,评估积极维护的替代方案,例如 Coqui TTS(通过社区维护的 idiap/coqui-ai-TTS 分支)或 Piper。
Bark 使用什么许可证?
根据其官方 README,Bark 依据 MIT 许可证授权,自 2023 年 5 月 1 日起完全可用于商业用途。这不是法律建议;在任何商业使用前请自行阅读 MIT 许可证文本。
Bark 不适合的场景
Bark 是一个独具特色的研究级生成式音频模型,而不是一个通用的、适合生产部署的 TTS 引擎。在以下情况下它是错误的选择:
- 克隆特定人物的声音。 Bark 自身文档指出它"目前不支持自定义声音克隆"。如果你需要从简短的参考录音中克隆真实声音,XTTS v2 正是为此而设计的(尽管采用非商业许可证)——Bark 不能替代它。
- 需要保证持续支持的生产系统。 由于公开仓库自 2024 年 4 月 5 日以来没有任何提交,加上 Suno 的公开重心已转向 AI 音乐生成,将生产环境的依赖押注在 Bark 持续维护、安全补丁或错误修复上,是 PromptQuorum 无法排除的真实风险。
- 在中低端硬件上的低延迟实时应用。 Bark 自己的 README 指出,"在较旧的 GPU、默认的 Colab 或 CPU 上,推理时间可能明显更慢",而不是它"在企业级 GPU 和 PyTorch nightly 上"达到的"接近实时"的速度。像 Piper 这样的轻量级引擎更适合仅使用 CPU 或嵌入式硬件的实时使用场景。
- 一致且可重复的输出。 由于 Bark 自身的 README 将其生成描述为比传统 TTS 方差更高、更不确定,它不适合任何需要对相同输入每次都产生完全相同输出的工作流程(交互式语音应答系统、无障碍工具、受监管的信息披露)。
- 单次生成完成长篇旁白。 Bark 在其自身 README 中将约 13-14 秒的生成时长限制归因于其 GPT 风格架构和上下文窗口,这意味着有声读物长度或长播客的旁白需要手动将文本拆分为多个片段,然后拼接生成的音频文件。
Bark 的替代方案
XTTS v2
- 最适合场景:
- 从6秒参考音频实现真正的声音克隆,支持17种语言
- 许可证:
- CPML(非商业性质)
Coqui TTS 工具包
- 最适合场景:
- 社区维护的工具包,可运行 XTTS v2 及其他模型
- 许可证:
- MPL-2.0
StyleTTS 2
- 最适合场景:
- 最高水准的自然英语朗读质量(不支持声音克隆)
- 许可证:
- MIT
Piper
- 最适合场景:
- 仅CPU下最快的合成速度,积极维护,可在树莓派上实时运行
- 许可证:
- GPL-3.0-or-later
ElevenLabs
- 最适合场景:
- 具有商业声音克隆和积极支持的托管云端 API
- 许可证:
- 专有(付费云端 API)
常见问题
Bark 是什么?
Bark 是 Suno 发布的开源生成式文本转音频模型,仅凭文本提示、无需参考音频片段,即可生成逼真的多语言语音以及笑声、叹息和简单音乐等非语音声音。
Bark 可以免费用于商业用途吗?
可以。Bark 采用 MIT 许可证授权,Suno 自己的 README 指出它已于 2023 年 5 月 1 日起完全可用于商业用途。这不是法律建议;在任何商业部署前请自行阅读 MIT 许可证文本。
Bark 能克隆特定人物的声音吗?
不能。Suno 自己的文档明确指出 Bark "目前不支持自定义声音克隆"。它可以匹配其超过 100 种内置说话人预设之一的音调和韵律,但无法从参考录音中克隆任意声音。如需该功能,请参见 PromptQuorum 对 XTTS v2 的评测,该模型专为声音克隆而设计(采用非商业许可证)。
Bark 还在维护吗?
这一点尚不确定。公开的 GitHub 仓库 suno-ai/bark 自 2024 年 4 月 5 日以来没有任何提交,不过它未被标记为已归档,社区仍在继续提交问题(issue)。Suno 公司如今主要以其 AI 音乐生成产品闻名,而非 Bark。PromptQuorum 无法确认 Suno 目前是否仍为 Bark 仓库分配工程资源。
Bark 单次生成能有多长?
每次生成约 13-14 秒的口语文本。Bark 自己的 README 将此归因于其 GPT 风格架构和上下文窗口,而非缺陷——更长的内容需要拆分成多个片段,然后再拼接起来。
为什么相同的 Bark 提示有时会产生不同的结果?
Bark 自己的 README 将其描述为在生成中"采取一定的创造性自由,导致模型输出的方差高于传统文本转语音方法"。预期两次运行相同的提示有时会产生明显不同的音频。
Bark 需要多少 GPU 显存?
根据其官方 README,完整模型需要约 12 GB 显存。设置环境变量 SUNO_USE_SMALL_MODELS=True 会加载能容纳在约 8 GB 内的较小模型,而 SUNO_OFFLOAD_CPU=True 会在两次生成之间将模型卸载到 CPU,以进一步降低内存占用。
结论
Bark 仍然是 PromptQuorum 所涵盖的本地文本转音频模型中最独具特色的一个:在这一比较组中,没有其他模型能够在完全宽松的 MIT 许可证下,从内嵌文本提示生成笑声、叹息和简单音乐。对于需要许可证清晰无歧义的个人项目、原型或商业产品而言,Bark 在授权方面确实是一个能力出众且低风险的选择。对大多数读者来说真正重要的两个决定因素是:它缺乏自定义声音克隆功能,以及其不确定的维护状态——公开的 GitHub 仓库自 2024 年 4 月 5 日以来没有任何提交,而 Suno 的公开重心已转向 AI 音乐生成。如果你需要克隆特定人物的声音,请改用 XTTS v2(非商业许可证)。如果你在生产环境中需要积极的维护以及一个许可宽松的快速引擎,可以考虑 Piper 或社区维护的 Coqui TTS 工具包。如需托管的商业替代方案,请参见与 ElevenLabs 的比较。
来源
- GitHub 上的 Bark——官方 README:语言、说话人预设、非语音声音标签、许可证和安装说明。
- Bark 提交历史——维护活动的公开记录,截至本评测发布时,显示自 2024 年 4 月 5 日以来没有任何提交。
- Hugging Face 上的 Bark——模型卡,反映了 GitHub README 中的功能和许可证说明。
- XTTS v2 评测——PromptQuorum 对 Bark 未提供的声音克隆替代方案的专门评测。
- 本地 TTS 与声音克隆许可证——本地 TTS 引擎间的完整许可证比较。
