关键要点
- Kokoro-82M:8200万参数,Apache 2.0许可证,源自StyleTTS2的架构,由hexgrad发布(huggingface.co/hexgrad/Kokoro-82M)。
- 8种语言(英语、西班牙语、法语、印地语、意大利语、日语、葡萄牙语、中文)共54种内置语音——没有从参考样本进行官方实时语音克隆的功能。
- 可在CPU或中端GPU上运行;下载模型和语音包后无需联网。
- ElevenLabs:付费云平台,从免费层级(每月10,000积分,无商用许可)到Business(每月990美元,6,000,000积分)——决定前请在ElevenLabs定价页面核实最新方案和积分成本。
- ElevenLabs从付费方案开始支持从简短参考片段进行零样本语音克隆;Kokoro没有内置这项功能。
- PromptQuorum与Kokoro/hexgrad之间不存在联盟关系;本文中任何ElevenLabs链接均按页面顶部联盟披露说明进行披露。
📍 简单一句话
Kokoro是一款免费的开放权重8200万参数TTS模型(Apache 2.0,由hexgrad开发),本地运行,拥有54种固定语音;ElevenLabs是拥有更大语音目录和语音克隆功能的付费云平台。
💬 简单来说
Kokoro是你免费下载并在自己电脑上运行的软件,有一份固定的语音列表可供选择。ElevenLabs是通过浏览器或API使用的订阅服务,还能从简短录音中复制特定人物的声音。
📌注: 事实已根据Hugging Face上的Kokoro-82M模型卡片和ElevenLabs的公开定价页面在本文发布日期进行核实。两者均可能发生变化——在决定使用任何一方之前请核实最新条款。
Kokoro是由化名开发者hexgrad发布的开放权重文本转语音模型。以8200万参数而言,相比大多数现代TTS系统它规模较小,但Hugging Face上的独立评测和社区基准测试将其描述为在感知音频质量上超出其参数量的表现——不过PromptQuorum并未进行过自己的盲听测试,因此质量比较应视为方向性参考,而非实测数据。该架构源自StyleTTS 2,结合了ISTFTNet风格的声码器,采用纯解码器设计,这也是它能在CPU或中端GPU上舒适运行而无需大型加速器的部分原因。
ElevenLabs是一个托管语音平台。其方案将文本转语音与其他语音和媒体功能捆绑在一起;积分在各产品间共享。免费层级标注为每月10,000积分,而付费方案增加了商用许可访问权限、专业和即时语音克隆,以及更高的额度。在依赖任何具体数字之前,请查阅ElevenLabs实时定价页面,因为方案和积分成本会发生变化。
真正需要决定的不是"哪个声音更好听?"而是:你是想要一个免费下载一次、自己用固定语音集运营的模型,还是想要一个付费服务,以订阅和将文本发送到第三方服务器为代价,提供克隆功能和更大的语音库?
我们的结论
🏆 最佳免费/离线TTS: Kokoro——一个8200万参数、Apache 2.0许可证的模型,自己运营,没有按字符付费。 💰 最佳语音克隆: ElevenLabs——付费方案可从简短参考片段进行零样本克隆。 ⚡ 今天就要打磨过的声音、无需设置的最佳选择: ElevenLabs。 🖥️ 纯CPU或中端GPU硬件的最佳选择: Kokoro。 🔒 让文本和音频远离第三方服务器的最佳选择: Kokoro(一旦下载并完全离线运行)。 🌍 最大语言覆盖的最佳选择: ElevenLabs——请查阅其最新文档获取确切数字;Kokoro在模型层面覆盖8种语言。
对于预算有限、不需要语音克隆的开发者和爱好者,从Kokoro开始。对于需要克隆语音、更广泛语言支持,或今天就要结果而无需安装任何东西的创作者和企业,从ElevenLabs的免费层级开始。
选择你的TTS方案
以下情况使用本地LLM:
- •你想要免费、无限量的生成,没有按字符计费。
- •流水线需要在设置完成后完全离线运行——信息亭、嵌入式设备、隔离系统。
- •你可以接受从54种固定语音中选择,而不是克隆特定的声音。
以下情况使用云端模型:
- •你需要从简短参考样本克隆特定声音。
- •你想要最广泛的语言和口音覆盖,而不想自己核查模型层面的语言列表。
- •你今天就需要一个声音,不想安装任何东西或管理模型。
快速决策:
- →对于语音克隆或零配置的最大打磨度:ElevenLabs胜出。
- →对于免费、离线、固定语音的生成:Kokoro胜出。
- →对于云端按量计费不断累积的大量生成需求:Kokoro运行起来后通常更便宜。
一览
场景 | 更好的选择 | 原因 |
|---|---|---|
| 今天就需要自然的配音,无需安装 | ElevenLabs | 无需下载模型,无需本地运行环境设置。几分钟内即可通过浏览器或API生成。 |
| 需要从样本克隆特定人物的声音 | ElevenLabs | Kokoro没有官方零样本语音克隆功能;ElevenLabs在付费方案中支持此功能,并有同意要求。 |
| 想要为副业项目或应用提供免费、无计量的TTS | Kokoro | Apache 2.0许可证,无需订阅,下载并运行后无按字符积分。 |
| 正在构建离线或嵌入式语音功能 | Kokoro | 设置完成后可在CPU或中端GPU上运行,无需联网。 |
| 需要几十种语言/口音,而不想自己核查覆盖范围 | ElevenLabs | 在其网站上列出更广泛的语言支持;Kokoro在模型层面记录为支持8种语言。 |
| 每月生成大量音频 | Kokoro可能更便宜 | 硬件到位后无按字符成本;ElevenLabs的按量积分随用量增加。 |
| 想要微调、自托管或完全审查模型 | Kokoro | Apache 2.0权重可下载和检查;ElevenLabs是封闭的托管平台。 |
Kokoro是什么,与ElevenLabs有何不同?
Kokoro是一个小型的开放权重文本转语音模型——不是一家公司、产品套件或托管平台。 它是一套单一的模型权重(目前以Kokoro-82M的形式发布),你从Hugging Face下载,用推理脚本、社区封装或量化的GGUF/ONNX构建来运行。没有账户,没有仪表盘,没有订阅——整个"产品"就是模型文件加上运行它的代码。
- 参数: 8200万——足够小,可以在CPU或中端GPU上舒适运行,不像需要专用加速器的TTS系统。
- 许可证: Apache 2.0——宽松许可,允许商业使用、修改和再分发,不像GPL那样带有著佐权要求。
- 架构: 源自StyleTTS 2,结合ISTFTNet风格的声码器,采用纯解码器设计——没有扩散过程,没有繁重的编码器堆栈。
- 语音: 随模型附带54个内置语音包,在模型层面涵盖8种语言(英语、西班牙语、法语、印地语、意大利语、日语、葡萄牙语、中文)。
- 语音克隆: 不是官方内置功能。存在在Kokoro基础上添加零样本克隆的第三方社区项目,但这些是独立的、非官方的附加组件——不是hexgrad或基础模型本身提供或支持的东西。
- 分发: 模型卡片和权重位于Hugging Face的hexgrad/Kokoro-82M;也有量化版和ONNX社区构建可用于更轻量的部署。
赞助内容
使用ElevenLabs你付费的内容
今天就需要克隆或打磨过的声音,且不想在本地设置? 从ElevenLabs的免费层级开始——每月10,000积分,无需信用卡。免费试用ElevenLabs →
ElevenLabs消除了自己运行Kokoro时留给你的若干任务:
无需管理模型或运行环境
- 实际改变了什么:
- 你不需要下载权重、安装推理堆栈或排查音频依赖问题
语音克隆
- 实际改变了什么:
- 付费方案可从简短参考片段克隆语音——这是Kokoro不提供的功能
更大、经过筛选的语音库
- 实际改变了什么:
- 可从比Kokoro的54种固定预设语音更大的目录中选择
更广泛的文档化语言支持
- 实际改变了什么:
- 请查阅最新的ElevenLabs文档获取确切数字;可能比Kokoro模型层面的8种语言更广
托管扩展
- 实际改变了什么:
- 由服务商运营基础设施,而不是你自己管理GPU、服务器、更新和监控
生产功能
- 实际改变了什么:
- 付费方案可能包含商用许可访问权限和额外工具;请核实适用于你账户的方案条款
•Key Point: ElevenLabs目前列出:Free(0美元,每月10,000积分,无商用许可)、Starter(每月6美元,30,000积分,含商用许可和即时语音克隆)、Creator(每月22美元,121,000积分,专业语音克隆)、Pro(每月99美元,600,000积分,更高质量的192kbps音频)、Scale(每月299美元,1,800,000积分)、以及Business(每月990美元,6,000,000积分)。企业方案采用定制定价。按年计费可降低有效月费。文本转语音使用会消耗共享积分,确切的积分成本取决于所选模型和工作流程——决定前请在ElevenLabs实时定价页面确认最新数字。
•Key Point: 2026年5月7日,ElevenLabs下调了其自助服务API价格——Text to Speech降价高达55%,Speech to Text降价高达45%,ElevenAgents降价高达20%——并为不想按月订阅的开发者推出了按量付费积分。来源:ElevenLabs — We've lowered API & Agents pricing and introduced PAYG。
自己运行Kokoro的真实成本
想要免费、无限量的本地TTS,且不需要克隆功能? Kokoro是最易于上手运行的小型开放权重TTS模型之一。在Hugging Face上探索Kokoro-82M →
Kokoro的模型权重在Apache 2.0许可证下是0美元,但一旦真正部署,"免费"只是众多成本项之一:
硬件
- 意味着什么:
- 纯CPU机器对轻负载可用;中端GPU能加快生成速度和并发请求处理
安装
- 意味着什么:
- 需要安装Python环境、推理代码或封装,并下载模型和语音包
语音选择
- 意味着什么:
- 仅限于54种内置语音——没有第三方附加组件无法克隆你自己或客户的特定声音
没有官方托管API
- 意味着什么:
- 没有hexgrad运营的官方端点;需要自己托管或使用运行相同开放权重的第三方服务商
运维
- 意味着什么:
- 更新、安全、存储、日志、监控和扩展都是你自己的责任
可靠性
- 意味着什么:
- 你需要承担故障模式:依赖冲突、驱动问题以及并发负载下的延迟
•Key Point: Kokoro用前期设置时间和持续责任换取免除订阅费。对于想要免费、无限量、具备离线能力且不需要语音克隆的开发者来说,这是一笔好交易。如果你需要克隆语音,或想在没有任何设置的情况下今天就发布结果,这就是一笔糟糕的交易。
Kokoro vs ElevenLabs:并排对比
维度 | Kokoro | ElevenLabs |
|---|---|---|
| 产品类型 | 开放权重本地模型(82M参数) | 托管云平台 |
| 成本 | 免费(Apache 2.0);硬件自备 | 免费层级,之后为6至990美元以上/月的付费方案 |
| 设置 | 安装Python环境,下载权重和语音 | 创建账户即可生成——无需安装 |
| 联网要求 | 下载模型/语音后无需联网 | 正常使用需要连接服务 |
| 算力 | CPU或中端GPU——相对其输出质量而言很轻量 | 由服务商运营 |
| 语音目录 | 54种固定内置语音 | 更大的经筛选托管语音库,加上语音设计工具 |
| 语音克隆 | 无官方内置功能(存在非官方社区附加组件) | 付费方案支持从简短样本进行零样本/即时克隆 |
| 语言覆盖 | 模型层面记录支持8种语言 | 文档化覆盖更广——请查阅最新文档获取确切数字 |
| 隐私控制 | 运行后文本和音频可完全保留在你的设备上 | 受服务商条款、账户设置和当前数据实践约束 |
| 商业用途 | Apache 2.0允许对模型本身进行商业使用 | 请核实你的方案——商用许可访问权限与付费层级挂钩 |
| 许可证 | Apache 2.0(宽松) | 专有服务;使用受服务条款约束 |
| 最适合 | 想要免费、离线、固定语音TTS的开发者和爱好者 | 需要克隆、打磨度和速度且无需设置的创作者和企业 |
Kokoro在每参数质量方面的独立报道声誉来自社区基准测试和Hugging Face讨论,而非PromptQuorum进行的盲测——请视为方向性参考。两款工具的并发性和延迟因硬件和账户层级而异;在做决定前请用你自己的工作负载测试。
Kokoro实际需要什么硬件?
打算为本地AI语音或LLM工作购买硬件?查看我们的本地AI最佳GPU指南,获取各种预算的购买建议。
Kokoro较小的参数量(8200万)是它相比更大的TTS和语音克隆模型能在适中硬件上运行的主要原因。
纯CPU笔记本电脑
- Kokoro:
- 适用于轻度、非实时用途
Mac Mini / Apple Silicon
- Kokoro:
- 良好
16GB内存PC,无独立GPU
- Kokoro:
- 中等吞吐量表现良好
NVIDIA 8GB GPU
- Kokoro:
- 有充裕余量,生成更快
NVIDIA 12GB以上GPU
- Kokoro:
- 绰绰有余;主要用于并发场景
树莓派/低功耗嵌入式板
- Kokoro:
- 轻负载下可行,但不是Kokoro的主要目标平台——使用前请先测试
这些是方向性指南,而非基准测试——实际吞吐量取决于具体的推理运行环境(PyTorch、ONNX、GGUF)、批处理和并发负载。购买硬件前请用自己的脚本进行测试。
哪种工作流程更便宜?
答案取决于用量、你是否已经拥有合适的硬件,以及是否需要语音克隆功能。
场景 | Kokoro | ElevenLabs | 实用答案 |
|---|---|---|---|
| 本周偶尔需要一次配音 | 设置时间可能超过节省的价值 | 免费层级或小额付费方案几分钟内就能搞定 | ElevenLabs通常能更快得到成品 |
| 不需要克隆的业余项目或内部工具 | 运行后无按字符成本;如果已有机器则很理想 | 免费层级可用至每月10,000积分 | 持续免费使用时Kokoro通常更便宜 |
| 需要克隆特定声音 | 不是官方功能——需要非官方的第三方附加组件 | 在付费方案中内置,有同意要求 | ElevenLabs是直接且受支持的途径 |
| 大量生成(每月数千次请求) | 规模足够大时硬件和运维可能比按量积分更便宜 | 使用费用可能随用量大幅增长 | 请用你实际的请求量和硬件成本来计算 |
| 离线或隔离环境部署 | 模型和语音本地安装完成后表现出色 | 正常使用需要联网 | Kokoro胜出(离线要求) |
隐私、克隆与同意
在本地运行Kokoro可以让文本和生成的音频保留在你自己的设备上,但这并不会自动为你如何使用输出结果创建合规保障。根据使用场景和司法管辖区,你的责任仍可能包括合法依据、数据最小化、留存以及用户权利。
语音克隆引发了另一组更严肃的担忧——这些担忧特别适用于ElevenLabs的克隆功能,因为Kokoro根本不提供任何克隆功能:
- 未经明确、知情的许可,切勿克隆、模仿或部署真人的声音。 未经同意克隆声音可能使你承担法律责任(根据司法管辖区不同,可能涉及形象权、欺诈、诽谤等索赔),并对声音被使用的人造成实际伤害。
- 核实平台的同意与验证要求。 ElevenLabs的条款规定了克隆工作流程需要什么,以及你被允许对克隆语音做什么——在为商业用途克隆任何声音(包括你自己的声音)之前,请审阅最新条款。
- 在相关情况下披露合成或克隆音频。 平台政策、广告法规和受众期望越来越要求在音频是AI生成或语音克隆时进行披露,尤其是在商业或面向公众的内容中。
- Kokoro的固定语音集完全规避了这一风险类别 ——因为它没有内置克隆功能,对其附带的语音也就没有需要管理的同意问题。如果你在其之上添加了非官方的第三方克隆层,情况就会改变,那时就要承担与任何其他克隆工具相同的同意义务。
•Warning: 本文提供的是技术指导,而非法律建议。在部署任何语音克隆工作流程之前,请就你所在司法管辖区的同意、形象权和合规问题咨询合格的专业人士。
以下情况选择Kokoro
如果以下大多数描述符合你的情况,请选择免费的本地模型:
- 你想要免费、无限量的文本转语音,没有订阅或按字符计费。
- 流水线需要在设置完成后完全离线运行——嵌入式设备、信息亭、隔离系统。
- 你可以接受从54种预设语音的固定集合中选择,而不是克隆特定的声音。
- 你想在宽松许可证下安装、检查、微调或再分发模型。
- 你是开发者,能够熟练设置Python环境和推理流水线。
- 你生成大量音频,云端按量计费会不断累积成本。
•Key Point: Kokoro-82M的权重可在Apache 2.0许可证下从Hugging Face免费下载。无需账户,无需订阅,无需积分。
以下情况不要选择Kokoro
如果以下任何一项描述你的项目,本地固定语音模型就不适合:
- 你需要从样本克隆特定人物的声音——Kokoro没有为此提供官方功能。
- 你需要Kokoro模型层面8种语言之外的语言。
- 你想今天就得到结果,不想安装或配置任何东西。
- 你没有运行模型的硬件,也不想租用云实例。
- 你需要有支持和SLA的官方托管API——Kokoro没有官方托管端点。
以下情况选择ElevenLabs
如果以下大多数描述符合你的情况,请选择付费云平台:
- 你需要在获得适当同意的前提下从参考样本克隆特定声音。
- 你本周就需要一个打磨过的专业声音,而不是在完成设置项目之后。
- 你定期发布视频、广告、播客、课程或客户作品,并重视快速迭代。
- 你需要比Kokoro模型层面8种语言更广的语言或口音覆盖。
- 你不想安装依赖项、管理模型或维护本地基础设施。
- 在审阅其最新条款和数据实践后,你能接受使用第三方平台。
•Key Point: 每月10,000积分免费开始。无需信用卡。今天就用自己的脚本进行测试。
以下情况不要选择ElevenLabs
如果这就是你的情况,请改从Hugging Face上的Kokoro-82M →开始——免费、Apache 2.0许可证,可在CPU或中端GPU上运行。
如果以下任何一项描述你的项目,付费云平台就不适合:
- 你需要完全离线运行,没有互联网连接。
- 你的文本和音频不能离开自己的基础设施。
- 你需要无限量生成,没有任何按字符或按积分的成本。
- 你运行的是没有网络访问的隔离或嵌入式系统。
- 你想要对模型权重本身拥有完全的控制和可见性。
常见问题
Kokoro比ElevenLabs更好吗?
对于免费、离线、固定语音的生成:Kokoro在成本和控制方面胜出。对于语音克隆、更广泛的语言覆盖,或无需本地设置的输出:ElevenLabs胜出。它们解决的是不同的问题——Kokoro是你自己运营的模型,ElevenLabs是托管服务。
Kokoro能像ElevenLabs一样克隆声音吗?
不能,官方不支持。Kokoro内置54种固定预设语音,没有内置的零样本语音克隆功能。存在在Kokoro之上添加克隆功能的非官方第三方社区项目,但这些是独立的附加组件,不是基础模型或hexgrad直接支持的功能。
Kokoro可以免费用于商业用途吗?
Kokoro-82M在Apache 2.0许可证下发布,允许对模型本身进行商业使用、修改和再分发。由于条款可能更新,商业部署前请务必在模型卡片上核实最新许可证。
Kokoro有多少参数?
Kokoro-82M拥有8200万参数——相比大多数现代TTS系统而言较小,这也是它能在CPU或中端GPU上运行而无需专用加速器的原因。
Kokoro支持哪些语言?
Kokoro在模型层面记录支持8种语言:英语、西班牙语、法语、印地语、意大利语、日语、葡萄牙语和中文。请查阅最新模型卡片获取每种语言语音包的确切细分。
Kokoro需要GPU吗?
不需要。Kokoro可以在纯CPU硬件上运行轻度工作负载;中端GPU能加快生成速度并有助于处理并发请求,但鉴于模型仅有8200万参数的小体量,并非严格必需。
ElevenLabs的收费标准是多少?
ElevenLabs列出了Free方案(0美元,每月10,000积分,无商用许可),以及从Starter(每月6美元)到Business(每月990美元,6,000,000积分)的付费方案,加上定制的Enterprise定价。由于方案和积分成本会变化,请在ElevenLabs定价页面确认最新数字。
我可以让Kokoro完全离线运行吗?
可以,一旦下载了模型权重和语音包,Kokoro就能在没有互联网连接的情况下生成语音。ElevenLabs作为云服务,正常使用需要联网。
ElevenLabs提供免费方案吗?
是的。ElevenLabs的Free方案目前列出每月10,000积分,但不包含商用许可——若要将生成的音频用于商业用途,你需要像Starter这样的付费方案。发布获利内容前请核实最新条款。
Kokoro是开源的吗?
Kokoro-82M的模型权重在Apache 2.0许可证下发布,并托管在Hugging Face上,这使得权重和典型的推理代码公开可用。请务必核实你所使用的具体代码仓库的确切许可条款。
在大量使用的情况下,Kokoro和ElevenLabs哪个更便宜?
这取决于你的实际用量和硬件成本。Kokoro运行后没有按字符计费,因此在足够的用量下,硬件和设置可能比ElevenLabs的按量积分更便宜。ElevenLabs基于用量的定价可能随用量大幅增长。请用你实际的请求数量而非假设数字来计算。
我可以用本地模型免费克隆自己的声音吗?
不能直接用Kokoro实现,因为它不提供语音克隆功能。存在其他具备克隆能力的本地开放模型,但它们通常比Kokoro需要更多设置和更强的硬件。在为商业用途克隆任何声音(包括你自己的声音)之前,请务必获得明确同意,并核实具体工具的许可证和同意要求。
结论
如果你需要克隆语音、广泛的语言覆盖,或今天就要一个无需设置的打磨结果,从ElevenLabs开始。 免费层级(每月10,000积分,无需信用卡)消除了浪费设置时间的风险,付费方案解锁商用许可和克隆功能。
如果你想要免费、无限量、具备离线能力的文本转语音且不需要语音克隆,Kokoro是战略性的选择。 一个8200万参数、Apache 2.0许可证的模型,可在CPU或中端GPU上运行,内置54种语音,按字符零成本。
真正需要决定的不是"哪个听起来更好?"而是你更愿意租用一个具备克隆功能和更广覆盖的托管语音平台,还是自己下载并运行一个小型、免费、固定语音的模型。对于有特定离线或大量需求的开发者,Kokoro的设置是值得的。对于其他所有人,尤其是需要克隆功能的人,ElevenLabs的免费层级是更快的起点。
