关键要点
- Izwi(github.com/izwi-ai/izwi)是一款免费、开源、以本地优先为设计理念的语音AI运行时,用于文本转语音、语音转文本及相关音频任务
- "Izwi"是祖鲁语和科萨语中"声音"的意思
- 采用MIT许可,通过GitHub仓库的LICENSE文件确认
- 提供桌面应用(macOS、Linux、Windows)、Web界面和命令行工具,均构建于同一个本地推理服务器之上
- 截至本次评测,GitHub星标超过383,fork数为40
- 目前仍处于测试版阶段:最新的带标签发布版本是v0.1.0-beta-17(2026年6月22日),而该仓库最近一次代码推送则是在2026年9月13日
📍 简单一句话
Izwi是一款免费、开源(MIT)、以本地优先为设计理念的语音AI运行时——提供桌面应用、Web界面和CLI——将文本转语音、语音转文本、说话人分离和声音克隆整合在一个兼容OpenAI的API之下,GitHub星标数超过383。
💬 简单来说
Izwi是一款你安装在自己电脑上的软件,可以把文本转换成语音、把语音转录成文本,还能根据样本克隆声音——全部在本地运行,而不是通过ElevenLabs或OpenAI音频接口等付费云端API。由于它的API格式与OpenAI自身的格式一致,许多为该API打造的现有应用只需极少改动就能改为指向Izwi。
📌注: 本评测基于Izwi自身的GitHub仓库、其README文件以及通过GitHub API获取的发布历史。本评测不声称PromptQuorum独立测试过Izwi所支持的任何特定模型的音频质量或转录准确度。
Izwi是什么?
Izwi是一款免费、开源、以本地优先为设计理念的语音AI运行时,将文本转语音、语音转文本、说话人分离和声音克隆等多项独立语音任务整合在一个兼容OpenAI的API之下,而不需要为每项任务单独使用云端服务。 其自身README将它描述为"面向语音、聊天和音频工作流的本地优先语音AI"。
- 产品类型:一个本地推理服务器,配有三种前端——原生桌面应用、基于浏览器的Web界面和CLI——三者都对接同一个底层引擎
- 仓库:github.com/izwi-ai/izwi,创建于2026年1月23日
- 许可:MIT,通过仓库的LICENSE文件确认
- 网站:izwiai.com,另有独立文档位于izwiai.com/docs
- 资金:本评测未发现Izwi获得融资轮次、投资者或商业支持的证据——应将Izwi视为一个看似独立、由社区支持的开源项目
- 规模:截至本次评测,GitHub星标超过383,fork数为40
Izwi实际能做什么?
无论你使用桌面应用、Web界面还是CLI,Izwi都通过统一的界面覆盖四项相关的语音任务——发声、聆听、克隆以及管理本地模型。
- 文本转语音:将文本转换为语音音频,包括长篇的"Studio"项目,支持声音设计和保存自定义声音
- 声音克隆:使用支持的TTS模型系列,根据参考样本生成克隆声音的语音
- 语音转文本:转录音频文件,并支持对实时音频进行流式转录
- 说话人分离与强制对齐:识别多说话人音频中每句话是谁说的,并将转录文本与精确的音频时间戳对齐
- 实时语音对话:结合本地自动语音识别、本地聊天模型和本地文本转语音,实现语音往返交流,概念上类似于语音助手
- 模型管理:在应用内下载、加载、卸载和删除模型;查看聊天记录并导出结果
- 兼容OpenAI的API:提供用于模型、聊天补全、音频语音生成和音频转录的
/v1路由,并预览支持Responses API格式,因此现有的OpenAI API客户端代码通常只需极少改动即可指向本地Izwi服务器
Izwi支持哪些模型?
Izwi是一个运行时,而非单一模型——它为每项任务提供多个可互换的模型系列,供你根据硬件条件和质量需求选择。
文本转语音
- Izwi目录中支持的模型系列:
- Qwen3-TTS, Kokoro-82M, Voxtral TTS, VibeVoice
语音转文本
- Izwi目录中支持的模型系列:
- Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio, Voxtral Mini
说话人分离与对齐
- Izwi目录中支持的模型系列:
- Sortformer(说话人分离), Qwen3 ForcedAligner(时间戳对齐)
聊天
- Izwi目录中支持的模型系列:
- Qwen3, Qwen3.5, LFM2.5, Gemma
在本地运行izwi list查看当前已启用的模型目录,因为支持的模型可能会随版本更新而增减。部分模型权重带有各自独立的许可或使用限制——在重新分发或商业使用前,请先查看Izwi的模型指南izwiai.com/docs/models。
使用示例
下载模型后,Izwi的CLI只需几条命令即可完成核心任务。
# Start the local server with the web UI
izwi serve --mode web
# Download a TTS model, then generate speech
izwi pull Qwen3-TTS-12Hz-0.6B-Base
izwi tts "Hello from Izwi." --output hello.wav
# Download a speech-to-text model, then transcribe a file
izwi pull Parakeet-TDT-0.6B-v3
izwi transcribe audio.wav --model Parakeet-TDT-0.6B-v3平台、定价与许可
平台
- Izwi的说明:
- 提供适用于macOS、Linux和Windows的桌面应用;同时也提供Web界面和CLI/服务器形式,均构建于同一个本地引擎之上。
费用
- Izwi的说明:
- 免费且开源。本地推理无需账户、订阅或API密钥;部分模型权重可能带有各自独立的许可条款。
许可
- Izwi的说明:
- MIT,通过GitHub仓库的LICENSE文件确认。
硬件加速
- Izwi的说明:
- macOS Apple Silicon发布版在macOS 15及以上使用Metal,在macOS 12-14上回退至CPU。Linux和Windows发布版默认仅支持CPU;NVIDIA CUDA需通过Docker CUDA配置文件或源代码构建来支持。
状态
- Izwi的说明:
- 目前仍处于测试版阶段——最新的带标签发布版本是v0.1.0-beta-17,该标签之后仍有持续的提交活动。
安装前请直接前往izwiai.com/docs/support-matrix核实当前的运行时支持矩阵,因为硬件加速支持可能会随版本更新而变化。
安装Izwi
Izwi为三大桌面平台提供预构建的安装程序,同时还提供CLI安装脚本和源代码构建方式。
Source | Link |
|---|---|
| GitHub Releases(macOS .dmg、Linux .deb、Windows .exe) | github.com/izwi-ai/izwi/releases |
| GitHub仓库(源代码,MIT) | github.com/izwi-ai/izwi |
| CLI安装脚本 | ./scripts/install-cli.sh,或使用cargo build --release -p izwi-cli手动构建 |
| 文档 | izwiai.com/docs |
在Linux上,使用sudo dpkg -i izwi_*.deb安装下载的软件包。Linux或Windows上的CUDA加速需要Docker CUDA配置文件,或使用匹配的CUDA工具包进行源代码构建——发布版默认仅支持CPU。
Izwi vs. Whisper.cpp + Piper
Izwi用一个运行时和一个API,取代了常见的双工具本地语音方案——用Whisper.cpp做转录、用Piper做文本转语音——代价是它是一个更年轻、仍处于测试版阶段的项目。
覆盖范围
- Izwi:
- 一个运行时,通过一个API覆盖TTS、STT、说话人分离、对齐和声音克隆
- Whisper.cpp + Piper(分别使用):
- 两个独立项目——Whisper.cpp仅负责STT,Piper仅负责TTS——需要你分别运行并自行集成
API形式
- Izwi:
- 兼容OpenAI的
/v1路由,因此现有的OpenAI API客户端代码通常只需极少改动即可使用 - Whisper.cpp + Piper(分别使用):
- 每个工具都有各自的CLI/库接口;两者默认没有共享或兼容OpenAI的API
声音克隆
- Izwi:
- 通过兼容的TTS模型系列支持
- Whisper.cpp + Piper(分别使用):
- Piper和Whisper.cpp自身均不支持
项目成熟度
- Izwi:
- 仅有测试版发布(最新:v0.1.0-beta-17);创建于2026年1月
- Whisper.cpp + Piper(分别使用):
- 两者各自都是历史悠久、广泛部署的项目
界面
- Izwi:
- 同一个项目提供桌面应用、Web界面和CLI
- Whisper.cpp + Piper(分别使用):
- 命令行/库工具;任何图形界面都来自第三方封装
如果你想要一个运行时和一个API涵盖包括声音克隆在内的多项语音任务,可以选择Izwi。如果你特别看重每个工具各自悠久的历史记录,或者只需要两项任务中的一项,可以分别选择Whisper.cpp和Piper。详见Whisper.cpp评测和Piper TTS评测。
谁应该使用Izwi?
Izwi适合希望用一个本地工具覆盖多项语音任务、而不是拼凑多个独立云端API或单一功能本地工具的开发者及技术用户。
Izwi不适合什么场景
如果你需要在Linux/Windows上开箱即用的GPU加速,或需要一款历史悠久、非测试版的产品,Izwi并不适合你。
- 在Linux或Windows上默认不支持GPU加速——发布版仅在CPU上运行,除非使用Docker CUDA配置文件或从源代码构建
- 不是1.0正式版——最新的带标签版本是测试版(v0.1.0-beta-17),因此API和功能集仍可能发生变化
- 不是单一功能的精简工具——如果你只需要一项任务(比如只需要TTS),像Piper这样的专用工具可能更简单易用
- 不保证带标签的发布版本与最新代码同步——本评测发现最近一次代码推送(2026年9月13日)与最新的带标签发布版本(2026年6月22日)之间存在时间差
- 本评测未能核实到任何融资轮次或公司的支持——应将它视为一个独立维护、由社区支持的项目
评估Izwi时的常见误区
关于Izwi的大多数困惑,源于误以为它是单一模型、默认期望处处都有GPU加速,或忽略了它仍处于1.0之前的阶段。
竞品与替代方案
Izwi最适合与其他本地或开源的文本转语音、语音转文本工具相比较,其中有几款它可以通过一个统一的API进行替代。
Tool | Best known for | Link |
|---|---|---|
| Whisper.cpp | 快速、广泛使用的本地语音转文本引擎,是OpenAI Whisper的C/C++移植版本 | Whisper.cpp评测 |
| Piper | 轻量级、广泛部署的本地文本转语音引擎,常用于低功耗设备 | Piper TTS评测 |
| Coqui TTS | 开源文本转语音工具包,支持声音克隆 | Coqui TTS评测 |
| MacWhisper | 基于Whisper打造的macOS本地转录桌面应用 | MacWhisper评测 |
此列表反映了在本地语音AI领域常与Izwi比较的工具,并非PromptQuorum的独立排名——选择之前请核实每款工具当前的功能集和硬件支持情况。
常见问题
Izwi是什么?
Izwi(github.com/izwi-ai/izwi)是一款免费、开源(MIT)、以本地优先为设计理念的语音AI运行时,将文本转语音、语音转文本、说话人分离和声音克隆整合在一个兼容OpenAI的API之下。
Izwi是免费的吗?
是的,Izwi免费且开源(MIT许可)。本地推理无需账户、订阅或API密钥;部分下载的模型权重可能带有各自独立的许可条款。
"Izwi"是什么意思?
"Izwi"是祖鲁语和科萨语中"声音"的意思。
Izwi支持Windows吗?
支持,Izwi提供Windows安装程序(.exe),此外还有macOS(.dmg)和Linux(.deb)版本。Windows和Linux发布版默认仅支持CPU;在Apple Silicon Mac上可通过Metal使用GPU加速。
Izwi支持声音克隆吗?
支持,通过其目录中兼容的文本转语音模型系列实现,完全在你自己的设备上运行。
Izwi支持哪些语音转文本模型?
根据Izwi当前的模型目录,包括Parakeet、Whisper、Qwen3-ASR、Nemotron 3.5 ASR、VibeVoice ASR、LFM2.5 Audio和Voxtral Mini——在本地运行izwi list可查看当前已启用的模型。
Izwi使用兼容OpenAI的API吗?
是的。它提供用于模型、聊天补全、音频语音生成和音频转录的/v1路由,并预览支持Responses API格式。
Izwi是完成的1.0产品吗?
不是。截至本次评测,最新的带标签发布版本是测试版(v0.1.0-beta-17),因此API和模型目录预计仍会持续变化。
Izwi会把我的音频或转录内容发送到其他地方吗?
根据Izwi自身README,推理数据保留在你的设备上。可选的匿名桌面分析功能默认关闭,即使启用,据说明也不包含提示词、转录内容、音频数据、文件路径或个人身份信息。
如何安装Izwi?
从GitHub Releases下载适合你平台的安装程序(macOS为.dmg,Linux为.deb,Windows为.exe),或仅使用该项目的安装脚本或源代码构建来安装CLI/服务器。