Skip to main content
PromptQuorum
主页/本地LLM进阶/Izwi评测:支持TTS、STT与声音克隆的本地语音AI
Voice, Speech & Multimodal

Izwi评测:支持TTS、STT与声音克隆的本地语音AI

·阅读约10分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

Izwi是一款免费、开源、以本地优先为设计理念的语音AI运行时,将文本转语音、语音转文本、说话人分离和声音克隆整合在一个兼容OpenAI的API之下,因此你可以用它作为多个独立云端语音服务的本地直接替代方案。 它提供适用于macOS、Linux和Windows的桌面应用,以及Web界面和CLI,采用MIT许可,本地推理无需账户或API密钥。

Izwi(github.com/izwi-ai/izwi)是一款免费、开源、以本地优先为设计理念的语音AI运行时,将文本转语音、语音转文本、说话人分离和声音克隆整合在一个兼容OpenAI的API之下,提供桌面应用、Web界面和命令行工具三种形式。"Izwi"是祖鲁语和科萨语中"声音"的意思。本评测介绍它的功能、支持哪些模型、硬件要求,以及适合哪些人使用。

关键要点

  • Izwi(github.com/izwi-ai/izwi)是一款免费、开源、以本地优先为设计理念的语音AI运行时,用于文本转语音、语音转文本及相关音频任务
  • "Izwi"是祖鲁语和科萨语中"声音"的意思
  • 采用MIT许可,通过GitHub仓库的LICENSE文件确认
  • 提供桌面应用(macOS、Linux、Windows)、Web界面和命令行工具,均构建于同一个本地推理服务器之上
  • 截至本次评测,GitHub星标超过383,fork数为40
  • 目前仍处于测试版阶段:最新的带标签发布版本是v0.1.0-beta-17(2026年6月22日),而该仓库最近一次代码推送则是在2026年9月13日

📍 简单一句话

Izwi是一款免费、开源(MIT)、以本地优先为设计理念的语音AI运行时——提供桌面应用、Web界面和CLI——将文本转语音、语音转文本、说话人分离和声音克隆整合在一个兼容OpenAI的API之下,GitHub星标数超过383。

💬 简单来说

Izwi是一款你安装在自己电脑上的软件,可以把文本转换成语音、把语音转录成文本,还能根据样本克隆声音——全部在本地运行,而不是通过ElevenLabs或OpenAI音频接口等付费云端API。由于它的API格式与OpenAI自身的格式一致,许多为该API打造的现有应用只需极少改动就能改为指向Izwi。

📌: 本评测基于Izwi自身的GitHub仓库、其README文件以及通过GitHub API获取的发布历史。本评测不声称PromptQuorum独立测试过Izwi所支持的任何特定模型的音频质量或转录准确度。

Izwi是什么?

Izwi是一款免费、开源、以本地优先为设计理念的语音AI运行时,将文本转语音、语音转文本、说话人分离和声音克隆等多项独立语音任务整合在一个兼容OpenAI的API之下,而不需要为每项任务单独使用云端服务。 其自身README将它描述为"面向语音、聊天和音频工作流的本地优先语音AI"。

  • 产品类型:一个本地推理服务器,配有三种前端——原生桌面应用、基于浏览器的Web界面和CLI——三者都对接同一个底层引擎
  • 仓库:github.com/izwi-ai/izwi,创建于2026年1月23日
  • 许可:MIT,通过仓库的LICENSE文件确认
  • 网站:izwiai.com,另有独立文档位于izwiai.com/docs
  • 资金:本评测未发现Izwi获得融资轮次、投资者或商业支持的证据——应将Izwi视为一个看似独立、由社区支持的开源项目
  • 规模:截至本次评测,GitHub星标超过383,fork数为40

Izwi实际能做什么?

无论你使用桌面应用、Web界面还是CLI,Izwi都通过统一的界面覆盖四项相关的语音任务——发声、聆听、克隆以及管理本地模型。

  • 文本转语音:将文本转换为语音音频,包括长篇的"Studio"项目,支持声音设计和保存自定义声音
  • 声音克隆:使用支持的TTS模型系列,根据参考样本生成克隆声音的语音
  • 语音转文本:转录音频文件,并支持对实时音频进行流式转录
  • 说话人分离与强制对齐:识别多说话人音频中每句话是谁说的,并将转录文本与精确的音频时间戳对齐
  • 实时语音对话:结合本地自动语音识别、本地聊天模型和本地文本转语音,实现语音往返交流,概念上类似于语音助手
  • 模型管理:在应用内下载、加载、卸载和删除模型;查看聊天记录并导出结果
  • 兼容OpenAI的API:提供用于模型、聊天补全、音频语音生成和音频转录的/v1路由,并预览支持Responses API格式,因此现有的OpenAI API客户端代码通常只需极少改动即可指向本地Izwi服务器

Izwi支持哪些模型?

Izwi是一个运行时,而非单一模型——它为每项任务提供多个可互换的模型系列,供你根据硬件条件和质量需求选择。

文本转语音

Izwi目录中支持的模型系列:
Qwen3-TTS, Kokoro-82M, Voxtral TTS, VibeVoice

语音转文本

Izwi目录中支持的模型系列:
Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio, Voxtral Mini

说话人分离与对齐

Izwi目录中支持的模型系列:
Sortformer(说话人分离), Qwen3 ForcedAligner(时间戳对齐)

聊天

Izwi目录中支持的模型系列:
Qwen3, Qwen3.5, LFM2.5, Gemma

在本地运行izwi list查看当前已启用的模型目录,因为支持的模型可能会随版本更新而增减。部分模型权重带有各自独立的许可或使用限制——在重新分发或商业使用前,请先查看Izwi的模型指南izwiai.com/docs/models

使用示例

下载模型后,Izwi的CLI只需几条命令即可完成核心任务。

bash
# Start the local server with the web UI
izwi serve --mode web

# Download a TTS model, then generate speech
izwi pull Qwen3-TTS-12Hz-0.6B-Base
izwi tts "Hello from Izwi." --output hello.wav

# Download a speech-to-text model, then transcribe a file
izwi pull Parakeet-TDT-0.6B-v3
izwi transcribe audio.wav --model Parakeet-TDT-0.6B-v3

平台、定价与许可

平台

Izwi的说明:
提供适用于macOS、Linux和Windows的桌面应用;同时也提供Web界面和CLI/服务器形式,均构建于同一个本地引擎之上。

费用

Izwi的说明:
免费且开源。本地推理无需账户、订阅或API密钥;部分模型权重可能带有各自独立的许可条款。

许可

Izwi的说明:
MIT,通过GitHub仓库的LICENSE文件确认。

硬件加速

Izwi的说明:
macOS Apple Silicon发布版在macOS 15及以上使用Metal,在macOS 12-14上回退至CPU。Linux和Windows发布版默认仅支持CPU;NVIDIA CUDA需通过Docker CUDA配置文件或源代码构建来支持。

状态

Izwi的说明:
目前仍处于测试版阶段——最新的带标签发布版本是v0.1.0-beta-17,该标签之后仍有持续的提交活动。

安装前请直接前往izwiai.com/docs/support-matrix核实当前的运行时支持矩阵,因为硬件加速支持可能会随版本更新而变化。

Izwi vs. Whisper.cpp + Piper

Izwi用一个运行时和一个API,取代了常见的双工具本地语音方案——用Whisper.cpp做转录、用Piper做文本转语音——代价是它是一个更年轻、仍处于测试版阶段的项目。

覆盖范围

Izwi:
一个运行时,通过一个API覆盖TTS、STT、说话人分离、对齐和声音克隆
Whisper.cpp + Piper(分别使用):
两个独立项目——Whisper.cpp仅负责STT,Piper仅负责TTS——需要你分别运行并自行集成

API形式

Izwi:
兼容OpenAI的/v1路由,因此现有的OpenAI API客户端代码通常只需极少改动即可使用
Whisper.cpp + Piper(分别使用):
每个工具都有各自的CLI/库接口;两者默认没有共享或兼容OpenAI的API

声音克隆

Izwi:
通过兼容的TTS模型系列支持
Whisper.cpp + Piper(分别使用):
Piper和Whisper.cpp自身均不支持

项目成熟度

Izwi:
仅有测试版发布(最新:v0.1.0-beta-17);创建于2026年1月
Whisper.cpp + Piper(分别使用):
两者各自都是历史悠久、广泛部署的项目

界面

Izwi:
同一个项目提供桌面应用、Web界面和CLI
Whisper.cpp + Piper(分别使用):
命令行/库工具;任何图形界面都来自第三方封装

如果你想要一个运行时和一个API涵盖包括声音克隆在内的多项语音任务,可以选择Izwi。如果你特别看重每个工具各自悠久的历史记录,或者只需要两项任务中的一项,可以分别选择Whisper.cpp和Piper。详见Whisper.cpp评测Piper TTS评测

谁应该使用Izwi?

Izwi适合希望用一个本地工具覆盖多项语音任务、而不是拼凑多个独立云端API或单一功能本地工具的开发者及技术用户。

Izwi不适合什么场景

如果你需要在Linux/Windows上开箱即用的GPU加速,或需要一款历史悠久、非测试版的产品,Izwi并不适合你。

  • 在Linux或Windows上默认不支持GPU加速——发布版仅在CPU上运行,除非使用Docker CUDA配置文件或从源代码构建
  • 不是1.0正式版——最新的带标签版本是测试版(v0.1.0-beta-17),因此API和功能集仍可能发生变化
  • 不是单一功能的精简工具——如果你只需要一项任务(比如只需要TTS),像Piper这样的专用工具可能更简单易用
  • 不保证带标签的发布版本与最新代码同步——本评测发现最近一次代码推送(2026年9月13日)与最新的带标签发布版本(2026年6月22日)之间存在时间差
  • 本评测未能核实到任何融资轮次或公司的支持——应将它视为一个独立维护、由社区支持的项目

评估Izwi时的常见误区

关于Izwi的大多数困惑,源于误以为它是单一模型、默认期望处处都有GPU加速,或忽略了它仍处于1.0之前的阶段。

竞品与替代方案

Izwi最适合与其他本地或开源的文本转语音、语音转文本工具相比较,其中有几款它可以通过一个统一的API进行替代。

Tool
Best known for
Link
Whisper.cpp快速、广泛使用的本地语音转文本引擎,是OpenAI Whisper的C/C++移植版本Whisper.cpp评测
Piper轻量级、广泛部署的本地文本转语音引擎,常用于低功耗设备Piper TTS评测
Coqui TTS开源文本转语音工具包,支持声音克隆Coqui TTS评测
MacWhisper基于Whisper打造的macOS本地转录桌面应用MacWhisper评测

此列表反映了在本地语音AI领域常与Izwi比较的工具,并非PromptQuorum的独立排名——选择之前请核实每款工具当前的功能集和硬件支持情况。

常见问题

Izwi是什么?

Izwi(github.com/izwi-ai/izwi)是一款免费、开源(MIT)、以本地优先为设计理念的语音AI运行时,将文本转语音、语音转文本、说话人分离和声音克隆整合在一个兼容OpenAI的API之下。

Izwi是免费的吗?

是的,Izwi免费且开源(MIT许可)。本地推理无需账户、订阅或API密钥;部分下载的模型权重可能带有各自独立的许可条款。

"Izwi"是什么意思?

"Izwi"是祖鲁语和科萨语中"声音"的意思。

Izwi支持Windows吗?

支持,Izwi提供Windows安装程序(.exe),此外还有macOS(.dmg)和Linux(.deb)版本。Windows和Linux发布版默认仅支持CPU;在Apple Silicon Mac上可通过Metal使用GPU加速。

Izwi支持声音克隆吗?

支持,通过其目录中兼容的文本转语音模型系列实现,完全在你自己的设备上运行。

Izwi支持哪些语音转文本模型?

根据Izwi当前的模型目录,包括Parakeet、Whisper、Qwen3-ASR、Nemotron 3.5 ASR、VibeVoice ASR、LFM2.5 Audio和Voxtral Mini——在本地运行izwi list可查看当前已启用的模型。

Izwi使用兼容OpenAI的API吗?

是的。它提供用于模型、聊天补全、音频语音生成和音频转录的/v1路由,并预览支持Responses API格式。

Izwi是完成的1.0产品吗?

不是。截至本次评测,最新的带标签发布版本是测试版(v0.1.0-beta-17),因此API和模型目录预计仍会持续变化。

Izwi会把我的音频或转录内容发送到其他地方吗?

根据Izwi自身README,推理数据保留在你的设备上。可选的匿名桌面分析功能默认关闭,即使启用,据说明也不包含提示词、转录内容、音频数据、文件路径或个人身份信息。

如何安装Izwi?

从GitHub Releases下载适合你平台的安装程序(macOS为.dmg,Linux为.deb,Windows为.exe),或仅使用该项目的安装脚本或源代码构建来安装CLI/服务器。

信息来源

← 返回 本地LLM进阶