Skip to main content
PromptQuorum
Início/LLMs locais avançados/Izwi: IA de voz local para TTS, STT e clonagem
Voice, Speech & Multimodal

Izwi: IA de voz local para TTS, STT e clonagem

·10 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O Izwi é um runtime de IA de voz gratuito, de código aberto e local, que combina texto-para-voz, voz-para-texto, diarização de locutores e clonagem de voz atrás de uma única API compatível com OpenAI, permitindo usá-lo como substituto local direto para várias APIs de voz na nuvem ao mesmo tempo. Ele é distribuído como app desktop para macOS, Linux e Windows, além de uma interface web e uma CLI, e é licenciado sob MIT, sem exigir conta ou chave de API para inferência local.

Izwi (github.com/izwi-ai/izwi) é um runtime de IA de voz gratuito, de código aberto e local, que reúne texto-para-voz, voz-para-texto, diarização de locutores e clonagem de voz atrás de uma única API compatível com OpenAI, disponível como app desktop, interface web e ferramenta de linha de comando. "Izwi" é a palavra zulu e xhosa para "voz". Esta análise cobre o que ele faz, quais modelos suporta, seus requisitos de hardware e para quem é indicado.

Principais conclusões

  • O Izwi (github.com/izwi-ai/izwi) é um runtime de IA de voz gratuito, de código aberto e local, para texto-para-voz, voz-para-texto e tarefas de áudio relacionadas
  • "Izwi" é a palavra zulu e xhosa para "voz"
  • Licenciado sob MIT, confirmado pelo arquivo LICENSE do repositório no GitHub
  • Distribuído como app desktop (macOS, Linux, Windows), uma interface web e uma ferramenta de linha de comando, todos construídos sobre o mesmo servidor de inferência local
  • Mais de 383 estrelas no GitHub e 40 forks no momento desta análise
  • Ainda em beta: o lançamento com tag mais recente é o v0.1.0-beta-17 (22 de junho de 2026), embora o commit mais recente enviado ao repositório seja datado de 13 de setembro de 2026

📍 Em uma frase

O Izwi é um runtime de IA de voz gratuito, de código aberto (MIT) e local — app desktop, interface web e CLI — que reúne texto-para-voz, voz-para-texto, diarização de locutores e clonagem de voz atrás de uma única API compatível com OpenAI, com mais de 383 estrelas no GitHub.

💬 Em termos simples

O Izwi é um software que você instala no seu próprio computador, capaz de transformar texto em áudio falado, transformar áudio falado em texto e clonar uma voz a partir de uma amostra — tudo rodando localmente, em vez de por APIs pagas na nuvem, como as da ElevenLabs ou os endpoints de áudio da OpenAI. Como sua API corresponde ao formato da própria OpenAI, muitos apps já construídos para essa API podem apontar para o Izwi com mudanças mínimas.

📌Nota: Esta análise se baseia no próprio repositório do Izwi no GitHub, em seu README e em seu histórico de lançamentos via API do GitHub. Ela não afirma que a PromptQuorum realizou benchmarks independentes da qualidade de áudio ou da precisão de transcrição de nenhum modelo específico suportado pelo Izwi.

O que é o Izwi?

O Izwi é um runtime de IA de voz gratuito, de código aberto e local, que reúne várias tarefas de voz separadas — texto-para-voz, voz-para-texto, diarização e clonagem de voz — atrás de uma única API compatível com OpenAI, em vez de exigir um serviço na nuvem diferente para cada uma. Seu próprio README o descreve como "IA de voz local para fluxos de fala, chat e áudio."

  • Tipo de produto: um servidor de inferência local com três front-ends — um app desktop nativo, uma interface web baseada em navegador e uma CLI — todos se comunicando com o mesmo mecanismo subjacente
  • Repositório: github.com/izwi-ai/izwi, criado em 23 de janeiro de 2026
  • Licença: MIT, confirmada pelo arquivo LICENSE do repositório
  • Site: izwiai.com, com documentação separada em izwiai.com/docs
  • Financiamento: nenhuma rodada de financiamento, investidor ou apoio comercial foi encontrado para esta análise — trate o Izwi como um projeto de código aberto aparentemente independente, sustentado pela comunidade
  • Escala: mais de 383 estrelas no GitHub, 40 forks, no momento desta análise

O que você pode fazer com o Izwi?

O Izwi cobre quatro tarefas de voz relacionadas — falar, escutar, clonar e organizar modelos locais — por meio de uma interface consistente, seja no app desktop, na interface web ou na CLI.

  • Texto-para-voz: converte texto em áudio falado, incluindo projetos longos no modo "Studio", com suporte para design de voz e vozes personalizadas salvas
  • Clonagem de voz: gera fala em uma voz clonada a partir de uma amostra de referência, usando as famílias de modelos TTS suportadas
  • Voz-para-texto: transcreve arquivos de áudio, além de transcrição em streaming em tempo real para áudio ao vivo
  • Diarização de locutores e alinhamento forçado: identifica quem disse o quê em áudios com múltiplos locutores, e alinha o texto transcrito às marcações de tempo exatas do áudio
  • Conversa de voz em tempo real: combina reconhecimento de fala automático local, um modelo de chat local e texto-para-voz local para um diálogo falado, semelhante em conceito a um assistente de voz
  • Gerenciamento de modelos: baixar, carregar, descarregar e excluir modelos de dentro do app; visualizar histórico de chat e exportar resultados
  • API compatível com OpenAI: rotas /v1 para modelos, conclusões de chat, fala em áudio e transcrições de áudio, além de suporte experimental ao formato da Responses API, de modo que o código de clientes existentes para a API da OpenAI muitas vezes pode apontar para um servidor Izwi local com mudanças mínimas

Quais modelos o Izwi suporta?

O Izwi é um runtime, não um único modelo — ele suporta várias famílias de modelos intercambiáveis por tarefa, para que você escolha a que se encaixa no seu hardware e nas suas necessidades de qualidade.

Texto-para-voz

Famílias de modelos suportadas (catálogo do Izwi):
Qwen3-TTS, Kokoro-82M, Voxtral TTS, VibeVoice

Voz-para-texto

Famílias de modelos suportadas (catálogo do Izwi):
Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio, Voxtral Mini

Diarização e alinhamento

Famílias de modelos suportadas (catálogo do Izwi):
Sortformer (diarização), Qwen3 ForcedAligner (alinhamento de marcações de tempo)

Chat

Famílias de modelos suportadas (catálogo do Izwi):
Qwen3, Qwen3.5, LFM2.5, Gemma

Execute izwi list localmente para ver o catálogo atualmente habilitado, já que os modelos suportados podem ser adicionados ou alterados entre lançamentos. Alguns pesos de modelo carregam suas próprias licenças ou restrições de uso separadas — confira o Guia de Modelos do Izwi em izwiai.com/docs/models antes de redistribuir ou usar comercialmente.

Exemplos de uso

A CLI do Izwi cobre as tarefas principais em poucos comandos, assim que um modelo é baixado.

bash
# Start the local server with the web UI
izwi serve --mode web

# Download a TTS model, then generate speech
izwi pull Qwen3-TTS-12Hz-0.6B-Base
izwi tts "Hello from Izwi." --output hello.wav

# Download a speech-to-text model, then transcribe a file
izwi pull Parakeet-TDT-0.6B-v3
izwi transcribe audio.wav --model Parakeet-TDT-0.6B-v3

Plataforma, preços e licenciamento

Plataforma

O que o Izwi declara:
App desktop para macOS, Linux e Windows; também disponível como interface web e CLI/servidor, todos construídos sobre o mesmo mecanismo local.

Custo

O que o Izwi declara:
Gratuito e de código aberto. Nenhuma conta, assinatura ou chave de API é exigida para inferência local; alguns pesos de modelo podem carregar seus próprios termos de licença separados.

Licenciamento

O que o Izwi declara:
MIT, confirmado pelo arquivo LICENSE do repositório no GitHub.

Aceleração de hardware

O que o Izwi declara:
As builds de lançamento para macOS Apple Silicon usam Metal no macOS 15+ e recorrem à CPU no macOS 12-14. As builds de lançamento para Linux e Windows são apenas CPU por padrão; o CUDA da NVIDIA é suportado por meio de um perfil Docker CUDA ou de uma build a partir do código-fonte.

Status

O que o Izwi declara:
Ainda em beta — seu lançamento com tag mais recente é o v0.1.0-beta-17, com atividade de commits continuando após essa tag.

Verifique a Matriz de Suporte do Runtime atual diretamente em izwiai.com/docs/support-matrix antes de instalar, já que o suporte à aceleração de hardware pode mudar entre lançamentos.

Izwi vs. Whisper.cpp + Piper

O Izwi substitui uma pilha local comum de duas ferramentas — Whisper.cpp para transcrição mais Piper para texto-para-voz — por um único runtime e uma única API, ao custo de ser um projeto mais novo e ainda em beta.

Escopo

Izwi:
Um único runtime cobrindo TTS, STT, diarização, alinhamento e clonagem de voz atrás de uma única API
Whisper.cpp + Piper (separados):
Dois projetos separados — Whisper.cpp apenas para STT, Piper apenas para TTS — que você executa e integra de forma independente

Formato da API

Izwi:
Rotas /v1 compatíveis com OpenAI, então o código de clientes existentes para a API da OpenAI muitas vezes funciona com mudanças mínimas
Whisper.cpp + Piper (separados):
Cada ferramenta tem sua própria interface de CLI/biblioteca; não há API compartilhada ou compatível com OpenAI entre as duas por padrão

Clonagem de voz

Izwi:
Suportada por meio de famílias de modelos TTS compatíveis
Whisper.cpp + Piper (separados):
Não suportada nem pelo Piper nem pelo Whisper.cpp

Maturidade do projeto

Izwi:
Apenas lançamentos beta (mais recente: v0.1.0-beta-17); criado em janeiro de 2026
Whisper.cpp + Piper (separados):
Ambos são projetos individualmente consolidados e amplamente implantados

Interfaces

Izwi:
App desktop, interface web e CLI, de um único projeto
Whisper.cpp + Piper (separados):
Ferramentas de linha de comando/biblioteca; qualquer GUI vem de wrappers de terceiros

Escolha o Izwi se quiser um único runtime e uma única superfície de API para várias tarefas de voz, incluindo clonagem. Escolha o Whisper.cpp e o Piper separadamente se quiser especificamente o longo histórico individual de cada ferramenta, ou se precisar de apenas uma das duas tarefas. Veja a análise do Whisper.cpp e a análise do Piper TTS para detalhes sobre cada uma.

Quem deveria usar o Izwi?

O Izwi é indicado para desenvolvedores e usuários técnicos que querem uma única ferramenta local cobrindo várias tarefas de voz, em vez de costurar APIs na nuvem separadas ou ferramentas locais de propósito único.

Para que o Izwi não é bom

O Izwi não é uma boa opção se você precisa de aceleração por GPU pronta para uso no Linux/Windows, ou de um produto consolidado e fora do beta.

  • Não tem aceleração por GPU por padrão no Linux ou Windows — as builds de lançamento rodam apenas em CPU, a menos que você use o perfil Docker CUDA ou compile a partir do código-fonte
  • Não é um lançamento 1.0 — a versão com tag mais recente é um beta (v0.1.0-beta-17), então espere que a API e o conjunto de recursos ainda estejam se estabilizando
  • Não é uma ferramenta mínima de propósito único — se você só precisa de uma tarefa (digamos, apenas TTS), uma ferramenta dedicada como o Piper pode ser mais simples de executar
  • Não tem garantia de possuir um lançamento com tag correspondente ao código mais recente — esta análise encontrou uma diferença entre o commit mais recente enviado (13 de setembro de 2026) e o lançamento com tag mais recente (22 de junho de 2026)
  • Não tem por trás uma rodada de financiamento ou empresa que esta análise pudesse verificar — trate-o como um projeto mantido de forma independente, sustentado pela comunidade

Erros comuns ao avaliar o Izwi

A maior parte da confusão sobre o Izwi vem de presumir que ele é um único modelo, esperar aceleração por GPU em todo lugar por padrão, ou não perceber que ele ainda é pré-1.0.

Concorrentes e alternativas

O Izwi é mais diretamente comparável a outras ferramentas locais ou de código aberto de texto-para-voz e voz-para-texto, várias das quais ele pode substituir atrás de uma API unificada.

Ferramenta
Mais conhecida por
Link
Whisper.cppMecanismo local de voz-para-texto rápido e amplamente usado, um port em C/C++ do Whisper da OpenAIAnálise do Whisper.cpp
PiperMecanismo local de texto-para-voz leve, usado com frequência em dispositivos de baixa potênciaAnálise do Piper TTS
Coqui TTSKit de ferramentas de texto-para-voz de código aberto com suporte a clonagem de vozAnálise do Coqui TTS
MacWhisperApp desktop para macOS para transcrição local, construído sobre o WhisperAnálise do MacWhisper

Esta lista reflete ferramentas comumente comparadas ao Izwi no espaço de IA de voz local, não um ranking independente da PromptQuorum — verifique o conjunto de recursos e o suporte de hardware atuais de cada ferramenta antes de escolher.

Perguntas frequentes

O que é o Izwi?

O Izwi (github.com/izwi-ai/izwi) é um runtime de IA de voz gratuito, de código aberto (MIT) e local, que reúne texto-para-voz, voz-para-texto, diarização e clonagem de voz atrás de uma única API compatível com OpenAI.

O Izwi é gratuito?

Sim, o Izwi é gratuito e de código aberto (licença MIT). Nenhuma conta, assinatura ou chave de API é exigida para inferência local; alguns pesos de modelo baixados podem carregar seus próprios termos de licença separados.

O que significa "Izwi"?

"Izwi" é a palavra zulu e xhosa para "voz".

O Izwi roda no Windows?

Sim, o Izwi tem um instalador para Windows (.exe), além das builds para macOS (.dmg) e Linux (.deb). As builds de lançamento para Windows e Linux são apenas CPU por padrão; a aceleração por GPU via Metal está disponível em Macs com Apple Silicon.

O Izwi suporta clonagem de voz?

Sim, por meio de famílias de modelos de texto-para-voz compatíveis em seu catálogo, executadas inteiramente na sua própria máquina.

Quais modelos de voz-para-texto o Izwi suporta?

Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio e Voxtral Mini, segundo o catálogo de modelos atual do Izwi — execute izwi list localmente para ver o que está habilitado.

O Izwi usa uma API compatível com OpenAI?

Sim. Ele expõe rotas /v1 para modelos, conclusões de chat, fala em áudio e transcrições de áudio, além de suporte experimental ao formato da Responses API.

O Izwi é um produto 1.0 finalizado?

Não. No momento desta análise, o lançamento com tag mais recente é um beta (v0.1.0-beta-17), então espere que a API e o catálogo de modelos continuem mudando.

O Izwi envia meu áudio ou transcrições para algum lugar?

Segundo o próprio README do Izwi, os dados de inferência permanecem na sua máquina. A telemetria anônima opcional de desktop vem desativada por padrão e, se ativada, o projeto declara que não inclui prompts, transcrições, payloads de áudio, caminhos de arquivo ou identificadores pessoais.

Como instalo o Izwi?

Baixe o instalador para sua plataforma no GitHub Releases (.dmg para macOS, .deb para Linux, .exe para Windows), ou instale apenas a CLI/servidor com o script de instalação do projeto ou uma build a partir do código-fonte.

Fontes

← Voltar para LLMs locais avançados