Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Izwi: IA de voz local para TTS, STT y clonación
Voice, Speech & Multimodal

Izwi: IA de voz local para TTS, STT y clonación

·9 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Izwi es un runtime de IA de voz gratuito, de código abierto y local que combina texto a voz, voz a texto, diarización de hablantes y clonación de voz detrás de una única API compatible con OpenAI, de modo que puedes usarlo como reemplazo local directo de varios servicios de voz en la nube a la vez. Se distribuye como aplicación de escritorio para macOS, Linux y Windows, además de una interfaz web y una CLI, y tiene licencia MIT sin necesidad de cuenta ni clave de API para la inferencia local.

Izwi (github.com/izwi-ai/izwi) es un runtime de IA de voz gratuito, de código abierto y local que agrupa texto a voz, voz a texto, diarización de hablantes y clonación de voz detrás de una única API compatible con OpenAI, disponible como aplicación de escritorio, interfaz web y herramienta de línea de comandos. "Izwi" es la palabra zulú y xhosa para "voz". Esta reseña cubre qué hace, qué modelos admite, sus requisitos de hardware y para quién es adecuada.

Conclusiones clave

  • Izwi (github.com/izwi-ai/izwi) es un runtime de IA de voz gratuito, de código abierto y local para texto a voz, voz a texto y tareas de audio relacionadas
  • "Izwi" es la palabra zulú y xhosa para "voz"
  • Con licencia MIT, confirmada mediante el archivo LICENSE del repositorio de GitHub
  • Se distribuye como aplicación de escritorio (macOS, Linux, Windows), interfaz web y herramienta de línea de comandos, todas construidas sobre el mismo servidor de inferencia local
  • Más de 383 estrellas en GitHub y 40 forks al momento de esta reseña
  • Todavía en beta: la versión etiquetada más reciente es v0.1.0-beta-17 (22 de junio de 2026), aunque el push de commit más reciente del repositorio tiene fecha del 13 de septiembre de 2026

📍 En una frase

Izwi es un runtime de IA de voz local, gratuito y de código abierto (MIT) — aplicación de escritorio, interfaz web y CLI — que agrupa texto a voz, voz a texto, diarización de hablantes y clonación de voz detrás de una única API compatible con OpenAI, con más de 383 estrellas en GitHub.

💬 En términos simples

Izwi es un software que instalas en tu propio equipo, que convierte texto en audio hablado, convierte audio hablado en texto y puede clonar una voz a partir de una muestra — todo ejecutándose localmente en lugar de a través de APIs en la nube de pago como las de ElevenLabs o los endpoints de audio de OpenAI. Como su API coincide con el formato propio de OpenAI, muchas aplicaciones existentes construidas para esa API pueden apuntar a Izwi en su lugar con cambios mínimos.

📌Nota: Esta reseña se basa en el propio repositorio de GitHub de Izwi, su README y su historial de versiones a través de la API de GitHub. No afirma que PromptQuorum haya evaluado de forma independiente la calidad de audio o la precisión de transcripción de ningún modelo específico admitido por Izwi.

¿Qué es Izwi?

Izwi es un runtime de IA de voz gratuito, de código abierto y local que agrupa varias tareas de voz independientes — texto a voz, voz a texto, diarización y clonación de voz — detrás de una única API compatible con OpenAI, en lugar de requerir un servicio en la nube diferente para cada una. Su propio README lo describe como "IA de voz local para flujos de trabajo de habla, chat y audio".

  • Tipo de producto: un servidor de inferencia local con tres interfaces — una aplicación de escritorio nativa, una interfaz web basada en navegador y una CLI — todas conectadas al mismo motor subyacente
  • Repositorio: github.com/izwi-ai/izwi, creado el 23 de enero de 2026
  • Licencia: MIT, confirmada mediante el archivo LICENSE del repositorio
  • Sitio web: izwiai.com, con documentación separada en izwiai.com/docs
  • Financiación: para esta reseña no se encontró ninguna ronda de financiación, inversor o respaldo comercial — trata a Izwi como un proyecto de código abierto aparentemente independiente, sostenido por la comunidad
  • Escala: más de 383 estrellas en GitHub, 40 forks, al momento de esta reseña

¿Qué puedes hacer con Izwi?

Izwi cubre cuatro tareas de voz relacionadas — hablar, escuchar, clonar y organizar modelos locales — a través de una interfaz consistente, ya sea que uses la aplicación de escritorio, la interfaz web o la CLI.

  • Texto a voz: convierte texto en audio hablado, incluidos proyectos "Studio" de formato largo, con soporte para diseño de voz y voces personalizadas guardadas
  • Clonación de voz: genera voz en una voz clonada a partir de una muestra de referencia, usando familias de modelos de TTS compatibles
  • Voz a texto: transcribe archivos de audio, además de transcripción por streaming en tiempo real para audio en vivo
  • Diarización de hablantes y alineación forzada: identifica quién dijo qué en audio con múltiples hablantes, y alinea el texto transcrito con marcas de tiempo exactas del audio
  • Conversación de voz en tiempo real: combina reconocimiento automático de voz local, un modelo de chat local y texto a voz local para un intercambio hablado, similar en concepto a un asistente de voz
  • Gestión de modelos: descarga, carga, descarga y elimina modelos desde dentro de la aplicación; visualiza el historial de chat y exporta resultados
  • API compatible con OpenAI: rutas /v1 para modelos, completions de chat, audio de voz y transcripciones de audio, además de soporte en vista previa para el formato de la Responses API, de modo que el código cliente existente de la API de OpenAI a menudo puede apuntar a un servidor Izwi local con cambios mínimos

¿Qué modelos admite Izwi?

Izwi es un runtime, no un único modelo — admite varias familias de modelos intercambiables por tarea, así que eliges la que se ajusta a tu hardware y a tus necesidades de calidad.

Texto a voz

Familias de modelos admitidas (según el catálogo de Izwi):
Qwen3-TTS, Kokoro-82M, Voxtral TTS, VibeVoice

Voz a texto

Familias de modelos admitidas (según el catálogo de Izwi):
Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio, Voxtral Mini

Diarización y alineación

Familias de modelos admitidas (según el catálogo de Izwi):
Sortformer (diarización), Qwen3 ForcedAligner (alineación de marcas de tiempo)

Chat

Familias de modelos admitidas (según el catálogo de Izwi):
Qwen3, Qwen3.5, LFM2.5, Gemma

Ejecuta izwi list localmente para ver el catálogo habilitado actual, ya que los modelos admitidos pueden añadirse o cambiar entre versiones. Algunos pesos de modelo tienen sus propias licencias o restricciones de uso independientes — consulta la Guía de modelos de Izwi en izwiai.com/docs/models antes de redistribuir o usar comercialmente.

Ejemplos de uso

La CLI de Izwi cubre las tareas principales en un puñado de comandos, una vez que se ha descargado un modelo.

bash
# Iniciar el servidor local con la interfaz web
izwi serve --mode web

# Descargar un modelo de TTS y luego generar voz
izwi pull Qwen3-TTS-12Hz-0.6B-Base
izwi tts "Hello from Izwi." --output hello.wav

# Descargar un modelo de voz a texto y luego transcribir un archivo
izwi pull Parakeet-TDT-0.6B-v3
izwi transcribe audio.wav --model Parakeet-TDT-0.6B-v3

Plataforma, precios y licencia

Plataforma

Lo que indica Izwi:
Aplicación de escritorio para macOS, Linux y Windows; también disponible como interfaz web y CLI/servidor, todas construidas sobre el mismo motor local.

Costo

Lo que indica Izwi:
Gratuito y de código abierto. No se requiere cuenta, suscripción ni clave de API para la inferencia local; algunos pesos de modelo pueden tener sus propios términos de licencia independientes.

Licencia

Lo que indica Izwi:
MIT, confirmada mediante el archivo LICENSE del repositorio de GitHub.

Aceleración de hardware

Lo que indica Izwi:
Las compilaciones de lanzamiento para Apple Silicon en macOS usan Metal en macOS 15+ y recurren a la CPU en macOS 12-14. Las compilaciones de lanzamiento para Linux y Windows son solo de CPU por defecto; NVIDIA CUDA se admite mediante un perfil Docker CUDA o una compilación desde el código fuente.

Estado

Lo que indica Izwi:
Todavía en beta — su versión etiquetada más reciente es v0.1.0-beta-17, con actividad de commits que continúa después de esa etiqueta.

Verifica la Matriz de compatibilidad de runtime actual directamente en izwiai.com/docs/support-matrix antes de instalar, ya que la compatibilidad de aceleración de hardware puede cambiar entre versiones.

Izwi vs. Whisper.cpp + Piper

Izwi reemplaza una combinación local de dos herramientas habitual — Whisper.cpp para transcripción más Piper para texto a voz — con un único runtime y una única API, al costo de ser un proyecto más joven y todavía en beta.

Alcance

Izwi:
Un único runtime que cubre TTS, STT, diarización, alineación y clonación de voz detrás de una sola API
Whisper.cpp + Piper (por separado):
Dos proyectos separados — Whisper.cpp solo para STT, Piper solo para TTS — que ejecutas e integras de forma independiente

Forma de la API

Izwi:
Rutas /v1 compatibles con OpenAI, así que el código cliente existente de la API de OpenAI a menudo funciona con cambios mínimos
Whisper.cpp + Piper (por separado):
Cada herramienta tiene su propia interfaz de CLI/biblioteca; no hay una API compartida o compatible con OpenAI entre ambas por defecto

Clonación de voz

Izwi:
Admitida a través de familias de modelos de TTS compatibles
Whisper.cpp + Piper (por separado):
No admitida por Piper ni por Whisper.cpp en sí mismos

Madurez del proyecto

Izwi:
Solo versiones beta (la última: v0.1.0-beta-17); creado en enero de 2026
Whisper.cpp + Piper (por separado):
Ambos son proyectos individualmente establecidos desde hace tiempo y ampliamente desplegados

Interfaces

Izwi:
Aplicación de escritorio, interfaz web y CLI de un único proyecto
Whisper.cpp + Piper (por separado):
Herramientas de línea de comandos/biblioteca; cualquier interfaz gráfica proviene de envoltorios de terceros

Elige Izwi si quieres un único runtime y una única superficie de API para varias tareas de voz, incluida la clonación. Elige Whisper.cpp y Piper por separado si quieres específicamente el largo historial individual de cada herramienta, o solo necesitas una de las dos tareas. Consulta la reseña de Whisper.cpp y la reseña de Piper TTS para más detalles sobre cada una.

¿Quién debería usar Izwi?

Izwi es adecuado para desarrolladores y usuarios técnicos que quieren una única herramienta local que cubra varias tareas de voz, en lugar de combinar APIs en la nube independientes o herramientas locales de un solo propósito.

Para qué no es bueno Izwi

Izwi no es una buena opción si necesitas aceleración por GPU lista para usar en Linux/Windows o un producto establecido desde hace tiempo y no en beta.

  • No tiene aceleración por GPU por defecto en Linux o Windows — las compilaciones de lanzamiento se ejecutan solo en CPU a menos que uses el perfil Docker CUDA o compiles desde el código fuente
  • No es una versión 1.0 — la versión etiquetada más reciente es una beta (v0.1.0-beta-17), así que espera que la API y el conjunto de funciones todavía se estén asentando
  • No es una herramienta mínima de un solo propósito — si solo necesitas una tarea (digamos, solo TTS), una herramienta dedicada como Piper puede ser más simple de ejecutar
  • No garantiza tener una versión etiquetada que coincida con su código más reciente — esta reseña encontró una brecha entre el push de commit más reciente (13 de septiembre de 2026) y la versión etiquetada más reciente (22 de junio de 2026)
  • No está respaldado por una ronda de financiación o una empresa que esta reseña pudiera verificar — trátalo como un proyecto mantenido de forma independiente, sostenido por la comunidad

Errores comunes al evaluar Izwi

La mayor parte de la confusión sobre Izwi proviene de asumir que es un único modelo, esperar aceleración por GPU en todas partes por defecto, o pasar por alto que todavía está antes de la versión 1.0.

Competidores y alternativas

Izwi se compara más directamente con otras herramientas locales o de código abierto de texto a voz y voz a texto, varias de las cuales puede sustituir detrás de una API unificada.

Tool
Best known for
Link
Whisper.cppMotor local de voz a texto rápido y ampliamente usado, un port en C/C++ del Whisper de OpenAIreseña de Whisper.cpp
PiperMotor local de texto a voz ligero y ampliamente desplegado, usado a menudo en dispositivos de bajo consumoreseña de Piper TTS
Coqui TTSKit de herramientas de texto a voz de código abierto con soporte de clonación de vozreseña de Coqui TTS
MacWhisperAplicación de escritorio para macOS para transcripción local construida sobre Whisperreseña de MacWhisper

Esta lista refleja herramientas con las que se compara comúnmente a Izwi en el espacio de IA de voz local, no un ranking independiente de PromptQuorum — verifica el conjunto de funciones actual y la compatibilidad de hardware de cada herramienta antes de elegir.

Preguntas frecuentes

¿Qué es Izwi?

Izwi (github.com/izwi-ai/izwi) es un runtime de IA de voz local, gratuito y de código abierto (MIT) que agrupa texto a voz, voz a texto, diarización y clonación de voz detrás de una única API compatible con OpenAI.

¿Es gratis Izwi?

Sí, Izwi es gratuito y de código abierto (licencia MIT). No se requiere cuenta, suscripción ni clave de API para la inferencia local; algunos pesos de modelo descargados pueden tener sus propios términos de licencia independientes.

¿Qué significa "Izwi"?

"Izwi" es la palabra zulú y xhosa para "voz".

¿Izwi funciona en Windows?

Sí, Izwi tiene un instalador para Windows (.exe), además de compilaciones para macOS (.dmg) y Linux (.deb). Las compilaciones de lanzamiento para Windows y Linux son solo de CPU por defecto; la aceleración por GPU mediante Metal está disponible en Mac con Apple Silicon.

¿Izwi admite clonación de voz?

Sí, a través de familias de modelos de texto a voz compatibles en su catálogo, ejecutándose enteramente en tu propio equipo.

¿Qué modelos de voz a texto admite Izwi?

Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio y Voxtral Mini, según el catálogo de modelos actual de Izwi — ejecuta izwi list localmente para ver qué está habilitado.

¿Izwi usa una API compatible con OpenAI?

Sí. Expone rutas /v1 para modelos, completions de chat, audio de voz y transcripciones de audio, además de soporte en vista previa para el formato de la Responses API.

¿Izwi es un producto 1.0 terminado?

No. Al momento de esta reseña, la versión etiquetada más reciente es una beta (v0.1.0-beta-17), así que espera que la API y el catálogo de modelos sigan cambiando.

¿Izwi envía mi audio o mis transcripciones a algún lugar?

Según el propio README de Izwi, los datos de inferencia permanecen en tu equipo. La analítica de escritorio anónima opcional está desactivada por defecto y, si se activa, se indica que no incluye prompts, transcripciones, cargas de audio, rutas de archivo ni identificadores personales.

¿Cómo instalo Izwi?

Descarga el instalador para tu plataforma desde GitHub Releases (.dmg para macOS, .deb para Linux, .exe para Windows), o instala solo la CLI/el servidor con el script de instalación del proyecto o una compilación desde el código fuente.

Fuentes

← Volver a LLM locales avanzados