Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Herramientas locales de voz y habla comparadas (2026): texto a voz, voz a texto y agentes de voz
Voice, Speech & Multimodal

Herramientas locales de voz y habla comparadas (2026): texto a voz, voz a texto y agentes de voz

·9 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Las 17 herramientas de voz locales del directorio de PromptQuorum se dividen en tres tareas que conviene comparar por separado: texto a voz (8 herramientas), voz a texto (7) y agentes de voz en tiempo real (4). En texto a voz, la clonación de voz figura en la documentación oficial de Coqui TTS, XTTS-v2, Izwi y Willow Inference Server; en voz a texto, whisper.cpp y Willow Inference Server documentan la transcripción en tiempo real; y Dograh, Jarvis, Parlor y Voxa son los agentes de voz. Usa la tabla comparativa de abajo y lee el análisis propio de cada herramienta antes de instalarla.

Las herramientas de voz locales se dividen en tres tareas distintas —convertir texto en voz, convertir voz en texto y mantener una conversación hablada con una IA—, y ninguna lista única de funciones las compara con justicia. Esta guía compara 17 herramientas gratuitas y freemium que se ejecutan en tu propio hardware, una tarea cada vez, con una tabla comparativa generada a partir de los mismos datos que el análisis propio de cada herramienta en PromptQuorum, de modo que la tabla y los análisis no pueden contradecirse.

Esta página contiene enlaces de referencia a productos de terceros. PromptQuorum no participa en ningún programa de afiliados — son enlaces simples que no generan comisión. Hacer clic en los enlaces y los pasos siguientes son de su entera responsabilidad. Estos enlaces no representan ningún respaldo ni verificación por parte de PromptQuorum.

Conclusiones clave

  • 17 herramientas, tres tareas: texto a voz (8), voz a texto (7), agentes de voz en tiempo real (4). Izwi y Willow Inference Server hacen tanto texto a voz como voz a texto, por lo que aparecen en ambas tablas.
  • La tabla se genera a partir del registro de cada herramienta y se contrasta con su README o sitio oficial; un guion significa «no indicado en la documentación», nunca «no».
  • Las licencias difieren de formas que importan: por ejemplo, Piper y OpenAI Edge TTS son GPL-3.0, Coqui TTS es MPL-2.0, XTTS-v2 usa la Coqui Public Model License, y Bark, StyleTTS 2, whisper.cpp y faster-whisper son MIT.
  • Cada nombre de herramienta de la tabla enlaza a su propio análisis de PromptQuorum, donde se explican los pasos de instalación y los límites.

📍 En una frase

Las herramientas de voz locales son tres tareas distintas —texto a voz, voz a texto y agentes de voz en tiempo real—, por lo que las 17 herramientas del directorio de PromptQuorum se comparan dentro de cada tarea, con una tabla generada a partir de los mismos datos que el análisis propio de cada herramienta.

💬 En términos simples

Algunas herramientas leen un texto en voz alta, otras escriben lo que dices y otras mantienen una conversación hablada con una IA. Comparar un lector con un transcriptor en «clonación de voz» no tiene sentido, así que esta guía compara cosas del mismo tipo.

Cómo comparamos

Los datos de cada herramienta —precio, licencia, plataformas, requisitos de hardware y atributos específicos de su categoría— se guardan una sola vez, en el registro de esa herramienta en el directorio. La tabla comparativa de abajo se genera a partir de esos registros y el análisis de la herramienta se apoya en el mismo registro, de modo que ambos no pueden indicar valores distintos.

Los atributos específicos de cada categoría (por ejemplo, la clonación de voz o la transcripción en tiempo real) se tomaron del README o del sitio web oficial de cada proyecto y se contrastaron con su redacción exacta. Cuando la documentación no dice nada, la tabla muestra un guion en lugar de suponer; cuando una afirmación tiene condiciones (experimental, solo en el nivel de pago o dependiente de una GPU), el atributo se deja fuera de la tabla y se trata en el análisis de la herramienta.

La comparación enumera herramientas que se ejecutan en tu propio hardware. No las clasifica: cuál es la adecuada depende de tu restricción, y las secciones siguientes señalan dónde están las diferencias reales.

Tabla comparativa

Elige una tarea abajo y lee la fila de izquierda a derecha. Haz clic en el nombre de una herramienta para abrir su análisis completo en PromptQuorum.

HerramientaPrecioLicenciaPlataformasEjecuciónHardwareVersiónIdiomasClonación de vozSalida en streamingUsable solo con CPUServidor API localAnálisisenlace de producto · divulgado
BarkGratisMITmacOS, Windows, LinuxLocalBasta con CPU13NoLeer análisisBark
Coqui TTSGratisMPL-2.0macOS, Windows, LinuxLocalBasta con CPUv0.27.5Leer análisisCoqui TTS
IzwiGratisMITmacOS, Windows, LinuxLocalDepende del modelov0.1.0-beta-17Leer análisisIzwi
openai-edge-ttsGratisGPL-3.0macOS, Windows, LinuxHíbridoBasta con CPULeer análisisopenai-edge-tts
Piper TTSGratisGPL-3.0macOS, Windows, LinuxLocalBasta con CPULeer análisisPiper TTS
StyleTTS 2GratisMITmacOS, Windows, LinuxLocalBasta con CPULeer análisisStyleTTS 2
Willow Inference ServerGratisApache-2.0Linux, WindowsLocalBasta con CPULeer análisisWillow Inference Server
XTTS v2GratisCPMLmacOS, Windows, LinuxLocal17Leer análisisXTTS v2

«—» significa que la documentación del propio proyecto no lo indica, no que la función no exista. Los valores proceden del README oficial o del sitio de cada proyecto y se vuelven a comprobar cuando se actualiza el análisis de una herramienta.

Texto a voz: en qué se diferencian

  • Licencia. Bark y StyleTTS 2 tienen licencia MIT. Coqui TTS es MPL-2.0. XTTS-v2 usa la Coqui Public Model License (CPML), una licencia personalizada con sus propios términos, no una licencia de código abierto estándar: léela antes de cualquier uso comercial. Piper y OpenAI Edge TTS son GPL-3.0, que impone condiciones a la distribución de versiones modificadas. Revisa la licencia antes de construir un producto con cualquiera de ellas; consulta Piper TTS y XTTS v2.
  • Clonación de voz. Coqui TTS (análisis), XTTS-v2 (análisis), Izwi (análisis) y Willow Inference Server (análisis) documentan la clonación de voz o las voces personalizadas. Bark indica que no admite la clonación de voz personalizada.
  • Servidor API local. Coqui TTS, Izwi, OpenAI Edge TTS, Piper y Willow Inference Server documentan un componente de servidor, de modo que otras apps pueden llamarlos por HTTP; OpenAI Edge TTS está construido en torno a eso.
  • Idiomas. Bark documenta 13 idiomas y XTTS-v2 documenta 17. Las demás herramientas no indican una cifra comparable, por lo que la tabla muestra un guion en lugar de un número.

Voz a texto: en qué se diferencian

  • Transcripción en tiempo real. whisper.cpp documenta un ejemplo de streaming en tiempo real, e Izwi y Willow Inference Server documentan el uso en tiempo real. faster-whisper es una biblioteca de transcripción; su propio README no documenta un modo en tiempo real.
  • Etiquetas de hablante. Izwi y FunClip documentan el etiquetado de hablantes. Meetily ofrece la diarización de hablantes solo en su nivel Pro de pago. El marcado de cambios de hablante de whisper.cpp es experimental y se trata en su análisis, no en la tabla.
  • Precio y plataforma. MacWhisper es una app propietaria para macOS con un nivel gratuito y una mejora de pago; la mayoría de las demás herramientas de aquí son gratuitas y de código abierto. La Community Edition de Meetily es gratuita y con licencia MIT, con un nivel Pro de pago.
  • Servidor API local. whisper.cpp incluye un servidor, e Izwi y Willow Inference Server documentan API HTTP.

Agentes de voz: en qué se diferencian

  • Totalmente local frente a nube opcional. Jarvis documenta una pila local de entrada de voz, LLM y salida de voz; Parlor documenta un flujo local con una función opcional de investigación en la nube. Voxa puede usar un proveedor de voz local o proveedores en la nube, así que solo es totalmente local si eliges el local.
  • Interrupción (barge-in). Jarvis, Parlor y Voxa documentan que puedes interrumpir al agente mientras habla.
  • Tu propio LLM y llamadas telefónicas. Dograh documenta la elección de LLM y las integraciones de telefonía; Voxa documenta la conexión de tu propio modelo mediante un daemon local.

Lo que esta comparación no puede decirte

  • Compara capacidades documentadas, no calidad. No dice nada sobre lo natural que suena una voz ni lo precisa que es una transcripción: eso requiere tu propio audio y tu propio hardware.
  • No incluye pruebas de velocidad: PromptQuorum no las ha medido para estas herramientas.
  • Los guiones son lagunas en la documentación de los proyectos, no hallazgos negativos. Algunas herramientas pueden admitir una función que su README no menciona.
  • Las herramientas cambian rápido. El análisis de cada herramienta indica la versión con la que se contrastó, y esta guía se actualiza cuando se actualiza un análisis.

Preguntas frecuentes

¿Por qué se comparan por separado el texto a voz, la voz a texto y los agentes de voz?

Hacen tareas distintas, así que la mayoría de los atributos solo tienen sentido dentro de una tarea: la clonación de voz se aplica al texto a voz, las etiquetas de hablante a la transcripción y la interrupción a los agentes de voz. Compararlos en una sola tabla dejaría la mayoría de las celdas vacías o sin sentido.

¿Qué significa un guion en la tabla comparativa?

Significa que la documentación del propio proyecto no indica ese atributo. No significa que la función no exista; consulta el análisis de la herramienta o su repositorio.

¿Estas herramientas son realmente locales?

Están diseñadas para ejecutarse en tu propio hardware, pero algunas ofrecen funciones opcionales en la nube —por ejemplo, la investigación en la nube opcional de Parlor o los proveedores de voz en la nube de Voxa— y algunas necesitan internet en la primera ejecución para descargar modelos. El análisis de cada herramienta lo detalla.

¿Alguna de estas herramientas tiene un enlace de afiliado?

No. PromptQuorum no tiene ninguna relación de afiliación con ninguna herramienta de esta comparación en el momento de escribir esto, y ningún enlace de aquí genera una comisión.

¿Con qué frecuencia se actualiza esta comparación?

Se actualiza dos veces al año y siempre que se actualiza el análisis de alguna de las herramientas incluidas, porque la tabla se genera a partir de los mismos datos que esos análisis.

Fuentes

← Volver a LLM locales avanzados