Conclusiones clave
- Desciende del proyecto de investigación TTS de Mozilla; desarrollado por la startup Coqui AI, fundada en 2021 por antiguos ingenieros de Mozilla TTS.
- Coqui AI cerró sus servicios de nube de pago en diciembre de 2023; el repositorio original de GitHub coqui-ai/TTS no ha recibido nuevos commits desde agosto de 2024.
- Fork activamente mantenido: idiap/coqui-ai-TTS, por el Instituto de Investigación Idiap, publicado en PyPI como
coqui-tts. - Licencia: MPL-2.0 para el kit. El modelo XTTS v2 que puede ejecutar está bajo la CPML no comercial, por separado — no confundir ambas.
- Gratuito, sin nivel de pago; funciona en CPU, con GPU recomendada para modelos de clonación de voz más grandes.
- Última versión del paquete: coqui-tts v0.27.5, publicada el 26 de enero de 2026.
📍 En una frase
Coqui TTS es un kit de código abierto de síntesis de voz y clonación de voz local descendiente del proyecto TTS de Mozilla, cuya empresa original, Coqui AI, cerró sus servicios de pago en diciembre de 2023, dejando el repositorio original sin mantenimiento desde agosto de 2024 — pero un fork comunitario activamente mantenido, idiap/coqui-ai-TTS, continúa el desarrollo bajo el Instituto de Investigación Idiap.
💬 En términos simples
Es un programa que instalas con pip install y que puede convertir texto en voz usando varios modelos de IA distintos, incluido un modelo de clonación de voz llamado XTTS v2 — la empresa que lo creó cerró, pero un instituto de investigación mantiene hoy el software actualizado.
📌Nota: Instala coqui-tts (el fork mantenido), no el nombre de paquete original TTS del repositorio coqui-ai/TTS ahora sin mantenimiento, si quieres una versión que reciba actualizaciones. Ver la sección Instalar y ejecutar más abajo.
Historia: de Mozilla TTS a un fork comunitario
**Coqui TTS se remonta al proyecto TTS de Mozilla**, un esfuerzo de investigación interno de Mozilla en tecnología de voz de código abierto. Cuando Mozilla disolvió ese grupo de investigación en 2021, varios de sus ingenieros — entre ellos Eren Gölge, Kelly Davis, Josh Meyer y Reuben Morais — fundaron la startup Coqui AI para continuar el trabajo como empresa independiente, publicando tanto un kit de texto a voz (Coqui TTS) como un kit de voz a texto (Coqui STT).
Coqui AI recaudó 3,3 millones de dólares en una ronda semilla en marzo de 2023 y ofrecía tanto un kit de código abierto como servicios de nube de pago, incluyendo acceso alojado a su modelo de clonación de voz, XTTS. La empresa no encontró un modelo de negocio sostenible sobre software de código abierto, y anunció el cierre de sus servicios de pago en diciembre de 2023, con sus servidores desconectados el 11 de diciembre de 2023.
**El repositorio original, coqui-ai/TTS, permanece públicamente disponible en GitHub** bajo su licencia MPL-2.0, pero no ha recibido nuevos commits desde agosto de 2024, y GitHub no lo muestra como formalmente archivado — en la práctica, no recibe desarrollo activo ni correcciones de errores.
**Un fork comunitario, idiap/coqui-ai-TTS, continúa el desarrollo.** Está mantenido por el Instituto de Investigación Idiap, un instituto de investigación suizo, y se publica en PyPI bajo el nombre de paquete coqui-tts (distinto del nombre de paquete original TTS). Su README indica explícitamente que es un "fork del repositorio original, sin mantenimiento", y su historial de versiones muestra actualizaciones continuas, incluida una versión v0.27.0 que añadió una caché de clonación de voz y una versión v0.27.5 el 26 de enero de 2026.
¿Quién creó Coqui TTS?
Coqui TTS fue creado por la startup Coqui AI, fundada en 2021 por antiguos ingenieros del proyecto de investigación TTS de Mozilla, entre ellos Eren Gölge, Kelly Davis, Josh Meyer y Reuben Morais. Tras el cierre de los servicios de pago de Coqui AI en diciembre de 2023, el desarrollo continuó en un fork comunitario mantenido por el Instituto de Investigación Idiap.
Qué hace realmente Coqui TTS
Coqui TTS es un kit, no un único modelo — proporciona una interfaz de Python unificada, una CLI y un pipeline de entrenamiento para ejecutar (e, históricamente, entrenar) varias arquitecturas distintas de modelos de texto a voz.
- Interfaz multi-modelo. Una única clase de Python
TTS()carga y ejecuta distintas arquitecturas de modelo, incluidos modelos VITS de uno y varios hablantes, modelos basados en Tacotron2 y el modelo de clonación de voz XTTS v2, sin cambiar el código de la aplicación circundante. - Síntesis por línea de comandos. El comando CLI
ttssintetiza voz directamente desde la terminal, listando todos los modelos preentrenados disponibles contts --list_models. - Clonación de voz vía XTTS v2. Pasar un argumento
speaker_wava un modelo XTTS v2 cargado clona una voz a partir de un breve clip de audio de referencia, generando voz en esa voz clonada en los idiomas que XTTS v2 soporta. - Amplia biblioteca de modelos preentrenados. El kit da acceso a modelos preentrenados que, según su documentación, cubren más de 1.100 idiomas a través de los modelos masivamente multilingües basados en Fairseq, junto con modelos curados de mayor calidad para idiomas específicos.
- Entrenamiento y ajuste fino de modelos. Más allá de ejecutar modelos preentrenados, el kit incluye scripts de entrenamiento y utilidades de análisis de datasets para construir o ajustar un modelo de voz personalizado — históricamente una de sus funciones más usadas antes del cierre del servicio de entrenamiento alojado de Coqui AI.
- Inferencia en streaming para XTTS v2. El kit documenta síntesis en streaming de baja latencia con XTTS v2 (citada por la documentación del fork mantenido como una latencia inferior a 200 ms hasta el primer audio), útil para aplicaciones de voz interactivas.
Coqui TTS y XTTS v2: cómo se relacionan
Coqui TTS (el kit) y XTTS v2 (el modelo) son dos cosas distintas con dos licencias distintas, y confundirlas es un error de licencia común. El kit Coqui TTS — el paquete de Python, la CLI y el código de entrenamiento — está bajo licencia MPL-2.0, una licencia permisiva que permite el uso comercial con condiciones de divulgación de código sobre las modificaciones al kit. XTTS v2 es un modelo preentrenado específico cuyos pesos se distribuyen bajo la Coqui Public Model License (CPML), una licencia no comercial, separada de la licencia MPL-2.0 del kit.
En la práctica, esto significa que puedes usar el kit Coqui TTS comercialmente con modelos de licencia permisiva (modelos VITS o Tacotron2 entrenados bajo licencias compatibles), mientras que la combinación específica de "kit Coqui TTS ejecutando el modelo XTTS v2" hereda la restricción no comercial de XTTS v2 para los pesos y salidas de ese modelo. Ejecutar un modelo distinto, de licencia permisiva, a través del mismo kit no arrastra esa restricción.
**El paquete coqui-tts documenta directamente el uso de XTTS v2**, con el modelo cargado como TTS("tts_models/multilingual/multi-dataset/xtts_v2"), ya que el kit es la vía principal soportada para ejecutar XTTS v2 fuera de usar directamente los pesos del modelo mediante otro stack de inferencia. Ver el análisis dedicado de XTTS v2 de PromptQuorum para un desglose completo de la licencia y capacidades de ese modelo.
Instalar y ejecutar Coqui TTS: paso a paso
Esta guía instala el paquete coqui-tts activamente mantenido y ejecuta una primera síntesis, según la sintaxis documentada en el propio README del fork mantenido.
- 1Instala el paquete mantenido.
Why it matters: Ejecuta `pip install coqui-tts` (o `uv pip install coqui-tts` si usas uv) en un entorno Python. Instala específicamente el paquete `coqui-tts` — no el nombre de paquete más antiguo `TTS`, que apunta al repositorio original ahora sin mantenimiento. - 2Lista los modelos preentrenados disponibles.
Why it matters: Ejecuta `tts --list_models` para ver el catálogo completo de modelos preentrenados disponibles para descargar, organizados por idioma y arquitectura (VITS, Tacotron2, XTTS y otros). - 3Sintetiza voz desde la línea de comandos.
Why it matters: Ejecuta `tts --text "Hello world" --out_path output.wav` para sintetizar con el modelo por defecto, o añade `--model_name <modelo>` para elegir uno específico de la lista. - 4(Opcional) Usa la API de Python para clonación de voz con XTTS v2.
Why it matters: Carga el modelo con `TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)`, luego llama a `.tts_to_file()` con un argumento `speaker_wav` que apunte a un breve clip de audio de referencia y un argumento `language` para clonar una voz. - 5(Opcional) Activa la aceleración por GPU.
Why it matters: Pasa `gpu=True` al constructor `TTS()`, o llama a `.to("cuda")` sobre el objeto de modelo cargado, para ejecutar la inferencia en una GPU NVIDIA — recomendado para XTTS v2, notablemente más lento solo con CPU. - 6(Opcional) Acepta la licencia CPML de forma no interactiva para XTTS v2.
Why it matters: Cargar XTTS v2 por primera vez solicita un paso interactivo de aceptación de la CPML. Define la variable de entorno `COQUI_TOS_AGREED=1` para aceptarla de forma no interactiva, requerido para uso desatendido en contenedores Docker o pipelines de CI.
Ejemplos de uso reales
Más allá de la guía de instalación básica anterior, estos son patrones de uso comunes de la propia documentación del fork mantenido.
- Aceptación no interactiva de la CPML para entornos automatizados: define
COQUI_TOS_AGREED=1antes de la primera carga de XTTS v2, para que los builds de Docker y los pipelines de CI no se queden bloqueados en una solicitud interactiva. - Introspección de hablantes e idiomas: tras cargar un modelo multi-hablante o multilingüe,
tts.speakersytts.languageslistan lo que el modelo cargado realmente soporta — útil para validar la entrada antes de la síntesis.
# Línea de comandos: listar modelos preentrenados disponibles
tts --list_models
# Línea de comandos: sintetizar con el modelo por defecto
tts --text "Hello world" --out_path output.wav
# Línea de comandos: sintetizar con un modelo específico
tts --model_name "tts_models/en/ljspeech/tacotron2-DDC" \
--text "This is a test." --out_path output.wav
# API de Python: síntesis básica
from TTS.api import TTS
tts = TTS("tts_models/en/ljspeech/tacotron2-DDC")
tts.tts_to_file(text="Hello world", file_path="output.wav")
# API de Python: clonación de voz con XTTS v2 (acepta la CPML de forma no interactiva primero)
# export COQUI_TOS_AGREED=1
import torch
from TTS.api import TTS
device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)
tts.tts_to_file(
text="Hola, esto es una prueba.",
speaker_wav="reference_voice.wav",
language="es",
file_path="cloned_output.wav",
)
# API de Python: listar hablantes e idiomas disponibles en un modelo cargado
print(tts.speakers)
print(tts.languages)Licencia y coste
El kit Coqui TTS está bajo licencia MPL-2.0 (Mozilla Public License 2.0), confirmada a través de los metadatos publicados del paquete coqui-tts en PyPI y el archivo de licencia en el repositorio idiap/coqui-ai-TTS. MPL-2.0 es una licencia permisiva con condiciones: puedes usar el kit comercialmente, pero si modificas y distribuyes los archivos fuente propios del kit, debes publicar esos archivos modificados específicos también bajo MPL-2.0. Usar el kit como dependencia sin modificar no coloca tu propio código de aplicación bajo MPL-2.0.
El modelo XTTS v2 tiene licencia separada, bajo la Coqui Public Model License (CPML), que es no comercial — esto se aplica a los pesos del modelo y sus salidas de audio generadas, no al código del kit Coqui TTS que los ejecuta. Ver el análisis de XTTS v2 de PromptQuorum para el desglose completo de esa licencia.
No hay nivel de pago, suscripción ni cuota de licencia para el kit Coqui TTS en sí. Los servicios alojados de pago de Coqui AI cerraron en diciembre de 2023 y no están disponibles a ningún precio; la única forma de usar Coqui TTS hoy es autoalojado, ya sea con el paquete original sin mantenimiento o con el fork coqui-tts activamente mantenido.
¿Qué licencia usa Coqui TTS?
El kit Coqui TTS en sí está bajo licencia MPL-2.0, que permite el uso comercial con la condición de que las modificaciones a los archivos fuente propios del kit se publiquen bajo la misma licencia. Esto es independiente de la licencia de cualquier modelo específico que ejecute — el modelo XTTS v2, por ejemplo, está bajo la Coqui Public Model License (CPML) no comercial, que se aplica a los pesos y salidas del modelo, no al código del kit.
Para qué no es bueno Coqui TTS
Coqui TTS es un kit flexible multi-modelo, no la opción más rápida ni más simple para cada caso de uso. Es la herramienta equivocada para las siguientes situaciones:
- Construir sobre el repositorio original sin mantenimiento. Si ejecutas
pip install TTS(el nombre de paquete original) en lugar depip install coqui-tts(el fork mantenido), estás construyendo sobre código que no ha recibido actualizaciones desde agosto de 2024 — comprueba qué paquete referencia realmente un tutorial o dependencia antes de confiar en él. - La síntesis solo-CPU más rápida posible. Si tu prioridad es la voz en tiempo real en hardware modesto como una Raspberry Pi sin GPU, Piper está construido específicamente para eso y es más simple de desplegar; los modelos más grandes de Coqui TTS, especialmente XTTS v2, son notablemente más lentos solo con CPU.
- Clonación de voz comercial sin una revisión de licencia separada. Ejecutar XTTS v2 a través del kit Coqui TTS sigue arrastrando la restricción no comercial propia de XTTS v2 (CPML) sobre los pesos y salidas del modelo — la licencia MPL-2.0 del kit no anula eso. Ver la sección Licencia y coste anterior.
- Soporte corporativo garantizado a largo plazo. La empresa Coqui AI ya no existe desde diciembre de 2023. El fork actual lo mantiene un instituto de investigación de forma comunitaria, un modelo de mantenimiento distinto al de una empresa financiada con contrato de soporte — considéralo para decisiones de infraestructura de producción crítica.
- Una única API estable entre versiones. Como el desarrollo se trasladó entre un original sin mantenimiento y un fork activamente desarrollado, algunos tutoriales, respuestas de Stack Overflow y publicaciones de blog en línea referencian una superficie de API más antigua o el nombre de paquete original — verifica contra la documentación actual de
coqui-ttsen lugar de un resultado de búsqueda antiguo.
Alternativas a Coqui TTS
Piper
- Mejor para:
- La síntesis solo-CPU más rápida, sin clonación de voz, tiempo real en una Raspberry Pi
- Licencia:
- GPL-3.0-or-later
XTTS v2
- Mejor para:
- El propio modelo de clonación de voz, si solo necesitas XTTS v2 y no el kit más amplio
- Licencia:
- CPML (no comercial)
Bark
- Mejor para:
- Audio no vocal expresivo — risas, suspiros, sonido ambiental
- Licencia:
- MIT
StyleTTS 2
- Mejor para:
- La mejor calidad de narración natural en inglés (sin clonación de voz)
- Licencia:
- MIT
ElevenLabs
- Mejor para:
- API en la nube gestionada para equipos que prefieren no autoalojar, con clonación de voz comercial
- Licencia:
- Propietaria (API en la nube de pago)
Preguntas frecuentes
¿Qué es Coqui TTS?
Coqui TTS es un kit de código abierto de síntesis de voz y clonación de voz local descendiente del proyecto de investigación TTS de Mozilla, creado originalmente por la startup Coqui AI. Soporta varias arquitecturas de modelo, incluido el modelo de clonación de voz XTTS v2, a través de una única interfaz de Python y CLI.
¿Sigue manteniéndose Coqui TTS?
El repositorio original coqui-ai/TTS ya no se mantiene activamente — no ha recibido nuevos commits desde agosto de 2024, tras el cierre de los servicios de pago de la empresa Coqui AI en diciembre de 2023. Un fork comunitario activamente mantenido, idiap/coqui-ai-TTS, continúa el desarrollo bajo el Instituto de Investigación Idiap y se publica en PyPI como el paquete coqui-tts, con versiones tan recientes como enero de 2026.
¿Es gratuito Coqui TTS?
Sí, el kit en sí no tiene nivel de pago ni cuota de licencia. Los antiguos servicios alojados de pago de Coqui AI cerraron en diciembre de 2023 y no están disponibles a ningún precio. Algunos modelos específicos que se ejecutan sobre el kit, como XTTS v2, tienen su propia licencia separada (CPML) que restringe el uso comercial de los pesos y salidas de ese modelo.
¿Cuál es la diferencia entre los paquetes coqui-tts y TTS?
TTS es el nombre de paquete original de PyPI, ligado al repositorio coqui-ai/TTS sin mantenimiento y sin actualizaciones desde agosto de 2024. coqui-tts es el nombre de paquete del fork activamente mantenido, publicado desde el repositorio idiap/coqui-ai-TTS bajo el Instituto de Investigación Idiap, con versiones regulares incluyendo v0.27.5 en enero de 2026. Instala coqui-tts para una versión que reciba actualizaciones.
¿Coqui TTS soporta clonación de voz?
Sí, a través del modelo XTTS v2, que el kit puede cargar y ejecutar. XTTS v2 clona una voz a partir de un breve clip de audio de referencia pasado como argumento speaker_wav. Ten en cuenta que la propia licencia de XTTS v2, la Coqui Public Model License (CPML), es no comercial, separada de la licencia MPL-2.0 del kit.
¿Por qué cerró Coqui AI?
Coqui AI, la empresa detrás de Coqui TTS, anunció el cierre de sus servicios alojados de pago en diciembre de 2023, con sus servidores desconectados el 11 de diciembre de 2023, tras no lograr construir un modelo de negocio sostenible sobre tecnología de voz de código abierto. El kit de código abierto en sí siguió disponible, y el desarrollo continuó después en un fork comunitario.
¿Cuál es la última versión de Coqui TTS?
La última versión del paquete coqui-tts activamente mantenido es v0.27.5, publicada el 26 de enero de 2026, según su entrada en PyPI.
Veredicto
Coqui TTS es un caso de estudio genuinamente útil sobre qué le ocurre a una infraestructura de código abierto tras el cierre de la empresa que la respalda: el repositorio original enmudeció en agosto de 2024, pero el software no desapareció — un instituto de investigación asumió el mantenimiento, renombró el paquete y siguió publicando versiones hasta 2026. Para cualquiera que lo evalúe hoy, la conclusión práctica es simple: instala coqui-tts, no el paquete TTS original, y comprende que la licencia MPL-2.0 del kit es independiente de la licencia no comercial CPML del modelo XTTS v2 que puede ejecutar. Como kit, su fortaleza está en la flexibilidad entre arquitecturas de modelo más que en ser la opción más rápida o simple para cualquier caso de uso concreto — para eso, combina este análisis con la cobertura de PromptQuorum sobre Piper para velocidad, XTTS v2 específicamente para el modelo de clonación, o la guía de licencias de TTS local para el panorama completo entre motores.
Fuentes
- idiap/coqui-ai-TTS en GitHub — el fork activamente mantenido: README, documentación, licencia e historial de versiones.
- coqui-tts en PyPI — metadatos publicados del paquete, incluida la licencia MPL-2.0 actual e historial de versiones.
- coqui-ai/TTS en GitHub — el repositorio original, ahora sin mantenimiento (licencia MPL-2.0).
- XTTS v2 en Hugging Face — la ficha del modelo y el texto de licencia CPML del modelo de clonación de voz.
- Instituto de Investigación Idiap — el instituto de investigación suizo que mantiene el fork comunitario.
