Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/XTTS v2: análisis (2026) — clonación de voz multilingüe desde 6 segundos de audio
Voice, Speech & Multimodal

XTTS v2: análisis (2026) — clonación de voz multilingüe desde 6 segundos de audio

·12 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

XTTS v2 es un modelo de clonación de voz multilingüe de Coqui que clona una voz a partir de apenas 6 segundos de audio de referencia y genera habla con esa voz en 17 idiomas. Se ejecuta a través del kit de herramientas Coqui TTS (pip install coqui-tts, luego TTS("tts_models/multilingual/multi-dataset/xtts_v2")). Su licencia, la Coqui Public Model License (CPML), es no comercial — y como Coqui AI, la empresa, cerró sus servicios de pago en diciembre de 2023, actualmente no existe una vía activa hacia una licencia comercial. Para una comparación completa de licencias entre motores TTS locales, consulta la guía de licencias de TTS local de PromptQuorum.

XTTS v2 es un modelo de clonación de voz multilingüe publicado por Coqui, distribuido en Hugging Face, que clona una voz a partir de apenas 6 segundos de audio de referencia y la hace hablar en 17 idiomas. Se ejecuta a través del kit de herramientas Coqui TTS — el fork mantenido activamente es idiap/coqui-ai-TTS — o puede usarse de forma independiente mediante los pesos del modelo. Este análisis cubre qué hace realmente XTTS v2, comandos de uso reales, su licencia (la Coqui Public Model License, CPML, no comercial) y cuándo es o no la herramienta adecuada, ya que Coqui AI, la empresa que lo publicó originalmente, cerró sus servicios de pago en diciembre de 2023.

XTTS v2: análisis (2026) — clonación de voz multilingüe desde 6 segundos de audio

Conclusiones clave

  • Clona una voz a partir de apenas 6 segundos de audio de referencia, en 17 idiomas.
  • Se ejecuta mediante el kit de herramientas Coqui TTS (pip install coqui-tts) o directamente mediante sus pesos de modelo en Hugging Face.
  • Licencia: Coqui Public Model License (CPML) — solo no comercial.
  • Sin vía comercial activa: Coqui AI cerró sus servicios de pago en diciembre de 2023.
  • Latencia de streaming documentada inferior a 200 ms hasta el primer audio; se recomienda encarecidamente una GPU.
  • Requiere aceptar la CPML — establece COQUI_TOS_AGREED=1 para hacerlo de forma no interactiva en Docker o CI.

📍 En una frase

XTTS v2 es el modelo de clonación de voz multilingüe de Coqui que clona una voz a partir de 6 segundos de audio de referencia y la hace hablar en 17 idiomas, licenciado bajo la Coqui Public Model License (CPML) no comercial, sin vía comercial activa desde que Coqui AI, la empresa que lo publicó, cerró sus servicios de pago en diciembre de 2023.

💬 En términos simples

Es un modelo de IA que escucha un clip corto de alguien hablando y luego puede generar nuevas frases con esa misma voz, en 17 idiomas distintos — gratuito para uso personal e investigación, pero no para un producto de pago sin un acuerdo aparte que actualmente no existe.

📌Nota: La CPML no es la misma licencia que el kit de herramientas Coqui TTS que ejecuta XTTS v2 — el kit es MPL-2.0, pero los pesos y las salidas de este modelo específico son no comerciales. Consulta la sección Licencia y uso comercial más abajo.

Qué hace realmente XTTS v2

XTTS v2 es un modelo de texto a voz con clonación entre idiomas basado en GPT. Dado un clip de audio de referencia corto y un texto objetivo, genera habla con la voz clonada, incluso en un idioma distinto al del audio de referencia.

  • Clonación de voz en pocos segundos. Un único clip de audio de referencia de 6 segundos es suficiente para clonar una voz, según la ficha oficial de Coqui — no se requiere ajuste fino ni entrenamiento para una voz nueva.
  • Compatibilidad con 17 idiomas y clonación entre idiomas. Los idiomas admitidos son inglés, español, francés, alemán, italiano, portugués, polaco, turco, ruso, neerlandés, checo, árabe, chino (zh-cn), japonés, húngaro, coreano e hindi — puedes clonar una voz a partir de audio en inglés y generar habla en cualquiera de los otros 16 idiomas con esa misma voz clonada.
  • Inferencia por streaming. XTTS v2 admite síntesis por streaming con una latencia inferior a 200 ms hasta el primer audio, documentada desde que se introdujo la función en Coqui TTS v0.20.0 — útil para aplicaciones de voz interactivas donde esperar un archivo de audio completo es demasiado lento.
  • Se ejecuta mediante el kit de herramientas Coqui TTS. La forma principal y compatible de ejecutar XTTS v2 es a través de Coqui TTS (pip install coqui-tts), que lo expone como TTS("tts_models/multilingual/multi-dataset/xtts_v2").
  • Reutilización de embeddings de hablante. Más allá de pasar un clip de referencia sin procesar cada vez, el kit de herramientas permite calcular y reutilizar el embedding latente de un hablante, evitando recalcularlo en síntesis repetidas con la misma voz clonada.

Ejemplos de uso reales

Estos comandos usan la API de Python documentada del kit de herramientas Coqui TTS, la forma principal y compatible de ejecutar XTTS v2.

  • La calidad del audio de referencia importa. Un clip limpio de 6 segundos de un solo hablante, sin ruido de fondo ni música, produce un clon notablemente mejor que un clip corto, ruidoso o con varios hablantes.
  • La aceptación no interactiva de la CPML es necesaria la primera vez que XTTS v2 se carga en un entorno desatendido (Docker, CI) — establece COQUI_TOS_AGREED=1 antes de esa primera carga.
python
# Instalar el kit de herramientas
pip install coqui-tts

# Aceptar la CPML de forma no interactiva (necesario para Docker/CI; de lo
# contrario aparece un aviso interactivo en la primera carga)
export COQUI_TOS_AGREED=1

# API de Python: clonar una voz y generar habla
import torch
from TTS.api import TTS

device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)

# Clonación en el mismo idioma
tts.tts_to_file(
    text="This is a cloned voice speaking a new sentence.",
    speaker_wav="reference_voice.wav",
    language="en",
    file_path="output_en.wav",
)

# Clonación entre idiomas: clonar desde audio en inglés, hablar en español
tts.tts_to_file(
    text="Esta es la misma voz clonada, ahora hablando en español.",
    speaker_wav="reference_voice.wav",
    language="es",
    file_path="output_es.wav",
)

# Síntesis por streaming (baja latencia hasta el primer audio)
for chunk in tts.tts_stream(
    text="Streaming audio, chunk by chunk, for interactive use.",
    speaker_wav="reference_voice.wav",
    language="en",
):
    play_audio(chunk)

Licencia y uso comercial

Los pesos del modelo y las salidas de audio generadas por XTTS v2 están licenciados bajo la Coqui Public Model License (CPML) 1.0.0, confirmado mediante el archivo de licencia publicado junto al modelo en Hugging Face. La CPML establece explícitamente que "permite únicamente el uso no comercial de un modelo de aprendizaje automático y sus salidas" — los usos permitidos incluyen proyectos personales, investigación académica y trabajo como hobby, siempre que no recibas una compensación directa o indirecta ligada a ese uso.

Actualmente no existe una vía comercial activa para XTTS v2. La ficha del modelo indica una dirección de contacto, info@coqui.ai, para consultas de licencia comercial, pero Coqui AI, la empresa, cerró sus servicios de pago en diciembre de 2023 — PromptQuorum no pudo confirmar que esa dirección esté activamente atendida ni que hoy se pueda obtener una licencia comercial. Trata XTTS v2 como exclusivamente no comercial a menos que confirmes lo contrario de forma independiente antes de lanzar un producto de pago.

La CPML se aplica específicamente a los pesos del modelo XTTS v2 y sus salidas — no al código del kit de herramientas Coqui TTS que ejecuta el modelo, que está licenciado por separado bajo MPL-2.0 y sí permite el uso comercial con condiciones de divulgación de código sobre las modificaciones del kit. Este párrafo explica la forma general de la licencia; no es asesoría legal — lee la CPML tú mismo y consulta a un abogado antes de cualquier despliegue comercial.

¿Qué licencia usa XTTS v2?

XTTS v2 se publica bajo la Coqui Public Model License (CPML) 1.0.0, una licencia no comercial que se aplica a los pesos del modelo y a sus salidas de audio generadas. Permite el uso personal, de investigación y como hobby, pero prohíbe el uso comercial — cualquier producto de pago, herramienta SaaS o entregable a un cliente — sin un acuerdo aparte. Esto no es asesoría legal; lee la CPML tú mismo antes de usarla comercialmente.

Para qué no sirve XTTS v2

XTTS v2 es un modelo de clonación de voz de alta calidad, no un motor de TTS de propósito general apto para despliegue comercial. Es la herramienta equivocada para las siguientes situaciones:

  • Cualquier producto comercial sin una licencia confirmada. La CPML es no comercial, y actualmente no existe una vía confirmada y activa hacia una licencia comercial tras el cierre de Coqui AI en 2023. No despliegues XTTS v2 en un producto de pago, una app con publicidad o un entregable a cliente sin confirmar de forma independiente los términos de licencia primero.
  • Uso en tiempo real solo con CPU y recursos limitados. XTTS v2 sí admite streaming de baja latencia, pero ese rendimiento asume aceleración por GPU; solo en CPU es notablemente más lento que un motor ligero como Piper, y puede no ser práctico para uso en tiempo real en hardware modesto como una Raspberry Pi.
  • Clonar una voz a partir de audio muy corto o ruidoso. Aunque 6 segundos es el mínimo documentado, un clip de referencia ruidoso, comprimido o con varios hablantes produce un clon notablemente peor que una grabación limpia de un solo hablante.
  • Un idioma fuera de los 17 admitidos. XTTS v2 admite exactamente inglés, español, francés, alemán, italiano, portugués, polaco, turco, ruso, neerlandés, checo, árabe, chino (zh-cn), japonés, húngaro, coreano e hindi — no hay una hoja de ruta oficial para más idiomas a fecha de esta publicación.
  • Suplantar a alguien sin su consentimiento. Clonar la voz de una persona real sin su conocimiento o consentimiento plantea problemas de consentimiento, derechos de imagen y potencialmente fraude o suplantación que son independientes de la restricción no comercial de la CPML — se aplican al margen de los términos de licencia, tanto en uso personal como comercial.

Alternativas a XTTS v2

Piper

Mejor para:
Síntesis solo con CPU más rápida, sin clonación de voz, tiempo real en una Raspberry Pi
Licencia:
GPL-3.0-or-later

Kit de herramientas Coqui TTS

Mejor para:
El software que ejecuta XTTS v2 (y otros modelos) con una base de código más amplia y de licencia permisiva
Licencia:
MPL-2.0 (solo el kit)

Bark

Mejor para:
Audio expresivo, no verbal — risas, suspiros, sonido ambiental
Licencia:
MIT

StyleTTS 2

Mejor para:
Máxima calidad de narración en inglés con sonido natural (sin clonación de voz)
Licencia:
MIT

ElevenLabs

Mejor para:
API en la nube gestionada con clonación de voz comercial y licencia comercial clara
Licencia:
Propietaria (API en la nube de pago)

Preguntas frecuentes

¿Qué es XTTS v2?

XTTS v2 es un modelo de texto a voz con clonación de voz multilingüe publicado por Coqui que clona una voz a partir de apenas 6 segundos de audio de referencia y genera habla con esa voz en 17 idiomas, incluida la clonación entre idiomas.

¿Puedo usar XTTS v2 comercialmente?

No sin un acuerdo aparte. XTTS v2 está licenciado bajo la Coqui Public Model License (CPML), que permite el uso personal, de investigación y como hobby, pero prohíbe el uso comercial — cualquier producto de pago, SaaS, contenido con publicidad o trabajo para clientes. Coqui AI, la empresa que lo publicó, cerró sus servicios de pago en diciembre de 2023, y PromptQuorum no pudo confirmar que hoy exista una vía comercial activa. Trata XTTS v2 como exclusivamente no comercial.

¿Cuánto audio de referencia necesita XTTS v2 para clonar una voz?

Apenas 6 segundos de audio de referencia limpio y de un solo hablante, según su ficha oficial en Hugging Face. Un clip más largo y limpio suele producir un clon más preciso.

¿Cuántos idiomas admite XTTS v2?

Exactamente 17: inglés, español, francés, alemán, italiano, portugués, polaco, turco, ruso, neerlandés, checo, árabe, chino (zh-cn), japonés, húngaro, coreano e hindi. Admite la clonación entre idiomas — clona una voz a partir de audio en uno de estos idiomas y genera habla en cualquiera de los otros.

¿Cómo ejecuto XTTS v2?

Instala el kit de herramientas Coqui TTS con pip install coqui-tts, luego carga el modelo con TTS("tts_models/multilingual/multi-dataset/xtts_v2"). Establece primero la variable de entorno COQUI_TOS_AGREED=1 si necesitas aceptar la licencia CPML de forma no interactiva, como en un contenedor Docker o una pipeline de CI.

¿Necesito una GPU para ejecutar XTTS v2?

Se recomienda encarecidamente una GPU. XTTS v2 funciona en CPU, pero de forma notablemente más lenta — su latencia de streaming documentada inferior a 200 ms asume aceleración por GPU, y el uso solo con CPU no es práctico para aplicaciones en tiempo real.

¿Cuál es la diferencia entre XTTS v2 y el kit de herramientas Coqui TTS?

XTTS v2 es un modelo específico de clonación de voz, licenciado bajo la CPML no comercial. El kit de herramientas Coqui TTS es el software — un paquete de Python y una CLI — que ejecuta XTTS v2 y otros modelos, licenciado por separado bajo MPL-2.0, que sí permite el uso comercial del propio código del kit.

Veredicto

XTTS v2 sigue siendo uno de los modelos de clonación de voz local de mayor calidad disponibles en 2026, y la combinación de un requisito de clonación de 6 segundos, compatibilidad entre 17 idiomas y latencia de streaming inferior a 200 ms es genuinamente capaz para uso personal, investigación y prototipado. La decisión que realmente importa para la mayoría de los lectores es la licencia: la Coqui Public Model License es inequívocamente no comercial, y como Coqui AI cerró en diciembre de 2023, hoy no existe una vía confirmada y activa hacia una licencia comercial. Si tu caso de uso es personal, académico o un prototipo no comercial, XTTS v2 es una opción sólida y bien documentada. Si necesitas clonación de voz comercial, verifica los términos de licencia de forma independiente antes de construir sobre él, o combina este análisis con la cobertura de Piper y Bark de PromptQuorum para alternativas con licencia permisiva, o la comparación con ElevenLabs para una opción comercial gestionada.

Fuentes

← Volver a LLM locales avanzados