Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/StyleTTS 2 reseña (2026): el modelo de investigación de Columbia con licencia MIT para voz natural
Voice, Speech & Multimodal

StyleTTS 2 reseña (2026): el modelo de investigación de Columbia con licencia MIT para voz natural

·12 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

StyleTTS 2 es un modelo de texto a voz de código abierto y nivel investigación de la Universidad de Columbia, que genera voz de sonido natural mediante difusión de estilo y entrenamiento adversarial con grandes modelos de lenguaje de voz. Su código está bajo licencia MIT, se instala con git clone https://github.com/yl4579/StyleTTS2.git && pip install -r requirements.txt. Su README añade una condición aparte, fuera de la licencia, sobre los pesos del modelo preentrenado (divulgar que el habla es sintetizada salvo permiso del hablante), y el repositorio público de GitHub no muestra commits desde el 7 de marzo de 2024. Para una comparación completa de licencias entre motores TTS locales, consulta la guía de licencias TTS locales de PromptQuorum.

StyleTTS 2 es un modelo de texto a voz de código abierto publicado por investigadores de la Universidad de Columbia en GitHub, que genera voz de sonido natural mediante difusión de estilo y entrenamiento adversarial con grandes modelos de lenguaje de voz. Su código está bajo licencia MIT, pero su README añade una condición de divulgación aparte, fuera de la licencia, para los pesos del modelo preentrenado, y el repositorio público no tiene commits desde el 7 de marzo de 2024. Esta reseña cubre qué hace realmente StyleTTS 2, comandos reales de instalación e inferencia, el matiz de licencia entre el código MIT y los pesos condicionales, y su estado de mantenimiento inactivo pero no archivado — el panorama honesto para quien lo evalúe en 2026.

StyleTTS 2 reseña (2026): el modelo de investigación de Columbia con licencia MIT para voz natural

Conclusiones clave

  • Voz de sonido natural mediante difusión de estilo y entrenamiento adversarial, igualando o superando grabaciones humanas en benchmarks estándar de un solo hablante según su artículo de NeurIPS.
  • Licencia del código: MIT. Los pesos del modelo preentrenado llevan una condición de divulgación aparte en el README, no codificada en el texto de la licencia MIT.
  • Transferencia de estilo zero-shot desde un clip de referencia de 5 a 10 segundos vía el checkpoint multi-hablante de LibriTTS (se recomiendan 15 a 30 segundos).
  • La inferencia oficial necesita espeak-ng con licencia GPL-3.0; un paquete pip comunitario lo evita pero su última versión es del 11 de enero de 2024.
  • Sin commits en el repositorio oficial desde el 7 de marzo de 2024; no archivado, más de 6.300 estrellas en GitHub.
  • Los checkpoints preentrenados son principalmente en inglés; el alineador de texto también se entrenó con corpus japonés y chino y generaliza razonablemente a otros idiomas sin ajuste fino.

📍 En una frase

StyleTTS 2 es el modelo de texto a voz de investigación con licencia MIT de la Universidad de Columbia, que produce voz de sonido natural mediante difusión de estilo y entrenamiento adversarial, con una condición de divulgación a nivel de documentación sobre sus pesos preentrenados y sin commits en GitHub desde el 7 de marzo de 2024.

💬 En términos simples

Es un modelo de IA gratuito y descargable que convierte texto en voz de sonido muy natural, creado por investigadores universitarios en lugar de una empresa — de uso comercial libre según la licencia del código, pero sus propias instrucciones piden informar a los oyentes que el habla está sintetizada, y nadie parece estar corrigiendo errores activamente ya.

📌Nota: Un issue de GitHub sobre el proyecto (#37) señaló que el requisito de divulgación del README para modelos preentrenados está fuera del propio archivo de licencia MIT, lo que algunos lectores encuentran confuso. Lee tanto el archivo LICENSE como la sección de uso del modelo del README antes de desplegarlo — ver la sección de Licencia y costo abajo.

Historia: un proyecto de investigación de Columbia

StyleTTS 2 fue creado por investigadores del Departamento de Ingeniería Eléctrica de la Universidad de Columbia — Yinghao Aaron Li, Cong Han, Vinay S. Raghavan, Gavin Mischler y Nima Mesgarani — y publicado como artículo de NeurIPS 2023 titulado "StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models".

La afirmación central del artículo es que su combinación de difusión de estilo (modelar el estilo del habla como una distribución de probabilidad latente en lugar de un vector fijo único) y entrenamiento adversarial contra grandes modelos de lenguaje de voz preentrenados le permite modelar la variación del habla humana con mayor precisión que los enfoques anteriores. En el benchmark de un solo hablante LJSpeech, el artículo reporta que StyleTTS 2 iguala o supera grabaciones de habla humana real en evaluaciones de oyentes; en el conjunto de datos multi-hablante LibriTTS, reporta superar a los modelos públicos previamente disponibles en adaptación zero-shot al hablante.

El repositorio público de GitHub yl4579/StyleTTS2 ha acumulado más de 6.300 estrellas, y no está marcado como archivado — pero PromptQuorum no encontró commits en la rama principal del repositorio desde el 7 de marzo de 2024, según el historial público de commits del proyecto. Esto es consistente con una publicación de investigación universitaria en lugar de un producto de código abierto mantenido comercialmente: el código, el artículo y los checkpoints preentrenados se publicaron para acompañar la investigación, sin un compromiso continuo de desarrollo de funciones o versiones correctivas.

Un paquete pip mantenido por la comunidad, styletts2 del desarrollador Sidharth Rajaram, envuelve el código de investigación original en un paquete instalable (pip install styletts2) que reemplaza el fonemizador espeak-ng con licencia GPL-3.0 por la biblioteca gruut con licencia MIT, para mantener toda la cadena de instalación con licencia permisiva. Su versión más reciente en PyPI es la 0.1.6, publicada el 11 de enero de 2024 — también con más de dos años y medio de antigüedad al momento de esta reseña, y un proyecto de terceros separado del código de investigación original de Columbia.

¿Quién creó StyleTTS 2?

StyleTTS 2 fue creado por Yinghao Aaron Li, Cong Han, Vinay S. Raghavan, Gavin Mischler y Nima Mesgarani, investigadores del Departamento de Ingeniería Eléctrica de la Universidad de Columbia, y publicado como artículo de NeurIPS 2023.

Qué hace realmente StyleTTS 2

StyleTTS 2 es un modelo de texto a voz que genera un mel-espectrograma (y, en su configuración de extremo a extremo, una forma de onda cruda) a partir del texto de entrada, usando un modelo de difusión para muestrear un vector de "estilo" latente en lugar de tener que predecirlo de forma determinista — este mecanismo es al que el artículo atribuye una prosodia más natural y humana.

  • Difusión de estilo para prosodia natural. En lugar de predecir un único embedding de estilo fijo a partir del texto, StyleTTS 2 muestrea, mediante difusión, una distribución de probabilidad aprendida sobre estilos, lo que según el artículo produce una variación más natural en tono, ritmo y énfasis que los enfoques deterministas.
  • Entrenamiento adversarial contra modelos de lenguaje de voz. El proceso de entrenamiento enfrenta al modelo TTS contra grandes modelos de lenguaje de voz (SLM) preentrenados que actúan como discriminadores, una técnica a la que el artículo atribuye cerrar la brecha restante con la calidad de grabación humana en el benchmark LJSpeech.
  • Dos checkpoints preentrenados publicados oficialmente. StyleTTS2-LJSpeech (un solo hablante en inglés, 24kHz) y StyleTTS2-LibriTTS (multi-hablante en inglés) están alojados en Hugging Face.
  • Transferencia de estilo zero-shot desde audio de referencia. El checkpoint multi-hablante de LibriTTS puede sintetizar texto nuevo en un estilo capturado a partir de un clip de audio de referencia — la propia documentación del proyecto y guías de terceros describen un mínimo de 5 a 10 segundos, recomendando 15 a 30 segundos de audio de referencia limpio y de un solo hablante para un timbre, prosodia y pronunciación precisos.
  • Checkpoints preentrenados principalmente en inglés, con algo de trabajo base multilingüe. Los checkpoints publicados oficialmente se entrenan con conjuntos de datos en inglés (LJSpeech, LibriTTS). El artículo señala que su componente alineador de texto también se preentrenó con corpus japonés (JVS) y chino (AiShell) y "funciona bien para la mayoría de los demás idiomas sin ajuste fino", y hace referencia a un modelo PL-BERT multilingüe que cubre 14 idiomas como punto de partida para entrenar tu propio modelo StyleTTS 2 no inglés — pero no hay un checkpoint no inglés oficialmente publicado y listo para usar.

Instalar y ejecutar StyleTTS 2: paso a paso

Esta guía sigue la configuración documentada por el propio proyecto para ejecutar inferencia con un checkpoint preentrenado.

  1. 1
    Clonar el repositorio e instalar las dependencias.
    Why it matters: Ejecuta `git clone https://github.com/yl4579/StyleTTS2.git && cd StyleTTS2 && pip install -r requirements.txt`. Esto instala las dependencias principales de Python listadas en el archivo requirements del propio proyecto.
  2. 2
    Instalar el fonemizador y espeak-ng.
    Why it matters: Ejecuta `pip install phonemizer` y, en Linux, `sudo apt-get install espeak-ng` (o el equivalente para tu sistema operativo). Ten en cuenta que espeak-ng en sí tiene licencia GPL-3.0 — ver la sección de Licencia y costo para saber por qué eso importa para la ruta de inferencia, no solo para el código de StyleTTS 2 en sí.
  3. 3
    Descargar un checkpoint preentrenado.
    Why it matters: Descarga [StyleTTS2-LJSpeech](https://huggingface.co/yl4579/StyleTTS2-LJSpeech/tree/main) (un solo hablante) o [StyleTTS2-LibriTTS](https://huggingface.co/yl4579/StyleTTS2-LibriTTS/tree/main) (multi-hablante, admite transferencia de estilo) desde Hugging Face al directorio del proyecto.
  4. 4
    Ejecutar la inferencia a través de los notebooks proporcionados.
    Why it matters: El proyecto incluye `Demo/Inference_LJSpeech.ipynb` y `Demo/Inference_LibriTTS.ipynb` — abre el que coincida con tu checkpoint descargado en Jupyter para cargar el modelo y sintetizar tu primera muestra.
  5. 5
    (Alternativa) Usar el paquete pip comunitario para una cadena de instalación más simple, solo MIT.
    Why it matters: Ejecuta `pip install styletts2`, luego `from styletts2 import tts; my_tts = tts.StyleTTS2(); my_tts.inference("Hola.", output_wav_file="test.wav")`. Este paquete de terceros (última versión el 11 de enero de 2024) usa la biblioteca gruut con licencia MIT en lugar de espeak-ng, evitando la dependencia GPL-3.0 — a costa de depender de un wrapper no oficial también inactivo.
  6. 6
    (Opcional) Proporcionar un clip de referencia para transferencia de estilo.
    Why it matters: Con el checkpoint de LibriTTS, pasa un argumento `target_voice_path` (paquete comunitario) o el parámetro de audio de referencia equivalente (notebook oficial) apuntando a un archivo WAV limpio de un solo hablante de 15 a 30 segundos, para sintetizar texto nuevo en ese estilo capturado.

Ejemplos de uso reales

Estos ejemplos muestran tanto la API simplificada del paquete pip comunitario como el patrón usado en los notebooks de inferencia del proyecto oficial.

  • La calidad del audio de referencia importa para la transferencia de estilo. Un clip limpio de un solo hablante de 15 a 30 segundos produce una transferencia de estilo notablemente mejor que una referencia corta, ruidosa o de múltiples hablantes.
  • Existen dos cadenas de dependencias separadas. La ruta por notebook del repositorio oficial trae espeak-ng con licencia GPL-3.0; el paquete pip comunitario evita eso con gruut en su lugar — elige la cadena que coincida con tus requisitos de licencia antes de construir herramientas alrededor de cualquiera de las dos.
python
# Ruta más simple: paquete pip comunitario (cadena de dependencias solo MIT,
# última versión 2024-01-11 — verifica que aún funcione antes de depender de él)
pip install styletts2

from styletts2 import tts

my_tts = tts.StyleTTS2()
my_tts.inference(
    "Hello there, this is a natural-sounding synthesized sentence.",
    output_wav_file="test.wav",
)

# Transferencia de estilo zero-shot desde un clip de referencia (checkpoint tipo LibriTTS)
my_tts.inference(
    "The same text, now spoken in a captured reference style.",
    target_voice_path="reference_voice.wav",
    output_wav_file="styled_test.wav",
)

# Ruta de checkpoint y configuración personalizados
custom_tts = tts.StyleTTS2(
    model_checkpoint_path="/path/to/epochs_2nd_00020.pth",
    config_path="/path/to/config.yml",
)

# --- Ruta del repositorio oficial (requiere espeak-ng, GPL-3.0) ---
# git clone https://github.com/yl4579/StyleTTS2.git
# cd StyleTTS2 && pip install -r requirements.txt
# pip install phonemizer && sudo apt-get install espeak-ng
# Luego abre Demo/Inference_LJSpeech.ipynb o Demo/Inference_LibriTTS.ipynb
# en Jupyter y ejecuta las celdas proporcionadas con tu checkpoint descargado.

Licencia y costo

El código de StyleTTS 2 tiene licencia MIT, confirmado a través del archivo LICENSE en el repositorio oficial. MIT es una licencia permisiva: puedes usar, modificar y redistribuir el código, incluso comercialmente, con restricciones mínimas.

Los pesos del modelo preentrenado llevan una condición aparte, fuera de la licencia, indicada en el README, no en el archivo LICENSE en sí. El README del proyecto pide a los usuarios "informar a los oyentes que las muestras de voz son sintetizadas por los modelos StyleTTS 2, a menos que tengas permiso para usar la voz que sintetizas". Esto es una solicitud a nivel de documentación, no una cláusula de licencia formal — un issue de GitHub sobre el proyecto (#37) señaló explícitamente esto como potencialmente confuso, ya que la insignia de licencia y el archivo LICENSE del repositorio sugieren a un lector que no lee también la sección de uso del modelo del README que solo aplican los términos MIT. PromptQuorum no encontró respuesta de los mantenedores que resuelva esa ambigüedad en el hilo público del issue. Trata la condición de divulgación como una solicitud real y documentada de los autores, y cúmplela — pero entiende que está fuera de la concesión MIT formal sobre el código en sí, una estructura genuinamente inusual que vale la pena señalar antes del uso comercial.

Ejecutar la inferencia oficial trae una dependencia con licencia GPL-3.0: espeak-ng. Las propias instrucciones de instalación del proyecto piden pip install phonemizer más una instalación a nivel de sistema de espeak-ng, y espeak-ng tiene licencia GPL-3.0. GPL-3.0 es una licencia copyleft con obligaciones de distribución distintas a MIT; usar espeak-ng como dependencia externa del sistema sin modificar generalmente se trata de forma diferente a enlazar estáticamente o redistribuir su código fuente modificado, pero el límite exacto depende de tu implementación. El paquete pip comunitario styletts2 evita este problema específico usando la biblioteca gruut con licencia MIT en lugar de espeak-ng — una diferencia práctica real si quieres una cadena de dependencias totalmente permisiva, a costa de depender de un paquete de terceros con una fecha de última versión (11 de enero de 2024) aún más antigua que la del repositorio oficial.

Nada de esto es asesoría legal. Lee el archivo LICENSE, la sección de uso del modelo del README, y consulta a un abogado para tu implementación específica antes de lanzar StyleTTS 2 en un producto comercial.

¿Qué licencia usa StyleTTS 2?

El código de StyleTTS 2 tiene licencia MIT. Sus pesos de modelo preentrenado llevan una condición aparte, fuera de la licencia, en el README del proyecto (divulgar el habla sintetizada a menos que tengas permiso del hablante), que no forma parte del texto formal de la licencia MIT — una distinción que un issue de GitHub sobre el proyecto señaló como potencialmente confusa. Esto no es asesoría legal; lee tú mismo el archivo LICENSE y el README antes del uso comercial.

Para qué no sirve StyleTTS 2

StyleTTS 2 es un modelo de nivel investigación con una calidad de salida genuinamente sólida, no un producto de consumo pulido y activamente mantenido. Es la herramienta equivocada para las siguientes situaciones:

  • Lectores que quieren una experiencia simple de instalar con pip y listo. A diferencia de Piper, que está a pip install piper-tts y un solo comando CLI de tener audio funcionando, la ruta oficial de StyleTTS 2 implica clonar un repositorio de investigación, instalar un fonemizador, una dependencia de espeak-ng a nivel de sistema y ejecutar notebooks de Jupyter — una barrera de configuración notablemente más alta.
  • Despliegue en producción sin esfuerzo de ingeniería de ML. No hay un modo de servidor web mantenido, ni una imagen Docker oficial, ni una empresa respaldando el soporte continuo. Cualquiera que despliegue StyleTTS 2 en producción debe esperar escribir y mantener su propia capa de servicio alrededor del código de investigación.
  • Correcciones de errores o actualizaciones de funciones continuas garantizadas. Sin commits en el repositorio oficial desde el 7 de marzo de 2024, y con la última versión del paquete pip comunitario fechada el 11 de enero de 2024, no asumas mantenimiento activo para ninguna de las dos cadenas de dependencias — presupuesta la posibilidad de estar por tu cuenta ante cualquier problema que encuentres.
  • Voz lista para usar en idiomas distintos al inglés. Los checkpoints preentrenados publicados oficialmente son solo en inglés (LJSpeech, LibriTTS). Entrenar tú mismo un modelo no inglés es arquitectónicamente posible según las notas del artículo sobre su alineador de texto multilingüe y PL-BERT, pero requiere tu propio entrenamiento — no hay un checkpoint no inglés descargable del proyecto.
  • Una concesión de licencia única e inequívoca para todo lo que descargas. Porque el código (MIT) y los pesos preentrenados (MIT más una condición de divulgación en el README) se rigen de forma ligeramente diferente, y la ruta de inferencia oficial trae una dependencia GPL-3.0, StyleTTS 2 no ofrece la historia de licencia única y simple que tiene un proyecto como Bark (totalmente MIT, sin condiciones adicionales).

Alternativas a StyleTTS 2

Piper

Mejor para:
Configuración simple pip-install-y-listo, síntesis CPU más rápida, tiempo real en Raspberry Pi
Licencia:
GPL-3.0-or-later

XTTS v2

Mejor para:
Clonado de voz empaquetado desde 6 segundos de audio de referencia, 17 idiomas
Licencia:
CPML (no comercial)

Coqui TTS

Mejor para:
Kit multi-backend flexible con amplio soporte de idiomas y fork mantenido
Licencia:
MPL-2.0

Bark

Mejor para:
Audio expresivo no vocal — risas, suspiros, sonido ambiental, licencia MIT única e inequívoca
Licencia:
MIT

ElevenLabs

Mejor para:
API en la nube gestionada con clonado de voz comercial y soporte activo, sin esfuerzo de autoalojamiento
Licencia:
Propietaria (API en la nube de pago)

Preguntas frecuentes

¿Qué es StyleTTS 2?

StyleTTS 2 es un modelo de texto a voz de código abierto de investigadores de la Universidad de Columbia que genera voz de sonido natural mediante difusión de estilo y entrenamiento adversarial con grandes modelos de lenguaje de voz, publicado como artículo de NeurIPS 2023.

¿Es StyleTTS 2 gratuito para uso comercial?

Su código tiene licencia MIT, que permite el uso comercial. Sus pesos de modelo preentrenado llevan una condición aparte, fuera de la licencia, en el README, que pide divulgar el habla sintetizada a menos que tengas permiso del hablante. Esto no es asesoría legal; lee tú mismo el archivo LICENSE y el README antes de un despliegue comercial.

¿Puede StyleTTS 2 clonar una voz?

Su checkpoint multi-hablante de LibriTTS admite transferencia de estilo zero-shot desde un clip de audio de referencia (5 a 10 segundos como mínimo, 15 a 30 segundos recomendados), lo cual se asemeja al clonado de voz en espíritu. No está empaquetado como una función de clonado simple de una línea como XTTS v2 — usarlo requiere el flujo de trabajo oficial basado en notebooks o el paquete pip comunitario.

¿Sigue mantenido StyleTTS 2?

El repositorio oficial de GitHub no está marcado como archivado, pero PromptQuorum no encontró commits desde el 7 de marzo de 2024. El paquete pip comunitario que simplifica la instalación se publicó por última vez el 11 de enero de 2024. Trata a ambos como artefactos de investigación inactivos en lugar de software en desarrollo activo.

¿StyleTTS 2 admite idiomas distintos al inglés?

Los checkpoints preentrenados publicados oficialmente (LJSpeech, LibriTTS) son solo en inglés. El artículo señala que su componente alineador de texto también se entrenó con corpus japonés y chino y generaliza razonablemente a otros idiomas sin ajuste fino, y hace referencia a un modelo PL-BERT multilingüe de 14 idiomas como punto de partida para entrenar tu propio modelo no inglés — pero no hay un checkpoint no inglés listo para usar publicado oficialmente.

¿Por qué la instalación oficial de StyleTTS 2 necesita espeak-ng, y por qué importa eso?

La ruta de inferencia oficial usa la biblioteca phonemizer con espeak-ng como backend para convertir texto en fonemas. espeak-ng tiene licencia GPL-3.0, una licencia copyleft con obligaciones de distribución distintas a MIT. Un paquete pip comunitario (styletts2) evita esto usando la biblioteca gruut con licencia MIT en su lugar, a costa de depender de una versión no oficial aún más antigua (última actualización el 11 de enero de 2024).

¿Cómo se compara StyleTTS 2 con XTTS v2?

El código de StyleTTS 2 tiene licencia MIT y es de uso comercial libre (con la condición de divulgación del README sobre los pesos); XTTS v2 tiene licencia bajo la Coqui Public Model License no comercial. La configuración oficial de StyleTTS 2 es más de nivel investigación y requiere más trabajo manual; XTTS v2 ofrece una API de clonado de voz más simple y empaquetada a través del kit Coqui TTS. Elige según tus necesidades de licencia y tu tolerancia a la complejidad de configuración.

Veredicto

StyleTTS 2 sigue siendo genuinamente impresionante en calidad de salida: su enfoque de difusión de estilo y entrenamiento adversarial es acreditado en su propio artículo de NeurIPS con igualar o superar la calidad de grabación humana en el benchmark LJSpeech, bajo una licencia de código (MIT) tan permisiva como es posible. Lo que le impide ser una recomendación fácil para la mayoría de los lectores es todo lo que rodea a ese modelo central: una condición de divulgación a nivel de documentación sobre los pesos preentrenados que está fuera de la concesión MIT formal, una ruta de inferencia oficial que trae una dependencia GPL-3.0, un paquete pip comunitario que evita esa dependencia pero que en sí tiene más de dos años y medio de antigüedad, y sin commits en el repositorio oficial desde el 7 de marzo de 2024. Si quieres la mejor calidad de narración en inglés natural disponible localmente y te sientes cómodo con una configuración de nivel investigación y una cadena de dependencias no mantenida, StyleTTS 2 cumple. Si quieres una instalación más simple, mantenimiento activo, o clonado de voz empaquetado, combina esta reseña con la cobertura de PromptQuorum sobre Piper para síntesis CPU rápida, XTTS v2 para clonado de voz empaquetado, o la comparación de ElevenLabs para una alternativa completamente gestionada. Esta reseña es la última de seis motores locales de reconocimiento y síntesis de voz que PromptQuorum ha revisado en profundidad, junto a Whisper.cpp, Faster Whisper, Piper, Coqui TTS, XTTS v2 y Bark.

Fuentes

← Volver a LLM locales avanzados