Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Bark TTS: análisis (2026) — el modelo con licencia MIT de Suno para risas, suspiros y habla
Voice, Speech & Multimodal

Bark TTS: análisis (2026) — el modelo con licencia MIT de Suno para risas, suspiros y habla

·12 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Bark es un modelo de audio generativo de código abierto de Suno que produce habla multilingüe realista además de sonidos no verbales — risas, suspiros y música simple — a partir de indicaciones de texto. Está licenciado bajo la Licencia MIT, apto para uso comercial completo desde el 1 de mayo de 2023, y se instala con pip install git+https://github.com/suno-ai/bark.git (nunca pip install bark, que instala un paquete sin relación). Su repositorio público de GitHub no muestra commits desde el 5 de abril de 2024, y no admite clonación de voz personalizada — para eso, consulta el análisis de XTTS v2 de PromptQuorum. Para una comparación completa de licencias entre motores TTS locales, consulta la guía de licencias de TTS local.

Bark es un modelo generativo de texto a audio de código abierto publicado por Suno en GitHub, capaz de producir habla multilingüe realista y, algo inusual para un modelo de texto a voz, sonidos no verbales como risas, suspiros y música simple, todo a partir de indicaciones de texto. Está licenciado bajo la Licencia MIT — Suno lo hizo apto para uso comercial completo el 1 de mayo de 2023. Este análisis cubre qué hace realmente Bark, comandos de uso reales, sus limitaciones honestas (sin clonación de voz personalizada, salida no determinista, un límite de generación de aproximadamente 13-14 segundos) y su estado de mantenimiento: el repositorio público de GitHub no muestra commits desde el 5 de abril de 2024, y Suno, la empresa, se ha vuelto conocida principalmente por su producto de generación musical con IA en lugar de por Bark.

Bark TTS: análisis (2026) — el modelo con licencia MIT de Suno para risas, suspiros y habla

Conclusiones clave

  • Genera habla multilingüe realista además de sonidos no verbales (risas, suspiros, jadeos, música) a partir de indicaciones de texto.
  • Licencia: MIT — apta para uso comercial completo desde el 1 de mayo de 2023.
  • Sin compatibilidad con clonación de voz personalizada, según la propia documentación de Suno.
  • Sin commits en el repositorio público de GitHub desde el 5 de abril de 2024; no marcado como archivado, pero parece inactivo.
  • Salida limitada a aproximadamente 13-14 segundos por generación, por diseño de la arquitectura.
  • Nunca ejecutes pip install bark — instala un paquete sin relación; usa pip install git+https://github.com/suno-ai/bark.git.

📍 En una frase

Bark es el modelo de audio generativo de código abierto con licencia MIT de Suno que produce habla multilingüe además de sonidos no verbales como risas y suspiros a partir de indicaciones de texto, pero no admite clonación de voz personalizada y su repositorio público de GitHub no ha tenido commits desde el 5 de abril de 2024.

💬 En términos simples

Es un modelo de IA que convierte texto en audio hablado y también puede añadir sonidos humanos como reír o suspirar, e incluso música simple, según las indicaciones que escribas — de uso comercial gratuito, pero no puede copiar la voz de una persona específica, y no parece que nadie en Suno siga trabajando activamente en él.

📌Nota: Suno, la empresa que creó Bark, se ha vuelto conocida principalmente por su producto de generación musical con IA. PromptQuorum no pudo confirmar si Suno todavía asigna recursos de ingeniería a Bark; el historial público de commits es la única evidencia disponible, y no muestra nada desde abril de 2024.

Qué hace realmente Bark

Bark es un modelo generativo basado en transformadores, de estilo GPT, para texto a audio, no una canalización de texto a voz convencional. En lugar de solo mapear texto a fonemas y formas de onda, genera tokens de audio directamente a partir del texto, lo que le permite producir sonidos no verbales y una prosodia expresiva que los motores TTS tradicionales no pueden ofrecer.

  • Habla multilingüe. Bark admite 13 idiomas, según su README oficial: inglés, alemán, español, francés, hindi, italiano, japonés, coreano, polaco, portugués, ruso, turco y chino simplificado.
  • Generación de sonidos no verbales. Bark puede generar `[laughter], [laughs], [sighs], [gasps] y [clears throat] como indicaciones de texto integradas, además de un [music]` simple, documentado directamente en su propio README — esta es la característica que lo distingue de cualquier otro motor TTS local cubierto por PromptQuorum.
  • Más de 100 perfiles de voz predefinidos. Bark incluye más de 100 perfiles de voz integrados en sus idiomas compatibles, seleccionables mediante un argumento history_prompt (por ejemplo v2/en_speaker_6) en lugar de un clip de audio de referencia.
  • Sin clonación de voz personalizada. La propia documentación de Suno indica claramente que Bark "actualmente no admite la clonación de voz personalizada" — puede igualar el tono, el matiz, la emoción y la prosodia de un perfil dado, pero no puede clonar la voz de una persona arbitraria a partir de una grabación de referencia como sí hace XTTS v2.
  • Salida no determinista. El propio README de Bark lo describe como que toma "libertades creativas en sus generaciones, lo que da como resultado salidas de modelo de mayor varianza que los enfoques de texto a voz tradicionales" — ejecutar la misma indicación dos veces puede producir resultados notablemente diferentes.

Ejemplos de uso reales

Estos comandos siguen la guía de inicio rápido en Python documentada por el propio Bark. Nota la advertencia de instalación a continuación — proviene directamente del README del proyecto.

  • Mantén las indicaciones en unos 13-14 segundos de texto hablado. El propio README de Bark explica que esto es un límite de arquitectura, no un error: "Bark es un modelo de estilo GPT, y su arquitectura/ventana de contexto está optimizada para producir generaciones de aproximadamente esta duración." El contenido narrativo más largo debe dividirse en segmentos y luego unirse.
  • Espera variación entre ejecuciones. Como la salida es no determinista, genera varias tomas de cualquier frase que necesites que suene de una manera específica y elige la mejor, en lugar de asumir que la primera toma es representativa.
python
# Instalar Bark — NO uses "pip install bark", que instala un
# paquete sin relación, no gestionado por Suno.
pip install git+https://github.com/suno-ai/bark.git

# API de Python: generación básica
from bark import SAMPLE_RATE, generate_audio, preload_models
from scipy.io.wavfile import write as write_wav

preload_models()

text_prompt = "Hello, my name is Suno. And, uh — and I like pizza. [laughs]"
audio_array = generate_audio(text_prompt)

write_wav("bark_generation.wav", SAMPLE_RATE, audio_array)

# Usar un perfil de voz específico en lugar de una voz aleatoria
audio_array = generate_audio(
    "This is a specific preset voice speaking a new sentence.",
    history_prompt="v2/en_speaker_6",
)

# Reducir el uso de memoria de GPU en tarjetas más pequeñas
import os
os.environ["SUNO_OFFLOAD_CPU"] = "True"
os.environ["SUNO_USE_SMALL_MODELS"] = "True"

Licencia y estado de mantenimiento

Bark está licenciado bajo la Licencia MIT. Su README lo indica claramente: "Bark is now licensed under the MIT License, meaning it's now available for commercial use!" — con fecha del 1 de mayo de 2023. A diferencia de XTTS v2 (CPML no comercial) o F5-TTS (CC-BY-NC-4.0), no hay ninguna restricción comercial sobre los pesos del modelo de Bark ni sus salidas. Esto es un resumen factual de la forma general de la licencia, no asesoría legal — lee tú mismo el texto de la Licencia MIT antes de cualquier despliegue comercial.

El mantenimiento es la verdadera pregunta abierta, no la licencia. El historial de commits del repositorio público suno-ai/bark no muestra commits desde el 5 de abril de 2024, a la fecha de publicación de este análisis. GitHub no muestra el repositorio como archivado, y la comunidad sigue abriendo incidencias, pero PromptQuorum no encontró evidencia de actividad de mantenedores, lanzamientos o correcciones en ese período. Suno, la empresa, se ha vuelto conocida principalmente por su producto de generación musical con IA en lugar de por Bark, y PromptQuorum no pudo confirmar si Suno actualmente asigna algún recurso de ingeniería al repositorio de Bark.

Trata el "mantenimiento activo" como no confirmado. Si dependes de Bark para un caso de uso en producción, prevé la posibilidad de que no lleguen más actualizaciones, parches de seguridad o correcciones de errores, y evalúa alternativas activamente mantenidas como Coqui TTS (mediante el fork mantenido por la comunidad idiap/coqui-ai-TTS) o Piper si el mantenimiento continuo importa para tu caso de uso.

¿Qué licencia usa Bark?

Bark está licenciado bajo la Licencia MIT, apto para uso comercial completo desde el 1 de mayo de 2023, según su propio README. Esto no es asesoría legal; lee tú mismo el texto de la Licencia MIT antes de cualquier uso comercial.

Para qué no sirve Bark

Bark es un modelo de audio generativo de nivel investigación distintivo, no un motor TTS de propósito general apto para producción. Es la herramienta equivocada para las siguientes situaciones:

  • Clonar la voz de una persona específica. La propia documentación de Bark indica que "actualmente no admite la clonación de voz personalizada". Si necesitas clonar una voz real a partir de una grabación de referencia corta, XTTS v2 está diseñado exactamente para eso (aunque bajo una licencia no comercial) — Bark no es un sustituto.
  • Sistemas de producción que necesitan soporte continuo garantizado. Sin commits en el repositorio público desde el 5 de abril de 2024 y con el enfoque público de Suno desplazado hacia la generación musical con IA, apostar una dependencia de producción al mantenimiento continuo, los parches de seguridad o las correcciones de errores de Bark es un riesgo real que PromptQuorum no puede descartar.
  • Aplicaciones en tiempo real de baja latencia en hardware modesto. El propio README de Bark indica que "en GPU más antiguas, Colab predeterminado, o CPU, el tiempo de inferencia puede ser significativamente más lento" que la velocidad "aproximadamente en tiempo real" que alcanza "en GPU empresariales y PyTorch nightly". Un motor ligero como Piper se adapta mejor al uso en tiempo real solo con CPU o en hardware embebido.
  • Salida consistente y repetible. Dado que el propio README de Bark describe sus generaciones como de mayor varianza y no deterministas que un TTS tradicional, encaja mal en cualquier flujo de trabajo (sistemas IVR, herramientas de accesibilidad, divulgaciones reguladas) que necesite exactamente la misma salida cada vez para la misma entrada.
  • Narración extensa en una sola pasada. El límite de generación de aproximadamente 13-14 segundos, que Bark atribuye en su propio README a su arquitectura de estilo GPT y ventana de contexto, significa que una narración de longitud de audiolibro o podcast largo requiere dividir manualmente el texto en segmentos y unir los archivos de audio resultantes.

Alternativas a Bark

XTTS v2

Mejor para:
Clonación de voz real desde 6 segundos de audio de referencia, 17 idiomas
Licencia:
CPML (no comercial)

Kit de herramientas Coqui TTS

Mejor para:
Kit mantenido por la comunidad que ejecuta XTTS v2 y otros modelos
Licencia:
MPL-2.0

StyleTTS 2

Mejor para:
Máxima calidad de narración en inglés con sonido natural (sin clonación de voz)
Licencia:
MIT

Piper

Mejor para:
Síntesis solo con CPU más rápida, mantenimiento activo, tiempo real en una Raspberry Pi
Licencia:
GPL-3.0-or-later

ElevenLabs

Mejor para:
API en la nube gestionada con clonación de voz comercial y soporte activo
Licencia:
Propietaria (API en la nube de pago)

Preguntas frecuentes

¿Qué es Bark?

Bark es un modelo generativo de texto a audio de código abierto publicado por Suno que produce habla multilingüe realista además de sonidos no verbales como risas, suspiros y música simple, todo a partir de indicaciones de texto, sin un clip de audio de referencia.

¿Es Bark gratuito para uso comercial?

Sí. Bark está licenciado bajo la Licencia MIT, y el propio README de Suno indica que se volvió apto para uso comercial completo el 1 de mayo de 2023. Esto no es asesoría legal; lee tú mismo el texto de la Licencia MIT antes de cualquier despliegue comercial.

¿Puede Bark clonar la voz de una persona específica?

No. La propia documentación de Suno indica claramente que Bark "actualmente no admite la clonación de voz personalizada". Puede igualar el tono y la prosodia de uno de sus más de 100 perfiles de voz integrados, pero no puede clonar una voz arbitraria a partir de una grabación de referencia. Para eso, consulta el análisis de PromptQuorum sobre XTTS v2, diseñado específicamente para clonación de voz (bajo una licencia no comercial).

¿Sigue manteniéndose Bark?

Esto es incierto. El repositorio público de GitHub suno-ai/bark no muestra commits desde el 5 de abril de 2024, aunque no está marcado como archivado y la comunidad sigue abriendo incidencias. Suno, la empresa, se ha vuelto conocida principalmente por su producto de generación musical con IA en lugar de por Bark. PromptQuorum no pudo confirmar si Suno actualmente asigna recursos de ingeniería al repositorio de Bark.

¿Cuánto puede durar una sola generación de Bark?

Aproximadamente 13-14 segundos de texto hablado por generación. El propio README de Bark atribuye esto a su arquitectura de estilo GPT y su ventana de contexto, no a un error — el contenido más largo debe dividirse en segmentos y luego unirse.

¿Por qué la misma indicación de Bark a veces produce resultados diferentes?

El propio README de Bark lo describe como que toma "libertades creativas en sus generaciones, lo que da como resultado salidas de modelo de mayor varianza que los enfoques de texto a voz tradicionales". Se espera que ejecutar la misma indicación dos veces a veces produzca un audio notablemente diferente.

¿Cuánta memoria de GPU necesita Bark?

El modelo completo necesita aproximadamente 12 GB de VRAM, según su propio README. Configurar la variable de entorno SUNO_USE_SMALL_MODELS=True carga modelos más pequeños que caben en aproximadamente 8 GB, y SUNO_OFFLOAD_CPU=True descarga los modelos a la CPU entre generaciones para reducir aún más el uso de memoria.

Veredicto

Bark sigue siendo el modelo local de texto a audio más distintivo cubierto por PromptQuorum: nada más en este conjunto de comparación genera risas, suspiros y música simple a partir de indicaciones de texto integradas bajo una licencia MIT totalmente permisiva. Para audio expresivo y consciente de sonidos no verbales en proyectos personales, prototipos o productos comerciales donde la licencia debe ser inequívoca, Bark es una opción genuinamente capaz y de bajo riesgo en el aspecto de licencia. Las dos decisiones que realmente importan para la mayoría de los lectores son su falta de clonación de voz personalizada y su estado de mantenimiento incierto: el repositorio público de GitHub no ha tenido commits desde el 5 de abril de 2024, y el enfoque público de Suno se ha desplazado hacia la generación musical con IA. Si necesitas clonar la voz de una persona específica, usa XTTS v2 en su lugar (licencia no comercial). Si necesitas mantenimiento activo y un motor rápido con licencia permisiva para producción, considera Piper o el kit de herramientas Coqui TTS mantenido por la comunidad. Para una alternativa comercial gestionada, consulta la comparación con ElevenLabs.

Fuentes

  • Bark en GitHub — el README oficial: idiomas, perfiles de voz, etiquetas de sonidos no verbales, licencia e instrucciones de instalación.
  • Historial de commits de Bark — el registro público de actividad de mantenimiento, que no muestra commits desde el 5 de abril de 2024 a la fecha de publicación de este análisis.
  • Bark en Hugging Face — la ficha del modelo, que refleja la descripción de características y licencia del README de GitHub.
  • Análisis de XTTS v2 — el análisis dedicado de PromptQuorum sobre la alternativa de clonación de voz que Bark no proporciona.
  • Licencias de TTS local y clonación de voz — comparación completa de licencias entre motores TTS locales.

← Volver a LLM locales avanzados