Chatterbox es un modelo de clonación de voz open source gratuito publicado por Resemble AI en mayo de 2025 bajo licencia MIT. Clona una voz a partir de un breve clip de referencia, se ejecuta en tu propio hardware y añade un control ajustable de "exaggeration" para la intensidad emocional — una función que la mayoría de plataformas TTS en la nube no exponen directamente. Una versión multilingüe con 23 idiomas llegó en septiembre de 2025.
ElevenLabs es una plataforma de voz alojada. Sus planes actuales agrupan texto a voz, clonación de voz y otras funciones de voz/medios tras créditos de uso compartidos. El plan gratuito indica 10.000 créditos al mes; los planes de pago añaden acceso a licencia comercial y cuotas más altas. Comprueba la página de precios en vivo antes de confiar en cualquier cifra, ya que los proveedores cambian planes y cuotas de créditos sin previo aviso.
La decisión no es "¿qué voz suena mejor?" — ambas pueden sonar convincentes. Es: ¿quieres un modelo gratuito que instalas, operas y del que eres responsable, o un servicio de pago que te libera del trabajo de infraestructura a cambio de una cuota recurrente y límites de uso?
Nuestro veredicto
🏆 Mejor opción para un resultado profesional sin esfuerzo hoy: ElevenLabs — sin instalación, voces seleccionadas, licencia comercial en planes de pago. 💰 Mejor opción gratuita y autoalojada: Chatterbox — con licencia MIT, cero coste recurrente una vez funcionando. 🎭 Mejor opción para controlar la intensidad emocional: Chatterbox — su control de exaggeration no tiene equivalente directo en ElevenLabs. 🔒 Mejor opción para clonación de voz sin conexión o aislada: Chatterbox — la inferencia permanece en tu propio hardware una vez descargado el modelo. ⚡ Mejor opción para una locución esta semana sin instalación: ElevenLabs. 🧑💻 Mejor opción para desarrolladores que quieren inspeccionar, ajustar o autoalojar el modelo: Chatterbox.
Para la mayoría de creadores que necesitan un resultado hoy y no quieren gestionar una GPU, ElevenLabs es el camino más rápido. Para desarrolladores y equipos que quieren un modelo gratuito, controlable y autoalojado — y están cómodos con una GPU y un entorno Python — Chatterbox es la opción más interesante.
Elige tu enfoque de clonación de voz
Usa un LLM local si:
- •Quieres un modelo gratuito con licencia MIT que puedas inspeccionar, modificar y ejecutar sin suscripción.
- •Necesitas clonación de voz sin conexión o aislada y puedes aportar una GPU para velocidad en tiempo real.
- •Quieres control directo sobre el parámetro de emoción/exaggeration en lugar de un ajuste gestionado por la plataforma.
Usa un modelo en la nube si:
- •Quieres un clon de voz pulido hoy mismo, sin instalación, sin GPU y sin gestionar dependencias.
- •Necesitas voces seleccionadas y alojadas, un flujo de navegador/API y condiciones de licencia comercial gestionadas por el proveedor.
- •Produces trabajo para clientes o contenido con una fecha límite de publicación.
Decisión rápida:
- →Para una locución esta semana sin instalación: gana ElevenLabs.
- →Para un modelo gratuito, autoalojado, acelerado por GPU y que controlas tú: gana Chatterbox.
- →Para el control de la intensidad emocional: solo Chatterbox lo expone directamente.
Conclusiones clave
- Chatterbox es un modelo de clonación de voz gratuito con licencia MIT de unos 0,5 mil millones de parámetros, de Resemble AI, construido sobre una arquitectura tipo Llama y lanzado en mayo de 2025; una versión multilingüe de 23 idiomas llegó en septiembre de 2025.
- ElevenLabs es una plataforma en la nube de pago y gestionada: Free (10.000 créditos/mes), Starter $6/mes, Creator $22/mes, Pro $99/mes, Scale $299/mes, Business $990/mes — comprueba las cifras actuales en la página de precios en vivo.
- Resemble AI informa que el 63,75% de los evaluadores en pruebas a ciegas prefirió la salida de Chatterbox frente a la de ElevenLabs, en su propia evaluación realizada vía Podonos — esta es una afirmación publicada por el fabricante Resemble AI, no una prueba independiente ni verificada por PromptQuorum, y debe interpretarse así.
- Chatterbox clona una voz a partir de un breve clip de referencia y ofrece un control "exaggeration" para la intensidad emocional; se recomienda una GPU para generación en tiempo real, y cada salida lleva una marca de agua inaudible PerTh.
- ElevenLabs no requiere hardware ni instalación local, ofrece voces seleccionadas y condiciones de licencia comercial en planes de pago, y procesa las solicitudes a través de su propia infraestructura en la nube.
- Ambas herramientas clonan voces a partir de un clip corto — nunca clones, imites ni despliegues la voz de una persona real sin su permiso explícito y las salvaguardas adecuadas.
De un vistazo
Situación | Mejor ruta | Por qué |
|---|---|---|
| Necesitas una locución clonada hoy, sin instalación | ElevenLabs | Sin instalación, sin GPU, sin descargar un modelo — crea una cuenta y genera. |
| Quieres un modelo de clonación de voz gratuito y autoalojado | Chatterbox | Licencia MIT, sin suscripción, se ejecuta en hardware que controlas. |
| Necesitas clonación de voz sin conexión o aislada | Chatterbox | La inferencia puede quedarse en tu propio dispositivo una vez descargado el modelo. |
| Necesitas voces seleccionadas y licencia comercial gestionada | ElevenLabs | Los planes de pago incluyen acceso a licencia comercial; no revisas las condiciones del modelo tú mismo. |
| Quieres control directo sobre la intensidad emocional de la salida | Chatterbox | El parámetro exaggeration es ajustable directamente; ElevenLabs gestiona esto vía ajustes de la plataforma. |
| No tienes GPU o no quieres gestionar una | ElevenLabs | La generación se ejecuta en la infraestructura de ElevenLabs, no en la tuya. |
| Necesitas clonar una voz para trabajo comercial | Compara con cuidado | Consentimiento, condiciones del proveedor y licencias importan en ambas opciones. |
¿Qué es Chatterbox?
Chatterbox es un modelo gratuito de texto a voz y clonación de voz publicado por Resemble AI en mayo de 2025 bajo licencia MIT. El modelo original en inglés usa aproximadamente 0,5 mil millones de parámetros sobre una arquitectura de transformador tipo Llama. Una versión multilingüe, Chatterbox Multilingual V3, llegó en septiembre de 2025 y admite 23 idiomas; una variante más pequeña y rápida, "Turbo" (unos 350 millones de parámetros), apunta a despliegues con menor latencia.
- Clonación de voz zero-shot: Chatterbox clona una voz a partir de un breve clip de referencia — sin necesitar un ajuste fino ni un conjunto de datos de entrenamiento.
- Control de exaggeration: un parámetro ajustable (0,5 por defecto) regula la intensidad emocional, de plano/monótono a marcadamente expresivo — una función que la mayoría de plataformas TTS comerciales no exponen como control directo.
- Licencia MIT: gratuita para uso comercial, sin regalías ni participación en ingresos exigidas por Resemble AI sobre el modelo en sí — aun así, comprueba las condiciones de licencia de cualquier voz de referencia de terceros que uses.
- Marca de agua PerTh: cada salida de audio lleva una marca de agua inaudible que Resemble AI dice diseñada para sobrevivir al procesamiento de audio habitual (compresión, edición), de forma que el audio generado pueda rastrearse hasta el modelo.
- Hardware: admite CUDA (GPU NVIDIA), Apple Silicon (MPS) e inferencia en CPU; se recomienda una GPU para alcanzar velocidad de generación en tiempo real.
•Key Point: Chatterbox es un modelo que descargas y ejecutas — vía paquetes Python, una interfaz web de la comunidad o un servidor autoalojado — no un producto alojado con una página de registro. Espera instalar dependencias y gestionar un entorno Python/GPU.
¿Qué dice realmente la afirmación "Chatterbox vence a ElevenLabs"?
Resemble AI, la empresa detrás de Chatterbox, informa que el 63,75% de los evaluadores en pruebas a ciegas prefirió la salida de Chatterbox frente a la de ElevenLabs, en una evaluación que Resemble AI realizó a través de la plataforma externa Podonos. Este es un resultado publicado por el propio fabricante Resemble AI, no un estudio independiente, y no algo que PromptQuorum haya probado o verificado — trátalo como cualquier afirmación de benchmark de un proveedor.
- Según la metodología publicada por Resemble AI, ambos sistemas generaron audio a partir de las mismas entradas de texto usando clips de referencia de 7 a 20 segundos, descritos como zero-shot, sin ingeniería de prompts ni posprocesamiento.
- Desglose informado por Resemble AI: el 38,75% prefirió fuertemente Chatterbox, el 25% prefirió Chatterbox, el 8,75% no tuvo preferencia, el 16,25% prefirió ElevenLabs y el 11,25% prefirió fuertemente ElevenLabs.
- La comparación cubre una sola dimensión — la preferencia de oyentes en pruebas a ciegas sobre los clips probados, en el momento de esa evaluación. No cubre la fiabilidad a gran escala, la cobertura de idiomas más allá del conjunto probado, la latencia bajo carga de producción ni la calidad de narración larga.
- Las pruebas de preferencia a ciegas de este tipo también son sensibles al texto, las voces y los clips de referencia elegidos, y los resultados pueden variar entre versiones del modelo en ambos lados.
•Warning: Esta es una afirmación del fabricante Resemble AI, presentada aquí con su metodología declarada y un enlace completo a la fuente para que puedas evaluarla tú mismo — no es un resultado de prueba de PromptQuorum y no debe tratarse como un benchmark independiente.
Publicidad
Por qué pagas con ElevenLabs
¿Necesitas una locución clonada para mañana sin GPU ni instalación? Empieza con el plan gratuito de ElevenLabs — 10.000 créditos mensuales, sin tarjeta. Probar ElevenLabs gratis →
ElevenLabs te libera de varias tareas que autoalojar Chatterbox te deja a ti:
Sin instalación local
- Qué cambia en la práctica:
- No gestionas GPU, entorno Python ni pesos del modelo
Biblioteca de voces seleccionadas
- Qué cambia en la práctica:
- Eliges de un catálogo alojado en lugar de conseguir y clonar tus propios clips de referencia
Licencia comercial gestionada
- Qué cambia en la práctica:
- Los planes de pago incluyen acceso a licencia comercial; no revisas las condiciones del modelo tú mismo
Escalado alojado
- Qué cambia en la práctica:
- ElevenLabs opera la infraestructura en lugar de que tú gestiones capacidad de GPU y disponibilidad
Inicio más rápido
- Qué cambia en la práctica:
- Puedes evaluar el flujo en el plan gratuito antes de invertir en hardware local
•Key Point: ElevenLabs ofrece actualmente: Free ($0, 10.000 créditos/mes, sin licencia comercial), Starter ($6/mes, 30.000 créditos, licencia comercial incluida), Creator ($22/mes, 121.000 créditos), Pro ($99/mes, 600.000 créditos, audio de 192 kbps), Scale ($299/mes, 1.800.000 créditos) y Business ($990/mes, 6.000.000 créditos). Los planes Enterprise usan precios personalizados. El uso de texto a voz y clonación de voz consume créditos compartidos; el coste exacto en créditos depende del modelo y la función usados — comprueba las cifras actuales en la página de precios en vivo antes de decidir.
•Key Point: El 7 de mayo de 2026, ElevenLabs recortó sus precios de API de autoservicio — Text to Speech hasta un 55% — e introdujo créditos de pago por uso para desarrolladores que no quieren una suscripción mensual. Fuente: ElevenLabs — We've lowered API & Agents pricing and introduced PAYG.
Lo que realmente cuesta ejecutar Chatterbox
Chatterbox en sí es gratuito bajo licencia MIT, pero "$0 por el modelo" es solo una partida del coste real de ejecutarlo tú mismo:
Hardware
- Qué significa:
- Se recomienda una GPU para generación en tiempo real; CPU y Apple Silicon (MPS) funcionan pero notablemente más lento
Instalación
- Qué significa:
- Hay que configurar un entorno Python, dependencias y los pesos del modelo (o un servidor/interfaz web de la comunidad)
Preparación del clip de referencia
- Qué significa:
- La clonación de voz necesita un clip de referencia limpio y corto y, para uso comercial, consentimiento documentado
Actualizaciones del modelo
- Qué significa:
- Los nuevos checkpoints (Turbo, Multilingual V3 y futuros lanzamientos) requieren que tú mismo los sigas y vuelvas a probar
Operación
- Qué significa:
- Disponibilidad, almacenamiento, registro y escalado con solicitudes simultáneas son responsabilidad tuya, no de un proveedor
Fiabilidad
- Qué significa:
- Asumes los modos de fallo: conflictos de dependencias, problemas de controladores y latencia bajo carga
•Key Point: Chatterbox cambia una suscripción recurrente de ElevenLabs por hardware y tiempo de configuración por adelantado, más responsabilidad operativa continua. Es un buen trato si ya tienes GPU y quieres un modelo gratuito, controlable y autoalojado; es un mal trato si solo necesitas una locución antes de una fecha límite.
Chatterbox vs ElevenLabs: comparativa lado a lado
Dimensión | Chatterbox | ElevenLabs |
|---|---|---|
| Tipo de producto | Modelo open source autoalojado | Plataforma en la nube gestionada |
| Coste | Gratis (licencia MIT) | Plan gratuito + planes de pago desde $6/mes |
| Instalación | Instalar software, descargar pesos, GPU recomendada | Crear cuenta y generar — sin instalación |
| Clonación de voz | Zero-shot desde un breve clip de referencia | Clonación gestionada en planes/funciones relevantes |
| Control emocional | Parámetro exaggeration directo | Ajustes de voz gestionados por la plataforma |
| Necesidad de internet | Ninguna tras la instalación — puede funcionar totalmente sin conexión | Requiere conexión al servicio |
| Cómputo | Tu GPU/CPU (GPU recomendada para tiempo real) | Operado por el proveedor |
| Marca de agua | Marca de agua PerTh inaudible en cada salida | Comprobar documentación actual de la plataforma |
| Idiomas | 23 (Multilingual V3), menos en el modelo base | Muchos (decenas, según la plataforma — comprobar documentación actual) |
| Uso comercial | Licencia MIT; comprobar condiciones de cualquier voz de referencia usada | Incluido en planes de pago; comprobar condiciones actuales |
| Mejor uso | Desarrolladores que quieren un modelo gratuito, controlable y autoalojado | Creadores y equipos que necesitan un resultado rápido y pulido, sin instalación |
Ambas herramientas clonan voces a partir de un breve clip de referencia. Consentimiento, licencias y obligaciones de divulgación aplican en ambos caminos — ver la sección Privacidad, consentimiento y marca de agua más abajo.
¿Qué hardware necesita realmente Chatterbox?
¿Planeas comprar hardware para IA de voz local o LLM? Consulta nuestra guía de las mejores GPU para IA local para recomendaciones de compra según tu presupuesto.
Resemble AI no publica una cifra mínima oficial única, y la VRAM reportada varía según la variante de Chatterbox usada y cómo esté empaquetada. Trata lo siguiente como orientación de la comunidad, no como una especificación garantizada — pruébalo con tu propio hardware y carga de trabajo antes de decidirte.
Hardware | Chatterbox (base/Multilingual) | Chatterbox-Turbo |
|---|---|---|
| Portátil solo con CPU | Funciona, muy por debajo del tiempo real | Más rápido, puede acercarse al tiempo real en CPUs potentes |
| Apple Silicon (MPS) | Compatible, más lento que una GPU dedicada | Compatible, más ágil |
| GPU NVIDIA de 8–12 GB | Bueno — mínimo comúnmente reportado para un uso fluido | Margen cómodo |
| GPU clase RTX 4090 | Tiempo real o más rápido | Latencia por debajo de 200 ms reportada por Resemble AI |
Las cifras anteriores proceden de los propios materiales de Resemble AI y guías de despliegue de la comunidad, no de un benchmark independiente de PromptQuorum. El rendimiento real depende de la variante del modelo, la longitud del texto, el procesamiento por lotes y las solicitudes simultáneas — pruébalo con tus propios guiones antes de comprar hardware.
Privacidad, consentimiento y marca de agua
Ejecutar Chatterbox localmente puede reducir la cantidad de audio y datos de referencia enviados a terceros, pero no crea cumplimiento legal automático ni te exime de la responsabilidad sobre cómo se usa una voz clonada. ElevenLabs procesa los datos de voz según sus condiciones actuales y la configuración de tu cuenta — revísalas también antes de asumir nada sobre privacidad.
- ¿Puedes usar una voz específica? Una voz clonada puede tener consideraciones separadas de derechos, consentimiento, contrato y suplantación de identidad — sin importar qué herramienta produjo el clon.
- ¿A dónde van el audio y el clip de referencia? Chatterbox puede mantener la inferencia y los clips de referencia en tu propio dispositivo, una vez configurado así. ElevenLabs procesa las solicitudes según sus condiciones e infraestructura actuales; confirma los detalles que aplican a tu cuenta.
- ¿La salida lleva marca de agua? Cada salida de Chatterbox lleva la marca de agua inaudible PerTh de Resemble AI, que la empresa dice diseñada para sobrevivir al procesamiento de audio habitual y hacer que el audio generado sea rastreable hasta el modelo. Consulta la documentación actual de ElevenLabs para sus propias funciones de marca de agua o procedencia.
•Warning: Nunca clones, imites ni despliegues la voz de una persona real — con Chatterbox, ElevenLabs o cualquier otra herramienta — sin su permiso explícito y las salvaguardas adecuadas. Este artículo es orientación técnica, no asesoramiento legal.
Elige Chatterbox si
Un modelo autoalojado probablemente encaje mejor si la mayoría de esto te describe:
- Quieres un modelo de clonación de voz gratuito con licencia MIT, sin suscripción.
- Necesitas clonación de voz sin conexión o aislada y puedes aportar una GPU para velocidad en tiempo real.
- Quieres control directo sobre la intensidad emocional mediante el parámetro exaggeration.
- Te sientes cómodo instalando dependencias Python y gestionando un entorno GPU/modelo.
- Quieres inspeccionar, modificar o autoalojar el modelo en lugar de depender de un servicio de terceros.
- Estás construyendo un producto o pipeline donde los precios en la nube por solicitud dejarían de ser rentables a tu volumen.
•Key Point: Chatterbox es un modelo, no un producto de consumo pulido — espera un paso de configuración antes de tu primer clip generado.
Elige ElevenLabs si
Una plataforma en la nube gestionada encaja mejor si la mayoría de esto te describe:
- Necesitas un clon de voz de sonido profesional esta semana, no un proyecto de infraestructura local.
- No tienes GPU o no quieres gestionar una para esta tarea.
- Publicas vídeos, anuncios, cursos o trabajo para clientes con regularidad.
- Quieres que las condiciones de licencia comercial las gestione el proveedor en lugar de revisarlas modelo por modelo.
- Quieres una biblioteca de voces seleccionadas y herramientas alojadas en un solo producto.
- Estás cómodo usando una plataforma de terceros tras revisar sus condiciones y prácticas de datos actuales.
•Key Point: Empieza gratis con 10.000 créditos mensuales. Sin tarjeta de crédito. Pruébalo hoy con tu propio guion.
Un flujo de pruebas razonable
No decidas basándote en afirmaciones de marketing — incluida la cifra de la prueba a ciegas mencionada arriba. Genera el mismo guion corto con ambas herramientas y compara directamente:
- Pronunciación de nombres, abreviaturas, números y palabras extranjeras.
- Pausas naturales, ritmo y qué tan bien encaja el ajuste de exaggeration/emoción con el tono deseado.
- Calidad en el formato de audio que realmente publicas.
- Tiempo desde el guion hasta una toma utilizable, incluidas repeticiones y, para Chatterbox, el tiempo de instalación/configuración.
- Si puedes mantener entradas y salidas dentro del entorno que exige tu proyecto.
- Coste total: cuotas de suscripción de ElevenLabs frente a hardware, tiempo de configuración y operación de Chatterbox.
- Requisitos de consentimiento y licencia para la voz específica que planeas clonar.
•Key Point: Para la mayoría de plazos de contenido, el factor decisivo es el tiempo hasta una toma publicable — no la calidad bruta del modelo en un único benchmark reportado.
Preguntas frecuentes
¿Chatterbox es realmente gratis para uso comercial?
Sí — Chatterbox se publica bajo licencia MIT, que permite uso comercial sin regalías ni participación en ingresos exigidas por Resemble AI sobre el modelo en sí. Sigues siendo responsable del estado de licencia y consentimiento de cualquier voz de referencia que uses como entrada, una cuestión separada de la licencia del propio modelo.
¿Chatterbox realmente vence a ElevenLabs en pruebas a ciegas?
Resemble AI, la empresa detrás de Chatterbox, informa que el 63,75% de los evaluadores en pruebas a ciegas prefirió su salida frente a la de ElevenLabs, en una evaluación que Resemble AI realizó a través de la plataforma externa Podonos. Esta es una afirmación publicada por el propio Resemble AI, no una prueba independiente ni verificada por PromptQuorum — lee la metodología en la fuente antes de tratarla como decisiva para tu caso de uso.
¿Cuánta VRAM necesita Chatterbox?
Resemble AI no publica un mínimo oficial único, y las cifras reportadas por la comunidad varían según la variante y el empaquetado — normalmente entre 6 y 12 GB para un uso fluido en tiempo real, siendo la variante Turbo la que menos necesita. Pruébalo con tu propio hardware antes de decidirte.
¿Puedo ejecutar Chatterbox sin GPU?
Sí. Chatterbox admite inferencia en CPU y Apple Silicon (MPS), pero la generación es notablemente más lenta que el tiempo real en hardware solo con CPU. Se recomienda una GPU si necesitas salida en tiempo real o casi en tiempo real.
¿En qué se diferencia la clonación de voz de Chatterbox de la de ElevenLabs?
Ambas clonan una voz a partir de un breve clip de referencia sin necesitar entrenamiento. Chatterbox ejecuta la clonación localmente en tu propio hardware y expone un parámetro directo "exaggeration" para la intensidad emocional. ElevenLabs ejecuta la clonación en su propia infraestructura en la nube y gestiona los ajustes de voz a través de su plataforma en lugar de un único parámetro ajustable que controlas directamente.
¿El audio de Chatterbox lleva marca de agua?
Sí. Resemble AI incorpora su marca de agua PerTh (Perceptual Threshold), descrita como inaudible y diseñada para sobrevivir al procesamiento de audio habitual como la compresión y la edición, en cada salida de Chatterbox, permitiendo rastrear el audio generado hasta el modelo.
¿Qué idiomas admite Chatterbox?
El modelo original en inglés es solo para ese idioma. Chatterbox Multilingual V3, publicado en septiembre de 2025, admite 23 idiomas. Consulta la documentación actual de Resemble AI para la lista exacta, ya que la compatibilidad de idiomas puede ampliarse con nuevos lanzamientos.
¿Es ElevenLabs mejor que Chatterbox para narraciones de YouTube?
Para la mayoría de creadores que quieren una voz pulida sin instalación local, ElevenLabs es el camino más rápido — ofrece planes de texto a voz con acceso a licencia comercial en niveles de pago. Chatterbox es una alternativa viable si ya tienes una GPU, quieres cero coste recurrente y estás cómodo con un paso de configuración. Comprueba en ambos casos las condiciones exactas del plan y las prácticas de divulgación antes de publicar contenido monetizado.
¿Puedo clonar la voz de otra persona con Chatterbox o ElevenLabs?
Solo con el permiso explícito de esa persona y las salvaguardas adecuadas. Ambas herramientas hacen que la clonación de voz sea técnicamente sencilla a partir de un breve clip de referencia, pero ni la licencia del modelo ni los términos de servicio de una plataforma sustituyen el consentimiento de la persona cuya voz estás clonando. Esto es orientación técnica, no asesoramiento legal.
¿Cuál es más barato con volumen alto, Chatterbox o ElevenLabs?
Depende de tu uso real y del hardware que ya posees. El precio por créditos según uso de ElevenLabs escala con el volumen, mientras que el coste de Chatterbox es sobre todo por adelantado (GPU, tiempo de configuración) más la operación continua una vez en marcha. Calcula con tu volumen real de solicitudes, no uno hipotético, antes de cambiar en cualquier dirección.
