Conclusiones clave
- Kokoro-82M: 82 millones de parámetros, licencia Apache 2.0, arquitectura derivada de StyleTTS2, publicado por hexgrad (huggingface.co/hexgrad/Kokoro-82M).
- 54 voces integradas en 8 idiomas (inglés, español, francés, hindi, italiano, japonés, portugués, chino): sin clonación de voz oficial en tiempo real a partir de una muestra de referencia.
- Funciona en CPU o una GPU modesta; no requiere conexión a Internet una vez descargados el modelo y los paquetes de voz.
- ElevenLabs: plataforma en la nube de pago, desde el nivel gratuito (10.000 créditos/mes, sin licencia comercial) hasta Business (990 $/mes, 6.000.000 créditos): verifica los planes y costes de créditos actuales en la página de precios de ElevenLabs antes de decidir.
- ElevenLabs admite clonación de voz zero-shot a partir de un clip de referencia corto desde los planes de pago; Kokoro no incluye esta función de fábrica.
- No existe relación de afiliación entre PromptQuorum y Kokoro/hexgrad; cualquier enlace de ElevenLabs en este artículo se divulga conforme al aviso de afiliación en la parte superior de la página.
📍 En una frase
Kokoro es un modelo TTS local gratuito de pesos abiertos con 82 millones de parámetros (Apache 2.0, de hexgrad) que funciona localmente con 54 voces fijas; ElevenLabs es una plataforma en la nube de pago con un catálogo de voces más amplio y clonación de voz.
💬 En términos simples
Kokoro es software que descargas y ejecutas gratis en tu propio ordenador, con una lista fija de voces entre las que elegir. ElevenLabs es un servicio por suscripción que usas mediante un navegador o una API y que también puede copiar la voz de una persona específica a partir de una grabación corta.
📌Nota: Los datos se han verificado con la ficha de modelo de Kokoro-82M en Hugging Face y la página pública de precios de ElevenLabs a la fecha de publicación de este artículo. Ambos pueden cambiar: verifica las condiciones actuales antes de comprometerte con cualquiera de las dos opciones.
Kokoro es un modelo de texto a voz de pesos abiertos publicado por el desarrollador pseudónimo hexgrad. Con 82 millones de parámetros, es pequeño comparado con la mayoría de los sistemas TTS modernos, aunque análisis independientes y pruebas comparativas de la comunidad en Hugging Face lo describen como superior a su número de parámetros en calidad de audio percibida, aunque PromptQuorum no ha realizado sus propias pruebas de escucha a ciegas, por lo que las comparaciones de calidad deben tratarse como orientativas, no medidas. La arquitectura se deriva de StyleTTS 2, combinada con un vocoder de tipo ISTFTNet en un diseño solo de decodificador, lo que explica en parte que pueda funcionar cómodamente en CPU o una GPU de gama media en lugar de requerir un gran acelerador.
ElevenLabs es una plataforma de voz alojada. Sus planes combinan texto a voz con otras funciones de voz y medios; los créditos se comparten entre productos. El nivel gratuito indica 10.000 créditos al mes, mientras que los planes de pago añaden acceso a licencia comercial, clonación de voz profesional e instantánea, y asignaciones más altas. Consulta la página de precios de ElevenLabs en vivo antes de confiar en una cifra específica, porque los planes y costes de créditos cambian.
La decisión real no es «¿qué voz suena mejor?». Es: ¿quieres un modelo gratuito que descargas una vez y operas tú mismo con un conjunto fijo de voces, o un servicio de pago que ofrece clonación y una biblioteca de voces más amplia a cambio de una suscripción y de enviar tu texto a un servidor de terceros?
Nuestro veredicto
🏆 Mejor TTS gratuito/sin conexión: Kokoro — un modelo de 82M de parámetros bajo licencia Apache 2.0 que operas tú mismo, sin coste por carácter. 💰 Mejor para clonación de voz: ElevenLabs — clonación zero-shot a partir de un clip de referencia corto en planes de pago. ⚡ Mejor para una voz pulida hoy mismo, sin instalación: ElevenLabs. 🖥️ Mejor para hardware solo CPU o GPU modesta: Kokoro. 🔒 Mejor para mantener texto y audio fuera de servidores de terceros: Kokoro (una vez descargado y ejecutado completamente sin conexión). 🌍 Mejor para máxima cobertura de idiomas: ElevenLabs — consulta su documentación actual para la cifra exacta; Kokoro cubre 8 idiomas a nivel de modelo.
Para desarrolladores y aficionados con presupuesto ajustado que no necesitan clonación de voz, empieza con Kokoro. Para creadores y empresas que necesitan una voz clonada, mayor soporte de idiomas, o resultados hoy sin instalar nada, empieza con el nivel gratuito de ElevenLabs.
Elige tu enfoque de TTS
Usa un LLM local si:
- •Quieres generación gratuita e ilimitada sin facturación por carácter.
- •La canalización debe funcionar completamente sin conexión una vez configurada: quioscos, dispositivos embebidos, sistemas aislados.
- •Te conformas con elegir entre un conjunto fijo de 54 voces en lugar de clonar una específica.
Usa un modelo en la nube si:
- •Necesitas clonar una voz específica a partir de una muestra de referencia corta.
- •Quieres la mayor cobertura de idiomas y acentos sin revisar tú mismo las listas de idiomas a nivel de modelo.
- •Necesitas una voz hoy y no quieres instalar nada ni gestionar un modelo.
Decisión rápida:
- →Para clonación de voz o máximo pulido con cero configuración: gana ElevenLabs.
- →Para generación gratuita, sin conexión y de voces fijas: gana Kokoro.
- →Para generación de alto volumen donde el precio de la nube por uso se acumula: Kokoro suele ser más barato una vez en funcionamiento.
De un vistazo
Situación | Mejor opción | Por qué |
|---|---|---|
| Necesitas una locución natural hoy, sin instalación | ElevenLabs | Sin descarga de modelo, sin configuración local. Generación en un navegador o vía API en minutos. |
| Necesitas clonar la voz de una persona específica a partir de una muestra | ElevenLabs | Kokoro no clona voces; ElevenLabs sí, en planes de pago, con requisitos de consentimiento. |
| Quieres TTS gratuito y sin medición para un proyecto paralelo o app | Kokoro | Licenciado bajo Apache 2.0, sin suscripción, sin créditos por carácter una vez descargado y en funcionamiento. |
| Estás construyendo una función de voz sin conexión o embebida | Kokoro | Funciona en CPU o GPU modesta sin conexión a Internet tras la configuración. |
| Necesitas docenas de idiomas/acentos sin verificar tú mismo la cobertura | ElevenLabs | Indica soporte de idiomas más amplio en su sitio; Kokoro está documentado para 8 idiomas a nivel de modelo. |
| Generas un alto volumen de audio cada mes | Kokoro puede ser más barato | Sin coste por carácter tras montar el hardware; los créditos de ElevenLabs escalan con el volumen. |
| Quieres ajustar, autoalojar o auditar completamente el modelo | Kokoro | Los pesos Apache 2.0 son descargables e inspeccionables; ElevenLabs es una plataforma cerrada y alojada. |
¿Qué es Kokoro y en qué se diferencia de ElevenLabs?
Kokoro es un modelo de texto a voz pequeño y de pesos abiertos, no una empresa, una suite de productos ni una plataforma alojada. Es un único conjunto de pesos de modelo (actualmente distribuido como Kokoro-82M) que descargas de Hugging Face y ejecutas con un script de inferencia, un envoltorio comunitario, o una compilación cuantizada GGUF/ONNX. No hay cuenta, ni panel de control, ni suscripción: todo el «producto» es el archivo del modelo más el código que lo ejecuta.
- Parámetros: 82 millones — lo bastante pequeño para funcionar cómodamente en CPU o una GPU de gama media, a diferencia de los sistemas TTS que necesitan aceleradores dedicados.
- Licencia: Apache 2.0 — permisiva, permite uso comercial, modificación y redistribución sin los requisitos copyleft de una licencia como la GPL.
- Arquitectura: derivada de StyleTTS 2, combinada con un vocoder de tipo ISTFTNet en un diseño solo de decodificador — sin proceso de difusión, sin un gran bloque codificador.
- Voces: 54 paquetes de voz integrados con el modelo, que abarcan 8 idiomas (inglés, español, francés, hindi, italiano, japonés, portugués, chino) a nivel de modelo.
- Clonación de voz: no es una función oficial integrada. Existen proyectos comunitarios de terceros que añaden clonación zero-shot sobre Kokoro, pero son complementos separados y no oficiales, no algo que hexgrad o el modelo base incluyan o admitan.
- Distribución: la ficha de modelo y los pesos están en Hugging Face en hexgrad/Kokoro-82M; también hay compilaciones comunitarias cuantizadas y ONNX disponibles para despliegues más ligeros.
Publicidad
Lo que pagas con ElevenLabs
¿Necesitas una voz clonada o pulida hoy, sin instalación local? Empieza con el nivel gratuito de ElevenLabs: 10.000 créditos mensuales, sin necesidad de tarjeta. Probar ElevenLabs gratis →
ElevenLabs elimina varias tareas que quedan a tu cargo al ejecutar Kokoro tú mismo:
Sin modelo ni runtime que gestionar
- Qué cambia en la práctica:
- No descargas pesos, no instalas una pila de inferencia ni solucionas dependencias de audio
Clonación de voz
- Qué cambia en la práctica:
- Puedes clonar una voz a partir de un clip de referencia corto en planes de pago, una función que Kokoro no ofrece
Biblioteca de voces más amplia y curada
- Qué cambia en la práctica:
- Eliges entre un catálogo más grande que las 54 voces preestablecidas fijas de Kokoro
Soporte de idiomas documentado más amplio
- Qué cambia en la práctica:
- Consulta la documentación actual de ElevenLabs para la cifra exacta; probablemente más amplia que los 8 idiomas de Kokoro a nivel de modelo
Escalado alojado
- Qué cambia en la práctica:
- El proveedor opera la infraestructura en lugar de que tú gestiones una GPU, un servidor, actualizaciones y monitorización
Funciones de producción
- Qué cambia en la práctica:
- Los planes de pago pueden incluir acceso a licencia comercial y herramientas adicionales; verifica los términos del plan que se aplican a tu cuenta
•Key Point: ElevenLabs actualmente indica: Free (0 $, 10.000 créditos/mes, sin licencia comercial), Starter (6 $/mes, 30.000 créditos, licencia comercial y clonación de voz instantánea incluidas), Creator (22 $/mes, 121.000 créditos, clonación de voz profesional), Pro (99 $/mes, 600.000 créditos, audio de mayor calidad a 192 kbps), Scale (299 $/mes, 1.800.000 créditos), y Business (990 $/mes, 6.000.000 créditos). Los planes Enterprise usan precios personalizados. La facturación anual reduce el precio mensual efectivo. El uso de texto a voz consume créditos compartidos, y el coste exacto en créditos depende del modelo y flujo de trabajo seleccionados: confirma las cifras actuales en la página de precios de ElevenLabs en vivo antes de decidir.
•Key Point: El 7 de mayo de 2026, ElevenLabs redujo sus precios de API de autoservicio: Text to Speech hasta un 55 %, Speech to Text hasta un 45 %, y ElevenAgents hasta un 20 %, e introdujo créditos de pago por uso para desarrolladores que no quieren una suscripción mensual. Fuente: ElevenLabs — We've lowered API & Agents pricing and introduced PAYG.
Lo que realmente cuesta ejecutar Kokoro tú mismo
¿Quieres TTS local gratuito e ilimitado sin necesidad de clonación? Kokoro es uno de los modelos TTS pequeños de pesos abiertos más accesibles para poner en marcha. Explorar Kokoro-82M en Hugging Face →
Los pesos del modelo Kokoro cuestan 0 $ bajo la licencia Apache 2.0, pero «gratis» es solo una partida una vez que realmente lo despliegas:
Hardware
- Qué significa:
- Una máquina solo con CPU funciona para cargas ligeras; una GPU modesta acelera la generación y las solicitudes concurrentes
Instalación
- Qué significa:
- Instalas un entorno Python, el código de inferencia o un envoltorio, y descargas el modelo y los paquetes de voz
Selección de voz
- Qué significa:
- Estás limitado a las 54 voces integradas — sin clonar tu propia voz o la de un cliente sin un complemento de terceros
Sin API alojada oficial
- Qué significa:
- No hay un endpoint oficial operado por hexgrad; te autoalojas o usas un proveedor tercero que ejecuta los mismos pesos abiertos
Operaciones
- Qué significa:
- Las actualizaciones, seguridad, almacenamiento, registro, monitorización y escalado son tu responsabilidad
Fiabilidad
- Qué significa:
- Asumes los modos de fallo: conflictos de dependencias, problemas de controladores y latencia bajo carga concurrente
•Key Point: Kokoro cambia una suscripción por tiempo de configuración inicial y responsabilidad continua. Es un buen trato para desarrolladores que quieren generación gratuita, ilimitada y capaz de funcionar sin conexión, y no necesitan clonación de voz. Es un mal trato si necesitas una voz clonada o quieres publicar resultados hoy sin ninguna configuración.
Kokoro vs ElevenLabs: comparación directa
Dimensión | Kokoro | ElevenLabs |
|---|---|---|
| Tipo de producto | Modelo local de pesos abiertos (82M de parámetros) | Plataforma en la nube gestionada |
| Coste | Gratuito (Apache 2.0); tú proporcionas el hardware | Nivel gratuito, luego planes de pago de 6 $ a 990+ $/mes |
| Configuración | Instalar un entorno Python, descargar pesos y voces | Crear una cuenta y generar — sin instalación |
| Requisito de Internet | Ninguno tras descargar el modelo/las voces | El uso normal requiere conectividad al servicio |
| Cómputo | CPU o GPU modesta — ligero para su calidad de salida | Operado por el proveedor |
| Catálogo de voces | 54 voces integradas fijas | Biblioteca de voces alojada más amplia y curada, más herramientas de diseño de voz |
| Clonación de voz | Sin función oficial integrada (existen complementos comunitarios no oficiales) | Clonación zero-shot/instantánea a partir de una muestra corta en planes de pago |
| Cobertura de idiomas | 8 idiomas documentados a nivel de modelo | Cobertura documentada más amplia — consultar documentación actual para la cifra exacta |
| Control de privacidad | Texto y audio pueden permanecer totalmente en tu dispositivo una vez en funcionamiento | Regido por los términos del proveedor, la configuración de la cuenta y las prácticas de datos actuales |
| Uso comercial | Apache 2.0 permite el uso comercial del modelo en sí | Verifica tu plan — el acceso a licencia comercial está ligado a los niveles de pago |
| Licencia | Apache 2.0 (permisiva) | Servicio propietario; uso regido por los términos de servicio |
| Mejor para | Desarrolladores y aficionados que quieren TTS gratuito, sin conexión y de voces fijas | Creadores y empresas que necesitan clonación, pulido y velocidad sin configuración |
La reputación de Kokoro sobre calidad por parámetro, reportada de forma independiente, proviene de pruebas comparativas de la comunidad y discusiones en Hugging Face, no de una prueba a ciegas realizada por PromptQuorum: trátala como orientativa. La concurrencia y latencia de ambas herramientas varían según el hardware y el nivel de cuenta; prueba con tu propia carga de trabajo antes de decidirte.
¿Qué hardware necesitas realmente para Kokoro?
¿Planeas comprar hardware para IA de voz local o trabajo con LLM? Consulta nuestra guía de las mejores GPU para IA local para recomendaciones de compra en todos los presupuestos.
El bajo número de parámetros de Kokoro (82 millones) es la razón principal por la que funciona en hardware modesto comparado con modelos de TTS y clonación de voz más grandes.
Portátil solo con CPU
- Kokoro:
- Funcional para uso ligero, no en tiempo real
Mac Mini / Apple Silicon
- Kokoro:
- Bueno
PC con 16GB de RAM, sin GPU dedicada
- Kokoro:
- Bueno para un rendimiento moderado
GPU NVIDIA de 8GB
- Kokoro:
- Margen cómodo, generación más rápida
GPU NVIDIA de 12GB+
- Kokoro:
- Más que suficiente; útil sobre todo para concurrencia
Raspberry Pi / placa embebida de bajo consumo
- Kokoro:
- Posible para cargas ligeras, pero no es el objetivo principal de Kokoro — probar antes de decidirse
Estas son pautas orientativas, no pruebas comparativas — el rendimiento real depende del runtime de inferencia específico (PyTorch, ONNX, GGUF), del procesamiento por lotes y de la carga concurrente. Prueba con tus propios scripts antes de comprar hardware.
¿Qué flujo de trabajo es más barato?
La respuesta depende del volumen, de si ya tienes hardware adecuado, y de si necesitas clonación de voz.
Escenario | Kokoro | ElevenLabs | Respuesta práctica |
|---|---|---|---|
| Una locución ocasional esta semana | El tiempo de configuración puede superar el valor del ahorro | El nivel gratuito o un plan de pago pequeño lo cubre en minutos | ElevenLabs suele ser más rápido para llegar a un resultado terminado |
| Un proyecto de aficionado o herramienta interna sin necesidad de clonación | Sin coste por carácter una vez en funcionamiento; ideal si ya tienes una máquina | El nivel gratuito funciona hasta 10.000 créditos/mes | Kokoro suele ser más barato para uso gratuito sostenido |
| Necesitas clonar una voz específica | No es una función oficial — necesitarías un complemento de terceros no oficial | Integrado en planes de pago, con requisitos de consentimiento | ElevenLabs es el camino directo y compatible |
| Generación de alto volumen (miles de solicitudes/mes) | El hardware y las operaciones pueden ser más baratos que los créditos medidos a escala | Los cargos por uso pueden crecer sustancialmente con el volumen | Calcula con tu volumen de solicitudes real y el coste del hardware |
| Despliegue sin conexión o aislado | Excelente encaje una vez instalados localmente el modelo y las voces | Requiere conectividad para uso normal | Kokoro gana (requisito sin conexión) |
Privacidad, clonación y consentimiento
Ejecutar Kokoro localmente puede mantener tu texto y el audio generado en tu propio dispositivo, pero no crea automáticamente cumplimiento legal para cómo usas el resultado. Tus responsabilidades pueden seguir incluyendo base legal, minimización de datos, retención y derechos del usuario, según tu caso de uso y jurisdicción.
La clonación de voz plantea un conjunto de preocupaciones distinto y más serio, que se aplica específicamente a la función de clonación de ElevenLabs, ya que Kokoro no incluye clonación en absoluto:
- Nunca clones, imites ni despliegues la voz de una persona real sin su permiso claro e informado. Clonar una voz sin consentimiento puede exponerte a responsabilidad legal (derecho de imagen, fraude, difamación y otras reclamaciones según la jurisdicción) y causa un daño real a la persona cuya voz se usa.
- Revisa los requisitos de consentimiento y verificación de la plataforma. Los términos de ElevenLabs rigen lo que requieren los flujos de clonación y lo que puedes hacer con una voz clonada: revisa los términos actuales antes de clonar cualquier voz, incluida la tuya, para uso comercial.
- Divulga el audio sintético o clonado cuando sea relevante. Las políticas de plataformas, la normativa publicitaria y las expectativas del público cada vez exigen más divulgar cuando el audio es generado por IA o es una clonación de voz, especialmente en contenido comercial o de cara al público.
- El conjunto fijo de voces de Kokoro evita por completo esta categoría de riesgo — como no tiene clonación integrada, no hay pregunta de consentimiento que gestionar para las voces con las que se distribuye. Eso cambia si añades una capa de clonación de terceros no oficial encima, que entonces conlleva las mismas obligaciones de consentimiento que cualquier otra herramienta de clonación.
•Warning: Este artículo ofrece orientación técnica, no asesoramiento legal. Consulta a un profesional cualificado sobre cuestiones de consentimiento, derechos de imagen y cumplimiento en tu jurisdicción antes de desplegar cualquier flujo de trabajo de clonación de voz.
Elige Kokoro si
Elige el modelo local gratuito si la mayoría de estas afirmaciones te describen:
- Quieres texto a voz gratuito e ilimitado sin suscripción ni facturación por carácter.
- La canalización debe funcionar completamente sin conexión una vez configurada: dispositivos embebidos, quioscos, sistemas aislados.
- Te conformas con elegir entre un conjunto fijo de 54 voces preestablecidas en lugar de clonar una específica.
- Quieres instalar, inspeccionar, ajustar o redistribuir el modelo bajo una licencia permisiva.
- Eres desarrollador y te sientes cómodo configurando un entorno Python y una canalización de inferencia.
- Generas grandes volúmenes de audio donde el precio medido en la nube se acumularía.
•Key Point: Los pesos de Kokoro-82M se pueden descargar gratis desde Hugging Face bajo Apache 2.0. Sin cuenta, sin suscripción, sin créditos.
No elijas Kokoro si
Un modelo local de voces fijas es la elección incorrecta si alguna de estas describe tu proyecto:
- Necesitas clonar la voz de una persona específica a partir de una muestra — Kokoro no tiene una función oficial para esto.
- Necesitas un idioma fuera de los 8 idiomas de Kokoro a nivel de modelo.
- Quieres resultados hoy sin instalar ni configurar nada.
- No tienes hardware para ejecutar el modelo y no quieres alquilar una instancia en la nube.
- Necesitas una API alojada oficial con soporte y SLA — Kokoro no tiene un endpoint alojado oficial.
Elige ElevenLabs si
Elige la plataforma en la nube de pago si la mayoría de estas afirmaciones te describen:
- Necesitas clonar una voz específica a partir de una muestra de referencia, con el consentimiento adecuado.
- Necesitas una voz pulida y profesional esta semana, no tras un proyecto de configuración.
- Publicas vídeos, anuncios, podcasts, cursos o trabajos de clientes con regularidad y valoras la iteración rápida.
- Necesitas mayor cobertura de idiomas o acentos que los 8 idiomas de Kokoro a nivel de modelo.
- No quieres instalar dependencias, gestionar un modelo ni mantener infraestructura local.
- Te sientes cómodo usando una plataforma de terceros tras revisar sus términos y prácticas de datos actuales.
•Key Point: Empieza gratis con 10.000 créditos mensuales. No se requiere tarjeta de crédito. Pruébalo con tu propio script hoy mismo.
No elijas ElevenLabs si
Si este es tu caso, empieza en su lugar con Kokoro-82M en Hugging Face → — gratuito, Apache 2.0, y funciona en CPU o GPU modesta.
Una plataforma en la nube de pago es la elección incorrecta si alguna de estas describe tu proyecto:
- Necesitas operación completamente sin conexión, sin conexión a Internet.
- Tu texto y audio no pueden salir de tu propia infraestructura.
- Necesitas generación ilimitada sin ningún coste por carácter o crédito.
- Operas un sistema aislado o embebido sin acceso a red.
- Quieres control total y visibilidad sobre los pesos del modelo en sí.
Preguntas frecuentes
¿Es Kokoro mejor que ElevenLabs?
Para generación gratuita, sin conexión y de voces fijas: Kokoro gana en coste y control. Para clonación de voz, mayor cobertura de idiomas, o resultados sin ninguna configuración local: ElevenLabs gana. Resuelven problemas distintos: Kokoro es un modelo que operas tú mismo, ElevenLabs es un servicio alojado.
¿Puede Kokoro clonar voces como ElevenLabs?
No, no oficialmente. Kokoro viene con 54 voces preestablecidas fijas y no tiene una función de clonación de voz zero-shot integrada. Existen proyectos comunitarios de terceros no oficiales que añaden clonación sobre Kokoro, pero son complementos separados, no algo que el modelo base o hexgrad admitan directamente.
¿Es Kokoro gratuito para uso comercial?
Kokoro-82M se publica bajo la licencia Apache 2.0, que permite el uso comercial, modificación y redistribución del modelo en sí. Verifica siempre la licencia actual en la ficha de modelo antes de un despliegue comercial, ya que las condiciones pueden actualizarse.
¿Cuántos parámetros tiene Kokoro?
Kokoro-82M tiene 82 millones de parámetros — pequeño comparado con la mayoría de los sistemas TTS modernos, lo que explica que pueda funcionar en CPU o una GPU modesta en lugar de requerir un acelerador dedicado.
¿Qué idiomas admite Kokoro?
Kokoro está documentado a nivel de modelo para admitir 8 idiomas: inglés, español, francés, hindi, italiano, japonés, portugués y chino. Consulta la ficha de modelo actual para el desglose exacto de paquetes de voz por idioma.
¿Kokoro requiere una GPU?
No. Kokoro puede funcionar en hardware solo con CPU para cargas ligeras; una GPU modesta acelera la generación y ayuda con solicitudes concurrentes, pero no es estrictamente necesaria dado el pequeño tamaño de 82 millones de parámetros del modelo.
¿Cuánto cuesta ElevenLabs?
ElevenLabs indica un plan Free (0 $, 10.000 créditos/mes, sin licencia comercial) hasta planes de pago que van desde Starter (6 $/mes) hasta Business (990 $/mes, 6.000.000 créditos), más precios Enterprise personalizados. Confirma las cifras actuales en la página de precios de ElevenLabs, ya que los planes y costes de créditos cambian.
¿Puedo ejecutar Kokoro completamente sin conexión?
Sí, una vez descargados los pesos del modelo y los paquetes de voz, Kokoro puede generar voz sin conexión a Internet. ElevenLabs, como servicio en la nube, requiere conectividad para uso normal.
¿ElevenLabs ofrece un plan gratuito?
Sí. El plan Free de ElevenLabs indica actualmente 10.000 créditos al mes pero no incluye licencia comercial: necesitarías un plan de pago como Starter para usar el audio generado comercialmente. Verifica las condiciones actuales antes de publicar contenido monetizado.
¿Kokoro es de código abierto?
Los pesos del modelo Kokoro-82M se publican bajo la licencia Apache 2.0 y se alojan en Hugging Face, lo que hace que los pesos y el código de inferencia habitual estén abiertamente disponibles. Verifica siempre el repositorio específico que uses para sus condiciones de licencia exactas.
¿Cuál es más barato con alto volumen, Kokoro o ElevenLabs?
Depende de tu uso real y tus costes de hardware. Kokoro no tiene facturación por carácter una vez en funcionamiento, por lo que el hardware y la configuración pueden ser más baratos que los créditos medidos de ElevenLabs a suficiente volumen. Los precios basados en uso de ElevenLabs pueden crecer sustancialmente con el volumen. Calcula con tu recuento de solicitudes real, no uno hipotético.
¿Puedo clonar mi propia voz gratis con un modelo local?
No directamente con Kokoro, ya que no incluye clonación de voz. Existen otros modelos abiertos locales con capacidad de clonación, pero normalmente requieren más configuración y hardware más potente que Kokoro. Obtén siempre un consentimiento claro antes de clonar cualquier voz, incluida la tuya, para uso comercial, y revisa la licencia y los requisitos de consentimiento de la herramienta específica.
Veredicto
Si necesitas una voz clonada, amplia cobertura de idiomas, o un resultado pulido hoy sin configuración, empieza con ElevenLabs. El nivel gratuito (10.000 créditos/mes, sin tarjeta requerida) elimina el riesgo de tiempo de configuración desperdiciado, y los planes de pago desbloquean licencia comercial y clonación.
Si quieres texto a voz gratuito, ilimitado y capaz de funcionar sin conexión y no necesitas clonación de voz, Kokoro es la elección estratégica. Un modelo de 82 millones de parámetros bajo licencia Apache 2.0 que funciona en CPU o GPU modesta, con 54 voces integradas, sin coste por carácter.
La decisión real no es «¿cuál suena mejor?». Es si prefieres alquilar una plataforma de voz alojada con clonación y mayor cobertura, o descargar y ejecutar tú mismo un modelo pequeño, gratuito y de voces fijas. Para desarrolladores con un requisito específico sin conexión o de alto volumen, la configuración de Kokoro vale la pena. Para todos los demás, especialmente quienes necesitan clonación, el nivel gratuito de ElevenLabs es el punto de partida más rápido.
