Conclusiones clave
- Piper: originado en el ecosistema Rhasspy/Home Assistant, hoy mantenido por la Open Home Foundation; basado en ONNX Runtime; funciona sin problemas en una Raspberry Pi sin GPU.
- Kokoro: un modelo de 82 millones de parámetros de hexgrad, derivado de StyleTTS2 e ISTFTNet, bajo licencia Apache-2.0; funciona bien en CPU o una GPU modesta.
- Ninguno de los dos motores realiza clonación de voz zero-shot; ambos ofrecen conjuntos fijos de voces preentrenadas.
- Licencia de Piper: GPL-3.0-or-later (repositorio actual); el repositorio original archivado era MIT. Licencia de Kokoro: Apache-2.0.
- Piper gana en velocidad pura y uso mínimo de recursos; Kokoro se describe ampliamente como más natural en comparativas de escucha de la comunidad.
- Usa Piper para dispositivos embebidos/edge y asistentes de voz; usa Kokoro cuando la calidad de audio importa más que reducirse al hardware más pequeño posible.
📍 En una frase
Piper es el motor de texto a voz local más rápido y ligero, que funciona en una Raspberry Pi sin GPU (licencia GPL-3.0-or-later), mientras que Kokoro es un modelo de peso abierto de 82 millones de parámetros (Apache-2.0) que sacrifica algo de velocidad por audio notablemente más natural; ninguno clona voces a partir de una muestra.
💬 En términos simples
Ambos convierten texto en audio hablado por completo en tu propio equipo, sin llamadas a una API en la nube. Piper es más pequeño y rápido, así que funciona en hardware barato como una Raspberry Pi, pero suena algo más robótico. Kokoro es un modelo ligeramente más grande que suena notablemente más humano, a costa de necesitar algo más de potencia de cómputo.
📌Nota: Ni Piper ni Kokoro clonan una voz a partir de un clip de referencia corto. Para esa capacidad, consulta la reseña de XTTS v2 de PromptQuorum — ten en cuenta que la licencia de XTTS v2 es no comercial, a diferencia de Piper y Kokoro.
Qué es realmente cada motor
Piper y Kokoro resuelven el mismo problema básico — convertir texto en audio hablado en hardware local, sin que los datos salgan de la máquina — pero provienen de linajes distintos y hacen compromisos diferentes entre tamaño y calidad.
- Piper es un motor de texto a voz neuronal, creado originalmente por Michael Hansen dentro de Rhasspy, un kit de herramientas de código abierto para asistentes de voz sin conexión. Convierte texto en fonemas con espeak-ng y luego sintetiza una forma de onda a partir de esos fonemas usando un modelo de tipo VITS exportado a ONNX Runtime para inferencia rápida, incluso en hardware de solo CPU. Se convirtió en el motor TTS local predeterminado en el pipeline de voz de Home Assistant y hoy lo mantiene la Open Home Foundation en OHF-Voice/piper1-gpl. PromptQuorum lo cubre en detalle en una reseña dedicada a Piper.
- Kokoro es un modelo TTS de peso abierto de 82 millones de parámetros publicado en Hugging Face por el desarrollador conocido como hexgrad. Su arquitectura se basa en StyleTTS 2 con un vocoder ISTFTNet, en un diseño solo-decodificador sin paso de difusión — un pipeline más pequeño y simple que muchos modelos TTS con mayor cantidad de parámetros. Según su ficha de modelo en Hugging Face, se entrenó con unos cientos de horas de audio con licencia permisiva o de dominio público, y la versión 1.0 se publicó el 27 de enero de 2025.
- Ninguno de los dos modelos clona una voz a partir de un clip de referencia corto. Piper y Kokoro ofrecen cada uno un conjunto fijo de voces preentrenadas entre las que elegir — una capacidad fundamentalmente distinta de un modelo de clonación de voz como XTTS v2, que sintetiza habla en una voz nueva a partir de 6 segundos de audio de muestra, aunque bajo licencia no comercial.
- Ambos funcionan completamente sin conexión, en tu propio hardware. Ninguno de los dos motores envía texto ni audio a una API en la nube — todo el pipeline de síntesis se ejecuta localmente, algo relevante para aplicaciones sensibles a la privacidad y para evitar costes de TTS en la nube por carácter.
Piper vs Kokoro: comparación directa
Piper gana en velocidad y huella mínima de hardware; Kokoro gana en calidad de audio percibida. La tabla siguiente resume los compromisos reales — trata la fila "Calidad de voz" como una impresión cualitativa y ampliamente compartida por la comunidad, no como una puntuación de benchmark específica, ya que PromptQuorum no pudo localizar un único benchmark numérico autorizado que compare directamente ambos motores.
Origen / mantenedor
- Piper:
- Proyecto Rhasspy → Open Home Foundation
- Kokoro:
- Desarrollador independiente (hexgrad)
Cantidad de parámetros
- Piper:
- Sin una cifra única publicada (tipo VITS, modelos por voz)
- Kokoro:
- 82 millones de parámetros
Arquitectura
- Piper:
- Tipo VITS, ONNX Runtime
- Kokoro:
- StyleTTS 2 + ISTFTNet, solo decodificador
Licencia
- Piper:
- GPL-3.0-or-later (repositorio actual)
- Kokoro:
- Apache-2.0
Requisitos de hardware
- Piper:
- Solo CPU, tiempo real en una Raspberry Pi
- Kokoro:
- CPU o GPU modesta
Calidad de voz (reportes de la comunidad)
- Piper:
- Rápido, decente para su tamaño, algo más robótico
- Kokoro:
- Ampliamente descrito como más natural / expresivo
Clonación de voz
- Piper:
- No — voces preentrenadas fijas
- Kokoro:
- No — voces preentrenadas fijas
Instalación
- Piper:
pip install piper-tts- Kokoro:
pip install kokoro
Ejemplos de uso reales
Estos comandos usan el patrón de instalación y API documentado por cada proyecto. Revisa la documentación actual en GitHub/Hugging Face de cada proyecto antes de desplegar, ya que las opciones de CLI y los nombres de paquetes pueden cambiar entre versiones.
- Piper arranca más rápido. Sus modelos ONNX por voz cargan rápido y la síntesis es casi instantánea en CPU, por lo que es la opción habitual para asistentes de voz interactivos en hardware limitado.
- El pipeline de Kokoro agrupa la síntesis en fragmentos (la tupla
gs/ps/audiode arriba), algo que conviene saber antes de asumir que una sola llamada devuelve un búfer de audio continuo para texto largo.
# ── Piper: instalación y síntesis ─────────────────────────────
pip install piper-tts
python3 -m piper.download_voices en_US-lessac-medium
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."
# API de Python de Piper
from piper import PiperVoice
voice = PiperVoice.load("en_US-lessac-medium.onnx")
with open("test.wav", "wb") as wav_file:
voice.synthesize_wav("Fast, local speech synthesis.", wav_file)
# ── Kokoro: instalación y síntesis ────────────────────────────
pip install kokoro soundfile
# API de Python de Kokoro (según hexgrad/Kokoro-82M en Hugging Face)
from kokoro import KPipeline
import soundfile as sf
pipeline = KPipeline(lang_code="a") # "a" = inglés americano
generator = pipeline(
"Kokoro produces noticeably natural-sounding speech from a small model.",
voice="af_heart",
)
for i, (gs, ps, audio) in enumerate(generator):
sf.write(f"output_{i}.wav", audio, 24000)Licencia y coste
El repositorio activamente mantenido de Piper, OHF-Voice/piper1-gpl, está bajo licencia GPL-3.0-or-later. Esto supone un cambio respecto al repositorio original rhasspy/piper, que era MIT antes de ser archivado (marcado como solo lectura) el 6 de octubre de 2025, y sigue disponible bajo esa licencia MIT, sin mantenimiento. GPL-3.0 es una licencia copyleft: puedes usar Piper gratis, incluso comercialmente, para generar voz, pero si distribuyes una versión modificada del propio código fuente de Piper, debes publicar esa modificación bajo los mismos términos GPL-3.0. Usar Piper como herramienta externa sin modificar (su CLI, su paquete de Python o un servidor web invocado como proceso separado) generalmente no pone el resto de tu aplicación bajo GPL, pero el límite exacto depende de cuán estrechamente esté vinculado tu código con el de Piper — esto no es asesoría legal, consulta a un abogado para tu implementación específica.
Kokoro está bajo licencia Apache-2.0, confirmada en su ficha de modelo en Hugging Face. Apache-2.0 es una licencia permisiva sin obligaciones de copyleft — puedes usar, modificar y redistribuir Kokoro, incluso en productos comerciales de código cerrado, sin estar obligado a publicar tu propio código fuente, sujeto a los términos estándar de atribución y concesión de patente de la licencia.
Ninguno de los dos motores tiene un nivel de pago, suscripción o cuota de licencia. Los únicos costes son el hardware en el que los ejecutas y tu propio tiempo de desarrollo. Si en cambio buscas una API TTS en la nube gestionada y de pago con clonación de voz comercial, consulta la comparativa ElevenLabs vs TTS local de PromptQuorum.
¿Kokoro TTS es gratuito para uso comercial?
Sí. Kokoro está bajo licencia Apache-2.0, una licencia permisiva sin obligaciones de copyleft, por lo que puede usarse en productos comerciales de código cerrado sin necesidad de publicar tu propio código fuente, sujeto a los términos estándar de atribución y concesión de patente de la licencia. Esto no es asesoría legal — lee tú mismo la licencia Apache-2.0 antes de un despliegue comercial.
¿Piper es gratuito para uso comercial?
Sí, generar voz con Piper es gratuito para uso comercial. Su licencia actual, GPL-3.0-or-later, es una licencia copyleft que solo impone condiciones si distribuyes una versión modificada del propio código fuente de Piper — usarlo como herramienta externa generalmente no pone el resto del código de tu aplicación bajo GPL. Esto no es asesoría legal — consulta a un abogado para tu implementación específica.
Quién debería usar cuál
Elige Piper para dispositivos embebidos, asistentes de voz y cualquier despliegue donde los ciclos de CPU o la memoria estén muy limitados. Elige Kokoro cuando la calidad de audio sea la prioridad y dispongas al menos de un presupuesto modesto de CPU o GPU para invertir en ella.
- Elige Piper si: funcionas en una Raspberry Pi o un dispositivo similarmente limitado, necesitas la menor latencia posible hasta el primer audio, o te integras con el pipeline de voz de Home Assistant, donde Piper es el motor TTS local predeterminado.
- Elige Kokoro si: produces audiolibros, narraciones, o cualquier contenido donde los oyentes notarían un habla robótica, y dispones de margen de CPU o GPU más allá del mínimo absoluto.
- No elijas ninguno de los dos, y consulta XTTS v2 en su lugar, si: necesitas clonar la voz de una persona específica a partir de un clip de referencia corto — tanto Piper como Kokoro usan solo voces preentrenadas fijas, y ninguno realiza clonación de voz. Consulta la reseña de XTTS v2 de PromptQuorum (licencia no comercial) o la guía de licencias TTS locales para alternativas capaces de clonar y sus licencias.
- No elijas ninguno de los dos, y consulta la comparativa de ElevenLabs en su lugar, si: necesitas clonación de voz de nivel comercial con una licencia de pago clara y no quieres autoalojarla. Consulta la comparativa ElevenLabs vs TTS local de PromptQuorum.
Para qué no sirve ninguno de los dos
Piper y Kokoro son ambos motores TTS de voz fija, sin clonación. Ninguno es la herramienta adecuada para las siguientes situaciones:
- Clonar la voz de una persona específica a partir de un clip de muestra. Ambos motores ofrecen solo voces preentrenadas — no hay ningún mecanismo en ninguno de los dos para generar habla en una voz nueva, nunca antes escuchada, a partir de una grabación de referencia corta. Consulta en su lugar XTTS v2, teniendo en cuenta su licencia no comercial.
- Audio expresivo no vocal (risas, suspiros, sonido ambiental). Ambos motores sintetizan habla, no el rango de audio expresivo más amplio al que apunta un modelo como Bark.
- La máxima fidelidad de audio posible sin importar el coste en recursos. Para lectores que específicamente quieren la narración en inglés de mayor calidad y no tienen restricciones de recursos, la reseña de StyleTTS 2 de PromptQuorum cubre un modelo con una arquitectura subyacente comparable a Kokoro pero un compromiso de tamaño/calidad distinto.
- Una base de código GPL-3.0 dentro de un producto de código cerrado que modifica el propio código fuente de Piper. Si tu plan de despliegue implica bifurcar o enlazar estáticamente código fuente de Piper modificado en un binario de código cerrado, la licencia GPL-3.0-or-later actual de Piper es una restricción real — la licencia Apache-2.0 de Kokoro no tiene esta restricción.
Alternativas
XTTS v2
- Mejor para:
- Clonación de voz a partir de 6 segundos de audio de referencia
- Licencia:
- CPML (no comercial)
Kit de herramientas Coqui TTS
- Mejor para:
- El software que ejecuta XTTS v2 y otros modelos
- Licencia:
- MPL-2.0 (solo el kit)
Bark
- Mejor para:
- Audio expresivo no vocal — risas, suspiros, sonido ambiental
- Licencia:
- MIT
StyleTTS 2
- Mejor para:
- La narración en inglés más natural (sin clonación de voz)
- Licencia:
- MIT
ElevenLabs
- Mejor para:
- API en la nube gestionada con clonación de voz comercial
- Licencia:
- Propietaria (API en la nube de pago)
Preguntas frecuentes
¿Cuál es la principal diferencia entre Piper y Kokoro TTS?
Piper es un motor TTS neuronal ligero y totalmente local, optimizado para velocidad y uso mínimo de recursos — funciona en tiempo real en hardware de solo CPU, incluida una Raspberry Pi. Kokoro es un modelo de peso abierto de 82 millones de parámetros que produce audio notablemente más natural, a costa de necesitar algo más de potencia de cómputo, aunque sigue funcionando en CPU o una GPU modesta.
¿Qué suena más natural, Piper o Kokoro?
Kokoro se describe ampliamente como más natural que Piper en comparativas de escucha de la comunidad. PromptQuorum no pudo localizar un único benchmark numérico autorizado y verificado independientemente que compare ambos motores directamente — trata esto, por tanto, como una impresión cualitativa y ampliamente compartida por la comunidad, no como una puntuación medida.
¿Piper o Kokoro admiten clonación de voz?
No. Ambos motores ofrecen un conjunto fijo de voces preentrenadas entre las que elegir — ninguno clona una voz nueva a partir de una muestra de audio de referencia corta. Para clonación de voz, consulta la reseña de XTTS v2 de PromptQuorum, teniendo en cuenta su licencia no comercial.
¿Puedo ejecutar Kokoro sin GPU?
Sí. Con 82 millones de parámetros, Kokoro funciona en CPU, aunque una GPU modesta acelera la síntesis. No requiere hardware GPU como suelen exigir modelos TTS o de clonación de voz más grandes.
¿Puede Piper funcionar en una Raspberry Pi?
Sí — la síntesis en tiempo real, solo en CPU, en una Raspberry Pi es uno de los principales objetivos de diseño de Piper, y es el motor de texto a voz local predeterminado en el pipeline de voz de Home Assistant, que a menudo funciona en hardware Raspberry Pi.
¿Qué licencia usa Kokoro?
Kokoro está bajo licencia Apache-2.0, una licencia permisiva sin obligaciones de copyleft, confirmada en su ficha de modelo en Hugging Face. Puede usarse en productos comerciales de código cerrado sin necesidad de publicar tu propio código fuente, sujeto a los términos estándar de atribución y concesión de patente de la licencia.
¿Qué licencia usa Piper?
El repositorio activamente mantenido de Piper (OHF-Voice/piper1-gpl) está bajo licencia GPL-3.0-or-later. El repositorio original rhasspy/piper, hoy archivado, era MIT. GPL-3.0 solo impone condiciones si distribuyes una versión modificada del propio código fuente de Piper; usarlo como herramienta externa generalmente no pone tu propia aplicación bajo GPL.
¿Quién mantiene Piper y Kokoro?
Piper fue creado originalmente por Michael Hansen dentro del proyecto de asistente de voz Rhasspy; el desarrollo activo lo mantiene hoy la Open Home Foundation, la organización sin ánimo de lucro detrás de Home Assistant. Kokoro fue publicado por el desarrollador conocido como hexgrad y se distribuye a través de Hugging Face.
¿Cuántos idiomas admiten Piper y Kokoro?
Las 54 voces integradas de Kokoro, según su ficha de modelo en Hugging Face, abarcan 8 grupos de idiomas y acentos, incluidos inglés americano y británico, español, francés, hindi, italiano, japonés, portugués brasileño y chino mandarín. El catálogo de voces de Piper es más grande y más fragmentado — decenas de idiomas y variantes regionales, aportados por distintos miembros de la comunidad, con calidad variable según la voz.
Veredicto
Piper y Kokoro no compiten exactamente por la misma tarea. Piper es la elección correcta cuando la restricción es el hardware — una Raspberry Pi, un dispositivo embebido, un asistente de voz que debe responder al instante solo con CPU — y su licencia GPL-3.0-or-later es gratuita para uso comercial siempre que no redistribuyas código fuente de Piper modificado. Kokoro es la elección correcta cuando la restricción es la calidad de audio: con 82 millones de parámetros sigue siendo pequeño y adecuado para CPU, pero las comparativas de escucha de la comunidad lo describen sistemáticamente como más natural que Piper, y su licencia Apache-2.0 no tiene ninguna restricción de copyleft. Ninguna de las dos herramientas clona una voz a partir de un clip de muestra — si esa es la necesidad real, esta comparativa no es la respuesta; consulta en su lugar la reseña de XTTS v2 de PromptQuorum, o la comparativa de ElevenLabs para una opción comercial gestionada. En caso de duda, empieza con Piper por la instalación más sencilla y los resultados más rápidos, y pasa a Kokoro si la calidad de salida no cumple tus expectativas.
Fuentes
- Kokoro-82M en Hugging Face — la ficha de modelo: parámetros, arquitectura, licencia, voces y fecha de publicación.
- hexgrad/kokoro en GitHub — el código fuente del pipeline de Kokoro y la documentación de la API.
- OHF-Voice/piper1-gpl en GitHub — el repositorio de Piper activamente mantenido, su licencia y documentación.
- rhasspy/piper en GitHub — el repositorio original, hoy archivado, con licencia MIT.
- Reseña de Piper TTS — la reseña dedicada de PromptQuorum sobre Piper, incluyendo su historial de relicenciamiento de 2025.
