Conclusiones clave
- Creado dentro del proyecto de asistente de voz Rhasspy por Michael Hansen.
- Repositorio original rhasspy/piper archivado (solo lectura) el 6 de octubre de 2025, bajo licencia MIT.
- Desarrollo activo hoy en OHF-Voice/piper1-gpl (creado el 28 de marzo de 2025), bajo la Open Home Foundation, la organización sin fines de lucro detrás de Home Assistant.
- Licencia actual: GPL-3.0-or-later — un cambio respecto a la licencia MIT del repositorio archivado.
- Gratuito, sin nivel de pago; inferencia en tiempo real en CPU, aceleración GPU CUDA opcional.
- Última versión: v1.8.0, publicada el 4 de septiembre de 2026.
📍 En una frase
Piper es un motor de síntesis de voz neuronal local y gratuito, creado originalmente dentro del proyecto de asistente de voz Rhasspy por Michael Hansen y hoy mantenido por la Open Home Foundation, lo bastante rápido como para funcionar en tiempo real en hardware solo con CPU como una Raspberry Pi, cuya licencia pasó de MIT a GPL-3.0-or-later al trasladarse a un nuevo repositorio en 2025.
💬 En términos simples
Es un programa que instalas con pip install y que convierte texto escrito en audio hablado en tu propio dispositivo — sin cuenta en la nube, sin necesidad de conexión a Internet, y funciona lo bastante rápido para voz en tiempo real incluso en hardware muy modesto.
📌Nota: La licencia cambió en 2025. Si evaluaste Piper antes de esa fecha asumiendo que tenía licencia MIT, revísalo de nuevo antes de usar el repositorio actualmente mantenido en un producto de código cerrado — ver la sección Licencia y coste más abajo.
Historia: de Rhasspy a la Open Home Foundation
Piper nació dentro de Rhasspy, un conjunto de herramientas de código abierto para construir asistentes de voz totalmente offline, donde Michael Hansen lo desarrolló como un motor de síntesis de voz local y rápido para combinarlo con el reconocimiento de voz local de Rhasspy — evitando un viaje de ida y vuelta a una API TTS en la nube en cada respuesta hablada. Piper usa una arquitectura neuronal de texto a forma de onda de tipo VITS: el texto se convierte primero en fonemas (mediante espeak-ng), y luego un modelo exportado a ONNX Runtime sintetiza directamente una forma de onda a partir de esos fonemas, con inferencia rápida incluso en hardware solo con CPU.
**El repositorio original, rhasspy/piper, se convirtió en uno de los motores TTS locales más usados** en el ecosistema de código abierto de domótica y accesibilidad, acumulando más de 11.000 estrellas en GitHub bajo su licencia MIT. Se convirtió en el motor de síntesis de voz local por defecto del flujo de voz de Home Assistant.
En 2025, el desarrollo activo se trasladó a un nuevo repositorio. OHF-Voice/piper1-gpl se creó el 28 de marzo de 2025, bajo la Open Home Foundation — la organización sin fines de lucro que también gestiona Home Assistant. El repositorio original rhasspy/piper se archivó posteriormente (quedó de solo lectura) el 6 de octubre de 2025; sigue disponible bajo su licencia MIT original, pero no recibe más actualizaciones.
El nuevo repositorio usa una licencia distinta: GPL-3.0-or-later, en lugar de la licencia MIT original. El proyecto no explica el motivo en su README ni en el changelog, pero piper1-gpl integra espeak-ng para la fonemización, y espeak-ng en sí está bajo licencia GPL-3.0 — una explicación plausible del cambio de licencia, aunque PromptQuorum no pudo confirmarla como motivo declarado oficialmente. Al momento de esta publicación, el propio README del proyecto indica que la Open Home Foundation busca más mantenedores para Piper.
¿Quién creó Piper?
Piper fue creado por Michael Hansen dentro del proyecto de asistente de voz de código abierto Rhasspy. El desarrollo se trasladó después a un nuevo repositorio, OHF-Voice/piper1-gpl, mantenido por la Open Home Foundation.
Qué hace realmente Piper
Piper convierte texto escrito en audio hablado mediante un pipeline de síntesis de voz neuronal: el texto se convierte en fonemas con espeak-ng, y luego un modelo de voz entrenado sintetiza una forma de onda a partir de esos fonemas, ejecutándose sobre ONNX Runtime para mayor velocidad.
- Síntesis por línea de comandos. Ejecuta
python3 -m pipercon un modelo de voz descargado para generar un archivo WAV o transmitir audio directamente a tus altavoces. - API de Python. Carga una voz con
PiperVoice.load()y llama a.synthesize_wav()o al generador en streaming.synthesize()desde tu propia aplicación Python. - Modo servidor web HTTP. Piper puede ejecutarse como un servidor web persistente para que los modelos de voz permanezcan cargados en memoria, evitando el coste de recarga de la CLI en cada llamada — recomendado para uso repetido o en producción.
- API C/C++ (libpiper). Una biblioteca nativa en C++ y su CLI, portada desde el repositorio original de Piper, para integrar Piper en aplicaciones que no son Python.
- Inyección de fonemas en bruto. Envolver texto en `[[ ... ]]
permite pasar fonemas IPA (obtenidos conespeak-ng --ipa=3`) directamente, útil para corregir la pronunciación de nombres o términos técnicos. - Aceleración GPU opcional. Pasar
--cuda(CLI) ouse_cuda=True(Python) activa la aceleración CUDA mediante el paqueteonnxruntime-gpu, aunque Piper está diseñado para funcionar a una velocidad aceptable solo con CPU. - Voces multilingües entrenadas por la comunidad. Docenas de idiomas y variantes regionales están disponibles como modelos de voz descargables por separado desde Hugging Face; la calidad varía según la voz, ya que son entrenadas por distintos colaboradores de la comunidad.
Instalar y ejecutar Piper: paso a paso
Esta guía instala Piper mediante pip y realiza una primera síntesis, siguiendo la sintaxis documentada en la CLI y la API de Python del propio proyecto.
- 1Instalar Piper.
Why it matters: Ejecuta `pip install piper-tts` en un entorno Python (se recomienda Python 3.9+). Esto instala el paquete `piper` y su dependencia de ONNX Runtime; no se necesita configuración de GPU ni CUDA para uso solo con CPU. - 2Listar y descargar una voz.
Why it matters: Ejecuta `python3 -m piper.download_voices` sin argumentos para listar las voces disponibles, y luego `python3 -m piper.download_voices en_US-lessac-medium` para descargar una voz concreta al directorio actual. - 3Sintetizar voz desde la línea de comandos.
Why it matters: Ejecuta `python3 -m piper -m en_US-lessac-medium -f test.wav -- 'This is a test.'` para escribir un archivo WAV. Con `ffplay` instalado, omite `-f` para escuchar el audio de inmediato en lugar de guardarlo. - 4(Opcional) Usar la API de Python en lugar de la CLI.
Why it matters: Para uso repetido dentro de una aplicación, `from piper import PiperVoice; voice = PiperVoice.load("en_US-lessac-medium.onnx")` seguido de `voice.synthesize_wav(text, wav_file)` evita el coste de arranque de la CLI en cada llamada. - 5(Opcional) Activar la aceleración GPU.
Why it matters: Instala el paquete `onnxruntime-gpu`, y luego pasa `--cuda` en la CLI o `use_cuda=True` a `PiperVoice.load()` en Python. Es opcional — Piper está diseñado para funcionar en tiempo real solo con CPU. - 6(Opcional) Ejecutar el servidor web para uso repetido.
Why it matters: Para una configuración de producción o de uso repetido, ejecuta el modo servidor web HTTP de Piper para que el modelo de voz permanezca cargado en memoria en lugar de recargarse en cada llamada a la CLI. - 7(Opcional) Corregir una palabra mal pronunciada con fonemas en bruto.
Why it matters: Obtén los fonemas IPA de una palabra con `espeak-ng -v en-us --ipa=3 -q <palabra>`, y envuélvelos en `[[ ... ]]` dentro del texto de entrada para anular la pronunciación automática de Piper para esa palabra.
Ejemplos de uso reales
Más allá de la guía básica de instalación anterior, estos son patrones de uso reales comunes tomados de la propia documentación del proyecto.
- Inyección de fonemas en bruto para corregir pronunciación: envuelve texto como `The [[ bˈætmæn ]] not [[ bɹˈuːs wˈeɪn ]]
con fonemas IPA obtenidos conespeak-ng -v en-us --ipa=3 -q <palabra>`. - API C/C++ libpiper expone
piper_create()(opiper_create_with_options()para un control más fino) para integrar Piper directamente en una aplicación nativa sin entorno de ejecución Python.
# Línea de comandos: escribir un archivo WAV
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."
# Línea de comandos: reproducir audio de inmediato (requiere ffplay)
python3 -m piper -m en_US-lessac-medium -- "This will play on your speakers."
# API de Python
import wave
from piper import PiperVoice
voice = PiperVoice.load("en_US-lessac-medium.onnx")
with wave.open("test.wav", "wb") as wav_file:
voice.synthesize_wav("Welcome to the world of speech synthesis!", wav_file)
# API de Python: ajustar la síntesis (velocidad, volumen, expresividad)
from piper import SynthesisConfig
syn_config = SynthesisConfig(
volume=0.5, # la mitad de volumen
length_scale=2.0, # el doble de lento
noise_scale=1.0, # más variación de audio
noise_w_scale=1.0, # más variación al hablar
)
voice.synthesize_wav("Custom synthesis settings.", wav_file, syn_config=syn_config)
# API de Python: aceleración GPU (requiere onnxruntime-gpu)
voice = PiperVoice.load("en_US-lessac-medium.onnx", use_cuda=True)
# API de Python: síntesis en streaming
for chunk in voice.synthesize("Streamed audio, chunk by chunk."):
play_audio(chunk.audio_int16_bytes, chunk.sample_rate)Licencia y coste
**El repositorio de Piper activamente mantenido, OHF-Voice/piper1-gpl, tiene licencia GPL-3.0-or-later**, confirmado mediante los metadatos publicados del paquete piper-tts en PyPI. Es un cambio respecto al repositorio original rhasspy/piper, que tenía licencia MIT antes de archivarse el 6 de octubre de 2025 y que sigue disponible bajo esa licencia MIT, sin mantenimiento.
GPL-3.0 es una licencia copyleft, lo cual es una diferencia real frente a MIT para uso comercial. Puedes usar Piper de forma gratuita, incluso comercialmente, para generar voz. Pero GPL-3.0 exige que, si distribuyes una versión modificada del propio código fuente de Piper — por ejemplo, un fork integrado o enlazado estáticamente en tu producto — debes publicar ese código modificado bajo los mismos términos de GPL-3.0. Usar Piper sin modificar como herramienta externa (llamando a su CLI, su paquete Python o su servidor web como proceso separado) generalmente no coloca el resto del código de tu aplicación bajo GPL, pero el límite exacto depende de cuán estrechamente esté vinculado tu código con el de Piper. Este párrafo explica la forma general de la licencia; no es asesoría legal — consulta con un abogado para tu despliegue específico antes de lanzar un producto comercial construido sobre Piper.
No hay nivel de pago, suscripción ni tarifa de licencia para Piper en sí. Los únicos costes son el hardware en el que se ejecuta y tu propio tiempo de desarrollo. Los modelos de voz se descargan por separado desde un repositorio compartido de Hugging Face; revisa la licencia indicada para cada voz individual antes de redistribuirla, ya que las voces son aportadas por distintos miembros de la comunidad y no tienen garantizada la misma licencia que el código de Piper.
¿Qué licencia usa Piper?
El repositorio de Piper activamente mantenido (OHF-Voice/piper1-gpl) tiene licencia GPL-3.0-or-later. El repositorio original, ahora archivado, rhasspy/piper tenía licencia MIT. Esta es una diferencia real para uso comercial — GPL-3.0 exige liberar bajo la misma licencia las modificaciones del propio código fuente de Piper si se distribuyen, algo que MIT no exigía.
Para qué no sirve Piper
Piper es un motor de síntesis de voz local rápido y de propósito general, no una herramienta de clonación de voz ni de habla expresiva. Es la herramienta equivocada en las siguientes situaciones:
- Clonación de voz expresiva, emocional o a partir de pocos segundos. Piper sintetiza voz a partir de modelos de voz preentrenados, no a partir de un breve clip de audio de referencia de una persona concreta. Si necesitas clonar una voz a partir de pocos segundos de audio de muestra, o buscas una entonación más expresiva, XTTS v2 está diseñado para eso — consulta la guía de licencias de TTS local de PromptQuorum para conocer sus términos de licencia (no comercial).
- Clonación multi-hablante a partir de una muestra corta. De igual forma, Piper no tiene ningún mecanismo integrado para generar al vuelo una nueva voz a partir de una muestra de audio de un hablante específico; cada voz es un modelo entrenado y distribuido por separado.
- Obligaciones copyleft de GPL-3.0 en un producto de código cerrado. Si tu caso de uso implica modificar y redistribuir el propio código fuente de Piper dentro de un binario de código cerrado, la licencia GPL-3.0-or-later del repositorio actual es una restricción real que el repositorio original con licencia MIT no tenía. Revisa la sección Licencia y coste anterior y consulta con un abogado antes de ese tipo de despliegue.
- Calidad de voz garantizada y homogénea en todos los idiomas. Como las voces son entrenadas y aportadas por distintos miembros de la comunidad, la calidad varía notablemente según el idioma y la voz concreta — revisa muestras del idioma objetivo antes de comprometerte con Piper para una aplicación de producción.
- Certeza de mantenimiento a largo plazo. Al momento de esta publicación, el propio README del proyecto indica que la Open Home Foundation busca más mantenedores para Piper, algo a tener en cuenta antes de construir infraestructura crítica sobre él.
Alternativas a Piper
Coqui TTS
- Mejor para:
- Kit de herramientas multi-backend flexible (VITS, Tacotron2, XTTS) con amplio soporte de idiomas
- Licencia:
- MPL-2.0
XTTS v2
- Mejor para:
- Clonación de voz a partir de pocos segundos de audio de referencia, en 17 idiomas
- Licencia:
- CPML (no comercial)
StyleTTS 2
- Mejor para:
- Máxima calidad de narración natural en inglés (sin clonación de voz)
- Licencia:
- MIT
Bark
- Mejor para:
- Audio expresivo no verbal — risas, suspiros, sonido ambiental
- Licencia:
- MIT
ElevenLabs
- Mejor para:
- API en la nube gestionada para equipos que prefieren no autohospedar, con clonación de voz comercial
- Licencia:
- Propietaria (API en la nube de pago)
Preguntas frecuentes
¿Qué es Piper?
Piper es un motor de síntesis de voz neuronal local y gratuito, creado dentro del proyecto de asistente de voz Rhasspy por Michael Hansen, hoy mantenido por la Open Home Foundation, que convierte texto en audio hablado con suficiente rapidez para funcionar en tiempo real en hardware solo con CPU.
¿Es gratis Piper?
Sí. Piper no tiene nivel de pago, suscripción ni tarifa de licencia. Actualmente tiene licencia GPL-3.0-or-later, gratuita de usar pero que impone condiciones a la distribución de versiones modificadas del propio código fuente de Piper — ver la sección Licencia y coste para más detalles.
¿Necesito una GPU para ejecutar Piper?
No. Piper está diseñado para funcionar en tiempo real en hardware solo con CPU, incluida una Raspberry Pi. Hay aceleración GPU CUDA opcional disponible mediante el paquete onnxruntime-gpu para mayor rendimiento.
¿Cuál es la diferencia entre rhasspy/piper y OHF-Voice/piper1-gpl?
rhasspy/piper es el repositorio original, creado dentro del proyecto Rhasspy y con licencia MIT; se archivó (solo lectura) el 6 de octubre de 2025. OHF-Voice/piper1-gpl es el repositorio sucesor activamente mantenido, creado el 28 de marzo de 2025 bajo la Open Home Foundation, y con licencia GPL-3.0-or-later en lugar de MIT.
¿Puede Piper clonar la voz de una persona concreta?
No a partir de una muestra corta de audio. Piper sintetiza voz usando modelos de voz preentrenados que descargas y seleccionas; no clona una nueva voz al vuelo a partir de pocos segundos de audio de referencia. Para eso está XTTS v2, diseñado específicamente para clonación de voz en pocos segundos.
¿Se usa Piper en Home Assistant?
Sí. Piper es el motor de síntesis de voz local por defecto en el flujo de asistente de voz de Home Assistant, mantenido por la Open Home Foundation, la misma organización sin fines de lucro que gestiona Home Assistant.
¿Quién mantiene Piper hoy?
Piper se mantiene bajo la Open Home Foundation en el repositorio OHF-Voice/piper1-gpl, tras trasladarse allí el desarrollo desde el repositorio original alojado en Rhasspy en 2025. El README del proyecto indica que la Open Home Foundation busca actualmente más mantenedores.
¿Cuál es la última versión de Piper?
La última versión estable es la v1.8.0, publicada el 4 de septiembre de 2026, según la página de releases de GitHub del proyecto.
Veredicto
Piper sigue siendo una de las formas más rápidas de conseguir síntesis de voz local real en hardware modesto — su rendimiento en tiempo real solo con CPU es lo que lo convirtió en la voz por defecto de Home Assistant, y eso no ha cambiado bajo sus nuevos mantenedores. Lo que sí ha cambiado, y lo que cualquiera que evalúe Piper en 2026 debe saber, es la licencia: el repositorio activamente mantenido pasó de MIT a GPL-3.0-or-later cuando el desarrollo se trasladó a la Open Home Foundation en 2025, una diferencia real para quien planee integrar y redistribuir código fuente modificado de Piper en un producto de código cerrado. Sigue siendo gratuito, bien documentado y con lanzamientos activos (v1.8.0 a fecha de septiembre de 2026), aunque sus propios mantenedores buscan abiertamente más ayuda. Para síntesis de voz rápida, offline y de propósito general en hardware de clase CPU, Piper es una opción bien verificada y sin coste — para clonación de voz expresiva en pocos segundos, combina este análisis con la cobertura de XTTS v2 de PromptQuorum o compáralo con la alternativa en la nube gestionada en la comparativa ElevenLabs vs TTS local.
Fuentes
- OHF-Voice/piper1-gpl en GitHub — el repositorio activamente mantenido: README, documentación, licencia e historial de versiones.
- piper-tts en PyPI — metadatos publicados del paquete, incluida la licencia GPL-3.0-or-later actual.
- rhasspy/piper en GitHub — el repositorio original, ahora archivado (licencia MIT).
- Releases de piper1-gpl — historial de versiones, incluida la v1.8.0 (4 de septiembre de 2026).
- Open Home Foundation — la organización sin fines de lucro que mantiene Piper y Home Assistant.
