Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Mejor motor TTS local para Raspberry Pi (2026)
Voice, Speech & Multimodal

Mejor motor TTS local para Raspberry Pi (2026)

·13 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Piper es el mejor motor de texto a voz local para una Raspberry Pi. Es un motor TTS neuronal basado en ONNX Runtime, creado dentro del proyecto Rhasspy por Michael Hansen específicamente para hardware embebido con recursos limitados; no necesita GPU y, por esa misma razón, sigue siendo la voz local por defecto de Home Assistant. Instálalo con pip install piper-tts. Para mayor calidad de voz a un coste real en recursos, consulta las secciones Kokoro y Coqui TTS/XTTS v2 más abajo — ambas más pesadas y menos probadas en CPUs de clase Pi.

Elegir un motor de texto a voz (TTS) local para una Raspberry Pi significa elegir para una placa ARM con CPU únicamente y memoria limitada, no para una GPU de escritorio. Piper es la recomendación por defecto clara para esta categoría exacta de hardware: se creó dentro del proyecto de asistente de voz sin conexión Rhasspy específicamente para funcionar en tiempo real en dispositivos como una Raspberry Pi, y sigue siendo hoy el motor TTS local por defecto en el flujo de voz de Home Assistant. Esta guía compara Piper con las alternativas realistas — Kokoro, el kit de herramientas Coqui TTS y XTTS v2, y el sintetizador más antiguo espeak-ng — evaluados específicamente por su adecuación a la Raspberry Pi: huella de RAM, viabilidad solo con CPU, complejidad de instalación y compromiso de calidad de voz.

Mejor motor TTS local para Raspberry Pi (2026)

Conclusiones clave

  • Piper: diseñado específicamente para hardware embebido solo con CPU, sin GPU, en tiempo real en una Raspberry Pi 4.
  • Kokoro (82M de parámetros, Apache-2.0): calidad de voz más natural, sin benchmark en tiempo real documentado en Pi — más realista en una Pi 5 que en una Pi 4.
  • Coqui TTS / XTTS v2: añade clonación de voz, asume aceleración por GPU, no encaja bien en un Pi solo con CPU.
  • espeak-ng: la opción más ligera, suena mecánica — un recurso de última opción, no primera elección.
  • Pi 5 (Cortex-A76, 2,4GHz) notablemente más rápida que la Pi 4 (Cortex-A72, hasta 1,8GHz) en cualquiera de estas opciones.
  • Instalación de Piper en un comando: pip install piper-tts, luego descargar un modelo de voz.

📍 En una frase

Piper es el mejor motor TTS local para una Raspberry Pi porque se creó dentro del proyecto de asistente de voz sin conexión Rhasspy específicamente para hardware embebido solo con CPU, no necesita GPU, y por eso sigue siendo la voz local por defecto de Home Assistant; Kokoro suena más natural pero no tiene benchmark en tiempo real documentado en Pi, y Coqui TTS/XTTS v2 asumen aceleración por GPU.

💬 En términos simples

Si quieres que tu Raspberry Pi hable en voz alta sin conexión a internet, Piper es la herramienta hecha exactamente para eso — lo instalas, descargas una voz, y habla en tiempo real en una placa desde unos 35 dólares. Las opciones más sofisticadas (Kokoro, XTTS v2) suenan mejor pero no se diseñaron pensando en la CPU limitada de una Raspberry Pi.

📌Nota: Esta guía cubre la velocidad de síntesis solo con CPU y la adecuación a la Raspberry Pi, no la clonación de voz. Para clonación de voz específicamente, consulta la reseña dedicada de PromptQuorum sobre XTTS v2, que explícitamente no se recomienda para CPUs de clase Pi.

¿Qué hace que un motor TTS sea apto para una Raspberry Pi?

Un motor TTS apto para Raspberry Pi debe funcionar sin GPU, caber con su modelo y entorno de ejecución en unos pocos cientos de megabytes de RAM, y generar audio más rápido que en tiempo real en una CPU ARM de cuatro núcleos. Una Raspberry Pi no tiene una GPU dedicada que valga la pena usar para inferencia TTS — cada motor aquí se ejecuta en la CPU, así que el factor decisivo es cuán eficientemente se construyó cada uno para esa limitación, no la calidad bruta del modelo por sí sola.

  • Sin dependencia de GPU. Una Raspberry Pi no tiene una GPU compatible con CUDA; un motor que asume aceleración por GPU para una velocidad aceptable queda descalificado para uso en tiempo real, incluso si técnicamente funciona en CPU como respaldo.
  • Huella de RAM. Una Raspberry Pi 4 llega hasta 8 GB de RAM total, compartida con el sistema operativo y cualquier otro servicio en ejecución (Home Assistant, un detector de palabra de activación); un motor TTS que necesita varios gigabytes solo para cargar deja poco margen para lo demás.
  • Complejidad de instalación. Un simple pip install con ruedas ARM precompiladas es muy distinto de un kit de herramientas que espera una cadena de dependencias orientada a GPU (CUDA, cuDNN) que no aplica en una Pi.
  • Compromiso de calidad de voz. Cada motor de esta lista intercambia algo de calidad por velocidad; la cuestión es qué compromiso encaja con tu caso de uso — un anuncio de altavoz inteligente tiene necesidades de calidad distintas a un proyecto de clonación de voz.

Piper vs Kokoro vs Coqui TTS/XTTS v2 vs espeak-ng en adecuación a Raspberry Pi

Piper obtiene la mejor puntuación en todos los criterios específicos de Pi excepto la calidad de voz bruta, donde lideran Kokoro y XTTS v2. La tabla siguiente puntúa cada motor según los cuatro criterios que realmente importan para un despliegue en Raspberry Pi, no según benchmarks TTS generales realizados en hardware de escritorio o servidor.

Motor
Huella de RAM
Viabilidad solo CPU
Complejidad instalación
Calidad de voz
PiperBaja (archivos de modelo normalmente muy por debajo de 100 MB por voz)Diseñado para ello; tiempo real ampliamente reportado en Pi 4Un comando: pip install piper-ttsBuena, voces neuronales bastante naturales; sin clonación
KokoroModerada (modelo de 82M de parámetros, ~327 MB de pesos)Funciona en CPU; sin benchmark en tiempo real documentado en PiPaquete de Python + descarga de modelo; más dependencias que PiperSuperior — cerca de la cima de los rankings independientes de calidad TTS
Coqui TTS / XTTS v2Alta; se asume VRAM de GPU para las cifras de latencia documentadasBaja; la propia reseña de XTTS v2 de PromptQuorum señala el uso en Pi solo con CPU como poco prácticoInstalación del kit más aceptación de licencia (CPML para XTTS v2)La más alta — incluye clonación de voz en 6 segundos en 17 idiomas
espeak-ngMínima (unos pocos megabytes)Trivial; funciona en casi cualquier hardware, incluidos microcontroladoresDisponible directamente en la mayoría de gestores de paquetes de LinuxSonido mecánico de síntesis por formantes — no es habla natural

Por qué Piper es la recomendación por defecto para una Raspberry Pi

Piper es la recomendación por defecto porque se diseñó para exactamente esta categoría de hardware, no se adaptó a ella después. Se originó dentro de Rhasspy, un kit de herramientas de código abierto para construir asistentes de voz completamente sin conexión — un proyecto cuya premisa completa es ejecutar reconocimiento y síntesis de voz en hardware local, a menudo modesto, incluidas placas Raspberry Pi, sin ida y vuelta a una API en la nube.

  • Diseñado para dispositivos embebidos y con recursos limitados. Piper usa una arquitectura neuronal tipo VITS, exportada a ONNX Runtime para inferencia rápida en CPU — una decisión deliberada para hardware sin GPU de respaldo.
  • Sigue siendo la opción por defecto en Home Assistant. Piper es el motor de texto a voz local por defecto en el flujo de voz de Home Assistant, mantenido por la Open Home Foundation, la misma organización sin fines de lucro que gestiona Home Assistant — y una gran parte de las instalaciones de Home Assistant funcionan en una Raspberry Pi.
  • Nunca requiere GPU. Existe aceleración GPU CUDA opcional para mayor rendimiento en hardware de escritorio, pero no es necesaria — Piper está diseñado para funcionar en tiempo real solo con CPU.
  • Sin clonación de voz — en su lugar, un catálogo de voces fijo. Piper incluye docenas de voces preentrenadas en más de 20 idiomas en lugar de clonar una voz a partir de una muestra; eso es un compromiso real frente a XTTS v2, pero también es lo que mantiene la huella de recursos de Piper lo suficientemente pequeña para una Raspberry Pi.

Kokoro: mayor calidad, mayor coste

Kokoro es un modelo TTS de 82 millones de parámetros, con licencia Apache-2.0, derivado de StyleTTS2, que produce una voz notablemente más natural que Piper, a un coste real en recursos no documentado específicamente para hardware Raspberry Pi. A diferencia de Piper, Kokoro no se construyó con los dispositivos ARM embebidos como objetivo principal — se construyó para ser pequeño y rápido en relación con modelos TTS más grandes en hardware de propósito general, un objetivo de diseño distinto al rendimiento en tiempo real específicamente en la CPU de una Raspberry Pi.

  • 82M de parámetros, ~327 MB de pesos. Eso es pequeño comparado con un gran modelo de clonación de voz, pero aún notablemente más pesado que una sola voz de Piper, que normalmente se sitúa muy por debajo de 100 MB.
  • Licencia Apache-2.0. Permisiva y compatible con uso comercial — sin restricción no comercial de tipo CPML, a diferencia de XTTS v2.
  • Sin benchmark en tiempo real documentado en Raspberry Pi. PromptQuorum no encontró un benchmark publicado y con fuente que muestre a Kokoro funcionando en tiempo real específicamente en hardware Raspberry Pi 4 o 5. Trata cualquier afirmación de tiempo real para Kokoro en una Pi como no verificada hasta que la pruebes tú mismo.
  • Una Raspberry Pi 5 es el objetivo más realista. Su CPU Cortex-A76 a 2,4GHz ofrece notablemente más capacidad de cómputo que el Cortex-A72 de una Raspberry Pi 4, lo cual importa más para un modelo más pesado como Kokoro que para el más ligero Piper.

Coqui TTS y XTTS v2: cuándo importa la clonación de voz

Coqui TTS y su modelo XTTS v2 añaden clonación de voz a partir de tan solo 6 segundos de audio de referencia, pero ambos asumen aceleración por GPU y no encajan de forma realista en hardware Raspberry Pi solo con CPU. Si tu proyecto realmente necesita clonar una voz específica en lugar de usar una preentrenada, esta es la única opción de esta lista que lo hace — pero planea ejecutarla en otro lugar y transmitir el audio a la Pi, no ejecutarla en la propia Pi.

  • XTTS v2 clona una voz a partir de 6 segundos de audio en 17 idiomas, según su ficha de modelo oficial en Hugging Face — consulta la reseña completa de XTTS v2 de PromptQuorum para comandos de instalación y detalles de licencia.
  • Se recomienda encarecidamente una GPU, y el uso solo con CPU no es práctico para aplicaciones en tiempo real, según la propia reseña de XTTS v2 de PromptQuorum — una Raspberry Pi no tiene GPU dedicada, por lo que la inferencia de XTTS v2 en tiempo real en el dispositivo no es realista.
  • La licencia de XTTS v2, la Coqui Public Model License (CPML), es no comercial — una consideración separada de la adecuación al hardware. Consulta la guía de licencias TTS locales para la comparación completa.
  • Un patrón común para proyectos en Pi que necesitan voces clonadas: ejecutar XTTS v2 en un servidor o equipo de escritorio separado, siempre encendido y con GPU, generar allí el audio, y enviar el archivo de audio o la transmisión resultante a la Raspberry Pi para su reproducción — en lugar de ejecutar la inferencia en la propia Pi.

espeak-ng: el recurso ligero

espeak-ng es un motor TTS de síntesis por formantes que funciona en casi cualquier hardware, incluidos microcontroladores, pero suena mecánico en lugar de natural. Precede en más de una década a los motores TTS neuronales de esta lista y no es un competidor real en calidad de voz — se incluye porque representa el suelo: la opción con prácticamente ningún requisito de recursos.

  • Funciona en prácticamente cualquier cosa. espeak-ng solo necesita unos pocos megabytes de memoria y ningún entorno de ejecución de redes neuronales, lo que lo hace viable incluso en hardware muy por debajo de las especificaciones de una Raspberry Pi.
  • Suena robótico. Su enfoque de síntesis por formantes — generar habla a partir de reglas acústicas en lugar de un modelo neuronal entrenado — produce habla inteligible pero claramente sintética, una mala opción para un asistente de voz o un sistema de anuncios que debe sonar natural.
  • Sigue siendo útil como fonemizador. El propio Piper usa espeak-ng internamente para la conversión de texto a fonemas, aunque la salida de audio de Piper proviene de su propio modelo neuronal, no directamente de espeak-ng.
  • Elígelo solo cuando la RAM o la CPU estén tan limitadas que ni siquiera Piper sea viable — por ejemplo, un dispositivo de clase microcontrolador en lugar de una Raspberry Pi.

Cómo instalar Piper en una Raspberry Pi

Instalar Piper en una Raspberry Pi consiste en un único pip install seguido de descargar un modelo de voz — sin controladores de GPU, sin CUDA, sin paso de compilación. Estos son los mismos comandos documentados en la reseña dedicada de Piper TTS de PromptQuorum, aplicados aquí específicamente a una Raspberry Pi con Raspberry Pi OS (u otra distribución Linux ARM basada en Debian).

  1. 1
    Actualizar el sistema e instalar Python 3
    Why it matters: Raspberry Pi OS viene con Python 3 preinstalado en imágenes recientes, pero ejecuta primero `sudo apt update && sudo apt upgrade` para asegurarte de que pip y los paquetes del sistema estén actualizados antes de instalar algo nuevo.
  2. 2
    Instalar Piper con pip
    Why it matters: Ejecuta `pip install piper-tts` (o `pip3 install piper-tts` según tu imagen). Esto instala el paquete `piper` junto con su dependencia de ONNX Runtime — las ruedas ARM precompiladas significan que no hay paso de compilación en una Raspberry Pi.
  3. 3
    Descargar un modelo de voz
    Why it matters: Ejecuta `piper --download-dir voices --update-voices --voice en_US-lessac-medium` (sustituye por cualquier voz del catálogo de voces de Piper en Hugging Face). Una voz de calidad media es la opción por defecto correcta para una Raspberry Pi — es más rápida que una voz de alta calidad, con una diferencia en la salida que es insignificante a través de un altavoz típico.
  4. 4
    Generar voz a partir de texto
    Why it matters: Envía texto a Piper desde la línea de comandos, por ejemplo `echo "Hola desde la Raspberry Pi." | piper --model voices/en_US-lessac-medium.onnx --output_file output.wav`, y luego reproduce el archivo WAV resultante con `aplay output.wav`.
  5. 5
    Integrarlo en un proyecto
    Why it matters: Para una cadena completa de asistente de voz (palabra de activación, reconocimiento de voz, un LLM y Piper para la respuesta), consulta la [guía paso a paso de PromptQuorum para construir un asistente de voz sin conexión](/es/power-local-llm/build-local-voice-assistant-2026); para Home Assistant en concreto, Piper ya es el motor TTS por defecto en los ajustes del flujo de voz.

Raspberry Pi 4 vs Raspberry Pi 5 para texto a voz

Una Raspberry Pi 5 tiene una CPU notablemente más rápida que una Raspberry Pi 4, lo cual importa más para motores más pesados como Kokoro que para el ya ligero Piper. Ambas placas ejecutan Piper en tiempo real, pero la brecha de CPU amplía el conjunto de opciones realistas en cuanto se considera algo más pesado.

  • Raspberry Pi 4: una CPU Arm Cortex-A72 de cuatro núcleos hasta 1,8GHz, con configuraciones de RAM de hasta 8 GB. Suficiente para síntesis de Piper en tiempo real; no un objetivo realista para Kokoro o XTTS v2 en tiempo real.
  • Raspberry Pi 5: una CPU Arm Cortex-A76 de cuatro núcleos (BCM2712) a 2,4GHz, con configuraciones de RAM de hasta 16 GB — un aumento documentado de 2 a 3 veces el rendimiento de CPU respecto a la Raspberry Pi 4. Esta es la placa a usar si quieres experimentar con Kokoro en lugar de Piper.
  • Ninguna de las dos placas cambia el panorama de la aceleración por GPU. A ambas les falta una GPU dedicada compatible con CUDA, por lo que Coqui TTS y XTTS v2 siguen siendo poco prácticos para inferencia en tiempo real en el dispositivo en ambas generaciones.
  • La RAM importa más allá del propio motor TTS. Si la misma placa también ejecuta Home Assistant, un detector de palabra de activación o un LLM local para una cadena completa de asistente de voz, los motores ligeros (Piper, luego espeak-ng) dejan más margen para esos otros procesos que Kokoro o Coqui TTS.

Preguntas frecuentes

¿Cuál es el mejor motor TTS local para una Raspberry Pi?

Piper es el mejor motor TTS local para una Raspberry Pi en la mayoría de los casos de uso. Se creó dentro del proyecto de asistente de voz sin conexión Rhasspy específicamente para hardware embebido solo con CPU, no necesita GPU, y por eso sigue siendo el motor TTS local por defecto de Home Assistant. Se reporta ampliamente que funciona en tiempo real en una Raspberry Pi 4.

¿Necesita Piper una GPU para funcionar en una Raspberry Pi?

No. Piper está diseñado para funcionar en tiempo real solo con CPU, incluida una Raspberry Pi. Existe aceleración GPU CUDA opcional para mayor rendimiento en hardware de escritorio, pero no es necesaria, y una Raspberry Pi de todos modos no tiene una GPU dedicada para usarla.

¿Puede Kokoro funcionar en tiempo real en una Raspberry Pi?

PromptQuorum no encontró un benchmark en tiempo real documentado y con fuente específicamente para Kokoro en hardware Raspberry Pi. Kokoro es un modelo de 82 millones de parámetros que funciona en CPU de forma general, pero no se diseñó específicamente para dispositivos ARM embebidos como Piper. Es más realista probarlo en una Raspberry Pi 5, con su CPU Cortex-A76 más rápida, que en una Raspberry Pi 4 — mídelo tú mismo antes de confiar en él para un caso de uso interactivo en vivo.

¿Por qué no usar XTTS v2 para clonación de voz en una Raspberry Pi?

XTTS v2 asume aceleración por GPU para su rendimiento de baja latencia documentado, y la propia reseña de XTTS v2 de PromptQuorum indica que el uso solo con CPU no es práctico para aplicaciones en tiempo real. Una Raspberry Pi no tiene GPU dedicada, por lo que la inferencia de XTTS v2 en tiempo real en el dispositivo no es realista. Un enfoque común es ejecutar XTTS v2 en un servidor separado con GPU y transmitir el audio resultante a la Raspberry Pi.

¿Es Piper gratuito para uso comercial?

El repositorio de Piper activamente mantenido, OHF-Voice/piper1-gpl, tiene licencia GPL-3.0-or-later, un cambio respecto a la licencia MIT del repositorio original, ahora archivado, rhasspy/piper. La GPL-3.0 permite el uso comercial de Piper como herramienta, pero exige publicar bajo la misma licencia cualquier modificación al propio código fuente de Piper si se distribuye. Consulta la reseña completa de Piper TTS de PromptQuorum para el historial completo de licencia — esto no es asesoría legal.

¿Cuál es la diferencia entre una Raspberry Pi 4 y una Raspberry Pi 5 para texto a voz?

Una Raspberry Pi 5 usa una CPU Arm Cortex-A76 de cuatro núcleos (BCM2712) a 2,4GHz con configuraciones de RAM de hasta 16 GB, un aumento documentado de 2 a 3 veces el rendimiento de CPU respecto al Cortex-A72 de cuatro núcleos de la Raspberry Pi 4, hasta 1,8GHz, con RAM de hasta 8 GB. Ambas ejecutan Piper en tiempo real; el margen adicional de la Pi 5 importa más si quieres experimentar con un motor más pesado como Kokoro.

¿Piper admite otros idiomas además del inglés?

Sí. Piper incluye voces preentrenadas en más de 20 idiomas, aunque no clona la voz de una persona específica — usa voces fijas y preentrenadas por idioma, en lugar de clonar a partir de una muestra como hace XTTS v2.

¿Qué es espeak-ng y cuándo debería usarlo en lugar de Piper?

espeak-ng es un motor TTS de síntesis por formantes que funciona en casi cualquier hardware, incluidos dispositivos por debajo de las especificaciones de una Raspberry Pi, pero suena mecánico en lugar de natural. Úsalo solo cuando la RAM o la CPU estén tan limitadas que ni siquiera Piper sea viable — para la mayoría de proyectos con Raspberry Pi, Piper es la mejor opción por defecto. El propio Piper usa espeak-ng internamente para la conversión de texto a fonemas.

¿Cuánta RAM necesita Piper en una Raspberry Pi?

Los archivos de modelo de Piper por voz suelen estar muy por debajo de 100 MB, y el motor no requiere varios gigabytes de RAM para funcionar, lo cual es una ventaja real en una Raspberry Pi 4 con tan solo 2 GB de RAM total, compartida con el sistema operativo y cualquier otro servicio en ejecución.

Veredicto

Piper es la elección por defecto correcta para texto a voz local en una Raspberry Pi, y no es una decisión reñida: se diseñó dentro del proyecto de asistente de voz sin conexión Rhasspy específicamente para hardware embebido solo con CPU, no necesita GPU, se instala con un comando, y por esas mismas razones sigue siendo la voz local por defecto de Home Assistant. Usa Kokoro en su lugar si la calidad de voz importa más que una respuesta garantizada en tiempo real, y solo después de probarlo tú mismo en tu modelo específico de Raspberry Pi — su rendimiento en tiempo real documentado es en hardware general, no específicamente en placas ARM de clase Pi. Usa Coqui TTS o XTTS v2 solo si realmente necesitas clonación de voz, y planea ejecutar la inferencia en una máquina separada con GPU en lugar de en la propia Pi. Recurre a espeak-ng solo como último recurso, en hardware demasiado limitado incluso para Piper. En caso de duda, empieza con Piper — es la herramienta para la que se construyó esta categoría de hardware.

Fuentes

← Volver a LLM locales avanzados