Conclusiones clave
- Kokoro-82M: Apache-2.0, 82M parámetros, corre vía el framework MLX de Apple mediante el proyecto comunitario mlx-audio — la ruta real de aceleración en Apple Silicon.
- Piper: GPL-3.0-or-later, solo-CPU por diseño vía ONNX Runtime — mismo perfil de rendimiento en Mac Intel y Apple Silicon.
- XTTS v2: licencia CPML no comercial, clonación de voz a partir de ~6 segundos de audio, pero el soporte Metal (MPS) es un issue de GitHub rastreado y sin resolver — corre solo con CPU en Mac.
- Bark: licencia MIT, soporte Apple Silicon MPS experimental detrás de una variable de entorno, sin commits en su repositorio público desde abril de 2024.
- Los Mac Intel no pueden usar en absoluto la ruta Kokoro acelerada por MLX — MLX requiere Apple Silicon.
📍 En una frase
Para texto a voz local en Apple Silicon, Kokoro-82M es el único de los cuatro motores locales principales con una ruta real de GPU Metal (vía el proyecto comunitario mlx-audio sobre el framework MLX de Apple); Piper es la opción solo-CPU más simple, con el mismo comportamiento en Mac Intel; XTTS v2 ofrece clonación de voz pero su soporte MPS en Apple Silicon es un issue de GitHub documentado y roto; y el soporte MPS de Bark es explícitamente experimental.
💬 En términos simples
No todo programa gratuito de texto a voz que puedes correr en un Mac usa realmente el chip gráfico del Mac — algunos simplemente corren en el procesador normal, lo cual funciona bien pero es más lento de lo que podría ser. Kokoro es el que está construido para aprovechar el propio diseño de chip de Apple a través de un proyecto llamado MLX; los otros o bien evitan la GPU por diseño (Piper) o intentan usarla pero chocan con problemas sin resolver (XTTS v2, Bark).
📌Nota: Esta guía compara los cuatro motores TTS locales que PromptQuorum ha revisado de forma independiente (Piper, Kokoro, XTTS v2, Bark). Cada uno tiene su propia reseña dedicada, enlazada a lo largo del artículo, con comandos de instalación, detalles de licencia y limitaciones completas.
¿Qué motor TTS local deberías instalar realmente?
El motor correcto depende de si necesitas aceleración por GPU, clonación de voz, o la mayor compatibilidad posible con Mac — ningún motor gana en los tres frentes. Kokoro es el único aquí con una ruta real de GPU Apple Silicon; Piper es el más portable; XTTS v2 es el único que clona voces.
- 🏆 Mejor opción general para Apple Silicon: Kokoro-82M vía mlx-audio — el único motor aquí con una ruta real de GPU Metal, lo bastante pequeño (82M parámetros) para correr cómodamente en cualquier Mac Apple Silicon.
- Mejor opción para simplicidad y compatibilidad con Intel: Piper — solo-CPU por diseño, así que la instalación y el rendimiento son idénticos tanto en un chip serie M como en un Mac Intel antiguo.
- Mejor opción si necesitas clonación de voz: XTTS v2 — clona una voz a partir de ~6 segundos de audio de referencia, pero corre solo con CPU en cualquier Mac y su licencia es exclusivamente para uso no comercial.
- Mejor opción para audio expresivo no verbal: Bark — risas, suspiros y música simple a partir de texto, con soporte de GPU Apple Silicon experimental (parcial), aunque su repositorio está inactivo desde abril de 2024.
¿Quién debería usar cada motor?
Elige el motor según tu Mac y tu necesidad real, no según cuál tenga más estrellas en GitHub. La aceleración por GPU solo importa si generas suficiente audio, con suficiente frecuencia, como para que la síntesis solo-CPU se sienta lenta.
- 🧭 Mac Apple Silicon, quieres la opción local más rápida: Kokoro vía mlx-audio — el único motor aquí escrito para usar Metal a través de MLX.
- 🧭 Cualquier Mac, incluido un modelo Intel antiguo: Piper — solo-CPU por diseño, así que no hay nada específico de Apple Silicon que configurar o solucionar.
- 🧭 Necesitas clonar una voz específica a partir de una grabación corta: XTTS v2 — acepta que correrá solo con CPU en un Mac, y que su licencia es no comercial.
- 🧭 Quieres risas, suspiros o sonido ambiente, no solo voz: Bark — pero presupuesta tiempo extra de instalación por su ruta experimental en Apple Silicon, y confirma primero su estado de mantenimiento actual.
- ❌ Evita Bark si necesitas mantenimiento activo o rendimiento garantizado — su repositorio público no muestra commits desde abril de 2024, independientemente del tema Apple Silicon.
- ❌ Evita XTTS v2 si estás construyendo un producto comercial — su licencia Coqui Public Model License (CPML) es no comercial, y Coqui AI, la empresa que lo lanzó, cerró sus servicios de pago en diciembre de 2023.
¿Cómo se comparan Piper, Kokoro, XTTS v2 y Bark en idoneidad para Apple Silicon?
Kokoro es el único motor de esta comparativa con una ruta real y construida específicamente para la GPU de Apple Silicon; el resto son solo-CPU por diseño o por un bug sin resolver. La tabla siguiente puntúa cada motor en los cuatro factores que realmente determinan la idoneidad en Mac: si usa aceleración Apple Silicon, cuánta memoria necesita, cuánta fricción tiene la instalación en macOS, y la calidad de voz.
Motor | Aceleración Apple Silicon | Uso de RAM | Instalación macOS | Calidad de voz |
|---|---|---|---|---|
| Kokoro-82M | Sí — Metal vía MLX (mlx-audio) | Bajo (82M param., existen variantes cuantiz.) | pip install + mlx-audio, solo Apple Silicon | Natural, cercana a modelos cloud grandes |
| Piper | Ninguna (diseño) — CPU, ONNX Runtime | Muy bajo (~50–100MB por voz) | pip install piper-tts, sin config de GPU | Clara, prosodia algo robótica |
| XTTS v2 | Ninguna — MPS se cuelga (issue GH #3649) | Moderado-alto (modelo de clonación completo) | pip install coqui-tts, solo CPU en Mac | Alta, clona una voz específica |
| Bark | Experimental — SUNO_ENABLE_MPS=True | Alto (flag small-models para reducir) | pip install desde GitHub, sin paquete PyPI | Expresiva, no determinista |
Las valoraciones de calidad de voz son descripciones cualitativas basadas en la arquitectura documentada de cada motor y en las reseñas dedicadas de PromptQuorum (enlazadas en cada fila), no una prueba de escucha a ciegas realizada por PromptQuorum — no se afirma aquí ningún puntaje MOS (Mean Opinion Score) numérico ni cifra de benchmark.
¿Qué motores usan realmente la GPU en un Mac?
Solo Kokoro tiene una ruta real, construida específicamente, hacia la GPU Metal de Apple Silicon; Piper evita la GPU por completo por diseño, y tanto XTTS v2 como Bark tienen soporte de GPU sin resolver o parcial en Mac. Este es el factor individual más importante que separa a estos motores en Apple Silicon, y es fácil asumir que "funciona en un Mac" significa "usa la GPU del Mac" — normalmente no es así.
- Kokoro-82M corre a través del framework MLX propio de Apple mediante el proyecto comunitario mlx-audio, que requiere Apple Silicon y Python 3.10–3.12. MLX es el framework de machine learning open source de Apple, construido desde cero para Metal sobre la arquitectura de memoria unificada de Apple Silicon — el mismo framework que cubre la guía de LLM local para Apple Silicon y la comparativa MLX vs. Ollama vs. llama.cpp para modelos de lenguaje. Los pesos oficiales de Kokoro-82M, publicados por hexgrad en Hugging Face, son nativamente un modelo PyTorch; la ruta MLX es un port comunitario, no una publicación oficial de Apple o hexgrad, y mlx-audio también ofrece variantes cuantizadas (bf16, 8-bit, 4-bit) para menor uso de memoria.
- Piper nunca toca la GPU en ninguna plataforma, Apple Silicon incluido — esto es por diseño, no una limitación. Piper convierte texto a fonemas con espeak-ng, y luego sintetiza audio con un modelo exportado a ONNX Runtime para inferencia rápida en CPU. Esa decisión de diseño es exactamente por qué Piper corre en tiempo real incluso en una Raspberry Pi — ver la reseña de Piper TTS de PromptQuorum para la arquitectura completa y los pasos de instalación.
- El soporte de Metal (MPS) de XTTS v2 en Apple Silicon actualmente no funciona. Un issue rastreado en el repositorio de GitHub coqui-ai/TTS, titulado "Unable to use xtts_v2 with mps device on Apple Silicon", documenta que intentar correr XTTS v2 en el dispositivo MPS se cuelga en lugar de completarse. El propio proyecto de Coqui no lista el soporte de GPU en Apple Silicon como oficialmente soportado. En la práctica, esto significa que XTTS v2 corre solo con CPU en un Mac, a través del mismo toolkit Coqui TTS (con licencia MPL-2.0) que lo ejecuta en otras plataformas.
- Bark tiene soporte experimental de Apple Silicon MPS, protegido detrás de una variable de entorno. Establecer
SUNO_ENABLE_MPS=Trueactiva la aceleración Metal, según la discusión en el repositorio de GitHub suno-ai/bark, pero algunos operadores de PyTorch de los que depende Bark no estaban implementados para MPS al momento de escribir esto, causando un fallback parcial a CPU para esos pasos. Bark también soporta un flagSUNO_USE_SMALL_MODELS=Trueespecíficamente para reducir la presión de memoria en Mac con menos memoria unificada.
¿Cómo instalar Kokoro con aceleración MLX en un Mac?
Esta guía instala el proyecto comunitario mlx-audio para correr Kokoro-82M a través del framework MLX de Apple, siguiendo la configuración documentada en el repositorio de GitHub mlx-audio.
- 1Confirma que estás en Apple Silicon con una versión de Python compatible.
Why it matters: mlx-audio requiere un Mac Apple Silicon (chip serie M) y Python 3.10–3.12; MLX no corre en absoluto en Mac Intel, así que esta ruta es exclusiva de Apple Silicon. - 2Instala mlx-audio.
Why it matters: Ejecuta `pip install mlx-audio` en un entorno virtual de Python. Esto trae MLX en sí (versión 0.31 o posterior) junto con el pipeline de audio. - 3Ejecuta una primera síntesis desde la línea de comandos.
Why it matters: El paquete incluye un punto de entrada CLI que descarga los pesos de Kokoro-82M en el primer uso y sintetiza un archivo WAV a partir de una cadena de texto — revisa el README actual del proyecto para el comando exacto, ya que las opciones de la CLI pueden cambiar entre versiones. - 4Elige una voz y, opcionalmente, una variante de modelo cuantizada.
Why it matters: Kokoro-82M incluye 54 presets de voz en varios idiomas. mlx-audio también ofrece variantes cuantizadas bf16, 8-bit y 4-bit — una precisión menor intercambia algo de calidad por un menor uso de memoria, útil en un Mac con menos memoria unificada. - 5Intégralo en tu propia aplicación Python.
Why it matters: Para cualquier uso más allá de la síntesis puntual por CLI, llama directamente a la API de Python de mlx-audio en lugar de invocar la CLI repetidamente, evitando el costo de recargar el modelo en cada llamada.
¿Qué cambia en un Mac Intel?
En un Mac Intel, la ruta Kokoro acelerada por MLX no está disponible en absoluto — MLX requiere Apple Silicon y no corre en hardware Intel. Todos los demás motores cubiertos aquí siguen funcionando en Intel, porque ninguno depende del Neural Engine de Apple ni de aceleración de GPU específica de Apple Silicon para funcionar; simplemente corren en CPU.
- Piper no se ve afectado por la distinción Intel/Apple Silicon. Es solo-CPU por diseño en toda plataforma, así que un Mac Intel rinde de forma comparable a un Mac Apple Silicon específicamente para Piper, dejando aparte la generación de hardware.
- Kokoro sigue corriendo en un Mac Intel a través de sus pesos PyTorch oficiales, simplemente sin la ruta de aceleración MLX. Pierdes la ruta Metal específica de Apple Silicon vía mlx-audio, pero el modelo en sí (82M parámetros) es lo bastante pequeño para correr de forma aceptable en CPU.
- XTTS v2 y Bark corren de forma idéntica en Mac Intel y Apple Silicon, ya que ambos actualmente corren solo con CPU en cualquier Mac de todos modos — XTTS v2 porque el soporte MPS está roto, y Bark porque el soporte MPS es experimental y parcial. Ninguno de los dos pierde capacidad significativa al pasar de Apple Silicon a Intel, ya que ninguno tiene una ruta acelerada madura en Apple Silicon para empezar.
¿Cuándo no deberías usar ninguno de estos motores?
Ninguno de los cuatro motores de esta comparativa es la opción correcta para todo caso de uso de TTS en Mac — cada uno tiene situaciones donde otra herramienta, o una API cloud, encaja mejor.
- ❌ Necesitas una licencia comercial garantizada con voces clonadas. La licencia CPML de XTTS v2 es no comercial, sin una vía activa confirmada hacia una licencia comercial desde que Coqui AI cerró sus servicios de pago en diciembre de 2023 — ver la comparativa con ElevenLabs de PromptQuorum para una alternativa cloud comercial gestionada.
- ❌ Necesitas mantenimiento activo garantizado. El repositorio público de GitHub de Bark no muestra commits desde el 5 de abril de 2024; si las correcciones y actualizaciones continuas importan para tu proyecto, Piper (mantenido activamente por Open Home Foundation) o Kokoro (un ecosistema comunitario activamente usado en torno a mlx-audio) son apuestas más seguras.
- ❌ Necesitas soporte de GPU en Apple Silicon de nivel producción hoy mismo, sin depender de un proyecto comunitario. La ruta MLX de Kokoro pasa por un proyecto comunitario, no una publicación oficial de Apple o hexgrad — trátala como buena, pero no garantizada por un proveedor.
- ❌ Necesitas voz interactiva en tiempo real en memoria Apple Silicon muy limitada (configuraciones base de 8GB) mientras también corres un LLM local grande a la vez. Apilar un proceso grande de XTTS v2 o Bark junto a un LLM en un Mac con memoria ajustada puede ser justo; las huellas pequeñas de Piper y Kokoro dejan más margen.
Preguntas frecuentes
¿Cuál es el mejor motor TTS local para Mac Apple Silicon?
Kokoro-82M, ejecutado a través del proyecto comunitario mlx-audio, es la mejor opción si quieres específicamente aceleración de GPU (Metal) en Apple Silicon vía el framework MLX propio de Apple. Si quieres la instalación más simple que funcione igual en cualquier Mac, Piper es la mejor opción, ya que es solo-CPU por diseño en toda plataforma.
¿Piper usa la GPU en un Mac?
No. Piper es solo-CPU por diseño en toda plataforma, incluidos Apple Silicon y Mac Intel. Convierte texto a fonemas con espeak-ng y sintetiza audio a través de ONNX Runtime, por lo que corre en tiempo real incluso en una Raspberry Pi sin ninguna GPU.
¿Puede Kokoro-82M correr en Apple Silicon con aceleración por GPU?
Sí, a través del proyecto comunitario mlx-audio, que ejecuta Kokoro-82M vía el framework MLX propio de Apple — construido específicamente para Metal sobre la arquitectura de memoria unificada de Apple Silicon. Los pesos oficiales de Kokoro-82M de hexgrad son un modelo PyTorch; la ruta MLX es un port comunitario, no una publicación oficial, y requiere un Mac Apple Silicon (los Mac Intel no pueden usarla) y Python 3.10–3.12.
¿XTTS v2 funciona en Apple Silicon?
Funciona, pero solo con CPU. El soporte del dispositivo Metal (MPS) de XTTS v2 es un issue documentado y sin resolver rastreado en el repositorio de GitHub coqui-ai/TTS (issue #3649), donde intentar usar el dispositivo MPS se cuelga en lugar de completarse. El proyecto de Coqui no soporta oficialmente la aceleración por GPU en Apple Silicon para XTTS v2, así que espera rendimiento solo-CPU en cualquier Mac.
¿Bark está acelerado en Apple Silicon?
Parcialmente, y de forma experimental. Establecer la variable de entorno SUNO_ENABLE_MPS=True activa la aceleración por GPU Metal para Bark, pero algunos operadores de PyTorch de los que depende no se han implementado para MPS, así que algunos pasos de procesamiento aún recaen en la CPU. Los propios mantenedores de Bark describen este soporte como experimental, no listo para producción.
¿Puedo usar alguno de estos motores en un Mac Intel?
Piper, XTTS v2 y Bark corren todos en Mac Intel, ya que ninguno requiere aceleración específica de Apple Silicon para funcionar — corren solo con CPU ya sea por diseño (Piper) o porque sus rutas de aceleración por GPU están de todos modos sin resolver o son parciales (XTTS v2, Bark). La ruta acelerada por MLX de Kokoro requiere específicamente Apple Silicon y no corre en absoluto en un Mac Intel, aunque los pesos PyTorch oficiales de Kokoro sí corren en Intel sin aceleración MLX.
¿Cuál de estos motores puede clonar una voz específica?
Solo XTTS v2, entre los cuatro cubiertos aquí, clona una voz a partir de un clip de audio de referencia corto (tan solo 6 segundos, según su ficha oficial de modelo). Piper, Kokoro y Bark usan todos voces pre-entrenadas o preestablecidas en lugar de clonar una voz arbitraria al vuelo. Ver la reseña dedicada de XTTS v2 de PromptQuorum para los detalles completos de clonación y licencia.
¿Alguno de estos motores TTS locales requiere una licencia de pago para uso en Mac Apple Silicon?
Ningún motor cubierto aquí cobra específicamente por el uso en macOS o Apple Silicon. Piper (GPL-3.0-or-later), Kokoro (Apache-2.0) y Bark (MIT) son todos software gratuito y de código abierto, independientemente de la plataforma. XTTS v2 es gratuito de usar pero bajo una licencia no comercial (CPML) — esa restricción aplica igual en Apple Silicon, Intel, Windows o Linux, y no tiene relación con qué Mac uses.
Veredicto
Específicamente en Apple Silicon, Kokoro-82M destaca porque es el único de estos cuatro motores con una ruta real, construida específicamente, hacia la GPU Metal del Mac, a través del proyecto comunitario mlx-audio construido sobre el framework MLX propio de Apple — y es lo bastante pequeño (82 millones de parámetros, con licencia Apache-2.0) como para que valga la pena configurar esta aceleración. Piper sigue siendo la opción por defecto correcta cuando la simplicidad y la consistencia entre hardware importan más que la velocidad bruta: es solo-CPU en todas partes, así que no hay nada específico de Apple Silicon que configurar, solucionar, o temer que falle en un Mac Intel. XTTS v2 vale la pena por la pérdida de rendimiento solo-CPU únicamente si necesitas específicamente clonación de voz y puedes vivir con su licencia no comercial; Bark merece consideración solo por sus sonidos distintivos no verbales, con la advertencia de que tanto su aceleración en Apple Silicon como su estado general de mantenimiento están sin resolver. Si tienes dudas, empieza con Piper para la instalación más simple, pasa a Kokoro vía mlx-audio una vez que confirmes que quieres la aceleración Metal, y recurre a XTTS v2 solo cuando la clonación de voz sea un requisito estricto.
Fuentes
- Kokoro-82M en Hugging Face — la ficha oficial del modelo: parámetros, licencia y arquitectura.
- mlx-audio en GitHub — el proyecto comunitario que ejecuta Kokoro-82M vía el framework MLX de Apple en Apple Silicon.
- Issue de GitHub coqui-ai/TTS #3649 — "Unable to use xtts_v2 with mps device on Apple Silicon", que documenta el bloqueo de MPS sin resolver.
- Repositorio de GitHub suno-ai/bark — issues y pull requests que documentan el soporte experimental de Apple Silicon MPS vía SUNO_ENABLE_MPS.
- Framework MLX de Apple — el framework oficial de machine learning open source de Apple con aceleración nativa de GPU Metal para Apple Silicon.
- Reseña de Piper TTS — la reseña dedicada de PromptQuorum, incluyendo comandos de instalación e historial de licencias.
- Reseña de XTTS v2, Reseña de Coqui TTS y Reseña de Bark TTS — las reseñas dedicadas de PromptQuorum de los demás motores cubiertos aquí.
