Points clés
- Kokoro-82M : Apache-2.0, 82M paramètres, tourne via le framework MLX d'Apple grâce au projet communautaire mlx-audio — le vrai chemin d'accélération Apple Silicon.
- Piper : GPL-3.0-or-later, CPU uniquement par conception via ONNX Runtime — même profil de performance sur Mac Intel et Apple Silicon.
- XTTS v2 : licence CPML non commerciale, clonage vocal à partir de ~6 secondes d'audio, mais le support Metal (MPS) est une issue GitHub suivie et non résolue — CPU uniquement sur Mac.
- Bark : licence MIT, support Apple Silicon MPS expérimental derrière une variable d'environnement, aucun commit sur son dépôt public depuis avril 2024.
- Les Mac Intel ne peuvent pas du tout utiliser le chemin Kokoro accéléré par MLX — MLX nécessite Apple Silicon.
📍 En une phrase
Pour la synthèse vocale locale sur Apple Silicon, Kokoro-82M est le seul des quatre grands moteurs locaux avec un vrai chemin GPU Metal (via le projet communautaire mlx-audio sur le framework MLX d'Apple) ; Piper est l'option CPU uniquement la plus simple, identique sur Mac Intel ; XTTS v2 offre le clonage vocal mais son support MPS sur Apple Silicon est une issue GitHub documentée et cassée ; et le support MPS de Bark est explicitement expérimental.
💬 En termes simples
Tout programme gratuit de synthèse vocale exécutable sur un Mac n'utilise pas forcément la puce graphique du Mac — certains tournent simplement sur le processeur classique, ce qui fonctionne mais reste plus lent que possible. Kokoro est conçu pour exploiter la puce Apple via un projet appelé MLX ; les autres évitent le GPU par conception (Piper) ou tentent de l'utiliser mais rencontrent des problèmes non résolus (XTTS v2, Bark).
📌Remarque: Ce guide compare les quatre moteurs TTS locaux que PromptQuorum a testés indépendamment (Piper, Kokoro, XTTS v2, Bark). Chacun dispose de son propre test dédié, lié tout au long de l'article, pour les commandes d'installation, le détail des licences et les limitations complètes.
Quel moteur TTS local installer réellement ?
Le bon moteur dépend de si vous avez besoin d'accélération GPU, de clonage vocal, ou de la plus large compatibilité Mac possible — aucun moteur ne gagne sur les trois. Kokoro est le seul ici avec un vrai chemin GPU Apple Silicon ; Piper est le plus portable ; XTTS v2 est le seul à cloner des voix.
- 🏆 Meilleur choix global pour Apple Silicon : Kokoro-82M via mlx-audio — le seul moteur ici avec un vrai chemin GPU Metal, assez petit (82M paramètres) pour tourner confortablement sur tout Mac Apple Silicon.
- Meilleur choix pour la simplicité et la compatibilité Intel : Piper — CPU uniquement par conception, donc installation et performances identiques que ce soit sur une puce M-series ou un ancien Mac Intel.
- Meilleur choix si vous avez besoin de clonage vocal : XTTS v2 — clone une voix à partir de ~6 secondes d'audio de référence, mais tourne uniquement sur CPU sur tout Mac et n'est licencié que pour un usage non commercial.
- Meilleur choix pour l'audio expressif non vocal : Bark — rires, soupirs et musique simple à partir de texte, avec un support GPU Apple Silicon expérimental (partiel), sachant que son dépôt est dormant depuis avril 2024.
Qui devrait utiliser quel moteur ?
Associez le moteur à votre Mac et à votre besoin réel, pas à celui qui a le plus d'étoiles GitHub. L'accélération GPU n'est importante que si vous générez suffisamment d'audio, assez souvent, pour que la synthèse CPU uniquement paraisse lente.
- 🧭 Mac Apple Silicon, voulez l'option locale la plus rapide : Kokoro via mlx-audio — le seul moteur ici écrit pour utiliser Metal via MLX.
- 🧭 Tout Mac, y compris un ancien modèle Intel : Piper — CPU uniquement par conception, rien de spécifique à Apple Silicon à configurer ou dépanner.
- 🧭 Besoin de cloner une voix spécifique à partir d'un court enregistrement : XTTS v2 — acceptez qu'il tournera uniquement sur CPU sur un Mac, et que sa licence est non commerciale.
- 🧭 Voulez des rires, soupirs ou sons d'ambiance, pas seulement de la parole : Bark — mais prévoyez un temps d'installation supplémentaire pour son chemin Apple Silicon expérimental, et vérifiez d'abord son statut de maintenance actuel.
- ❌ Évitez Bark si vous avez besoin d'une maintenance active ou de performances garanties — son dépôt public n'a affiché aucun commit depuis avril 2024, indépendamment de la question Apple Silicon.
- ❌ Évitez XTTS v2 si vous construisez un produit commercial — sa licence Coqui Public Model License (CPML) est non commerciale, et Coqui AI, l'entreprise qui l'a publié, a arrêté ses services payants en décembre 2023.
Comment Piper, Kokoro, XTTS v2 et Bark se comparent-ils pour l'adéquation Apple Silicon ?
Kokoro est le seul moteur de ce comparatif avec un vrai chemin GPU Apple Silicon conçu pour cela ; les autres sont CPU uniquement par conception ou à cause d'un bug non résolu. Le tableau ci-dessous note chaque moteur sur les quatre facteurs qui déterminent réellement l'adéquation Mac : s'il utilise l'accélération Apple Silicon, sa consommation mémoire, la fluidité de l'installation macOS, et la qualité vocale.
Moteur | Accél. Apple Silicon | Empreinte RAM | Installation macOS | Qualité vocale |
|---|---|---|---|---|
| Kokoro-82M | Oui — Metal via MLX (mlx-audio) | Faible (82M param., variantes quantif.) | pip install + mlx-audio, Apple Silicon uniquement | Naturelle, proche de modèles cloud plus grands |
| Piper | Aucune (conception) — CPU, ONNX Runtime | Très faible (~50–100Mo par voix) | pip install piper-tts, aucune config GPU | Claire, prosodie parfois robotique |
| XTTS v2 | Aucune — MPS bloque (issue GH #3649) | Modérée à élevée (modèle de clonage complet) | pip install coqui-tts, CPU uniquement sur Mac | Élevée, clone une voix spécifique |
| Bark | Expérimentale — SUNO_ENABLE_MPS=True | Élevée (flag small-models pour réduire) | pip install depuis GitHub, pas de paquet PyPI | Expressive, non déterministe |
Les notes de qualité vocale sont des descriptions qualitatives basées sur l'architecture documentée de chaque moteur et les tests dédiés de PromptQuorum (liés par ligne), pas un test d'écoute à l'aveugle mené par PromptQuorum — aucun score MOS (Mean Opinion Score) ni chiffre de benchmark n'est revendiqué ici.
Quels moteurs utilisent vraiment le GPU sur un Mac ?
Seul Kokoro a un vrai chemin, conçu pour cela, vers le GPU Metal d'Apple Silicon ; Piper évite entièrement le GPU par conception, et XTTS v2 comme Bark ont un support GPU non résolu ou partiel sur Mac. C'est le facteur le plus important qui distingue ces moteurs sur Apple Silicon, et il est facile de supposer que « tourne sur un Mac » signifie « utilise le GPU du Mac » — ce n'est généralement pas le cas.
- Kokoro-82M tourne via le framework MLX d'Apple grâce au projet communautaire mlx-audio, qui nécessite Apple Silicon et Python 3.10–3.12. MLX est le framework de machine learning open source d'Apple, construit depuis zéro pour Metal sur l'architecture à mémoire unifiée d'Apple Silicon — le même framework que couvrent le guide LLM local Apple Silicon et le comparatif MLX vs. Ollama vs. llama.cpp pour les modèles de langage. Les poids officiels de Kokoro-82M, publiés par hexgrad sur Hugging Face, sont nativement un modèle PyTorch ; le chemin MLX est un portage communautaire, pas une publication officielle d'Apple ou hexgrad, et mlx-audio propose aussi des variantes quantifiées (bf16, 8-bit, 4-bit) pour réduire l'utilisation mémoire.
- Piper ne touche jamais le GPU, sur aucune plateforme, Apple Silicon inclus — c'est un choix de conception, pas une limitation. Piper convertit le texte en phonèmes avec espeak-ng, puis synthétise l'audio avec un modèle exporté vers ONNX Runtime pour une inférence CPU rapide. Ce choix de conception explique précisément pourquoi Piper tourne en temps réel même sur un Raspberry Pi — voir le test Piper TTS de PromptQuorum pour l'architecture complète et les étapes d'installation.
- Le support Apple Silicon Metal (MPS) de XTTS v2 ne fonctionne actuellement pas. Une issue suivie sur le dépôt GitHub coqui-ai/TTS, intitulée « Unable to use xtts_v2 with mps device on Apple Silicon », documente que tenter d'exécuter XTTS v2 sur le périphérique MPS bloque au lieu de se terminer. Le propre projet de Coqui ne liste pas le support GPU Apple Silicon comme officiellement supporté. En pratique, cela signifie que XTTS v2 tourne uniquement sur CPU sur un Mac, via le même toolkit Coqui TTS (licencié MPL-2.0) qui l'exécute sur d'autres plateformes.
- Bark dispose d'un support Apple Silicon MPS expérimental, protégé par une variable d'environnement. Définir
SUNO_ENABLE_MPS=Trueactive l'accélération Metal, selon les discussions sur le dépôt GitHub suno-ai/bark, mais certains opérateurs PyTorch dont Bark dépend n'étaient pas implémentés pour MPS au moment de la rédaction, entraînant un repli partiel sur CPU pour ces étapes. Bark prend aussi en charge un flagSUNO_USE_SMALL_MODELS=Truespécifiquement pour réduire la pression mémoire sur les Mac disposant de moins de mémoire unifiée.
Comment installer Kokoro avec l'accélération MLX sur un Mac ?
Ce guide installe le projet communautaire mlx-audio pour exécuter Kokoro-82M via le framework MLX d'Apple, en suivant la configuration documentée dans le dépôt GitHub mlx-audio.
- 1Confirmez que vous êtes sur Apple Silicon avec une version Python prise en charge.
Why it matters: mlx-audio nécessite un Mac Apple Silicon (puce M-series) et Python 3.10–3.12 ; MLX ne tourne pas du tout sur Mac Intel, ce chemin est donc réservé à Apple Silicon. - 2Installez mlx-audio.
Why it matters: Exécutez `pip install mlx-audio` dans un environnement virtuel Python. Cela entraîne MLX lui-même (version 0.31 ou ultérieure) avec le pipeline audio. - 3Lancez une première synthèse en ligne de commande.
Why it matters: Le paquet fournit un point d'entrée CLI qui télécharge les poids de Kokoro-82M à la première utilisation et synthétise un fichier WAV à partir d'une chaîne de texte — vérifiez le README actuel du projet pour la commande exacte, car les options CLI peuvent changer entre versions. - 4Choisissez une voix et, éventuellement, une variante de modèle quantifiée.
Why it matters: Kokoro-82M propose 54 préréglages de voix dans plusieurs langues. mlx-audio propose aussi des variantes quantifiées bf16, 8-bit et 4-bit — une précision réduite échange un peu de qualité contre une empreinte mémoire plus petite, utile sur un Mac avec moins de mémoire unifiée. - 5Intégrez-le dans votre propre application Python.
Why it matters: Pour tout usage au-delà de la synthèse CLI ponctuelle, appelez directement l'API Python de mlx-audio plutôt que d'invoquer la CLI à répétition, ce qui évite le coût de rechargement du modèle à chaque appel.
Qu'est-ce qui change sur un Mac Intel ?
Sur un Mac Intel, le chemin Kokoro accéléré par MLX est totalement indisponible — MLX nécessite Apple Silicon et ne tourne pas du tout sur du matériel Intel. Tous les autres moteurs ici couverts fonctionnent encore sur Intel, car aucun ne dépend du Neural Engine d'Apple ni d'une accélération GPU spécifique à Apple Silicon pour fonctionner ; ils tournent simplement sur CPU.
- Piper n'est pas affecté par la distinction Intel/Apple Silicon. Il est CPU uniquement par conception sur toute plateforme, donc un Mac Intel performe de manière comparable à un Mac Apple Silicon spécifiquement pour Piper, génération matérielle mise à part.
- Kokoro tourne encore sur un Mac Intel via ses poids PyTorch officiels, simplement sans le chemin d'accélération MLX. Vous perdez le chemin Metal spécifique à Apple Silicon via mlx-audio, mais le modèle lui-même (82M paramètres) est assez petit pour tourner de façon acceptable sur CPU.
- XTTS v2 et Bark tournent de façon identique sur Mac Intel et Apple Silicon, puisque les deux fonctionnent de toute façon uniquement sur CPU sur tout Mac actuellement — XTTS v2 parce que le support MPS est cassé, et Bark parce que le support MPS est expérimental et partiel. Aucun des deux ne perd de capacité significative en passant d'Apple Silicon à Intel, puisqu'aucun n'a de chemin accéléré mature sur Apple Silicon au départ.
Quand ne pas utiliser aucun de ces moteurs ?
Aucun des quatre moteurs de ce comparatif n'est le bon choix pour chaque cas d'usage TTS sur Mac — chacun a des situations où un autre outil, ou une API cloud, convient mieux.
- ❌ Besoin d'une licence commerciale garantie avec voix clonées. La licence CPML de XTTS v2 est non commerciale, sans voie confirmée et active vers une licence commerciale depuis que Coqui AI a arrêté ses services payants en décembre 2023 — voir le comparatif ElevenLabs de PromptQuorum pour une alternative cloud commerciale gérée.
- ❌ Besoin d'une maintenance active garantie. Le dépôt GitHub public de Bark n'affiche aucun commit depuis le 5 avril 2024 ; si les correctifs et mises à jour continus comptent pour votre projet, Piper (activement maintenu par l'Open Home Foundation) ou Kokoro (un écosystème communautaire activement utilisé autour de mlx-audio) sont des paris plus sûrs.
- ❌ Besoin d'un support GPU Apple Silicon de qualité production dès aujourd'hui, sans dépendance à un projet communautaire. Le chemin MLX de Kokoro passe par un projet communautaire, pas une publication officielle d'Apple ou hexgrad — considérez-le comme bon, mais non garanti par un éditeur.
- ❌ Besoin de voix interactive en temps réel sur une mémoire Apple Silicon très limitée (configurations de base 8Go) tout en faisant tourner simultanément un grand LLM local. Empiler un gros processus XTTS v2 ou Bark à côté d'un LLM sur un Mac à mémoire contrainte peut être serré ; les faibles empreintes de Piper et Kokoro laissent plus de marge.
Questions fréquemment posées
Quel est le meilleur moteur TTS local pour les Mac Apple Silicon ?
Kokoro-82M, exécuté via le projet communautaire mlx-audio, est le meilleur choix si vous voulez spécifiquement l'accélération GPU (Metal) Apple Silicon via le framework MLX d'Apple. Si vous voulez l'installation la plus simple qui fonctionne pareil sur tout Mac, Piper est le meilleur choix, puisqu'il est CPU uniquement par conception sur toute plateforme.
Piper utilise-t-il le GPU sur un Mac ?
Non. Piper est CPU uniquement par conception sur toute plateforme, Apple Silicon et Mac Intel inclus. Il convertit le texte en phonèmes avec espeak-ng et synthétise l'audio via ONNX Runtime, ce qui explique pourquoi il tourne en temps réel même sur un Raspberry Pi sans aucun GPU.
Kokoro-82M peut-il tourner sur Apple Silicon avec accélération GPU ?
Oui, via le projet communautaire mlx-audio, qui exécute Kokoro-82M via le framework MLX d'Apple — construit spécifiquement pour Metal sur l'architecture à mémoire unifiée d'Apple Silicon. Les poids officiels de Kokoro-82M par hexgrad sont un modèle PyTorch ; le chemin MLX est un portage communautaire, pas une publication officielle, et nécessite un Mac Apple Silicon (les Mac Intel ne peuvent pas l'utiliser) et Python 3.10–3.12.
XTTS v2 fonctionne-t-il sur Apple Silicon ?
Il fonctionne, mais uniquement sur CPU. Le support du périphérique Metal (MPS) de XTTS v2 est une issue documentée et non résolue suivie sur le dépôt GitHub coqui-ai/TTS (issue #3649), où tenter d'utiliser le périphérique MPS bloque au lieu de se terminer. Le projet de Coqui ne prend pas officiellement en charge l'accélération GPU Apple Silicon pour XTTS v2, attendez-vous donc à des performances CPU uniquement sur tout Mac.
Bark est-il accéléré sur Apple Silicon ?
Partiellement, et expérimentalement. Définir la variable d'environnement SUNO_ENABLE_MPS=True active l'accélération GPU Metal pour Bark, mais certains opérateurs PyTorch dont il dépend n'ont pas été implémentés pour MPS, donc certaines étapes de traitement continuent de retomber sur CPU. Les mainteneurs de Bark décrivent eux-mêmes ce support comme expérimental, pas prêt pour la production.
Puis-je utiliser l'un de ces moteurs sur un Mac Intel ?
Piper, XTTS v2 et Bark tournent tous sur Mac Intel, puisqu'aucun ne nécessite d'accélération spécifique à Apple Silicon pour fonctionner — ils tournent soit sur CPU par conception (Piper), soit parce que leurs chemins d'accélération GPU sont de toute façon non résolus ou partiels (XTTS v2, Bark). Le chemin accéléré par MLX de Kokoro nécessite spécifiquement Apple Silicon et ne tourne pas du tout sur un Mac Intel, bien que les poids PyTorch officiels de Kokoro tournent quand même sur Intel sans accélération MLX.
Lequel de ces moteurs peut cloner une voix spécifique ?
Seul XTTS v2, parmi les quatre couverts ici, clone une voix à partir d'un court extrait audio de référence (à partir de 6 secondes seulement, selon sa fiche modèle officielle). Piper, Kokoro et Bark utilisent tous des voix pré-entraînées ou préréglées plutôt que de cloner une voix arbitraire à la volée. Voir le test XTTS v2 dédié de PromptQuorum pour les détails complets du clonage et la licence.
L'un de ces moteurs TTS locaux nécessite-t-il une licence payante pour un usage sur Mac Apple Silicon ?
Aucun moteur couvert ici ne facture spécifiquement l'usage macOS ou Apple Silicon. Piper (GPL-3.0-or-later), Kokoro (Apache-2.0) et Bark (MIT) sont tous des logiciels gratuits et open source, quelle que soit la plateforme. XTTS v2 est gratuit d'usage mais sous une licence non commerciale (CPML) — cette restriction s'applique de la même façon sur Apple Silicon, Intel, Windows ou Linux, et n'a rien à voir avec le Mac que vous utilisez.
Verdict
Spécifiquement sur Apple Silicon, Kokoro-82M se démarque car c'est le seul de ces quatre moteurs avec un vrai chemin, conçu pour cela, vers le GPU Metal du Mac, via le projet communautaire mlx-audio construit sur le framework MLX d'Apple — et il est assez petit (82 millions de paramètres, licencié Apache-2.0) pour que cette accélération vaille la peine d'être configurée. Piper reste le bon choix par défaut quand la simplicité et la cohérence multi-matériel comptent plus que la vitesse brute : il est CPU uniquement partout, donc rien de spécifique à Apple Silicon à configurer, dépanner, ou craindre de voir régresser sur un Mac Intel. XTTS v2 vaut la perte de performance CPU uniquement seulement si vous avez spécifiquement besoin de clonage vocal et pouvez vivre avec sa licence non commerciale ; Bark mérite considération uniquement pour ses sons non vocaux distinctifs, avec la réserve que son accélération Apple Silicon comme son statut de maintenance global restent incertains. En cas de doute, commencez par Piper pour l'installation la plus simple, passez à Kokoro via mlx-audio une fois confirmé que vous voulez l'accélération Metal, et n'utilisez XTTS v2 que lorsque le clonage vocal est une exigence stricte.
Sources
- Kokoro-82M sur Hugging Face — la fiche modèle officielle : paramètres, licence et architecture.
- mlx-audio sur GitHub — le projet communautaire qui exécute Kokoro-82M via le framework MLX d'Apple sur Apple Silicon.
- Issue GitHub coqui-ai/TTS #3649 — « Unable to use xtts_v2 with mps device on Apple Silicon », documentant le blocage MPS non résolu.
- Dépôt GitHub suno-ai/bark — issues et pull requests documentant le support Apple Silicon MPS expérimental via SUNO_ENABLE_MPS.
- Framework Apple MLX — le framework de machine learning open source officiel d'Apple avec accélération GPU Metal native pour Apple Silicon.
- Test Piper TTS — le test dédié de PromptQuorum, incluant les commandes d'installation et l'historique des licences.
- Test XTTS v2, Test Coqui TTS et Test Bark TTS — les tests dédiés de PromptQuorum pour les autres moteurs couverts ici.
