Points clés
- Piper : conçu spécifiquement pour du matériel embarqué sans GPU, temps réel sur un Raspberry Pi 4.
- Kokoro (82M de paramètres, Apache-2.0) : qualité vocale plus naturelle, aucun benchmark temps réel documenté sur Pi — plus réaliste sur un Pi 5 que sur un Pi 4.
- Coqui TTS / XTTS v2 : ajoute le clonage vocal, suppose une accélération GPU, ne convient pas à un Pi sans GPU.
- espeak-ng : l'option la plus légère, sonne mécanique — un recours plutôt qu'un premier choix.
- Pi 5 (Cortex-A76, 2,4GHz) nettement plus rapide que le Pi 4 (Cortex-A72, jusqu'à 1,8GHz) pour l'une de ces options.
- Installation de Piper en une commande :
pip install piper-tts, puis téléchargement d'un modèle de voix.
📍 En une phrase
Piper est le meilleur moteur TTS local pour un Raspberry Pi car il a été conçu au sein du projet d'assistant vocal hors ligne Rhasspy spécifiquement pour du matériel embarqué sans GPU, et reste pour cette raison la voix locale par défaut de Home Assistant ; Kokoro sonne plus naturel mais n'a aucun benchmark temps réel documenté sur Pi, et Coqui TTS/XTTS v2 supposent une accélération GPU.
💬 En termes simples
Si vous voulez que votre Raspberry Pi parle à voix haute sans connexion internet, Piper est l'outil conçu exactement pour cela — installez-le, téléchargez une voix, et il parle en temps réel sur une carte à partir d'environ 35 dollars. Les options plus sophistiquées (Kokoro, XTTS v2) sonnent mieux mais n'ont pas été conçues en tenant compte du CPU limité d'un Raspberry Pi.
📌Remarque: Ce guide couvre la vitesse de synthèse en CPU seul et l'adéquation au Raspberry Pi, pas le clonage vocal. Pour le clonage vocal spécifiquement, voir le test dédié de PromptQuorum sur XTTS v2, explicitement déconseillé pour des CPU de classe Pi.
Qu'est-ce qui rend un moteur TTS adapté à un Raspberry Pi ?
Un moteur TTS adapté au Raspberry Pi doit fonctionner sans GPU, tenir avec son modèle et son environnement d'exécution en quelques centaines de mégaoctets de RAM, et générer de l'audio plus vite que le temps réel sur un CPU ARM quad-cœur. Un Raspberry Pi n'a pas de GPU dédié utile pour l'inférence TTS — chaque moteur ici tourne sur le CPU, donc le facteur décisif est l'efficacité avec laquelle chacun a été conçu pour cette contrainte, pas la qualité brute du modèle isolément.
- Aucune dépendance à un GPU. Un Raspberry Pi n'a pas de GPU compatible CUDA ; un moteur qui suppose une accélération GPU pour une vitesse acceptable est disqualifié pour un usage temps réel, même s'il fonctionne techniquement en CPU en repli.
- Empreinte RAM. Un Raspberry Pi 4 plafonne à 8 Go de RAM totale, partagée avec l'OS et tout autre service en cours (Home Assistant, un détecteur de mot de réveil) ; un moteur TTS nécessitant plusieurs gigaoctets rien que pour se charger laisse peu de place pour le reste.
- Complexité d'installation. Un simple
pip installavec des roues ARM précompilées est très différent d'une boîte à outils qui attend une chaîne de dépendances orientée GPU (CUDA, cuDNN) qui ne s'applique pas sur un Pi. - Compromis sur la qualité vocale. Chaque moteur de cette liste échange de la qualité contre de la vitesse ; la question est de savoir quel compromis convient à votre usage — une annonce d'enceinte connectée n'a pas les mêmes exigences de qualité qu'un projet de clonage vocal.
Piper vs Kokoro vs Coqui TTS/XTTS v2 vs espeak-ng sur l'adéquation au Raspberry Pi
Piper obtient le meilleur score sur chaque critère spécifique au Pi, sauf la qualité vocale brute, où Kokoro et XTTS v2 mènent. Le tableau ci-dessous évalue chaque moteur sur les quatre critères qui comptent réellement pour un déploiement sur Raspberry Pi, et non sur des benchmarks TTS généraux réalisés sur du matériel de bureau ou serveur.
Moteur | Empreinte RAM | Faisabilité CPU seul | Complexité install. | Qualité vocale |
|---|---|---|---|---|
| Piper | Faible (fichiers modèle souvent bien sous 100 Mo par voix) | Conçu pour cela ; temps réel largement rapporté sur Pi 4 | Une commande : pip install piper-tts | Bonne, voix neuronales assez naturelles ; pas de clonage |
| Kokoro | Modérée (modèle 82M de paramètres, ~327 Mo de poids) | Fonctionne en CPU ; aucun benchmark temps réel documenté sur Pi | Paquet Python + téléchargement modèle ; plus de dépendances que Piper | Supérieure — proche du sommet des classements indépendants de qualité TTS |
| Coqui TTS / XTTS v2 | Élevée ; VRAM GPU supposée pour les chiffres de latence documentés | Faible ; le propre test XTTS v2 de PromptQuorum juge le Pi en CPU seul peu pratique | Installation de la boîte à outils plus acceptation de licence (CPML pour XTTS v2) | La plus élevée — dont le clonage vocal en 6 secondes en 17 langues |
| espeak-ng | Minimale (quelques mégaoctets) | Triviale ; fonctionne sur presque tout matériel, y compris des microcontrôleurs | Disponible directement via la plupart des gestionnaires de paquets Linux | Son de synthèse par formants, mécanique — pas une parole naturelle |
Pourquoi Piper est la recommandation par défaut pour un Raspberry Pi
Piper est la recommandation par défaut parce qu'il a été conçu pour exactement cette catégorie de matériel, et non adapté après coup. Il est né au sein de Rhasspy, une boîte à outils open source pour construire des assistants vocaux entièrement hors ligne — un projet dont toute la prémisse est d'exécuter reconnaissance et synthèse vocales sur du matériel local, souvent modeste, y compris des cartes Raspberry Pi, sans aller-retour vers une API cloud.
- Conçu pour des appareils embarqués et à ressources limitées. Piper utilise une architecture neuronale de type VITS, exportée vers ONNX Runtime pour une inférence CPU rapide — un choix délibéré pour du matériel sans GPU de repli.
- Toujours le choix par défaut dans Home Assistant. Piper est le moteur de synthèse vocale local par défaut de la chaîne vocale de Home Assistant, maintenu par l'Open Home Foundation, la même organisation à but non lucratif qui gère Home Assistant — et une grande partie des installations Home Assistant tournent sur un Raspberry Pi.
- Aucun GPU jamais requis. Une accélération GPU CUDA optionnelle existe pour un débit supérieur sur du matériel de bureau, mais elle n'est pas nécessaire — Piper est conçu pour fonctionner en temps réel sur CPU seul.
- Pas de clonage vocal — un catalogue de voix fixe à la place. Piper fournit des dizaines de voix préentraînées dans plus de 20 langues plutôt que de cloner une voix à partir d'un échantillon ; c'est un vrai compromis face à XTTS v2, mais c'est aussi ce qui maintient l'empreinte ressources de Piper assez faible pour un Raspberry Pi.
Kokoro : qualité supérieure, coût plus lourd
Kokoro est un modèle TTS de 82 millions de paramètres, sous licence Apache-2.0, dérivé de StyleTTS2, qui produit une voix nettement plus naturelle que Piper, à un coût réel en ressources non documenté spécifiquement pour du matériel Raspberry Pi. Contrairement à Piper, Kokoro n'a pas été conçu avec les appareils ARM embarqués comme cible principale — il a été conçu pour être petit et rapide par rapport aux modèles TTS plus volumineux sur du matériel généraliste, un objectif de conception différent d'une performance temps réel spécifiquement sur le CPU d'un Raspberry Pi.
- 82M de paramètres, ~327 Mo de poids. C'est petit comparé à un grand modèle de clonage vocal, mais tout de même nettement plus lourd qu'une seule voix Piper, qui tient généralement bien sous 100 Mo.
- Licence Apache-2.0. Permissive et adaptée à un usage commercial — pas de restriction non commerciale de type CPML, contrairement à XTTS v2.
- Aucun benchmark temps réel documenté sur Raspberry Pi. PromptQuorum n'a trouvé aucun benchmark publié et sourcé montrant Kokoro fonctionner en temps réel spécifiquement sur du matériel Raspberry Pi 4 ou 5. Considérez toute affirmation de temps réel pour Kokoro sur un Pi comme non vérifiée tant que vous ne l'avez pas testée vous-même.
- Un Raspberry Pi 5 est la cible la plus réaliste. Son CPU Cortex-A76 à 2,4GHz offre nettement plus de puissance de calcul que le Cortex-A72 d'un Raspberry Pi 4, ce qui compte davantage pour un modèle plus lourd comme Kokoro que pour le plus léger Piper.
Coqui TTS et XTTS v2 : quand le clonage vocal compte
Coqui TTS et son modèle XTTS v2 ajoutent le clonage vocal à partir de seulement 6 secondes d'audio de référence, mais tous deux supposent une accélération GPU et ne conviennent pas de façon réaliste à du matériel Raspberry Pi sans GPU. Si votre projet a réellement besoin de cloner une voix spécifique plutôt que d'utiliser une voix préentraînée, c'est la seule option de cette liste qui le permette — mais prévoyez de l'exécuter ailleurs et de diffuser l'audio vers le Pi, pas de l'exécuter sur le Pi lui-même.
- XTTS v2 clone une voix à partir de 6 secondes d'audio en 17 langues, selon sa fiche modèle officielle sur Hugging Face — voir le test complet de XTTS v2 de PromptQuorum pour les commandes d'installation et les détails de licence.
- Un GPU est fortement recommandé, et un usage en CPU seul n'est pas praticable pour des applications temps réel, selon le propre test XTTS v2 de PromptQuorum — un Raspberry Pi n'a pas de GPU dédié, donc l'inférence XTTS v2 en temps réel sur l'appareil n'est pas réaliste.
- La licence de XTTS v2, la Coqui Public Model License (CPML), est non commerciale — une considération distincte de l'adéquation matérielle. Voir le guide des licences TTS locales pour la comparaison complète.
- Un schéma courant pour les projets Pi nécessitant des voix clonées : exécuter XTTS v2 sur un serveur ou un poste de travail séparé, toujours actif, doté d'un GPU, y générer l'audio, puis envoyer le fichier ou le flux audio résultant au Raspberry Pi pour lecture — plutôt que d'exécuter l'inférence sur le Pi lui-même.
espeak-ng : le recours léger
espeak-ng est un moteur TTS à synthèse par formants qui fonctionne sur presque tout matériel, y compris des microcontrôleurs, mais avec un rendu mécanique plutôt que naturel. Il précède de plus d'une décennie les moteurs TTS neuronaux de cette liste et n'est pas un véritable concurrent en qualité vocale — il figure ici parce qu'il représente le plancher : l'option pratiquement sans exigence de ressources.
- Fonctionne sur pratiquement n'importe quoi. espeak-ng ne nécessite que quelques mégaoctets de mémoire et aucun environnement d'exécution de réseau neuronal, ce qui le rend viable même sur du matériel bien en deçà des spécifications d'un Raspberry Pi.
- Rendu robotique. Son approche par synthèse de formants — générer la parole à partir de règles acoustiques plutôt que d'un modèle neuronal entraîné — produit une parole intelligible mais clairement synthétique, un mauvais choix pour un assistant vocal ou un système d'annonces censé sonner naturel.
- Toujours utile comme phonémiseur. Piper lui-même utilise espeak-ng en interne pour la conversion texte-vers-phonèmes, même si la sortie audio de Piper provient de son propre modèle neuronal, et non directement d'espeak-ng.
- À choisir uniquement quand la RAM ou le CPU sont si limités que même Piper n'est pas viable — par exemple un appareil de classe microcontrôleur plutôt qu'un Raspberry Pi.
Installer Piper sur un Raspberry Pi
Installer Piper sur un Raspberry Pi tient en un seul pip install, suivi du téléchargement d'un modèle de voix — pas de pilotes GPU, pas de CUDA, pas d'étape de compilation. Ce sont les mêmes commandes documentées dans le test dédié de Piper TTS de PromptQuorum, appliquées ici spécifiquement à un Raspberry Pi sous Raspberry Pi OS (ou une autre distribution Linux ARM basée sur Debian).
- 1Mettre à jour le système et installer Python 3
Why it matters: Raspberry Pi OS embarque Python 3 préinstallé sur les images récentes, mais exécutez d'abord `sudo apt update && sudo apt upgrade` pour vous assurer que pip et les paquets système sont à jour avant d'installer quoi que ce soit de nouveau. - 2Installer Piper avec pip
Why it matters: Exécutez `pip install piper-tts` (ou `pip3 install piper-tts` selon votre image). Cela installe le paquet `piper` avec sa dépendance ONNX Runtime — des roues ARM précompilées évitent toute étape de compilation sur un Raspberry Pi. - 3Télécharger un modèle de voix
Why it matters: Exécutez `piper --download-dir voices --update-voices --voice en_US-lessac-medium` (remplacez par n'importe quelle voix du catalogue Piper sur Hugging Face). Une voix de qualité moyenne est le bon choix par défaut pour un Raspberry Pi — elle est plus rapide qu'une voix haute qualité, avec une différence de rendu négligeable sur un haut-parleur typique. - 4Générer de la parole à partir de texte
Why it matters: Transmettez du texte à Piper en ligne de commande, par exemple `echo "Bonjour depuis le Raspberry Pi." | piper --model voices/en_US-lessac-medium.onnx --output_file output.wav`, puis lisez le fichier WAV obtenu avec `aplay output.wav`. - 5L'intégrer à un projet
Why it matters: Pour une chaîne complète d'assistant vocal (mot de réveil, reconnaissance vocale, un LLM et Piper pour la réponse), voir le [guide de construction pas à pas d'un assistant vocal hors ligne](/fr/power-local-llm/build-local-voice-assistant-2026) de PromptQuorum ; pour Home Assistant spécifiquement, Piper est déjà le moteur TTS par défaut dans les paramètres de la chaîne vocale.
Raspberry Pi 4 vs Raspberry Pi 5 pour la synthèse vocale
Un Raspberry Pi 5 a un CPU nettement plus rapide qu'un Raspberry Pi 4, ce qui compte davantage pour des moteurs plus lourds comme Kokoro que pour le déjà léger Piper. Les deux cartes exécutent Piper en temps réel, mais l'écart de CPU élargit l'ensemble d'options réaliste dès qu'on envisage quelque chose de plus lourd.
- Raspberry Pi 4 : un CPU quad-cœur Arm Cortex-A72 jusqu'à 1,8GHz, avec des configurations RAM jusqu'à 8 Go. Suffisant pour une synthèse Piper en temps réel ; pas une cible réaliste pour Kokoro ou XTTS v2 en temps réel.
- Raspberry Pi 5 : un CPU quad-cœur Arm Cortex-A76 (BCM2712) à 2,4GHz, avec des configurations RAM jusqu'à 16 Go — une hausse documentée de 2 à 3 fois la performance CPU par rapport au Raspberry Pi 4. C'est la carte à utiliser pour expérimenter avec Kokoro plutôt qu'avec Piper.
- Aucune des deux cartes ne change la donne côté accélération GPU. Les deux manquent d'un GPU dédié compatible CUDA, donc Coqui TTS et XTTS v2 restent peu praticables pour de l'inférence temps réel sur l'appareil, sur les deux générations.
- La RAM compte au-delà du seul moteur TTS. Si la même carte fait aussi tourner Home Assistant, un détecteur de mot de réveil ou un LLM local pour une chaîne complète d'assistant vocal, les moteurs légers (Piper, puis espeak-ng) laissent plus de marge pour ces autres processus que Kokoro ou Coqui TTS.
Questions fréquemment posées
Quel est le meilleur moteur TTS local pour un Raspberry Pi ?
Piper est le meilleur moteur TTS local pour un Raspberry Pi dans la plupart des cas d'usage. Il a été conçu au sein du projet d'assistant vocal hors ligne Rhasspy spécifiquement pour du matériel embarqué sans GPU, ne nécessite aucun GPU, et reste pour cette raison le moteur TTS local par défaut de Home Assistant. Il fonctionnerait largement en temps réel sur un Raspberry Pi 4.
Piper a-t-il besoin d'un GPU pour fonctionner sur un Raspberry Pi ?
Non. Piper est conçu pour fonctionner en temps réel sur du matériel CPU seul, y compris un Raspberry Pi. Une accélération GPU CUDA optionnelle existe pour un débit supérieur sur du matériel de bureau, mais elle n'est pas nécessaire, et un Raspberry Pi n'a de toute façon pas de GPU dédié à utiliser pour cela.
Kokoro peut-il fonctionner en temps réel sur un Raspberry Pi ?
PromptQuorum n'a trouvé aucun benchmark temps réel documenté et sourcé spécifiquement pour Kokoro sur du matériel Raspberry Pi. Kokoro est un modèle de 82 millions de paramètres qui fonctionne en CPU de façon générale, mais il n'a pas été conçu spécifiquement pour des appareils ARM embarqués comme Piper. Il est plus réaliste de le tester sur un Raspberry Pi 5, avec son CPU Cortex-A76 plus rapide, que sur un Raspberry Pi 4 — testez-le vous-même avant de vous y fier pour un usage interactif en direct.
Pourquoi ne pas utiliser XTTS v2 pour le clonage vocal sur un Raspberry Pi ?
XTTS v2 suppose une accélération GPU pour sa performance de faible latence documentée, et le propre test XTTS v2 de PromptQuorum indique qu'un usage en CPU seul n'est pas praticable pour des applications temps réel. Un Raspberry Pi n'a pas de GPU dédié, donc une inférence XTTS v2 en temps réel sur l'appareil n'est pas réaliste. Un contournement courant consiste à exécuter XTTS v2 sur un serveur séparé équipé d'un GPU et à diffuser l'audio résultant vers le Raspberry Pi.
Piper est-il gratuit pour un usage commercial ?
Le dépôt Piper activement maintenu, OHF-Voice/piper1-gpl, est sous licence GPL-3.0-or-later, un changement par rapport à la licence MIT du dépôt d'origine rhasspy/piper, aujourd'hui archivé. La GPL-3.0 autorise un usage commercial de Piper en tant qu'outil, mais exige de publier sous la même licence toute modification du code source propre de Piper en cas de distribution. Voir le test complet de Piper TTS de PromptQuorum pour l'historique complet de la licence — ceci n'est pas un conseil juridique.
Quelle est la différence entre un Raspberry Pi 4 et un Raspberry Pi 5 pour la synthèse vocale ?
Un Raspberry Pi 5 utilise un CPU quad-cœur Arm Cortex-A76 (BCM2712) à 2,4GHz avec des configurations RAM jusqu'à 16 Go, une hausse documentée de 2 à 3 fois la performance CPU par rapport au Cortex-A72 quad-cœur du Raspberry Pi 4, jusqu'à 1,8GHz, avec RAM jusqu'à 8 Go. Les deux exécutent Piper en temps réel ; la marge supplémentaire du Pi 5 compte davantage si vous voulez expérimenter avec un moteur plus lourd comme Kokoro.
Piper prend-il en charge d'autres langues que l'anglais ?
Oui. Piper fournit des voix préentraînées dans plus de 20 langues, mais ne clone pas la voix d'une personne précise — il utilise des voix fixes et préentraînées par langue, plutôt que de cloner à partir d'un échantillon comme le fait XTTS v2.
Qu'est-ce qu'espeak-ng et quand l'utiliser à la place de Piper ?
espeak-ng est un moteur TTS à synthèse par formants qui fonctionne sur presque tout matériel, y compris des appareils en dessous des spécifications d'un Raspberry Pi, mais avec un rendu mécanique plutôt que naturel. À utiliser uniquement quand la RAM ou le CPU sont si limités que même Piper n'est pas viable — pour la plupart des projets Raspberry Pi, Piper reste le meilleur choix par défaut. Piper lui-même utilise espeak-ng en interne pour la conversion texte-vers-phonèmes.
De combien de RAM Piper a-t-il besoin sur un Raspberry Pi ?
Les fichiers modèle de Piper par voix tiennent généralement bien sous 100 Mo, et le moteur ne nécessite pas plusieurs gigaoctets de RAM pour fonctionner, ce qui est un avantage réel sur un Raspberry Pi 4 avec seulement 2 Go de RAM totale, partagée avec le système d'exploitation et tout autre service en cours.
Verdict
Piper est le bon choix par défaut pour la synthèse vocale locale sur un Raspberry Pi, et ce n'est pas un choix serré : il a été conçu au sein du projet d'assistant vocal hors ligne Rhasspy spécifiquement pour du matériel embarqué sans GPU, ne nécessite aucun GPU, s'installe en une commande, et reste pour ces raisons précises la voix locale par défaut de Home Assistant. Optez pour Kokoro si la qualité vocale compte plus qu'une réponse temps réel garantie, et seulement après l'avoir testé vous-même sur votre modèle spécifique de Raspberry Pi — sa performance temps réel documentée concerne du matériel généraliste, pas spécifiquement des cartes ARM de classe Pi. N'utilisez Coqui TTS ou XTTS v2 que si vous avez réellement besoin de clonage vocal, et prévoyez d'exécuter l'inférence sur une machine séparée équipée d'un GPU plutôt que sur le Pi lui-même. Ne recourez à espeak-ng qu'en dernier ressort, sur du matériel trop limité même pour Piper. En cas de doute, commencez par Piper — c'est l'outil que cette catégorie de matériel a été conçue pour faire fonctionner.
Sources
- Test de Piper TTS — le test complet de PromptQuorum, incluant l'historique de licence, les commandes d'installation et l'intégration Home Assistant.
- OHF-Voice/piper1-gpl sur GitHub — le dépôt Piper activement maintenu sous l'Open Home Foundation.
- Kokoro-82M sur Hugging Face — la fiche modèle officielle : nombre de paramètres, licence et architecture.
- Test de XTTS v2 — le test de PromptQuorum, incluant la performance en CPU seul et les réserves de licence référencées ici.
- Page produit du Raspberry Pi 5 — spécifications officielles du processeur BCM2712 et des configurations RAM.
- Construire un assistant vocal entièrement hors ligne — le guide pas à pas de PromptQuorum, incluant la latence mesurée sur Raspberry Pi 5 pour la chaîne complète Whisper + LLM + Piper.
