Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Piper TTS : avis (2026) — synthèse vocale neuronale locale et rapide
Voice, Speech & Multimodal

Piper TTS : avis (2026) — synthèse vocale neuronale locale et rapide

·11 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

**Piper est un moteur de synthèse vocale neuronale local et gratuit, créé au sein du projet d'assistant vocal Rhasspy par Michael Hansen, aujourd'hui maintenu par l'Open Home Foundation sur OHF-Voice/piper1-gpl, assez rapide pour fonctionner en temps réel sur du matériel CPU seul comme un Raspberry Pi.** Installation avec pip install piper-tts. Depuis 2025, le dépôt activement maintenu est sous licence GPL-3.0-or-later — un changement par rapport à la licence MIT du dépôt d'origine rhasspy/piper, désormais archivé. Pour un comparatif de licences entre Piper, Coqui TTS, XTTS v2, F5-TTS, Bark et StyleTTS 2, voir le guide des licences TTS locales de PromptQuorum.

Piper est un moteur de synthèse vocale neuronale local et gratuit, qui transforme du texte en audio parlé entièrement sur votre propre appareil, créé à l'origine au sein du projet open source d'assistant vocal Rhasspy par Michael Hansen. En 2025, le développement actif a migré vers un nouveau dépôt, OHF-Voice/piper1-gpl, maintenu par l'Open Home Foundation — l'organisation à but non lucratif derrière Home Assistant — et le dépôt d'origine rhasspy/piper a été archivé (passé en lecture seule) le 6 octobre 2025. Cet avis couvre cette histoire, de vraies commandes d'installation et d'utilisation, sa licence actuelle (passée de MIT à GPL-3.0-or-later) et les cas où Piper n'est pas le bon outil — avec un lien vers le comparatif de licences de PromptQuorum et sa comparaison face à ElevenLabs.

Piper TTS : avis (2026) — synthèse vocale neuronale locale et rapide

Points clés

  • Créé au sein du projet d'assistant vocal Rhasspy par Michael Hansen.
  • Dépôt d'origine rhasspy/piper archivé (lecture seule) le 6 octobre 2025, sous licence MIT.
  • Développement actif désormais sur OHF-Voice/piper1-gpl (créé le 28 mars 2025), sous l'Open Home Foundation, l'organisation à but non lucratif derrière Home Assistant.
  • Licence actuelle : GPL-3.0-or-later — un changement par rapport à la licence MIT du dépôt archivé.
  • Gratuit, aucune offre payante ; inférence CPU en temps réel, accélération GPU CUDA optionnelle.
  • Dernière version : v1.8.0, publiée le 4 septembre 2026.

📍 En une phrase

Piper est un moteur de synthèse vocale neuronale local et gratuit, créé à l'origine au sein du projet d'assistant vocal Rhasspy par Michael Hansen et aujourd'hui maintenu par l'Open Home Foundation, assez rapide pour fonctionner en temps réel sur du matériel CPU seul comme un Raspberry Pi, et dont la licence est passée de MIT à GPL-3.0-or-later lors du transfert vers un nouveau dépôt en 2025.

💬 En termes simples

C'est un programme que l'on installe avec pip install et qui transforme du texte tapé en audio parlé sur son propre appareil — pas de compte cloud, pas de connexion Internet nécessaire, et il tourne assez vite pour de la parole en temps réel même sur du matériel très modeste.

📌Remarque: La licence a changé en 2025. Si vous avez évalué Piper avant cette date en pensant qu'il était sous licence MIT, vérifiez à nouveau avant d'utiliser le dépôt actuellement maintenu dans un produit fermé — voir la section Licence et coût ci-dessous.

Histoire : de Rhasspy à l'Open Home Foundation

Piper est né au sein de Rhasspy, une boîte à outils open source pour construire des assistants vocaux entièrement hors ligne, où Michael Hansen l'a conçu comme un moteur de synthèse vocale local et rapide à associer à la reconnaissance vocale locale de Rhasspy — évitant un aller-retour vers une API TTS cloud à chaque réponse parlée. Piper utilise une architecture neuronale texte-vers-forme-d'onde de type VITS : le texte est d'abord converti en phonèmes (via espeak-ng), puis un modèle exporté vers ONNX Runtime synthétise directement une forme d'onde à partir de ces phonèmes, pour une inférence rapide même sur du matériel CPU seul.

**Le dépôt d'origine, rhasspy/piper, est devenu l'un des moteurs TTS locaux les plus utilisés** dans l'écosystème open source de la domotique et de l'accessibilité, accumulant plus de 11 000 étoiles GitHub sous sa licence MIT. Il est devenu le moteur de synthèse vocale locale par défaut du pipeline vocal de Home Assistant.

En 2025, le développement actif a migré vers un nouveau dépôt. OHF-Voice/piper1-gpl a été créé le 28 mars 2025, sous l'Open Home Foundation — l'organisation à but non lucratif qui gère aussi Home Assistant. Le dépôt d'origine rhasspy/piper a ensuite été archivé (passé en lecture seule) le 6 octobre 2025 ; il reste disponible sous sa licence MIT d'origine, mais ne reçoit plus de mises à jour.

Le nouveau dépôt porte une licence différente : GPL-3.0-or-later, et non plus la licence MIT d'origine. Le projet n'explique pas cette raison dans son README ou son changelog, mais piper1-gpl intègre espeak-ng pour la phonémisation, et espeak-ng est lui-même sous licence GPL-3.0 — une explication plausible du changement de licence, que PromptQuorum n'a toutefois pas pu confirmer comme raison officiellement énoncée. Au moment de la publication, le README du projet indique que l'Open Home Foundation recherche des mainteneurs supplémentaires pour Piper.

Qui a créé Piper ?

Piper a été créé par Michael Hansen au sein du projet open source d'assistant vocal Rhasspy. Le développement a ensuite migré vers un nouveau dépôt, OHF-Voice/piper1-gpl, maintenu par l'Open Home Foundation.

Ce que Piper fait réellement

Piper convertit du texte écrit en audio parlé via un pipeline de synthèse vocale neuronale : le texte est converti en phonèmes via espeak-ng, puis un modèle de voix entraîné synthétise une forme d'onde à partir de ces phonèmes, exécuté sur ONNX Runtime pour la rapidité.

  • Synthèse en ligne de commande. Exécuter python3 -m piper avec un modèle de voix téléchargé pour synthétiser un fichier WAV ou diffuser l'audio directement vers vos haut-parleurs.
  • API Python. Charger une voix avec PiperVoice.load() et appeler .synthesize_wav() ou le générateur en streaming .synthesize() depuis votre propre application Python.
  • Mode serveur web HTTP. Piper peut fonctionner comme un serveur web persistant afin que les modèles de voix restent chargés en mémoire, évitant le coût de rechargement de la CLI à chaque appel — recommandé pour un usage répété ou en production.
  • API C/C++ (libpiper). Une bibliothèque C++ native et sa CLI, portées depuis l'ancien dépôt Piper, pour intégrer Piper dans des applications non Python.
  • Injection de phonèmes bruts. Entourer du texte de `[[ ... ]] permet de passer directement des phonèmes IPA (issus de espeak-ng --ipa=3`), utile pour corriger la prononciation de noms ou de termes techniques.
  • Accélération GPU optionnelle. Passer --cuda (CLI) ou use_cuda=True (Python) active l'accélération CUDA via le paquet onnxruntime-gpu, bien que Piper soit conçu pour tourner à une vitesse acceptable sur CPU seul.
  • Voix multilingues entraînées par la communauté. Des dizaines de langues et de variantes régionales sont disponibles sous forme de modèles de voix téléchargeables séparément via Hugging Face ; la qualité varie selon la voix, celles-ci étant entraînées par différents contributeurs de la communauté.

Installer et exécuter Piper : étape par étape

Ce guide installe Piper via pip et effectue une première synthèse, en suivant la syntaxe documentée dans la CLI et l'API Python du projet.

  1. 1
    Installer Piper.
    Why it matters: Exécuter `pip install piper-tts` dans un environnement Python (Python 3.9+ recommandé). Cela installe le paquet `piper` et sa dépendance ONNX Runtime ; aucune configuration GPU ou CUDA n'est requise pour un usage CPU seul.
  2. 2
    Lister et télécharger une voix.
    Why it matters: Exécuter `python3 -m piper.download_voices` sans argument pour lister les voix disponibles, puis `python3 -m piper.download_voices en_US-lessac-medium` pour en télécharger une dans le répertoire courant.
  3. 3
    Synthétiser la parole en ligne de commande.
    Why it matters: Exécuter `python3 -m piper -m en_US-lessac-medium -f test.wav -- 'This is a test.'` pour écrire un fichier WAV. Avec `ffplay` installé, omettre `-f` pour entendre l'audio immédiatement au lieu de l'enregistrer.
  4. 4
    (Optionnel) Utiliser l'API Python plutôt que la CLI.
    Why it matters: Pour un usage répété dans une application, `from piper import PiperVoice; voice = PiperVoice.load("en_US-lessac-medium.onnx")` puis `voice.synthesize_wav(text, wav_file)` évite le coût de démarrage de la CLI à chaque appel.
  5. 5
    (Optionnel) Activer l'accélération GPU.
    Why it matters: Installer le paquet `onnxruntime-gpu`, puis passer `--cuda` en CLI ou `use_cuda=True` à `PiperVoice.load()` en Python. Optionnel — Piper est conçu pour tourner en temps réel sur CPU seul.
  6. 6
    (Optionnel) Exécuter le serveur web pour un usage répété.
    Why it matters: Pour une configuration en production ou à usage répété, exécuter le mode serveur web HTTP de Piper afin que le modèle de voix reste chargé en mémoire au lieu d'être rechargé à chaque appel de la CLI.
  7. 7
    (Optionnel) Corriger un mot mal prononcé avec des phonèmes bruts.
    Why it matters: Obtenir les phonèmes IPA d'un mot avec `espeak-ng -v en-us --ipa=3 -q <mot>`, puis les entourer de `[[ ... ]]` dans le texte d'entrée pour remplacer la prononciation automatique de Piper pour ce mot.

Exemples d'utilisation réels

Au-delà du guide d'installation de base ci-dessus, voici des schémas d'utilisation courants issus de la documentation officielle du projet.

  • Injection de phonèmes bruts pour corriger la prononciation : entourer du texte comme `The [[ bˈætmæn ]] not [[ bɹˈuːs wˈeɪn ]] avec des phonèmes IPA obtenus via espeak-ng -v en-us --ipa=3 -q <mot>`.
  • API C/C++ libpiper expose piper_create() (ou piper_create_with_options() pour un contrôle plus fin) pour intégrer Piper directement dans une application native sans environnement Python.
python
# Ligne de commande : écrire un fichier WAV
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."

# Ligne de commande : jouer l'audio immédiatement (nécessite ffplay)
python3 -m piper -m en_US-lessac-medium -- "This will play on your speakers."

# API Python
import wave
from piper import PiperVoice

voice = PiperVoice.load("en_US-lessac-medium.onnx")
with wave.open("test.wav", "wb") as wav_file:
    voice.synthesize_wav("Welcome to the world of speech synthesis!", wav_file)

# API Python : ajuster la synthèse (vitesse, volume, expressivité)
from piper import SynthesisConfig

syn_config = SynthesisConfig(
    volume=0.5,        # deux fois moins fort
    length_scale=2.0,  # deux fois plus lent
    noise_scale=1.0,   # plus de variation audio
    noise_w_scale=1.0, # plus de variation d'élocution
)
voice.synthesize_wav("Custom synthesis settings.", wav_file, syn_config=syn_config)

# API Python : accélération GPU (nécessite onnxruntime-gpu)
voice = PiperVoice.load("en_US-lessac-medium.onnx", use_cuda=True)

# API Python : synthèse en streaming
for chunk in voice.synthesize("Streamed audio, chunk by chunk."):
    play_audio(chunk.audio_int16_bytes, chunk.sample_rate)

Licence et coût

**Le dépôt Piper activement maintenu, OHF-Voice/piper1-gpl, est sous licence GPL-3.0-or-later**, confirmé par les métadonnées publiées du paquet piper-tts sur PyPI. C'est un changement par rapport au dépôt d'origine rhasspy/piper, qui était sous licence MIT avant d'être archivé le 6 octobre 2025, et qui reste disponible sous cette licence MIT, sans plus être maintenu.

GPL-3.0 est une licence copyleft, ce qui la distingue nettement de MIT pour un usage commercial. Piper peut être utilisé gratuitement, y compris commercialement, pour générer de la parole. Mais GPL-3.0 exige que si vous distribuez une version modifiée du code source de Piper lui-même — par exemple un fork intégré ou lié statiquement à votre produit — vous devez publier ce code modifié sous les mêmes conditions GPL-3.0. Utiliser Piper tel quel comme outil externe (appeler sa CLI, son paquet Python ou son serveur web comme processus séparé) ne place généralement pas le reste du code de votre application sous GPL, mais la limite exacte dépend du degré de liaison entre votre code et celui de Piper. Ce paragraphe explique la forme générale de la licence ; ce n'est pas un avis juridique — consultez un avocat pour votre déploiement spécifique avant de commercialiser un produit construit sur Piper.

Il n'y a aucune offre payante, abonnement ou frais de licence pour Piper lui-même. Les seuls coûts sont le matériel sur lequel il fonctionne et votre propre temps de développement. Les modèles de voix sont téléchargés séparément depuis un dépôt Hugging Face partagé ; vérifiez la licence indiquée pour chaque voix avant de la redistribuer, car les voix sont fournies par différents contributeurs de la communauté et ne partagent pas nécessairement la même licence que le code de Piper.

Quelle licence utilise Piper ?

Le dépôt Piper activement maintenu (OHF-Voice/piper1-gpl) est sous licence GPL-3.0-or-later. Le dépôt d'origine, désormais archivé, rhasspy/piper était sous licence MIT. C'est une réelle différence pour un usage commercial — GPL-3.0 impose la même licence si vous distribuez des versions modifiées du code source de Piper lui-même, ce que MIT n'exigeait pas.

Ce pour quoi Piper n'est pas adapté

Piper est un moteur de synthèse vocale locale rapide et généraliste, pas un outil de clonage de voix ou de parole expressive. C'est le mauvais outil dans les cas suivants :

  • Clonage vocal expressif, émotionnel ou à partir de quelques secondes. Piper synthétise la parole à partir de modèles de voix pré-entraînés, pas à partir d'un court extrait audio de référence d'une personne précise. Pour cloner une voix à partir de quelques secondes d'échantillon audio, ou obtenir une élocution plus expressive, XTTS v2 est conçu pour cela — voir le guide des licences TTS locales de PromptQuorum pour ses conditions de licence (non commerciales).
  • Clonage multi-locuteur à partir d'un court échantillon. De même, Piper n'a aucun mécanisme intégré pour générer à la volée une nouvelle voix à partir d'un échantillon audio d'un locuteur donné ; chaque voix est un modèle entraîné et distribué séparément.
  • Obligations copyleft de la GPL-3.0 dans un produit fermé. Si votre cas d'usage implique de modifier et de redistribuer le code source de Piper lui-même dans un binaire fermé, la licence GPL-3.0-or-later du dépôt actuel est une contrainte réelle que le dépôt d'origine, sous MIT, n'avait pas. Relire la section Licence et coût ci-dessus et consulter un avocat avant ce type de déploiement.
  • Qualité vocale garantie et homogène sur toutes les langues. Les voix étant entraînées et fournies par différents contributeurs de la communauté, la qualité varie sensiblement selon la langue et la voix — vérifier des échantillons dans la langue cible avant de s'engager sur Piper pour une application en production.
  • Certitude de maintenance à long terme. Au moment de la publication, le README du projet indique que l'Open Home Foundation recherche des mainteneurs supplémentaires pour Piper, un point à prendre en compte avant de construire une infrastructure critique dessus.

Alternatives à Piper

Coqui TTS

Idéal pour:
Boîte à outils multi-backend flexible (VITS, Tacotron2, XTTS) avec large support linguistique
Licence:
MPL-2.0

XTTS v2

Idéal pour:
Clonage vocal à partir de quelques secondes d'audio de référence, sur 17 langues
Licence:
CPML (non commercial)

StyleTTS 2

Idéal pour:
Meilleure qualité de narration anglaise naturelle (sans clonage vocal)
Licence:
MIT

Bark

Idéal pour:
Audio expressif non verbal — rires, soupirs, ambiances sonores
Licence:
MIT

ElevenLabs

Idéal pour:
API cloud gérée pour les équipes préférant ne pas s'auto-héberger, avec clonage vocal commercial
Licence:
Propriétaire (API cloud payante)

Questions fréquentes

Qu'est-ce que Piper ?

Piper est un moteur de synthèse vocale neuronale local et gratuit, créé au sein du projet d'assistant vocal Rhasspy par Michael Hansen, aujourd'hui maintenu par l'Open Home Foundation, qui convertit du texte en audio parlé assez rapidement pour fonctionner en temps réel sur du matériel CPU seul.

Piper est-il gratuit ?

Oui. Piper n'a aucune offre payante, abonnement ou frais de licence. Il est actuellement sous licence GPL-3.0-or-later, gratuite à l'usage mais qui impose des conditions à la distribution de versions modifiées du code source de Piper lui-même — voir la section Licence et coût pour les détails.

Ai-je besoin d'un GPU pour exécuter Piper ?

Non. Piper est conçu pour fonctionner en temps réel sur du matériel CPU seul, y compris un Raspberry Pi. Une accélération GPU CUDA optionnelle est disponible via le paquet onnxruntime-gpu pour un débit plus élevé.

Quelle est la différence entre rhasspy/piper et OHF-Voice/piper1-gpl ?

rhasspy/piper est le dépôt d'origine, créé au sein du projet Rhasspy et sous licence MIT ; il a été archivé (lecture seule) le 6 octobre 2025. OHF-Voice/piper1-gpl est le dépôt successeur activement maintenu, créé le 28 mars 2025 sous l'Open Home Foundation, et sous licence GPL-3.0-or-later au lieu de MIT.

Piper peut-il cloner la voix d'une personne précise ?

Pas à partir d'un court échantillon audio. Piper synthétise la parole à l'aide de modèles de voix pré-entraînés que l'on télécharge et sélectionne ; il ne clone pas de nouvelle voix à la volée à partir de quelques secondes d'audio de référence. Pour cela, voir XTTS v2, conçu spécifiquement pour le clonage vocal en quelques secondes.

Piper est-il utilisé dans Home Assistant ?

Oui. Piper est le moteur de synthèse vocale locale par défaut du pipeline d'assistant vocal de Home Assistant, maintenu par l'Open Home Foundation, la même organisation à but non lucratif qui gère Home Assistant.

Qui maintient Piper aujourd'hui ?

Piper est maintenu sous l'Open Home Foundation, sur le dépôt OHF-Voice/piper1-gpl, après que le développement y a migré depuis le dépôt d'origine hébergé sur Rhasspy en 2025. Le README du projet indique que l'Open Home Foundation recherche actuellement des mainteneurs supplémentaires.

Quelle est la dernière version de Piper ?

La dernière version stable est la v1.8.0, publiée le 4 septembre 2026, selon la page des releases GitHub du projet.

Verdict

Piper reste l'un des moyens les plus rapides d'obtenir une vraie synthèse vocale locale sur du matériel modeste — sa performance en temps réel sur CPU seul en a fait la voix par défaut de Home Assistant, et cela n'a pas changé sous ses nouveaux mainteneurs. Ce qui a changé, et que tout lecteur évaluant Piper en 2026 doit connaître, c'est la licence : le dépôt activement maintenu est passé de MIT à GPL-3.0-or-later lors du transfert vers l'Open Home Foundation en 2025, une réelle différence pour quiconque prévoit d'intégrer et de redistribuer du code source Piper modifié dans un produit fermé. Il reste gratuit, bien documenté et activement publié (v1.8.0 à la date de septembre 2026), même si ses propres mainteneurs recherchent ouvertement de l'aide. Pour une synthèse vocale rapide, hors ligne et généraliste sur du matériel de classe CPU, Piper est un choix bien vérifié et sans coût — pour un clonage vocal expressif en quelques secondes, associez cet avis à la couverture de XTTS v2 par PromptQuorum ou comparez avec l'alternative cloud gérée dans le comparatif ElevenLabs vs TTS local.

Sources

← Retour aux LLM locaux avancés