Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Piper vs Kokoro TTS (2026) : quel moteur vocal local choisir ?
Voice, Speech & Multimodal

Piper vs Kokoro TTS (2026) : quel moteur vocal local choisir ?

·11 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Utilisez Piper si vous avez besoin, des deux, du moteur de synthèse vocale local le plus rapide et le plus léger — il tourne en temps réel sur un Raspberry Pi sans GPU. Utilisez Kokoro si la qualité vocale compte plus que la vitesse brute — son modèle de 82 millions de paramètres produit un audio nettement plus naturel tout en tournant encore sur CPU. Piper est sous licence GPL-3.0-or-later (son dépôt d'origine, archivé, était sous licence MIT) ; Kokoro est sous licence Apache-2.0. Aucun des deux ne clone de voix à partir d'un échantillon — tous deux proposent un ensemble fixe de voix préentraînées. Pour le clonage vocal, consultez plutôt le test XTTS v2 de PromptQuorum.

Piper et Kokoro sont deux moteurs de synthèse vocale (TTS) à poids ouverts, entièrement locaux, qui résolvent des problèmes différents : Piper, développé à l'origine au sein du projet d'assistant vocal Rhasspy et désormais maintenu par l'Open Home Foundation sous OHF-Voice/piper1-gpl, est l'option la plus rapide et la plus légère en ressources des deux, fonctionnant confortablement sur un Raspberry Pi sans GPU. Kokoro, un modèle de 82 millions de paramètres publié par le développeur pseudonyme hexgrad, sacrifie une partie de cette efficacité brute pour un rendu audio nettement plus naturel, tout en restant assez petit pour tourner sur CPU. Aucun des deux moteurs ne clone de voix à partir d'un court échantillon audio — tous deux proposent un ensemble fixe de voix préentraînées. Ce comparatif couvre les commandes d'installation réelles, les licences actuelles, les besoins matériels, et lequel choisir selon l'usage.

Piper vs Kokoro TTS (2026) : quel moteur vocal local choisir ?

Points clés

  • Piper : issu à l'origine de l'écosystème Rhasspy/Home Assistant, désormais maintenu par l'Open Home Foundation ; basé sur ONNX Runtime ; tourne confortablement sur un Raspberry Pi sans GPU.
  • Kokoro : un modèle de 82 millions de paramètres par hexgrad, dérivé de StyleTTS2 et ISTFTNet, sous licence Apache-2.0 ; tourne bien sur CPU ou un GPU modeste.
  • Aucun des deux moteurs n'effectue de clonage vocal zero-shot ; tous deux proposent des ensembles fixes de voix préentraînées.
  • Licence Piper : GPL-3.0-or-later (dépôt actuel) ; le dépôt d'origine, archivé, était sous licence MIT. Licence Kokoro : Apache-2.0.
  • Piper l'emporte en vitesse brute et en légèreté ; Kokoro est largement décrit comme sonnant plus naturel dans les comparatifs d'écoute communautaires.
  • Utilisez Piper pour les appareils embarqués/edge et les assistants vocaux ; utilisez Kokoro quand la qualité audio compte plus que le fait de tenir sur le matériel le plus petit possible.

📍 En une phrase

Piper est le moteur de synthèse vocale local le plus rapide et le plus léger, tournant sur un Raspberry Pi sans GPU (licence GPL-3.0-or-later), tandis que Kokoro est un modèle à poids ouverts de 82 millions de paramètres (Apache-2.0) qui sacrifie un peu de vitesse pour un audio nettement plus naturel ; aucun des deux ne clone de voix à partir d'un échantillon.

💬 En termes simples

Les deux transforment du texte en audio parlé entièrement sur votre propre ordinateur, sans appel à une API cloud. Piper est plus petit et plus rapide, il fonctionne donc sur du matériel bon marché comme un Raspberry Pi, mais sonne un peu plus robotique. Kokoro est un modèle légèrement plus grand qui sonne nettement plus humain, au prix d'un peu plus de puissance de calcul nécessaire.

📌Remarque: Ni Piper ni Kokoro ne clonent de voix à partir d'un court extrait de référence. Pour cette capacité, voir le test XTTS v2 de PromptQuorum — notez que la licence de XTTS v2 est non commerciale, contrairement à Piper et Kokoro.

Ce qu'est vraiment chaque moteur

Piper et Kokoro résolvent le même problème de base — transformer du texte en audio parlé sur du matériel local, sans que les données ne quittent la machine — mais ils viennent de lignées différentes et font des compromis taille/qualité différents.

  • Piper est un moteur de synthèse vocale neuronale, créé à l'origine par Michael Hansen au sein de Rhasspy, une boîte à outils open source pour assistants vocaux hors ligne. Il convertit le texte en phonèmes avec espeak-ng, puis synthétise une forme d'onde à partir de ces phonèmes à l'aide d'un modèle de type VITS exporté vers ONNX Runtime pour une inférence rapide, y compris sur du matériel CPU uniquement. Il est devenu le moteur TTS local par défaut du pipeline vocal de Home Assistant et est aujourd'hui maintenu par l'Open Home Foundation sous OHF-Voice/piper1-gpl. PromptQuorum le couvre en détail dans un test dédié à Piper.
  • Kokoro est un modèle TTS à poids ouverts de 82 millions de paramètres, publié sur Hugging Face par le développeur connu sous le nom de hexgrad. Son architecture repose sur StyleTTS 2 avec un vocodeur ISTFTNet, dans une conception decoder-only sans étape de diffusion — un pipeline plus petit et plus simple que de nombreux modèles TTS avec un plus grand nombre de paramètres. Selon sa fiche modèle Hugging Face, il a été entraîné sur quelques centaines d'heures d'audio sous licence permissive ou du domaine public, et la version 1.0 a été publiée le 27 janvier 2025.
  • Aucun des deux modèles ne clone de voix à partir d'un court extrait de référence. Piper et Kokoro proposent chacun un ensemble fixe de voix préentraînées parmi lesquelles choisir — une capacité fondamentalement différente d'un modèle de clonage vocal comme XTTS v2, qui synthétise la parole dans une nouvelle voix à partir de 6 secondes d'audio d'échantillon, mais sous licence non commerciale.
  • Les deux fonctionnent entièrement hors ligne, sur votre propre matériel. Ni texte ni audio ne sont envoyés à une API cloud par l'un ou l'autre moteur — l'intégralité du pipeline de synthèse s'exécute localement, ce qui compte pour les applications sensibles à la confidentialité et pour éviter les coûts d'API TTS cloud facturés au caractère.

Piper vs Kokoro : comparatif côte à côte

Piper l'emporte en vitesse et en légèreté matérielle ; Kokoro l'emporte sur la qualité audio perçue. Le tableau ci-dessous résume les vrais compromis — considérez la ligne « Qualité vocale » comme une impression communautaire qualitative et largement partagée plutôt qu'un score de benchmark précis, car PromptQuorum n'a pas pu localiser un seul benchmark chiffré, faisant autorité, comparant directement les deux.

Origine / mainteneur

Piper:
Projet Rhasspy → Open Home Foundation
Kokoro:
Développeur indépendant (hexgrad)

Nombre de paramètres

Piper:
Aucun chiffre unique publié (type VITS, modèles par voix)
Kokoro:
82 millions de paramètres

Architecture

Piper:
Type VITS, ONNX Runtime
Kokoro:
StyleTTS 2 + ISTFTNet, decoder-only

Licence

Piper:
GPL-3.0-or-later (dépôt actuel)
Kokoro:
Apache-2.0

Besoins matériels

Piper:
CPU uniquement, temps réel sur un Raspberry Pi
Kokoro:
CPU ou GPU modeste

Qualité vocale (retours communautaires)

Piper:
Rapide, correct pour sa taille, plutôt robotique
Kokoro:
Largement décrit comme plus naturel / expressif

Clonage vocal

Piper:
Non — voix préentraînées fixes
Kokoro:
Non — voix préentraînées fixes

Installation

Piper:
pip install piper-tts
Kokoro:
pip install kokoro

Exemples d'utilisation réels

Ces commandes suivent le modèle d'installation et d'API documenté par chaque projet. Vérifiez la documentation GitHub/Hugging Face actuelle de chaque projet avant tout déploiement, car les options CLI et les noms de paquets peuvent changer d'une version à l'autre.

  • Piper démarre plus vite. Ses modèles ONNX par voix se chargent rapidement et la synthèse est quasi instantanée sur CPU, ce qui en fait le choix courant pour les assistants vocaux interactifs sur du matériel contraint.
  • Le pipeline de Kokoro regroupe la synthèse en segments (le tuple gs/ps/audio ci-dessus) — bon à savoir avant de supposer qu'un seul appel renvoie un tampon audio continu pour un texte long.
python
# ── Piper : installation et synthèse ───────────────────────────
pip install piper-tts
python3 -m piper.download_voices en_US-lessac-medium
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."

# API Python de Piper
from piper import PiperVoice
voice = PiperVoice.load("en_US-lessac-medium.onnx")
with open("test.wav", "wb") as wav_file:
    voice.synthesize_wav("Fast, local speech synthesis.", wav_file)

# ── Kokoro : installation et synthèse ──────────────────────────
pip install kokoro soundfile

# API Python de Kokoro (selon hexgrad/Kokoro-82M sur Hugging Face)
from kokoro import KPipeline
import soundfile as sf

pipeline = KPipeline(lang_code="a")  # "a" = anglais américain
generator = pipeline(
    "Kokoro produces noticeably natural-sounding speech from a small model.",
    voice="af_heart",
)
for i, (gs, ps, audio) in enumerate(generator):
    sf.write(f"output_{i}.wav", audio, 24000)

Licence et coût

Le dépôt activement maintenu de Piper, OHF-Voice/piper1-gpl, est sous licence GPL-3.0-or-later. C'est un changement par rapport au dépôt d'origine rhasspy/piper, qui était sous licence MIT avant d'être archivé (rendu en lecture seule) le 6 octobre 2025, et reste disponible sous cette licence MIT, mais non maintenu. La GPL-3.0 est une licence copyleft : vous pouvez utiliser Piper gratuitement, y compris commercialement, pour générer de la parole, mais si vous distribuez une version modifiée du code source propre de Piper, vous devez publier cette modification sous les mêmes termes GPL-3.0. Utiliser Piper comme outil externe non modifié (sa CLI, son paquet Python, ou un serveur web appelé comme processus séparé) ne place généralement pas le reste de votre application sous GPL, mais la limite exacte dépend de l'étroitesse du lien entre votre code et celui de Piper — ceci n'est pas un conseil juridique, consultez un avocat pour votre déploiement spécifique.

Kokoro est sous licence Apache-2.0, confirmée sur sa fiche modèle Hugging Face. Apache-2.0 est une licence permissive sans obligation de copyleft — vous pouvez utiliser, modifier et redistribuer Kokoro, y compris dans des produits commerciaux à code source fermé, sans être tenu de publier votre propre code source, sous réserve des conditions standard d'attribution et de concession de brevet de la licence.

Aucun des deux moteurs n'a de palier payant, d'abonnement ou de frais de licence. Les seuls coûts sont le matériel sur lequel vous les exécutez et votre propre temps de développement. Si vous voulez plutôt une API TTS cloud gérée et payante avec clonage vocal commercial, voir le comparatif ElevenLabs vs TTS local de PromptQuorum.

Kokoro TTS est-il gratuit pour un usage commercial ?

Oui. Kokoro est sous licence Apache-2.0, une licence permissive sans obligation de copyleft, il peut donc être utilisé dans des produits commerciaux à code source fermé sans obligation de publier votre propre code source, sous réserve des conditions standard d'attribution et de concession de brevet de la licence. Ceci n'est pas un conseil juridique — lisez vous-même la licence Apache-2.0 avant tout déploiement commercial.

Piper est-il gratuit pour un usage commercial ?

Oui, générer de la parole avec Piper est gratuit pour un usage commercial. Sa licence actuelle, GPL-3.0-or-later, est une licence copyleft qui n'impose des conditions que si vous distribuez une version modifiée du code source propre de Piper — l'utiliser comme outil externe ne place généralement pas le reste du code de votre application sous GPL. Ceci n'est pas un conseil juridique — consultez un avocat pour votre déploiement spécifique.

Qui devrait utiliser lequel

Choisissez Piper pour les appareils embarqués, les assistants vocaux et tout déploiement où les cycles CPU ou la mémoire sont fortement contraints. Choisissez Kokoro quand la qualité audio est la priorité et que vous disposez d'au moins un budget CPU ou GPU modeste à y consacrer.

  • Choisissez Piper si : vous tournez sur un Raspberry Pi ou un appareil similairement contraint, avez besoin de la latence la plus faible possible jusqu'au premier audio, ou vous intégrez au pipeline vocal de Home Assistant, où Piper est le moteur TTS local par défaut.
  • Choisissez Kokoro si : vous produisez des livres audio, des narrations, ou tout contenu où les auditeurs remarqueraient une parole robotique, et que vous disposez d'une marge CPU ou GPU au-delà du strict minimum.
  • Ne choisissez ni l'un ni l'autre, et voyez plutôt XTTS v2, si : vous devez cloner la voix d'une personne précise à partir d'un court extrait de référence — Piper comme Kokoro n'utilisent que des voix préentraînées fixes, et aucun des deux n'effectue de clonage vocal. Voir le test XTTS v2 de PromptQuorum (licence non commerciale) ou le guide des licences TTS locales pour des alternatives capables de clonage et leurs licences.
  • Ne choisissez ni l'un ni l'autre, et voyez plutôt le comparatif ElevenLabs, si : vous avez besoin d'un clonage vocal de qualité commerciale avec une licence payante claire et ne voulez pas auto-héberger. Voir le comparatif ElevenLabs vs TTS local de PromptQuorum.

Ce pour quoi aucun des deux n'est adapté

Piper et Kokoro sont tous deux des moteurs TTS à voix fixe, sans clonage. Aucun des deux n'est le bon outil pour les situations suivantes :

  • Cloner la voix d'une personne précise à partir d'un extrait échantillon. Les deux moteurs ne proposent que des voix préentraînées — aucun mécanisme dans l'un ou l'autre ne permet de générer de la parole dans une nouvelle voix, jamais entendue auparavant, à partir d'un court enregistrement de référence. Voir plutôt XTTS v2, en notant sa licence non commerciale.
  • Audio expressif, non vocal (rires, soupirs, sons ambiants). Les deux moteurs synthétisent de la parole, pas l'éventail audio expressif plus large que cible un modèle comme Bark.
  • Fidélité audio maximale possible, indépendamment du coût en ressources. Pour les lecteurs qui veulent spécifiquement la meilleure qualité de narration anglaise et ne sont pas contraints en ressources, le test StyleTTS 2 de PromptQuorum couvre un modèle avec une architecture sous-jacente comparable à Kokoro, mais un compromis taille/qualité différent.
  • Une base de code GPL-3.0 au sein d'un produit à code source fermé qui modifie le code source propre de Piper. Si votre plan de déploiement implique de forker ou de lier statiquement du code source Piper modifié dans un binaire à code source fermé, la licence GPL-3.0-or-later actuelle de Piper est une contrainte réelle — la licence Apache-2.0 de Kokoro n'a pas cette restriction.

Alternatives

XTTS v2

Idéal pour:
Clonage vocal à partir de 6 secondes d'audio de référence
Licence:
CPML (non commerciale)

Boîte à outils Coqui TTS

Idéal pour:
Le logiciel qui exécute XTTS v2 et d'autres modèles
Licence:
MPL-2.0 (boîte à outils uniquement)

Bark

Idéal pour:
Audio expressif, non vocal — rires, soupirs, sons ambiants
Licence:
MIT

StyleTTS 2

Idéal pour:
Narration anglaise la plus naturelle (sans clonage vocal)
Licence:
MIT

ElevenLabs

Idéal pour:
API cloud gérée avec clonage vocal commercial
Licence:
Propriétaire (API cloud payante)

Questions fréquentes

Quelle est la principale différence entre Piper et Kokoro TTS ?

Piper est un moteur TTS neuronal léger et entièrement local, optimisé pour la vitesse et une consommation de ressources minimale — il tourne en temps réel sur du matériel CPU uniquement, y compris un Raspberry Pi. Kokoro est un modèle à poids ouverts de 82 millions de paramètres qui produit un audio nettement plus naturel, au prix d'un peu plus de puissance de calcul nécessaire, tout en tournant encore sur CPU ou un GPU modeste.

Lequel sonne le plus naturel, Piper ou Kokoro ?

Kokoro est largement décrit comme sonnant plus naturel que Piper dans les comparatifs d'écoute communautaires. PromptQuorum n'a pas pu localiser un seul benchmark chiffré, faisant autorité et vérifié indépendamment, comparant directement les deux moteurs — traitez donc cela comme une impression communautaire qualitative et largement partagée, plutôt qu'un score mesuré.

Piper ou Kokoro prennent-ils en charge le clonage vocal ?

Non. Les deux moteurs proposent un ensemble fixe de voix préentraînées parmi lesquelles choisir — aucun des deux ne clone une nouvelle voix à partir d'un court échantillon audio de référence. Pour le clonage vocal, voir le test XTTS v2 de PromptQuorum, en notant sa licence non commerciale.

Puis-je faire tourner Kokoro sans GPU ?

Oui. Avec ses 82 millions de paramètres, Kokoro tourne sur CPU, bien qu'un GPU modeste accélère la synthèse. Il ne nécessite pas de matériel GPU, contrairement à ce qu'exigent souvent les modèles TTS ou de clonage vocal plus volumineux.

Piper peut-il tourner sur un Raspberry Pi ?

Oui — la synthèse en temps réel, uniquement sur CPU, sur un Raspberry Pi est l'un des principaux objectifs de conception de Piper, et c'est le moteur de synthèse vocale local par défaut du pipeline vocal de Home Assistant, qui tourne fréquemment sur du matériel Raspberry Pi.

Quelle licence utilise Kokoro ?

Kokoro est sous licence Apache-2.0, une licence permissive sans obligation de copyleft, confirmée sur sa fiche modèle Hugging Face. Il peut être utilisé dans des produits commerciaux à code source fermé sans obligation de publier votre propre code source, sous réserve des conditions standard d'attribution et de concession de brevet de la licence.

Quelle licence utilise Piper ?

Le dépôt activement maintenu de Piper (OHF-Voice/piper1-gpl) est sous licence GPL-3.0-or-later. Le dépôt d'origine, rhasspy/piper, aujourd'hui archivé, était sous licence MIT. La GPL-3.0 n'impose des conditions que si vous distribuez une version modifiée du code source propre de Piper ; l'utiliser comme outil externe ne place généralement pas votre propre application sous GPL.

Qui maintient Piper et Kokoro ?

Piper a été créé à l'origine par Michael Hansen au sein du projet d'assistant vocal Rhasspy ; le développement actif est aujourd'hui maintenu par l'Open Home Foundation, l'organisation à but non lucratif derrière Home Assistant. Kokoro a été publié par le développeur connu sous le nom de hexgrad et est distribué via Hugging Face.

Combien de langues Piper et Kokoro prennent-ils en charge ?

Les 54 voix intégrées de Kokoro, selon sa fiche modèle Hugging Face, couvrent 8 groupes de langues et d'accents, dont l'anglais américain et britannique, l'espagnol, le français, l'hindi, l'italien, le japonais, le portugais brésilien et le chinois mandarin. Le catalogue de voix de Piper est plus vaste et plus fragmenté — des dizaines de langues et de variantes régionales, contribuées par différents membres de la communauté, avec une qualité variable selon la voix.

Verdict

Piper et Kokoro ne se disputent pas exactement la même tâche. Piper est le bon choix quand la contrainte est matérielle — un Raspberry Pi, un appareil embarqué, un assistant vocal qui doit répondre instantanément sur CPU seul — et sa licence GPL-3.0-or-later est gratuite pour un usage commercial tant que vous ne redistribuez pas de code source Piper modifié. Kokoro est le bon choix quand la contrainte est la qualité audio : avec 82 millions de paramètres, il reste petit et adapté au CPU, mais les comparatifs d'écoute communautaires le décrivent systématiquement comme sonnant plus naturel que Piper, et sa licence Apache-2.0 n'a aucune restriction de copyleft. Aucun des deux outils ne clone de voix à partir d'un extrait échantillon — si c'est le véritable besoin, ce comparatif n'est pas la réponse ; voir plutôt le test XTTS v2 de PromptQuorum, ou le comparatif ElevenLabs pour une option commerciale gérée. En cas de doute, commencez par Piper pour l'installation la plus simple et les résultats les plus rapides, et passez à Kokoro si la qualité de sortie ne répond pas à vos attentes.

Sources

← Retour aux LLM locaux avancés