Points clés
- Izwi (github.com/izwi-ai/izwi) est un runtime d'IA vocale gratuit, open source et local pour la synthèse vocale, la reconnaissance vocale et les tâches audio associées
- « Izwi » est le mot zoulou et xhosa pour « voix »
- Sous licence MIT, confirmée via le fichier LICENSE du dépôt GitHub
- Livré sous forme d'application de bureau (macOS, Linux, Windows), d'interface web et d'outil en ligne de commande, tous construits sur le même serveur d'inférence local
- Plus de 383 étoiles GitHub et 40 forks au moment de cette revue
- Encore en bêta : la dernière version taguée est v0.1.0-beta-17 (22 juin 2026), même si le dernier push de commit du dépôt date du 13 septembre 2026
📍 En une phrase
Izwi est un runtime d'IA vocale local, gratuit et open source (MIT) — application de bureau, interface web et CLI — qui regroupe synthèse vocale, reconnaissance vocale, diarisation des locuteurs et clonage de voix derrière une seule API compatible OpenAI, avec plus de 383 étoiles GitHub.
💬 En termes simples
Izwi est un logiciel que vous installez sur votre propre ordinateur, qui transforme du texte en audio parlé, transforme de l'audio parlé en texte, et peut cloner une voix à partir d'un échantillon — le tout en local, plutôt que via des API cloud payantes comme celles d'ElevenLabs ou les points de terminaison audio d'OpenAI. Comme son API correspond au format d'OpenAI, de nombreuses applications déjà conçues pour cette API peuvent pointer vers Izwi à la place, avec des changements minimes.
📌Remarque: Cette revue s'appuie sur le dépôt GitHub d'Izwi, son README et son historique de versions via l'API GitHub. Elle n'affirme pas que PromptQuorum a effectué un benchmark indépendant de la qualité audio ou de la précision de transcription d'un quelconque modèle pris en charge par Izwi.
Qu'est-ce qu'Izwi ?
Izwi est un runtime d'IA vocale gratuit, open source et local qui regroupe plusieurs tâches vocales distinctes — synthèse vocale, reconnaissance vocale, diarisation et clonage de voix — derrière une seule API compatible OpenAI, au lieu de nécessiter un service cloud différent pour chacune. Son propre README le décrit comme une « IA vocale local-first pour les workflows de parole, de chat et d'audio ».
- Type de produit : un serveur d'inférence local avec trois interfaces — une application de bureau native, une interface web dans le navigateur et une CLI — parlant toutes au même moteur sous-jacent
- Dépôt : github.com/izwi-ai/izwi, créé le 23 janvier 2026
- Licence : MIT, confirmée via le fichier LICENSE du dépôt
- Site web : izwiai.com, avec une documentation distincte sur izwiai.com/docs
- Financement : aucun tour de financement, investisseur ou soutien commercial n'a été trouvé pour cette revue — considérez Izwi comme un projet open source apparemment indépendant, soutenu par la communauté
- Ampleur : plus de 383 étoiles GitHub, 40 forks, au moment de cette revue
Que peut-on faire avec Izwi ?
Izwi couvre quatre tâches vocales liées — parler, écouter, cloner et organiser des modèles locaux — via une interface cohérente, que vous utilisiez l'application de bureau, l'interface web ou la CLI.
- Synthèse vocale : convertir du texte en audio parlé, y compris des projets « Studio » de longue durée, avec prise en charge de la conception de voix et des voix personnalisées enregistrées
- Clonage de voix : générer de la parole dans une voix clonée à partir d'un échantillon de référence, en utilisant des familles de modèles TTS compatibles
- Reconnaissance vocale : transcrire des fichiers audio, plus une transcription en flux en temps réel pour l'audio en direct
- Diarisation des locuteurs et alignement forcé : identifier qui a dit quoi dans un audio à plusieurs locuteurs, et aligner le texte transcrit sur les horodatages audio exacts
- Conversation vocale en temps réel : combiner reconnaissance vocale automatique locale, modèle de chat local et synthèse vocale locale pour un échange parlé, similaire dans son concept à un assistant vocal
- Gestion des modèles : télécharger, charger, décharger et supprimer des modèles depuis l'application ; consulter l'historique des conversations et exporter les résultats
- API compatible OpenAI : routes
/v1pour les modèles, les complétions de chat, la synthèse audio et les transcriptions audio, avec prise en charge en aperçu du format de l'API Responses, de sorte que le code client existant pour l'API OpenAI peut souvent pointer vers un serveur Izwi local avec des changements minimes
Quels modèles Izwi prend-il en charge ?
Izwi est un runtime, pas un modèle unique — il prend en charge plusieurs familles de modèles interchangeables par tâche, afin que vous choisissiez celle qui correspond à votre matériel et à vos exigences de qualité.
Synthèse vocale
- Familles de modèles prises en charge (selon le catalogue d'Izwi):
- Qwen3-TTS, Kokoro-82M, Voxtral TTS, VibeVoice
Reconnaissance vocale
- Familles de modèles prises en charge (selon le catalogue d'Izwi):
- Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio, Voxtral Mini
Diarisation et alignement
- Familles de modèles prises en charge (selon le catalogue d'Izwi):
- Sortformer (diarisation), Qwen3 ForcedAligner (alignement d'horodatage)
Chat
- Familles de modèles prises en charge (selon le catalogue d'Izwi):
- Qwen3, Qwen3.5, LFM2.5, Gemma
Exécutez izwi list en local pour voir le catalogue actuellement activé, car les modèles pris en charge peuvent être ajoutés ou modifiés d'une version à l'autre. Certains poids de modèles ont leur propre licence ou restrictions d'usage distinctes — consultez le guide des modèles d'Izwi sur izwiai.com/docs/models avant toute redistribution ou usage commercial.
Exemples d'utilisation
La CLI d'Izwi couvre les tâches principales en quelques commandes, une fois un modèle téléchargé.
# Start the local server with the web UI
izwi serve --mode web
# Download a TTS model, then generate speech
izwi pull Qwen3-TTS-12Hz-0.6B-Base
izwi tts "Hello from Izwi." --output hello.wav
# Download a speech-to-text model, then transcribe a file
izwi pull Parakeet-TDT-0.6B-v3
izwi transcribe audio.wav --model Parakeet-TDT-0.6B-v3Plateforme, tarifs et licence
Plateforme
- Ce qu'Izwi indique:
- Application de bureau pour macOS, Linux et Windows ; également disponible en interface web et en CLI/serveur, toutes construites sur le même moteur local.
Coût
- Ce qu'Izwi indique:
- Gratuit et open source. Aucun compte, abonnement ou clé API n'est requis pour l'inférence locale ; certains poids de modèles peuvent avoir leurs propres conditions de licence distinctes.
Licence
- Ce qu'Izwi indique:
- MIT, confirmée via le fichier LICENSE du dépôt GitHub.
Accélération matérielle
- Ce qu'Izwi indique:
- Les builds macOS Apple Silicon utilisent Metal sur macOS 15+ et retombent sur le CPU sur macOS 12-14. Les builds Linux et Windows sont CPU uniquement par défaut ; CUDA NVIDIA est pris en charge via un profil Docker CUDA ou une compilation depuis les sources.
Statut
- Ce qu'Izwi indique:
- Encore en bêta — sa dernière version taguée est v0.1.0-beta-17, avec une activité de commits qui se poursuit après ce tag.
Vérifiez la matrice de compatibilité actuelle du runtime directement sur izwiai.com/docs/support-matrix avant d'installer, car la prise en charge de l'accélération matérielle peut évoluer d'une version à l'autre.
Installer Izwi
Izwi fournit des installateurs préconstruits pour les trois plateformes de bureau, plus un script d'installation CLI et des compilations depuis les sources.
Source | Link |
|---|---|
| Releases GitHub (macOS .dmg, Linux .deb, Windows .exe) | github.com/izwi-ai/izwi/releases |
| Dépôt GitHub (code source, MIT) | github.com/izwi-ai/izwi |
| Script d'installation CLI | ./scripts/install-cli.sh, ou compilation manuelle avec cargo build --release -p izwi-cli |
| Documentation | izwiai.com/docs |
Sur Linux, installez le paquet téléchargé avec sudo dpkg -i izwi_*.deb. L'accélération CUDA sur Linux ou Windows nécessite le profil Docker CUDA ou une compilation depuis les sources avec le toolkit CUDA correspondant — les builds de release sont CPU uniquement par défaut.
Izwi vs. Whisper.cpp + Piper
Izwi remplace une pile vocale locale courante à deux outils — Whisper.cpp pour la transcription plus Piper pour la synthèse vocale — par un seul runtime et une seule API, au prix d'être un projet plus jeune, encore en bêta.
Portée
- Izwi:
- Un seul runtime couvrant TTS, STT, diarisation, alignement et clonage de voix derrière une seule API
- Whisper.cpp + Piper (séparément):
- Deux projets distincts — Whisper.cpp pour le STT uniquement, Piper pour le TTS uniquement — que vous exécutez et intégrez indépendamment
Forme de l'API
- Izwi:
- Routes
/v1compatibles OpenAI, donc le code client existant pour l'API OpenAI fonctionne souvent avec des changements minimes - Whisper.cpp + Piper (séparément):
- Chaque outil a sa propre interface CLI/bibliothèque ; aucune API partagée ou compatible OpenAI entre les deux par défaut
Clonage de voix
- Izwi:
- Pris en charge via des familles de modèles TTS compatibles
- Whisper.cpp + Piper (séparément):
- Non pris en charge par Piper ni par Whisper.cpp eux-mêmes
Maturité du projet
- Izwi:
- Versions bêta uniquement (dernière : v0.1.0-beta-17) ; créé en janvier 2026
- Whisper.cpp + Piper (séparément):
- Les deux sont des projets établis de longue date et largement déployés individuellement
Interfaces
- Izwi:
- Application de bureau, interface web et CLI d'un seul projet
- Whisper.cpp + Piper (séparément):
- Outils en ligne de commande/bibliothèque ; toute interface graphique provient de wrappers tiers
Choisissez Izwi si vous voulez un seul runtime et une seule surface d'API pour plusieurs tâches vocales, y compris le clonage. Choisissez Whisper.cpp et Piper séparément si vous voulez spécifiquement le long historique individuel de chaque outil, ou si vous n'avez besoin que d'une seule des deux tâches. Voir l'avis Whisper.cpp et l'avis Piper TTS pour plus de détails sur chacun.
Pour qui Izwi est-il fait ?
Izwi convient aux développeurs et utilisateurs techniques qui veulent un seul outil local couvrant plusieurs tâches vocales, plutôt que d'assembler des API cloud distinctes ou des outils locaux à usage unique.
Pour quoi Izwi n'est pas adapté
Izwi ne convient pas si vous avez besoin d'une accélération GPU prête à l'emploi sur Linux/Windows, ou d'un produit établi de longue date et hors bêta.
- Pas accéléré par GPU par défaut sur Linux ou Windows — les builds de release fonctionnent uniquement sur CPU sauf si vous utilisez le profil Docker CUDA ou compilez depuis les sources
- Pas une version 1.0 — la dernière version taguée est une bêta (v0.1.0-beta-17), attendez-vous donc à ce que l'API et l'ensemble des fonctionnalités continuent d'évoluer
- Pas un outil minimal à usage unique — si vous n'avez besoin que d'une seule tâche (par exemple, uniquement du TTS), un outil dédié comme Piper pourrait être plus simple à exécuter
- Aucune garantie qu'une version taguée corresponde à son code le plus récent — cette revue a constaté un écart entre le dernier push de commit (13 septembre 2026) et la dernière version taguée (22 juin 2026)
- Pas soutenu par un tour de financement ou une entreprise que cette revue a pu vérifier — considérez-le comme un projet maintenu de manière indépendante, soutenu par la communauté
Erreurs courantes lors de l'évaluation d'Izwi
La plupart des confusions autour d'Izwi viennent du fait de le prendre pour un modèle unique, d'attendre une accélération GPU partout par défaut, ou de ne pas réaliser qu'il est encore en pré-1.0.
Concurrents et alternatives
Izwi se compare le plus directement à d'autres outils locaux ou open source de synthèse vocale et de reconnaissance vocale, dont plusieurs qu'il peut remplacer derrière une API unifiée unique.
Tool | Best known for | Link |
|---|---|---|
| Whisper.cpp | Moteur de reconnaissance vocale local rapide et largement utilisé, un portage C/C++ de Whisper d'OpenAI | avis Whisper.cpp |
| Piper | Moteur de synthèse vocale local léger et largement déployé, souvent utilisé sur des appareils peu puissants | avis Piper TTS |
| Coqui TTS | Boîte à outils de synthèse vocale open source avec prise en charge du clonage de voix | avis Coqui TTS |
| MacWhisper | Application de bureau macOS pour la transcription locale, construite sur Whisper | avis MacWhisper |
Cette liste reflète les outils habituellement comparés à Izwi dans l'univers de l'IA vocale locale, et non un classement indépendant de PromptQuorum — vérifiez l'ensemble des fonctionnalités et la prise en charge matérielle actuels de chaque outil avant de faire votre choix.
Questions fréquemment posées
Qu'est-ce qu'Izwi ?
Izwi (github.com/izwi-ai/izwi) est un runtime d'IA vocale gratuit, open source (MIT) et local, qui regroupe synthèse vocale, reconnaissance vocale, diarisation et clonage de voix derrière une seule API compatible OpenAI.
Izwi est-il gratuit ?
Oui, Izwi est gratuit et open source (licence MIT). Aucun compte, abonnement ou clé API n'est requis pour l'inférence locale ; certains poids de modèles téléchargés peuvent avoir leurs propres conditions de licence distinctes.
Que signifie « Izwi » ?
« Izwi » est le mot zoulou et xhosa pour « voix ».
Izwi fonctionne-t-il sous Windows ?
Oui, Izwi dispose d'un installateur Windows (.exe), aux côtés de builds macOS (.dmg) et Linux (.deb). Les builds de release Windows et Linux sont CPU uniquement par défaut ; l'accélération GPU via Metal est disponible sur les Mac Apple Silicon.
Izwi prend-il en charge le clonage de voix ?
Oui, via des familles de modèles de synthèse vocale compatibles de son catalogue, exécutées entièrement sur votre propre machine.
Quels modèles de reconnaissance vocale Izwi prend-il en charge ?
Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio et Voxtral Mini, selon le catalogue de modèles actuel d'Izwi — exécutez izwi list en local pour voir ce qui est activé.
Izwi utilise-t-il une API compatible OpenAI ?
Oui. Il expose des routes /v1 pour les modèles, les complétions de chat, la synthèse audio et les transcriptions audio, avec une prise en charge en aperçu du format de l'API Responses.
Izwi est-il un produit 1.0 fini ?
Non. Au moment de cette revue, la dernière version taguée est une bêta (v0.1.0-beta-17), attendez-vous donc à ce que l'API et le catalogue de modèles continuent d'évoluer.
Izwi envoie-t-il mon audio ou mes transcriptions quelque part ?
Selon le propre README d'Izwi, les données d'inférence restent sur votre machine. Les statistiques anonymes optionnelles de l'application de bureau sont désactivées par défaut et, si elles sont activées, il est indiqué qu'elles n'incluent pas de prompts, transcriptions, données audio, chemins de fichiers ou identifiants personnels.
Comment installer Izwi ?
Téléchargez l'installateur pour votre plateforme depuis les Releases GitHub (.dmg pour macOS, .deb pour Linux, .exe pour Windows), ou installez uniquement la CLI/le serveur avec le script d'installation du projet ou une compilation depuis les sources.