Wichtigste Erkenntnisse
- Izwi (github.com/izwi-ai/izwi) ist eine kostenlose, quelloffene, lokal-first laufende Sprach-KI-Laufzeitumgebung für Text-to-Speech, Speech-to-Text und verwandte Audioaufgaben
- "Izwi" ist das Zulu- und Xhosa-Wort für "Stimme"
- MIT-lizenziert, bestätigt über die LICENSE-Datei des GitHub-Repositorys
- Verfügbar als Desktop-App (macOS, Linux, Windows), Web-UI und Kommandozeilen-Tool, alle auf demselben lokalen Inferenzserver aufgebaut
- Über 383 GitHub-Stars und 40 Forks zum Zeitpunkt dieser Review
- Noch in der Beta-Phase: Das aktuellste getaggte Release ist v0.1.0-beta-17 (22. Juni 2026), obwohl der jüngste Commit-Push des Repositorys vom 13. September 2026 datiert
📍 In einem Satz
Izwi ist eine kostenlose, quelloffene (MIT), lokal-first laufende Sprach-KI-Laufzeitumgebung — Desktop-App, Web-UI und CLI —, die Text-to-Speech, Speech-to-Text, Sprecherdiarisierung und Voice-Cloning hinter einer einzigen OpenAI-kompatiblen API bündelt, mit über 383 GitHub-Stars.
💬 In einfachen Worten
Izwi ist Software, die Sie auf Ihrem eigenen Computer installieren und die Text in gesprochenes Audio umwandelt, gesprochenes Audio in Text umwandelt und eine Stimme aus einer Beispielaufnahme klonen kann — alles läuft lokal statt über kostenpflichtige Cloud-APIs wie die von ElevenLabs oder OpenAIs Audio-Endpunkte. Da die API dem OpenAI-Format entspricht, können viele bestehende Apps, die für diese API gebaut wurden, mit minimalen Änderungen stattdessen auf Izwi zeigen.
📌Hinweis: Diese Review basiert auf Izwis eigenem GitHub-Repository, seinem README und seiner Release-Historie über die GitHub-API. Sie behauptet nicht, dass PromptQuorum die Audioqualität oder Transkriptionsgenauigkeit eines bestimmten von Izwi unterstützten Modells unabhängig getestet hat.
Was ist Izwi?
Izwi ist eine kostenlose, quelloffene, lokal-first laufende Sprach-KI-Laufzeitumgebung, die mehrere separate Sprachaufgaben — Text-to-Speech, Speech-to-Text, Diarisierung und Voice-Cloning — hinter einer einzigen OpenAI-kompatiblen API bündelt, statt für jede Aufgabe einen eigenen Cloud-Dienst zu erfordern. Das eigene README beschreibt es als "lokal-first laufende Sprach-KI für Sprach-, Chat- und Audio-Workflows".
- Produkttyp: ein lokaler Inferenzserver mit drei Oberflächen — eine native Desktop-App, eine browserbasierte Web-UI und eine CLI — die alle mit derselben zugrunde liegenden Engine kommunizieren
- Repository: github.com/izwi-ai/izwi, erstellt am 23. Januar 2026
- Lizenz: MIT, bestätigt über die LICENSE-Datei des Repositorys
- Website: izwiai.com, mit separater Dokumentation unter izwiai.com/docs
- Finanzierung: Für diese Review wurde keine Finanzierungsrunde, kein Investor und keine kommerzielle Unterstützung gefunden — behandeln Sie Izwi als offenbar unabhängiges, community-getragenes Open-Source-Projekt
- Umfang: über 383 GitHub-Stars, 40 Forks, zum Zeitpunkt dieser Review
Was können Sie mit Izwi tun?
Izwi deckt vier zusammenhängende Sprachaufgaben ab — Sprechen, Zuhören, Klonen und Organisieren lokaler Modelle — über eine konsistente Oberfläche, egal ob Sie die Desktop-App, die Web-UI oder die CLI nutzen.
- Text-to-Speech: Wandelt Text in gesprochenes Audio um, einschließlich langer "Studio"-Projekte, mit Unterstützung für Voice-Design und gespeicherte eigene Stimmen
- Voice-Cloning: Erzeugt Sprache in einer geklonten Stimme aus einer Referenzaufnahme, mithilfe unterstützter TTS-Modellfamilien
- Speech-to-Text: Transkribiert Audiodateien, plus Echtzeit-Streaming-Transkription für Live-Audio
- Sprecherdiarisierung und forcierte Ausrichtung: Identifiziert, wer bei Audio mit mehreren Sprechern was gesagt hat, und richtet transkribierten Text an exakten Audio-Zeitstempeln aus
- Echtzeit-Sprachkonversation: Kombiniert lokale automatische Spracherkennung, ein lokales Chat-Modell und lokales Text-to-Speech für ein gesprochenes Hin und Her, konzeptionell ähnlich einem Sprachassistenten
- Modellverwaltung: Modelle innerhalb der App herunterladen, laden, entladen und löschen; Chatverlauf einsehen und Ergebnisse exportieren
- OpenAI-kompatible API:
/v1-Routen für Modelle, Chat-Completions, Audio-Speech und Audio-Transkriptionen, plus Vorabunterstützung für das Responses-API-Format, sodass bestehender OpenAI-API-Client-Code oft mit minimalen Änderungen auf einen lokalen Izwi-Server zeigen kann
Welche Modelle unterstützt Izwi?
Izwi ist eine Laufzeitumgebung, kein einzelnes Modell — es unterstützt pro Aufgabe mehrere austauschbare Modellfamilien, sodass Sie diejenige wählen, die zu Ihrer Hardware und Ihren Qualitätsanforderungen passt.
Text-to-Speech
- Unterstützte Modellfamilien (laut Izwis Katalog):
- Qwen3-TTS, Kokoro-82M, Voxtral TTS, VibeVoice
Speech-to-Text
- Unterstützte Modellfamilien (laut Izwis Katalog):
- Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio, Voxtral Mini
Diarisierung & Ausrichtung
- Unterstützte Modellfamilien (laut Izwis Katalog):
- Sortformer (Diarisierung), Qwen3 ForcedAligner (Zeitstempel-Ausrichtung)
Chat
- Unterstützte Modellfamilien (laut Izwis Katalog):
- Qwen3, Qwen3.5, LFM2.5, Gemma
Führen Sie lokal izwi list aus, um den aktuell aktivierten Katalog zu sehen, da sich unterstützte Modelle zwischen Releases ändern oder hinzukommen können. Manche Modellgewichte unterliegen eigenen separaten Lizenzen oder Nutzungsbeschränkungen — prüfen Sie Izwis Models Guide unter izwiai.com/docs/models, bevor Sie sie weitergeben oder kommerziell nutzen.
Anwendungsbeispiele
Izwis CLI deckt die Kernaufgaben in wenigen Befehlen ab, sobald ein Modell heruntergeladen ist.
# Start the local server with the web UI
izwi serve --mode web
# Download a TTS model, then generate speech
izwi pull Qwen3-TTS-12Hz-0.6B-Base
izwi tts "Hello from Izwi." --output hello.wav
# Download a speech-to-text model, then transcribe a file
izwi pull Parakeet-TDT-0.6B-v3
izwi transcribe audio.wav --model Parakeet-TDT-0.6B-v3Plattform, Preise und Lizenzierung
Plattform
- Was Izwi angibt:
- Desktop-App für macOS, Linux und Windows; zusätzlich verfügbar als Web-UI und CLI/Server, alle auf derselben lokalen Engine aufgebaut.
Kosten
- Was Izwi angibt:
- Kostenlos und quelloffen. Für lokale Inferenz ist kein Konto, Abonnement oder API-Schlüssel erforderlich; manche Modellgewichte können eigene separate Lizenzbedingungen haben.
Lizenzierung
- Was Izwi angibt:
- MIT, bestätigt über die LICENSE-Datei des GitHub-Repositorys.
Hardwarebeschleunigung
- Was Izwi angibt:
- macOS-Apple-Silicon-Release-Builds nutzen Metal auf macOS 15+ und fallen auf macOS 12-14 auf CPU zurück. Linux- und Windows-Release-Builds sind standardmäßig nur CPU; NVIDIA CUDA wird über ein Docker-CUDA-Profil oder einen Source-Build unterstützt.
Status
- Was Izwi angibt:
- Noch in der Beta-Phase — das aktuellste getaggte Release ist v0.1.0-beta-17, mit fortlaufender Commit-Aktivität nach diesem Tag.
Prüfen Sie die aktuelle Runtime Support Matrix direkt unter izwiai.com/docs/support-matrix, bevor Sie installieren, da sich die Hardwarebeschleunigungsunterstützung zwischen Releases ändern kann.
Izwi installieren
Izwi liefert vorgefertigte Installer für alle drei Desktop-Plattformen sowie ein CLI-Installationsskript und Source-Builds.
Source | Link |
|---|---|
| GitHub Releases (macOS .dmg, Linux .deb, Windows .exe) | github.com/izwi-ai/izwi/releases |
| GitHub-Repository (Quellcode, MIT) | github.com/izwi-ai/izwi |
| CLI-Installationsskript | ./scripts/install-cli.sh, oder manuell bauen mit cargo build --release -p izwi-cli |
| Dokumentation | izwiai.com/docs |
Installieren Sie unter Linux das heruntergeladene Paket mit sudo dpkg -i izwi_*.deb. CUDA-Beschleunigung unter Linux oder Windows erfordert das Docker-CUDA-Profil oder einen Source-Build mit dem passenden CUDA-Toolkit — Release-Builds sind standardmäßig nur CPU.
Izwi vs. Whisper.cpp + Piper
Izwi ersetzt einen gängigen lokalen Zwei-Tool-Sprach-Stack — Whisper.cpp für Transkription plus Piper für Text-to-Speech — durch eine Laufzeitumgebung und eine API, auf Kosten eines jüngeren, noch in Beta befindlichen Projekts.
Umfang
- Izwi:
- Eine Laufzeitumgebung, die TTS, STT, Diarisierung, Ausrichtung und Voice-Cloning hinter einer API abdeckt
- Whisper.cpp + Piper (separat):
- Zwei separate Projekte — Whisper.cpp nur für STT, Piper nur für TTS —, die Sie unabhängig voneinander betreiben und integrieren
API-Format
- Izwi:
- OpenAI-kompatible
/v1-Routen, sodass bestehender OpenAI-API-Client-Code oft mit minimalen Änderungen funktioniert - Whisper.cpp + Piper (separat):
- Jedes Tool hat seine eigene CLI-/Bibliotheksschnittstelle; standardmäßig keine gemeinsame oder OpenAI-kompatible API über beide hinweg
Voice-Cloning
- Izwi:
- Unterstützt durch kompatible TTS-Modellfamilien
- Whisper.cpp + Piper (separat):
- Weder von Piper noch von Whisper.cpp selbst unterstützt
Projektreife
- Izwi:
- Nur Beta-Releases (aktuell: v0.1.0-beta-17); erstellt im Januar 2026
- Whisper.cpp + Piper (separat):
- Beide sind einzeln lange etablierte, weit verbreitete Projekte
Oberflächen
- Izwi:
- Desktop-App, Web-UI und CLI aus einem Projekt
- Whisper.cpp + Piper (separat):
- Kommandozeilen-/Bibliotheks-Tools; jede GUI stammt von Drittanbieter-Wrappern
Wählen Sie Izwi, wenn Sie eine einzige Laufzeitumgebung und API-Oberfläche für mehrere Sprachaufgaben inklusive Cloning möchten. Wählen Sie Whisper.cpp und Piper separat, wenn Sie speziell die lange individuelle Erfolgsbilanz jedes Tools möchten oder nur eine der beiden Aufgaben benötigen. Details zu jedem finden Sie in der Whisper.cpp Review und der Piper TTS Review.
Für wen eignet sich Izwi?
Izwi passt zu Entwicklern und technischen Nutzern, die ein einziges lokales Tool für mehrere Sprachaufgaben möchten, statt separate Cloud-APIs oder einzweckgebundene lokale Tools zusammenzustellen.
Wofür Izwi nicht gut geeignet ist
Izwi ist keine gute Wahl, wenn Sie GPU-Beschleunigung unter Linux/Windows von Haus aus oder ein lange etabliertes Nicht-Beta-Produkt benötigen.
- Standardmäßig nicht GPU-beschleunigt unter Linux oder Windows — Release-Builds laufen dort nur auf CPU, sofern Sie nicht das Docker-CUDA-Profil nutzen oder aus dem Quellcode bauen
- Kein 1.0-Release — die aktuellste getaggte Version ist eine Beta (v0.1.0-beta-17), erwarten Sie also, dass API und Funktionsumfang noch nicht endgültig festgelegt sind
- Kein einzweckgebundenes, minimales Tool — wenn Sie nur eine Aufgabe benötigen (etwa nur TTS), kann ein spezialisiertes Tool wie Piper einfacher zu betreiben sein
- Nicht garantiert ein getaggtes Release, das dem neuesten Code entspricht — diese Review fand eine Lücke zwischen dem letzten Commit-Push (13. September 2026) und dem letzten getaggten Release (22. Juni 2026)
- Nicht durch eine für diese Review verifizierbare Finanzierungsrunde oder ein Unternehmen unterstützt — behandeln Sie es als unabhängig gepflegtes, community-getragenes Projekt
Häufige Fehler bei der Bewertung von Izwi
Die meiste Verwirrung um Izwi entsteht durch die Annahme, es sei ein einzelnes Modell, durch die Erwartung von GPU-Beschleunigung überall standardmäßig, oder durch das Übersehen, dass es noch vor 1.0 steht.
Wettbewerber und Alternativen
Izwi ist am direktesten mit anderen lokalen oder quelloffenen Text-to-Speech- und Speech-to-Text-Tools vergleichbar, von denen es mehrere hinter einer einheitlichen API ersetzen kann.
Tool | Best known for | Link |
|---|---|---|
| Whisper.cpp | Schnelle, weit verbreitete lokale Speech-to-Text-Engine, ein C/C++-Port von OpenAIs Whisper | Whisper.cpp Review |
| Piper | Leichtgewichtige, weit verbreitete lokale Text-to-Speech-Engine, oft auf leistungsschwachen Geräten eingesetzt | Piper TTS Review |
| Coqui TTS | Quelloffenes Text-to-Speech-Toolkit mit Voice-Cloning-Unterstützung | Coqui TTS Review |
| MacWhisper | macOS-Desktop-App für lokale Transkription auf Basis von Whisper | MacWhisper Review |
Diese Liste spiegelt Tools wider, die im Bereich lokaler Sprach-KI häufig mit Izwi verglichen werden, nicht ein unabhängiges PromptQuorum-Ranking — prüfen Sie den aktuellen Funktionsumfang und die Hardwareunterstützung jedes Tools, bevor Sie sich entscheiden.
Häufig gestellte Fragen
Was ist Izwi?
Izwi (github.com/izwi-ai/izwi) ist eine kostenlose, quelloffene (MIT), lokal-first laufende Sprach-KI-Laufzeitumgebung, die Text-to-Speech, Speech-to-Text, Diarisierung und Voice-Cloning hinter einer OpenAI-kompatiblen API bündelt.
Ist Izwi kostenlos?
Ja, Izwi ist kostenlos und quelloffen (MIT-Lizenz). Für lokale Inferenz ist kein Konto, Abonnement oder API-Schlüssel erforderlich; manche heruntergeladenen Modellgewichte können eigene separate Lizenzbedingungen haben.
Was bedeutet "Izwi"?
"Izwi" ist das Zulu- und Xhosa-Wort für "Stimme".
Läuft Izwi unter Windows?
Ja, Izwi hat einen Windows-Installer (.exe), zusätzlich zu macOS- (.dmg) und Linux-Builds (.deb). Windows- und Linux-Release-Builds sind standardmäßig nur CPU; GPU-Beschleunigung über Metal ist auf Apple-Silicon-Macs verfügbar.
Unterstützt Izwi Voice-Cloning?
Ja, über kompatible Text-to-Speech-Modellfamilien in seinem Katalog, vollständig auf Ihrem eigenen Rechner ausgeführt.
Welche Speech-to-Text-Modelle unterstützt Izwi?
Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio und Voxtral Mini, laut Izwis aktuellem Modellkatalog — führen Sie lokal izwi list aus, um zu sehen, was aktiviert ist.
Verwendet Izwi eine OpenAI-kompatible API?
Ja. Sie stellt /v1-Routen für Modelle, Chat-Completions, Audio-Speech und Audio-Transkriptionen bereit, plus Vorabunterstützung für das Responses-API-Format.
Ist Izwi ein fertiges 1.0-Produkt?
Nein. Zum Zeitpunkt dieser Review ist das aktuellste getaggte Release eine Beta (v0.1.0-beta-17), erwarten Sie also, dass sich API und Modellkatalog weiter ändern.
Sendet Izwi meine Audio- oder Transkriptdaten irgendwohin?
Laut Izwis eigenem README bleiben Inferenzdaten auf Ihrem Rechner. Optionale anonyme Desktop-Analytics sind standardmäßig deaktiviert und enthalten, falls aktiviert, laut Angabe keine Prompts, Transkripte, Audio-Payloads, Dateipfade oder personenbezogenen Kennungen.
Wie installiere ich Izwi?
Laden Sie den Installer für Ihre Plattform von GitHub Releases herunter (.dmg für macOS, .deb für Linux, .exe für Windows), oder installieren Sie nur die CLI/den Server mit dem Installationsskript des Projekts oder einem Source-Build.