Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Izwi Review: Lokale Sprach-KI für TTS, STT und Cloning
Voice, Speech & Multimodal

Izwi Review: Lokale Sprach-KI für TTS, STT und Cloning

·10 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Izwi ist eine kostenlose, quelloffene, lokal-first laufende Sprach-KI-Laufzeitumgebung, die Text-to-Speech, Speech-to-Text, Sprecherdiarisierung und Voice-Cloning hinter einer einzigen OpenAI-kompatiblen API kombiniert, sodass Sie sie als direkten lokalen Ersatz für mehrere separate Cloud-Sprachdienste gleichzeitig einsetzen können. Sie wird als Desktop-App für macOS, Linux und Windows ausgeliefert, zusätzlich als Web-UI und CLI, ist MIT-lizenziert und benötigt für lokale Inferenz kein Konto und keinen API-Schlüssel.

Izwi (github.com/izwi-ai/izwi) ist eine kostenlose, quelloffene, lokal-first laufende Sprach-KI-Laufzeitumgebung, die Text-to-Speech, Speech-to-Text, Sprecherdiarisierung und Voice-Cloning hinter einer einzigen OpenAI-kompatiblen API bündelt, verfügbar als Desktop-App, Web-UI und Kommandozeilen-Tool. "Izwi" ist das Zulu- und Xhosa-Wort für "Stimme". Diese Review beschreibt, was es tut, welche Modelle es unterstützt, welche Hardware-Anforderungen bestehen und für wen es geeignet ist.

Wichtigste Erkenntnisse

  • Izwi (github.com/izwi-ai/izwi) ist eine kostenlose, quelloffene, lokal-first laufende Sprach-KI-Laufzeitumgebung für Text-to-Speech, Speech-to-Text und verwandte Audioaufgaben
  • "Izwi" ist das Zulu- und Xhosa-Wort für "Stimme"
  • MIT-lizenziert, bestätigt über die LICENSE-Datei des GitHub-Repositorys
  • Verfügbar als Desktop-App (macOS, Linux, Windows), Web-UI und Kommandozeilen-Tool, alle auf demselben lokalen Inferenzserver aufgebaut
  • Über 383 GitHub-Stars und 40 Forks zum Zeitpunkt dieser Review
  • Noch in der Beta-Phase: Das aktuellste getaggte Release ist v0.1.0-beta-17 (22. Juni 2026), obwohl der jüngste Commit-Push des Repositorys vom 13. September 2026 datiert

📍 In einem Satz

Izwi ist eine kostenlose, quelloffene (MIT), lokal-first laufende Sprach-KI-Laufzeitumgebung — Desktop-App, Web-UI und CLI —, die Text-to-Speech, Speech-to-Text, Sprecherdiarisierung und Voice-Cloning hinter einer einzigen OpenAI-kompatiblen API bündelt, mit über 383 GitHub-Stars.

💬 In einfachen Worten

Izwi ist Software, die Sie auf Ihrem eigenen Computer installieren und die Text in gesprochenes Audio umwandelt, gesprochenes Audio in Text umwandelt und eine Stimme aus einer Beispielaufnahme klonen kann — alles läuft lokal statt über kostenpflichtige Cloud-APIs wie die von ElevenLabs oder OpenAIs Audio-Endpunkte. Da die API dem OpenAI-Format entspricht, können viele bestehende Apps, die für diese API gebaut wurden, mit minimalen Änderungen stattdessen auf Izwi zeigen.

📌Hinweis: Diese Review basiert auf Izwis eigenem GitHub-Repository, seinem README und seiner Release-Historie über die GitHub-API. Sie behauptet nicht, dass PromptQuorum die Audioqualität oder Transkriptionsgenauigkeit eines bestimmten von Izwi unterstützten Modells unabhängig getestet hat.

Was ist Izwi?

Izwi ist eine kostenlose, quelloffene, lokal-first laufende Sprach-KI-Laufzeitumgebung, die mehrere separate Sprachaufgaben — Text-to-Speech, Speech-to-Text, Diarisierung und Voice-Cloning — hinter einer einzigen OpenAI-kompatiblen API bündelt, statt für jede Aufgabe einen eigenen Cloud-Dienst zu erfordern. Das eigene README beschreibt es als "lokal-first laufende Sprach-KI für Sprach-, Chat- und Audio-Workflows".

  • Produkttyp: ein lokaler Inferenzserver mit drei Oberflächen — eine native Desktop-App, eine browserbasierte Web-UI und eine CLI — die alle mit derselben zugrunde liegenden Engine kommunizieren
  • Repository: github.com/izwi-ai/izwi, erstellt am 23. Januar 2026
  • Lizenz: MIT, bestätigt über die LICENSE-Datei des Repositorys
  • Website: izwiai.com, mit separater Dokumentation unter izwiai.com/docs
  • Finanzierung: Für diese Review wurde keine Finanzierungsrunde, kein Investor und keine kommerzielle Unterstützung gefunden — behandeln Sie Izwi als offenbar unabhängiges, community-getragenes Open-Source-Projekt
  • Umfang: über 383 GitHub-Stars, 40 Forks, zum Zeitpunkt dieser Review

Was können Sie mit Izwi tun?

Izwi deckt vier zusammenhängende Sprachaufgaben ab — Sprechen, Zuhören, Klonen und Organisieren lokaler Modelle — über eine konsistente Oberfläche, egal ob Sie die Desktop-App, die Web-UI oder die CLI nutzen.

  • Text-to-Speech: Wandelt Text in gesprochenes Audio um, einschließlich langer "Studio"-Projekte, mit Unterstützung für Voice-Design und gespeicherte eigene Stimmen
  • Voice-Cloning: Erzeugt Sprache in einer geklonten Stimme aus einer Referenzaufnahme, mithilfe unterstützter TTS-Modellfamilien
  • Speech-to-Text: Transkribiert Audiodateien, plus Echtzeit-Streaming-Transkription für Live-Audio
  • Sprecherdiarisierung und forcierte Ausrichtung: Identifiziert, wer bei Audio mit mehreren Sprechern was gesagt hat, und richtet transkribierten Text an exakten Audio-Zeitstempeln aus
  • Echtzeit-Sprachkonversation: Kombiniert lokale automatische Spracherkennung, ein lokales Chat-Modell und lokales Text-to-Speech für ein gesprochenes Hin und Her, konzeptionell ähnlich einem Sprachassistenten
  • Modellverwaltung: Modelle innerhalb der App herunterladen, laden, entladen und löschen; Chatverlauf einsehen und Ergebnisse exportieren
  • OpenAI-kompatible API: /v1-Routen für Modelle, Chat-Completions, Audio-Speech und Audio-Transkriptionen, plus Vorabunterstützung für das Responses-API-Format, sodass bestehender OpenAI-API-Client-Code oft mit minimalen Änderungen auf einen lokalen Izwi-Server zeigen kann

Welche Modelle unterstützt Izwi?

Izwi ist eine Laufzeitumgebung, kein einzelnes Modell — es unterstützt pro Aufgabe mehrere austauschbare Modellfamilien, sodass Sie diejenige wählen, die zu Ihrer Hardware und Ihren Qualitätsanforderungen passt.

Text-to-Speech

Unterstützte Modellfamilien (laut Izwis Katalog):
Qwen3-TTS, Kokoro-82M, Voxtral TTS, VibeVoice

Speech-to-Text

Unterstützte Modellfamilien (laut Izwis Katalog):
Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio, Voxtral Mini

Diarisierung & Ausrichtung

Unterstützte Modellfamilien (laut Izwis Katalog):
Sortformer (Diarisierung), Qwen3 ForcedAligner (Zeitstempel-Ausrichtung)

Chat

Unterstützte Modellfamilien (laut Izwis Katalog):
Qwen3, Qwen3.5, LFM2.5, Gemma

Führen Sie lokal izwi list aus, um den aktuell aktivierten Katalog zu sehen, da sich unterstützte Modelle zwischen Releases ändern oder hinzukommen können. Manche Modellgewichte unterliegen eigenen separaten Lizenzen oder Nutzungsbeschränkungen — prüfen Sie Izwis Models Guide unter izwiai.com/docs/models, bevor Sie sie weitergeben oder kommerziell nutzen.

Anwendungsbeispiele

Izwis CLI deckt die Kernaufgaben in wenigen Befehlen ab, sobald ein Modell heruntergeladen ist.

bash
# Start the local server with the web UI
izwi serve --mode web

# Download a TTS model, then generate speech
izwi pull Qwen3-TTS-12Hz-0.6B-Base
izwi tts "Hello from Izwi." --output hello.wav

# Download a speech-to-text model, then transcribe a file
izwi pull Parakeet-TDT-0.6B-v3
izwi transcribe audio.wav --model Parakeet-TDT-0.6B-v3

Plattform, Preise und Lizenzierung

Plattform

Was Izwi angibt:
Desktop-App für macOS, Linux und Windows; zusätzlich verfügbar als Web-UI und CLI/Server, alle auf derselben lokalen Engine aufgebaut.

Kosten

Was Izwi angibt:
Kostenlos und quelloffen. Für lokale Inferenz ist kein Konto, Abonnement oder API-Schlüssel erforderlich; manche Modellgewichte können eigene separate Lizenzbedingungen haben.

Lizenzierung

Was Izwi angibt:
MIT, bestätigt über die LICENSE-Datei des GitHub-Repositorys.

Hardwarebeschleunigung

Was Izwi angibt:
macOS-Apple-Silicon-Release-Builds nutzen Metal auf macOS 15+ und fallen auf macOS 12-14 auf CPU zurück. Linux- und Windows-Release-Builds sind standardmäßig nur CPU; NVIDIA CUDA wird über ein Docker-CUDA-Profil oder einen Source-Build unterstützt.

Status

Was Izwi angibt:
Noch in der Beta-Phase — das aktuellste getaggte Release ist v0.1.0-beta-17, mit fortlaufender Commit-Aktivität nach diesem Tag.

Prüfen Sie die aktuelle Runtime Support Matrix direkt unter izwiai.com/docs/support-matrix, bevor Sie installieren, da sich die Hardwarebeschleunigungsunterstützung zwischen Releases ändern kann.

Izwi vs. Whisper.cpp + Piper

Izwi ersetzt einen gängigen lokalen Zwei-Tool-Sprach-Stack — Whisper.cpp für Transkription plus Piper für Text-to-Speech — durch eine Laufzeitumgebung und eine API, auf Kosten eines jüngeren, noch in Beta befindlichen Projekts.

Umfang

Izwi:
Eine Laufzeitumgebung, die TTS, STT, Diarisierung, Ausrichtung und Voice-Cloning hinter einer API abdeckt
Whisper.cpp + Piper (separat):
Zwei separate Projekte — Whisper.cpp nur für STT, Piper nur für TTS —, die Sie unabhängig voneinander betreiben und integrieren

API-Format

Izwi:
OpenAI-kompatible /v1-Routen, sodass bestehender OpenAI-API-Client-Code oft mit minimalen Änderungen funktioniert
Whisper.cpp + Piper (separat):
Jedes Tool hat seine eigene CLI-/Bibliotheksschnittstelle; standardmäßig keine gemeinsame oder OpenAI-kompatible API über beide hinweg

Voice-Cloning

Izwi:
Unterstützt durch kompatible TTS-Modellfamilien
Whisper.cpp + Piper (separat):
Weder von Piper noch von Whisper.cpp selbst unterstützt

Projektreife

Izwi:
Nur Beta-Releases (aktuell: v0.1.0-beta-17); erstellt im Januar 2026
Whisper.cpp + Piper (separat):
Beide sind einzeln lange etablierte, weit verbreitete Projekte

Oberflächen

Izwi:
Desktop-App, Web-UI und CLI aus einem Projekt
Whisper.cpp + Piper (separat):
Kommandozeilen-/Bibliotheks-Tools; jede GUI stammt von Drittanbieter-Wrappern

Wählen Sie Izwi, wenn Sie eine einzige Laufzeitumgebung und API-Oberfläche für mehrere Sprachaufgaben inklusive Cloning möchten. Wählen Sie Whisper.cpp und Piper separat, wenn Sie speziell die lange individuelle Erfolgsbilanz jedes Tools möchten oder nur eine der beiden Aufgaben benötigen. Details zu jedem finden Sie in der Whisper.cpp Review und der Piper TTS Review.

Für wen eignet sich Izwi?

Izwi passt zu Entwicklern und technischen Nutzern, die ein einziges lokales Tool für mehrere Sprachaufgaben möchten, statt separate Cloud-APIs oder einzweckgebundene lokale Tools zusammenzustellen.

Wofür Izwi nicht gut geeignet ist

Izwi ist keine gute Wahl, wenn Sie GPU-Beschleunigung unter Linux/Windows von Haus aus oder ein lange etabliertes Nicht-Beta-Produkt benötigen.

  • Standardmäßig nicht GPU-beschleunigt unter Linux oder Windows — Release-Builds laufen dort nur auf CPU, sofern Sie nicht das Docker-CUDA-Profil nutzen oder aus dem Quellcode bauen
  • Kein 1.0-Release — die aktuellste getaggte Version ist eine Beta (v0.1.0-beta-17), erwarten Sie also, dass API und Funktionsumfang noch nicht endgültig festgelegt sind
  • Kein einzweckgebundenes, minimales Tool — wenn Sie nur eine Aufgabe benötigen (etwa nur TTS), kann ein spezialisiertes Tool wie Piper einfacher zu betreiben sein
  • Nicht garantiert ein getaggtes Release, das dem neuesten Code entspricht — diese Review fand eine Lücke zwischen dem letzten Commit-Push (13. September 2026) und dem letzten getaggten Release (22. Juni 2026)
  • Nicht durch eine für diese Review verifizierbare Finanzierungsrunde oder ein Unternehmen unterstützt — behandeln Sie es als unabhängig gepflegtes, community-getragenes Projekt

Häufige Fehler bei der Bewertung von Izwi

Die meiste Verwirrung um Izwi entsteht durch die Annahme, es sei ein einzelnes Modell, durch die Erwartung von GPU-Beschleunigung überall standardmäßig, oder durch das Übersehen, dass es noch vor 1.0 steht.

Wettbewerber und Alternativen

Izwi ist am direktesten mit anderen lokalen oder quelloffenen Text-to-Speech- und Speech-to-Text-Tools vergleichbar, von denen es mehrere hinter einer einheitlichen API ersetzen kann.

Tool
Best known for
Link
Whisper.cppSchnelle, weit verbreitete lokale Speech-to-Text-Engine, ein C/C++-Port von OpenAIs WhisperWhisper.cpp Review
PiperLeichtgewichtige, weit verbreitete lokale Text-to-Speech-Engine, oft auf leistungsschwachen Geräten eingesetztPiper TTS Review
Coqui TTSQuelloffenes Text-to-Speech-Toolkit mit Voice-Cloning-UnterstützungCoqui TTS Review
MacWhispermacOS-Desktop-App für lokale Transkription auf Basis von WhisperMacWhisper Review

Diese Liste spiegelt Tools wider, die im Bereich lokaler Sprach-KI häufig mit Izwi verglichen werden, nicht ein unabhängiges PromptQuorum-Ranking — prüfen Sie den aktuellen Funktionsumfang und die Hardwareunterstützung jedes Tools, bevor Sie sich entscheiden.

Häufig gestellte Fragen

Was ist Izwi?

Izwi (github.com/izwi-ai/izwi) ist eine kostenlose, quelloffene (MIT), lokal-first laufende Sprach-KI-Laufzeitumgebung, die Text-to-Speech, Speech-to-Text, Diarisierung und Voice-Cloning hinter einer OpenAI-kompatiblen API bündelt.

Ist Izwi kostenlos?

Ja, Izwi ist kostenlos und quelloffen (MIT-Lizenz). Für lokale Inferenz ist kein Konto, Abonnement oder API-Schlüssel erforderlich; manche heruntergeladenen Modellgewichte können eigene separate Lizenzbedingungen haben.

Was bedeutet "Izwi"?

"Izwi" ist das Zulu- und Xhosa-Wort für "Stimme".

Läuft Izwi unter Windows?

Ja, Izwi hat einen Windows-Installer (.exe), zusätzlich zu macOS- (.dmg) und Linux-Builds (.deb). Windows- und Linux-Release-Builds sind standardmäßig nur CPU; GPU-Beschleunigung über Metal ist auf Apple-Silicon-Macs verfügbar.

Unterstützt Izwi Voice-Cloning?

Ja, über kompatible Text-to-Speech-Modellfamilien in seinem Katalog, vollständig auf Ihrem eigenen Rechner ausgeführt.

Welche Speech-to-Text-Modelle unterstützt Izwi?

Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio und Voxtral Mini, laut Izwis aktuellem Modellkatalog — führen Sie lokal izwi list aus, um zu sehen, was aktiviert ist.

Verwendet Izwi eine OpenAI-kompatible API?

Ja. Sie stellt /v1-Routen für Modelle, Chat-Completions, Audio-Speech und Audio-Transkriptionen bereit, plus Vorabunterstützung für das Responses-API-Format.

Ist Izwi ein fertiges 1.0-Produkt?

Nein. Zum Zeitpunkt dieser Review ist das aktuellste getaggte Release eine Beta (v0.1.0-beta-17), erwarten Sie also, dass sich API und Modellkatalog weiter ändern.

Sendet Izwi meine Audio- oder Transkriptdaten irgendwohin?

Laut Izwis eigenem README bleiben Inferenzdaten auf Ihrem Rechner. Optionale anonyme Desktop-Analytics sind standardmäßig deaktiviert und enthalten, falls aktiviert, laut Angabe keine Prompts, Transkripte, Audio-Payloads, Dateipfade oder personenbezogenen Kennungen.

Wie installiere ich Izwi?

Laden Sie den Installer für Ihre Plattform von GitHub Releases herunter (.dmg für macOS, .deb für Linux, .exe für Windows), oder installieren Sie nur die CLI/den Server mit dem Installationsskript des Projekts oder einem Source-Build.

Quellen

← Zurück zu Lokale LLMs Pro