Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Willow Inference Server Review 2026: Selbst gehostete Whisper-ASR und TTS
Voice, Speech & Multimodal

Willow Inference Server Review 2026: Selbst gehostete Whisper-ASR und TTS

·11 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Willow Inference Server ist ein kostenloser, quelloffener, selbst gehosteter Sprach-Inferenz-Server (Quellcode unter github.com/toverainc/willow-inference-server) von Tovera, der Whisper-basierte Sprache-zu-Text- und Text-zu-Sprache-Funktionen über WebRTC, REST und WebSockets bereitstellt. Es gibt keine kostenpflichtige Stufe: Die GitHub-LICENSE-Datei ist die Apache License 2.0. Willow Inference Server läuft unter Linux (Windows über WSL) via Docker Compose, benötigt eine CUDA-fähige NVIDIA-GPU mit bereits 3 GB VRAM für den Basisbetrieb (6 GB empfohlen für ASR und TTS zusammen) und wurde ursprünglich als Backend für das quelloffene Sprachassistenz-Hardware-Projekt Willow entwickelt — allerdings unterstützt es zum Zeitpunkt dieser Review keine allgemeine LLM-/Chat-Inferenz mehr, eine Funktion, die die eigenen Maintainer im Februar 2026 entfernt haben.

Willow Inference Server (WIS, github.com/toverainc/willow-inference-server) ist ein kostenloser, quelloffener, selbst gehosteter Sprach-Server von Tovera, der Whisper-basierte Spracherkennung (ASR) und Text-zu-Sprache (TTS) über WebRTC, REST und WebSockets bereitstellt. Er wurde ursprünglich als Backend für das quelloffene Sprachassistenz-Hardware-Projekt Willow entwickelt und kann auch eigenständig auf Ihrer eigenen GPU laufen. Diese Review behandelt, was Willow Inference Server tatsächlich kann, die Docker-Installationsschritte, die realen Hardware-Anforderungen und den aktuellen Pflegezustand des Projekts.

Wichtigste Erkenntnisse

  • Willow Inference Server ist kostenlos und quelloffen; die offizielle GitHub-LICENSE ist die Apache License 2.0
  • Führt Whisper-basierte automatische Spracherkennung (ASR) und Text-zu-Sprache (TTS) aus, erreichbar über WebRTC, REST und WebSockets
  • Wird via Docker Compose unter Linux bereitgestellt (Windows über WSL); eine CPU-only-Docker-Compose-Datei ist ebenfalls vorhanden, wobei die CPU-Leistung laut Dokumentation deutlich langsamer als GPU ist
  • Läuft auf NVIDIA-GPUs von der GTX 1060 3 GB bis zur RTX 4090; etwa 6 GB VRAM werden empfohlen, um alle Standard-Whisper-Modellgrößen zusammen mit TTS auszuführen
  • Unterstützt individuelle TTS-Stimmerstellung aus einer relativ kurzen Beispielaufnahme
  • Entwickelt von Tovera als Backend für das quelloffene Sprachassistenz-Hardware-Projekt Willow
  • Unterstützt keine allgemeine LLM-/Chat-Inferenz mehr — diese Funktion wurde in einem Commit im Februar 2026 explizit entfernt; die eigenen Maintainer des Projekts verweisen Nutzer darauf, dafür ein separates Tool wie Ollama daneben laufen zu lassen
  • Das GitHub-Repository (github.com/toverainc/willow-inference-server) zeigt Stand September 2026 rund 510 Sterne; die Commit-Aktivität verläuft in Schüben statt kontinuierlich — betrachten Sie dies als kleineres, langsamer voranschreitendes Projekt als ein stark besetztes kommerzielles

📍 In einem Satz

Willow Inference Server ist ein kostenloser, quelloffener, selbst gehosteter Server, der Whisper-basierte Spracherkennung und Text-zu-Sprache auf Ihrer eigenen NVIDIA-GPU ausführt, ohne jegliche kostenpflichtige Stufe.

💬 In einfachen Worten

Statt Ihre Sprachaufnahmen an eine Cloud-Sprach-API zu senden, führt Willow Inference Server die Sprache-zu-Text- und Text-zu-Sprache-Modelle auf einem Rechner aus, den Sie selbst kontrollieren — meist einem mit einer NVIDIA-Grafikkarte. Es wurde entwickelt, um das Willow-Sprachassistenz-Hardware-Projekt anzutreiben, kann aber auch eigenständig für jede App laufen, die Sprache in Text oder Text in Sprache umwandeln muss, ohne Cloud-Abhängigkeit.

📌Hinweis: Diese Review ist das vertiefende Begleitstück zum Eintrag von Willow Inference Server im lokalen KI-Software-Verzeichnis — dort finden Sie einen schnellen Überblick, wie es im Vergleich zu Dutzenden anderer lokaler KI-Tools abschneidet.

Was ist Willow Inference Server?

Willow Inference Server ist ein selbst gehosteter Server, der Spracherkennungs- und Sprachsynthese-Modelle auf Ihrer eigenen Hardware ausführt, erreichbar über WebRTC, REST und WebSockets. Die eigene GitHub-Beschreibung lautet: "Open source, local, and self-hosted highly optimized language inference server supporting ASR/STT, TTS, and LLM across WebRTC, REST, and WS" — eine Beschreibung, die diese Review als teilweise veraltet einstuft, da die allgemeine LLM-Unterstützung im Februar 2026 aus dem Code entfernt wurde (siehe Geschichtsabschnitt unten). Zum Zeitpunkt dieser Review ist WIS korrekt als ASR-/TTS-Server zu beschreiben, nicht als allgemeiner LLM-Server.

  • Kernfunktion: ein Sprach-Inferenz-Server, der Audio oder Text über WebRTC, REST oder WebSockets entgegennimmt und transkribierten Text oder synthetisierte Audio zurückgibt
  • Spracherkennungs-Engine: OpenAIs Whisper-Modelle, vom Projekt auf niedrige Latenz im Streaming-Betrieb getrimmt
  • Text-zu-Sprache-Engine: eine gebündelte TTS-Pipeline (das Repository enthält ein eigenes Dockerfile.xtts und ein xtts-Verzeichnis) mit Unterstützung für individuelle Stimmerstellung aus kurzen Beispielaufnahmen
  • Bereitstellungsziel: CUDA-fähige NVIDIA-GPUs, mit einem dokumentierten CPU-only-Fallback-Pfad für geringere Leistung
  • Entwickler: Tovera, die Organisation hinter dem quelloffenen Sprachassistenz-Hardware-Projekt Willow
  • Kanonisches Repository: github.com/toverainc/willow-inference-server — der aktuell aktive Projekt- und Organisationsname für Quellcode, Releases und Issue-Tracker des Servers

Projektgeschichte von Willow Inference Server

Das GitHub-Repository von Willow Inference Server wurde im Februar 2023 erstellt, und die Commit-Historie zeigt Aktivitätsschübe, getrennt durch lange ruhige Phasen, statt kontinuierlicher wöchentlicher Entwicklung — ein Muster, das Sie kennen sollten, bevor Sie sich für den Produktivbetrieb darauf verlassen.

  1. 1
    Februar 2023 — Repository erstellt
    Why it matters: Willow Inference Server startete als Backend-Begleiter des Sprachassistenz-Hardware-Projekts Willow, das die Organisation Tovera ebenfalls pflegt.
  2. 2
    April 2024 — Updates der TTS-Engine
    Why it matters: Commits aus diesem Zeitraum aktualisierten laut Commit-Historie des Repositorys die gebündelte XTTS-Stimmklon-Pipeline.
  3. 3
    Juni 2025 — Code-Qualitäts-Durchgang
    Why it matters: Ein Commit-Bündel ersetzte das flake8-Linting des Projekts durch black-Code-Formatierung und formatierte die Python-Codebasis neu — ein Wartungsdurchgang statt eines Feature-Releases, nach etwa 14 Monaten ohne öffentlichen Commit.
  4. 4
    Februar 2026 — LLM-/Chat-Unterstützung entfernt
    Why it matters: Ein Commit mit dem Titel "README: drop LLM/chat references" stellt unmissverständlich fest: "We no longer support that. People can run ollama next to WIS." Dies ist die folgenreichste Änderung in der jüngeren Geschichte des Projekts — sie verengt den Umfang von WIS von einem kombinierten ASR-/TTS-/LLM-Server zu einem reinen ASR-/TTS-Server, und es ist der jüngste Commit auf dem Main-Branch des Repositorys zum Zeitpunkt dieser Review.

Was können Sie mit Willow Inference Server tun?

Der Funktionsumfang von Willow Inference Server dreht sich um schnelle, selbst gehostete Sprachverarbeitung statt allgemeinen Sprachmodell-Chat. Hier ist, was jeder Teil tatsächlich tut, laut der eigenen GitHub-README des Projekts.

  • Automatische Spracherkennung (ASR) — transkribiert gesprochene Audio zu Text mithilfe Whisper-basierter Modelle, vom Projekt auf "so nah wie möglich an Echtzeit" gestreamte Erkennung getrimmt, statt nur Stapelverarbeitung
  • Mehrere gleichzeitige Whisper-Modellgrößen — die README besagt, dass alle drei Standard-Whisper-Modellgrößen (base, medium, large-v2) gleichzeitig innerhalb von 6 GB VRAM geladen werden können, sodass eine Bereitstellung pro Anfrage Genauigkeit gegen Geschwindigkeit abwägen kann, statt sich auf eine Modellgröße festzulegen
  • Text-zu-Sprache (TTS) mit Stimmklonen — synthetisiert Sprache aus Text, mit Unterstützung für die Erstellung einer individuellen Stimme aus einer relativ kurzen Beispielaufnahme, über die gebündelte XTTS-basierte Pipeline
  • Multi-Protokoll-Zugriff — erreichbar über WebRTC (für Echtzeit-Audio-Streaming mit geringer Bandbreite), REST und WebSockets, sodass ein Client den für seinen Anwendungsfall passenden Transportweg wählen kann
  • Automatische Hardware-Erkennung — der Server erkennt laut Dokumentation automatisch verfügbare Hardware und passt sein Verhalten entsprechend an, statt manuelle Konfiguration pro GPU-Modell zu erfordern
  • Willow-Sprachassistenz-Backend — WIS ist das Inferenz-Backend, mit dem sich das quelloffene Sprachassistenz-Hardware-Projekt Willow verbindet, um gesprochene Befehle in Text und optional Antworten zurück in Sprache umzuwandeln

Anwendungsbeispiele: Drei Möglichkeiten, Willow Inference Server zu nutzen

Dies sind konkrete Workflows, die auf den oben dokumentierten Funktionen von Willow Inference Server aufbauen — keine hypothetischen Anwendungsfälle.

Willow Inference Server Preise: Ist es wirklich kostenlos?

Ja — Willow Inference Server hat keine kostenpflichtige Stufe. Das GitHub-Repository hat keine Preisseite, und die LICENSE.md-Datei gilt für die gesamte Anwendung. Der Lizenztext ist die Apache License, Version 2.0 — permissiv, mit einer Patentgewährung und ohne Copyleft-Pflicht, eigene Änderungen zu veröffentlichen.

  • Kein Abonnement, keine kostenpflichtige Stufe, keine von Willow Inference Server selbst auferlegten Nutzungslimits
  • Kein Konto oder Registrierung zur Bereitstellung oder Nutzung der Software erforderlich
  • Der Betrieb von WIS erfordert weiterhin Ihre eigene GPU-Hardware und die Strom-/Hosting-Kosten für deren Betrieb — die Software selbst ist kostenlos, aber Self-Hosting ist nicht kostenlos in dem Sinne, wie es eine gehostete API sein kann
  • Tovera betreibt außerdem einen gehosteten Beispiel-Server für das separate Sprachassistenz-Hardware-Projekt Willow — diese Review behandelt speziell die selbst gehostete, kostenlos zu betreibende WIS-Software; wenden Sie sich direkt an Tovera für Details zu einem separaten gehosteten Angebot und ob dieses eigene Kosten verursacht

Willow Inference Server vs. whisper.cpp

Willow Inference Server und whisper.cpp führen beide OpenAIs Whisper-Spracherkennungsmodelle lokal aus, und sie werden oft verglichen, weil beide vermeiden, Audio an eine Cloud-API zu senden. Die klarsten Unterschiede liegen im Bereitstellungsmodell und im Umfang.

Aspekt
WIS
whisper.cpp
UmfangASR + TTS Server mit WebRTC/REST/WSNur ASR (Transkription), kein Server/TTS
BereitstellungDocker Compose, GPU-fokussiertKompilierte Binärdatei/Bibliothek, CPU-freundlich
Hardware-ZielNVIDIA-CUDA-GPU (3–6+ GB VRAM)Läuft auf CPU; GPU-Beschleunigung optional
Echtzeit-StreamingDafür gebaut, via WebRTCMit zusätzlicher Client-Arbeit möglich
Hardware-IntegrationAls Willow-Assistenz-Backend gebautAllzweck-Bibliothek, keine Hardware-Anbindung
Pflege-TempoSchubweise; letzter Commit Feb. 2026Aktiv gepflegt, häufige Commits

Wenn Ihre Priorität ein fertiger Server mit eingebautem WebRTC-Streaming und TTS ist und Sie eine freie NVIDIA-GPU haben, ist der Funktionsumfang von Willow Inference Server der breitere der beiden. Wenn Ihre Priorität die leichtestmögliche, CPU-freundliche Transkriptionsbibliothek zur Einbettung in Ihre eigene Anwendung ist, lohnt sich eine direkte Prüfung von whisper.cpp — siehe die whisper.cpp Review für alle Details.

Für wen eignet sich Willow Inference Server?

Ob Willow Inference Server zu Ihnen passt, hängt davon ab, ob Sie eine kompatible NVIDIA-GPU besitzen, sowohl ASR als auch TTS in einem Server benötigen und mit einem Projekt zurechtkommen, das Updates schubweise statt kontinuierlich ausliefert.

Willow Inference Server vs. andere Sprach-Tools

Willow Inference Server ist eine von mehreren selbst gehosteten Optionen für lokale Spracherkennung und -synthese. So schneidet es im Vergleich zu anderen Tools in diesem Bereich ab — siehe das lokale KI-Software-Verzeichnis für den vollständigen Katalog und den eigenen Vergleich Willow Inference Server vs. whisper.cpp oben für den direktesten Vergleich.

  • whisper.cpp — ein leichtgewichtiger, CPU-freundlicher C/C++-Port von OpenAIs Whisper nur für Transkription, ohne eingebauten Server, WebRTC oder TTS; siehe den eigenen Vergleichsabschnitt oben.
  • Faster Whisper — eine auf CTranslate2 basierende Neuimplementierung von Whisper mit Fokus auf Inferenzgeschwindigkeit; eine einzubettende Bibliothek statt eines fertigen ASR-/TTS-Servers wie WIS.
  • Piper TTS — eine leichtgewichtige, CPU-freundliche lokale Text-zu-Sprache-Engine; enger im Umfang als der kombinierte ASR+TTS-Server von WIS, aber weit genügsamer bei den Hardware-Anforderungen.
  • Coqui TTS — ein quelloffenes Text-zu-Sprache-Toolkit mit Stimmklon-Unterstützung, im TTS-Umfang vergleichbar mit der von WIS gebündelten XTTS-Pipeline, aber als Bibliothek statt als WebRTC-fertiger Server vertrieben.
  • Bark TTS — ein generatives Text-zu-Sprache-Modell, das auch nicht-sprachliches Audio (Lachen, Pausen) erzeugen kann; eine andere TTS-Engine-Wahl als die von WIS gebündelte XTTS-Pipeline.
  • MacWhisper — eine native macOS-Desktop-App für Whisper-Transkription; eine grafische Desktop-Alternative für Nutzer, die das Server-/WebRTC-Bereitstellungsmodell von WIS überhaupt nicht benötigen.

Häufige Fehler bei der Bewertung von Willow Inference Server

Die meiste Verwirrung rund um Willow Inference Server entsteht durch veraltete Beschreibungen der LLM-Unterstützung, unklare Hardware-Erwartungen oder eine Überschätzung, wie aktiv derzeit Updates ausgeliefert werden.

Häufig gestellte Fragen

Was ist Willow Inference Server?

Willow Inference Server (WIS, github.com/toverainc/willow-inference-server) ist ein kostenloser, quelloffener, selbst gehosteter Server, der Whisper-basierte Spracherkennung und Text-zu-Sprache ausführt, erreichbar über WebRTC, REST und WebSockets. Er wurde von Tovera als Backend für das Sprachassistenz-Hardware-Projekt Willow entwickelt.

Ist Willow Inference Server kostenlos?

Ja. Das GitHub-Repository hat keine Preisseite, und die LICENSE.md-Datei ist die Apache License 2.0, die für die gesamte Anwendung ohne kostenpflichtige Stufe gilt. Sie müssen weiterhin Ihre eigene GPU-Hardware stellen und bezahlen, um es zu betreiben.

Unterstützt Willow Inference Server LLM-/Chat-Inferenz?

Nein, zum Zeitpunkt dieser Review nicht. Ein Commit im Februar 2026 entfernte die allgemeine LLM-/Chat-Unterstützung aus dem Projekt, wobei die Maintainer feststellten: "We no longer support that. People can run ollama next to WIS." Willow Inference Server ist derzeit ein reiner ASR-/TTS-Server.

Welche GPU benötigt Willow Inference Server?

Eine CUDA-fähige NVIDIA-GPU. Das Projekt dokumentiert eine GTX 1060 3 GB als praktisches Minimum, mit etwa 6 GB VRAM empfohlen, um alle drei Standard-Whisper-Modellgrößen (base, medium, large-v2) zusammen mit TTS auszuführen. Ein Nur-CPU-Docker-Compose-Pfad existiert, ist aber laut Dokumentation deutlich langsamer.

Wie installiere ich Willow Inference Server?

Klonen Sie das GitHub-Repository und führen Sie docker compose up mit der bereitgestellten docker-compose.yml für die GPU-Bereitstellung aus, oder docker compose -f docker-compose-cpu.yml up für den Nur-CPU-Pfad. Prüfen Sie das Repository direkt auf aktuelle Anweisungen, bevor Sie installieren, da sich diese zwischen Commits ändern können.

Wird Willow Inference Server aktiv gepflegt?

Die Commit-Historie zeigt Aktivitätsschübe, getrennt durch mehrmonatige Lücken, statt kontinuierlicher Entwicklung — etwa rund 14 Monate ohne öffentliche Commits zwischen April 2024 und Juni 2025. Zum Zeitpunkt dieser Review stammt der jüngste Commit auf dem Main-Branch vom Februar 2026, und das Repository hat keine getaggten Releases. Es ist nicht archiviert, aber dies ist ein kleineres, von der Community getragenes Projekt statt eines mit kontinuierlicher Release-Kadenz.

Wie verhalten sich Willow Inference Server und Willow zueinander?

Willow ist ein separates quelloffenes Sprachassistenz-Hardware-/Firmware-Projekt, ebenfalls von Tovera gepflegt. Willow Inference Server ist die Backend-Software, die Sprache für Willow-Geräte verarbeitet, kann aber auch eigenständig für andere Sprache-zu-Text- oder Text-zu-Sprache-Anwendungsfälle laufen.

Kann Willow Inference Server eine individuelle Stimme für TTS klonen?

Ja. Die gebündelte XTTS-basierte TTS-Pipeline unterstützt laut Projektdokumentation die Erstellung eines individuellen Stimmprofils aus einer relativ kurzen Beispielaufnahme.

Welche Lizenz verwendet Willow Inference Server?

Die Apache License, Version 2.0, laut der offiziellen LICENSE.md-Datei — permissiv, mit einer Patentgewährung und ohne Pflicht, eigene Änderungen quelloffen zu veröffentlichen.

Unterstützt Willow Inference Server Echtzeit-Streaming?

Ja, über WebRTC, das das Projekt speziell für latenzarme Echtzeit-Audio-Anwendungsfälle wie einen kontinuierlich auf Befehle lauschenden Sprachassistenten gebaut hat. REST- und WebSocket-Endpunkte sind ebenfalls für nicht-streamende oder einfachere Integrationen verfügbar.

Quellen

← Zurück zu Lokale LLMs Pro