Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/openai-edge-tts im Test: Ein kostenloser OpenAI-kompatibler TTS-Server
Voice, Speech & Multimodal

openai-edge-tts im Test: Ein kostenloser OpenAI-kompatibler TTS-Server

·10 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

openai-edge-tts ist ein kostenloser, quelloffener, selbst gehosteter API-Server, der einen /v1/audio/speech-Endpunkt bereitstellt, der dem Text-to-Speech-API-Format von OpenAI entspricht – synthetisiert Sprache aber nicht lokal. Jede Anfrage wird über die edge-tts-Bibliothek an die kostenlosen Online-Stimmen von Microsoft Edges „Vorlesen“-Funktion weitergeleitet, sodass der gesendete Text Ihr Gerät verlässt und bei Microsofts Dienst landet – auch wenn der Server-Prozess selbst auf Hardware läuft, die Sie kontrollieren.

openai-edge-tts (github.com/travisvn/openai-edge-tts) ist ein kostenloser, quelloffener, selbst gehosteter API-Server von Entwickler travisvn, der einen /v1/audio/speech-Endpunkt bereitstellt, der dem Text-to-Speech-API-Format von OpenAI entspricht. Er führt kein lokales Sprachmodell aus – er leitet jede Anfrage über die Python-Bibliothek edge-tts an die kostenlosen Online-Stimmen von Microsoft Edges „Vorlesen“-Funktion weiter und gibt das Audio dann in einer OpenAI-kompatiblen Antwort zurück. Dieser Test zeigt genau, wohin er weiterleitet, wie man ihn installiert und für wen er geeignet ist.

Wichtigste Erkenntnisse

  • openai-edge-tts (github.com/travisvn/openai-edge-tts) ist ein kostenloser, quelloffener, selbst gehosteter API-Server – kein lokales Sprachmodell
  • Erstellt von Entwickler travisvn; Repository erstellt am 9. Oktober 2024
  • GPL-3.0-lizenziert, bestätigt über das Lizenzfeld des GitHub-Repositorys
  • Stellt /v1/audio/speech bereit, das dem Anfrage-/Antwortformat der OpenAI-Text-to-Speech-API entspricht, sodass bestehender OpenAI-TTS-Client-Code mit einer geänderten Basis-URL darauf zeigen kann
  • Sprachsynthese wird über die Python-Bibliothek edge-tts an die kostenlosen Online-Stimmen von Microsoft Edges „Vorlesen“-Funktion weitergeleitet – kein lokales Sprachmodell läuft auf Ihrer Hardware
  • Über 2.100 GitHub-Stars und 316 Forks zum Zeitpunkt dieses Tests

📍 In einem Satz

openai-edge-tts ist ein kostenloser, quelloffener (GPL-3.0) API-Server von travisvn, der einen OpenAI-kompatiblen /v1/audio/speech-Endpunkt bereitstellt, aber statt ein lokales Sprachmodell auszuführen, jede Anfrage über die edge-tts-Bibliothek an die kostenlosen Online-Stimmen von Microsoft Edge weiterleitet.

💬 In einfachen Worten

Es ist ein kleiner Server, den Sie selbst betreiben (meist in Docker) und der Text-to-Speech-Tools, die für OpenAIs API gebaut wurden, gegen eine kostenlose Stimmquelle arbeiten lässt – das eigentliche „Sprechen“ passiert aber auf Microsofts Servern, nicht auf Ihrem Gerät. Wenn Ihnen Privatsphäre gegenüber Microsoft für Ihren Text wichtig ist, bietet dieses Tool das nicht; wenn die Kosten der OpenAI-/Azure-/ElevenLabs-TTS-API das Problem sind, das Sie lösen wollen, dann schon.

📌Hinweis: Dieser Test basiert auf dem eigenen GitHub-Repository, der README und den Release Notes von openai-edge-tts. PromptQuorum behauptet nicht, eigene Latenz- oder Qualitätstests gegenüber den zugrunde liegenden Microsoft-Edge-Stimmen durchgeführt zu haben.

Was ist openai-edge-tts?

openai-edge-tts ist ein selbst gehosteter API-Server, der die Text-to-Speech-API von OpenAI nachbildet, sodass Tools, die für OpenAI, Azure AI Speech oder ElevenLabs gebaut wurden, stattdessen darauf zeigen können – ohne Abrechnung pro Anfrage. Er tut dies, indem er die edge-tts-Bibliothek umschließt, die wiederum über das Internet mit dem kostenlosen, browserbasierten „Vorlesen“-Stimmdienst von Microsoft Edge kommuniziert.

  • Produkttyp: ein selbst gehosteter API-Server (Docker oder Python), keine herunterladbare Endnutzer-App und kein lokales Sprachmodell
  • Ersteller: travisvn, ein Einzelentwickler; das GitHub-Repository liegt unter github.com/travisvn/openai-edge-tts
  • Repository erstellt am 9. Oktober 2024, laut den Repository-Metadaten von GitHub
  • Lizenz: GPL-3.0, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys; die README weist zudem darauf hin, dass Unternehmen/kommerzielle Einsätze den Autor direkt kontaktieren sollten
  • Lokalität: hybrid, nicht lokal – der Server-Prozess ist selbst gehostet, aber die eigentliche Text-to-Speech-Synthese wird an den Online-Stimmdienst von Microsoft Edge weitergeleitet, nicht auf Ihrer eigenen Hardware berechnet
  • Umfang: über 2.100 GitHub-Stars und 316 Forks zum Zeitpunkt dieses Tests

Projektgeschichte und Versionsmeilensteine

Das GitHub-Repository wurde am 9. Oktober 2024 erstellt, und der bislang wichtigste öffentliche Release-Meilenstein ist v2.0.0, veröffentlicht am 28. Dezember 2024, der Markdown-Filterung, Beta-Kompatibilität mit ElevenLabs-/Azure-AI-Speech-Endpunkten sowie eine vereinfachte Einrichtung hinzufügte.

  1. 1
    9. Oktober 2024: Repository erstellt
    Why it matters: Markiert den Start des Projekts, laut den Repository-Metadaten von GitHub.
  2. 2
    v2.0.0 — 28. Dezember 2024: Markdown-Filterung, erweiterte API-Unterstützung, vereinfachte Einrichtung
    Why it matters: Fügte optionale Markdown-Filterung des Ausgabetexts hinzu, Beta-Drop-in-Kompatibilität mit ElevenLabs- und Azure-AI-Speech-Endpunkten (neben dem bestehenden OpenAI-Format-Endpunkt) und machte das `/v1`-Routenpräfix optional, laut den offiziellen GitHub-Release-Notes.

Was macht openai-edge-tts tatsächlich?

openai-edge-tts empfängt eine Text-to-Speech-Anfrage im API-Format von OpenAI, ordnet die angeforderte Stimme und Einstellungen einer entsprechenden Microsoft-Edge-Stimme zu, ruft das synthetisierte Audio über die edge-tts-Bibliothek von Microsofts Online-Dienst ab und gibt es im vom Client erwarteten Format zurück.

  • OpenAI-kompatibler Endpunkt: /v1/audio/speech (das /v1-Präfix ist seit v2.0.0 optional), passend zum Anfrage-/Antwortformat der OpenAI-TTS-API, sodass bestehender Client-Code nur eine geänderte Basis-URL benötigt
  • Stimmzuordnung: OpenAI-Stimmennamen (alloy, echo, fable, onyx, nova, shimmer) werden standardmäßig bestimmten edge-tts-Stimmen zugeordnet; die README dokumentiert außerdem die direkte Auswahl jeder edge-tts-Stimme unter Umgehung der OpenAI-Namenszuordnung
  • Beta-Kompatibilitätsschichten: Drop-in-Endpunkte, die die APIs von ElevenLabs und Azure AI Speech nachbilden, zusätzlich zum primären OpenAI-Format-Endpunkt, eingeführt in v2.0.0
  • Audioformate: mp3-, opus-, aac-, flac-, wav- und pcm-Ausgabe, laut README
  • Streaming: Server-Sent-Events(SSE)-Streaming mit Base64-kodierten Audio-Chunks, für Clients, die inkrementelles Audio statt einer vollständigen Datei wollen
  • Geschwindigkeitssteuerung: einstellbare Wiedergabegeschwindigkeit von 0,25x bis 4,0x
  • Optionale Markdown-Filterung: entfernt standardmäßig Markdown-Syntax aus dem Eingabetext vor der Synthese, da Quelltext (zum Beispiel aus einer LLM-Antwort) oft Markdown enthält, das nicht wörtlich vorgelesen werden sollte; kann über eine REMOVE_FILTER-Umgebungsvariable deaktiviert werden
  • Konfiguration: eine .env-Datei legt API-Schlüssel, Port (Standard 5050), Standardstimme, Standardgeschwindigkeit und Standardsprache fest

Anwendungsbeispiele: Zwei Wege, openai-edge-tts zu nutzen

Dies sind konkrete Arbeitsabläufe, die auf den oben dokumentierten Funktionen des Projekts basieren.

Plattform, Preise und Lizenzierung

Plattform

Was openai-edge-tts angibt:
Ein selbst gehosteter API-Server (Docker oder Python) – keine grafische Oberfläche, keine herunterladbare Endnutzer-App; läuft auf jedem Host, der Docker oder Python ausführen kann.

Kosten

Was openai-edge-tts angibt:
Kostenlos und quelloffen für den privaten Gebrauch. Die README weist darauf hin, dass Unternehmen/kommerzielle Einsätze den Autor (travisvn) direkt kontaktieren sollten.

Lizenzierung

Was openai-edge-tts angibt:
GPL-3.0, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys.

Installationsmethode

Was openai-edge-tts angibt:
Docker (docker run oder Docker Compose) ist der dokumentierte Hauptweg; ein Python-Virtualenv-plus-pip-Weg ist ebenfalls für den Betrieb ohne Docker dokumentiert.

Prüfen Sie die aktuellen Lizenz- und Nutzungsbedingungen für kommerzielle Zwecke direkt im GitHub-Repository, bevor Sie dies im Organisationsmaßstab einsetzen, da der Hinweis zur Unternehmenskontaktaufnahme in der README eine erklärte Absicht ist, kein separat veröffentlichter kommerzieller Lizenztext, den dieser Test unabhängig prüfen konnte.

openai-edge-tts vs. Piper TTS

openai-edge-tts und Piper TTS lösen dasselbe Problem eines „kostenlosen OpenAI-kompatiblen TTS-Endpunkts“ auf entgegengesetzte Weise: Das eine leitet an einen kostenlosen Cloud-Stimmdienst weiter, das andere führt ein echtes neuronales TTS-Modell vollständig auf Ihrer eigenen Hardware aus. Sie werden verglichen, weil beide bei den gleichen Suchanfragen zu „wie füge ich meinem selbst gehosteten KI-Stack kostenloses TTS hinzu“ auftauchen.

Aspekt
openai-edge-tts
Piper TTS
Wo die Synthese stattfindetMicrosofts Edge-Stimmdienst, über das NetzwerkVollständig auf Ihrer eigenen CPU, kein Netzwerkaufruf
LokalitätHybrid – selbst gehosteter Server, Cloud-abhängige SyntheseVollständig lokal – funktioniert offline nach dem Modell-Download
Stimmqualität/-stilMicrosoft Edges kommerzielle Online-Stimmen, viele SprachenKleinere neuronale Stimmmodelle, Qualität variiert je Stimme, Download pro Stimme
AbhängigkeitsrisikoAbhängig davon, dass Microsoft diesen kostenlosen Dienst weiter anbietetAbhängig nur davon, dass die heruntergeladene Modelldatei weiter funktioniert
LizenzGPL-3.0MIT

Wenn das Senden von Text an Microsoft für Ihren Anwendungsfall akzeptabel ist und Sie eine breite Auswahl ausgereifter Stimmen ohne lokale Rechenkosten wollen, ist openai-edge-tts der einfachere Weg. Wenn die Synthese vollständig auf Hardware bleiben muss, die Sie kontrollieren, ist Piper TTS (oder eine andere wirklich lokale Engine) die richtige Wahl, nicht dieses Tool.

Für wen eignet sich openai-edge-tts?

openai-edge-tts eignet sich für Entwickler, die die Kosten pro Anfrage einer kommerziellen TTS-API eliminieren wollen, ohne eine OpenAI-förmige Integration aufzugeben, und die damit einverstanden sind, dass Text an Microsofts Edge-Stimmdienst gesendet wird.

Wofür openai-edge-tts nicht geeignet ist

openai-edge-tts eignet sich nicht, wenn wirklich lokale, offline-fähige oder datenschutzsensible Sprachsynthese eine Anforderung ist.

  • Nicht offlinefähig – jede Syntheseanfrage benötigt eine funktionierende Internetverbindung zu Microsofts Edge-Stimmdienst; funktioniert nicht auf einem vom Netzwerk getrennten Rechner
  • Nicht privat auf die Art eines lokalen Modells – zur Synthese gesendeter Text erreicht Microsofts Server, dieses Tool hält synthetisierten Text also nicht auf Ihrer eigenen Hardware
  • Nicht durch eine offizielle, dokumentierte Microsoft-API abgesichert – es hängt vom selben kostenlosen „Vorlesen“-Stimmmechanismus ab, den der Edge-Browser nutzt, den Microsoft ohne Ankündigung ändern oder einschränken könnte; die README selbst dokumentiert kein formales Rate-Limit oder eine Nutzungsbedingungsgarantie für diese Abhängigkeit
  • Kein Stimmklon-Tool – es bietet nur Microsoft Edges bestehende voreingestellte Stimmen, ohne Unterstützung fürs Trainieren oder Klonen einer individuellen Stimme aus eigenem Audio
  • Nicht standardmäßig kommerziell lizenziert – die README bittet Unternehmen/kommerzielle Einsätze, den Autor direkt zu kontaktieren, statt anzunehmen, dass die GPL-3.0-Bedingungen allein diesen Anwendungsfall abdecken

Häufige Fehler bei der Bewertung von openai-edge-tts

Die meiste Verwirrung über openai-edge-tts entsteht durch die Annahme, es verhalte sich wie ein lokales Modell, weil es selbst gehostet ist, oder durch das Übersehen des Beta-Status seiner Nicht-OpenAI-Endpunktmodi.

Konkurrenten und Alternativen

openai-edge-tts wird am häufigsten mit wirklich lokalen, offline-fähigen Text-to-Speech-Engines verglichen, die ebenfalls einen OpenAI-kompatiblen Endpunkt bereitstellen – sein Hauptunterscheidungsmerkmal ist der Tausch echter Offline-Privatsphäre gegen Microsoft Edges breitere, ausgereiftere Stimmauswahl bei null lokalen Rechenkosten.

Tool
Bekannt für
Link
Piper TTSSchnelle, vollständig lokale, reine CPU-neuronale TTS-Engine aus dem Rhasspy-ProjektPiper TTS Review
Coqui TTSQuelloffenes lokales TTS-Toolkit mit Stimmklon-Unterstützung und vielen SprachenCoqui TTS Review
XTTS-v2Lokales Zero-Shot-Stimmklon-TTS-Modell von CoquiXTTS-v2 Review
BarkLokales, transformerbasiertes TTS-Modell mit ausdrucksstarker Nicht-Sprach-AudioerzeugungBark Review

Diese Liste zeigt Tools, die üblicherweise mit openai-edge-tts im lokalen/selbst gehosteten TTS-Bereich verglichen werden, kein unabhängiges PromptQuorum-Ranking – prüfen Sie den aktuellen Funktionsumfang und die Hardwareanforderungen jedes Tools, bevor Sie sich entscheiden.

Häufig gestellte Fragen

Was ist openai-edge-tts?

openai-edge-tts (github.com/travisvn/openai-edge-tts) ist ein kostenloser, quelloffener (GPL-3.0), selbst gehosteter API-Server, der einen /v1/audio/speech-Endpunkt bereitstellt, der dem Text-to-Speech-API-Format von OpenAI entspricht, gestützt auf Microsoft Edges kostenlose Online-Stimmen statt eines lokalen Sprachmodells.

Läuft openai-edge-tts lokal oder nutzt es die Cloud?

Es ist hybrid, nicht vollständig lokal. Der Server selbst ist selbst gehostet, aber jede Text-to-Speech-Anfrage wird über das Internet über die edge-tts-Bibliothek an den kostenlosen Online-„Vorlesen“-Stimmdienst von Microsoft Edge weitergeleitet.

Ist openai-edge-tts kostenlos?

Ja, für den privaten Gebrauch. Es ist kostenlos und quelloffen unter GPL-3.0. Die README weist darauf hin, dass Unternehmen/kommerzielle Einsätze den Autor travisvn direkt kontaktieren sollten.

Schützt openai-edge-tts meine Privatsphäre?

Nicht auf die Art eines lokalen Modells. Da die Synthese an Microsofts Edge-Stimmdienst weitergeleitet wird, bleibt der gesendete Text nicht auf Ihrer eigenen Hardware – verwenden Sie es nicht für Text, den Sie nicht von einem Cloud-Dienst eines Drittanbieters verarbeitet haben möchten.

Wie installiere ich openai-edge-tts?

Der dokumentierte Schnellstart ist Docker: docker run -d -p 5050:5050 -e API_KEY=your_api_key_here -e PORT=5050 travisvn/openai-edge-tts:latest. Eine Docker-Compose-Einrichtung und eine direkte Python-/pip-Installation sind ebenfalls in der GitHub-README dokumentiert.

Welche Stimmen unterstützt openai-edge-tts?

Es ordnet die sechs Standard-Stimmennamen von OpenAI (alloy, echo, fable, onyx, nova, shimmer) standardmäßig entsprechenden Microsoft-Edge-Stimmen zu und erlaubt außerdem die direkte Auswahl jeder edge-tts-Stimme, was viele Sprachen abdeckt.

Kann openai-edge-tts ElevenLabs oder Azure AI Speech ersetzen, nicht nur OpenAI?

Das Projekt fügte in v2.0.0 (Dezember 2024) Beta-Drop-in-Kompatibilitätsendpunkte für ElevenLabs und Azure AI Speech hinzu, neben seinem primären OpenAI-Format-Endpunkt. Prüfen Sie das aktuelle Verhalten gegen Ihren spezifischen Client, bevor Sie sich in der Produktion darauf verlassen.

Wer hat openai-edge-tts erstellt?

Ein Einzelentwickler namens travisvn hat openai-edge-tts erstellt und pflegt es. Das GitHub-Repository wurde am 9. Oktober 2024 erstellt.

Unterstützt openai-edge-tts Stimmklonen?

Nein. Es bietet nur Microsoft Edges bestehende voreingestellte Stimmen; es gibt keine Funktion zum Trainieren oder Klonen einer individuellen Stimme aus eigenen Audioproben.

Hat PromptQuorum die Angaben von openai-edge-tts unabhängig getestet?

Dieser Test basiert auf dem eigenen GitHub-Repository, der README und den Release Notes des Projekts, nicht auf eigenen Latenz- oder Audioqualitätstests von PromptQuorum.

Quellen

← Zurück zu Lokale LLMs Pro