Wichtigste Erkenntnisse
- Kokoro-82M: Apache-2.0, 82M Parameter, läuft über Apples MLX-Framework via das Community-Projekt mlx-audio — der echte Apple-Silicon-Beschleunigungspfad.
- Piper: GPL-3.0-or-later, von Grund auf nur CPU via ONNX Runtime — gleiches Leistungsprofil auf Intel- und Apple-Silicon-Macs.
- XTTS v2: nicht-kommerzielle CPML-Lizenz, Voice-Cloning aus ~6 Sekunden Audio, doch die Metal-(MPS)-Unterstützung ist ein verfolgtes, ungelöstes GitHub-Issue — läuft auf Mac nur mit CPU.
- Bark: MIT-Lizenz, experimentelle Apple-Silicon-MPS-Unterstützung hinter einer Umgebungsvariable, keine Commits im öffentlichen Repository seit April 2024.
- Intel-Macs können den MLX-beschleunigten Kokoro-Pfad überhaupt nicht nutzen — MLX erfordert Apple Silicon.
📍 In einem Satz
Für lokale Text-zu-Sprache auf Apple Silicon ist Kokoro-82M die einzige der vier großen lokalen Engines mit einem echten Metal-GPU-Pfad (via das Community-Projekt mlx-audio auf Apples MLX-Framework); Piper ist die einfachste reine-CPU-Option, die sich auf Intel-Macs identisch verhält; XTTS v2 bietet Voice-Cloning, doch seine Apple-Silicon-MPS-Unterstützung ist ein dokumentiertes, defektes GitHub-Issue; und Barks MPS-Unterstützung ist ausdrücklich experimentell.
💬 In einfachen Worten
Nicht jedes kostenlose Text-zu-Sprache-Programm, das auf einem Mac läuft, nutzt tatsächlich den Grafikchip des Macs — manche laufen einfach auf dem normalen Prozessor, was gut funktioniert, aber langsamer ist als möglich. Kokoro ist dasjenige, das gebaut wurde, um Apples eigenes Chipdesign über ein Projekt namens MLX zu nutzen; die anderen überspringen die GPU entweder von Grund auf (Piper) oder versuchen sie zu nutzen, stoßen aber auf ungelöste Probleme (XTTS v2, Bark).
📌Hinweis: Dieser Leitfaden vergleicht die vier lokalen TTS-Engines, die PromptQuorum unabhängig getestet hat (Piper, Kokoro, XTTS v2, Bark). Jede hat ihren eigenen dedizierten Test, durchgängig verlinkt, für Installationsbefehle, Lizenzdetails und vollständige Einschränkungen.
Welche lokale TTS-Engine sollten Sie tatsächlich installieren?
Die richtige Engine hängt davon ab, ob Sie GPU-Beschleunigung, Voice-Cloning oder möglichst breite Mac-Kompatibilität benötigen — keine einzelne Engine gewinnt in allen drei Punkten. Kokoro ist die einzige Engine hier mit einem echten Apple-Silicon-GPU-Pfad; Piper ist am portabelsten; XTTS v2 ist die einzige, die Stimmen klont.
- 🏆 Insgesamt am besten für Apple Silicon: Kokoro-82M via mlx-audio — die einzige hier behandelte Engine mit einem echten Metal-GPU-Pfad, klein genug (82M Parameter), um auf jedem Apple-Silicon-Mac bequem zu laufen.
- Am besten für Einfachheit und Intel-Kompatibilität: Piper — von Grund auf nur CPU, sodass Installation und Leistung identisch sind, egal ob auf einem M-Series-Chip oder einem älteren Intel-Mac.
- Am besten, wenn Sie Voice-Cloning benötigen: XTTS v2 — klont eine Stimme aus ~6 Sekunden Referenzaudio, läuft aber auf jedem Mac nur mit CPU und ist ausschließlich für nicht-kommerzielle Nutzung lizenziert.
- Am besten für ausdrucksstarkes, nicht-sprachliches Audio: Bark — Lachen, Seufzer und einfache Musik aus Text, mit experimenteller (teilweiser) Apple-Silicon-GPU-Unterstützung, wobei sein Repository seit April 2024 ruht.
Wer sollte welche Engine nutzen?
Wählen Sie die Engine passend zu Ihrem Mac und Ihrer tatsächlichen Anforderung, nicht danach, welche die meisten GitHub-Sterne hat. GPU-Beschleunigung ist nur wichtig, wenn Sie genug Audio, oft genug, generieren, dass reine CPU-Synthese sich langsam anfühlt.
- 🧭 Apple-Silicon-Mac, wollen die schnellste lokale Option: Kokoro via mlx-audio — die einzige hier behandelte Engine, die geschrieben wurde, um Metal über MLX zu nutzen.
- 🧭 Jeder Mac, auch ein älteres Intel-Modell: Piper — von Grund auf nur CPU, sodass es nichts Apple-Silicon-Spezifisches zu konfigurieren oder zu beheben gibt.
- 🧭 Müssen eine bestimmte Stimme aus einer kurzen Aufnahme klonen: XTTS v2 — akzeptieren Sie, dass es auf einem Mac nur mit CPU läuft und seine Lizenz nicht-kommerziell ist.
- 🧭 Wollen Lachen, Seufzer oder Umgebungsgeräusche, nicht nur Sprache: Bark — kalkulieren Sie aber zusätzliche Installationszeit für seinen experimentellen Apple-Silicon-Pfad ein, und prüfen Sie vorab den aktuellen Pflegestatus.
- ❌ Überspringen Sie Bark, wenn Sie aktive Pflege oder garantierte Leistung benötigen — sein öffentliches Repository zeigt seit April 2024 keine Commits mehr, unabhängig von der Apple-Silicon-Frage.
- ❌ Überspringen Sie XTTS v2, wenn Sie ein kommerzielles Produkt bauen — seine Coqui Public Model License (CPML) ist nicht-kommerziell, und Coqui AI, das Unternehmen, das es veröffentlichte, stellte seine kostenpflichtigen Dienste im Dezember 2023 ein.
Wie schneiden Piper, Kokoro, XTTS v2 und Bark bei der Apple-Silicon-Eignung ab?
Kokoro ist die einzige Engine in diesem Vergleich mit einem echten, speziell gebauten Apple-Silicon-GPU-Pfad; die übrigen sind von Grund auf oder wegen eines ungelösten Bugs nur CPU. Die Tabelle unten bewertet jede Engine anhand der vier Faktoren, die die Mac-Eignung tatsächlich entscheiden: ob sie Apple-Silicon-Beschleunigung nutzt, wie viel Speicher sie braucht, wie reibungslos die macOS-Installation ist, und die Sprachqualität.
Engine | Apple-Silicon-Beschl. | RAM-Bedarf | macOS-Installation | Sprachqualität |
|---|---|---|---|---|
| Kokoro-82M | Ja — Metal via MLX (mlx-audio) | Niedrig (82M Param., quant. Varianten) | pip install + mlx-audio, nur Apple Silicon | Natürlich, nah an größeren Cloud-Modellen |
| Piper | Keine (Design) — nur CPU, ONNX Runtime | Sehr niedrig (~50–100MB pro Stimme) | pip install piper-tts, kein GPU-Setup | Klar, etwas robotische Prosodie |
| XTTS v2 | Keine — MPS hängt (GH-Issue #3649) | Mittel–hoch (volles Cloning-Modell) | pip install coqui-tts, nur CPU auf Mac | Hoch, klont eine bestimmte Stimme |
| Bark | Experimentell — SUNO_ENABLE_MPS=True | Hoch (Small-Models-Flag zum Reduzieren) | pip install von GitHub, kein PyPI-Paket | Ausdrucksstark, nicht-deterministisch |
Die Sprachqualitäts-Bewertungen sind qualitative Beschreibungen, basierend auf der dokumentierten Architektur jeder Engine und PromptQuorums dedizierten Tests (pro Zeile verlinkt), kein von PromptQuorum durchgeführter Blind-Hörtest — es werden hier keine numerischen MOS-Werte (Mean Opinion Score) oder Benchmark-Zahlen behauptet.
Welche Engines nutzen die GPU auf einem Mac tatsächlich?
Nur Kokoro hat einen echten, speziell gebauten Pfad zur Metal-GPU von Apple Silicon; Piper überspringt die GPU von Grund auf, und sowohl XTTS v2 als auch Bark haben auf Mac ungelöste oder teilweise GPU-Unterstützung. Dies ist der einzelne größte Unterschied zwischen diesen Engines auf Apple Silicon, und es ist leicht anzunehmen, „läuft auf einem Mac" bedeute „nutzt die GPU des Macs" — das ist meist nicht der Fall.
- Kokoro-82M läuft über Apples eigenes MLX-Framework via das Community-Projekt mlx-audio, das Apple Silicon und Python 3.10–3.12 erfordert. MLX ist Apples Open-Source-Machine-Learning-Framework, von Grund auf für Metal auf der Unified-Memory-Architektur von Apple Silicon gebaut — dasselbe Framework, das der Apple-Silicon-Leitfaden für lokale LLMs und der Vergleich MLX vs. Ollama vs. llama.cpp für Sprachmodelle behandeln. Die offiziellen Kokoro-82M-Gewichte, veröffentlicht von hexgrad auf Hugging Face, sind nativ ein PyTorch-Modell; der MLX-Pfad ist ein Community-Port, keine offizielle Apple- oder hexgrad-Veröffentlichung, und mlx-audio bietet zudem quantisierte (bf16, 8-bit, 4-bit) Varianten für geringeren Speicherverbrauch.
- Piper berührt auf keiner Plattform die GPU, Apple Silicon eingeschlossen — das ist Design, keine Einschränkung. Piper wandelt Text mit espeak-ng in Phoneme um und synthetisiert dann Audio mit einem Modell, das für schnelle CPU-Inferenz nach ONNX Runtime exportiert wurde. Genau diese Design-Entscheidung ist der Grund, warum Piper sogar auf einem Raspberry Pi in Echtzeit läuft — siehe PromptQuorums Piper-TTS-Test für die vollständige Architektur und Installationsschritte.
- Die Apple-Silicon-Metal-(MPS)-Unterstützung von XTTS v2 funktioniert derzeit nicht. Ein verfolgtes Issue im coqui-ai/TTS-GitHub-Repository, betitelt „Unable to use xtts_v2 with mps device on Apple Silicon", dokumentiert, dass der Versuch, XTTS v2 auf dem MPS-Gerät auszuführen, hängen bleibt, statt abzuschließen. Coquis eigenes Projekt führt Apple-Silicon-GPU-Unterstützung nicht als offiziell unterstützt auf. In der Praxis bedeutet das, dass XTTS v2 auf einem Mac nur auf der CPU läuft, über dasselbe Coqui-TTS-Toolkit (MPL-2.0-lizenziert), das es auf anderen Plattformen ausführt.
- Bark hat experimentelle Apple-Silicon-MPS-Unterstützung, geschützt hinter einer Umgebungsvariable. Das Setzen von
SUNO_ENABLE_MPS=Trueaktiviert Metal-Beschleunigung, laut Diskussion im suno-ai/bark-GitHub-Repository, doch einige PyTorch-Operatoren, von denen Bark abhängt, waren zum Zeitpunkt nicht für MPS implementiert, was bei diesen Schritten zu teilweisem CPU-Fallback führt. Bark unterstützt zudem einSUNO_USE_SMALL_MODELS=True-Flag speziell zur Reduzierung des Speicherdrucks auf Macs mit weniger Unified Memory.
Wie installieren Sie Kokoro mit MLX-Beschleunigung auf einem Mac?
Diese Anleitung installiert das Community-Projekt mlx-audio, um Kokoro-82M über Apples MLX-Framework auszuführen, nach dem im mlx-audio-GitHub-Repository dokumentierten Setup.
- 1Bestätigen Sie, dass Sie Apple Silicon mit einer unterstützten Python-Version nutzen.
Why it matters: mlx-audio erfordert einen Apple-Silicon-Mac (M-Series-Chip) und Python 3.10–3.12; MLX läuft auf Intel-Macs überhaupt nicht, dieser Pfad ist also nur für Apple Silicon. - 2Installieren Sie mlx-audio.
Why it matters: Führen Sie `pip install mlx-audio` in einer Python-Virtual-Environment aus. Das zieht MLX selbst (Version 0.31 oder neuer) zusammen mit der Audio-Pipeline mit ein. - 3Führen Sie eine erste Synthese über die Kommandozeile aus.
Why it matters: Das Paket liefert einen CLI-Einstiegspunkt, der beim ersten Gebrauch die Kokoro-82M-Gewichte herunterlädt und aus einer Textzeichenkette eine WAV-Datei synthetisiert — prüfen Sie das aktuelle README des Projekts für den genauen Befehl, da CLI-Flags sich zwischen Releases ändern können. - 4Wählen Sie eine Stimme und optional eine quantisierte Modellvariante.
Why it matters: Kokoro-82M liefert 54 Stimmpresets über mehrere Sprachen hinweg. mlx-audio bietet zudem bf16-, 8-bit- und 4-bit-quantisierte Varianten — geringere Präzision tauscht etwas Qualität gegen einen kleineren Speicherbedarf, nützlich auf einem Mac mit weniger Unified Memory. - 5Integrieren Sie es in Ihre eigene Python-Anwendung.
Why it matters: Für alles über einmalige CLI-Synthese hinaus rufen Sie die Python-API von mlx-audio direkt auf, statt wiederholt die CLI aufzurufen, um die Kosten für das erneute Laden des Modells bei jedem Aufruf zu vermeiden.
Was ändert sich auf einem Intel-Mac?
Auf einem Intel-Mac ist der MLX-beschleunigte Kokoro-Pfad vollständig nicht verfügbar — MLX erfordert Apple Silicon und läuft auf Intel-Hardware überhaupt nicht. Jede andere hier behandelte Engine funktioniert weiterhin auf Intel, da keine von ihnen für ihre Funktion auf Apples Neural Engine oder Apple-Silicon-spezifische GPU-Beschleunigung angewiesen ist — sie laufen einfach auf der CPU.
- Piper ist von der Intel/Apple-Silicon-Unterscheidung unberührt. Es ist auf jeder Plattform von Grund auf nur CPU, sodass ein Intel-Mac speziell für Piper vergleichbar mit einem Apple-Silicon-Mac abschneidet, Hardware-Generation ausgeklammert.
- Kokoro läuft auf einem Intel-Mac weiterhin über seine offiziellen PyTorch-Gewichte, nur ohne den MLX-Beschleunigungspfad. Sie verlieren den Apple-Silicon-spezifischen Metal-Weg via mlx-audio, doch das Modell selbst (82M Parameter) ist klein genug, um auf der CPU akzeptabel zu laufen.
- XTTS v2 und Bark laufen auf Intel- und Apple-Silicon-Macs identisch, da beide derzeit auf jedem Mac ohnehin nur mit CPU laufen — XTTS v2, weil die MPS-Unterstützung defekt ist, und Bark, weil die MPS-Unterstützung experimentell und teilweise ist. Keines der beiden verliert nennenswerte Fähigkeiten beim Wechsel von Apple Silicon zu Intel, da keines von beiden von Anfang an einen ausgereiften beschleunigten Pfad auf Apple Silicon hat.
Wann sollten Sie keine dieser Engines nutzen?
Keine der vier Engines in diesem Vergleich ist die richtige Wahl für jeden Mac-TTS-Anwendungsfall — jede hat Situationen, in denen ein anderes Werkzeug oder eine Cloud-API besser passt.
- ❌ Benötigen eine garantierte kommerzielle Lizenz mit geklonten Stimmen. Die CPML-Lizenz von XTTS v2 ist nicht-kommerziell, ohne bestätigten aktiven Weg zu einer kommerziellen Lizenz, seit Coqui AI seine kostenpflichtigen Dienste im Dezember 2023 einstellte — siehe PromptQuorums ElevenLabs-Vergleich für eine verwaltete kommerzielle Cloud-Alternative.
- ❌ Benötigen garantierte aktive Pflege. Barks öffentliches GitHub-Repository zeigt seit dem 5. April 2024 keine Commits mehr; wenn laufende Fixes und Updates für Ihr Projekt wichtig sind, sind Piper (aktiv gepflegt von der Open Home Foundation) oder Kokoro (ein aktiv genutztes Community-Ökosystem rund um mlx-audio) sicherere Wetten.
- ❌ Benötigen heute produktionsreife Apple-Silicon-GPU-Unterstützung, ohne Abhängigkeit von einem Community-Projekt. Der MLX-Pfad von Kokoro läuft über ein Community-Projekt, keine offizielle Apple- oder hexgrad-Veröffentlichung — behandeln Sie ihn als gut, aber nicht vom Hersteller garantiert.
- ❌ Benötigen interaktive Echtzeit-Sprache auf sehr begrenztem Apple-Silicon-Speicher (8GB-Basiskonfigurationen), während gleichzeitig ein großes lokales LLM läuft. Einen großen XTTS-v2- oder Bark-Prozess neben einem LLM auf einem speicherbegrenzten Mac zu stapeln, kann eng werden; die kleinen Speicherbedarfe von Piper und Kokoro lassen mehr Spielraum.
Häufig gestellte Fragen
Was ist die beste lokale TTS-Engine für Apple-Silicon-Macs?
Kokoro-82M, ausgeführt über das Community-Projekt mlx-audio, ist die beste Wahl, wenn Sie speziell Apple-Silicon-GPU-(Metal)-Beschleunigung über Apples eigenes MLX-Framework wollen. Wenn Sie die einfachste Installation wollen, die auf jedem Mac gleich funktioniert, ist Piper die bessere Wahl, da es auf jeder Plattform von Grund auf nur CPU nutzt.
Nutzt Piper die GPU auf einem Mac?
Nein. Piper ist auf jeder Plattform von Grund auf nur CPU, Apple Silicon und Intel-Macs eingeschlossen. Es wandelt Text mit espeak-ng in Phoneme um und synthetisiert Audio über ONNX Runtime, weshalb es sogar auf einem Raspberry Pi ohne jede GPU in Echtzeit läuft.
Kann Kokoro-82M auf Apple Silicon mit GPU-Beschleunigung laufen?
Ja, über das Community-Projekt mlx-audio, das Kokoro-82M via Apples eigenes MLX-Framework ausführt — speziell für Metal auf der Unified-Memory-Architektur von Apple Silicon gebaut. Die offiziellen Kokoro-82M-Gewichte von hexgrad sind ein PyTorch-Modell; der MLX-Pfad ist ein Community-Port, keine offizielle Veröffentlichung, und erfordert einen Apple-Silicon-Mac (Intel-Macs können ihn nicht nutzen) sowie Python 3.10–3.12.
Funktioniert XTTS v2 auf Apple Silicon?
Es läuft, aber nur mit CPU. Die Metal-(MPS)-Geräteunterstützung von XTTS v2 ist ein dokumentiertes, ungelöstes Issue im coqui-ai/TTS-GitHub-Repository (Issue #3649), bei dem der Versuch, das MPS-Gerät zu nutzen, hängen bleibt, statt abzuschließen. Coquis Projekt unterstützt Apple-Silicon-GPU-Beschleunigung für XTTS v2 nicht offiziell, erwarten Sie also auf jedem Mac reine CPU-Leistung.
Ist Bark auf Apple Silicon beschleunigt?
Teilweise und experimentell. Das Setzen der Umgebungsvariable SUNO_ENABLE_MPS=True aktiviert Metal-GPU-Beschleunigung für Bark, doch einige PyTorch-Operatoren, von denen es abhängt, wurden nicht für MPS implementiert, sodass einige Verarbeitungsschritte weiterhin auf die CPU zurückfallen. Barks eigene Maintainer beschreiben diese Unterstützung als experimentell, nicht produktionsreif.
Kann ich eine dieser Engines auf einem Intel-Mac nutzen?
Piper, XTTS v2 und Bark laufen alle auf Intel-Macs, da keine von ihnen Apple-Silicon-spezifische Beschleunigung für ihre Funktion benötigt — sie laufen entweder von Grund auf auf der CPU (Piper) oder weil ihre GPU-Beschleunigungspfade ohnehin ungelöst oder teilweise sind (XTTS v2, Bark). Kokoros MLX-beschleunigter Pfad erfordert speziell Apple Silicon und läuft auf einem Intel-Mac überhaupt nicht, doch Kokoros offizielle PyTorch-Gewichte laufen auch auf Intel ohne MLX-Beschleunigung.
Welche dieser Engines kann eine bestimmte Stimme klonen?
Nur XTTS v2 klont unter den hier behandelten vier eine Stimme aus einem kurzen Referenzaudioclip (nach eigener Model-Card bereits ab 6 Sekunden). Piper, Kokoro und Bark nutzen alle vortrainierte oder voreingestellte Stimmen, statt eine beliebige Stimme spontan zu klonen. Siehe PromptQuorums dedizierten XTTS-v2-Test für vollständige Cloning-Details und Lizenzierung.
Benötigt eine dieser lokalen TTS-Engines eine bezahlte Lizenz für die Nutzung auf einem Apple-Silicon-Mac?
Keine hier behandelte Engine berechnet speziell für macOS- oder Apple-Silicon-Nutzung. Piper (GPL-3.0-or-later), Kokoro (Apache-2.0) und Bark (MIT) sind alle kostenlose und quelloffene Software, unabhängig von der Plattform. XTTS v2 ist kostenlos nutzbar, aber unter einer nicht-kommerziellen Lizenz (CPML) — diese Einschränkung gilt gleichermaßen auf Apple Silicon, Intel, Windows oder Linux und hängt nicht davon ab, welchen Mac Sie nutzen.
Muss ich bei der Verwendung dieser lokalen TTS-Engines die DSGVO beachten?
Diese Engines sind lokale, selbst gehostete Open-Source-Tools, die vollständig auf dem Gerät laufen, ohne dass Audioclips oder Text zu einem Cloud-Anbieter übertragen werden. Das reduziert grundsätzlich Fragen zur Datenresidenz und zur Übermittlung an Dritte, die bei einer Cloud-TTS-API entstehen würden, und kann helfen, die Verarbeitungspflichten aus DSGVO-Artikel 28 zu vereinfachen, wenn Sie Auftragsverarbeitung minimieren wollen. Das ist jedoch keine Zertifizierung: Keines dieser Tools ist offiziell als „DSGVO-konform" zertifiziert, und ob Ihre konkrete Nutzung — etwa das Verarbeiten von Sprachaufnahmen echter Personen für Voice-Cloning mit XTTS v2 — vollständig konform ist, hängt von Ihrer gesamten Datenverarbeitung ab, nicht nur vom lokalen Betrieb der Engine. Prüfen Sie dies unabhängig, idealerweise mit rechtlicher Beratung, bevor Sie personenbezogene Sprachdaten verarbeiten.
Ist eine dieser Engines für den deutschen Mittelstand geeignet?
Piper und Kokoro sind für Mittelstandsanwendungen wie automatisierte Ansagen, interne Tools oder Prototypen gut geeignet: kostenlos, selbst gehostet, ohne laufende Kosten pro Zeichen oder API-Abonnement einer Cloud-TTS. XTTS v2 ist wegen seiner nicht-kommerziellen CPML-Lizenz für ein kommerzielles Mittelstandsprodukt derzeit nicht ohne separate Vereinbarung geeignet — behandeln Sie es allenfalls als internes Forschungs- oder Prototyping-Werkzeug. Für alle vier gilt: Da es sich um selbst gehostete Software handelt, liegt die Verantwortung für IT-Sicherheit und Systempflege beim Mittelstandsunternehmen selbst, nicht bei einem Cloud-Anbieter.
Fazit
Speziell auf Apple Silicon sticht Kokoro-82M hervor, weil es unter diesen vier Engines die einzige mit einem echten, speziell gebauten Pfad zur Metal-GPU des Macs ist, über das Community-Projekt mlx-audio, aufgebaut auf Apples eigenem MLX-Framework — und es ist klein genug (82 Millionen Parameter, Apache-2.0-lizenziert), dass sich diese Beschleunigung einzurichten lohnt. Piper bleibt die richtige Standardwahl, wenn Einfachheit und plattformübergreifende Konsistenz wichtiger sind als reine Geschwindigkeit: Es ist überall nur CPU, sodass es nichts Apple-Silicon-Spezifisches zu konfigurieren, zu beheben oder auf einem Intel-Mac zu befürchten gibt, dass es zurückfällt. XTTS v2 lohnt die reine-CPU-Leistungseinbuße nur, wenn Sie speziell Voice-Cloning benötigen und mit seiner nicht-kommerziellen Lizenz leben können; Bark lohnt eine Überlegung nur wegen seiner charakteristischen Nicht-Sprach-Klänge, mit dem Vorbehalt, dass sowohl seine Apple-Silicon-Beschleunigung als auch sein Pflegestatus insgesamt ungeklärt sind. Im Zweifel starten Sie mit Piper für die einfachste Installation, wechseln zu Kokoro via mlx-audio, sobald Sie bestätigt haben, dass Sie die Metal-Beschleunigung wollen, und greifen nur dann zu XTTS v2, wenn Voice-Cloning eine harte Anforderung ist.
Quellen
- Kokoro-82M auf Hugging Face — die offizielle Model-Card: Parameter, Lizenz und Architektur.
- mlx-audio auf GitHub — das Community-Projekt, das Kokoro-82M via Apples MLX-Framework auf Apple Silicon ausführt.
- coqui-ai/TTS-GitHub-Issue #3649 — „Unable to use xtts_v2 with mps device on Apple Silicon", dokumentiert das ungelöste MPS-Hängen.
- suno-ai/bark-GitHub-Repository — Issues und Pull-Requests, die experimentelle Apple-Silicon-MPS-Unterstützung via SUNO_ENABLE_MPS dokumentieren.
- Apple-MLX-Framework — Apples offizielles Open-Source-Machine-Learning-Framework mit nativer Metal-GPU-Beschleunigung für Apple Silicon.
- Piper-TTS-Test — PromptQuorums dedizierter Test, einschließlich Installationsbefehlen und Lizenzhistorie.
- XTTS-v2-Test, Coqui-TTS-Test und Bark-TTS-Test — PromptQuorums dedizierte Tests der übrigen hier behandelten Engines.
