Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Parlor Review: On-Device-Echtzeit-Sprach- und Vision-KI
Voice, Speech & Multimodal

Parlor Review: On-Device-Echtzeit-Sprach- und Vision-KI

·10 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Parlor ist ein kostenloser, quelloffener, on-device laufender Echtzeit-KI-Assistent, der gesprochene Unterhaltungen führt und auf das reagiert, was Ihre Kamera sieht — vollständig auf einem Mac mit Apple Silicon oder einem Linux-Rechner mit unterstützter GPU, nicht über eine Cloud-Sprach-API. Von einem Einzelentwickler als Research-Preview gebaut, kombiniert es ein lokales Vision-Language-Modell (Gemma 4, über llama.cpp) mit lokaler Sprechpausenerkennung und Text-to-Speech und bleibt vollständig on-device, sofern Sie nicht ausdrücklich eine optionale Cloud-Recherchefunktion aktivieren.

Parlor (github.com/fikrikarim/parlor) ist ein kostenloser, quelloffener, on-device laufender Echtzeit-multimodaler KI-Assistent, der über ein Mikrofon zuhört, über eine Kamera sieht und zurückspricht — konzipiert für den vollständigen Betrieb auf einem Mac oder Linux-Rechner statt über eine Cloud-Sprach-API. Es handelt sich um eine Research-Preview eines Einzelentwicklers, kein ausgereiftes kommerzielles Produkt, mit über 2.000 GitHub-Stars. Diese Review beschreibt, was es tut, wie seine Cascade-Pipeline funktioniert, welche Hardware-Anforderungen bestehen und für wen es geeignet ist.

Wichtigste Erkenntnisse

  • Parlor (github.com/fikrikarim/parlor) ist ein kostenloser, quelloffener, on-device laufender Echtzeit-multimodaler KI-Assistent — eine Research-Preview, kein fertiges Produkt
  • Erstellt von Entwickler Fikri Karim, der auch ein separates, gehostetes Sprach-KI-Projekt namens Bule AI gebaut hat; Parlor entstand aus dem Wunsch nach einer vollständig lokalen Alternative, nachdem OpenAIs GPT-Live ausprobiert wurde
  • Apache-2.0-lizenziert, bestätigt über die LICENSE-Datei des GitHub-Repositorys
  • Führt Gemma 4 (Google DeepMind) aus, standardmäßig die E4B-Variante, über llama.cpp für kombiniertes Sprach- und Bildverständnis
  • Über 2.000 GitHub-Stars und 271 Forks zum Zeitpunkt dieser Review
  • Bisher zwei getaggte Releases: v1.0.0 (29. Juli 2026) und v2.0.0 (2. August 2026)

📍 In einem Satz

Parlor ist ein kostenloser, quelloffener, on-device laufender Echtzeit-Sprach- und Vision-KI-Assistent, gebaut von einem Einzelentwickler als Research-Preview, der Gemma 4 über llama.cpp auf einem Mac mit Apple Silicon oder einem Linux-Rechner mit unterstützter GPU ausführt, mit über 2.000 GitHub-Stars.

💬 In einfachen Worten

Parlor ist Software, die Sie selbst installieren und ausführen und mit der Sie laut mit einem KI-Assistenten sprechen können, wobei optional auch Ihre Webcam mitschaut — standardmäßig vollständig auf Ihrem eigenen Computer, ohne Cloud-Sprachabo, ohne Konto und ohne Kosten pro Minute, sofern Sie nicht die optionale Cloud-Recherchefunktion aktivieren. Es benötigt einen recht leistungsfähigen Mac oder Linux-Rechner mit GPU, da das KI-Modell lokal läuft.

📌Hinweis: Diese Review basiert auf Parlors eigenem GitHub-Repository, seinem README und seiner Release-Historie über die GitHub-API. Sie behauptet nicht, dass PromptQuorum die veröffentlichten Latenz-Benchmarks von Parlor unabhängig reproduziert hat — diese Zahlen stammen vom Projekt selbst und wurden auf einem Apple M3 Pro gemessen.

Was ist Parlor?

Parlor ist eine kostenlose, quelloffene Research-Preview eines vollständig on-device laufenden Echtzeit-KI-Assistenten, der zuhört, über eine Kamera zusieht und zurückspricht — vergleichbar im Konzept mit OpenAIs GPT-Live, läuft aber lokal statt in der Cloud. Das README kennzeichnet es ausdrücklich als "Research Preview" und warnt, dass raue Kanten und Fehler zu erwarten sind.

  • Produkttyp: eine selbst gehostete, lokale Webanwendung — Sie betreiben einen Server auf Ihrem eigenen Rechner und öffnen ihn im Browser
  • Entwickler: Fikri Karim, alleine arbeitend; das README erklärt, die Codebasis sei "mit starker Unterstützung durch Claude und mit Menschen an der Spitze bei Ideen, Tests und Debugging" entstanden
  • Repository: github.com/fikrikarim/parlor, erstellt am 5. April 2026
  • Lizenz: Apache 2.0, bestätigt über die LICENSE-Datei des Repositorys
  • Finanzierung: Für diese Review wurde keine Finanzierungsrunde, kein Investor und keine kommerzielle Unterstützung gefunden — behandeln Sie Parlor als unabhängiges Research-Projekt eines Einzelentwicklers statt als finanziertes Unternehmen
  • Umfang: über 2.000 GitHub-Stars, 271 Forks, zum Zeitpunkt dieser Review

Wie funktioniert Parlor tatsächlich?

Parlor nutzt eine Cascade-Pipeline statt eines einzelnen End-to-End-Sprachmodells: Ihr Browser streamt Mikrofonaudio und Kamerabilder über einen WebSocket an einen lokalen FastAPI-Server, der Sprechpausenerkennung, ein Vision-Language-Modell und Text-to-Speech als separate Stufen ausführt.

  • Sprechpausenerkennung: browserseitiges Silero VAD erkennt Stille, dann bewertet Pipecats smart-turn-v3-Modell (etwa 20 ms), ob Sie tatsächlich fertig gesprochen haben, sodass mittensatzige Pausen nicht als Gesprächsende missverstanden werden
  • Verständnis und Generierung: Gemma 4 (Google DeepMind), standardmäßig die E4B-Variante, läuft über llama.cpp mit QAT-4-Bit-Quantisierung, verarbeitet sowohl Audio als auch Kamerabilder und streamt eine Antwort
  • Aktionsverarbeitung: eine separate, grammatikgesteuerte JSON-Anfrage desselben Modells entscheidet über Timer, Moduswechsel oder Rechercheanfragen, sodass Steuerbefehle nie in die gesprochene Antwort durchsickern
  • Sprachausgabe: Kokoro Text-to-Speech (MLX-Backend auf macOS, ONNX auf Linux) spricht die Antwort satzweise, während das Modell noch generiert
  • Barge-in: Sie können Parlor unterbrechen, indem Sie dazwischenreden — die Generierung wird serverseitig abgebrochen, statt nur die Wiedergabe stummzuschalten
  • Optionale Cloud-Recherche: Wenn Sie einen REASONER_API_KEY setzen, kann Parlor offene Rechercheanfragen (z. B. "finde die beste Pizza gerade jetzt in Rom") über einen OpenAI-kompatiblen Endpunkt wie OpenRouter an ein Frontier-Modell weitergeben, während das lokale Gespräch weiterläuft; ohne gesetzten Schlüssel bleibt Parlor vollständig on-device

Was können Sie mit Parlor tun?

Parlor unterstützt freihändige gesprochene Unterhaltungen mit optionaler Kameraeingabe sowie eine Handvoll benannter Modi für bestimmte Aufgaben.

  • Freihändige Unterhaltung: kein Push-to-Talk-Knopf — Parlor erkennt selbstständig, wann Sie zu sprechen beginnen und aufhören
  • Kamerabewusste Antworten: Richten Sie Ihre Webcam auf etwas und fragen Sie danach; Bilder werden zusammen mit Ihrer Sprache an dasselbe lokale Modell gestreamt
  • Timer: "Stell einen Timer für drei Minuten für die Pasta" — die Countdown-Uhr wird vom Server selbst geführt (nicht vom Sprachmodell), sodass der Timer auch während einer stillen Gesprächsrunde noch klingelt, und ein abbrechbarer Countdown-Chip verfolgt ihn auf dem Bildschirm
  • Live-Übersetzungsmodus: Sagen Sie "übersetze alles, was ich sage, ins Englische", und Parlor wird zum Konsekutivdolmetscher, der jede Äußerung nach einer kurzen Pause wiedergibt, in jeder Sprache, die Gemma 4 versteht, bis Sie "hör auf zu übersetzen" sagen
  • Nur-Zuhör-Modus: Sagen Sie "hör einfach eine Weile zu, ich möchte laut nachdenken", und Parlor transkribiert alles auf dem Bildschirm, ohne zurückzusprechen, bis Sie es wieder ansprechen
  • Hintergrundrecherche: Mit einem konfigurierten optionalen Cloud-API-Schlüssel kann Parlor offene Rechercheanfragen an ein separates Modell delegieren, während das lokale Gespräch weiterläuft, und die Antwort dann aussprechen, sobald sie eintrifft

Plattform, Preise und Lizenzierung

Plattform

Was Parlor angibt:
Eine selbst gehostete lokale Webanwendung, zugänglich über einen Browser. Läuft auf macOS mit Apple Silicon oder Linux mit unterstützter GPU. Es existiert kein Windows-Build.

Kosten

Was Parlor angibt:
Kostenlos und quelloffen, kein Abonnement, kein Konto. Die gesamte KI-Verarbeitung ist standardmäßig lokal; eine optionale Cloud-Recherchefunktion erfordert einen eigenen API-Schlüssel für einen separaten Anbieter.

Lizenzierung

Was Parlor angibt:
Apache 2.0, bestätigt über die LICENSE-Datei des GitHub-Repositorys.

Hardware

Was Parlor angibt:
Etwa 6 GB freier RAM für das Standardmodell Gemma 4 E4B; die kleinere E2B-Variante passt in etwa 4 GB; eine größere 12B-Option benötigt etwa 8 GB.

Status

Was Parlor angibt:
Im eigenen README ausdrücklich als "Research Preview" gekennzeichnet — laut Projekt selbst sind raue Kanten und Fehler zu erwarten.

Prüfen Sie die aktuellen Hardware- und Plattformanforderungen direkt auf github.com/fikrikarim/parlor, bevor Sie installieren, da sich diese bei einer Research-Preview zwischen Releases ändern können.

Parlor vs. Voxa

Parlor und Voxa sind beide quelloffene Echtzeit-Sprachassistenten, aber Parlor ist bewusst rein lokal, während Voxa von Natur aus hybrid ist.

Verarbeitungsort

Parlor:
Standardmäßig ausschließlich on-device; Cloud-Recherche ist optional und vom eigentlichen Gespräch getrennt
Voxa:
Hybrid — leitet Gespräche über Cloud-Echtzeitmodelle (Gemini Live, OpenAI Realtime) oder einen selbst konfigurierten, lokal gehosteten Daemon

Kameraeingabe

Parlor:
Ja — Kamerabilder speisen dasselbe Modell wie Ihre Sprache, für bildbewusste Antworten
Voxa:
Laut eigener Dokumentation nicht Teil des Kernfunktionsumfangs

Plattformunterstützung

Parlor:
macOS mit Apple Silicon oder Linux mit unterstützter GPU; kein Windows-Build
Voxa:
Desktop-App auf Basis von Tauri v2, plattformübergreifend durch das Design dieses Frameworks

Oberfläche

Parlor:
Browserbasierte lokale Webanwendung
Voxa:
Ein rahmenloser, immer-im-Vordergrund-Orb, den Sie zum Starten eines Gesprächs antippen

Reifegrad

Parlor:
Ausdrücklich als "Research Preview" gekennzeichnet; zwei getaggte Releases zum Zeitpunkt dieser Review
Voxa:
Positioniert als nutzbarer Desktop-Assistent statt als gekennzeichnete Research-Preview

Beide sind quelloffen und kostenlos. Wählen Sie Parlor, wenn Sie kamerabewusste, standardmäßig vollständig lokale Verarbeitung auf Mac oder Linux möchten; wählen Sie Voxa, wenn Sie einen leichteren Desktop-Orb mit der Option auf Cloud-Echtzeit-Sprachmodelle als Fallback möchten. Details finden Sie in der Voxa Review.

Für wen eignet sich Parlor?

Parlor passt zu Entwicklern und technisch versierten Nutzern auf Mac oder Linux, die mit einem vollständig lokalen, kamerabewussten Sprachassistenten experimentieren möchten und bereit sind, raue Kanten einer Research-Preview in Kauf zu nehmen.

Wofür Parlor nicht gut geeignet ist

Parlor ist keine gute Wahl, wenn Sie Windows-Unterstützung, eine Ein-Klick-Installation oder ein stabiles Produktionstool statt einer sich weiterentwickelnden Research-Preview benötigen.

  • Nicht für Windows-Nutzer — nur macOS mit Apple Silicon oder Linux mit unterstützter GPU werden unterstützt
  • Keine fertig verpackte Ein-Klick-App — die Installation erfordert ein Terminal, Python 3.12+, uv und einen funktionierenden llama.cpp-Build
  • Kein fertiges, versioniertes Produkt — das eigene README bezeichnet es als Research-Preview und warnt vor zu erwartenden Fehlern
  • Nicht mehrbenutzerfähig oder für andere gehostet — konzipiert für den lokalen Betrieb durch eine einzelne Person auf dem eigenen Rechner
  • Nicht durch ein für diese Review verifizierbares Unternehmen oder eine Finanzierungsrunde unterstützt — behandeln Sie es als unabhängig gepflegtes Projekt eines Einzelentwicklers

Häufige Fehler bei der Bewertung von Parlor

Die meiste Verwirrung um Parlor entsteht durch die Erwartung eines fertigen kommerziellen Produkts oder durch Unterschätzung seiner Hardware- und Plattformanforderungen.

Wettbewerber und Alternativen

Parlor ist am direktesten mit anderen quelloffenen Echtzeit-Sprach- und persönlichen Assistenten-Projekten vergleichbar, die lokale oder hybride Verarbeitung gegenüber einem reinen Cloud-Abonnement betonen.

Tool
Best known for
Link
VoxaQuelloffener Desktop-Sprachassistent-Orb, hybrides lokales/Cloud-Echtzeit-SprachroutingVoxa Review
Jarvis (Mac)Mac-fokussierte Sprachassistenten-App auf Basis lokaler und konfigurierbarer KI-BackendsJarvis Mac Review
nanobotSelbst gehosteter persönlicher KI-Agent mit dauerhaftem Gedächtnis, textbasiert statt sprachbasiertnanobot Review
OpenAI GPT-LiveCloud-basiertes, abonnementpflichtiges Echtzeit-Sprachprodukt, das als Parlors Inspiration genannt wirdopenai.com/index/introducing-gpt-live

Diese Liste spiegelt Tools wider, die im Bereich lokaler Sprachassistenten häufig mit Parlor verglichen werden, nicht ein unabhängiges PromptQuorum-Ranking — prüfen Sie die aktuelle Plattformunterstützung und den Funktionsumfang jedes Tools, bevor Sie sich entscheiden.

Häufig gestellte Fragen

Was ist Parlor?

Parlor (github.com/fikrikarim/parlor) ist eine kostenlose, quelloffene (Apache 2.0) Research-Preview eines on-device laufenden Echtzeit-Sprach- und Vision-KI-Assistenten, gebaut von einem Einzelentwickler für den vollständigen Betrieb auf einem Mac oder Linux-Rechner.

Ist Parlor kostenlos?

Ja, Parlor ist kostenlos und quelloffen. Es erfordert kein Abonnement und kein Konto. Eine optionale Hintergrundrecherche-Funktion benötigt einen eigenen API-Schlüssel für einen separaten Cloud-Anbieter, sofern Sie sie aktivieren möchten.

Funktioniert Parlor unter Windows?

Nein. Parlor erfordert macOS mit Apple Silicon oder Linux mit unterstützter GPU. Es gibt keinen Windows-Build.

Sendet Parlor meine Sprach- oder Kameradaten in die Cloud?

Standardmäßig nein — Mikrofonaudio und Kamerabilder werden lokal über ein Modell verarbeitet, das auf Ihrem eigenen Rechner läuft. Daten verlassen Ihr Gerät nur, wenn Sie ausdrücklich einen REASONER_API_KEY setzen, um die optionale Hintergrundrecherche-Funktion zu aktivieren.

Wie installiere ich Parlor?

Klonen Sie das GitHub-Repository, installieren Sie den Python-Paketmanager uv und llama.cpp, führen Sie dann uv sync gefolgt von uv run parlor aus. Öffnen Sie http://localhost:8000 im Browser und erteilen Sie Kamera- und Mikrofonberechtigungen.

Welches KI-Modell verwendet Parlor?

Gemma 4 von Google DeepMind, lokal über llama.cpp ausgeführt — standardmäßig die E4B-Variante, mit kleineren (E2B) und größeren (12B) Optionen je nach Ihrer Hardware.

Wer hat Parlor entwickelt?

Entwickler Fikri Karim baute Parlor als Solo-Research-Preview, nachdem er zuvor ein separates, dauerhaft online laufendes Sprach-KI-Projekt namens Bule AI selbst gehostet hatte.

Wie viel RAM benötigt Parlor?

Etwa 6 GB freier RAM für die Standardkonfiguration mit dem E4B-Modell; die kleinere E2B-Variante passt in etwa 4 GB, und die größere 12B-Option benötigt etwa 8 GB.

Kann Parlor durch meine Kamera sehen?

Ja. Sie können eine Webcam auf etwas richten und Parlor danach fragen — Kamerabilder werden zusammen mit Ihrer Sprache an dasselbe lokale Modell gestreamt.

Ist Parlor ein fertiges Produkt?

Nein. Das eigene README bezeichnet es ausdrücklich als "Research Preview" und bittet Nutzer, raue Kanten und Fehler zu erwarten. Bisher gibt es zwei getaggte Releases.

Quellen

← Zurück zu Lokale LLMs Pro