Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Parlor : assistant IA vocal et visuel local en temps réel
Voice, Speech & Multimodal

Parlor : assistant IA vocal et visuel local en temps réel

·10 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Parlor est un assistant IA gratuit, open source et local en temps réel qui tient des conversations parlées et réagit à ce que voit votre caméra, fonctionnant entièrement sur un Mac avec Apple Silicon ou une machine Linux avec un GPU compatible — pas une API vocale cloud. Développé par un développeur solo comme aperçu de recherche, il associe un modèle vision-langage local (Gemma 4, via llama.cpp) à une détection de tour de parole et une synthèse vocale locales, et reste entièrement local sauf si vous activez explicitement une fonctionnalité de recherche cloud optionnelle.

Parlor (github.com/fikrikarim/parlor) est un assistant IA multimodal gratuit, open source et local, qui écoute via un microphone, voit via une caméra et répond à voix haute — conçu pour fonctionner entièrement sur un Mac ou une machine Linux plutôt que via une API vocale cloud. C'est un aperçu de recherche développé par un développeur solo, pas un produit commercial abouti, avec plus de 2 000 étoiles GitHub. Cette revue présente ce qu'il fait, comment fonctionne son pipeline en cascade, ses exigences matérielles, et à qui il s'adresse.

Points clés

  • Parlor (github.com/fikrikarim/parlor) est un assistant IA multimodal gratuit, open source et local en temps réel — un aperçu de recherche, pas un produit fini
  • Créé par le développeur Fikri Karim, qui a aussi conçu un autre projet d'IA vocale hébergé nommé Bule AI ; Parlor est né du souhait d'avoir une alternative entièrement locale après avoir essayé GPT-Live d'OpenAI
  • Sous licence Apache 2.0, confirmée via le fichier LICENSE du dépôt GitHub
  • Exécute Gemma 4 (Google DeepMind), spécifiquement la variante E4B par défaut, via llama.cpp pour la compréhension combinée de la voix et de l'image
  • Plus de 2 000 étoiles GitHub et 271 forks au moment de cette revue
  • Deux versions taguées à ce jour : v1.0.0 (29 juillet 2026) et v2.0.0 (2 août 2026)

📍 En une phrase

Parlor est un assistant IA vocal et visuel local en temps réel, gratuit et open source, créé par un développeur solo comme aperçu de recherche, exécutant Gemma 4 via llama.cpp sur un Mac avec Apple Silicon ou une machine Linux avec un GPU compatible, avec plus de 2 000 étoiles GitHub.

💬 En termes simples

Parlor est un logiciel que vous installez et exécutez vous-même, qui permet de parler à voix haute à un assistant IA, avec en option votre webcam qui observe aussi, par défaut entièrement sur votre propre ordinateur — sans abonnement vocal cloud, sans compte et sans coût à la minute, sauf si vous activez la fonction optionnelle de recherche cloud. Il faut un Mac ou une machine Linux assez puissante avec un GPU, puisque le modèle IA tourne localement.

📌Remarque: Cette revue s'appuie sur le dépôt GitHub de Parlor, son README et son historique de versions via l'API GitHub. Elle n'affirme pas que PromptQuorum a reproduit de façon indépendante les benchmarks de latence publiés par Parlor — ces chiffres proviennent du projet lui-même, mesurés sur un Apple M3 Pro.

Qu'est-ce que Parlor ?

Parlor est un aperçu de recherche gratuit et open source d'un assistant IA entièrement local en temps réel, qui écoute, observe via une caméra et répond à voix haute — comparable dans son concept à GPT-Live d'OpenAI, mais fonctionnant localement plutôt que dans le cloud. Son README le présente explicitement comme un « aperçu de recherche » et prévient qu'il faut s'attendre à des imperfections et des bugs.

  • Type de produit : une application web locale auto-hébergée — vous exécutez un serveur sur votre propre machine et l'ouvrez dans un navigateur
  • Créateur : le développeur Fikri Karim, en solo ; le README indique que le code a été écrit « avec une forte assistance de Claude, les humains pilotant les idées, les tests et le débogage »
  • Dépôt : github.com/fikrikarim/parlor, créé le 5 avril 2026
  • Licence : Apache 2.0, confirmée via le fichier LICENSE du dépôt
  • Financement : aucun tour de financement, investisseur ou soutien commercial n'a été trouvé pour cette revue — considérez Parlor comme un projet de recherche indépendant d'un développeur solo plutôt qu'une entreprise financée
  • Ampleur : plus de 2 000 étoiles GitHub, 271 forks, au moment de cette revue

Comment Parlor fonctionne-t-il réellement ?

Parlor utilise un pipeline en cascade, et non un modèle vocal unique de bout en bout : votre navigateur diffuse l'audio du microphone et les images de la caméra via WebSocket vers un serveur FastAPI local, qui exécute la détection de tour de parole, un modèle vision-langage et la synthèse vocale comme étapes distinctes.

  • Détection de tour de parole : le VAD Silero côté navigateur détecte le silence, puis le modèle smart-turn-v3 de Pipecat (environ 20 ms) juge si vous avez réellement fini de parler, pour que les pauses en milieu de phrase ne soient pas prises pour la fin de votre tour
  • Compréhension et génération : Gemma 4 (Google DeepMind), la variante E4B par défaut, exécuté via llama.cpp avec une quantification QAT 4 bits, traite l'audio et les images de la caméra et diffuse une réponse
  • Gestion des actions : une requête JSON distincte, forcée par grammaire, envoyée au même modèle, décide des minuteries, des changements de mode ou des demandes de recherche, afin que les instructions de contrôle ne se mêlent jamais à la réponse parlée
  • Sortie vocale : la synthèse vocale Kokoro (backend MLX sur macOS, ONNX sur Linux) prononce la réponse phrase par phrase pendant que le modèle génère encore
  • Interruption (barge-in) : vous pouvez parler par-dessus Parlor pour l'interrompre — la génération est annulée côté serveur plutôt que de simplement couper la lecture audio
  • Recherche cloud optionnelle : si vous définissez une REASONER_API_KEY, Parlor peut confier des questions de recherche ouvertes (par exemple « trouve la meilleure pizza à Rome en ce moment ») à un modèle avancé via un point de terminaison compatible OpenAI comme OpenRouter, pendant que la conversation locale se poursuit ; sans cette clé, Parlor reste entièrement local

Que peut-on faire avec Parlor ?

Parlor prend en charge une conversation parlée mains libres avec entrée caméra optionnelle, ainsi qu'une poignée de modes nommés pour des tâches spécifiques.

  • Conversation mains libres : pas de bouton pousser-pour-parler — Parlor détecte seul quand vous commencez et finissez de parler
  • Réponses conscientes de la caméra : pointez votre webcam sur quelque chose et posez une question à ce sujet ; les images sont diffusées avec votre voix vers le même modèle local
  • Minuteries : « mets un minuteur de trois minutes pour les pâtes » — le serveur lui-même gère le compte à rebours (pas le modèle de langage), donc le minuteur sonne même pendant un tour silencieux, et une puce de compte à rebours annulable en suit la progression à l'écran
  • Mode traduction en direct : dites « traduis tout ce que je dis en anglais » et Parlor devient un interprète consécutif, restituant chaque énoncé après une courte pause, dans n'importe quelle langue que Gemma 4 comprend, jusqu'à ce que vous disiez « arrête de traduire »
  • Mode écoute seule : dites « écoute juste un moment, je veux réfléchir à voix haute » et Parlor retranscrit tout à l'écran sans répondre à voix haute, jusqu'à ce que vous vous adressiez de nouveau à lui
  • Recherche en arrière-plan : avec une clé API cloud optionnelle configurée, Parlor peut déléguer des questions de recherche ouvertes à un autre modèle pendant que la conversation locale continue, puis prononcer la réponse une fois qu'elle arrive

Plateforme, tarifs et licence

Plateforme

Ce que Parlor indique:
Une application web locale auto-hébergée, accessible via un navigateur. Fonctionne sur macOS avec Apple Silicon, ou Linux avec un GPU compatible. Aucune version Windows n'existe.

Coût

Ce que Parlor indique:
Gratuit et open source, sans abonnement, sans compte. Tout le traitement IA est local par défaut ; une fonctionnalité de recherche cloud optionnelle nécessite votre propre clé API pour un fournisseur distinct.

Licence

Ce que Parlor indique:
Apache 2.0, confirmée via le fichier LICENSE du dépôt GitHub.

Matériel

Ce que Parlor indique:
Environ 6 Go de RAM libre pour le modèle Gemma 4 E4B par défaut ; la variante E2B, plus petite, tient dans environ 4 Go ; une option 12B plus grande nécessite environ 8 Go.

Statut

Ce que Parlor indique:
Explicitement présenté comme un « aperçu de recherche » dans son propre README — attendez-vous à des imperfections et des bugs, selon le projet lui-même.

Vérifiez les exigences matérielles et de plateforme actuelles directement sur github.com/fikrikarim/parlor avant d'installer, car un aperçu de recherche peut les faire évoluer d'une version à l'autre.

Parlor vs. Voxa

Parlor et Voxa sont tous deux des assistants vocaux open source en temps réel, mais Parlor est délibérément local uniquement, tandis que Voxa est hybride par conception.

Lieu de traitement

Parlor:
Local uniquement par défaut ; la recherche cloud est optionnelle et distincte de la conversation elle-même
Voxa:
Hybride — achemine les conversations via des modèles cloud en temps réel (Gemini Live, OpenAI Realtime) ou un démon local auto-hébergé que vous configurez

Entrée caméra

Parlor:
Oui — les images de la caméra alimentent le même modèle que votre voix, pour des réponses tenant compte du visuel
Voxa:
Ne fait pas partie de ses fonctionnalités principales selon sa propre documentation

Plateformes prises en charge

Parlor:
macOS avec Apple Silicon, ou Linux avec un GPU compatible ; pas de version Windows
Voxa:
Application de bureau construite avec Tauri v2, multiplateforme par conception de ce framework

Interface

Parlor:
Application web locale, dans le navigateur
Voxa:
Un orbe sans bordure, toujours au premier plan, sur lequel on tape pour démarrer une conversation

Maturité

Parlor:
Explicitement présenté comme un « aperçu de recherche » ; deux versions taguées au moment de cette revue
Voxa:
Positionné comme un assistant de bureau utilisable plutôt qu'un aperçu de recherche étiqueté comme tel

Les deux sont open source et gratuits. Choisissez Parlor si vous voulez un traitement conscient de la caméra, entièrement local par défaut, sur Mac ou Linux ; choisissez Voxa si vous voulez un orbe de bureau plus léger avec la possibilité de basculer vers des modèles vocaux cloud en temps réel. Voir l'avis Voxa pour plus de détails.

Pour qui Parlor est-il fait ?

Parlor convient aux développeurs et utilisateurs technophiles sur Mac ou Linux qui veulent expérimenter avec un assistant vocal entièrement local et conscient de la caméra, et acceptent de tolérer les imperfections d'un aperçu de recherche.

Pour quoi Parlor n'est pas adapté

Parlor ne convient pas si vous avez besoin d'une prise en charge Windows, d'une installation en un clic, ou d'un outil de production stable plutôt qu'un aperçu de recherche en évolution.

  • Pas pour les utilisateurs Windows — seuls macOS avec Apple Silicon ou Linux avec un GPU compatible sont pris en charge
  • Pas une application packagée en un clic — l'installation nécessite un terminal, Python 3.12+, uv, et une build fonctionnelle de llama.cpp
  • Pas un produit fini et versionné — son propre README le décrit comme un aperçu de recherche et prévient qu'il faut s'attendre à des bugs
  • Pas multi-utilisateur ni hébergé pour d'autres personnes — conçu pour fonctionner localement pour une seule personne sur sa propre machine
  • Pas soutenu par une entreprise ou un tour de financement que cette revue a pu vérifier — considérez-le comme un projet indépendant, maintenu par un développeur solo

Erreurs courantes lors de l'évaluation de Parlor

La plupart des confusions autour de Parlor viennent du fait d'attendre un produit commercial abouti, ou de sous-estimer ses exigences matérielles et de plateforme.

Concurrents et alternatives

Parlor se compare le plus directement à d'autres projets open source d'assistants vocaux et personnels en temps réel, qui privilégient un traitement local ou hybride plutôt qu'un pur abonnement cloud.

Tool
Best known for
Link
VoxaOrbe d'assistant vocal de bureau open source, routage vocal hybride local/cloud en temps réelavis Voxa
Jarvis (Mac)Application d'assistant vocal centrée sur Mac, construite autour de backends IA locaux et configurablesavis Jarvis Mac
nanobotAgent IA personnel auto-hébergé avec mémoire persistante, centré texte plutôt que voixavis nanobot
OpenAI GPT-LiveProduit vocal cloud en temps réel, sur abonnement, cité comme source d'inspiration de Parloropenai.com/index/introducing-gpt-live

Cette liste reflète les outils habituellement comparés à Parlor dans l'univers des assistants vocaux locaux, et non un classement indépendant de PromptQuorum — vérifiez la prise en charge de plateforme et les fonctionnalités actuelles de chaque outil avant de faire votre choix.

Questions fréquemment posées

Qu'est-ce que Parlor ?

Parlor (github.com/fikrikarim/parlor) est un aperçu de recherche gratuit, open source (Apache 2.0) d'un assistant IA vocal et visuel local en temps réel, créé par un développeur solo pour fonctionner entièrement sur un Mac ou une machine Linux.

Parlor est-il gratuit ?

Oui, Parlor est gratuit et open source. Aucun abonnement ni compte n'est requis. Une fonctionnalité optionnelle de recherche en arrière-plan nécessite votre propre clé API pour un fournisseur cloud distinct, si vous choisissez de l'activer.

Parlor fonctionne-t-il sous Windows ?

Non. Parlor nécessite macOS avec Apple Silicon ou Linux avec un GPU compatible. Il n'existe pas de version Windows.

Parlor envoie-t-il mes données de voix ou de caméra dans le cloud ?

Par défaut, non — l'audio du microphone et les images de la caméra sont traités localement par un modèle exécuté sur votre propre machine. Les données ne quittent votre appareil que si vous définissez explicitement une REASONER_API_KEY pour activer la fonctionnalité optionnelle de recherche en arrière-plan.

Comment installer Parlor ?

Clonez le dépôt GitHub, installez le gestionnaire de paquets Python uv et llama.cpp, puis exécutez uv sync suivi de uv run parlor. Ouvrez http://localhost:8000 dans un navigateur et autorisez l'accès à la caméra et au microphone.

Quel modèle IA Parlor utilise-t-il ?

Gemma 4 de Google DeepMind, exécuté localement via llama.cpp — la variante E4B par défaut, avec des options plus petites (E2B) et plus grandes (12B) disponibles selon votre matériel.

Qui a créé Parlor ?

Le développeur Fikri Karim a créé Parlor comme aperçu de recherche en solo, après avoir précédemment auto-hébergé un autre projet d'IA vocale toujours en ligne nommé Bule AI.

Combien de RAM Parlor nécessite-t-il ?

Environ 6 Go de RAM libre pour la configuration par défaut du modèle E4B ; la variante E2B, plus petite, tient dans environ 4 Go, et l'option 12B plus grande nécessite environ 8 Go.

Parlor peut-il voir à travers ma caméra ?

Oui. Vous pouvez pointer une webcam sur quelque chose et interroger Parlor à ce sujet — les images de la caméra sont diffusées vers le même modèle local, avec votre voix.

Parlor est-il un produit fini ?

Non. Son propre README le présente explicitement comme un « aperçu de recherche » et demande aux utilisateurs de s'attendre à des imperfections et des bugs. Il compte deux versions taguées à ce jour.

Sources

← Retour aux LLM locaux avancés