Conclusiones clave
- Parlor (github.com/fikrikarim/parlor) es un asistente de IA multimodal gratuito, de código abierto y en tiempo real en el dispositivo — una vista previa de investigación, no un producto terminado
- Creado por el desarrollador Fikri Karim, que también construyó un proyecto de IA de voz alojado y separado llamado Bule AI; Parlor surgió del deseo de tener una alternativa totalmente local tras probar GPT-Live de OpenAI
- Con licencia Apache 2.0, confirmada mediante el archivo LICENSE del repositorio de GitHub
- Ejecuta Gemma 4 (Google DeepMind), específicamente la variante E4B por defecto, a través de llama.cpp para comprender de forma combinada voz e imagen
- Más de 2.000 estrellas en GitHub y 271 forks al momento de esta reseña
- Dos versiones etiquetadas hasta ahora: v1.0.0 (29 de julio de 2026) y v2.0.0 (2 de agosto de 2026)
📍 En una frase
Parlor es un asistente de IA de voz y visión en tiempo real, gratuito, de código abierto y en el dispositivo, creado por un desarrollador independiente como vista previa de investigación, que ejecuta Gemma 4 a través de llama.cpp en una Mac con Apple Silicon o en una máquina Linux con una GPU compatible, con más de 2.000 estrellas en GitHub.
💬 En términos simples
Parlor es un software que instalas y ejecutas tú mismo, que te permite hablar en voz alta con un asistente de IA, con tu webcam observando opcionalmente también, todo en tu propio equipo por defecto — sin suscripción a un servicio de voz en la nube, sin cuenta y sin costo por minuto, salvo que actives la función opcional de investigación en la nube. Necesita una Mac o una máquina Linux bastante capaz con GPU, ya que ejecuta el modelo de IA de forma local.
📌Nota: Esta reseña se basa en el propio repositorio de GitHub de Parlor, su README y su historial de versiones a través de la API de GitHub. No afirma que PromptQuorum haya reproducido de forma independiente los benchmarks de latencia publicados por Parlor — esas cifras son propias del proyecto, medidas en una Apple M3 Pro.
¿Qué es Parlor?
Parlor es una vista previa de investigación gratuita y de código abierto de un asistente de IA en tiempo real, completamente en el dispositivo, que escucha, observa a través de una cámara y responde hablando — comparable en concepto a GPT-Live de OpenAI, pero ejecutándose localmente en lugar de en la nube. Su README lo etiqueta explícitamente como una "vista previa de investigación" y advierte que hay que esperar imperfecciones y errores.
- Tipo de producto: una aplicación web local autoalojada — ejecutas un servidor en tu propio equipo y lo abres en un navegador
- Creador: el desarrollador Fikri Karim, trabajando en solitario; el README indica que el código se escribió "con fuerte asistencia de Claude y con humanos liderando las ideas, las pruebas y la depuración"
- Repositorio: github.com/fikrikarim/parlor, creado el 5 de abril de 2026
- Licencia: Apache 2.0, confirmada mediante el archivo LICENSE del repositorio
- Financiación: para esta reseña no se encontró ninguna ronda de financiación, inversor o respaldo comercial — trata a Parlor como un proyecto de investigación independiente de un desarrollador solitario, en lugar de una empresa financiada
- Escala: más de 2.000 estrellas en GitHub, 271 forks, al momento de esta reseña
¿Cómo funciona realmente Parlor?
Parlor usa un pipeline en cascada, no un único modelo de voz de extremo a extremo: tu navegador transmite el audio del micrófono y los fotogramas de la cámara por WebSocket a un servidor FastAPI local, que ejecuta la detección de turnos, un modelo de visión y lenguaje, y la conversión de texto a voz como etapas separadas.
- Detección de turnos: el VAD Silero del lado del navegador marca el silencio, y luego el modelo smart-turn-v3 de Pipecat (unos 20 ms) evalúa si de verdad terminaste de hablar, así las pausas a media frase no se confunden con el fin de tu turno
- Comprensión y generación: Gemma 4 (Google DeepMind), la variante E4B por defecto, ejecutándose a través de llama.cpp con cuantización QAT de 4 bits, procesa tanto el audio como los fotogramas de la cámara y transmite una respuesta
- Manejo de acciones: una solicitud JSON separada y forzada por gramática, del mismo modelo, decide sobre temporizadores, cambios de modo o solicitudes de investigación, de modo que las instrucciones de control nunca se filtran en la respuesta hablada
- Salida de voz: la conversión de texto a voz de Kokoro (backend MLX en macOS, ONNX en Linux) habla la respuesta frase por frase mientras el modelo todavía está generando
- Interrupción (barge-in): puedes hablar por encima de Parlor para interrumpirlo — la generación se aborta en el servidor en lugar de simplemente silenciar la reproducción
- Investigación opcional en la nube: si configuras una
REASONER_API_KEY, Parlor puede delegar preguntas de investigación abiertas (por ejemplo, "encuentra la mejor pizza de Roma ahora mismo") a un modelo de vanguardia a través de un endpoint compatible con OpenAI como OpenRouter, mientras la conversación local continúa; sin esa clave configurada, Parlor permanece completamente en el dispositivo
¿Qué puedes hacer con Parlor?
Parlor admite conversación hablada manos libres con entrada opcional de cámara, además de un puñado de modos con nombre para tareas específicas.
- Conversación manos libres: sin botón de pulsar para hablar — Parlor detecta por sí solo cuándo empiezas y terminas de hablar
- Respuestas conscientes de la cámara: apunta tu webcam a algo y pregunta al respecto; los fotogramas se transmiten junto con tu voz al mismo modelo local
- Temporizadores: "pon un temporizador de tres minutos para la pasta" — el propio servidor controla el reloj de cuenta atrás (no el modelo de lenguaje), así que el temporizador sigue sonando incluso durante un turno silencioso, y un chip de cuenta atrás cancelable lo muestra en pantalla
- Modo de traducción en vivo: di "traduce todo lo que diga al inglés" y Parlor se convierte en un intérprete consecutivo, renderizando cada enunciado tras una breve pausa, en cualquier idioma que Gemma 4 entienda, hasta que digas "deja de traducir"
- Modo de solo escuchar: di "solo escucha un rato, quiero pensar en voz alta" y Parlor transcribe todo en pantalla sin responder hablando, hasta que vuelvas a dirigirte a él
- Investigación en segundo plano: con una clave de API opcional en la nube configurada, Parlor puede delegar preguntas de búsqueda abiertas a un modelo separado mientras la conversación local continúa, y luego pronunciar la respuesta cuando llega
Plataforma, precios y licencia
Plataforma
- Lo que indica Parlor:
- Una aplicación web local autoalojada, a la que se accede a través de un navegador. Funciona en macOS con Apple Silicon, o en Linux con una GPU compatible. No existe una versión para Windows.
Costo
- Lo que indica Parlor:
- Gratuito y de código abierto, sin suscripción, sin cuenta. Todo el procesamiento de IA es local por defecto; una función opcional de investigación en la nube requiere tu propia clave de API para un proveedor independiente.
Licencia
- Lo que indica Parlor:
- Apache 2.0, confirmada mediante el archivo LICENSE del repositorio de GitHub.
Hardware
- Lo que indica Parlor:
- Alrededor de 6 GB de RAM libre para el modelo Gemma 4 E4B por defecto; la variante más pequeña E2B cabe en unos 4 GB; una opción mayor de 12B necesita unos 8 GB.
Estado
- Lo que indica Parlor:
- Etiquetado explícitamente como "vista previa de investigación" en su propio README — espera imperfecciones y errores, según el propio proyecto.
Verifica los requisitos actuales de hardware y plataforma directamente en github.com/fikrikarim/parlor antes de instalar, ya que una vista previa de investigación puede cambiarlos entre versiones.
Instalar Parlor
Parlor se instala desde el código fuente a través del gestor de paquetes de Python uv; no existe un instalador empaquetado para ninguna plataforma.
Repositorio de GitHub (código fuente, Apache 2.0)
Requisitos
- Link:
- Python 3.12+, llama.cpp (build b9503 o posterior), macOS con Apple Silicon o Linux con una GPU compatible
Comando de instalación
- Link:
git clone https://github.com/fikrikarim/parlor.git, luegouv syncyuv run parlor
Primera ejecución
- Link:
- Abre
http://localhost:8000, concede cámara y micrófono; modelos (~5,7 GB) se descargan solos
Parlor requiere una terminal, un entorno Python y una instalación local de llama.cpp (brew install llama.cpp en macOS) — no hay instalador gráfico.
Parlor vs. Voxa
Parlor y Voxa son ambos asistentes de voz en tiempo real de código abierto, pero Parlor es deliberadamente solo local, mientras que Voxa es híbrido por diseño.
Ubicación del procesamiento
- Parlor:
- Solo en el dispositivo por defecto; la investigación en la nube es opcional y está separada de la conversación en sí
- Voxa:
- Híbrido — enruta las conversaciones a través de modelos en tiempo real en la nube (Gemini Live, OpenAI Realtime) o un demonio local autoalojado que configuras
Entrada de cámara
- Parlor:
- Sí — los fotogramas de la cámara alimentan al mismo modelo que tu voz, para respuestas conscientes de la imagen
- Voxa:
- No forma parte de su conjunto de funciones principal, según su propia documentación
Compatibilidad de plataforma
- Parlor:
- macOS con Apple Silicon, o Linux con una GPU compatible; sin versión para Windows
- Voxa:
- Aplicación de escritorio construida con Tauri v2, multiplataforma por el diseño de ese framework
Interfaz
- Parlor:
- Aplicación web local basada en navegador
- Voxa:
- Una esfera sin marco y siempre visible que tocas para iniciar una conversación
Madurez
- Parlor:
- Etiquetado explícitamente como "vista previa de investigación"; dos versiones etiquetadas al momento de esta reseña
- Voxa:
- Posicionado como un asistente de escritorio utilizable, en lugar de una vista previa de investigación etiquetada
Ambos son de código abierto y gratuitos. Elige Parlor si quieres un procesamiento consciente de la cámara y totalmente local por defecto en Mac o Linux; elige Voxa si quieres una esfera de escritorio más ligera con la opción de recurrir a modelos de voz en tiempo real en la nube. Consulta la reseña de Voxa para más detalles.
¿Quién debería usar Parlor?
Parlor es adecuado para desarrolladores y usuarios técnicamente cómodos en Mac o Linux que quieren experimentar con un asistente de voz totalmente local y consciente de la cámara, y que están dispuestos a tolerar las imperfecciones propias de una vista previa de investigación.
Para qué no es bueno Parlor
Parlor no es una buena opción si necesitas compatibilidad con Windows, una instalación de un solo clic o una herramienta de producción estable en lugar de una vista previa de investigación en evolución.
- No para usuarios de Windows — solo se admiten macOS con Apple Silicon o Linux con una GPU compatible
- No es una aplicación empaquetada de un solo clic — la instalación requiere una terminal, Python 3.12+,
uvy una compilación funcional dellama.cpp - No es un producto terminado y versionado — su propio README lo llama vista previa de investigación y advierte que hay que esperar errores
- No es multiusuario ni está alojado para otros — está diseñado para ejecutarse localmente para una persona en su propio equipo
- No está respaldado por una empresa o ronda de financiación que esta reseña pudiera verificar — trátalo como un proyecto mantenido de forma independiente por un desarrollador solitario
Errores comunes al evaluar Parlor
La mayor parte de la confusión sobre Parlor proviene de esperar un producto comercial pulido, o de subestimar sus requisitos de hardware y plataforma.
Competidores y alternativas
Parlor se compara más directamente con otros proyectos de código abierto de voz en tiempo real y asistente personal, que dan prioridad al procesamiento local o híbrido frente a una suscripción puramente en la nube.
Tool | Best known for | Link |
|---|---|---|
| Voxa | Esfera de asistente de voz de escritorio de código abierto, enrutamiento híbrido local/nube en tiempo real | reseña de Voxa |
| Jarvis (Mac) | Aplicación de asistente de voz centrada en Mac, construida sobre backends de IA locales y configurables | reseña de Jarvis Mac |
| nanobot | Agente de IA personal autoalojado con memoria persistente, centrado en texto en lugar de voz | reseña de nanobot |
| OpenAI GPT-Live | Producto de voz en tiempo real en la nube y basado en suscripción, mencionado como la inspiración de Parlor | openai.com/index/introducing-gpt-live |
Esta lista refleja herramientas con las que se compara comúnmente a Parlor en el espacio de asistentes de voz locales, no un ranking independiente de PromptQuorum — verifica la compatibilidad de plataforma actual y el conjunto de funciones de cada herramienta antes de elegir.
Preguntas frecuentes
¿Qué es Parlor?
Parlor (github.com/fikrikarim/parlor) es una vista previa de investigación gratuita y de código abierto (Apache 2.0) de un asistente de IA de voz y visión en tiempo real en el dispositivo, creado por un desarrollador independiente para ejecutarse enteramente en una Mac o en una máquina Linux.
¿Es gratis Parlor?
Sí, Parlor es gratuito y de código abierto. No requiere suscripción ni cuenta. Una función opcional de investigación en segundo plano necesita tu propia clave de API para un proveedor de nube independiente, si eliges activarla.
¿Funciona Parlor en Windows?
No. Parlor requiere macOS con Apple Silicon o Linux con una GPU compatible. No existe una versión para Windows.
¿Parlor envía mis datos de voz o de cámara a la nube?
Por defecto, no — el audio del micrófono y los fotogramas de la cámara se procesan localmente mediante un modelo que se ejecuta en tu propio equipo. Los datos solo salen de tu dispositivo si configuras explícitamente una REASONER_API_KEY para activar la función opcional de investigación en segundo plano.
¿Cómo instalo Parlor?
Clona el repositorio de GitHub, instala el gestor de paquetes de Python uv y llama.cpp, y luego ejecuta uv sync seguido de uv run parlor. Abre http://localhost:8000 en un navegador y concede los permisos de cámara y micrófono.
¿Qué modelo de IA usa Parlor?
Gemma 4 de Google DeepMind, ejecutándose localmente a través de llama.cpp — la variante E4B por defecto, con opciones más pequeñas (E2B) y mayores (12B) disponibles según tu hardware.
¿Quién creó Parlor?
El desarrollador Fikri Karim construyó Parlor como una vista previa de investigación en solitario, después de haber autoalojado previamente un proyecto de IA de voz separado y siempre en línea llamado Bule AI.
¿Cuánta RAM necesita Parlor?
Alrededor de 6 GB de RAM libre para la configuración por defecto del modelo E4B; la variante más pequeña E2B cabe en unos 4 GB, y la opción mayor de 12B necesita unos 8 GB.
¿Parlor puede ver a través de mi cámara?
Sí. Puedes apuntar una webcam a algo y preguntarle a Parlor sobre ello — los fotogramas de la cámara se transmiten al mismo modelo local junto con tu voz.
¿Parlor es un producto terminado?
No. Su propio README lo etiqueta explícitamente como "vista previa de investigación" y pide a los usuarios que esperen imperfecciones y errores. Tiene dos versiones etiquetadas hasta ahora.