Principais conclusões
- O Parlor (github.com/fikrikarim/parlor) é um assistente de IA multimodal gratuito, de código aberto e em tempo real no dispositivo — uma prévia de pesquisa, não um produto finalizado
- Criado pelo desenvolvedor Fikri Karim, que também construiu um projeto separado de IA de voz hospedada chamado Bule AI; o Parlor surgiu do desejo de uma alternativa totalmente local depois de experimentar o GPT-Live da OpenAI
- Licenciado sob Apache 2.0, confirmado pelo arquivo LICENSE do repositório no GitHub
- Roda o Gemma 4 (Google DeepMind), especificamente a variante E4B por padrão, via llama.cpp para compreensão combinada de fala e visão
- Mais de 2.000 estrelas no GitHub e 271 forks no momento desta análise
- Dois lançamentos com tag até o momento: v1.0.0 (29 de julho de 2026) e v2.0.0 (2 de agosto de 2026)
📍 Em uma frase
O Parlor é um assistente de IA de voz e visão em tempo real, gratuito, de código aberto e no dispositivo, criado por um desenvolvedor solo como prévia de pesquisa, que roda o Gemma 4 via llama.cpp em um Mac com Apple Silicon ou em uma máquina Linux com GPU compatível, com mais de 2.000 estrelas no GitHub.
💬 Em termos simples
O Parlor é um software que você instala e executa no seu próprio computador, permitindo conversar em voz alta com um assistente de IA, com sua webcam opcionalmente observando também — tudo no seu próprio computador por padrão, sem assinatura de voz na nuvem, sem conta e sem custo por minuto, a menos que você ative o recurso opcional de pesquisa na nuvem. Ele precisa de um Mac ou máquina Linux razoavelmente potente com GPU, já que executa o modelo de IA localmente.
📌Nota: Esta análise se baseia no próprio repositório do Parlor no GitHub, em seu README e em seu histórico de lançamentos via API do GitHub. Ela não afirma que a PromptQuorum reproduziu de forma independente os benchmarks de latência publicados pelo Parlor — esses números são do próprio projeto, medidos em um Apple M3 Pro.
O que é o Parlor?
O Parlor é uma prévia de pesquisa gratuita e de código aberto de um assistente de IA totalmente no dispositivo e em tempo real, que escuta, observa pela câmera e responde por voz — comparável em conceito ao GPT-Live da OpenAI, mas rodando localmente em vez de na nuvem. Seu README o rotula explicitamente como "prévia de pesquisa" e avisa para esperar arestas e bugs.
- Tipo de produto: uma aplicação web local e autogerenciada — você executa um servidor na sua própria máquina e o abre em um navegador
- Criador: o desenvolvedor Fikri Karim, trabalhando sozinho; o README declara que o código foi escrito "com forte assistência do Claude e com humanos liderando as ideias, os testes e a depuração"
- Repositório: github.com/fikrikarim/parlor, criado em 5 de abril de 2026
- Licença: Apache 2.0, confirmada pelo arquivo LICENSE do repositório
- Financiamento: nenhuma rodada de financiamento, investidor ou apoio comercial foi encontrado para esta análise — trate o Parlor como um projeto de pesquisa independente de um desenvolvedor solo, não como uma empresa financiada
- Escala: mais de 2.000 estrelas no GitHub, 271 forks, no momento desta análise
Como o Parlor funciona de fato?
O Parlor usa um pipeline em cascata, não um único modelo de voz ponta a ponta: seu navegador transmite o áudio do microfone e os quadros da câmera via WebSocket para um servidor FastAPI local, que executa detecção de turno de fala, um modelo de visão e linguagem, e texto-para-voz como estágios separados.
- Detecção de turno: o Silero VAD, no lado do navegador, sinaliza silêncio, e então o modelo smart-turn-v3 do Pipecat (cerca de 20ms) avalia se você realmente terminou de falar, para que pausas no meio da frase não sejam confundidas com o fim do seu turno
- Compreensão e geração: o Gemma 4 (Google DeepMind), variante E4B por padrão, rodando via llama.cpp com quantização QAT de 4 bits, processa o áudio e os quadros da câmera e transmite uma resposta em streaming
- Tratamento de ações: uma requisição JSON separada e forçada por gramática, do mesmo modelo, decide sobre temporizadores, trocas de modo ou solicitações de pesquisa, para que instruções de controle nunca vazem para a resposta falada
- Saída de voz: o texto-para-voz Kokoro (backend MLX no macOS, ONNX no Linux) fala a resposta frase por frase enquanto o modelo ainda está gerando
- Interrupção (barge-in): você pode falar por cima do Parlor para interrompê-lo — a geração é abortada no servidor, em vez de apenas silenciar a reprodução
- Pesquisa opcional na nuvem: se você definir uma
REASONER_API_KEY, o Parlor pode repassar perguntas de pesquisa abertas (por exemplo, "encontre a melhor pizza em Roma agora") a um modelo de fronteira via um endpoint compatível com OpenAI, como o OpenRouter, enquanto a conversa local continua; sem essa chave definida, o Parlor permanece totalmente no dispositivo
O que você pode fazer com o Parlor?
O Parlor suporta conversas faladas sem as mãos, com entrada de câmera opcional, além de alguns modos nomeados para tarefas específicas.
- Conversa sem as mãos: sem botão de "aperte para falar" — o Parlor detecta sozinho quando você começa e termina de falar
- Respostas com consciência de câmera: aponte sua webcam para algo e pergunte sobre isso; os quadros são transmitidos junto com sua fala para o mesmo modelo local
- Temporizadores: "defina um temporizador de três minutos para o macarrão" — o próprio servidor controla a contagem regressiva (não o modelo de linguagem), então o temporizador ainda toca mesmo durante um turno silencioso, e um indicador cancelável de contagem regressiva o acompanha na tela
- Modo de tradução ao vivo: diga "traduza tudo o que eu disser para o inglês" e o Parlor se torna um intérprete consecutivo, produzindo cada fala após uma breve pausa, em qualquer idioma que o Gemma 4 entenda, até você dizer "pare de traduzir"
- Modo apenas escutar: diga "só escute por um tempo, quero pensar em voz alta" e o Parlor transcreve tudo na tela sem responder por voz, até que você fale com ele novamente
- Pesquisa em segundo plano: com uma chave de API na nuvem opcional configurada, o Parlor pode delegar perguntas de busca abertas a um modelo separado enquanto a conversa local continua, e depois falar a resposta assim que ela chega
Plataforma, preços e licenciamento
Plataforma
- O que o Parlor declara:
- Um app web local e autogerenciado, acessado pelo navegador. Roda em macOS com Apple Silicon ou Linux com GPU compatível. Não existe versão para Windows.
Custo
- O que o Parlor declara:
- Gratuito e de código aberto, sem assinatura, sem conta. Todo o processamento de IA é local por padrão; um recurso opcional de pesquisa na nuvem exige sua própria chave de API para um provedor separado.
Licenciamento
- O que o Parlor declara:
- Apache 2.0, confirmado pelo arquivo LICENSE do repositório no GitHub.
Hardware
- O que o Parlor declara:
- Cerca de 6 GB de RAM livre para o modelo padrão Gemma 4 E4B; a variante menor E2B cabe em cerca de 4 GB; a opção maior de 12B precisa de cerca de 8 GB.
Status
- O que o Parlor declara:
- Rotulado explicitamente como "prévia de pesquisa" no próprio README — espere arestas e bugs, segundo o próprio projeto.
Verifique os requisitos atuais de hardware e plataforma diretamente em github.com/fikrikarim/parlor antes de instalar, já que uma prévia de pesquisa pode alterá-los entre lançamentos.
Instalar o Parlor
O Parlor é instalado a partir do código-fonte via o gerenciador de pacotes Python uv; não existe instalador empacotado para nenhuma plataforma.
Repositório no GitHub (código-fonte, Apache 2.0)
Requisitos
- Link:
- Python 3.12+, llama.cpp (build b9503 ou mais recente), macOS com Apple Silicon ou Linux com GPU compatível
Comando de instalação
- Link:
git clone https://github.com/fikrikarim/parlor.git, depoisuv synceuv run parlor
Primeira execução
- Link:
- Abra
http://localhost:8000, conceda acesso à câmera e ao microfone; os modelos (cerca de 5.7 GB) são baixados automaticamente
O Parlor requer um terminal, um ambiente Python e uma instalação local do llama.cpp (brew install llama.cpp no macOS) — não existe instalador gráfico.
Parlor vs. Voxa
O Parlor e o Voxa são assistentes de voz em tempo real e de código aberto, mas o Parlor é deliberadamente somente local, enquanto o Voxa é híbrido por design.
Local de processamento
- Parlor:
- Somente no dispositivo por padrão; a pesquisa na nuvem é opcional e separada da conversa em si
- Voxa:
- Híbrido — roteia conversas por modelos de tempo real na nuvem (Gemini Live, OpenAI Realtime) ou um daemon local autogerenciado que você configura
Entrada de câmera
- Parlor:
- Sim — os quadros da câmera alimentam o mesmo modelo que sua fala, para respostas com consciência visual
- Voxa:
- Não faz parte do conjunto de recursos principais, segundo sua própria documentação
Suporte de plataforma
- Parlor:
- macOS com Apple Silicon ou Linux com GPU compatível; sem versão para Windows
- Voxa:
- App desktop construído com Tauri v2, multiplataforma pelo design desse framework
Interface
- Parlor:
- App web local baseado em navegador
- Voxa:
- Um orbe sem moldura e sempre visível, no qual você toca para iniciar uma conversa
Maturidade
- Parlor:
- Rotulado explicitamente como "prévia de pesquisa"; dois lançamentos com tag até o momento desta análise
- Voxa:
- Posicionado como um assistente desktop utilizável, e não como uma prévia de pesquisa rotulada
Ambos são gratuitos e de código aberto. Escolha o Parlor se quiser processamento com consciência de câmera, totalmente local por padrão, no Mac ou Linux; escolha o Voxa se quiser um orbe desktop mais leve, com a opção de recorrer a modelos de voz em tempo real na nuvem. Veja a análise do Voxa para mais detalhes.
Quem deveria usar o Parlor?
O Parlor é indicado para desenvolvedores e usuários com conforto técnico, no Mac ou Linux, que querem experimentar um assistente de voz totalmente local e com consciência de câmera, e estão dispostos a tolerar as arestas de uma prévia de pesquisa.
Para que o Parlor não é bom
O Parlor não é uma boa opção se você precisa de suporte ao Windows, instalação de um clique ou uma ferramenta de produção estável, em vez de uma prévia de pesquisa em evolução.
- Não é para usuários de Windows — apenas macOS com Apple Silicon ou Linux com GPU compatível são suportados
- Não é um app empacotado de um clique — a instalação requer terminal, Python 3.12+,
uve uma build funcional dollama.cpp - Não é um produto finalizado e versionado — o próprio README o chama de prévia de pesquisa e avisa para esperar bugs
- Não é multiusuário nem hospedado para outras pessoas — é projetado para rodar localmente para uma pessoa, na própria máquina
- Não tem por trás uma empresa ou rodada de financiamento que esta análise pudesse verificar — trate-o como um projeto mantido de forma independente por um desenvolvedor solo
Erros comuns ao avaliar o Parlor
A maior parte da confusão sobre o Parlor vem de esperar um produto comercial finalizado, ou de subestimar seus requisitos de hardware e plataforma.
Concorrentes e alternativas
O Parlor é mais diretamente comparável a outros projetos de código aberto de voz em tempo real e assistentes pessoais que priorizam o processamento local ou híbrido em vez de uma assinatura puramente na nuvem.
Ferramenta | Mais conhecida por | Link |
|---|---|---|
| Voxa | Orbe assistente de voz desktop de código aberto, roteamento de voz híbrido local/nuvem em tempo real | Análise do Voxa |
| Jarvis (Mac) | App assistente de voz focado em Mac, construído em torno de backends de IA locais e configuráveis | Análise do Jarvis Mac |
| nanobot | Agente de IA pessoal autogerenciado com memória persistente, priorizando texto em vez de voz | Análise do nanobot |
| OpenAI GPT-Live | Produto de voz em tempo real na nuvem, baseado em assinatura, citado como inspiração do Parlor | openai.com/index/introducing-gpt-live |
Esta lista reflete ferramentas comumente comparadas ao Parlor no espaço de assistentes de voz locais, não um ranking independente da PromptQuorum — verifique o suporte de plataforma e o conjunto de recursos atuais de cada ferramenta antes de escolher.
Perguntas frequentes
O que é o Parlor?
O Parlor (github.com/fikrikarim/parlor) é uma prévia de pesquisa gratuita e de código aberto (Apache 2.0) de um assistente de IA de voz e visão em tempo real no dispositivo, criado por um desenvolvedor solo para rodar inteiramente em um Mac ou máquina Linux.
O Parlor é gratuito?
Sim, o Parlor é gratuito e de código aberto. Não exige assinatura nem conta. Um recurso opcional de pesquisa em segundo plano precisa da sua própria chave de API para um provedor de nuvem separado, caso você opte por ativá-lo.
O Parlor funciona no Windows?
Não. O Parlor requer macOS com Apple Silicon ou Linux com GPU compatível. Não existe versão para Windows.
O Parlor envia meus dados de voz ou câmera para a nuvem?
Por padrão, não — o áudio do microfone e os quadros da câmera são processados localmente por um modelo que roda na sua própria máquina. Os dados só saem do seu dispositivo se você definir explicitamente uma REASONER_API_KEY para ativar o recurso opcional de pesquisa em segundo plano.
Como instalo o Parlor?
Clone o repositório do GitHub, instale o gerenciador de pacotes Python uv e o llama.cpp, depois execute uv sync seguido de uv run parlor. Abra http://localhost:8000 em um navegador e conceda as permissões de câmera e microfone.
Qual modelo de IA o Parlor usa?
O Gemma 4, da Google DeepMind, rodando localmente via llama.cpp — a variante E4B por padrão, com opções menores (E2B) e maiores (12B) disponíveis dependendo do seu hardware.
Quem criou o Parlor?
O desenvolvedor Fikri Karim criou o Parlor como uma prévia de pesquisa solo, depois de ter hospedado anteriormente um projeto separado de IA de voz sempre online chamado Bule AI.
Quanta RAM o Parlor precisa?
Cerca de 6 GB de RAM livre para a configuração padrão do modelo E4B; a variante menor E2B cabe em cerca de 4 GB, e a opção maior de 12B precisa de cerca de 8 GB.
O Parlor consegue ver pela minha câmera?
Sim. Você pode apontar uma webcam para algo e perguntar ao Parlor sobre isso — os quadros da câmera são transmitidos ao mesmo modelo local junto com sua fala.
O Parlor é um produto finalizado?
Não. O próprio README o rotula explicitamente como "prévia de pesquisa" e pede que os usuários esperem arestas e bugs. Ele tem dois lançamentos com tag até o momento.