Skip to main content
PromptQuorum
Início/LLMs locais avançados/Voxa: análise 2026 do assistente de voz privado para desktop
Voice, Speech & Multimodal

Voxa: análise 2026 do assistente de voz privado para desktop

·9 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O Voxa é um assistente de voz de desktop de código aberto sob licença MIT (Tauri v2) que funciona como um orbe flutuante, sempre visível — toque nele para iniciar uma conversa de voz em tempo real. Ele não é exclusivamente local: pode usar modelos de voz em tempo real na nuvem (Gemini Live ou OpenAI Realtime) ou um daemon local auto-hospedado que você mesmo configura, e salva notas como arquivos Markdown simples no seu próprio computador.

O Voxa, disponível em askvoxa.dev, é um assistente de voz de desktop de código aberto que se apresenta como um orbe sem bordas, sempre visível sobre as demais janelas, que você toca para iniciar uma conversa de voz em tempo real. Ele é construído com Tauri v2 e distribuído sob a licença MIT, e pesquisa e salva notas locais como arquivos Markdown simples no seu computador. O Voxa é híbrido, não exclusivamente local: pode encaminhar conversas por meio de modelos de voz em tempo real na nuvem (Google Gemini Live ou OpenAI Realtime) ou por meio de um daemon local auto-hospedado que você mesmo configura.

Voxa: análise 2026 do assistente de voz privado para desktop

Principais conclusões

  • Construído com Tauri v2, distribuído sob a licença MIT — nenhum software backend proprietário é necessário para rodar o app em si
  • Interface: um orbe sem bordas, sempre visível, em vez de uma janela convencional ou aba de navegador
  • Backend de modelo híbrido: voz em tempo real na nuvem (Google Gemini Live ou OpenAI Realtime) ou um daemon local auto-hospedado que você mesmo configura
  • Notas e resultados de pesquisa são salvos como arquivos Markdown simples no sistema de arquivos local, não em um banco de dados proprietário
  • Configuração, dados e chaves de API são armazenados no computador do usuário
  • Disponível para Windows (WebView2), macOS (WKWebView) e Linux (WebKitGTK 4.1)
  • Site oficial: askvoxa.dev

📍 Em uma frase

O Voxa é um assistente de voz de desktop de código aberto sob licença MIT, construído com Tauri v2, que aparece como um orbe flutuante sempre visível, suporta conversa de voz em tempo real por meio de um provedor em nuvem (Gemini Live ou OpenAI Realtime) ou de um daemon local auto-hospedado, e salva notas como arquivos Markdown simples no computador do usuário.

💬 Em termos simples

Em vez de abrir uma aba do navegador ou uma janela de aplicativo, você tem um pequeno círculo flutuante que fica sobre as suas outras janelas. Você toca nele e começa a falar: ele pode usar um serviço de voz em nuvem ou, se você mesmo configurar, um modelo de voz rodando no seu próprio computador, e grava notas como arquivos de texto simples que você pode abrir em qualquer editor.

📌Nota: O Voxa não é uma ferramenta exclusivamente local. O backend em nuvem (Gemini Live ou OpenAI Realtime) é o caminho mais simples e depende da API desse provedor e de uma conexão com a internet; uma configuração totalmente local exige apontar o Voxa para o seu próprio daemon auto-hospedado. Veja "O Voxa é realmente local?" abaixo antes de presumir que se trata de um app local sem nuvem e sem configuração.

O que é o Voxa?

O Voxa é um assistente de voz de desktop de código aberto, publicado em askvoxa.dev e construído com Tauri v2, um framework para criar aplicativos de desktop multiplataforma leves com interface baseada em web dentro de uma casca nativa. O Voxa é distribuído sob a licença MIT.

  • Modelo de interação principal: um orbe sem bordas, sempre visível, que flutua sobre as demais janelas — tocar nele inicia uma conversa de voz em tempo real, em vez de abrir uma janela de chat separada ou uma aba de navegador
  • O backend de modelo é configurável, não fixo em um único provedor: modelos de voz em tempo real na nuvem (Google Gemini Live ou OpenAI Realtime) ou um daemon local auto-hospedado
  • Construído com Tauri v2, que renderiza a interface usando o mecanismo web próprio do sistema operacional (WebView2 no Windows, WKWebView no macOS, WebKitGTK 4.1 no Linux) em vez de empacotar um mecanismo de navegador separado como faz o Electron
  • Notas e informações que o assistente pesquisa ou é solicitado a salvar são gravadas como arquivos Markdown simples no sistema de arquivos local
  • Nenhum servidor backend proprietário operado pelo próprio Voxa — a configuração, os dados e as chaves de API do app permanecem no seu computador; chamadas para a nuvem vão diretamente ao provedor de modelo que você configurar (Google ou OpenAI), não a um servidor operado pelo Voxa

Quais são os principais recursos do Voxa?

As três características que definem o Voxa são o orbe de voz sempre visível, o armazenamento de notas baseado em Markdown e sua base de código aberto com Tauri v2. Cada uma molda como o app se comporta em comparação com um assistente de voz baseado em navegador ou por assinatura.

O Voxa é realmente local?

O Voxa é um app híbrido, não exclusivamente local no dispositivo — é importante ter clareza sobre essa distinção antes de escolhê-lo como ferramenta de "IA local". Ele suporta dois caminhos de backend separados para o modelo de voz, e apenas um deles mantém a inferência no seu próprio hardware.

  • Modelos de voz em tempo real na nuvem — o Voxa pode encaminhar a conversa de voz em tempo real por meio do Google Gemini Live ou OpenAI Realtime. Esse caminho exige conexão com a internet e suas próprias credenciais/acesso de API com esse provedor; o modelo de voz em si roda nos servidores desse provedor, não no seu dispositivo.
  • Daemon local auto-hospedado — o Voxa pode, em vez disso, apontar para um daemon local que você mesmo configura e executa, mantendo a inferência do modelo de voz no seu próprio computador ou rede em vez de enviar áudio a um provedor em nuvem. Esse é o caminho que faz o Voxa funcionar como ferramenta de IA local, mas é uma configuração opcional feita por você, não o comportamento padrão sem qualquer configuração.

📌Nota: O que permanece local independentemente do backend escolhido: a configuração do próprio app, suas notas (salvas como arquivos Markdown simples) e suas chaves de API — armazenadas no seu computador, não em um servidor operado pelo Voxa. O que não permanece local por padrão: o modelo de voz em tempo real em si, a menos que o caminho do daemon local auto-hospedado tenha sido configurado.

Voxa no Windows, macOS e Linux

Windows

O que esperar:
O Voxa renderiza sua interface usando o WebView2, o mecanismo web baseado em Chromium que a Microsoft distribui com versões modernas do Windows. Um runtime WebView2 atualizado é necessário para que a interface do orbe e a UI de voz sejam exibidas corretamente.

macOS

O que esperar:
O Voxa usa o WKWebView, o mecanismo de renderização web integrado da Apple, para sua interface. Como o Tauri depende do mecanismo fornecido pelo sistema operacional em vez de empacotar o seu próprio, o comportamento segue a versão do WKWebView que acompanha a sua versão do macOS.

Linux

O que esperar:
O Voxa usa o WebKitGTK 4.1 para sua interface no Linux. Trata-se de uma versão específica do WebKitGTK, não "qualquer build do WebKit" — confirme se a sua distribuição empacota o WebKitGTK 4.1 (ou uma versão compatível) antes de instalar, já que versões mais antigas de pacotes de distribuições podem não corresponder.

Como o Tauri v2 renderiza a interface pelo mecanismo web próprio de cada sistema operacional, em vez de um mecanismo de navegador empacotado, a versão mínima exata de SO/mecanismo para cada plataforma não pode ser fixada aqui como um número permanente — confirme os requisitos de plataforma atuais diretamente em askvoxa.dev antes de instalar.

Quem deveria usar o Voxa?

A escolha certa depende de um orbe de voz sempre visível e notas baseadas em Markdown combinarem com a forma como você quer falar com um assistente, e de você estar disposto a configurar um daemon local caso a inferência totalmente local seja importante.

Erros comuns ao avaliar o Voxa

A maior parte da confusão sobre o Voxa vem de presumir que ele se comporta como um app puramente local ou puramente em nuvem, quando na verdade foi projetado como um híbrido configurável dos dois.

Perguntas frequentes

O que é o Voxa?

O Voxa é um assistente de voz de desktop de código aberto sob licença MIT, construído com Tauri v2, disponível em askvoxa.dev. Ele se apresenta como um orbe sem bordas, sempre visível, que você toca para iniciar uma conversa de voz em tempo real, e pode usar como backend um modelo de voz em tempo real na nuvem ou um daemon local auto-hospedado.

O Voxa é gratuito?

O próprio código do app Voxa é de código aberto sob a licença MIT. Se você usar o backend de voz em tempo real na nuvem (Gemini Live ou OpenAI Realtime), você fica sujeito aos preços e termos de API próprios desse provedor, separados do Voxa em si. Confirme os preços atuais do Gemini Live ou OpenAI Realtime diretamente com o Google ou a OpenAI.

O Voxa roda totalmente offline?

Somente se você configurar o caminho do daemon local auto-hospedado. Por padrão, o Voxa é configurado para usar um provedor de voz em tempo real na nuvem (Gemini Live ou OpenAI Realtime), o que exige conexão com a internet. Uma configuração totalmente offline é possível, mas exige que você execute seu próprio daemon local e aponte o Voxa para ele.

Quais plataformas o Voxa suporta?

Windows (usando o mecanismo WebView2), macOS (usando WKWebView) e Linux (usando WebKitGTK 4.1). O Voxa é um app de desktop construído com Tauri v2, não um app móvel para iOS ou Android.

Onde o Voxa armazena minhas notas?

Como arquivos Markdown simples no seu sistema de arquivos local, não em um banco de dados proprietário ou formato exclusivo de nuvem. Isso significa que as notas permanecem legíveis e editáveis em qualquer editor de texto, independentemente de o Voxa estar instalado ou em execução.

O Voxa envia minhas chaves de API ou dados para algum lugar?

Configuração, dados e chaves de API são armazenados no seu próprio computador. Se você usar o backend de voz em tempo real na nuvem, seu áudio e dados de conversa são enviados ao provedor que você configurou (Google Gemini Live ou OpenAI Realtime), sob os próprios termos de tratamento de dados desse provedor — não a um servidor separado operado pelo Voxa.

Qual é a diferença entre o backend em nuvem e o backend de daemon local no Voxa?

O backend em nuvem (Gemini Live ou OpenAI Realtime) encaminha o modelo de voz em tempo real pelos servidores desse provedor e exige conexão com a internet e acesso de API com esse provedor. O backend de daemon local auto-hospedado mantém a inferência do modelo de voz em hardware que você controla, mas você precisa configurar e executar esse daemon você mesmo — ele não vem pré-configurado.

O Voxa é de código aberto?

Sim. O Voxa é construído com Tauri v2 e distribuído sob a licença MIT, uma licença permissiva que permite inspecionar, modificar e redistribuir o código-fonte sem restrição para uso comercial.

Posso usar o Voxa sem conexão com a internet?

Somente se você tiver configurado e estiver executando o daemon local auto-hospedado como backend de modelo de voz. O caminho de voz em tempo real na nuvem (Gemini Live ou OpenAI Realtime) exige conexão para funcionar.

O Voxa exige um mecanismo de navegador específico no meu sistema?

Sim, indiretamente — por ser construído com Tauri v2, o Voxa renderiza sua interface pelo mecanismo web próprio do sistema operacional: WebView2 no Windows, WKWebView no macOS e WebKitGTK 4.1 no Linux. Certifique-se de que o mecanismo correspondente esteja presente e atualizado no seu sistema antes de instalar.

Fontes

← Voltar para LLMs locais avançados