Conclusiones clave
- Construido con Tauri v2, publicado bajo licencia MIT — no requiere software backend propietario para ejecutar la app en sí
- Interfaz: un orbe sin bordes, siempre visible, en lugar de una ventana convencional o una pestaña de navegador
- Backend de modelo híbrido: voz en tiempo real en la nube (Google Gemini Live u OpenAI Realtime) o un daemon local autoalojado que configuras tú mismo
- Las notas y resultados de búsqueda se guardan como archivos Markdown planos en el sistema de archivos local, no en una base de datos propietaria
- La configuración, los datos y las claves API se almacenan en el equipo del usuario
- Disponible para Windows (WebView2), macOS (WKWebView) y Linux (WebKitGTK 4.1)
- Sitio oficial: askvoxa.dev
📍 En una frase
Voxa es un asistente de voz de escritorio de código abierto bajo licencia MIT, construido con Tauri v2, que aparece como un orbe flotante siempre visible, admite conversación de voz en tiempo real mediante un proveedor en la nube (Gemini Live u OpenAI Realtime) o un daemon local autoalojado, y guarda notas como archivos Markdown planos en el equipo del usuario.
💬 En términos simples
En vez de abrir una pestaña del navegador o una ventana de aplicación, obtienes un pequeño círculo flotante que se mantiene sobre tus demás ventanas. Lo tocas y empiezas a hablar: puede usar un servicio de voz en la nube o, si lo configuras tú mismo, un modelo de voz que corre en tu propio equipo, y guarda las notas como archivos de texto que puedes abrir en cualquier editor.
📌Nota: Voxa no es una herramienta exclusivamente local. El backend en la nube (Gemini Live u OpenAI Realtime) es la vía más sencilla y depende de la API de ese proveedor y de una conexión a internet; una configuración totalmente local requiere apuntar Voxa a tu propio daemon autoalojado. Consulta "¿Voxa es realmente local?" más abajo antes de asumir que es una app local sin nube ni configuración.
¿Qué es Voxa?
Voxa es un asistente de voz de escritorio de código abierto, publicado en askvoxa.dev y construido con Tauri v2, un framework para crear aplicaciones de escritorio multiplataforma ligeras con una interfaz web envuelta en una capa nativa. Voxa se publica bajo licencia MIT.
- Modelo de interacción principal: un orbe sin bordes, siempre visible, que flota sobre tus demás ventanas — tocarlo inicia una conversación de voz en tiempo real, en lugar de abrir una ventana de chat separada o una pestaña de navegador
- El backend de modelo es configurable, no está fijo a un solo proveedor: modelos de voz en tiempo real en la nube (Google Gemini Live u OpenAI Realtime) o un daemon local autoalojado
- Construido con Tauri v2, que renderiza la interfaz usando el motor web propio del sistema operativo (WebView2 en Windows, WKWebView en macOS, WebKitGTK 4.1 en Linux) en lugar de empaquetar un motor de navegador aparte como hace Electron
- Las notas e información que el asistente busca o guarda se escriben como archivos Markdown planos en el sistema de archivos local
- Sin servidor backend propietario operado por Voxa — la configuración, los datos y las claves API de la app permanecen en tu equipo; las llamadas a la nube van directamente al proveedor de modelo que configures (Google u OpenAI), no a un servidor operado por Voxa
¿Cuáles son las funciones principales de Voxa?
Las tres características que definen a Voxa son el orbe de voz siempre visible, el almacenamiento de notas basado en Markdown y su base de código abierto con Tauri v2. Cada una determina cómo se comporta la app frente a un asistente de voz basado en navegador o por suscripción.
¿Voxa es realmente local?
Voxa es una app híbrida, no exclusivamente local — conviene tener clara esta distinción antes de elegirla como herramienta de "IA local". Admite dos vías de backend separadas para el modelo de voz, y solo una de ellas mantiene la inferencia en tu propio hardware.
- Modelos de voz en tiempo real en la nube — Voxa puede enrutar la conversación de voz en tiempo real a través de Google Gemini Live u OpenAI Realtime. Esta vía requiere conexión a internet y tu propio acceso/credenciales API con ese proveedor; el modelo de voz en sí corre en los servidores de ese proveedor, no en tu dispositivo.
- Daemon local autoalojado — Voxa puede en cambio apuntar a un daemon local que tú configuras y ejecutas, manteniendo la inferencia del modelo de voz en tu propio equipo o red en lugar de enviar audio a un proveedor en la nube. Esta es la vía que hace que Voxa funcione como herramienta de IA local, pero es una configuración opcional que debes hacer tú, no el comportamiento predeterminado sin configurar nada.
📌Nota: Lo que permanece local sin importar el backend elegido: la configuración propia de la app, tus notas (guardadas como archivos Markdown planos) y tus claves API — se almacenan en tu equipo, no en un servidor operado por Voxa. Lo que no permanece local por defecto: el modelo de voz en tiempo real en sí, a menos que hayas configurado la vía del daemon local autoalojado.
Voxa en Windows, macOS y Linux
Windows
- Qué esperar:
- Voxa renderiza su interfaz usando WebView2, el motor web basado en Chromium que Microsoft distribuye con las versiones modernas de Windows. Se necesita un runtime de WebView2 actualizado para que la interfaz del orbe y la UI de voz se muestren correctamente.
macOS
- Qué esperar:
- Voxa usa WKWebView, el motor de renderizado web integrado de Apple, para su interfaz. Como Tauri se apoya en el motor provisto por el sistema en lugar de empaquetar el suyo propio, el comportamiento sigue la versión de WKWebView incluida en tu versión de macOS.
Linux
- Qué esperar:
- Voxa usa WebKitGTK 4.1 para su interfaz en Linux. Es una versión específica de WebKitGTK, no "cualquier build de WebKit" — confirma que tu distribución empaqueta WebKitGTK 4.1 (o una versión compatible) antes de instalar, ya que versiones de paquetes de distros más antiguas podrían no coincidir.
Como Tauri v2 renderiza la interfaz a través del motor web propio de cada sistema operativo en lugar de un motor de navegador empaquetado, la versión mínima exacta de SO/motor para cada plataforma no puede fijarse aquí como un número permanente — confirma los requisitos de plataforma actuales directamente en askvoxa.dev antes de instalar.
¿Quién debería usar Voxa?
La elección correcta depende de si un orbe de voz siempre visible y notas basadas en Markdown encajan con la forma en que quieres hablar con un asistente, y de si estás dispuesto a configurar un daemon local si la inferencia totalmente local te importa.
Errores comunes al evaluar Voxa
La mayor parte de la confusión sobre Voxa viene de asumir que se comporta como una app puramente local o puramente en la nube, cuando en realidad está diseñada como un híbrido configurable de ambas.
Preguntas frecuentes
¿Qué es Voxa?
Voxa es un asistente de voz de escritorio de código abierto bajo licencia MIT, construido con Tauri v2, disponible en askvoxa.dev. Se presenta como un orbe sin bordes, siempre visible, que tocas para iniciar una conversación de voz en tiempo real, y puede usar como backend un modelo de voz en tiempo real en la nube o un daemon local autoalojado.
¿Voxa es gratis?
El propio código de la app de Voxa es de código abierto bajo licencia MIT. Si usas el backend de voz en tiempo real en la nube (Gemini Live u OpenAI Realtime), quedas sujeto a los precios y condiciones API propios de ese proveedor, aparte de Voxa. Confirma los precios actuales de Gemini Live u OpenAI Realtime directamente con Google u OpenAI.
¿Voxa funciona totalmente sin conexión?
Solo si configuras la vía del daemon local autoalojado. Por defecto, Voxa está configurado para usar un proveedor de voz en tiempo real en la nube (Gemini Live u OpenAI Realtime), lo que requiere conexión a internet. Una configuración totalmente sin conexión es posible, pero requiere que ejecutes tu propio daemon local y apuntes Voxa hacia él.
¿Qué plataformas admite Voxa?
Windows (usando el motor WebView2), macOS (usando WKWebView) y Linux (usando WebKitGTK 4.1). Voxa es una app de escritorio construida con Tauri v2, no una app móvil para iOS o Android.
¿Dónde guarda Voxa mis notas?
Como archivos Markdown planos en tu sistema de archivos local, no en una base de datos propietaria ni en un formato exclusivo de la nube. Esto significa que las notas siguen siendo legibles y editables en cualquier editor de texto, independientemente de si Voxa está instalado o en ejecución.
¿Voxa envía mis claves API o datos a algún lugar?
La configuración, los datos y las claves API se almacenan en tu propio equipo. Si usas el backend de voz en tiempo real en la nube, tu audio y datos de conversación se envían al proveedor que hayas configurado (Google Gemini Live u OpenAI Realtime), bajo los propios términos de manejo de datos de ese proveedor, no a un servidor separado operado por Voxa.
¿Cuál es la diferencia entre el backend en la nube y el backend de daemon local en Voxa?
El backend en la nube (Gemini Live u OpenAI Realtime) enruta el modelo de voz en tiempo real a través de los servidores de ese proveedor y requiere conexión a internet y acceso API con ese proveedor. El backend de daemon local autoalojado mantiene la inferencia del modelo de voz en hardware que tú controlas, pero tienes que configurar y ejecutar ese daemon tú mismo — no viene preconfigurado.
¿Voxa es de código abierto?
Sí. Voxa está construido con Tauri v2 y publicado bajo licencia MIT, una licencia permisiva que permite inspeccionar, modificar y redistribuir el código fuente sin restricción para el uso comercial.
¿Puedo usar Voxa sin conexión a internet?
Solo si has configurado y tienes en ejecución el daemon local autoalojado como backend de modelo de voz. La vía de voz en tiempo real en la nube (Gemini Live u OpenAI Realtime) requiere conexión para funcionar.
¿Voxa requiere un motor de navegador específico en mi sistema?
Sí, de forma indirecta — al estar construido con Tauri v2, Voxa renderiza su interfaz a través del motor web propio del sistema operativo: WebView2 en Windows, WKWebView en macOS y WebKitGTK 4.1 en Linux. Asegúrate de que el motor correspondiente esté presente y actualizado en tu sistema antes de instalar.
