Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/Voxaレビュー2026:デスクトップ向けプライベート音声アシスタントオーブ
Voice, Speech & Multimodal

Voxaレビュー2026:デスクトップ向けプライベート音声アシスタントオーブ

·9分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

Voxaは、フローティングの常時最前面表示オーブとして動作する、MITライセンスのオープンソースデスクトップ音声アシスタント(Tauri v2)です。タップするとリアルタイム音声会話が始まります。 完全にローカルというわけではなく、クラウドのリアルタイム音声モデル(Gemini LiveまたはOpenAI Realtime)か、自分で設定するセルフホスト型のローカルデーモンを使用でき、メモは自分のマシン上にプレーンなMarkdownファイルとして保存されます。

askvoxa.devで公開されているVoxaは、タップするとリアルタイム音声会話が始まる、枠のない常時最前面表示のオーブとして提示されるオープンソースのデスクトップ音声アシスタントです。Tauri v2で構築されMITライセンスの下で公開されており、ローカルのメモを検索・保存する際はプレーンなMarkdownファイルとしてユーザーのマシン上に保存します。Voxaは完全にオンデバイスというわけではなく、ハイブリッド型です。クラウドのリアルタイム音声モデル(Google Gemini LiveまたはOpenAI Realtime)を経由するか、自分で設定するセルフホスト型のローカルデーモンを経由するかを選べます。

Voxaレビュー2026:デスクトップ向けプライベート音声アシスタントオーブ

重要なポイント

  • Tauri v2で構築され、MITライセンスの下で公開 — アプリ自体を動かすのに独自のバックエンドソフトウェアは不要
  • UI:通常のウィンドウやブラウザタブではなく、枠のない常時最前面表示のオーブ
  • ハイブリッドなモデルバックエンド:クラウドのリアルタイム音声(Google Gemini LiveまたはOpenAI Realtime)か、自分で設定するセルフホスト型のローカルデーモン
  • メモや検索結果はプレーンなMarkdownファイルとしてローカルのファイルシステムに保存され、独自データベースではない
  • 設定・データ・APIキーはユーザー自身のマシンに保存される
  • Windows(WebView2)、macOS(WKWebView)、Linux(WebKitGTK 4.1)で利用可能
  • 公式サイト:askvoxa.dev

📍 一文で説明

VoxaはTauri v2で構築されたMITライセンスのオープンソースデスクトップ音声アシスタントで、常時最前面表示のフローティングオーブとして表示され、クラウドプロバイダー(Gemini LiveまたはOpenAI Realtime)またはセルフホスト型のローカルデーモンを経由したリアルタイム音声会話に対応し、メモをユーザーのマシン上にプレーンなMarkdownファイルとして保存する。

💬 簡潔に説明

ブラウザのタブやアプリのウィンドウを開く代わりに、他のウィンドウの上に浮かぶ小さな円形のUIが表示されます。タップして話しかけると、クラウドの音声AIサービスを使うか、自分で設定すれば自分のパソコン上で動く音声モデルを使うことができ、メモはどんなエディタでも開けるプレーンテキストファイルとして記録されます。

📌補足: Voxaは完全にローカル専用のツールではありません。クラウドバックエンド(Gemini LiveまたはOpenAI Realtime)はより簡単な経路ですが、そのプロバイダーのAPIとインターネット接続に依存します。完全にローカルな構成には、Voxaを自分自身がセルフホストするデーモンに向ける設定が必要です。クラウド不要・設定不要のローカルアプリだと思い込む前に、以下の「Voxaは本当にローカルか」を参照してください。

Voxaとは何か

Voxaはaskvoxa.devで公開されているオープンソースのデスクトップ音声アシスタントで、Tauri v2(ネイティブシェルにWebベースのUIを包んだ、軽量なクロスプラットフォームデスクトップアプリを構築するためのフレームワーク)で構築されています。VoxaはMITライセンスの下で公開されています。

  • 中心となる操作モデル:他のウィンドウの上に浮かぶ、枠のない常時最前面表示のオーブ — 別のチャットウィンドウやブラウザタブを開く代わりに、タップするとリアルタイム音声会話が始まる
  • モデルバックエンドは設定可能で、単一のプロバイダーに固定されていない:クラウドのリアルタイム音声モデル(Google Gemini LiveまたはOpenAI Realtime)か、セルフホスト型のローカルデーモン
  • Tauri v2で構築されており、Electronのように別のブラウザエンジンを同梱するのではなく、OS自身のWebエンジン(Windowsの場合WebView2、macOSの場合WKWebView、LinuxのはWebKitGTK 4.1)を使ってUIを描画する
  • アシスタントが検索したり保存を求められたりしたメモや情報は、ローカルのファイルシステムにプレーンなMarkdownファイルとして書き込まれる
  • Voxa自体が運用する独自バックエンドサーバーは存在しない — アプリ自体の設定・データ・APIキーは自分のマシン上に留まり、クラウド呼び出しは設定したモデルプロバイダー(GoogleまたはOpenAI)に直接送られ、Voxaが運用するサーバーには送られない

Voxaの主な機能は何か

Voxaを特徴づける3つの要素は、常時最前面表示の音声オーブ、Markdownベースのメモ保存、そしてTauri v2によるオープンソース基盤です。 それぞれが、ブラウザベースやサブスクリプション型の音声アシスタントと比べたVoxaの挙動を形作っています。

Voxaは本当にローカルか

Voxaは完全にオンデバイス専用ではなく、ハイブリッド型のアプリです。「ローカルAI」ツールとして選ぶ前に、この違いを明確にしておく必要があります。 リアルタイム音声モデルには2つの独立したバックエンド経路があり、そのうち自分のハードウェア上に推論を留められるのは片方だけです。

  • クラウドのリアルタイム音声モデル — VoxaはGoogle Gemini LiveまたはOpenAI Realtime経由でリアルタイム音声会話を行える。この経路にはインターネット接続と、そのプロバイダーに対する自分自身のAPIアクセス・認証情報が必要で、音声モデル自体はそのプロバイダーのサーバー上で動作し、自分のデバイス上では動作しない
  • セルフホスト型のローカルデーモン — 代わりにVoxaを、自分で設定・実行するローカルデーモンに向けることもできる。これにより音声モデルの推論を自分のマシンやネットワーク上に留め、クラウドプロバイダーへ音声を送信しない。この経路がVoxaをローカルAIツールとして機能させるものだが、これはオプトインの設定作業であり、デフォルトのゼロコンフィグ動作ではない

📌補足: どちらのバックエンドを選んでもローカルに留まるもの:アプリ自体の設定、メモ(プレーンなMarkdownファイルとして保存)、APIキー — これらはVoxaが運用するサーバーではなく、自分のマシン上に保存される。デフォルトでローカルに留まらないもの:セルフホスト型のローカルデーモン経路を設定していない限り、リアルタイム音声モデル自体。

Windows・macOS・LinuxでのVoxa

Windows

想定される動作:
Voxaは、Microsoftが最新のWindowsに同梱するChromiumベースのWebエンジンであるWebView2を使ってUIを描画する。オーブUIと音声UIが正しく表示されるには、最新のWebView2ランタイムが必要。

macOS

想定される動作:
VoxaはUIにAppleの組み込みWebレンダリングエンジンであるWKWebViewを使用する。TauriはOS自身のエンジンに依存し独自のものを同梱しないため、動作は使用中のmacOSに付属するWKWebViewのバージョンに従う。

Linux

想定される動作:
VoxaはLinux上のUIにWebKitGTK 4.1を使用する。これは「何らかのWebKitビルド」ではなく特定バージョンのWebKitGTKであるため、インストール前に自分のディストリビューションがWebKitGTK 4.1(または互換バージョン)をパッケージしているか確認すること。古いディストリビューションのパッケージバージョンでは一致しない可能性がある。

Tauri v2は同梱ブラウザエンジンではなく各OS自身のWebエンジンを通じてUIを描画するため、各プラットフォームの正確な最小OS/エンジンバージョンをここで恒久的な数値として固定することはできない。インストール前に、現在のプラットフォーム要件をaskvoxa.devで直接確認すること。

Voxaが向いている人

正しい選択は、常時表示される音声オーブとMarkdownベースのメモがアシスタントとの対話スタイルに合うかどうか、そして完全なローカル推論が重要な場合にローカルデーモンを設定する意思があるかどうかによって決まる。

Voxaを評価する際によくある誤解

Voxaに関する混乱の多くは、実際には両者を組み合わせた設定可能なハイブリッドとして設計されているにもかかわらず、純粋にローカルなアプリか純粋にクラウドなアプリのどちらかとして振る舞うと思い込むことから生じる。

よくある質問

Voxaとは何ですか?

VoxaはTauri v2で構築されたMITライセンスのオープンソースデスクトップ音声アシスタントで、askvoxa.devで利用できます。タップするとリアルタイム音声会話が始まる枠のない常時最前面表示のオーブとして提示され、バックエンドとしてクラウドのリアルタイム音声モデルかセルフホスト型のローカルデーモンを使用できます。

Voxaは無料ですか?

Voxaのアプリ自体のコードはMITライセンスの下でオープンソースです。クラウドのリアルタイム音声バックエンド(Gemini LiveまたはOpenAI Realtime)を使用する場合、Voxa自体とは別に、そのプロバイダー独自の料金とAPI利用規約が適用されます。Gemini LiveまたはOpenAI Realtimeの現在の料金はGoogleまたはOpenAIに直接確認してください。

Voxaは完全にオフラインで動作しますか?

セルフホスト型のローカルデーモン経路を設定した場合のみです。デフォルトでは、Voxaはインターネット接続を必要とするクラウドのリアルタイム音声プロバイダー(Gemini LiveまたはOpenAI Realtime)を使用するよう設定されています。完全にオフラインな構成は可能ですが、自分自身のローカルデーモンを実行し、Voxaをそこに向ける必要があります。

Voxaはどのプラットフォームに対応していますか?

WebView2エンジンを使用するWindows、WKWebViewを使用するmacOS、WebKitGTK 4.1を使用するLinuxです。VoxaはTauri v2で構築されたデスクトップアプリであり、iOSやAndroid向けのモバイルアプリではありません。

Voxaはメモをどこに保存しますか?

独自データベースやクラウド専用形式ではなく、ローカルのファイルシステムにプレーンなMarkdownファイルとして保存します。これにより、Voxaがインストールされているか動作しているかに関わらず、メモはどんなテキストエディタでも読み書きできる状態を保ちます。

VoxaはAPIキーやデータをどこかに送信しますか?

設定・データ・APIキーは自分自身のマシンに保存されます。クラウドのリアルタイム音声バックエンドを使用する場合、音声と会話データは設定したプロバイダー(Google Gemini LiveまたはOpenAI Realtime)に、そのプロバイダー独自のデータ取扱条件の下で送信され、Voxaが別途運用するサーバーには送信されません。

Voxaにおけるクラウドバックエンドとローカルデーモンバックエンドの違いは何ですか?

クラウドバックエンド(Gemini LiveまたはOpenAI Realtime)は、そのプロバイダーのサーバーを通じてリアルタイム音声モデルを実行し、インターネット接続とそのプロバイダーに対するAPIアクセスが必要です。セルフホスト型のローカルデーモンバックエンドは、音声モデルの推論を自分が管理するハードウェア上に留めますが、そのデーモン自体を自分で設定・実行する必要があり、事前設定済みではありません。

Voxaはオープンソースですか?

はい。VoxaはTauri v2で構築され、商用利用に制限のない、ソースコードの検証・変更・再配布を許可する寛容なライセンスであるMITライセンスの下で公開されています。

インターネット接続なしでVoxaを使用できますか?

セルフホスト型のローカルデーモンを音声モデルバックエンドとして設定・実行している場合のみです。クラウドのリアルタイム音声経路(Gemini LiveまたはOpenAI Realtime)が機能するには接続が必要です。

Voxaはシステム上に特定のブラウザエンジンを必要としますか?

はい、間接的にです。Tauri v2で構築されているため、VoxaはOS自身のWebエンジンを通じてUIを描画します:WindowsではWebView2、macOSではWKWebView、LinuxではWebKitGTK 4.1です。インストール前に、該当するエンジンがシステム上に存在し、最新であることを確認してください。

出典

← ローカルLLM活用 に戻る