Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/Willow Inference Serverレビュー2026: セルフホスト型Whisper ASRとTTS
Voice, Speech & Multimodal

Willow Inference Serverレビュー2026: セルフホスト型Whisper ASRとTTS

·読了時間11分·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

Willow Inference Serverは、Toveraが開発した無料のオープンソース・セルフホスト型音声推論サーバー(ソースコードはgithub.com/toverainc/willow-inference-server)で、Whisperベースの音声認識とテキスト読み上げをWebRTC、REST、WebSocketsで提供します。 有料プランは存在しません。GitHubのLICENSEファイルはApache License 2.0です。Willow Inference ServerはLinux(WindowsはWSL経由)でDocker Composeを使って動作し、基本利用にはわずか3GBのVRAMを備えたCUDA対応NVIDIA GPUが必要で(ASRとTTSを併用する場合は6GB推奨)、もともとはオープンソースの音声アシスタントハードウェアプロジェクトWillowのバックエンドとして構築されました——ただし本レビュー時点では、一般的なLLM/チャット推論はサポートしていません。この機能は開発チーム自身によって2026年2月に削除されました。

Willow Inference Server(WIS、github.com/toverainc/willow-inference-server)は、Toveraが開発した無料のオープンソース・セルフホスト型音声サーバーで、Whisperベースの音声認識(ASR)とテキスト読み上げ(TTS)をWebRTC、REST、WebSocketsで提供します。もともとはオープンソースの音声アシスタントハードウェアプロジェクトWillowのバックエンドとして構築され、自分のGPU上で単独でも動作します。本レビューでは、Willow Inference Serverが実際に何をするか、Dockerでのインストール手順、実際のハードウェア要件、現在のメンテナンス状況を取り上げます。

重要なポイント

  • Willow Inference Serverは無料でオープンソースです。公式GitHubのLICENSEはApache License 2.0です
  • Whisperベースの自動音声認識(ASR)とテキスト読み上げ(TTS)を実行し、WebRTC、REST、WebSocketsでアクセス可能
  • Linux上でDocker Composeを使って展開(WindowsはWSL経由)。CPUのみのDocker Composeファイルも提供されるが、CPU性能はGPUより大幅に遅いと文書化されている
  • GTX 1060 3GBからRTX 4090までのNVIDIA GPUで動作し、すべての標準Whisperモデルサイズに加えTTSを併用するには約6GBのVRAMが推奨される
  • 比較的短いサンプル録音からのカスタムTTS音声作成に対応
  • Toveraがオープンソースの音声アシスタントハードウェアプロジェクトWillowのバックエンドとして開発
  • 一般的なLLM/チャット推論はもはやサポートされていない——この機能は2026年2月のコミットで明示的に削除され、プロジェクトのメンテナー自身がその用途にはOllamaなどの別ツールをWISと並行して動かすよう案内している
  • GitHubリポジトリ(github.com/toverainc/willow-inference-server)は2026年9月時点で約510スターを記録。コミット活動は継続的というより断続的で、人員豊富な商用プロジェクトよりも小規模でペースの遅いプロジェクトと捉えるべき

📍 一文で説明

Willow Inference Serverは、自分のNVIDIA GPU上でWhisperベースの音声認識とテキスト読み上げを実行する無料のオープンソース・セルフホスト型サーバーで、有料プランは一切ありません。

💬 簡潔に説明

音声の録音をクラウドの音声APIに送る代わりに、Willow Inference Serverは音声認識とテキスト読み上げのモデルを自分で管理するコンピューター、通常はNVIDIAのグラフィックカードを搭載したマシン上で実行します。もともとはWillow音声アシスタントハードウェアプロジェクトを動かすために作られましたが、音声をテキストに、またはテキストを音声にクラウド依存なしで変換する必要があるあらゆるアプリのために単独でも動作します。

📌補足: 本レビューはローカルAIソフトウェアディレクトリにあるWillow Inference Serverのエントリーの詳細版です。他の数十のローカルAIツールと一目で比較できます。

Willow Inference Serverとは?

Willow Inference Serverは、自分のハードウェア上で音声認識と音声合成モデルを実行するセルフホスト型サーバーで、WebRTC、REST、WebSocketsでアクセスできます。 公式のGitHub説明には「Open source, local, and self-hosted highly optimized language inference server supporting ASR/STT, TTS, and LLM across WebRTC, REST, and WS」と記載されていますが、本レビューではこの説明は一部古くなっていると判断しました。一般的なLLMサポートは2026年2月にコードベースから削除されているためです(詳細は下記の歴史セクションを参照)。本レビュー時点で、WISは一般的なLLMサーバーではなく、ASR/TTSサーバーと正確に説明できます。

  • コア機能: WebRTC、REST、WebSocketsで音声またはテキストを受け取り、文字起こしされたテキストまたは合成音声を返す音声推論サーバー
  • 音声認識エンジン: OpenAIのWhisperモデルを、低遅延のストリーミング用途向けにプロジェクトがチューニング
  • テキスト読み上げエンジン: バンドルされたTTSパイプライン(リポジトリには専用のDockerfile.xttsxttsディレクトリが含まれる)で、短いサンプル録音からのカスタム音声作成に対応
  • 展開対象: CUDA対応NVIDIA GPU。性能は下がるがCPUのみのフォールバックパスも文書化されている
  • 開発元: オープンソースの音声アシスタントハードウェアプロジェクトWillowの背後にある組織Tovera
  • 正式なリポジトリ: github.com/toverainc/willow-inference-server — サーバーのソースコード、リリース、課題トラッカーで現在アクティブに使われているプロジェクト名・組織名

Willow Inference Serverのプロジェクト史

Willow Inference ServerのGitHubリポジトリは2023年2月に作成され、そのコミット履歴は継続的な週次開発というより、長い静かな期間に挟まれた活動の波を示しています——本番運用で依存する前に知っておくべきパターンです。

  1. 1
    2023年2月 — リポジトリ作成
    Why it matters: Willow Inference Serverは、Tovera組織が同じく保守する音声アシスタントハードウェアプロジェクトWillowのバックエンド補完として始まった。
  2. 2
    2024年4月 — TTSエンジンの更新
    Why it matters: この時期のコミットは、リポジトリのコミット履歴によれば、バンドルされたXTTS音声クローンパイプラインを更新した。
  3. 3
    2025年6月 — コード品質の改善作業
    Why it matters: 一連のコミットが、プロジェクトのflake8リンティングをblackコードフォーマットに置き換え、Pythonコードベースを再フォーマットした——約14か月間公開コミットがなかった後の、機能リリースというよりメンテナンス作業。
  4. 4
    2026年2月 — LLM/チャットサポートの削除
    Why it matters: 「README: drop LLM/chat references」と題されたコミットは明確に「We no longer support that. People can run ollama next to WIS.」と述べている。これはプロジェクトの近年の歴史で最も重要な変更であり、WISの範囲をASR/TTS/LLM統合サーバーからASR/TTS専用サーバーへと狭め、本レビュー時点でリポジトリのmainブランチにおける最新のコミットとなっている。

Willow Inference Serverで何ができるか?

Willow Inference Serverの機能セットは、汎用の言語モデルチャットよりも、高速でセルフホストされた音声処理に重点を置いています。以下は、プロジェクト自身のGitHubのREADMEに基づいて各パーツが実際に何をするかです。

  • 自動音声認識(ASR) — Whisperベースのモデルを使って話された音声をテキストに文字起こし。プロジェクトはバッチ文字起こしだけでなく「可能な限りリアルタイムに近い」ストリーミング認識に向けてチューニングしている
  • 複数のWhisperモデルサイズを同時利用 — READMEによると、3つの標準Whisperモデルサイズ(base、medium、large-v2)を6GBのVRAM内で同時にロードでき、1つのモデルサイズに固定する代わりにリクエストごとに精度と速度を調整できる
  • 音声クローン対応のテキスト読み上げ(TTS) — バンドルされたXTTSベースのパイプラインを通じてテキストから音声を合成し、比較的短いサンプル録音からのカスタム音声作成に対応
  • マルチプロトコルアクセス — WebRTC(低帯域幅のリアルタイム音声ストリーミング向け)、REST、WebSocketsでアクセス可能で、クライアントは用途に合ったトランスポートを選択できる
  • ハードウェア自動検出 — サーバーは利用可能なハードウェアを自動検出し、GPUモデルごとの手動設定を必要とせずに動作を調整すると文書化されている
  • Willow音声アシスタントのバックエンド — WISは、オープンソースの音声アシスタントハードウェアプロジェクトWillowが接続する推論バックエンドで、話された指示をテキストに、任意で応答を再び音声に変換する

使用例: Willow Inference Serverの3つの使い方

これらは上記で文書化されたWillow Inference Serverの機能から構築された具体的なワークフローであり、仮定の使用例ではありません。

Willow Inference Serverの料金: 本当に無料か?

はい——Willow Inference Serverに有料プランはありません。 GitHubリポジトリに料金ページはなく、LICENSE.mdファイルがアプリケーション全体に適用されます。ライセンス文はApache License, Version 2.0——許容的で、特許許諾があり、自分の改変版を公開するコピーレフト義務はありません。

  • サブスクリプションなし、有料プランなし、Willow Inference Server自体が課す利用制限もなし
  • ソフトウェアのデプロイや利用にアカウントや登録は不要
  • WISを動かすには自分のGPUハードウェアと、それを稼働させる電気代・ホスティング費用が引き続き必要です——ソフトウェア自体は無料ですが、セルフホスティングはホスト型APIのようにゼロコストというわけではありません
  • Toveraは別の音声アシスタントハードウェアプロジェクトWillow向けにホスト版サンプルサーバーも運営しています——本レビューは特にセルフホストで無料で運用できるWISソフトウェアを対象としています。別のホスト版サービスの詳細や独自の費用の有無については、直接Toveraに確認してください

Willow Inference Server vs. whisper.cpp

Willow Inference Serverとwhisper.cppはどちらもOpenAIのWhisper音声認識モデルをローカルで実行します。 どちらも音声をクラウドAPIに送らないため、よく比較されます。最も明確な違いは、デプロイモデルと範囲にあります。

観点
WIS
whisper.cpp
範囲WebRTC/REST/WS対応のASR+TTSサーバーASR(文字起こし)のみ、サーバー/TTSなし
デプロイDocker Compose、GPU中心コンパイル済みバイナリ/ライブラリ、CPU向き
ターゲットHWNVIDIA CUDA GPU(3〜6GB+ VRAM)CPUで動作。GPU高速化は任意
リアルタイム配信WebRTCで対応する設計追加のクライアント実装で可能
ハードウェア統合Willowバックエンドとして設計汎用ライブラリ、専用HWなし
メンテナンス頻度断続的。最終コミット26年2月積極的に保守、頻繁なコミット

WebRTCストリーミングとTTSが組み込まれた既製のサーバーを優先し、余っているNVIDIA GPUがある場合は、Willow Inference Serverの機能セットの方が幅広いです。自分のアプリに組み込む、できるだけ軽量でCPUに優しい文字起こしライブラリを優先する場合は、whisper.cppを直接検討する価値があります——詳細はwhisper.cppレビューを参照してください。

Willow Inference Serverは誰向けか?

Willow Inference Serverが合うかどうかは、対応するNVIDIA GPUを持っているか、1つのサーバーでASRとTTSの両方が必要か、そしてアップデートが継続的ではなく断続的に配信されるプロジェクトを受け入れられるかにかかっています。

Willow Inference Server vs. 他の音声ツール

Willow Inference Serverは、ローカルの音声認識・合成向けの複数あるセルフホスト型選択肢の1つです。この分野の他のツールとの比較は以下の通りです——全カタログはローカルAIソフトウェアディレクトリを、最も近い一対一比較は上記の専用Willow Inference Server vs. whisper.cpp比較をご覧ください。

  • whisper.cpp — OpenAIのWhisperを文字起こし専用に移植した軽量でCPUに優しいC/C++実装で、組み込みサーバー、WebRTC、TTSはなし。詳細は上記の専用比較セクションを参照。
  • Faster Whisper — 推論速度に重点を置いたCTranslate2ベースのWhisper再実装。WISのような既製のASR/TTSサーバーではなく、組み込み用のライブラリ。
  • Piper TTS — 軽量でCPUに優しいローカルのテキスト読み上げエンジン。WISの統合ASR+TTSサーバーより範囲は狭いが、ハードウェア要件ははるかに軽い。
  • Coqui TTS — 音声クローンに対応したオープンソースのテキスト読み上げツールキット。TTSの範囲はWISがバンドルするXTTSパイプラインと同程度だが、WebRTC対応サーバーではなくライブラリとして配布される。
  • Bark TTS — 笑い声やポーズなどの非音声オーディオも生成できる生成型テキスト読み上げモデル。WISがバンドルするXTTSパイプラインとは異なるTTSエンジンの選択肢。
  • MacWhisper — Whisper文字起こし用のネイティブmacOSデスクトップアプリ。WISのサーバー/WebRTCデプロイモデルをまったく必要としないユーザー向けのGUIデスクトップ代替。

Willow Inference Server評価時によくある誤解

Willow Inference Serverに関する混乱の多くは、LLMサポートに関する古い説明、不明確なハードウェアの前提、あるいは現在のアップデート頻度の過大評価から生じています。

よくある質問

Willow Inference Serverとは何ですか?

Willow Inference Server(WIS、github.com/toverainc/willow-inference-server)は、Whisperベースの音声認識とテキスト読み上げを実行する無料のオープンソース・セルフホスト型サーバーで、WebRTC、REST、WebSocketsでアクセス可能です。Toveraが音声アシスタントハードウェアプロジェクトWillowのバックエンドとして開発しました。

Willow Inference Serverは無料ですか?

はい。GitHubリポジトリに料金ページはなく、LICENSE.mdファイルはApache License 2.0で、アプリケーション全体に有料プランなしで適用されます。動かすためには引き続き自分のGPUハードウェアを用意し、その費用を負担する必要があります。

Willow Inference ServerはLLM/チャット推論をサポートしていますか?

本レビュー時点ではサポートしていません。2026年2月のコミットでプロジェクトから一般的なLLM/チャットサポートが削除され、メンテナーは「We no longer support that. People can run ollama next to WIS.」と述べています。Willow Inference Serverは現在ASR/TTS専用サーバーです。

Willow Inference Serverにはどのようなgpuが必要ですか?

CUDA対応のNVIDIA GPUです。プロジェクトは実用的な最低ラインとしてGTX 1060 3GBを文書化しており、3つの標準Whisperモデルサイズ(base、medium、large-v2)とTTSを併用するには約6GBのVRAMが推奨されます。CPUのみのDocker Composeパスも存在しますが、大幅に遅いと文書化されています。

Willow Inference Serverはどうやってインストールしますか?

GitHubリポジトリをクローンし、GPUデプロイには提供されているdocker-compose.ymldocker compose upを、CPUのみのパスにはdocker compose -f docker-compose-cpu.yml upを実行します。手順はコミットごとに変わる可能性があるため、インストール前にリポジトリで直接最新情報を確認してください。

Willow Inference Serverは積極的に保守されていますか?

コミット履歴は、継続的な開発というより、数か月単位のギャップに挟まれた活動の波を示しています——例えば2024年4月から2025年6月まで約14か月間、公開コミットがありませんでした。本レビュー時点で、mainブランチの最新コミットは2026年2月のもので、リポジトリにタグ付きリリースはありません。アーカイブされてはいませんが、継続的なリリースサイクルを持つプロジェクトというより、コミュニティのペースで進む小規模なプロジェクトです。

Willow Inference ServerとWillowの関係は何ですか?

Willowは、同じくToveraが保守する別のオープンソース音声アシスタントハードウェア/ファームウェアプロジェクトです。Willow Inference Serverは、Willowデバイス向けに音声を処理するバックエンドソフトウェアですが、他の音声認識やテキスト読み上げの用途にも単独で動作できます。

Willow Inference ServerはTTS用にカスタム音声をクローンできますか?

はい。バンドルされたXTTSベースのTTSパイプラインは、プロジェクトのドキュメントによると、比較的短いサンプル録音からカスタム音声プロファイルを作成することに対応しています。

Willow Inference Serverはどのライセンスを使用していますか?

公式のLICENSE.mdファイルによると、Apache License, Version 2.0です——許容的で、特許許諾があり、自分の改変版をオープンソース化する義務はありません。

Willow Inference Serverはリアルタイムストリーミングをサポートしていますか?

はい、WebRTC経由です。プロジェクトは、コマンドを継続的に待ち受ける音声アシスタントのような低遅延のリアルタイム音声用途向けに特別に構築しました。ストリーミングしない、あるいはよりシンプルな統合向けにRESTおよびWebSocketエンドポイントも利用可能です。

出典

← ローカルLLM活用 に戻る