Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/ローカル音声・スピーチツール比較(2026):音声合成・音声認識・ボイスエージェント
Voice, Speech & Multimodal

ローカル音声・スピーチツール比較(2026):音声合成・音声認識・ボイスエージェント

·9分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

PromptQuorumディレクトリにあるローカル音声ツール17種は、別々に比較すべき3つの役割に分かれます。音声合成(8ツール)、音声認識(7ツール)、リアルタイム・ボイスエージェント(4ツール)です。 音声合成のうち、ボイスクローンを公式ドキュメントに記載しているのはCoqui TTS、XTTS-v2、Izwi、Willow Inference Serverです。音声認識では、whisper.cppとWillow Inference Serverがリアルタイム文字起こしを記載しています。ボイスエージェントはDograh、Jarvis、Parlor、Voxaです。下の比較表を使い、インストール前に各ツールのレビューを読んでください。

ローカルの音声ツールには、テキストを音声にする、音声をテキストにする、AIと音声で会話する、という3つの異なる役割があり、単一の機能一覧では公平に比較できません。このガイドでは、自分のハードウェア上で動く無料・フリーミアムの17ツールを、役割ごとに比較します。比較表は各ツールのPromptQuorumレビューと同じデータから生成しているため、表とレビューの内容が食い違うことはありません。

このページには参考用の第三者製品へのリンクが含まれています。PromptQuorumはいかなるアフィリエイトプログラムにも参加しておらず、これらはコミッションを得ない単なる参照リンクです。リンクのクリックと次のステップはご自身の責任です。これらのリンクはPromptQuorumによる推奨や検証を表すものではありません。

重要なポイント

  • 17ツール、3つの役割:音声合成(8)、音声認識(7)、リアルタイム・ボイスエージェント(4)。IzwiとWillow Inference Serverは音声合成と音声認識の両方に対応するため、両方の表に登場します。
  • 表は各ツールのレコードから生成し、公式のREADMEまたはサイトと照合しています。ダッシュは「ドキュメントに記載なし」を意味し、「なし」を意味することはありません。
  • ライセンスには重要な違いがあります。たとえばPiperとOpenAI Edge TTSはGPL-3.0、Coqui TTSはMPL-2.0、XTTS-v2はCoqui Public Model License、Bark、StyleTTS 2、whisper.cpp、faster-whisperはMITです。
  • 表内のツール名はすべて、そのツール自身のPromptQuorumレビューにリンクしています。インストール手順や制限事項はそこで扱っています。

📍 一文で説明

ローカル音声ツールは、音声合成、音声認識、リアルタイム・ボイスエージェントという3つの異なる役割であるため、PromptQuorumディレクトリの17ツールを役割ごとに比較しており、比較表は各ツールのレビューと同じツールデータから生成しています。

💬 簡潔に説明

テキストを読み上げるツール、話した内容を書き起こすツール、AIと音声で会話するツールがあります。読み上げツールと文字起こしツールを「ボイスクローン」で比べても意味がないため、このガイドでは同じ種類どうしを比較します。

比較の方法

各ツールの情報(価格、ライセンス、プラットフォーム、ハードウェア要件、カテゴリ固有の属性)は、そのツールのディレクトリレコードに1か所だけ保存されています。下の比較表はそのレコードから生成され、ツール自身のレビューも同じレコードを参照しているため、両者が異なる値を示すことはありません。

カテゴリ固有の属性(たとえばボイスクローンやリアルタイム文字起こし)は、各プロジェクトの公式READMEまたはウェブサイトから取得し、そこでの正確な表現と照合しています。ドキュメントに記載がない場合、表は推測せずダッシュを表示します。記述に条件が付く場合(実験的、有料プランのみ、GPUが必要など)は、その属性を表から外し、ツールのレビューで扱います。

この比較は、自分のハードウェア上で動くツールを一覧にしたものです。順位付けはしません。どれが適切かは条件によって決まるため、以下のセクションで実際の違いを示します。

比較表

下から役割を選び、行に沿って読み進めてください。ツール名をクリックすると、PromptQuorumの詳しいレビューが開きます。

ツール価格ライセンスプラットフォーム動作環境ハードウェアバージョン対応言語ボイスクローンストリーミング出力CPUのみで利用可能ローカルAPIサーバーレビュー製品リンク · 開示済み
Bark無料MITmacOS, Windows, LinuxローカルCPUで十分13いいえレビューを読むBark
Coqui TTS無料MPL-2.0macOS, Windows, LinuxローカルCPUで十分v0.27.5はいはいはいレビューを読むCoqui TTS
Izwi無料MITmacOS, Windows, Linuxローカルモデルにより異なるv0.1.0-beta-17はいはいはいレビューを読むIzwi
openai-edge-tts無料GPL-3.0macOS, Windows, LinuxハイブリッドCPUで十分はいはいレビューを読むopenai-edge-tts
Piper TTS無料GPL-3.0macOS, Windows, LinuxローカルCPUで十分はいレビューを読むPiper TTS
StyleTTS 2無料MITmacOS, Windows, LinuxローカルCPUで十分レビューを読むStyleTTS 2
Willow Inference Server無料Apache-2.0Linux, WindowsローカルCPUで十分はいはいはいレビューを読むWillow Inference Server
XTTS v2無料CPMLmacOS, Windows, Linuxローカル17はいレビューを読むXTTS v2

「—」は、そのプロジェクト自身のドキュメントに記載がないことを示すもので、機能がないという意味ではありません。値は各プロジェクトの公式READMEまたはサイトから取得し、ツールのレビューを更新する際に再確認しています。

音声合成:違いのポイント

  • ライセンス。 BarkとStyleTTS 2はMITライセンスです。Coqui TTSはMPL-2.0です。XTTS-v2はCoqui Public Model License(CPML)を使用しており、これは標準的なオープンソースライセンスではなく、独自の条件を持つカスタムライセンスです。商用利用の前に必ず確認してください。PiperとOpenAI Edge TTSはGPL-3.0で、改変版を配布する際に条件が課されます。いずれかを使って製品を作る前にライセンスを確認してください。詳しくはPiper TTSXTTS v2をご覧ください。
  • ボイスクローン。 Coqui TTS(レビュー)、XTTS-v2(レビュー)、Izwi(レビュー)、Willow Inference Server(レビュー)は、ボイスクローンまたはカスタムボイスを記載しています。Barkは、カスタムのボイスクローンに対応していないと明記しています。
  • ローカルAPIサーバー。 Coqui TTS、Izwi、OpenAI Edge TTS、Piper、Willow Inference Serverはサーバーコンポーネントを記載しており、他のアプリからHTTP経由で呼び出せます。OpenAI Edge TTSはその用途を中心に作られています。
  • 対応言語。 Barkは13言語、XTTS-v2は17言語を記載しています。他のツールは比較可能な言語数を記載していないため、表には数字ではなくダッシュを表示しています。

音声認識:違いのポイント

  • リアルタイム文字起こし。 whisper.cppはリアルタイムのストリーミング例を記載しており、IzwiとWillow Inference Serverはリアルタイム利用を記載しています。faster-whisperは文字起こしライブラリで、そのREADMEにはリアルタイムモードの記載がありません。
  • 話者ラベル。 IzwiとFunClipは話者ラベル付けを記載しています。Meetilyは話者分離(ダイアライゼーション)を有料のProプランでのみ提供します。whisper.cppの話者交代マーキングは実験的であり、表ではなくレビューで扱っています。
  • 価格とプラットフォーム。 MacWhisperは無料プランと有料アップグレードを備えたプロプライエタリなmacOSアプリです。ここにある他のツールの大半は無料のオープンソースです。MeetilyのCommunity Editionは無料でMITライセンスであり、有料のProプランもあります。
  • ローカルAPIサーバー。 whisper.cppはサーバーを同梱しており、IzwiとWillow Inference ServerはHTTP APIを記載しています。

ボイスエージェント:違いのポイント

  • 完全ローカルか、オプションのクラウドか。 Jarvisは、ローカルで音声入力、LLM、音声出力を行うスタックを記載しています。Parlorは、オプションのクラウドリサーチ機能を備えたローカルパイプラインを記載しています。Voxaはローカルの音声プロバイダーもクラウドのプロバイダーも使えるため、ローカルのものを選んだ場合にのみ完全ローカルになります。
  • 割り込み(バージイン)。 Jarvis、Parlor、Voxaは、エージェントの発話中に割り込めることを記載しています。
  • 独自LLMと電話通話。 DograhはLLMの選択と電話連携を記載しており、Voxaはローカルのデーモン経由で独自のモデルを接続することを記載しています。

この比較でわからないこと

  • この比較はドキュメントに記載された機能を比べるものであり、品質を比べるものではありません。声がどれほど自然か、文字起こしがどれほど正確かはわかりません。それには、ご自身の音声とハードウェアでの確認が必要です。
  • 速度ベンチマークは含まれていません。PromptQuorumはこれらのツールについて測定していません。
  • ダッシュはプロジェクトのドキュメント上の空白であり、否定的な評価ではありません。READMEに記載がなくても、その機能に対応しているツールがある可能性があります。
  • ツールは急速に変化します。各ツールのレビューには確認したバージョンが記載されており、このガイドはレビューが更新されるたびに更新されます。

よくある質問

なぜ音声合成、音声認識、ボイスエージェントを別々に比較するのですか。

役割が異なるため、ほとんどの属性は1つの役割の中でのみ意味を持ちます。ボイスクローンは音声合成に、話者ラベルは文字起こしに、割り込みはボイスエージェントに当てはまります。1つの表で比較すると、ほとんどのセルが空欄か無意味になってしまいます。

比較表のダッシュは何を意味しますか。

そのプロジェクト自身のドキュメントに、その属性の記載がないことを意味します。機能がないという意味ではありません。ツールのレビューやリポジトリで確認してください。

これらのツールは本当にローカルですか。

自分のハードウェア上で動くように設計されていますが、Parlorのオプションのクラウドリサーチ機能やVoxaのクラウド音声プロバイダーのように、オプションのクラウド機能を備えるものもあり、初回実行時にモデルをダウンロードするためインターネット接続が必要なものもあります。詳細は各ツールのレビューで扱っています。

これらのツールにアフィリエイトリンクはありますか。

いいえ。執筆時点で、PromptQuorumはこの比較にあるどのツールともアフィリエイト関係になく、ここにあるリンクで報酬が発生することはありません。

この比較はどのくらいの頻度で更新されますか。

年2回、および掲載ツールのレビューが更新されるたびに更新されます。表がそれらのレビューと同じデータから生成されているためです。

出典

← ローカルLLM活用 に戻る