重要なポイント
- 17ツール、3つの役割:音声合成(8)、音声認識(7)、リアルタイム・ボイスエージェント(4)。IzwiとWillow Inference Serverは音声合成と音声認識の両方に対応するため、両方の表に登場します。
- 表は各ツールのレコードから生成し、公式のREADMEまたはサイトと照合しています。ダッシュは「ドキュメントに記載なし」を意味し、「なし」を意味することはありません。
- ライセンスには重要な違いがあります。たとえばPiperとOpenAI Edge TTSはGPL-3.0、Coqui TTSはMPL-2.0、XTTS-v2はCoqui Public Model License、Bark、StyleTTS 2、whisper.cpp、faster-whisperはMITです。
- 表内のツール名はすべて、そのツール自身のPromptQuorumレビューにリンクしています。インストール手順や制限事項はそこで扱っています。
📍 一文で説明
ローカル音声ツールは、音声合成、音声認識、リアルタイム・ボイスエージェントという3つの異なる役割であるため、PromptQuorumディレクトリの17ツールを役割ごとに比較しており、比較表は各ツールのレビューと同じツールデータから生成しています。
💬 簡潔に説明
テキストを読み上げるツール、話した内容を書き起こすツール、AIと音声で会話するツールがあります。読み上げツールと文字起こしツールを「ボイスクローン」で比べても意味がないため、このガイドでは同じ種類どうしを比較します。
比較の方法
各ツールの情報(価格、ライセンス、プラットフォーム、ハードウェア要件、カテゴリ固有の属性)は、そのツールのディレクトリレコードに1か所だけ保存されています。下の比較表はそのレコードから生成され、ツール自身のレビューも同じレコードを参照しているため、両者が異なる値を示すことはありません。
カテゴリ固有の属性(たとえばボイスクローンやリアルタイム文字起こし)は、各プロジェクトの公式READMEまたはウェブサイトから取得し、そこでの正確な表現と照合しています。ドキュメントに記載がない場合、表は推測せずダッシュを表示します。記述に条件が付く場合(実験的、有料プランのみ、GPUが必要など)は、その属性を表から外し、ツールのレビューで扱います。
この比較は、自分のハードウェア上で動くツールを一覧にしたものです。順位付けはしません。どれが適切かは条件によって決まるため、以下のセクションで実際の違いを示します。
比較表
下から役割を選び、行に沿って読み進めてください。ツール名をクリックすると、PromptQuorumの詳しいレビューが開きます。
| ツール | 価格 | ライセンス | プラットフォーム | 動作環境 | ハードウェア | バージョン | 対応言語 | ボイスクローン | ストリーミング出力 | CPUのみで利用可能 | ローカルAPIサーバー | レビュー | 製品リンク · 開示済み |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Bark | 無料 | MIT | macOS, Windows, Linux | ローカル | CPUで十分 | — | 13 | いいえ | — | — | — | レビューを読む → | Bark |
| Coqui TTS | 無料 | MPL-2.0 | macOS, Windows, Linux | ローカル | CPUで十分 | v0.27.5 | — | はい | はい | — | はい | レビューを読む → | Coqui TTS |
| Izwi | 無料 | MIT | macOS, Windows, Linux | ローカル | モデルにより異なる | v0.1.0-beta-17 | — | はい | — | はい | はい | レビューを読む → | Izwi |
| openai-edge-tts | 無料 | GPL-3.0 | macOS, Windows, Linux | ハイブリッド | CPUで十分 | — | — | — | はい | — | はい | レビューを読む → | openai-edge-tts |
| Piper TTS | 無料 | GPL-3.0 | macOS, Windows, Linux | ローカル | CPUで十分 | — | — | — | — | — | はい | レビューを読む → | Piper TTS |
| StyleTTS 2 | 無料 | MIT | macOS, Windows, Linux | ローカル | CPUで十分 | — | — | — | — | — | — | レビューを読む → | StyleTTS 2 |
| Willow Inference Server | 無料 | Apache-2.0 | Linux, Windows | ローカル | CPUで十分 | — | — | はい | はい | — | はい | レビューを読む → | Willow Inference Server |
| XTTS v2 | 無料 | CPML | macOS, Windows, Linux | ローカル | — | — | 17 | はい | — | — | — | レビューを読む → | XTTS v2 |
「—」は、そのプロジェクト自身のドキュメントに記載がないことを示すもので、機能がないという意味ではありません。値は各プロジェクトの公式READMEまたはサイトから取得し、ツールのレビューを更新する際に再確認しています。
音声合成:違いのポイント
- ライセンス。 BarkとStyleTTS 2はMITライセンスです。Coqui TTSはMPL-2.0です。XTTS-v2はCoqui Public Model License(CPML)を使用しており、これは標準的なオープンソースライセンスではなく、独自の条件を持つカスタムライセンスです。商用利用の前に必ず確認してください。PiperとOpenAI Edge TTSはGPL-3.0で、改変版を配布する際に条件が課されます。いずれかを使って製品を作る前にライセンスを確認してください。詳しくはPiper TTSとXTTS v2をご覧ください。
- ボイスクローン。 Coqui TTS(レビュー)、XTTS-v2(レビュー)、Izwi(レビュー)、Willow Inference Server(レビュー)は、ボイスクローンまたはカスタムボイスを記載しています。Barkは、カスタムのボイスクローンに対応していないと明記しています。
- ローカルAPIサーバー。 Coqui TTS、Izwi、OpenAI Edge TTS、Piper、Willow Inference Serverはサーバーコンポーネントを記載しており、他のアプリからHTTP経由で呼び出せます。OpenAI Edge TTSはその用途を中心に作られています。
- 対応言語。 Barkは13言語、XTTS-v2は17言語を記載しています。他のツールは比較可能な言語数を記載していないため、表には数字ではなくダッシュを表示しています。
音声認識:違いのポイント
- リアルタイム文字起こし。 whisper.cppはリアルタイムのストリーミング例を記載しており、IzwiとWillow Inference Serverはリアルタイム利用を記載しています。faster-whisperは文字起こしライブラリで、そのREADMEにはリアルタイムモードの記載がありません。
- 話者ラベル。 IzwiとFunClipは話者ラベル付けを記載しています。Meetilyは話者分離(ダイアライゼーション)を有料のProプランでのみ提供します。whisper.cppの話者交代マーキングは実験的であり、表ではなくレビューで扱っています。
- 価格とプラットフォーム。 MacWhisperは無料プランと有料アップグレードを備えたプロプライエタリなmacOSアプリです。ここにある他のツールの大半は無料のオープンソースです。MeetilyのCommunity Editionは無料でMITライセンスであり、有料のProプランもあります。
- ローカルAPIサーバー。 whisper.cppはサーバーを同梱しており、IzwiとWillow Inference ServerはHTTP APIを記載しています。
ボイスエージェント:違いのポイント
- 完全ローカルか、オプションのクラウドか。 Jarvisは、ローカルで音声入力、LLM、音声出力を行うスタックを記載しています。Parlorは、オプションのクラウドリサーチ機能を備えたローカルパイプラインを記載しています。Voxaはローカルの音声プロバイダーもクラウドのプロバイダーも使えるため、ローカルのものを選んだ場合にのみ完全ローカルになります。
- 割り込み(バージイン)。 Jarvis、Parlor、Voxaは、エージェントの発話中に割り込めることを記載しています。
- 独自LLMと電話通話。 DograhはLLMの選択と電話連携を記載しており、Voxaはローカルのデーモン経由で独自のモデルを接続することを記載しています。
この比較でわからないこと
- この比較はドキュメントに記載された機能を比べるものであり、品質を比べるものではありません。声がどれほど自然か、文字起こしがどれほど正確かはわかりません。それには、ご自身の音声とハードウェアでの確認が必要です。
- 速度ベンチマークは含まれていません。PromptQuorumはこれらのツールについて測定していません。
- ダッシュはプロジェクトのドキュメント上の空白であり、否定的な評価ではありません。READMEに記載がなくても、その機能に対応しているツールがある可能性があります。
- ツールは急速に変化します。各ツールのレビューには確認したバージョンが記載されており、このガイドはレビューが更新されるたびに更新されます。
よくある質問
なぜ音声合成、音声認識、ボイスエージェントを別々に比較するのですか。
役割が異なるため、ほとんどの属性は1つの役割の中でのみ意味を持ちます。ボイスクローンは音声合成に、話者ラベルは文字起こしに、割り込みはボイスエージェントに当てはまります。1つの表で比較すると、ほとんどのセルが空欄か無意味になってしまいます。
比較表のダッシュは何を意味しますか。
そのプロジェクト自身のドキュメントに、その属性の記載がないことを意味します。機能がないという意味ではありません。ツールのレビューやリポジトリで確認してください。
これらのツールは本当にローカルですか。
自分のハードウェア上で動くように設計されていますが、Parlorのオプションのクラウドリサーチ機能やVoxaのクラウド音声プロバイダーのように、オプションのクラウド機能を備えるものもあり、初回実行時にモデルをダウンロードするためインターネット接続が必要なものもあります。詳細は各ツールのレビューで扱っています。
これらのツールにアフィリエイトリンクはありますか。
いいえ。執筆時点で、PromptQuorumはこの比較にあるどのツールともアフィリエイト関係になく、ここにあるリンクで報酬が発生することはありません。
この比較はどのくらいの頻度で更新されますか。
年2回、および掲載ツールのレビューが更新されるたびに更新されます。表がそれらのレビューと同じデータから生成されているためです。
出典
- 各ツールの公式READMEまたはウェブサイト。そのツールのPromptQuorumレビュー(比較表からリンク)に記載しています。
- PromptQuorumローカルAIアプリディレクトリ — 表の各行の生成元となるレコードです。
- AIツールのライセンスを解説 — 上記のライセンス種別の意味を説明しています。