重要なポイント
- Piper:音声クローンなし、言語ごとに固定音声、CPUでリアルタイム動作(Raspberry Pi対応)、GPL-3.0-or-laterライセンス。
- Chatterbox:約7〜20秒の音声からゼロショット音声クローン、5億パラメータのLlamaベース、MITライセンス、GPU推奨。
- Chatterboxは感情強度を制御するexaggerationパラメータを備える;Piperには感情制御機能がない。
- Resemble AIはChatterboxがElevenLabsに対しブラインドテストで選好されたと報告している — これはモデル発行元自身の主張であり、PromptQuorum独自の調査結果ではない。
- どちらもライセンス料無料のオープンソースソフトウェア。
- 抽象的な「優劣」ではなく、ハードウェアとクローンの必要性に基づいて選ぶこと — 両者は解決する課題が異なる。
📍 一文で説明
Piperは固定の事前学習済み音声のみを持ちクローン機能を持たない軽量なCPU専用ニューラルTTSエンジンで現行GPL-3.0-or-laterライセンス、Chatterboxは短い参照音声から声をクローンしGPUで最も性能を発揮するResemble AI製の5億パラメータLlamaベースMITライセンスモデルである。
💬 簡潔に説明
Piperはほぼどんなコンピューターでもテキストを高速に読み上げるツールで、誰かがすでに収録・学習させた音声を使う。Chatterboxは短い録音から特定の人物の声をコピーし、その声で新しい文章を話せるツールだが、高速に動かすにはより強力なグラフィックカードが必要になる。
📌補足: Pipeのライセンスは、開発がOpen Home Foundationへ移った2025年にMITからGPL-3.0-or-laterへ変更された。MITを前提にPiperを以前評価したことがあるなら、クローズドソース製品への組み込み前に再確認してほしい — 詳細は下記「ライセンスとハードウェアコスト」を参照。
両ツールが実際に行うこと
PiperとChatterboxはどちらもテキストを音声に変換するが、アーキテクチャは根本的に異なり、解決する課題も異なる。 Piperは固定音声カタログによる速度と低リソース消費に最適化され、Chatterboxは要求に応じて特定の声をクローンすることに最適化されている。
- Piper:高速・固定音声・CPU優先の合成。 Piperはespeak-ngでテキストを音素に変換し、その音素からONNX RuntimeにエクスポートされたVITS系モデルで波形を合成する。これによりRaspberry Piでもリアルタイム動作できるほど高速になる。各音声は個別に学習されダウンロード可能なモデルであり、サンプルから新しい声を生成する仕組みはない。
- Chatterbox:Llamaベースのゼロショット音声クローン。 Resemble AIが公開したChatterboxは、Llamaベースの5億パラメータアーキテクチャを使用する。Resemble AI自身が公表した評価方法によれば約7〜20秒という短い参照音声クリップがあれば、その声をクローンして新しい発話を生成でき、ファインチューニングや追加学習は不要。
- Exaggerationパラメータ(Chatterboxのみ)。 Chatterboxは生成音声の感情強度を調整する
exaggerationパラメータ(デフォルト0.5)を公開しており、プロジェクトのドキュメントでは値を上げると発話速度が速くなる傾向があり、cfg(クラシファイアフリーガイダンス)を下げることでよりゆっくりと丁寧な話し方に調整できると説明されている。 - ニューラル電子透かし(Chatterboxのみ)。 Chatterboxが生成するすべての音声クリップには、Resemble AIが設計した知覚不能なPerth透かしが埋め込まれており、MP3圧縮や一般的な音声編集を経ても残存するよう設計され、AI生成音声を後から識別できることを目的としている。
- Piperにはクローン機能、感情制御、透かし機能のいずれもない — これは意図的に機能範囲を絞ったツールであり、その代わりにCPU専用での速度とはるかに小さいリソース消費を実現している。
徹底比較
速度とハードウェアコストではPiperが優位、音声クローンと表現力ではChatterboxが優位。 どちらも単純な上位互換ではない — 以下の表は選択の判断材料となる具体的な違いをまとめたもの。
主な用途
- Piper:
- CPUのみ/組み込みハードウェアでのリアルタイム音声
- Chatterbox:
- ゼロショット音声クローンと表現力豊かなナレーション
音声クローン
- Piper:
- 不可 — 固定の事前学習済み音声のみ
- Chatterbox:
- 可能 — 約7〜20秒の参照音声から
感情制御
- Piper:
- なし
- Chatterbox:
- あり —
exaggerationパラメータ
アーキテクチャ
- Piper:
- VITS系、ONNX Runtime、espeak-ng音素
- Chatterbox:
- 5億パラメータのLlamaベース
ハードウェア
- Piper:
- CPU(Raspberry Pi対応)、CUDAはオプション
- Chatterbox:
- リアルタイムにはGPU推奨(
device="cuda")
現行ライセンス
- Piper:
- GPL-3.0-or-later
- Chatterbox:
- MIT
発行元/保守元
- Piper:
- Open Home Foundation
- Chatterbox:
- Resemble AI
電子透かし
- Piper:
- なし
- Chatterbox:
- あり — Perthニューラル透かし
実際の使用例
以下のコマンドは、それぞれのプロジェクト自身が公開するCLIおよびPython APIに基づくもの。
- PiperはGPUの設定が一切不要 —
pip install piper-ttsによりONNX RuntimeのCPU依存関係が自動的に導入される。 - Chatterboxは
device="cpu"でも動作するが、リアルタイム生成と公表された低レイテンシ性能はGPUアクセラレーションを前提としている。
# ── Piper: CPUでインストールと合成 ──────────────────────────────
pip install piper-tts
python3 -m piper.download_voices en_US-lessac-medium
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."
# Piper Python API
from piper import PiperVoice
voice = PiperVoice.load("en_US-lessac-medium.onnx")
with open("test.wav", "wb") as wav_file:
voice.synthesize_wav("Hello from Piper.", wav_file)
# ── Chatterbox: インストールと声のクローン ─────────────────────
pip install chatterbox-tts
import torchaudio as ta
from chatterbox.tts import ChatterboxTTS
device = "cuda" # GPU推奨;"cpu"も可だが大幅に低速
model = ChatterboxTTS.from_pretrained(device=device)
# モデルのデフォルト音声で生成
wav = model.generate("This is a test.")
ta.save("output.wav", wav, model.sr)
# 短い参照音声からのゼロショットクローン、exaggeration設定付き
AUDIO_PROMPT_PATH = "reference_voice.wav"
wav = model.generate(
"This is the cloned voice speaking a new sentence.",
audio_prompt_path=AUDIO_PROMPT_PATH,
exaggeration=0.6,
)
ta.save("output_cloned.wav", wav, model.sr)ライセンスとハードウェアコスト
Piperの現行保守リポジトリであるOHF-Voice/piper1-gplはGPL-3.0-or-laterライセンスである。 これは元のリポジトリrhasspy/piperからの変更で、rhasspy/piperは2025年10月6日にアーカイブ(読み取り専用化)される前はMITライセンスだった。GPL-3.0はコピーレフトであり、Piperを外部ツールとして利用する場合(CLI、Pythonパッケージ、または別プロセスとして呼び出すWebサーバー)は通常自分のアプリケーションをGPLの対象にしないが、Piper自身のソースコードを改変して配布する場合はその改変部分を同じライセンスで公開する必要がある。これは法的助言ではない — Piperのソースを改変して再配布する商用展開の前には弁護士に相談すること。
Chatterboxはresemble-ai/chatterboxのGitHub上のLICENSEファイルで確認できる通りMITライセンスである — 著作権表示とライセンス文の保持といった最小限の条件で商用利用、改変、再配布を許可する寛容なライセンス。
実際の差別化要因はハードウェアコストであり、ライセンス料ではない — どちらのプロジェクトも無料ソフトウェアである。 PiperはRaspberry Piのような控えめなCPUハードウェアでもリアルタイム動作するため、すでに所有しているデバイス以外の実質コストはほぼゼロに近い。Chatterboxの公表された低レイテンシ性能はGPUアクセラレーション(device="cuda")を前提としており、良好に動かすには通常、CUDA対応GPU(コンシューマー向けNVIDIAカードでもレンタルのクラウドGPUインスタンスでも)を予算に組み込む必要がある。CPUのみの推論は明確に低速になる。
Piperは現在どのライセンスを使っており、変更はあったか?
現在活発に保守されているOHF-Voice/piper1-gplリポジトリはGPL-3.0-or-laterライセンスである。元のrhasspy/piperリポジトリは2025年10月6日にアーカイブされる前はMITライセンスだった。これは商用利用にとって実質的な違いであり、Piperをクローズドソース製品に組み込む前に現行ライセンスを確認すること。
どちらを使うべきか
CPUのみまたは組み込みハードウェア上で動作し、音声クローンが不要なプロジェクトにはPiperを使用する。 短い参照音声から特定の声をクローンする必要があり、GPUを利用できるならChatterboxを使用する。判断は一般的な品質の好みではなく、この2つの制約次第となる。
- 音声アシスタントと組み込み機器 → Piper。 Raspberry Piや同様の低電力ハードウェアでGPUに依存せずリアルタイム動作することこそPiperが設計された目的そのものであり、Home Assistantの音声パイプラインの既定のローカルTTSエンジンになっている理由もそこにある。
- アクセシビリティツールとスクリーンリーダー → Piper。 控えめなハードウェアでの固定で信頼できる音声と低レイテンシは、表現力やクローンよりもここでは重要になる。
- 特定の声によるオーディオブックのナレーションや吹き替え → Chatterbox。 短い参照音声からのゼロショットクローンと、テンポ・話し方を調整するexaggerationパラメータの組み合わせは、一貫性があり聞き分けやすい声が求められるナレーション作業に適する。
- パーソナライズされたブランド音声製品 → Chatterbox。 製品の価値提案が特定のクローンされた声 — ナレーター、ブランドのマスコット、選ばれたペルソナを持つパーソナルアシスタント — に依存する場合、Piperにはこれが一切できない;Chatterboxはまさにそのために作られている。
- 通話量の多い低予算・CPUのみのサーバー群 → Piper。 Piperの低リソース消費は、GPU依存のモデルよりも多数の同時CPUのみインスタンスにわたって予測しやすくスケールする。
- 迷ったらまずPiperから始める。 GPUへの依存がなく、
pip install piper-ttsの1コマンドで導入でき、クローン要件のない「このテキストを読み上げる」という一般的なケースをカバーする。特定の声をクローンする必要が実際に生じた時点で、Chatterboxへの移行を検討すればよい。
どちらにも向かない用途
どちらのツールにも、それぞれの主な設計目標の外側に実際の限界がある。
- Piperはサンプルからの音声クローンを一切できない。 要件の一部でも参照音声から特定の人物の声を再現することが含まれるなら、ハードウェア制約にかかわらずPiperは不適切なツールであり、代わりにChatterboxまたはXTTS v2を使用すること。
- CPUのみのハードウェアでのChatterboxはリアルタイム利用に適さない。 CPU(
device="cpu")でも動作するが、公表されている低レイテンシ性能はGPUアクセラレーションを前提としている。CPUのみのChatterboxはオフラインのバッチ生成には適するが、対話的なリアルタイム音声には向かないと考えること。 - どちらのツールも実在の人物の声をクローンする際の同意の問題には対応していない。 本人の知識や同意なしに実在する特定できる人物の声をクローンまたは合成することは、両プロジェクトのソフトウェアライセンスとは無関係に存在する同意、パブリシティ権、さらには詐欺や成りすましに関する懸念を生じさせる — これはどちらのツールを使うかにかかわらず、商用・個人利用いずれの文脈でも当てはまる。
- Piperの現行リポジトリにおけるGPL-3.0は、クローズドソースでの再配布に対する実質的な制約となる。 Piper自身のソースコードを改変し、クローズドソース製品内で再配布する展開の場合、現行リポジトリのGPL-3.0-or-later条件が適用される — これは元のMITライセンスのリポジトリには存在しなかった制約であり、2025年10月以前に立てた計画は再確認する必要がある。
- Chatterboxが報告するElevenLabsに対する優位性はベンダーの主張であり、独立したベンチマークではない。 Chatterboxを発行するResemble AIは、第三者プラットフォームPodonosを通じて行った評価に基づき、ブラインド評価者がChatterboxをElevenLabsより好んだと報告している。PromptQuorumはこの評価を独自に再現していない。これはモデル発行元自身の主張として扱い、検証済みの第三者結果としては扱わないこと。ElevenLabsに対する音声品質がプロジェクトの決め手になる場合はそれを踏まえて重み付けすること。
代替ツール
XTTS v2
- 最適な用途:
- 約6秒の音声から17言語にわたる多言語音声クローン
- ライセンス:
- CPML(非商用)
Coqui TTSツールキット
- 最適な用途:
- 幅広い言語対応の柔軟なマルチバックエンドツールキット(VITS、Tacotron2、XTTS)
- ライセンス:
- MPL-2.0
StyleTTS 2
- 最適な用途:
- 最も自然な英語ナレーション品質(音声クローンなし)
- ライセンス:
- MIT
Bark
- 最適な用途:
- 表現力豊かな非発話音声 — 笑い声、ため息、環境音
- ライセンス:
- MIT
ElevenLabs
- 最適な用途:
- 自前でホストしたくないチーム向けのマネージドクラウドAPI、商用音声クローン対応
- ライセンス:
- プロプライエタリ(有料クラウドAPI)
よくある質問
PiperとChatterbox TTSの主な違いは何か?
Piperは固定の事前学習済み音声セットを持ちクローン機能を持たない軽量なCPU専用TTSエンジンである。ChatterboxはResemble AI製の5億パラメータLlamaベースモデルで、短い参照音声から特定の声をクローンし、GPUアクセラレーションで最良の性能を発揮する。両者は同じ軸で競合するのではなく、異なる課題を解決する。
PiperはChatterboxのように音声をクローンできるか?
できない。Piperはダウンロードして選択した事前学習済み音声モデルからのみ音声を合成し、参照音声サンプルから新しい声を生成する仕組みは持たない。音声クローンには代わりにChatterboxまたはXTTS v2を使用すること。
Chatterboxの実行にGPUは必要か?
厳密には必須ではない — Chatterboxはdevice="cpu"をサポートしている — が、公表されている低レイテンシ・リアルタイム性能はdevice="cuda"によるGPUアクセラレーションを前提としている。CPUのみのChatterboxはオフラインのバッチ生成には実用的だが、GPU利用時より明確に低速になる。
PiperにはGPUが必要か?
不要。PiperはRaspberry Piを含むCPU専用ハードウェア上でリアルタイム動作するよう設計されている。onnxruntime-gpuパッケージによる任意のCUDA GPUアクセラレーションでスループットを高めることも可能だが、必須ではない。
Chatterboxはどのライセンスを使っているか?
ChatterboxはGitHubリポジトリresemble-ai/chatterboxのLICENSEファイルによればMITライセンスである — 著作権表示とライセンス文の保持といった最小限の条件で商用利用、改変、再配布を許可する寛容なライセンス。
Piperはどのライセンスを使っており、変更はあったか?
現在活発に保守されているOHF-Voice/piper1-gplリポジトリはGPL-3.0-or-laterライセンスである。元のrhasspy/piperリポジトリは、開発がOpen Home Foundationへ移った2025年10月6日にアーカイブされる前はMITライセンスだった。Piperをクローズドソース製品に組み込む前に現行ライセンスを確認すること。
ブラインドテストでChatterboxがElevenLabsに勝っているというのは本当か?
Chatterboxを発行するResemble AIは、第三者プラットフォームPodonosを通じて行った評価で、ブラインド評価者の過半数がChatterboxをElevenLabsより好んだと報告している。これはChatterbox発行元自身が公表した主張であり、PromptQuorumはこれを独自に再現していない。読者はこれを確立された独立ベンチマークではなく、検証すべき主張として扱うべきである。
Chatterboxが声をクローンするにはどれくらいの参照音声が必要か?
ChatterboxについてResemble AI自身が公表した評価方法によれば、約7〜20秒の参照音声で足りる。よりクリーンで単一話者の参照クリップの方が、通常はより正確なクローンを生成する。
ローカル音声アシスタントにはどちらを使うべきか?
ほとんどの場合はPiperである。音声アシスタントは通常控えめなCPU専用ハードウェアで動作し、特定の人物の声をクローンする必要はない — PiperのリアルタイムなCイス性能とGPU非依存性は、まさにこの用途に直結しており、これがHome Assistantの音声パイプラインで既定のローカルTTSエンジンになっている理由である。
同じプロジェクトでPiperとChatterboxを併用できるか?
可能である — 技術的な衝突はない。一般的なパターンは、高速で汎用的なCPUのみのナレーションにはPiperを使い、クローンされた声や感情表現が必要なコンテンツの一部にのみChatterboxを使い、GPUという追加要件を実際に必要な箇所だけで受け入れるというものである。
結論
PiperとChatterboxは実質的に競合関係にあるのではなく、異なる問いに答えるツールである。「GPUのないハードウェアで高速・信頼性の高い完全ローカルな音声合成をどう実現するか」という問いなら、Piperがその実証済みの答えである — Raspberry Piでのリアルタイム動作、クローンは不要かつ提供されておらず、pip install piper-ttsだけで導入できる。「短い参照音声から特定の声に新しいことを話させるにはどうするか」という問いなら、Chatterboxはまさにそのために作られている — MITライセンス、5億パラメータのLlamaベース、感情表現を調整するexaggerationパラメータを備えるが、その代わりに良好に動かすにはGPUが欲しくなる。ChatterboxがブラインドテストでElevenLabsに対して優位だと報告している点は知っておく価値があるが、それはResemble AI自身の主張であり、独立して検証された結果ではないため、確立した事実としてではなくマーケティング上の根拠として重み付けすべきである。ほとんどのローカル音声アシスタントおよび組み込みプロジェクトでは、まずPiperから始め、特定の声のクローンが実際に必要になった時点でChatterboxに手を伸ばすとよい。それぞれをより深く知りたい場合は、PromptQuorum独自のPiper TTSレビューやXTTS v2レビューも併せて参照してほしい。
情報源
- GitHub上のOHF-Voice/piper1-gpl — 現在活発に保守されているPiperリポジトリ:README、ドキュメント、ライセンス、リリース履歴。
- GitHub上のrhasspy/piper — 元のPiperリポジトリで現在はアーカイブ済み(MITライセンス)、2025年10月6日にアーカイブ。
- GitHub上のresemble-ai/chatterbox — Chatterboxの公式リポジトリ:README、ライセンス、インストールおよび使用方法のドキュメント。
- Resemble AI: Chatterbox — Podonos経由で報告されたElevenLabsに対するブラインド評価者の選好を説明するResemble AI自身のページ。
- Piper TTSレビュー — 2025年のライセンス変更の経緯を含む、PromptQuorum独自のPiperレビュー。
