Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/Coqui TTSレビュー(2026):コミュニティが保守する音声クローニング・ツールキット
Voice, Speech & Multimodal

Coqui TTSレビュー(2026):コミュニティが保守する音声クローニング・ツールキット

·12分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

Coqui TTSは、もともとスタートアップ企業Coqui AIが開発したオープンソースのローカル音声合成・音声クローニング・ツールキットで、同社は2023年12月に有料サービスを終了しました。 元のリポジトリcoqui-ai/TTSは2024年8月以降更新されていません。代わりに、積極的に保守されているコミュニティフォークをインストールしてください:pip install coqui-tts。これはidiap/coqui-ai-TTS由来で、Idiap研究所が保守しています。このツールキットはMPL-2.0ライセンスで、音声クローニングモデルXTTS v2を動かすソフトウェアです — ツールキットとモデルは別物で、それぞれ別のライセンスを持ちます(ライセンスと費用セクション参照)。ローカルTTSエンジン全体のライセンス比較は、PromptQuorumのローカルTTSライセンスガイドを参照してください。

Coqui TTSは、MozillaのTTSプロジェクトから派生したオープンソースのローカル音声合成・音声クローニング・ツールキットです。もともとはスタートアップ企業Coqui AIが開発しましたが、同社は2023年12月に有料サービスを終了しました。元のリポジトリcoqui-ai/TTSは2024年8月以降新しいコミットがなく、積極的には保守されていません(MPL-2.0ライセンスの下では引き続き公開されています)。開発は現在、コミュニティフォークのidiap/coqui-ai-TTSで継続されており、Idiap研究所が保守し、PyPIにはcoqui-ttsパッケージとして公開されています。このレビューでは、この歴史、音声クローニングモデルXTTS v2との関係、実際のインストール・使用コマンド、MPL-2.0ライセンス、そして2026年にこの保守移行が実際に重要になる点を扱います。

Coqui TTSレビュー(2026):コミュニティが保守する音声クローニング・ツールキット

重要なポイント

  • MozillaのTTS研究プロジェクトから派生;2021年に元MozillaのTTSエンジニアが設立したスタートアップCoqui AIが開発。
  • Coqui AIは2023年12月に有料クラウドサービスを終了;元のGitHubリポジトリcoqui-ai/TTSは2024年8月以降新しいコミットがない。
  • 積極的に保守されているフォーク:idiap/coqui-ai-TTS、Idiap研究所による保守、PyPIにはcoqui-ttsとして公開。
  • ライセンス:ツールキットはMPL-2.0。実行できるXTTS v2モデルは別途、非商用のCPMLの下にある — 両者を混同しないこと。
  • 無料、有料プランなし;CPUで動作し、大型の音声クローニングモデルにはGPUが推奨される。
  • 最新のパッケージリリース:coqui-tts v0.27.5、2026年1月26日公開。

📍 一文で説明

Coqui TTSはMozillaのTTSプロジェクトから派生したオープンソースのローカル音声合成・音声クローニング・ツールキットで、元の企業Coqui AIは2023年12月に有料サービスを終了し、元のリポジトリは2024年8月以降保守されていないが、積極的に保守されているコミュニティフォークidiap/coqui-ai-TTSがIdiap研究所の下で開発を継続している。

💬 簡潔に説明

pip installでインストールするプログラムで、XTTS v2という音声クローニングモデルを含む複数の異なるAIモデルを使ってテキストを音声に変換できます — これを作った会社は閉鎖しましたが、今は研究機関がソフトウェアを最新に保っています。

📌補足: 更新を受け取るバージョンが欲しい場合は、今は保守されていないcoqui-ai/TTSリポジトリ由来の元のパッケージ名TTSではなく、coqui-tts(保守されているフォーク)をインストールしてください。下記の「インストールと実行」セクションを参照。

歴史:Mozilla TTSからコミュニティフォークへ

**Coqui TTSはMozillaのTTSプロジェクトにさかのぼります。** これはオープンソース音声技術に関するMozilla社内の研究プロジェクトでした。Mozillaが2021年にその研究グループを解散した際、Eren Gölge、Kelly Davis、Josh Meyer、Reuben Moraisを含む複数のエンジニアが独立企業としてスタートアップCoqui AIを設立し、テキスト読み上げツールキット(Coqui TTS)と音声認識ツールキット(Coqui STT)の両方をリリースして作業を継続しました。

Coqui AIは2023年3月にシード資金として330万ドルを調達し、オープンソースツールキットと、音声クローニングモデルXTTSへのホスト型アクセスを含む有料クラウドサービスの両方を提供していました。同社はオープンソースソフトウェアの上に持続可能なビジネスモデルを見出せず、2023年12月に有料サービスの終了を発表し、サーバーは2023年12月11日にオフラインになりました。

**元のリポジトリcoqui-ai/TTSは、GitHub上でMPL-2.0ライセンスの下で公開され続けています**が、2024年8月以降新しいコミットはなく、GitHub上で正式にアーカイブ済みとは表示されていません — 実際には、積極的な開発やバグ修正は行われていません。

**コミュニティフォークのidiap/coqui-ai-TTSが開発を継続しています。** これはスイスの研究機関であるIdiap研究所によって保守され、PyPIには元のパッケージ名TTSとは別にcoqui-ttsというパッケージ名で公開されています。そのREADMEは明示的に「元の、保守されていないリポジトリのフォーク」であると述べており、リリース履歴は継続的な更新を示しています。音声クローニングキャッシュを追加したv0.27.0リリースや、2026年1月26日のv0.27.5リリースなどです。

Coqui TTSを作ったのは誰ですか

Coqui TTSは、2021年に設立されたスタートアップCoqui AIが作成しました。設立者にはMozillaのTTS研究プロジェクトの元エンジニアであるEren Gölge、Kelly Davis、Josh Meyer、Reuben Moraisが含まれます。Coqui AIが2023年12月に有料サービスを終了した後、開発はIdiap研究所が保守するコミュニティフォークで継続されました。

Coqui TTSが実際に行うこと

Coqui TTSは単一のモデルではなくツールキットです — 複数の異なる音声合成モデルアーキテクチャを実行(そして歴史的には訓練)するための、統一されたPythonインターフェース、CLI、トレーニングパイプラインを提供します。

  • マルチモデル・インターフェース。 単一のTTS()Pythonクラスが、VITSベースの単一話者・複数話者モデル、Tacotron2ベースのモデル、そして音声クローニングモデルXTTS v2を含む異なるモデルアーキテクチャを、周辺のアプリケーションコードを変更することなくロード・実行します。
  • コマンドライン合成。 ttsCLIコマンドはターミナルから直接音声を合成し、tts --list_modelsで利用可能な全ての事前学習モデルを一覧表示します。
  • XTTS v2による音声クローニング。 ロードしたXTTS v2モデルにspeaker_wav引数を渡すと、短い参照音声クリップから声をクローンし、XTTS v2が対応する言語でそのクローンした声で音声を生成します。
  • 幅広い事前学習モデルのライブラリ。 このツールキットは、ドキュメントによれば基盤となるFairseqベースの大規模多言語モデルを通じて1,100以上の言語をカバーする事前学習モデルへのアクセスに加え、特定言語向けのより高品質な厳選モデルも提供します。
  • モデルの訓練とファインチューニング。 事前学習モデルの実行に加え、このツールキットには独自の音声モデルを構築・微調整するためのトレーニングスクリプトとデータセット分析ユーティリティが含まれています — Coqui AIのホスト型トレーニングサービス終了以前は、歴史的に最も使われた機能の一つでした。
  • XTTS v2のストリーミング推論。 このツールキットは、XTTS v2による低遅延ストリーミング合成を文書化しており(保守されているフォークのドキュメントによれば最初の音声出力まで200ミリ秒未満のレイテンシと引用)、対話型音声アプリケーションに有用です。

Coqui TTSとXTTS v2の関係

Coqui TTS(ツールキット)とXTTS v2(モデル)は、それぞれ別のライセンスを持つ別物であり、両者を混同するのはよくあるライセンスの誤りです。 Coqui TTSツールキット — Pythonパッケージ、CLI、トレーニングコード — はMPL-2.0の下にあり、ツールキットへの変更に関するソース開示条件付きで商用利用を許可する寛容なライセンスです。XTTS v2は特定の事前学習モデルであり、その重みはCoqui Public Model License(CPML)という非商用ライセンスの下で配布されており、ツールキットのMPL-2.0ライセンスとは別のものです。

実際には、これはCoqui TTSツールキットを寛容にライセンスされたモデルとともに商用利用できることを意味します(互換性のあるライセンスの下で訓練されたVITSまたはTacotron2モデルなど)。一方で、「Coqui TTSツールキットがXTTS v2モデルを実行する」という特定の組み合わせは、そのモデルの重みと出力に対するXTTS v2の非商用制限を受け継ぎます。同じツールキットを通じて別の、寛容にライセンスされたモデルを実行する場合は、その制限を負いません。

coqui-ttsパッケージはXTTS v2の使用方法を直接文書化しており**、モデルはTTS("tts_models/multilingual/multi-dataset/xtts_v2")としてロードされます。これは、別の推論スタックを通じてモデルの重みを直接使用する以外で、XTTS v2を実行する主要なサポート方法がこのツールキットだからです。そのモデルのライセンスと機能の完全な内訳については、PromptQuorumの専用XTTS v2レビューを参照してください。

Coqui TTSのインストールと実行:手順

この手順では、積極的に保守されているcoqui-ttsパッケージをインストールし、保守されているフォーク自身のREADMEに文書化された構文を使って最初の合成を実行します。

  1. 1
    保守されているパッケージをインストールする。
    Why it matters: Python環境で`pip install coqui-tts`を実行してください(uvを使う場合は`uv pip install coqui-tts`)。特に`coqui-tts`パッケージをインストールしてください — 今は保守されていない元のリポジトリを指す古いパッケージ名`TTS`ではありません。
  2. 2
    利用可能な事前学習モデルを一覧表示する。
    Why it matters: `tts --list_models`を実行すると、言語とアーキテクチャ(VITS、Tacotron2、XTTSなど)ごとに整理された、ダウンロード可能な事前学習モデルの全カタログが表示されます。
  3. 3
    コマンドラインから音声を合成する。
    Why it matters: デフォルトモデルで合成するには`tts --text "Hello world" --out_path output.wav`を実行するか、リストから特定のモデルを選ぶには`--model_name <モデル>`を追加してください。
  4. 4
    (オプション)XTTS v2の音声クローニングにPython APIを使う。
    Why it matters: `TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)`でモデルをロードし、短い参照音声クリップを指す`speaker_wav`引数と声をクローンするための`language`引数を指定して`.tts_to_file()`を呼び出します。
  5. 5
    (オプション)GPUアクセラレーションを有効にする。
    Why it matters: `TTS()`コンストラクタに`gpu=True`を渡すか、ロードしたモデルオブジェクトで`.to("cuda")`を呼び出すことで、NVIDIA GPU上で推論を実行します — CPUのみでは明らかに遅くなるXTTS v2に推奨されます。
  6. 6
    (オプション)XTTS v2のCPMLライセンスを非対話的に承諾する。
    Why it matters: XTTS v2を初めてロードすると、CPMLの承諾を求める対話的なステップが表示されます。環境変数`COQUI_TOS_AGREED=1`を設定すると非対話的に承諾でき、DockerコンテナやCIパイプラインでの無人実行に必要です。

実際の使用例

上記の基本的なインストール手順に加えて、以下は保守されているフォーク自身のドキュメントに基づく一般的な実際の使用パターンです。

  • 自動化環境向けの非対話的CPML承諾:XTTS v2を最初にロードする前にCOQUI_TOS_AGREED=1を設定しておくと、DockerビルドやCIパイプラインが対話的なプロンプトで止まらなくなります。
  • 話者と言語のイントロスペクション:複数話者または多言語モデルをロードした後、tts.speakerstts.languagesはロードしたモデルが実際にサポートする内容を一覧表示します — 合成前の入力検証に有用です。
python
# コマンドライン:利用可能な事前学習モデルを一覧表示
tts --list_models

# コマンドライン:デフォルトモデルで合成
tts --text "Hello world" --out_path output.wav

# コマンドライン:特定のモデルで合成
tts --model_name "tts_models/en/ljspeech/tacotron2-DDC" \
    --text "This is a test." --out_path output.wav

# Python API:基本的な合成
from TTS.api import TTS

tts = TTS("tts_models/en/ljspeech/tacotron2-DDC")
tts.tts_to_file(text="Hello world", file_path="output.wav")

# Python API:XTTS v2による音声クローニング(先にCPMLを非対話的に承諾)
# export COQUI_TOS_AGREED=1
import torch
from TTS.api import TTS

device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)

tts.tts_to_file(
    text="Hola, esto es una prueba.",
    speaker_wav="reference_voice.wav",
    language="es",
    file_path="cloned_output.wav",
)

# Python API:ロードしたモデルで利用可能な話者と言語を一覧表示
print(tts.speakers)
print(tts.languages)

ライセンスと費用

Coqui TTSツールキットは、MPL-2.0(Mozilla Public License 2.0)の下でライセンスされています。 これはPyPI上で公開されているcoqui-ttsパッケージのメタデータと、idiap/coqui-ai-TTSリポジトリのライセンスファイルによって確認できます。MPL-2.0は条件付きの寛容なライセンスです:ツールキットを商用利用できますが、ツールキット自身のソースファイルを変更して配布する場合、その特定の変更済みファイルもMPL-2.0の下で公開する必要があります。未変更の依存関係としてツールキットを使用する場合、自身のアプリケーションコードをMPL-2.0の下に置く必要はありません。

XTTS v2モデルは別途、Coqui Public Model License(CPML)の下でライセンスされており、これは非商用です — これはモデルの重みと生成された音声出力に適用され、それらを実行するCoqui TTSツールキットのコードには適用されません。そのライセンスの完全な内訳については、PromptQuorumのXTTS v2レビューを参照してください。

Coqui TTSツールキット自体には、有料プラン、サブスクリプション、ライセンス料はありません。 Coqui AIの有料ホストサービスは2023年12月に終了しており、いかなる価格でも利用できません。今日Coqui TTSを使う唯一の方法は自己ホスト型で、保守されていない元のパッケージか、積極的に保守されているcoqui-ttsフォークのいずれかを使うことです。

Coqui TTSはどのライセンスを使っていますか

Coqui TTSツールキット自体はMPL-2.0の下にあり、ツールキット自身のソースファイルへの変更を同じライセンスの下で公開するという条件付きで商用利用を許可します。これは実行する特定のモデルのライセンスとは別のものです — 例えばXTTS v2モデルは非商用のCoqui Public Model License(CPML)の下にあり、これはモデルの重みと出力に適用され、ツールキットのコードには適用されません。

Coqui TTSが向いていない用途

Coqui TTSは柔軟なマルチモデル・ツールキットであり、あらゆる用途において最速または最もシンプルな選択肢ではありません。以下の状況には向いていません:

  • 元の、保守されていないリポジトリを基盤にすること。 pip install coqui-tts(保守されているフォーク)ではなくpip install TTS(元のパッケージ名)を実行した場合、2024年8月以降更新のないコードを基盤にすることになります — 依存する前に、チュートリアルや依存関係が実際にどのパッケージを参照しているか確認してください。
  • 可能な限り最速のCPU専用合成。 Raspberry PiのようなGPUなしの控えめなハードウェア上でのリアルタイム音声が優先事項であれば、Piperがその目的専用に作られておりデプロイも簡単です。Coqui TTSのより大きなモデル、特にXTTS v2は、CPUのみでは明らかに遅くなります。
  • 別途ライセンス確認なしでの商用音声クローニング。 Coqui TTSツールキットを通じてXTTS v2を実行しても、モデルの重みと出力に対するXTTS v2自身の非商用CPML制限は依然として適用されます — ツールキットのMPL-2.0ライセンスはそれを無効にしません。上記の「ライセンスと費用」セクションを参照してください。
  • 長期的な企業サポートの保証。 Coqui AIという会社は2023年12月以降存在しません。現在のフォークは研究機関がコミュニティベースで保守しており、サポート契約付きの資金調達済み企業とは異なる保守モデルです — 重要な本番インフラの決定にはこれを考慮してください。
  • バージョン間で単一の安定したAPI。 開発が保守されていないオリジナルと積極的に開発されているフォークの間で移動したため、オンライン上の一部のチュートリアル、Stack Overflowの回答、ブログ記事は古いAPI表面や元のパッケージ名を参照していることがあります — 古い検索結果ではなく、現在のcoqui-ttsドキュメントと照らし合わせて確認してください。

Coqui TTSの代替候補

Piper

最適な用途:
最速のCPU専用合成、音声クローニングなし、Raspberry Piでリアルタイム
ライセンス:
GPL-3.0-or-later

XTTS v2

最適な用途:
XTTS v2だけが必要で、より広いツールキットが不要な場合の音声クローニングモデル自体
ライセンス:
CPML(非商用)

Bark

最適な用途:
表現力豊かな非音声オーディオ — 笑い声、ため息、環境音
ライセンス:
MIT

StyleTTS 2

最適な用途:
最も自然な英語ナレーション品質(音声クローニングなし)
ライセンス:
MIT

ElevenLabs

最適な用途:
セルフホストを好まないチーム向けの、商用音声クローニング対応マネージドクラウドAPI
ライセンス:
プロプライエタリ(有料クラウドAPI)

よくある質問

Coqui TTSとは何ですか

Coqui TTSは、MozillaのTTS研究プロジェクトから派生し、もともとスタートアップ企業Coqui AIが開発した、オープンソースのローカル音声合成・音声クローニング・ツールキットです。音声クローニングモデルのXTTS v2を含む複数のモデルアーキテクチャを、単一のPythonインターフェースとCLIでサポートしています。

Coqui TTSは今も保守されていますか

元のcoqui-ai/TTSリポジトリは積極的に保守されていません — 企業Coqui AIが2023年12月に有料サービスを終了して以降、2024年8月から新しいコミットがありません。積極的に保守されているコミュニティフォークidiap/coqui-ai-TTSがIdiap研究所の下で開発を継続しており、PyPIにはcoqui-ttsパッケージとして公開され、2026年1月時点でもリリースが続いています。

Coqui TTSは無料ですか

はい、ツールキット自体には有料プランやライセンス料はありません。Coqui AIの以前の有料ホストサービスは2023年12月に終了し、いかなる価格でも利用できません。XTTS v2のようにツールキット上で動く一部の特定モデルには、そのモデルの重みと出力の商用利用を制限する独自の別ライセンス(CPML)があります。

coqui-ttsパッケージとTTSパッケージの違いは何ですか

TTSは元のPyPIパッケージ名で、2024年8月以降更新のない、保守されていないcoqui-ai/TTSリポジトリに紐づいています。coqui-ttsは積極的に保守されているフォークのパッケージ名で、Idiap研究所の下のidiap/coqui-ai-TTSリポジトリから公開され、2026年1月のv0.27.5を含む定期的なリリースがあります。更新を受け取るバージョンにはcoqui-ttsをインストールしてください。

Coqui TTSは音声クローニングに対応していますか

はい、ツールキットがロード・実行できるXTTS v2モデルを通じて対応しています。XTTS v2は、speaker_wav引数として渡された短い参照音声クリップから声をクローンします。XTTS v2自身のライセンスであるCoqui Public Model License(CPML)は非商用であり、ツールキットのMPL-2.0ライセンスとは別のものである点に注意してください。

なぜCoqui AIは閉鎖したのですか

Coqui TTSの開発元であるCoqui AIは、オープンソースの音声技術の上に持続可能なビジネスモデルを構築できず、2023年12月に有料ホストサービスの終了を発表し、サーバーは2023年12月11日にオフラインになりました。オープンソースのツールキット自体は利用可能なままで、開発はその後コミュニティフォークで継続されました。

Coqui TTSの最新リリースは何ですか

PyPIの登録情報によれば、積極的に保守されているcoqui-ttsパッケージの最新リリースはv0.27.5で、2026年1月26日に公開されました。

結論

Coqui TTSは、開発元の企業が閉鎖した後にオープンソースインフラに何が起こるかを示す、実に有用なケーススタディです。元のリポジトリは2024年8月に静まり返りましたが、ソフトウェアが消えることはありませんでした — 研究機関が保守を引き継ぎ、パッケージ名を変更し、2026年まで継続してリリースを出し続けています。今日これを評価する誰にとっても、実践的な結論はシンプルです:元のTTSパッケージではなくcoqui-ttsをインストールし、ツールキットのMPL-2.0ライセンスが、実行できるXTTS v2モデルの非商用CPMLライセンスとは別物であることを理解してください。ツールキットとしての強みは、単一の用途において最速または最もシンプルであることではなく、モデルアーキテクチャ全体にわたる柔軟性にあります — そのためには、このレビューを速度重視のPromptQuorumによるPiperのカバレッジ、クローニングモデル自体に特化したXTTS v2、あるいはエンジン全体の全体像をつかむためのローカルTTSライセンスガイドと組み合わせてください。

出典

  • GitHubのidiap/coqui-ai-TTS — 積極的に保守されているフォーク:README、ドキュメント、ライセンス、リリース履歴。
  • PyPIのcoqui-tts — 現在のMPL-2.0ライセンスとバージョン履歴を含む公開パッケージメタデータ。
  • GitHubのcoqui-ai/TTS — 今は保守されていない元のリポジトリ(MPL-2.0ライセンス)。
  • Hugging FaceのXTTS v2 — 音声クローニングモデルのモデルカードとCPMLライセンス本文。
  • Idiap研究所 — コミュニティフォークを保守するスイスの研究機関。

← ローカルLLM活用 に戻る