重要なポイント
- テキストプロンプトから、リアルな多言語音声に加え非音声サウンド(笑い声、ため息、あえぎ声、音楽)を生成する。
- ライセンス:MIT — 2023年5月1日以降完全な商用利用が可能。
- Suno自身のドキュメントによれば、カスタムボイスクローニングには非対応。
- 公開GitHubリポジトリは2024年4月5日以降コミットがない。アーカイブ済みとはマークされていないが、活動していないように見える。
- アーキテクチャ上の設計により、出力は1回の生成あたり約13〜14秒に制限されている。
pip install barkは絶対に実行しないでください — 無関係なパッケージがインストールされます。pip install git+https://github.com/suno-ai/bark.gitを使用してください。
📍 一文で説明
Barkは、テキストプロンプトから多言語音声に加え笑い声やため息などの非音声サウンドを生成する、SunoのオープンソースかつMITライセンスの生成音声モデルだが、カスタムボイスクローニングには対応しておらず、公開GitHubリポジトリは2024年4月5日以降コミットがない。
💬 簡潔に説明
これはテキストを話し声の音声に変換し、入力した指示に基づいて笑ったりため息をついたりする人間らしい音、さらには簡単な音楽まで加えられるAIモデルです。商用利用は無料ですが、特定の人物の声をコピーすることはできず、Sunoの誰かが今も積極的に開発を続けているようには見えません。
📌補足: Barkを構築した企業Sunoは、現在では主に音楽生成AI製品で知られるようになっています。PromptQuorumは、Sunoが今もBarkにエンジニアリングリソースを割いているかどうかを確認できませんでした。公開されているコミット履歴が唯一の手がかりであり、2024年4月以降は何も示していません。
Barkが実際に行うこと
BarkはトランスフォーマーベースのGPT風のテキスト音声生成モデルであり、従来型のテキスト読み上げパイプラインではありません。テキストを音素と波形に単純にマッピングするのではなく、テキストから直接音声トークンを生成します。これにより、従来型のTTSエンジンにはできない非音声サウンドや表現力豊かな韻律を生成できます。
- 多言語音声。 公式READMEによれば、Barkは英語、ドイツ語、スペイン語、フランス語、ヒンディー語、イタリア語、日本語、韓国語、ポーランド語、ポルトガル語、ロシア語、トルコ語、簡体字中国語の13言語に対応している。
- 非音声サウンドの生成。 Barkは `[laughter]
、[laughs]、[sighs]、[gasps]、[clears throat]を埋め込みテキストの合図として生成でき、さらに簡単な[music]` にも対応していることが、公式README自体に直接文書化されている — これがPromptQuorumで扱う他のどのローカルTTSエンジンとも一線を画す特徴である。 - 100種類以上の話者プリセット。 Barkは対応言語にまたがって100種類以上の組み込み話者プリセットを同梱しており、参照音声クリップではなく
history_prompt引数(例:v2/en_speaker_6)で選択できる。 - カスタムボイスクローニング非対応。 Suno自身のドキュメントは、Barkが「現時点でカスタムボイスクローニングには対応していない」と明確に述べている — 指定されたプリセットのトーン、ピッチ、感情、韻律を再現することはできるが、XTTS v2のように参照録音から任意の人物の声をクローンすることはできない。
- 非決定的な出力。 Bark自身のREADMEは、「その生成において創造的な自由を取ることがあり、従来のテキスト読み上げ手法よりも高い分散のモデル出力をもたらす」と説明している — 同じプロンプトを2回実行すると、明らかに異なる結果が生成されることがある。
実際の使用例
これらのコマンドは、Bark自身が文書化しているPythonクイックスタートに従っています。以下のインストール警告に注目してください — これはプロジェクトのREADMEから直接引用したものです。
- プロンプトは約13〜14秒の音声テキストに収めること。 Bark自身のREADMEは、これがバグではなくアーキテクチャ上の制限であると説明している:「Barkは GPT 風のモデルであり、そのアーキテクチャ/コンテキストウィンドウはおおよそこの長さの生成を出力するように最適化されている」。より長いナレーションはチャンクに分割し、後でつなぎ合わせる必要がある。
- 実行ごとにばらつきがあることを想定する。 出力が非決定的であるため、特定の響きにしたいセリフはいくつかテイクを生成し、最初のテイクが代表的だと想定するのではなく、その中から最良のものを選ぶこと。
# Barkをインストール — Sunoが管理していない無関係なパッケージが
# インストールされる "pip install bark" は絶対に使わないこと。
pip install git+https://github.com/suno-ai/bark.git
# Python API: 基本的な生成
from bark import SAMPLE_RATE, generate_audio, preload_models
from scipy.io.wavfile import write as write_wav
preload_models()
text_prompt = "Hello, my name is Suno. And, uh — and I like pizza. [laughs]"
audio_array = generate_audio(text_prompt)
write_wav("bark_generation.wav", SAMPLE_RATE, audio_array)
# ランダムな声ではなく特定の話者プリセットを使用
audio_array = generate_audio(
"This is a specific preset voice speaking a new sentence.",
history_prompt="v2/en_speaker_6",
)
# 小型のGPUでメモリ使用量を削減
import os
os.environ["SUNO_OFFLOAD_CPU"] = "True"
os.environ["SUNO_USE_SMALL_MODELS"] = "True"ライセンスとメンテナンス状況
Barkは MITライセンスの下でライセンスされています。 そのREADMEには明確に「Bark is now licensed under the MIT License, meaning it's now available for commercial use!」(2023年5月1日付)と記載されています。XTTS v2(非商用のCPML)やF5-TTS(CC-BY-NC-4.0)とは異なり、Barkのモデルの重みや出力に商用制限はありません。この段落はライセンスの大まかな形を説明する事実の要約であり、法的助言ではありません — 商用展開の前に自分でMITライセンスの本文を読んでください。
本当の未解決の問題はメンテナンスであり、ライセンスではありません。 公開されているsuno-ai/barkリポジトリのコミット履歴は、本レビューの公開時点で2024年4月5日以降のコミットを示していません。GitHubはこのリポジトリをアーカイブ済みとは表示しておらず、コミュニティによる課題(issue)の作成は今も続いていますが、PromptQuorumはこの期間にメンテナーの活動、リリース、修正の証拠を見つけられませんでした。企業であるSunoは現在、Barkよりもむしろ音楽生成AI製品で広く知られるようになっており、PromptQuorumはSunoが現在Barkリポジトリに何らかのエンジニアリングリソースを割いているかどうかを確認できませんでした。
「活発にメンテナンスされている」は未確認として扱ってください。 本番用途でBarkに依存する場合は、今後アップデート、セキュリティパッチ、バグ修正が一切来ない可能性を見込み、そのユースケースに継続的なメンテナンスが重要であれば、Coqui TTS(コミュニティ維持のidiap/coqui-ai-TTSフォーク経由)やPiperのような活発にメンテナンスされている代替案を検討してください。
Barkはどのライセンスを使用していますか?
Bark自身のREADMEによれば、Barkは MITライセンスの下でライセンスされており、2023年5月1日以降完全な商用利用が可能になっています。これは法的助言ではありません。商用利用の前に自分でMITライセンスの本文を読んでください。
Barkが向いていないこと
Barkは特徴的な研究レベルの生成音声モデルであり、汎用の本番用TTSエンジンではありません。以下のような状況には向いていません。
- 特定の人物の声をクローンすること。 Bark自身のドキュメントは「現時点でカスタムボイスクローニングには対応していない」と述べている。短い参照録音から実在の声をクローンする必要がある場合、XTTS v2はまさにその目的のために作られている(ただし非商用ライセンスの下)— Barkはその代わりにはならない。
- 保証された継続的サポートが必要な本番システム。 公開リポジトリは2024年4月5日以降コミットがなく、Sunoの公開上の注力先が音楽生成AIへ移っていることを考えると、本番運用の依存関係をBarkの継続的なメンテナンス、セキュリティパッチ、バグ修正に賭けることは、PromptQuorumが否定できない現実のリスクである。
- 控えめなハードウェアでの低レイテンシなリアルタイムアプリケーション。 Bark自身のREADMEは、「エンタープライズGPUとPyTorch nightlyでは」達成される「おおよそリアルタイム」の速度に対し、「古いGPU、デフォルトのColab、またはCPUでは、推論時間が著しく遅くなる可能性がある」と述べている。CPUのみや組み込みハードウェアでのリアルタイム利用には、Piperのような軽量エンジンの方が適している。
- 一貫した再現可能な出力。 Bark自身のREADMEが、その生成を従来のTTSよりも分散が大きく非決定的だと説明していることを踏まえると、同じ入力に対して毎回まったく同じ出力が必要なワークフロー(IVRシステム、アクセシビリティツール、規制対象の開示)には不向きである。
- 単一パスでの長時間ナレーション。 Bark自身がREADMEでGPT風アーキテクチャとコンテキストウィンドウに起因すると説明している約13〜14秒の生成時間制限は、オーディオブック並みの長さや長時間ポッドキャストのナレーションには、テキストを手動でチャンクに分割し、生成された音声ファイルをつなぎ合わせる必要があることを意味する。
Barkの代替案
XTTS v2
- 最適な用途:
- 6秒の参照音声からの実際のボイスクローニング、17言語対応
- ライセンス:
- CPML(非商用)
Coqui TTSツールキット
- 最適な用途:
- XTTS v2や他のモデルを実行する、コミュニティ維持のツールキット
- ライセンス:
- MPL-2.0
StyleTTS 2
- 最適な用途:
- 最高水準の自然な英語ナレーション品質(ボイスクローニングなし)
- ライセンス:
- MIT
Piper
- 最適な用途:
- 最速のCPUのみ合成、活発なメンテナンス、Raspberry Piでのリアルタイム利用
- ライセンス:
- GPL-3.0-or-later
ElevenLabs
- 最適な用途:
- 商用ボイスクローニングと積極的なサポートを備えたマネージドクラウドAPI
- ライセンス:
- プロプライエタリ(有料クラウドAPI)
よくある質問
Barkとは何ですか?
BarkはSunoが公開したオープンソースの生成テキスト音声モデルで、参照音声クリップなしにテキストプロンプトだけから、リアルな多言語音声に加え笑い声、ため息、簡単な音楽といった非音声サウンドを生成します。
Barkは商用利用できますか?
はい。BarkはMITライセンスの下でライセンスされており、Suno自身のREADMEによれば2023年5月1日以降完全な商用利用が可能になっています。これは法的助言ではありません。商用展開の前に自分でMITライセンスの本文を読んでください。
Barkは特定の人物の声をクローンできますか?
いいえ。Suno自身のドキュメントは、Barkが「現時点でカスタムボイスクローニングには対応していない」と明確に述べています。100種類以上の組み込み話者プリセットのいずれかのトーンや韻律を再現することはできますが、参照録音から任意の声をクローンすることはできません。その用途には、ボイスクローニング専用に作られたXTTS v2(非商用ライセンスの下)についてのPromptQuorumのレビューを参照してください。
Barkは今も維持されていますか?
これは不確かです。公開GitHubリポジトリのsuno-ai/barkは2024年4月5日以降コミットがありませんが、アーカイブ済みとはマークされておらず、コミュニティによる課題(issue)の作成は今も続いています。企業であるSunoは現在、Barkよりもむしろ音楽生成AI製品で広く知られるようになっています。PromptQuorumは、Sunoが現在Barkリポジトリにエンジニアリングリソースを割いているかどうかを確認できませんでした。
Barkの1回の生成はどれくらいの長さにできますか?
1回の生成あたり約13〜14秒の音声テキストです。Bark自身のREADMEはこれをバグではなく、GPT風アーキテクチャとコンテキストウィンドウに起因するとしています — より長いコンテンツはチャンクに分割し、後でつなぎ合わせる必要があります。
なぜ同じBarkのプロンプトが時々異なる結果を生成するのですか?
Bark自身のREADMEは、「その生成において創造的な自由を取ることがあり、従来のテキスト読み上げ手法よりも高い分散のモデル出力をもたらす」と説明しています。同じプロンプトを2回実行すると、時に明らかに異なる音声が生成されることが想定されています。
Barkにはどれくらいのグラフィックメモリが必要ですか?
公式READMEによれば、フルモデルには約12GBのVRAMが必要です。環境変数 SUNO_USE_SMALL_MODELS=True を設定すると約8GBに収まる小型モデルがロードされ、SUNO_OFFLOAD_CPU=True は生成間でモデルをCPUにオフロードして、メモリ使用量をさらに削減します。
結論
Barkは、PromptQuorumが扱う中で今も最も特徴的なローカルテキスト音声生成モデルであり続けています。この比較対象の中で、埋め込みテキストの合図から笑い声、ため息、簡単な音楽を、完全に寛容なMITライセンスの下で生成できるものは他にありません。ライセンスが明確である必要がある個人プロジェクト、プロトタイプ、商用製品における表現力豊かで非音声にも対応した音声については、Barkはライセンス面で真に実力があり低リスクな選択肢です。ほとんどの読者にとって実際に重要な2つの判断材料は、カスタムボイスクローニングがないことと、不確かなメンテナンス状況です。公開GitHubリポジトリは2024年4月5日以降コミットがなく、Sunoの公開上の注力先は音楽生成AIへ移っています。特定の人物の声をクローンする必要がある場合は、代わりにXTTS v2(非商用ライセンス)を使用してください。本番用途で活発なメンテナンスと高速かつ寛容なライセンスのエンジンが必要な場合は、Piperやコミュニティ維持のCoqui TTSツールキットを検討してください。マネージドな商用の代替案については、ElevenLabsとの比較を参照してください。
出典
- GitHub上のBark — 公式README:言語、話者プリセット、非音声サウンドタグ、ライセンス、インストール手順。
- Barkのコミット履歴 — メンテナンス活動の公開記録。本レビューの公開時点で2024年4月5日以降のコミットを示していない。
- Hugging Face上のBark — GitHub READMEの機能とライセンスの説明を反映したモデルカード。
- XTTS v2レビュー — Barkが提供しないボイスクローニングの代替案についてのPromptQuorumの専用レビュー。
- ローカルTTSとボイスクローニングのライセンス — ローカルTTSエンジン全体のライセンス完全比較。
