Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/Izwiレビュー: TTS・STT・音声クローン対応のローカル音声AI
Voice, Speech & Multimodal

Izwiレビュー: TTS・STT・音声クローン対応のローカル音声AI

·10分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

Izwiは、テキスト読み上げ、音声認識、話者ダイアライゼーション、音声クローンを1つのOpenAI互換APIの背後に統合した、無料・オープンソースのローカルファースト音声AIランタイムです。これにより、複数の個別クラウド音声サービスをまとめてローカルに置き換えるドロップイン代替として使えます。 macOS・Linux・Windows向けのデスクトップアプリに加え、Web UIとCLIも提供されており、MITライセンスで、ローカル推論にアカウントもAPIキーも不要です。

Izwi(github.com/izwi-ai/izwi)は、テキスト読み上げ、音声認識、話者ダイアライゼーション、音声クローンを1つのOpenAI互換APIの背後にまとめた、無料・オープンソースのローカルファースト音声AIランタイムです。デスクトップアプリ、Web UI、コマンドラインツールとして利用できます。「Izwi」はズールー語・コーサ語で「声」を意味します。本レビューでは、その機能、対応モデル、ハードウェア要件、そしてどのような人に向いているかを解説します。

重要なポイント

  • Izwi(github.com/izwi-ai/izwi)は、テキスト読み上げ、音声認識、その他関連する音声タスク向けの、無料・オープンソースのローカルファースト音声AIランタイム
  • 「Izwi」はズールー語・コーサ語で「声」を意味する
  • MITライセンス。GitHubリポジトリのLICENSEファイルで確認済み
  • 同じローカル推論サーバー上に構築されたデスクトップアプリ(macOS、Linux、Windows)、Web UI、コマンドラインツールとして提供
  • 本レビュー時点でGitHubスター383超、フォーク40
  • まだベータ版: 最新のタグ付きリリースはv0.1.0-beta-17(2026年6月22日)だが、リポジトリの最新コミットプッシュは2026年9月13日

📍 一文で説明

Izwiは、テキスト読み上げ、音声認識、話者ダイアライゼーション、音声クローンを1つのOpenAI互換APIの背後にまとめた、無料・オープンソース(MIT)のローカルファースト音声AIランタイムで、デスクトップアプリ・Web UI・CLIとして提供され、GitHubスターは383を超えます。

💬 簡潔に説明

Izwiは自分のコンピュータにインストールするソフトウェアで、テキストを音声に変換したり、音声をテキストに変換したり、サンプルから声をクローンしたりできます — すべてElevenLabsやOpenAIの音声エンドポイントのような有料クラウドAPIではなく、ローカルで動作します。APIの形式がOpenAI自身のものと一致しているため、そのAPI向けに作られた既存の多くのアプリを、最小限の変更でIzwiに向けることができます。

📌補足: 本レビューはIzwi自身のGitHubリポジトリ、README、およびGitHub API経由のリリース履歴に基づいています。Izwiが対応する特定のモデルの音声品質や文字起こし精度をPromptQuorumが独自にベンチマークしたものではありません。

Izwiとは?

Izwiは、テキスト読み上げ、音声認識、ダイアライゼーション、音声クローンといった複数の個別音声タスクを、タスクごとに別のクラウドサービスを必要とする代わりに、1つのOpenAI互換APIの背後にまとめた無料・オープンソースのローカルファースト音声AIランタイムです。 自らのREADMEでは「音声、チャット、オーディオワークフロー向けのローカルファースト音声AI」と説明されています。

  • 製品タイプ: 3つのフロントエンド — ネイティブデスクトップアプリ、ブラウザベースのWeb UI、CLI — がすべて同じ基盤エンジンと通信するローカル推論サーバー
  • リポジトリ: github.com/izwi-ai/izwi、2026年1月23日作成
  • ライセンス: MIT。リポジトリのLICENSEファイルで確認済み
  • ウェブサイト: izwiai.com。ドキュメントはizwiai.com/docsに別途用意
  • 資金調達: 本レビューの調査では資金調達ラウンド、投資家、商業的な後ろ盾は確認されなかった — Izwiは独立したコミュニティ支援のオープンソースプロジェクトと見られる
  • 規模: 本レビュー時点でGitHubスター383超、フォーク40

Izwiで何ができるのか?

Izwiは、デスクトップアプリ、Web UI、CLIのいずれを使っても、話す・聞く・クローンする・ローカルモデルを管理するという4つの関連音声タスクを一貫したインターフェースでカバーします。

  • テキスト読み上げ: テキストを音声に変換。ボイスデザインや保存済みカスタムボイスに対応した長尺の「Studio」プロジェクトも含む
  • 音声クローン: 対応するTTSモデルファミリーを使い、参照サンプルからクローンした声で音声を生成
  • 音声認識: 音声ファイルの文字起こしに加え、ライブ音声向けのリアルタイムストリーミング文字起こし
  • 話者ダイアライゼーションと強制アライメント: 複数話者の音声で誰が何を話したかを特定し、文字起こしテキストを正確な音声タイムスタンプに整列
  • リアルタイム音声会話: ローカルの自動音声認識、ローカルのチャットモデル、ローカルのテキスト読み上げを組み合わせ、音声アシスタントに似た形で声によるやり取りを実現
  • モデル管理: アプリ内でモデルのダウンロード・読み込み・アンロード・削除が可能。チャット履歴の閲覧や結果のエクスポートもできる
  • OpenAI互換API: モデル、チャット補完、音声合成、音声文字起こし向けの/v1ルートに加え、Responses API形式のプレビュー対応もあり、既存のOpenAI API向けクライアントコードが最小限の変更でローカルのIzwiサーバーを利用できることが多い

Izwiが対応するモデルは?

Izwiは単一のモデルではなくランタイムです — タスクごとに複数の交換可能なモデルファミリーに対応しているため、自分のハードウェアと品質要件に合ったものを選べます。

テキスト読み上げ

対応モデルファミリー(Izwiのカタログより):
Qwen3-TTS、Kokoro-82M、Voxtral TTS、VibeVoice

音声認識

対応モデルファミリー(Izwiのカタログより):
Parakeet、Whisper、Qwen3-ASR、Nemotron 3.5 ASR、VibeVoice ASR、LFM2.5 Audio、Voxtral Mini

ダイアライゼーション・アライメント

対応モデルファミリー(Izwiのカタログより):
Sortformer(ダイアライゼーション)、Qwen3 ForcedAligner(タイムスタンプ整列)

チャット

対応モデルファミリー(Izwiのカタログより):
Qwen3、Qwen3.5、LFM2.5、Gemma

対応モデルはリリース間で追加・変更されることがあるため、ローカルでizwi listを実行して現在有効なカタログを確認してください。一部のモデル重みには独自の別ライセンスや利用制限が付いている場合があります — 再配布や商用利用の前に、izwiai.com/docs/modelsのIzwi Models Guideを確認してください。

使用例

IzwiのCLIは、モデルをダウンロードすれば、いくつかのコマンドで主要タスクをカバーします。

bash
# Start the local server with the web UI
izwi serve --mode web

# Download a TTS model, then generate speech
izwi pull Qwen3-TTS-12Hz-0.6B-Base
izwi tts "Hello from Izwi." --output hello.wav

# Download a speech-to-text model, then transcribe a file
izwi pull Parakeet-TDT-0.6B-v3
izwi transcribe audio.wav --model Parakeet-TDT-0.6B-v3

プラットフォーム、価格、ライセンス

プラットフォーム

Izwiの説明:
macOS、Linux、Windows向けのデスクトップアプリ。Web UIとCLI/サーバーとしても利用可能で、すべて同じローカルエンジン上に構築。

料金

Izwiの説明:
無料・オープンソース。ローカル推論にアカウント、サブスクリプション、APIキーは不要。一部のモデル重みには独自の別ライセンス条件が付く場合がある。

ライセンス

Izwiの説明:
MIT。GitHubリポジトリのLICENSEファイルで確認済み。

ハードウェアアクセラレーション

Izwiの説明:
macOS Apple Siliconのリリースビルドは、macOS 15以降でMetalを使用し、macOS 12〜14ではCPUにフォールバック。LinuxとWindowsのリリースビルドはデフォルトでCPUのみ。NVIDIA CUDAはDocker CUDAプロファイルまたはソースビルド経由で対応。

ステータス

Izwiの説明:
まだベータ版 — 最新のタグ付きリリースはv0.1.0-beta-17で、そのタグ以降もコミット活動が続いている。

ハードウェアアクセラレーション対応はリリース間で変わる可能性があるため、インストール前にizwiai.com/docs/support-matrixで最新のRuntime Support Matrixを直接確認してください。

Izwi vs. Whisper.cpp + Piper

Izwiは、文字起こし用のWhisper.cppとテキスト読み上げ用のPiperという一般的な2ツール構成のローカル音声スタックを、1つのランタイムと1つのAPIに置き換えます。ただしその代償として、まだ若くベータ段階のプロジェクトであるという点があります。

範囲

Izwi:
TTS、STT、ダイアライゼーション、アライメント、音声クローンを1つのAPIの背後でカバーする単一ランタイム
Whisper.cpp + Piper(個別):
2つの別プロジェクト — STT専用のWhisper.cpp、TTS専用のPiper — を個別に実行・統合する必要がある

APIの形

Izwi:
OpenAI互換の/v1ルートで、既存のOpenAI APIクライアントコードが最小限の変更で動作することが多い
Whisper.cpp + Piper(個別):
各ツールが独自のCLI/ライブラリインターフェースを持ち、デフォルトでは両者にまたがる共有またはOpenAI互換のAPIはない

音声クローン

Izwi:
対応するTTSモデルファミリーを通じてサポート
Whisper.cpp + Piper(個別):
PiperにもWhisper.cppにも自体のサポートはない

プロジェクトの成熟度

Izwi:
ベータリリースのみ(最新: v0.1.0-beta-17)。2026年1月作成
Whisper.cpp + Piper(個別):
どちらも個別に長く確立され、広く導入されているプロジェクト

インターフェース

Izwi:
1つのプロジェクトからデスクトップアプリ、Web UI、CLI
Whisper.cpp + Piper(個別):
コマンドライン/ライブラリツール。GUIはすべてサードパーティ製ラッパーによるもの

音声クローンを含む複数の音声タスクを1つのランタイム・1つのAPI面でまとめたいならIzwiを選んでください。各ツールの長い個別の実績を特に重視する場合や、2つのタスクのうち片方だけが必要な場合は、Whisper.cppとPiperを個別に選んでください。それぞれの詳細はWhisper.cppレビューPiper TTSレビューを参照してください。

Izwiはどんな人におすすめか?

Izwiは、個別のクラウドAPIや単機能のローカルツールを組み合わせるのではなく、複数の音声タスクを1つのローカルツールでカバーしたい開発者や技術系ユーザーに向いています。

Izwiが向いていないケース

LinuxやWindowsで最初からGPUアクセラレーションが必要な場合、または長く確立されたベータ以外の製品が必要な場合、Izwiは適していません。

  • LinuxやWindowsでデフォルトでGPUアクセラレーションされているわけではない — Docker CUDAプロファイルを使うかソースからビルドしない限り、リリースビルドはCPUのみで動作
  • 1.0リリースではない — 最新のタグ付きバージョンはベータ(v0.1.0-beta-17)であり、APIと機能セットはまだ変化していくことが見込まれる
  • 単機能の最小限のツールではない — 1つのタスク(例えばTTSのみ)しか必要ない場合は、Piperのような専用ツールの方がシンプルに使える
  • 最新コードに対応したタグ付きリリースが常にあるとは限らない — 本レビューでは、最新のコミットプッシュ(2026年9月13日)と最新のタグ付きリリース(2026年6月22日)の間にギャップが確認された
  • 本レビューで確認できる範囲で、資金調達ラウンドや企業の後ろ盾はない — 独立して維持されているコミュニティ支援プロジェクトとして扱うべき

Izwiを評価する際によくある誤解

Izwiに関する混乱の多くは、単一のモデルだと思い込んだり、どこでもデフォルトでGPUアクセラレーションが効くと期待したり、まだ1.0未満であることを見落としていることに起因します。

競合・代替ツール

Izwiと最も直接比較されるのは、他のローカルまたはオープンソースのテキスト読み上げ・音声認識ツールです。その多くは、1つの統一APIの背後でIzwiが代替できるものです。

ツール
特徴
リンク
Whisper.cpp高速で広く使われているローカル音声認識エンジン。OpenAIのWhisperのC/C++移植版Whisper.cppレビュー
Piper軽量で広く導入されているローカルテキスト読み上げエンジン。低スペックデバイスでもよく使われるPiper TTSレビュー
Coqui TTS音声クローン対応のオープンソーステキスト読み上げツールキットCoqui TTSレビュー
MacWhisperWhisperを基にした、ローカル文字起こし向けのmacOSデスクトップアプリMacWhisperレビュー

このリストは、ローカル音声AI分野でIzwiと一般的に比較されるツールを反映したものであり、PromptQuorum独自のランキングではありません — 選択前に各ツールの現在の機能セットとハードウェア対応を確認してください。

よくある質問

Izwiとは何ですか?

Izwi(github.com/izwi-ai/izwi)は、テキスト読み上げ、音声認識、ダイアライゼーション、音声クローンを1つのOpenAI互換APIの背後にまとめた、無料・オープンソース(MIT)のローカルファースト音声AIランタイムです。

Izwiは無料ですか?

はい、Izwiは無料・オープンソース(MITライセンス)です。ローカル推論にアカウント、サブスクリプション、APIキーは不要です。ダウンロードする一部のモデル重みには独自の別ライセンス条件が付く場合があります。

「Izwi」とはどういう意味ですか?

「Izwi」はズールー語・コーサ語で「声」を意味します。

IzwiはWindowsで動作しますか?

はい、IzwiにはWindowsインストーラー(.exe)があり、macOS(.dmg)とLinux(.deb)向けのビルドもあります。WindowsとLinuxのリリースビルドはデフォルトでCPUのみで、Metal経由のGPUアクセラレーションはApple SiliconのMacで利用できます。

Izwiは音声クローンに対応していますか?

はい、カタログ内の対応テキスト読み上げモデルファミリーを通じて対応しており、すべて自分のマシン上で実行されます。

Izwiが対応する音声認識モデルは?

Izwiの現在のモデルカタログによれば、Parakeet、Whisper、Qwen3-ASR、Nemotron 3.5 ASR、VibeVoice ASR、LFM2.5 Audio、Voxtral Miniです — 有効になっているものはローカルでizwi listを実行して確認してください。

IzwiはOpenAI互換APIを使用していますか?

はい。モデル、チャット補完、音声合成、音声文字起こし向けの/v1ルートを公開しており、Responses API形式のプレビュー対応もあります。

Izwiは完成した1.0製品ですか?

いいえ。本レビュー時点で最新のタグ付きリリースはベータ版(v0.1.0-beta-17)であり、APIとモデルカタログは今後も変化していくことが見込まれます。

Izwiは音声や文字起こしをどこかに送信しますか?

IzwiのREADMEによれば、推論データは自分のマシン内に留まります。オプションの匿名デスクトップ分析はデフォルトで無効で、有効にした場合でもプロンプト・文字起こし・音声ペイロード・ファイルパス・個人識別子は含まれないとされています。

Izwiはどうやってインストールしますか?

GitHub Releasesから自分のプラットフォーム向けのインストーラー(macOS用.dmg、Linux用.deb、Windows用.exe)をダウンロードするか、プロジェクトのインストールスクリプトまたはソースビルドでCLI/サーバーのみをインストールしてください。

出典

← ローカルLLM活用 に戻る