重要なポイント
- 16ツール、2つの役割:画像・動画生成(13)とビジョン・OCR(3)。
- 表は各ツールのレコードから生成され、公式のREADMEまたはサイトと照合済みです。ダッシュは「ドキュメントに記載なし」を意味し、「なし」を意味しません。
- ライセンスには重要な違いがあります。たとえば、AUTOMATIC1111、DiffusionBee、Stable Diffusion WebUI Forge、Locally UncensoredはAGPL-3.0、ComfyUIとFooocusはGPL-3.0、AnimateDiff、ControlNet、InvokeAIはApache-2.0、StableSwarmUIとToolNeuronはMIT、Stable DiffusionはOpenRAILライセンスです。
- 表のツール名はいずれも、そのツール自身のPromptQuorumレビューにリンクしており、インストール手順と制限事項はそちらで扱っています。
📍 一文で説明
ローカル画像ツールは、画像・動画の生成と画像の理解という2つの異なる役割に分かれるため、PromptQuorumディレクトリの16ツールは役割ごとに比較しており、その表は各ツールのレビューと同じツールデータから生成されています。
💬 簡潔に説明
テキストのプロンプトから絵を描くツールもあれば、画像を見てそれについての質問に答えるツールもあります。絵を描くツールと画像を読み取るモデルを「インペイント」で比べても意味がないため、このガイドでは同じ種類どうしを比較します。
比較の方法
各ツールの事実情報(価格、ライセンス、対応プラットフォーム、必要なハードウェア、カテゴリ固有の属性)は、そのツールのディレクトリレコードに1か所だけ保存されています。下の比較表はそれらのレコードから生成され、ツール自身のレビューも同じレコードを参照するため、両者が異なる値を示すことはありません。
カテゴリ固有の属性(たとえばインペイントや拡張機能のサポート)は、各プロジェクトの公式READMEまたはウェブサイトから取得し、そこでの正確な表現と照合しました。ドキュメントに記載がない場合は、推測せず表にダッシュを表示します。記述に条件が付く場合(実験的、フォークに依存、ローカル機能ではなくホスト型サービスなど)は、その属性を表から外し、ツールのレビューで扱います。
表に載せているのは、独自のPromptQuorumレビューがあるツールだけです。この比較は自分のハードウェアで動作するツールを一覧にしたもので、順位付けはしません。適したツールは、あなたの制約条件によって変わるためです。
比較表
下から役割を選び、行に沿って読んでください。ツール名をクリックすると、PromptQuorumの詳細レビューが開きます。
| ツール | 価格 | ライセンス | プラットフォーム | 動作環境 | ハードウェア | バージョン | インペイント | 動画生成 | ノード/グラフ型ワークフローエディタ | 拡張機能/プラグイン | 低VRAMモード | ローカルAPIサーバー | レビュー | 製品リンク · 開示済み |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AnimateDiff | 無料 | Apache-2.0 | Windows, Linux, macOS | ローカル | VRAM 13 GB | — | — | はい | — | — | — | — | レビューを読む → | AnimateDiff |
| AUTOMATIC1111 | 無料 | AGPL-3.0 | macOS, Windows, Linux | ローカル | CPUで十分 | v1.10.1 | はい | — | — | はい | はい | はい | レビューを読む → | AUTOMATIC1111 |
| ComfyUI | 無料 | GPL-3.0 | macOS, Windows, Linux | ローカル | CPUで十分 | v0.36.0 | — | — | — | — | — | はい | レビューを読む → | ComfyUI |
| ControlNet | 無料 | Apache-2.0 | Windows, Linux, macOS | ローカル | VRAM 8 GB | — | — | — | — | — | はい | — | レビューを読む → | ControlNet |
| DiffusionBee | 無料 | AGPL-3.0 | macOS | ローカル | CPUで十分 | — | はい | はい | — | — | — | — | レビューを読む → | DiffusionBee |
| Draw Things | 無料 | Proprietary | macOS, iOS | ローカル | RAM 8 GB | — | — | はい | — | — | — | — | レビューを読む → | Draw Things |
| Fooocus | 無料 | GPL-3.0 | Windows, Linux, macOS | ローカル | CPUで十分 | v2.5.5 | はい | — | — | — | はい | — | レビューを読む → | Fooocus |
| Invoke AI | フリーミアム | Apache-2.0 | Windows, Linux, macOS | ローカル | VRAM 4 GB | — | はい | — | はい | — | — | — | レビューを読む → | Invoke AI |
| Locally Uncensored | 有料 | AGPL-3.0 | Windows | ローカル | モデルにより異なる | — | — | — | — | — | — | — | レビューを読む → | Locally Uncensored |
| Stable Diffusion | 無料 | OpenRAIL | macOS, Windows, Linux | ローカル | VRAM 10 GB | — | — | — | — | — | — | — | レビューを読む → | Stable Diffusion |
| Stable Diffusion WebUI Forge | 無料 | AGPL-3.0 | Linux, macOS, Windows | ローカル | モデルにより異なる | — | — | — | — | はい | — | はい | レビューを読む → | Stable Diffusion WebUI Forge |
| StableSwarmUI | 無料 | MIT | Windows, Linux | ローカル | VRAM 8 GB | — | — | はい | はい | はい | — | — | レビューを読む → | StableSwarmUI |
| ToolNeuron | 無料 | MIT | Android | ローカル | モデルにより異なる | — | — | — | — | — | — | はい | レビューを読む → | ToolNeuron |
「—」は、そのプロジェクト自身のドキュメントに記載がないことを示すもので、機能がないという意味ではありません。値は各プロジェクトの公式READMEまたはサイトから取得し、ツールのレビューを更新する際に再確認しています。
画像・動画生成:違いのポイント
- ワークフローの形式。 ComfyUI、Invoke AI、StableSwarmUIは、ノードベースまたはグラフ形式のワークフローをドキュメントに記載しています。他のツールのドキュメントには、ノードエディタの記述はありません。
- 拡張機能とプラグイン。 AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge、StableSwarmUI、ToolNeuronは、拡張機能またはプラグインの仕組みをドキュメントに記載しています。
- 動画。 ComfyUI、StableSwarmUI、DiffusionBee、Draw Things、Locally Uncensored、AnimateDiffは、動画またはアニメーションの生成をドキュメントに記載しています。
- インペイント。 AUTOMATIC1111、ComfyUI、DiffusionBee、Fooocus、Invoke AIは、インペイントをドキュメントに記載しています。
- 低VRAM動作。 AUTOMATIC1111、Fooocus、ControlNetは、低VRAMモードまたは小さなVRAM要件の明記をドキュメントに記載しています。他のツールについては、必要な容量が読み込むモデルによって変わるため、レビューを確認してください。
- ローカルAPI。 AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge、ToolNeuronは、他のアプリから呼び出せるAPIをドキュメントに記載しています。
- ライセンスと価格。 AUTOMATIC1111、DiffusionBee、Stable Diffusion WebUI Forge、Locally UncensoredはAGPL-3.0、ComfyUIとFooocusはGPL-3.0、AnimateDiff、ControlNet、Invoke AIはApache-2.0、StableSwarmUIとToolNeuronはMIT、Stable DiffusionはOpenRAILライセンスです。Draw Thingsはクローズドソースのアプリ、Locally Uncensoredは有料アプリ、Invoke AIはフリーミアムです。コピーレフト・ライセンスは、改変版を配布する際に条件を課します。詳しくはAIツールのライセンスを解説をご覧ください。
ビジョン・OCR:違いのポイント
- 画像内テキストの読み取り。 LLaVAとOllamaのビジョンモデルは、画像内のテキストの読み取りまたは認識をドキュメントに記載しています。
- 1プロンプトでの複数画像。 Ideficsは、1回のプロンプトで複数の画像を受け付けることをドキュメントに記載しています。
- ローカルAPI。 OllamaのビジョンモデルはローカルAPIをドキュメントに記載しています。IdeficsのドキュメントにあるAPIはローカルではなくホスト型のため、対象に数えていません。
- ライセンス。 LLaVAとIdeficsはApache-2.0です。Ollamaのビジョンモデルはライセンスが異なるモデルの集まりのため、各モデル自身のライセンスを確認してください。
この比較で分からないこと
- この比較はドキュメントに記載された機能を比べるもので、品質は比べていません。画像の出来栄えやテキスト読み取りの精度については何も述べていません。それには、あなた自身のプロンプトとハードウェアでの確認が必要です。
- 速度ベンチマークは含まれていません。PromptQuorumはこれらのツールについて測定していません。
- ダッシュはプロジェクトのドキュメントの空白であり、否定的な結果ではありません。READMEに記載がなくても、その機能に対応しているツールがある可能性があります。
- 編集・アップスケーリング系のツール(Real-ESRGAN、FunClip)とOllama経由のDALL-E 3は、ここでは比較していません。前者の2つは共通点が少なすぎて比較できず、後者には独自のPromptQuorumレビューがないためです。
- ツールは急速に変化します。各ツールのレビューには確認したバージョンが記載されており、このガイドはレビューが更新されるときに合わせて更新されます。
よくある質問
画像生成とビジョンモデルを別々に比較するのはなぜですか?
両者は異なる役割を持つため、ほとんどの属性は1つの役割の中でしか意味を持ちません。インペイントは画像生成に、画像内テキストの読み取りはビジョンモデルに当てはまります。1つの表にまとめると、ほとんどのセルが空になるか意味を成さなくなります。
比較表のダッシュは何を意味しますか?
プロジェクト自身のドキュメントにその属性の記載がないことを意味します。機能がないという意味ではありません。ツールのレビューまたはリポジトリで確認してください。
Stable Diffusion自体はアプリですか?
Stable Diffusionはアプリではなく、画像モデルのファミリーです。独自のPromptQuorumレビューがあるため、アプリと並べて掲載しています。ここにある生成ツールの多くは、Stable Diffusionのモデルを実行できます。
これらのツールにアフィリエイトリンクはありますか?
いいえ。執筆時点で、PromptQuorumはこの比較に含まれるどのツールともアフィリエイト関係になく、ここにあるリンクで報酬が発生することもありません。
この比較はどのくらいの頻度で更新されますか?
年2回、および掲載ツールのレビューが更新されるたびに更新されます。表がそれらのレビューと同じデータから生成されているためです。
出典
- 各ツールの公式READMEまたはウェブサイト。そのツールのPromptQuorumレビューに記載(比較表からリンク)。
- PromptQuorumローカルAIアプリディレクトリ — 表の各行の生成元となるレコード。
- AIツールのライセンスを解説 — 上で挙げたライセンスの系統の意味。