Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/ローカル画像・動画・ビジョンツール比較(2026):生成、ビジョン、OCR
Image & Video Generation

ローカル画像・動画・ビジョンツール比較(2026):生成、ビジョン、OCR

·9分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

PromptQuorumディレクトリにある16のローカル画像ツールは、別々に比較すべき2つの役割に分かれます。画像・動画生成(13ツール)と、ビジョン・OCR(3ツール)です。 生成系では、ComfyUI、InvokeAI、StableSwarmUIがノードベースのワークフローを、AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge、StableSwarmUI、ToolNeuronが拡張機能の仕組みを、AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge、ToolNeuronがローカルAPIをそれぞれドキュメントに記載しています。ビジョン系では、LLaVAが画像内のテキスト読み取りを、Ideficsが1回のプロンプトで複数画像を扱えることを記載しています。下の比較表を使い、インストール前に各ツールのレビューを読んでください。

ローカルの画像ツールには2つの異なる役割があります。プロンプトから画像や動画を生成することと、与えた画像を理解することです。単一の機能一覧では、両者を公平に比較できません。このガイドでは、自分のハードウェア上で動作する無料・有料の16ツールを、役割ごとに比較します。比較表は各ツールのPromptQuorumレビューと同じデータから生成されているため、表とレビューが食い違うことはありません。

このページには参考用の第三者製品へのリンクが含まれています。PromptQuorumはいかなるアフィリエイトプログラムにも参加しておらず、これらはコミッションを得ない単なる参照リンクです。リンクのクリックと次のステップはご自身の責任です。これらのリンクはPromptQuorumによる推奨や検証を表すものではありません。

重要なポイント

  • 16ツール、2つの役割:画像・動画生成(13)とビジョン・OCR(3)。
  • 表は各ツールのレコードから生成され、公式のREADMEまたはサイトと照合済みです。ダッシュは「ドキュメントに記載なし」を意味し、「なし」を意味しません。
  • ライセンスには重要な違いがあります。たとえば、AUTOMATIC1111、DiffusionBee、Stable Diffusion WebUI Forge、Locally UncensoredはAGPL-3.0、ComfyUIとFooocusはGPL-3.0、AnimateDiff、ControlNet、InvokeAIはApache-2.0、StableSwarmUIとToolNeuronはMIT、Stable DiffusionはOpenRAILライセンスです。
  • 表のツール名はいずれも、そのツール自身のPromptQuorumレビューにリンクしており、インストール手順と制限事項はそちらで扱っています。

📍 一文で説明

ローカル画像ツールは、画像・動画の生成と画像の理解という2つの異なる役割に分かれるため、PromptQuorumディレクトリの16ツールは役割ごとに比較しており、その表は各ツールのレビューと同じツールデータから生成されています。

💬 簡潔に説明

テキストのプロンプトから絵を描くツールもあれば、画像を見てそれについての質問に答えるツールもあります。絵を描くツールと画像を読み取るモデルを「インペイント」で比べても意味がないため、このガイドでは同じ種類どうしを比較します。

比較の方法

各ツールの事実情報(価格、ライセンス、対応プラットフォーム、必要なハードウェア、カテゴリ固有の属性)は、そのツールのディレクトリレコードに1か所だけ保存されています。下の比較表はそれらのレコードから生成され、ツール自身のレビューも同じレコードを参照するため、両者が異なる値を示すことはありません。

カテゴリ固有の属性(たとえばインペイントや拡張機能のサポート)は、各プロジェクトの公式READMEまたはウェブサイトから取得し、そこでの正確な表現と照合しました。ドキュメントに記載がない場合は、推測せず表にダッシュを表示します。記述に条件が付く場合(実験的、フォークに依存、ローカル機能ではなくホスト型サービスなど)は、その属性を表から外し、ツールのレビューで扱います。

表に載せているのは、独自のPromptQuorumレビューがあるツールだけです。この比較は自分のハードウェアで動作するツールを一覧にしたもので、順位付けはしません。適したツールは、あなたの制約条件によって変わるためです。

比較表

下から役割を選び、行に沿って読んでください。ツール名をクリックすると、PromptQuorumの詳細レビューが開きます。

ツール価格ライセンスプラットフォーム動作環境ハードウェアバージョンインペイント動画生成ノード/グラフ型ワークフローエディタ拡張機能/プラグイン低VRAMモードローカルAPIサーバーレビュー製品リンク · 開示済み
AnimateDiff無料Apache-2.0Windows, Linux, macOSローカルVRAM 13 GBはいレビューを読むAnimateDiff
AUTOMATIC1111無料AGPL-3.0macOS, Windows, LinuxローカルCPUで十分v1.10.1はいはいはいはいレビューを読むAUTOMATIC1111
ComfyUI無料GPL-3.0macOS, Windows, LinuxローカルCPUで十分v0.36.0はいレビューを読むComfyUI
ControlNet無料Apache-2.0Windows, Linux, macOSローカルVRAM 8 GBはいレビューを読むControlNet
DiffusionBee無料AGPL-3.0macOSローカルCPUで十分はいはいレビューを読むDiffusionBee
Draw Things無料ProprietarymacOS, iOSローカルRAM 8 GBはいレビューを読むDraw Things
Fooocus無料GPL-3.0Windows, Linux, macOSローカルCPUで十分v2.5.5はいはいレビューを読むFooocus
Invoke AIフリーミアムApache-2.0Windows, Linux, macOSローカルVRAM 4 GBはいはいレビューを読むInvoke AI
Locally Uncensored有料AGPL-3.0Windowsローカルモデルにより異なるレビューを読むLocally Uncensored
Stable Diffusion無料OpenRAILmacOS, Windows, LinuxローカルVRAM 10 GBレビューを読むStable Diffusion
Stable Diffusion WebUI Forge無料AGPL-3.0Linux, macOS, Windowsローカルモデルにより異なるはいはいレビューを読むStable Diffusion WebUI Forge
StableSwarmUI無料MITWindows, LinuxローカルVRAM 8 GBはいはいはいレビューを読むStableSwarmUI
ToolNeuron無料MITAndroidローカルモデルにより異なるはいレビューを読むToolNeuron

「—」は、そのプロジェクト自身のドキュメントに記載がないことを示すもので、機能がないという意味ではありません。値は各プロジェクトの公式READMEまたはサイトから取得し、ツールのレビューを更新する際に再確認しています。

画像・動画生成:違いのポイント

  • ワークフローの形式。 ComfyUIInvoke AIStableSwarmUIは、ノードベースまたはグラフ形式のワークフローをドキュメントに記載しています。他のツールのドキュメントには、ノードエディタの記述はありません。
  • 拡張機能とプラグイン。 AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge、StableSwarmUI、ToolNeuronは、拡張機能またはプラグインの仕組みをドキュメントに記載しています。
  • 動画。 ComfyUI、StableSwarmUI、DiffusionBeeDraw ThingsLocally UncensoredAnimateDiffは、動画またはアニメーションの生成をドキュメントに記載しています。
  • インペイント。 AUTOMATIC1111、ComfyUI、DiffusionBee、Fooocus、Invoke AIは、インペイントをドキュメントに記載しています。
  • 低VRAM動作。 AUTOMATIC1111、Fooocus、ControlNetは、低VRAMモードまたは小さなVRAM要件の明記をドキュメントに記載しています。他のツールについては、必要な容量が読み込むモデルによって変わるため、レビューを確認してください。
  • ローカルAPI。 AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge、ToolNeuronは、他のアプリから呼び出せるAPIをドキュメントに記載しています。
  • ライセンスと価格。 AUTOMATIC1111、DiffusionBee、Stable Diffusion WebUI Forge、Locally UncensoredはAGPL-3.0、ComfyUIとFooocusはGPL-3.0、AnimateDiff、ControlNet、Invoke AIはApache-2.0、StableSwarmUIとToolNeuronはMIT、Stable DiffusionはOpenRAILライセンスです。Draw Thingsはクローズドソースのアプリ、Locally Uncensoredは有料アプリ、Invoke AIはフリーミアムです。コピーレフト・ライセンスは、改変版を配布する際に条件を課します。詳しくはAIツールのライセンスを解説をご覧ください。

ビジョン・OCR:違いのポイント

  • 画像内テキストの読み取り。 LLaVAOllamaのビジョンモデルは、画像内のテキストの読み取りまたは認識をドキュメントに記載しています。
  • 1プロンプトでの複数画像。 Ideficsは、1回のプロンプトで複数の画像を受け付けることをドキュメントに記載しています。
  • ローカルAPI。 OllamaのビジョンモデルはローカルAPIをドキュメントに記載しています。IdeficsのドキュメントにあるAPIはローカルではなくホスト型のため、対象に数えていません。
  • ライセンス。 LLaVAとIdeficsはApache-2.0です。Ollamaのビジョンモデルはライセンスが異なるモデルの集まりのため、各モデル自身のライセンスを確認してください。

この比較で分からないこと

  • この比較はドキュメントに記載された機能を比べるもので、品質は比べていません。画像の出来栄えやテキスト読み取りの精度については何も述べていません。それには、あなた自身のプロンプトとハードウェアでの確認が必要です。
  • 速度ベンチマークは含まれていません。PromptQuorumはこれらのツールについて測定していません。
  • ダッシュはプロジェクトのドキュメントの空白であり、否定的な結果ではありません。READMEに記載がなくても、その機能に対応しているツールがある可能性があります。
  • 編集・アップスケーリング系のツール(Real-ESRGAN、FunClip)とOllama経由のDALL-E 3は、ここでは比較していません。前者の2つは共通点が少なすぎて比較できず、後者には独自のPromptQuorumレビューがないためです。
  • ツールは急速に変化します。各ツールのレビューには確認したバージョンが記載されており、このガイドはレビューが更新されるときに合わせて更新されます。

よくある質問

画像生成とビジョンモデルを別々に比較するのはなぜですか?

両者は異なる役割を持つため、ほとんどの属性は1つの役割の中でしか意味を持ちません。インペイントは画像生成に、画像内テキストの読み取りはビジョンモデルに当てはまります。1つの表にまとめると、ほとんどのセルが空になるか意味を成さなくなります。

比較表のダッシュは何を意味しますか?

プロジェクト自身のドキュメントにその属性の記載がないことを意味します。機能がないという意味ではありません。ツールのレビューまたはリポジトリで確認してください。

Stable Diffusion自体はアプリですか?

Stable Diffusionはアプリではなく、画像モデルのファミリーです。独自のPromptQuorumレビューがあるため、アプリと並べて掲載しています。ここにある生成ツールの多くは、Stable Diffusionのモデルを実行できます。

これらのツールにアフィリエイトリンクはありますか?

いいえ。執筆時点で、PromptQuorumはこの比較に含まれるどのツールともアフィリエイト関係になく、ここにあるリンクで報酬が発生することもありません。

この比較はどのくらいの頻度で更新されますか?

年2回、および掲載ツールのレビューが更新されるたびに更新されます。表がそれらのレビューと同じデータから生成されているためです。

出典

← ローカルLLM活用 に戻る