重要なポイント
- Stable Diffusionはオープンウェイトのテキストto画像モデルファミリーであり、単体アプリではない——ローカル実行には別のUI(AUTOMATIC1111、ComfyUI、InvokeAI、Fooocus)が必要。
- 2022年8月22日、Stability AI、ミュンヘン大学のCompVis研究グループ、Runway MLが共同で初めて公開した。学習データの一部にはLAION-5B画像データセットが使われた。
- ライセンス条件はバージョンによって異なる:SD 1.5/2.1/SDXLはCreativeML Open RAIL-M / RAIL++-Mライセンス(商用利用可、収益上限なし)。SD 3/3.5はStability AI Community License(年間収益100万ドル未満なら登録制で無料、それ以上はEnterpriseライセンスが必要)。
- ハードウェア要件はバージョンごとに変わる:SD 1.5は4GB VRAMで動作、SDXLは8〜12GB、SD 3.5 Largeは精度により約12〜16GBが必要。
- 該当ライセンスの下で自前ホストは無料。Stability AIは自前GPUを持たない読者向けに、ホスト型APIクレジットと有料メンバーシップを別途販売している。
- 2026年時点でFLUX(Black Forest Labs)がフォトリアリズムとプロンプト忠実度で一般的にリードするが、Stable Diffusionはエコシステムの深さ——コミュニティのチェックポイント、LoRA、ControlNetツールの数——で依然としてリードしている。
Stable Diffusionとは
Stable Diffusionは潜在拡散モデル(LDM)です。フル解像度のピクセルを直接扱う代わりに、テキストプロンプトに導かれて、画像の圧縮表現からノイズを段階的に除去することで画像を生成します。これにより、データセンター向けハードウェアではなく、コンシューマー向けGPUで動作できます。
このモデルは、Björn Ommer教授が率いるミュンヘン大学のCompVis(Computer Vision & Learning)研究グループによって開発され、後にStability AIに参加するRobin Rombachと、Runway MLのPatrick Esserが基盤となる潜在拡散アーキテクチャの主要な研究者でした。Stability AIが計算資源に資金を提供し、2022年8月22日にCompVisとRunway MLとともに最初の公開バージョンを共同リリースしました。
初期バージョンの学習データは、ドイツの非営利団体LAIONが構築した大規模な公開画像テキストデータセットであるLAION-5Bの一部を使用しています。これは、Stable Diffusionに限らず、大規模画像モデルの多くに関わる学習データの同意をめぐる進行中の法的・倫理的議論に関連する重要な点です。
重要な点として、「Stable Diffusion」はモデルの重みと推論コードを指し、完成したアプリケーションではありません。 実際にプロンプトを入力して画像を見るには、UIが必要です。最も広く使われている選択肢は、AUTOMATIC1111のStable Diffusion WebUI、ComfyUI(ノードベース、より高い制御性)、InvokeAI(洗練されたプロフェッショナル向けUI)、Fooocus(簡素化、最初の画像までのクリック数が最少)です。PromptQuorumはこれらのUIをそれぞれ別記事でレビューする予定です。本記事では基盤となるモデル自体に焦点を当てます。
📍 一文で説明
Stable Diffusionは、テキストプロンプトを画像に変換するオープンウェイトの潜在拡散モデルであり、消費者向けアプリではなく、ダウンロード可能なモデルファイルとコードとして配布される。
💬 簡潔に説明
車ではなくエンジンだと考えてください——Stable Diffusionは画像を生成しますが、プロンプトを入力して結果を見るには、依然としてダッシュボード(AUTOMATIC1111、ComfyUI、InvokeAI、Fooocus)が必要です。
Stable Diffusionのバージョン履歴
SD 1.4 / SD 1.5
- リリース時期:
- 2022年8〜10月
- ライセンスファミリー:
- CreativeML Open RAIL-M
- 主な変更点:
- 最初に広く採用された公開版。今なお数千のコミュニティチェックポイントの基盤
SD 2.0 / SD 2.1
- リリース時期:
- 2022年11〜12月
- ライセンスファミリー:
- CreativeML Open RAIL++-M
- 主な変更点:
- 新しいテキストエンコーダ(OpenCLIP)を採用。1.5のチェックポイントエコシステムに比べ評価は分かれた
SDXL 1.0
- リリース時期:
- 2023年7月
- ライセンスファミリー:
- CreativeML Open RAIL++-M
- 主な変更点:
- より大規模なベースモデル(約35億パラメータ)。1024×1024でより鮮明なディテールと構図
SD 3 Medium
- リリース時期:
- 2024年6月(重み公開)
- ライセンスファミリー:
- Stability AI Community License
- 主な変更点:
- 新しいマルチモーダル拡散トランスフォーマー(MMDiT)アーキテクチャ。テキスト描画とプロンプト忠実度が向上
SD 3.5(Large、Large Turbo、Medium)
- リリース時期:
- 2024年10月
- ライセンスファミリー:
- Stability AI Community License
- 主な変更点:
- Large(80億パラメータ)は画質と多様性を向上。Large Turboは4ステップ生成の速度と引き換えに画質を一部犠牲に。Medium(25億)はVRAMの少ないハードウェア向け
バージョンのリリース日とパラメータ数はStability AIおよび第三者ソースにより広く報告されている。技術仕様として引用する前に、Stability AIで正確な数値と新しいリリースを確認すること。最終確認日:2026-09-05。
Stable Diffusionをローカルで実行する方法
自分のGPUでStable Diffusionを実行する基本的な流れは、最終的にどのUIを選んでも同じです。
- 1GPUのVRAMを確認する
Why it matters: 希望するバージョンに十分なVRAMがGPUにあるか確認する(下記のハードウェア表を参照)。これにより実際に実行可能なStable Diffusionのバージョンと精度が決まる。 - 2フロントエンドUIをインストールする
Why it matters: AUTOMATIC1111のStable Diffusion WebUI、ComfyUI、InvokeAI、Fooocusのいずれかをダウンロードする。Stable Diffusion自体には専用インストーラーがないため、このステップは必須である。 - 3モデルの重みをダウンロードする
Why it matters: 希望するバージョン(SD 1.5、SDXL、SD 3.5など)のチェックポイントファイルを[Hugging Face](https://huggingface.co/stabilityai)やStability AIのサイトなどから取得し、ダウンロード前に用途に応じたライセンス条件を確認する。 - 4チェックポイントをUIのモデルフォルダに配置する
Why it matters: 各UIは起動時にチェックポイントを検出・読み込みできるよう、特定のディレクトリにモデルファイルを配置することを想定している(そのUI自体のセットアップガイドに記載)。 - 5プロンプトを書いて生成する
Why it matters: テキストプロンプトを入力し、解像度とサンプリングステップを設定して生成する。初回実行はモデルがVRAMに読み込まれるため通常より遅くなる。 - 6慣れたらオプションの拡張機能を追加する
Why it matters: LoRA(軽量なスタイル/被写体の微調整)、ControlNet(ポーズと構図の誘導)、カスタムチェックポイントは、ベースモデルの上に重ねるコミュニティ製の追加要素であり、Stable Diffusion自体の一部ではない。
Stable Diffusionのライセンスと商用利用条件
この違いは、生成した画像を商用製品で利用する予定のあるすべての人にとって重要です。SD 1.5、SD 2.1、SDXLに適用される旧来のCreativeML Open RAIL-M / RAIL++-Mライセンスは、収益上限なしで商用利用を許可しています——その制限は収益ベースではなく用途ベース(有害・違法・非人間化コンテンツの生成禁止)であり、派生した微調整モデルも同じ制限を引き継ぐ必要があります。
一方、SD 3とSD 3.5は、より新しいStability AI Community Licenseの下で提供されています。Hugging Faceに公開されているライセンス文書によると、商用または組織的な利用にはStability AIへの登録が必要であり、自社および関連会社の年間収益が合計100万ドルを超えた場合、契約に基づき付与されたライセンスは終了し、Stability AIにEnterpriseライセンスを申請する必要があります。これはStability AIの裁量により、別途交渉された条件で付与されます。
SD 3/3.5の非商用利用および研究利用には、Community Licenseの下での登録は不要です。別途、Stability AIはホスト型APIとツール向けにメンバーシッププログラム(Non-Commercial、Professional、Enterprise)も運営していますが、これは上記の自前ホストのライセンス条件とは別の商用サービスであり、両方の条件は変更される可能性があります。ビジネス上の判断を下す前に、stability.aiで最新の文言を直接確認してください。
📍 一文で説明
Stable Diffusionのライセンス条件はバージョンによって異なる。SD 1.5/2.1/SDXLは商用収益上限のないCreativeML Open RAIL-Mライセンスを採用し、SD 3とSD 3.5はStability AI Community Licenseを採用しており、年間収益100万ドル未満の組織のみ無料となる。
💬 簡潔に説明
旧バージョンのStable Diffusionは、コンテンツ悪用の制限以外に条件のない商用利用フレンドリーなライセンスだが、最新バージョンは大企業に有料のEnterpriseライセンスを求める。
SD 1.5、SD 2.1、SDXL 1.0
- ライセンス:
- CreativeML Open RAIL-M / RAIL++-M
- 商用利用:
- 許可、収益しきい値なし
- 重要な条件:
- 有害・違法・明らかに誤った表現を生成する用途は禁止(用途ベースの制限)。派生モデルは同じ制限を引き継ぐ必要がある
SD 3、SD 3.5(全バリエーション)
- ライセンス:
- Stability AI Community License
- 商用利用:
- 年間収益100万米ドル未満(自社および関連会社合算)であれば無料
- 重要な条件:
- 商用利用にはStability AIへの登録が必須。100万ドルのしきい値を超えるとライセンスが終了し、別途Enterpriseライセンスが必要になる
ライセンス条件はマーケティング文言ではなく法的な文書です——このセクションは2026-09-05時点で公開されている条件の要約であり、法的助言ではありません。商用展開の前に、利用予定のバージョンの実際のライセンスファイル(各モデルのHugging FaceページにあるLICENSE.mdなど)を読んでください。
バージョン別ハードウェア要件
SD 1.5
- 最小VRAM:
- 4 GB VRAM
- 快適なVRAM:
- 8 GB VRAM
- 備考:
- この10年のほとんどのGPUで動作。全バージョン中最大のチェックポイント/LoRAエコシステム
SDXL 1.0
- 最小VRAM:
- 8 GB VRAM(メモリ最適化あり)
- 快適なVRAM:
- 12〜16 GB VRAM
- 備考:
- ネイティブ1024×1024出力向けに設計。SD 1.5より1枚あたり遅く重い
SD 3.5 Medium
- 最小VRAM:
- 約6 GB VRAM(FP16)
- 快適なVRAM:
- 8〜10 GB VRAM
- 備考:
- SD 3.5の最小バリアント(25億パラメータ)、VRAMの少ないハードウェア向け
SD 3.5 Large / Large Turbo
- 最小VRAM:
- 約11 GB VRAM(FP8)
- 快適なVRAM:
- 16 GB以上VRAM(FP16)
- 備考:
- 80億パラメータ。Large Turboは4ステップ生成の速度と引き換えに画質を一部犠牲にする
正確なVRAM使用量は解像度、バッチサイズ、精度(FP16 vs. FP8/量子化)、および使用するUIで有効化される最適化(アテンションスライシング、モデルオフロードなど)に依存する。これらは計画の目安であり保証ではないため、使用するUIの最新ドキュメントを確認すること。
料金:無料の自前ホスト vs. Stability AIのホスト型プラン
Stable Diffusionの自前ホストは無料です——支払うのは自分のハードウェアと電気代のみで、選んだバージョンに適用されるライセンス(上記のライセンスセクション参照)に従います。 PromptQuorumが把握している限り、重みを自分でダウンロードして実行することに費用はかかりません。ローカルでのオフライン生成にサブスクリプションは不要です。
Stability AIは、自前のGPUを持ちたくない読者向けに、ホスト型アクセスを別途販売しています:無料のNon-Commercialメンバーシップ(個人・研究用途向け)、月額課金のProfessional(自前ホストの商用利用とホスト型APIアクセスを可能にする)、そしてCommunity Licenseの収益しきい値を超える大規模組織向けの個別見積もりのEnterpriseです。Stability AIは、サブスクリプションなしで従量課金のAPIクレジットも提供しています。
Stable Diffusion vs. 代替ツール
Stable Diffusion(AUTOMATIC1111/ComfyUI経由)
- 最適な用途:
- 最大のチェックポイント/LoRA/ControlNetエコシステム、完全なローカル制御
- 自前ホスト可否:
- 可能——無料、自分のGPU
- ライセンス/コスト:
- RAIL-M(SD 1.5/2.1/SDXL、上限なし)またはCommunity License(SD 3/3.5、年収100万ドル未満で無料)
- 重要なトレードオフ:
- 別のUIが必要。新バージョンは商用利用にライセンス登録が必要
FLUX(Black Forest Labs)
- 最適な用途:
- 標準設定でのフォトリアリズムとプロンプト忠実度
- 自前ホスト可否:
- 可能——無料、自分のGPU
- ライセンス/コスト:
- FLUX.1 schnellはApache 2.0(制限なし)。FLUX dev/Kontextは商用利用に有料ライセンスが必要
- 重要なトレードオフ:
- Stable Diffusionよりコミュニティエコシステムが小さい。ライセンスはバリアントごとに大きく異なる
コミュニティSDXLチェックポイント(Civitaiでホストされるフォーク、Pony Diffusion、Juggernaut XLなど)
- 最適な用途:
- プロンプトを工夫せずスタイル特化(アニメ、イラスト、特定のフォトリアリズム調)の結果を得る
- 自前ホスト可否:
- 可能——ベースのStable Diffusionと同じUI
- ライセンス/コスト:
- チェックポイントごとに異なる——多くはRAIL++-Mの条件を引き継ぐが、独自の制限を追加するものもある
- 重要なトレードオフ:
- 品質とライセンスの明確さはコミュニティ制作者ごとに異なる。各チェックポイントのライセンスページを確認すること
Midjourney
- 最適な用途:
- 最小限のプロンプト労力で得られる独特のデフォルト美観、Discord/Webワークフロー
- 自前ホスト可否:
- 不可——クラウドのみ、サブスクリプション必須
- ライセンス/コスト:
- 有料サブスクリプション階層
- 重要なトレードオフ:
- ローカルのプライバシーやオフライン利用なし。ベースモデルの自前ホストや微調整は不可
DALL-E 3(ChatGPT/API経由)
- 最適な用途:
- シンプルなプロンプトへの高い指示追従性、ChatGPTとの統合
- 自前ホスト可否:
- 不可——クラウドのみ
- ライセンス/コスト:
- ChatGPT Plus/Proに含まれる、または従量課金API
- 重要なトレードオフ:
- オフライン利用不可、微調整不可、チェックポイントエコシステムなし
Adobe Firefly
- 最適な用途:
- 企業・クリエイティブチーム向けの商用に安全な学習データ保証
- 自前ホスト可否:
- 不可——クラウドのみ
- ライセンス/コスト:
- サブスクリプション、Creative Cloudにバンドルまたは単体
- 重要なトレードオフ:
- ローカル制御や自前ホストなし。柔軟性を犠牲にして補償とAdobeアプリ統合を得る
これはポジショニングの要約であり、ベンチマークによる順位付けではない——ライセンスとVRAMの詳細についてFLUX、SD 3.5、Qwen-Imageをより深く比較したローカルAI画像生成 vs. クラウドを参照。
Stable Diffusionが向いている人
- 最大のローカル画像モデルエコシステムを求める読者。 他のどのオープン画像モデルも、これほど多くのコミュニティチェックポイント、LoRA、ControlNet統合を持っていない。
- UIのインストールに抵抗がない読者。 すでにAUTOMATIC1111、ComfyUI、InvokeAI、Fooocusのいずれかをセットアップする意志があれば、Stable Diffusionは読み込める事前学習済みスタイルと微調整モデルの最も幅広い選択肢を提供する。
- 完全なローカル制御とプライバシーを求める読者。 ダウンロード後、生成はすべて自分のGPU上で行われる——画像もプロンプトも自分のマシンの外に出ない。
- 年間収益100万ドル未満の小規模事業者や個人。 旧バージョンのRAIL-Mライセンスも、SD 3/3.5のCommunity License(無料登録あり)も、この規模であればサブスクリプションなしで商用利用を認めている。
- 独自のスタイルを微調整したい趣味の人やアーティスト。 Stable Diffusionのチェックポイント・LoRAトレーニングエコシステムの規模と成熟度は、個人向けスタイルモデルを訓練する上で最もドキュメントが充実した選択肢となっている。
Stable Diffusionが向いていない人
- セットアップ不要のワンクリックアプリを求める読者。 Stable Diffusionは重みとコードであり、アプリではない——まず別のUIをインストールして設定する必要がある。まったくセットアップを望まない読者は、MidjourneyやDALL-E 3のようなクラウドツールを検討すべき。
- VRAMが少なく、最適化に手間をかける余裕がない読者。 SDXLとSD 3.5 Largeはそれぞれ8GB以上、12〜16GB以上のVRAMを必要とする。古いGPUや統合GPUを使う読者は、量子化/最適化ビルドが必要になるか、SD 1.5にとどまるか、クラウド代替を利用すべき。
- SD 3またはSD 3.5の利用を計画している、年間収益100万ドルを超える組織。 Community Licenseはそのラインを超えるとStability AIからのEnterpriseライセンスを要求する——その交渉を予算に組み込むか、用途に合えば旧来のRAIL-Mライセンスのバージョンを使うこと。
- 最小限のプロンプト労力で最高のフォトリアリズムを求める読者。 2026年のコミュニティ報告や比較では、デフォルト設定でのフォトリアリズムとプロンプト忠実度において一般的にFLUXがベースのStable Diffusionより高く評価されているが、微調整されたStable Diffusionチェックポイントは特定のスタイルにおいてその差を大きく縮められる。
- 学習データに関する主張に対する補償を必要とする企業チーム。 Stable Diffusionの学習データは公開のLAION-5Bデータセットなどに基づいている。このリスクに対する契約上の補償が必要なチームは、代わりにAdobe Fireflyを検討すべき。
よくある質問
Stable Diffusionは無料ですか?
はい、自前ホストであれば無料です。モデルの重みとコードはHugging FaceとGitHubから無料でダウンロードでき、自分のGPUで実行するのに自分のハードウェアと電気代以外の費用はかかりません。Stability AIは、自前のGPUを持たない読者向けに、ホスト型メンバーシップと従量課金のAPIクレジットを別途販売しています——最新のプラン名と価格はstability.aiで確認してください。
Stable Diffusionを実行するには特別なアプリが必要ですか?
はい。Stable Diffusionはモデルの重みと推論コードとして配布されており、単体のアプリケーションではありません。実際にプロンプトを入力して画像を生成するには、AUTOMATIC1111のStable Diffusion WebUI、ComfyUI、InvokeAI、Fooocusなど、別のフロントエンドUIを自分のマシンにインストールする必要があります。
Stable Diffusionの画像を商用利用できますか?
バージョンによります。SD 1.5、SD 2.1、SDXLで生成した画像は、収益上限なしで商用利用を許可するCreativeML Open RAIL-M / RAIL++-Mライセンス(用途ベースのコンテンツ制限あり)の対象です。SD 3またはSD 3.5で生成した画像は、商用利用にStability AIへの登録を要求するStability AI Community Licenseの対象で、組織の年間収益合計が100万米ドル未満である間のみ無料です——それを超えるとStability AIのEnterpriseライセンスが必要になります。
Stable Diffusionを作ったのは誰ですか?
Stable Diffusionは2022年8月22日、計算資源に資金を提供したStability AI、Björn Ommer教授が率いるミュンヘン大学のCompVis研究グループ、Runway MLの共同プロジェクトとして初めて公開されました。Robin RombachとPatrick Esserは、基盤となる潜在拡散アーキテクチャの主要な研究者の一部でした。初期バージョンの学習データは、非営利団体LAIONが構築したLAION-5Bデータセットの一部を使用しています。
Stable Diffusionにはどれくらいのvramが必要ですか?
バージョンによります。SD 1.5はわずか4GBのVRAMで動作し、SDXLは快適な利用に約8〜12GB、SD 3.5 Mediumは約6〜10GB、SD 3.5 Largeは約11GB(FP8)から16GB以上(FP16)を必要とします。正確な使用量は解像度、バッチサイズ、使用するUIが有効化する最適化によって異なります。
Stable Diffusionはどこでダウンロードできますか?
公式のモデル重みは、stabilityai組織の下でHugging Faceに公開されており、元の研究用コードはGitHubのstability-ai/stablediffusionとstability-ai/generative-modelsにあります。ダウンロードした重みを読み込んで実行するには、AUTOMATIC1111、ComfyUI、InvokeAI、Fooocusなどの別のUIが別途必要です。
Stable DiffusionはFLUXやMidjourneyより優れていますか?
何を重視するかによります。2026年時点で、標準設定でのフォトリアリズムとプロンプト忠実度では一般的にFLUXがリードしており、Midjourneyは最小限のプロンプト労力で独特なデフォルト美観を出すことで知られていますが、どちらも自分のハードウェアで自前ホストすることはできません。Stable Diffusionの強みはオープンエコシステムの規模にあります——どのローカル画像モデルファミリーよりも多いコミュニティチェックポイント、LoRA微調整、ControlNetツール——に加え、完全なローカル制御と、旧バージョンでは商用収益の上限がないことです。
SD 1.5、SDXL、SD 3.5の違いは何ですか?
SD 1.5(2022年)は最小・最軽量で、コミュニティチェックポイントのエコシステムが群を抜いて最大です。SDXL(2023年)はより大きなベースモデルで、より鮮明なディテールとネイティブ1024×1024出力向けに作られています。SD 3.5(2024年)は新しいマルチモーダル拡散トランスフォーマーアーキテクチャを採用し、テキスト描画とプロンプト忠実度が向上していますが、1.5、2.1、SDXLで使われていた旧来のRAIL-Mライセンスではなく、Stability AI Community Licenseに切り替わっています。
自分のStable Diffusionモデルを微調整できますか?
はい。Stable Diffusionを基にLoRA(軽量なスタイル/被写体の微調整)や完全なカスタムチェックポイントを訓練することは、オープンソース画像生成コミュニティで最もよくドキュメント化されたワークフローの一つであり、この目的専用に作られたツールによって支えられています。得られた微調整モデルは、訓練元のベースモデルのライセンス制限を引き継ぎます。
総評
Stable Diffusionは、ローカルでオープンな画像生成の基盤としての地位を確立しています。それは、単一のバージョンが今日最高の性能を持つからではなく、2022年以降に周囲に築かれたエコシステムの深さゆえです。AUTOMATIC1111、ComfyUI、InvokeAI、Fooocusのようなuiをインストールする意志のある読者は、どのローカル画像モデルよりも大きなコミュニティチェックポイント、LoRA微調整、ControlNetツールのライブラリにアクセスでき、自分のハードウェアとデータに対する完全な制御を得られます。トレードオフは現実的です。ワンクリックアプリではなく、ハードウェア要件はバージョンによって大きく変わり、ライセンスは完全にオープンなCreativeML Open RAIL-M(SD 1.5/2.1/SDXL)から収益に応じて段階が変わるStability AI Community License(SD 3/3.5)へと移行しました——これは商用展開の前に確認する価値のある違いです。最高のフォトリアリズムを標準設定で求める読者はFLUXも評価すべきであり、まったくセットアップを望まない読者はMidjourneyやAdobe Fireflyのようなクラウドツールを検討すべきです。画像生成を自前でホストし、周辺の最大級のツールセットの恩恵を受けたいすべての人にとって、Stable Diffusionは依然として妥当な出発点です。
出典
- Stability AI — Community License — SD 3およびSD 3.5に適用されるStability AI Community Licenseの公式発表と条件。
- Stability AI — 公式サイト — 製品ページ、メンバーシップ階層、最新のAPI料金。
- Stable Diffusion 3.5 Large — Hugging FaceのLICENSE.md — 100万ドルの収益しきい値を含むCommunity Licenseの完全な法的文書。
- CreativeML Open RAIL-Mライセンス — CompVis/stable-diffusion GitHub — SD 1.xおよびSD 2.xを対象とするライセンスの完全な法的文書。
- Hugging Face上のStability AIモデル — 全Stable Diffusionバージョンの公式重み。
- GitHub上のstability-ai/stablediffusion — 元の研究用コードリポジトリ。
- GitHub上のstability-ai/generative-models — SD 3.xを含むStability AIの現行の生成モデルコードベース。
