关键要点
- Stable Diffusion是一系列开放权重的文生图模型,不是独立应用程序——本地运行需要单独的界面(AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus)。
- 它于2022年8月22日首次公开发布,由Stability AI、慕尼黑大学CompVis研究组和Runway ML联合完成,部分训练数据来自LAION-5B图像数据集。
- 各版本许可条款不同:SD 1.5/2.1/SDXL采用CreativeML Open RAIL-M / RAIL++-M许可证(允许商业用途,无收入上限);SD 3/3.5采用Stability AI Community License(年收入低于100万美元并注册可免费,超出则需企业级许可证)。
- 硬件需求随版本变化:4GB VRAM即可运行SD 1.5,SDXL需要8-12GB,SD 3.5 Large根据精度大约需要12-16GB。
- 在适用许可证下自行部署是免费的;Stability AI单独出售托管API积分和付费会员方案,供没有自有GPU的读者使用。
- 截至2026年,FLUX(Black Forest Labs出品)在写实感和提示词遵循度上通常领先;而Stable Diffusion在生态系统深度上仍然领先——拥有数量最多的社区检查点(checkpoint)、LoRA和ControlNet工具。
Stable Diffusion是什么
Stable Diffusion是一种潜在扩散模型(LDM):它通过在文本提示的引导下,逐步从图像的压缩表示中去除噪声来生成图像,而不是直接处理全分辨率像素。这正是它能在消费级GPU上运行,而无需数据中心级硬件的原因。
该模型由慕尼黑大学CompVis(计算机视觉与学习)研究组开发,负责人为Björn Ommer教授,Robin Rombach(后加入Stability AI)和Patrick Esser(Runway ML)是底层潜在扩散架构的核心研究者。Stability AI资助了算力,并于2022年8月22日与CompVis和Runway ML共同发布了首个公开版本。
早期版本的训练数据部分使用了LAION-5B数据集的子集,这是由德国非营利组织LAION构建的大型公开图文数据集——这一点与训练数据同意权的持续法律和伦理争议相关,该争议影响的是大多数大规模图像模型,而不仅仅是Stable Diffusion。
关键在于,"Stable Diffusion"指的是模型权重和推理代码,而不是一个成品应用程序。 要真正输入提示词并看到图像,你需要一个界面。最广泛使用的选项包括AUTOMATIC1111的Stable Diffusion WebUI、ComfyUI(基于节点,控制力更强)、InvokeAI(打磨精良的专业级界面),以及Fooocus(简化设计,生成第一张图所需的点击次数最少)。PromptQuorum将在专门的评测中分别介绍这些界面;本文聚焦于底层模型本身。
📍 简单一句话
Stable Diffusion是一个开放权重的潜在扩散(latent diffusion)模型,能将文本提示转化为图像,以可下载的模型文件和代码形式分发,而非消费级应用程序。
💬 简单来说
把它想象成一台引擎,而不是一辆汽车——Stable Diffusion负责生成图像,但你仍需要一个仪表盘(AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus)来输入提示词并查看结果。
Stable Diffusion版本历史
SD 1.4 / SD 1.5
- 发布时间:
- 2022年8月-10月
- 许可证系列:
- CreativeML Open RAIL-M
- 主要变化:
- 首个被广泛采用的公开版本;至今仍是数千个社区检查点的基础
SD 2.0 / SD 2.1
- 发布时间:
- 2022年11月-12月
- 许可证系列:
- CreativeML Open RAIL++-M
- 主要变化:
- 采用新的文本编码器(OpenCLIP);相较1.5的检查点生态系统,社区反响褒贬不一
SDXL 1.0
- 发布时间:
- 2023年7月
- 许可证系列:
- CreativeML Open RAIL++-M
- 主要变化:
- 更大的基础模型(约35亿参数),在1024×1024分辨率下细节和构图更清晰
SD 3 Medium
- 发布时间:
- 2024年6月(权重发布)
- 许可证系列:
- Stability AI Community License
- 主要变化:
- 采用新的多模态扩散Transformer(MMDiT)架构,文本渲染和提示词遵循度提升
SD 3.5(Large、Large Turbo、Medium)
- 发布时间:
- 2024年10月
- 许可证系列:
- Stability AI Community License
- 主要变化:
- Large(80亿参数)提升了画质和多样性;Large Turbo以牺牲部分画质换取4步生成的速度;Medium(25亿参数)面向VRAM较少的硬件
版本发布日期和参数量已被Stability AI及第三方来源广泛报道;在技术规格中引用前,请在Stability AI上核实确切数字及是否有更新版本发布。最后核实日期:2026-09-05。
如何在本地运行Stable Diffusion
无论你最终选择哪种界面,在自己的GPU上运行Stable Diffusion的基本流程都是一样的。
- 1检查GPU的VRAM
Why it matters: 确认你的GPU有足够的VRAM来运行你想要的版本(见下方硬件表)——这决定了你实际能运行哪个版本和精度的Stable Diffusion。 - 2安装一个前端界面
Why it matters: 下载AUTOMATIC1111的Stable Diffusion WebUI、ComfyUI、InvokeAI或Fooocus——Stable Diffusion本身没有自己的安装程序,所以这一步是必须的,而非可选。 - 3下载模型权重
Why it matters: 从[Hugging Face](https://huggingface.co/stabilityai)或Stability AI官网等渠道获取你想要的具体版本(SD 1.5、SDXL或SD 3.5)的检查点文件,并在下载前确认其许可条款是否适用于你的用途。 - 4将检查点放入界面的模型文件夹
Why it matters: 每个界面都要求模型文件位于特定目录(在该界面自己的设置指南中有说明),以便在启动时检测并加载检查点。 - 5编写提示词并生成
Why it matters: 输入文本提示词,设置分辨率和采样步数,然后生成——首次运行通常较慢,因为模型需要加载到VRAM中。 - 6熟悉后添加可选扩展
Why it matters: LoRA(轻量级风格/主体微调)、ControlNet(姿态和构图引导)以及自定义检查点都是叠加在基础模型之上的社区插件,并非Stable Diffusion本身的一部分。
Stable Diffusion许可证与商业用途条款
这一区别对任何计划在商业产品中使用生成图像的人都很重要。适用于SD 1.5、SD 2.1和SDXL的较旧的CreativeML Open RAIL-M / RAIL++-M许可证允许商业用途且无收入上限——其限制是基于用途的(不得生成有害、非法或非人化内容),而非基于收入的,任何衍生的微调模型都必须保留相同的限制。
相比之下,SD 3和SD 3.5采用更新的Stability AI Community License。根据Hugging Face上发布的许可证文本,商业或组织用途需要向Stability AI注册,如果你或你的关联公司合计年收入超过100万美元,协议下授予的许可证即终止,你必须向Stability AI申请企业级许可证,该许可证由Stability AI自行决定是否授予,并需另行商定条款。
SD 3/3.5的非商业和研究用途在Community License下无需注册。此外,Stability AI还为其托管API和工具单独运营会员计划(Non-Commercial、Professional、Enterprise)——该会员计划是与上述自托管许可条款截然不同的商业服务,两者的条款都可能发生变化,因此在做出商业决策前,请直接在stability.ai上确认最新措辞。
📍 简单一句话
Stable Diffusion的许可条款因版本而异:SD 1.5/2.1/SDXL采用没有商业收入上限的CreativeML Open RAIL-M许可证,而SD 3和SD 3.5采用Stability AI Community License,仅对年收入低于100万美元的组织免费。
💬 简单来说
旧版本的Stable Diffusion在商业用途上很友好,除了内容滥用限制外没有其他条件;而最新版本则要求较大的企业购买企业级许可证。
SD 1.5、SD 2.1、SDXL 1.0
- 许可证:
- CreativeML Open RAIL-M / RAIL++-M
- 商业用途:
- 允许,无收入门槛
- 关键条件:
- 基于用途的限制禁止生成有害、非法或明显误导性的内容;下游衍生作品必须保留相同的限制
SD 3、SD 3.5(所有变体)
- 许可证:
- Stability AI Community License
- 商业用途:
- 年收入低于100万美元(你与关联公司合计)时免费
- 关键条件:
- 商业用途必须向Stability AI注册;一旦超过100万美元门槛,许可证即终止,需另行申请企业级许可证
许可条款是法律文本,不是营销内容——本节总结的是截至2026-09-05公开发布的条款,但不构成法律建议。在进行任何商业部署之前,请阅读你计划使用版本的实际许可证文件(例如各模型Hugging Face页面上的LICENSE.md)。
各版本硬件要求
SD 1.5
- 最低VRAM:
- 4 GB VRAM
- 舒适VRAM:
- 8 GB VRAM
- 备注:
- 可在过去十年的大多数GPU上运行;所有版本中最大的检查点/LoRA生态系统
SDXL 1.0
- 最低VRAM:
- 8 GB VRAM(需内存优化)
- 舒适VRAM:
- 12-16 GB VRAM
- 备注:
- 专为原生1024×1024输出设计;单张图像的速度和资源消耗均高于SD 1.5
SD 3.5 Medium
- 最低VRAM:
- 约6 GB VRAM(FP16)
- 舒适VRAM:
- 8-10 GB VRAM
- 备注:
- SD 3.5中最小的变体(25亿参数),面向VRAM较少的硬件
SD 3.5 Large / Large Turbo
- 最低VRAM:
- 约11 GB VRAM(FP8)
- 舒适VRAM:
- 16 GB以上VRAM(FP16)
- 备注:
- 80亿参数;Large Turbo以牺牲部分画质换取4步生成的速度
确切的VRAM占用取决于分辨率、批处理大小、精度(FP16对比FP8/量化)以及所用界面启用的优化(如注意力切片attention slicing、模型卸载model offloading)——请将这些数字视为规划范围,而非保证,并查阅具体界面的最新文档。
价格:免费自托管 vs. Stability AI托管方案
自行部署Stable Diffusion是免费的——你只需支付自己的硬件和电费,遵循适用于所选版本的许可证(见上方许可证部分)。 PromptQuorum未发现自行下载和运行权重需要支付任何费用,本地离线生成也无需订阅。
Stability AI单独为不想使用自有GPU的读者提供托管访问:免费的Non-Commercial会员级别(供个人/研究用途)、按月付费的Professional级别(支持自托管商业用途和托管API访问),以及针对超过Community License收入门槛的大型组织的定制价格Enterprise级别。Stability AI还提供按需付费的API积分,供无需订阅的按需生成使用。
Stable Diffusion 对比其他方案
Stable Diffusion(通过AUTOMATIC1111/ComfyUI)
- 最适合:
- 最大的检查点/LoRA/ControlNet生态系统,完全的本地控制
- 可否自托管:
- 可以——免费,用你自己的GPU
- 许可证/成本:
- RAIL-M(SD 1.5/2.1/SDXL,无上限)或Community License(SD 3/3.5,年收入低于100万美元免费)
- 关键取舍:
- 需要单独的界面;新版本要求为商业用途注册许可证
FLUX(Black Forest Labs出品)
- 最适合:
- 开箱即用的写实感和提示词遵循度
- 可否自托管:
- 可以——免费,用你自己的GPU
- 许可证/成本:
- FLUX.1 schnell采用Apache 2.0(无限制);FLUX dev/Kontext商业用途需要付费许可证
- 关键取舍:
- 社区生态系统比Stable Diffusion小;许可证因版本不同而差异很大
社区SDXL检查点(如Civitai托管的Pony Diffusion、Juggernaut XL等分支)
- 最适合:
- 无需精心设计提示词即可获得特定风格的结果(动漫、插画、特定的写实风格)
- 可否自托管:
- 可以——与基础Stable Diffusion相同的界面
- 许可证/成本:
- 因检查点而异——许多继承RAIL++-M条款,部分附加了自己的限制
- 关键取舍:
- 质量和许可证清晰度因社区作者而异;需查看每个检查点自己的许可证页面
Midjourney
- 最适合:
- 以最少的提示词工作量获得独特的默认美感,基于Discord/网页的工作流
- 可否自托管:
- 不可以——仅限云端,需要订阅
- 许可证/成本:
- 付费订阅等级
- 关键取舍:
- 没有本地隐私或离线使用;无法自托管或微调基础模型
DALL-E 3(通过ChatGPT/API)
- 最适合:
- 对简单提示词有较强的指令遵循能力,与ChatGPT集成
- 可否自托管:
- 不可以——仅限云端
- 许可证/成本:
- 包含在ChatGPT Plus/Pro中,或按需付费API
- 关键取舍:
- 没有离线使用,没有微调,没有检查点生态系统
Adobe Firefly
- 最适合:
- 为企业/创意团队提供商业安全的训练数据保证
- 可否自托管:
- 不可以——仅限云端
- 许可证/成本:
- 订阅制,可捆绑在Creative Cloud中或单独购买
- 关键取舍:
- 没有本地控制或自托管;以灵活性换取赔偿保障和与Adobe应用的集成
这是一份定位总结,而非基准测试排名——关于许可证和VRAM的更深入比较,请参阅本地AI图像生成对比云端,涵盖FLUX、SD 3.5和Qwen-Image。
Stable Diffusion适合谁
- 想要最大本地图像模型生态系统的读者。 没有其他开放图像模型拥有如此多围绕它构建的社区检查点、LoRA和ControlNet集成。
- 愿意安装界面的读者。 如果你已经愿意配置AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus,Stable Diffusion能为你提供最广泛的预训练风格和微调模型可供加载。
- 想要完全本地控制和隐私的读者。 下载后,生成完全在你自己的GPU上进行——没有任何图像或提示词离开你的设备。
- 年收入低于100万美元门槛的小企业或个人。 无论是采用RAIL-M许可证的旧版本,还是SD 3/3.5的Community License(可免费注册),在这一规模下均允许无需订阅的商业用途。
- 想要微调自定义风格的爱好者或艺术家。 Stable Diffusion的检查点和LoRA训练生态系统的规模与成熟度,使其成为训练个人风格模型文档最完善的选择。
Stable Diffusion不适合谁
- 想要免设置一键应用的读者。 Stable Diffusion是权重和代码,而非应用程序——你仍需先安装并配置单独的界面。想要零配置的读者应该考虑使用Midjourney或DALL-E 3等云端工具。
- VRAM较低且没有耐心进行优化的读者。 SDXL和SD 3.5 Large分别需要8GB以上和12-16GB以上的VRAM;拥有较旧或集成GPU的用户可能需要量化/优化版本,或者只能使用SD 1.5,或改用云端替代方案。
- 年收入超过100万美元门槛、计划使用SD 3或SD 3.5的组织。 Community License要求超过该门槛后需要向Stability AI申请企业级许可证——请将这项谈判纳入预算,或者在合适的情况下改用采用RAIL-M许可证的旧版本。
- 想要以最少提示词工作量获得最佳开箱即用写实感的读者。 2026年的社区反馈和对比普遍认为,在默认设置下,FLUX在写实感和提示词遵循度上领先于基础Stable Diffusion,不过经过微调的Stable Diffusion检查点可以在特定风格上大幅缩小这一差距。
- 需要针对训练数据相关索赔获得赔偿保障的企业团队。 Stable Diffusion的训练数据部分基于公开的LAION-5B数据集;需要针对这一风险获得合同赔偿保障的团队应改为评估Adobe Firefly。
常见问题
Stable Diffusion是免费的吗?
是的,自托管是免费的。模型权重和代码可在Hugging Face和GitHub上免费下载,在自己的GPU上运行除了硬件和电费外不需要任何费用。Stability AI单独为没有自有GPU的读者出售托管会员和按需付费的API积分——具体的级别名称和当前价格请查看stability.ai。
运行Stable Diffusion需要特殊的应用程序吗?
是的。Stable Diffusion以模型权重和推理代码的形式分发,而不是作为独立应用程序。要真正输入提示词并生成图像,你需要在自己的设备上安装单独的前端界面,如AUTOMATIC1111的Stable Diffusion WebUI、ComfyUI、InvokeAI或Fooocus。
我可以将Stable Diffusion生成的图像用于商业用途吗?
这取决于版本。使用SD 1.5、SD 2.1或SDXL生成的图像属于CreativeML Open RAIL-M / RAIL++-M许可证范畴,该许可证允许商业用途且无收入上限(需遵守基于用途的内容限制)。使用SD 3或SD 3.5生成的图像属于Stability AI Community License范畴,该许可证要求商业用途向Stability AI注册,并且仅在你的组织年度合计收入低于100万美元时免费——超过该数额则需要Stability AI的企业级许可证。
Stable Diffusion是谁创建的?
Stable Diffusion于2022年8月22日首次公开发布,是Stability AI(资助算力)、由Björn Ommer教授领导的慕尼黑大学CompVis研究组以及Runway ML的联合项目。Robin Rombach和Patrick Esser是底层潜在扩散架构的核心研究者之一。早期版本的训练数据使用了非营利组织LAION构建的LAION-5B数据集的子集。
Stable Diffusion需要多少VRAM?
这取决于版本:SD 1.5仅需4GB VRAM即可运行,SDXL在舒适使用下大约需要8-12GB,SD 3.5 Medium大约需要6-10GB,SD 3.5 Large大约需要11GB(FP8)到16GB以上(FP16)。确切用量因分辨率、批处理大小以及所选界面启用的优化而异。
在哪里可以下载Stable Diffusion?
官方模型权重发布在Hugging Face的stabilityai组织下,原始研究代码则在GitHub上的stability-ai/stablediffusion和stability-ai/generative-models。你还需要单独安装AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus等界面来加载和运行下载的权重。
Stable Diffusion比FLUX或Midjourney更好吗?
这取决于你看重什么。截至2026年,FLUX在开箱即用的写实感和提示词遵循度上通常领先,而Midjourney以最少的提示词工作量呈现独特的默认美感著称,但两者都无法在你自己的硬件上自托管。Stable Diffusion的优势在于其开放生态系统的规模——在所有本地图像模型家族中拥有最多的社区检查点、LoRA微调和ControlNet工具——再加上完全的本地控制,以及旧版本没有商业收入上限。
SD 1.5、SDXL和SD 3.5有什么区别?
SD 1.5(2022年)是最小、最轻量的版本,拥有迄今为止最大的社区检查点生态系统。SDXL(2023年)是一个更大的基础模型,专为更清晰的细节和原生1024×1024输出而构建。SD 3.5(2024年)采用更新的多模态扩散Transformer架构,文本渲染和提示词遵循度有所提升,但改用Stability AI Community License,而非1.5、2.1和SDXL使用的旧版RAIL-M许可证。
我可以微调自己的Stable Diffusion模型吗?
可以。基于Stable Diffusion训练LoRA(轻量级风格/主体微调)和完整的自定义检查点,是开源图像生成社区中文档最完善的工作流程之一,并有专门为此目的构建的工具支持。由此产生的微调模型会继承其训练所基于的基础模型的许可证限制。
结论
Stable Diffusion赢得了本地、开放图像生成基石的地位——并不是因为某个单一版本如今是性能最强的,而是因为自2022年以来围绕它建立起来的生态系统之深厚。愿意安装AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus等界面的读者,可以获得所有本地图像模型中最大的社区检查点、LoRA微调和ControlNet工具库,并完全掌控自己的硬件和数据。这种取舍是真实存在的:它不是一键应用,硬件需求随版本大幅变化,许可证也从完全开放的CreativeML Open RAIL-M(SD 1.5/2.1/SDXL)转变为按收入分级的Stability AI Community License(SD 3/3.5)——这是在任何商业部署前都值得核实的区别。想要开箱即用最佳写实感的读者也应评估FLUX;想要零配置的读者应考虑Midjourney或Adobe Firefly等云端工具。对于任何想要自行部署图像生成并受益于周边最大工具集的人来说,Stable Diffusion仍然是一个合理的起点。
来源
- Stability AI — Community License — 关于SD 3和SD 3.5的Stability AI Community License的官方公告和条款。
- Stability AI — 官方网站 — 产品页面、会员等级和当前API价格。
- Stable Diffusion 3.5 Large — Hugging Face上的LICENSE.md — Community License的完整法律文本,包括100万美元的收入门槛。
- CreativeML Open RAIL-M许可证 — CompVis/stable-diffusion GitHub — 涵盖SD 1.x和SD 2.x的许可证完整法律文本。
- Hugging Face上的Stability AI模型 — 所有Stable Diffusion版本的官方权重。
- GitHub上的stability-ai/stablediffusion — 原始研究代码仓库。
- GitHub上的stability-ai/generative-models — Stability AI当前的生成模型代码库,包括SD 3.x。
