Skip to main content
PromptQuorum
主页/本地LLM进阶/Stable Diffusion评测(2026):免费本地文生图模型
Image & Video Generation

Stable Diffusion评测(2026):免费本地文生图模型

·阅读约11分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

Stable Diffusion是本地AI图像生成背后的开放权重模型家族——自行部署免费,但你需要一个单独的界面(AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus)才能真正运行它。 旧版本(SD 1.5、SD 2.1、SDXL)采用CreativeML Open RAIL-M许可证,没有收入上限;新版本(SD 3、SD 3.5)采用Stability AI Community License,年收入低于100万美元的组织可免费使用,但需要注册,超过该门槛则需要企业级(Enterprise)许可证。硬件需求从4GB VRAM(SD 1.5)到16GB以上VRAM(SD 3.5 Large)不等——在投入硬件或将商业项目押注在某个特定版本之前,请在Stability AIHugging Face上核实当前条款和文件大小。

Stable Diffusion是一系列开放权重的文本生成图像模型——包括SD 1.5、SD 2.1、SDXL、SD 3和SD 3.5——最初由Stability AI、慕尼黑大学(LMU)的CompVis研究组和Runway ML于2022年8月联合发布。它不是一个现成的应用程序:Stable Diffusion是模型本身,以权重(weights)和代码的形式分发,因此要在本地生成图像,仍需要一个单独的界面——如AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus——来加载模型并在你自己的GPU上运行推理。本文将介绍Stable Diffusion到底是什么、按版本不同的真实许可条款、硬件要求、权重下载地址,以及它与更新的本地和云端替代方案的比较。

Stable Diffusion评测(2026):免费本地文生图模型

关键要点

  • Stable Diffusion是一系列开放权重的文生图模型,不是独立应用程序——本地运行需要单独的界面(AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus)。
  • 它于2022年8月22日首次公开发布,由Stability AI、慕尼黑大学CompVis研究组和Runway ML联合完成,部分训练数据来自LAION-5B图像数据集。
  • 各版本许可条款不同:SD 1.5/2.1/SDXL采用CreativeML Open RAIL-M / RAIL++-M许可证(允许商业用途,无收入上限);SD 3/3.5采用Stability AI Community License(年收入低于100万美元并注册可免费,超出则需企业级许可证)。
  • 硬件需求随版本变化:4GB VRAM即可运行SD 1.5,SDXL需要8-12GB,SD 3.5 Large根据精度大约需要12-16GB。
  • 在适用许可证下自行部署是免费的;Stability AI单独出售托管API积分和付费会员方案,供没有自有GPU的读者使用。
  • 截至2026年,FLUX(Black Forest Labs出品)在写实感和提示词遵循度上通常领先;而Stable Diffusion在生态系统深度上仍然领先——拥有数量最多的社区检查点(checkpoint)、LoRA和ControlNet工具。

Stable Diffusion是什么

Stable Diffusion是一种潜在扩散模型(LDM):它通过在文本提示的引导下,逐步从图像的压缩表示中去除噪声来生成图像,而不是直接处理全分辨率像素。这正是它能在消费级GPU上运行,而无需数据中心级硬件的原因。

该模型由慕尼黑大学CompVis(计算机视觉与学习)研究组开发,负责人为Björn Ommer教授,Robin Rombach(后加入Stability AI)和Patrick Esser(Runway ML)是底层潜在扩散架构的核心研究者。Stability AI资助了算力,并于2022年8月22日与CompVis和Runway ML共同发布了首个公开版本。

早期版本的训练数据部分使用了LAION-5B数据集的子集,这是由德国非营利组织LAION构建的大型公开图文数据集——这一点与训练数据同意权的持续法律和伦理争议相关,该争议影响的是大多数大规模图像模型,而不仅仅是Stable Diffusion。

关键在于,"Stable Diffusion"指的是模型权重和推理代码,而不是一个成品应用程序。 要真正输入提示词并看到图像,你需要一个界面。最广泛使用的选项包括AUTOMATIC1111的Stable Diffusion WebUIComfyUI(基于节点,控制力更强)、InvokeAI(打磨精良的专业级界面),以及Fooocus(简化设计,生成第一张图所需的点击次数最少)。PromptQuorum将在专门的评测中分别介绍这些界面;本文聚焦于底层模型本身。

📍 简单一句话

Stable Diffusion是一个开放权重的潜在扩散(latent diffusion)模型,能将文本提示转化为图像,以可下载的模型文件和代码形式分发,而非消费级应用程序。

💬 简单来说

把它想象成一台引擎,而不是一辆汽车——Stable Diffusion负责生成图像,但你仍需要一个仪表盘(AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus)来输入提示词并查看结果。

Stable Diffusion版本历史

SD 1.4 / SD 1.5

发布时间:
2022年8月-10月
许可证系列:
CreativeML Open RAIL-M
主要变化:
首个被广泛采用的公开版本;至今仍是数千个社区检查点的基础

SD 2.0 / SD 2.1

发布时间:
2022年11月-12月
许可证系列:
CreativeML Open RAIL++-M
主要变化:
采用新的文本编码器(OpenCLIP);相较1.5的检查点生态系统,社区反响褒贬不一

SDXL 1.0

发布时间:
2023年7月
许可证系列:
CreativeML Open RAIL++-M
主要变化:
更大的基础模型(约35亿参数),在1024×1024分辨率下细节和构图更清晰

SD 3 Medium

发布时间:
2024年6月(权重发布)
许可证系列:
Stability AI Community License
主要变化:
采用新的多模态扩散Transformer(MMDiT)架构,文本渲染和提示词遵循度提升

SD 3.5(Large、Large Turbo、Medium)

发布时间:
2024年10月
许可证系列:
Stability AI Community License
主要变化:
Large(80亿参数)提升了画质和多样性;Large Turbo以牺牲部分画质换取4步生成的速度;Medium(25亿参数)面向VRAM较少的硬件

版本发布日期和参数量已被Stability AI及第三方来源广泛报道;在技术规格中引用前,请在Stability AI上核实确切数字及是否有更新版本发布。最后核实日期:2026-09-05。

如何在本地运行Stable Diffusion

无论你最终选择哪种界面,在自己的GPU上运行Stable Diffusion的基本流程都是一样的。

  1. 1
    检查GPU的VRAM
    Why it matters: 确认你的GPU有足够的VRAM来运行你想要的版本(见下方硬件表)——这决定了你实际能运行哪个版本和精度的Stable Diffusion。
  2. 2
    安装一个前端界面
    Why it matters: 下载AUTOMATIC1111的Stable Diffusion WebUI、ComfyUI、InvokeAI或Fooocus——Stable Diffusion本身没有自己的安装程序,所以这一步是必须的,而非可选。
  3. 3
    下载模型权重
    Why it matters: 从[Hugging Face](https://huggingface.co/stabilityai)或Stability AI官网等渠道获取你想要的具体版本(SD 1.5、SDXL或SD 3.5)的检查点文件,并在下载前确认其许可条款是否适用于你的用途。
  4. 4
    将检查点放入界面的模型文件夹
    Why it matters: 每个界面都要求模型文件位于特定目录(在该界面自己的设置指南中有说明),以便在启动时检测并加载检查点。
  5. 5
    编写提示词并生成
    Why it matters: 输入文本提示词,设置分辨率和采样步数,然后生成——首次运行通常较慢,因为模型需要加载到VRAM中。
  6. 6
    熟悉后添加可选扩展
    Why it matters: LoRA(轻量级风格/主体微调)、ControlNet(姿态和构图引导)以及自定义检查点都是叠加在基础模型之上的社区插件,并非Stable Diffusion本身的一部分。

Stable Diffusion许可证与商业用途条款

这一区别对任何计划在商业产品中使用生成图像的人都很重要。适用于SD 1.5、SD 2.1和SDXL的较旧的CreativeML Open RAIL-M / RAIL++-M许可证允许商业用途且无收入上限——其限制是基于用途的(不得生成有害、非法或非人化内容),而非基于收入的,任何衍生的微调模型都必须保留相同的限制。

相比之下,SD 3和SD 3.5采用更新的Stability AI Community License。根据Hugging Face上发布的许可证文本,商业或组织用途需要向Stability AI注册,如果你或你的关联公司合计年收入超过100万美元,协议下授予的许可证即终止,你必须向Stability AI申请企业级许可证,该许可证由Stability AI自行决定是否授予,并需另行商定条款。

SD 3/3.5的非商业和研究用途在Community License下无需注册。此外,Stability AI还为其托管API和工具单独运营会员计划(Non-Commercial、Professional、Enterprise)——该会员计划是与上述自托管许可条款截然不同的商业服务,两者的条款都可能发生变化,因此在做出商业决策前,请直接在stability.ai上确认最新措辞。

📍 简单一句话

Stable Diffusion的许可条款因版本而异:SD 1.5/2.1/SDXL采用没有商业收入上限的CreativeML Open RAIL-M许可证,而SD 3和SD 3.5采用Stability AI Community License,仅对年收入低于100万美元的组织免费。

💬 简单来说

旧版本的Stable Diffusion在商业用途上很友好,除了内容滥用限制外没有其他条件;而最新版本则要求较大的企业购买企业级许可证。

SD 1.5、SD 2.1、SDXL 1.0

许可证:
CreativeML Open RAIL-M / RAIL++-M
商业用途:
允许,无收入门槛
关键条件:
基于用途的限制禁止生成有害、非法或明显误导性的内容;下游衍生作品必须保留相同的限制

SD 3、SD 3.5(所有变体)

许可证:
Stability AI Community License
商业用途:
年收入低于100万美元(你与关联公司合计)时免费
关键条件:
商业用途必须向Stability AI注册;一旦超过100万美元门槛,许可证即终止,需另行申请企业级许可证

许可条款是法律文本,不是营销内容——本节总结的是截至2026-09-05公开发布的条款,但不构成法律建议。在进行任何商业部署之前,请阅读你计划使用版本的实际许可证文件(例如各模型Hugging Face页面上的LICENSE.md)。

各版本硬件要求

SD 1.5

最低VRAM:
4 GB VRAM
舒适VRAM:
8 GB VRAM
备注:
可在过去十年的大多数GPU上运行;所有版本中最大的检查点/LoRA生态系统

SDXL 1.0

最低VRAM:
8 GB VRAM(需内存优化)
舒适VRAM:
12-16 GB VRAM
备注:
专为原生1024×1024输出设计;单张图像的速度和资源消耗均高于SD 1.5

SD 3.5 Medium

最低VRAM:
约6 GB VRAM(FP16)
舒适VRAM:
8-10 GB VRAM
备注:
SD 3.5中最小的变体(25亿参数),面向VRAM较少的硬件

SD 3.5 Large / Large Turbo

最低VRAM:
约11 GB VRAM(FP8)
舒适VRAM:
16 GB以上VRAM(FP16)
备注:
80亿参数;Large Turbo以牺牲部分画质换取4步生成的速度

确切的VRAM占用取决于分辨率、批处理大小、精度(FP16对比FP8/量化)以及所用界面启用的优化(如注意力切片attention slicing、模型卸载model offloading)——请将这些数字视为规划范围,而非保证,并查阅具体界面的最新文档。

价格:免费自托管 vs. Stability AI托管方案

自行部署Stable Diffusion是免费的——你只需支付自己的硬件和电费,遵循适用于所选版本的许可证(见上方许可证部分)。 PromptQuorum未发现自行下载和运行权重需要支付任何费用,本地离线生成也无需订阅。

Stability AI单独为不想使用自有GPU的读者提供托管访问:免费的Non-Commercial会员级别(供个人/研究用途)、按月付费的Professional级别(支持自托管商业用途和托管API访问),以及针对超过Community License收入门槛的大型组织的定制价格Enterprise级别。Stability AI还提供按需付费的API积分,供无需订阅的按需生成使用。

Stable Diffusion 对比其他方案

Stable Diffusion(通过AUTOMATIC1111/ComfyUI)

最适合:
最大的检查点/LoRA/ControlNet生态系统,完全的本地控制
可否自托管:
可以——免费,用你自己的GPU
许可证/成本:
RAIL-M(SD 1.5/2.1/SDXL,无上限)或Community License(SD 3/3.5,年收入低于100万美元免费)
关键取舍:
需要单独的界面;新版本要求为商业用途注册许可证

FLUX(Black Forest Labs出品)

最适合:
开箱即用的写实感和提示词遵循度
可否自托管:
可以——免费,用你自己的GPU
许可证/成本:
FLUX.1 schnell采用Apache 2.0(无限制);FLUX dev/Kontext商业用途需要付费许可证
关键取舍:
社区生态系统比Stable Diffusion小;许可证因版本不同而差异很大

社区SDXL检查点(如Civitai托管的Pony Diffusion、Juggernaut XL等分支)

最适合:
无需精心设计提示词即可获得特定风格的结果(动漫、插画、特定的写实风格)
可否自托管:
可以——与基础Stable Diffusion相同的界面
许可证/成本:
因检查点而异——许多继承RAIL++-M条款,部分附加了自己的限制
关键取舍:
质量和许可证清晰度因社区作者而异;需查看每个检查点自己的许可证页面

Midjourney

最适合:
以最少的提示词工作量获得独特的默认美感,基于Discord/网页的工作流
可否自托管:
不可以——仅限云端,需要订阅
许可证/成本:
付费订阅等级
关键取舍:
没有本地隐私或离线使用;无法自托管或微调基础模型

DALL-E 3(通过ChatGPT/API)

最适合:
对简单提示词有较强的指令遵循能力,与ChatGPT集成
可否自托管:
不可以——仅限云端
许可证/成本:
包含在ChatGPT Plus/Pro中,或按需付费API
关键取舍:
没有离线使用,没有微调,没有检查点生态系统

Adobe Firefly

最适合:
为企业/创意团队提供商业安全的训练数据保证
可否自托管:
不可以——仅限云端
许可证/成本:
订阅制,可捆绑在Creative Cloud中或单独购买
关键取舍:
没有本地控制或自托管;以灵活性换取赔偿保障和与Adobe应用的集成

这是一份定位总结,而非基准测试排名——关于许可证和VRAM的更深入比较,请参阅本地AI图像生成对比云端,涵盖FLUX、SD 3.5和Qwen-Image。

Stable Diffusion适合谁

  • 想要最大本地图像模型生态系统的读者。 没有其他开放图像模型拥有如此多围绕它构建的社区检查点、LoRA和ControlNet集成。
  • 愿意安装界面的读者。 如果你已经愿意配置AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus,Stable Diffusion能为你提供最广泛的预训练风格和微调模型可供加载。
  • 想要完全本地控制和隐私的读者。 下载后,生成完全在你自己的GPU上进行——没有任何图像或提示词离开你的设备。
  • 年收入低于100万美元门槛的小企业或个人。 无论是采用RAIL-M许可证的旧版本,还是SD 3/3.5的Community License(可免费注册),在这一规模下均允许无需订阅的商业用途。
  • 想要微调自定义风格的爱好者或艺术家。 Stable Diffusion的检查点和LoRA训练生态系统的规模与成熟度,使其成为训练个人风格模型文档最完善的选择。

Stable Diffusion不适合谁

  • 想要免设置一键应用的读者。 Stable Diffusion是权重和代码,而非应用程序——你仍需先安装并配置单独的界面。想要零配置的读者应该考虑使用Midjourney或DALL-E 3等云端工具。
  • VRAM较低且没有耐心进行优化的读者。 SDXL和SD 3.5 Large分别需要8GB以上和12-16GB以上的VRAM;拥有较旧或集成GPU的用户可能需要量化/优化版本,或者只能使用SD 1.5,或改用云端替代方案。
  • 年收入超过100万美元门槛、计划使用SD 3或SD 3.5的组织。 Community License要求超过该门槛后需要向Stability AI申请企业级许可证——请将这项谈判纳入预算,或者在合适的情况下改用采用RAIL-M许可证的旧版本。
  • 想要以最少提示词工作量获得最佳开箱即用写实感的读者。 2026年的社区反馈和对比普遍认为,在默认设置下,FLUX在写实感和提示词遵循度上领先于基础Stable Diffusion,不过经过微调的Stable Diffusion检查点可以在特定风格上大幅缩小这一差距。
  • 需要针对训练数据相关索赔获得赔偿保障的企业团队。 Stable Diffusion的训练数据部分基于公开的LAION-5B数据集;需要针对这一风险获得合同赔偿保障的团队应改为评估Adobe Firefly。

常见问题

Stable Diffusion是免费的吗?

是的,自托管是免费的。模型权重和代码可在Hugging Face和GitHub上免费下载,在自己的GPU上运行除了硬件和电费外不需要任何费用。Stability AI单独为没有自有GPU的读者出售托管会员和按需付费的API积分——具体的级别名称和当前价格请查看stability.ai。

运行Stable Diffusion需要特殊的应用程序吗?

是的。Stable Diffusion以模型权重和推理代码的形式分发,而不是作为独立应用程序。要真正输入提示词并生成图像,你需要在自己的设备上安装单独的前端界面,如AUTOMATIC1111的Stable Diffusion WebUI、ComfyUI、InvokeAI或Fooocus。

我可以将Stable Diffusion生成的图像用于商业用途吗?

这取决于版本。使用SD 1.5、SD 2.1或SDXL生成的图像属于CreativeML Open RAIL-M / RAIL++-M许可证范畴,该许可证允许商业用途且无收入上限(需遵守基于用途的内容限制)。使用SD 3或SD 3.5生成的图像属于Stability AI Community License范畴,该许可证要求商业用途向Stability AI注册,并且仅在你的组织年度合计收入低于100万美元时免费——超过该数额则需要Stability AI的企业级许可证。

Stable Diffusion是谁创建的?

Stable Diffusion于2022年8月22日首次公开发布,是Stability AI(资助算力)、由Björn Ommer教授领导的慕尼黑大学CompVis研究组以及Runway ML的联合项目。Robin Rombach和Patrick Esser是底层潜在扩散架构的核心研究者之一。早期版本的训练数据使用了非营利组织LAION构建的LAION-5B数据集的子集。

Stable Diffusion需要多少VRAM?

这取决于版本:SD 1.5仅需4GB VRAM即可运行,SDXL在舒适使用下大约需要8-12GB,SD 3.5 Medium大约需要6-10GB,SD 3.5 Large大约需要11GB(FP8)到16GB以上(FP16)。确切用量因分辨率、批处理大小以及所选界面启用的优化而异。

在哪里可以下载Stable Diffusion?

官方模型权重发布在Hugging Face的stabilityai组织下,原始研究代码则在GitHub上的stability-ai/stablediffusionstability-ai/generative-models。你还需要单独安装AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus等界面来加载和运行下载的权重。

Stable Diffusion比FLUX或Midjourney更好吗?

这取决于你看重什么。截至2026年,FLUX在开箱即用的写实感和提示词遵循度上通常领先,而Midjourney以最少的提示词工作量呈现独特的默认美感著称,但两者都无法在你自己的硬件上自托管。Stable Diffusion的优势在于其开放生态系统的规模——在所有本地图像模型家族中拥有最多的社区检查点、LoRA微调和ControlNet工具——再加上完全的本地控制,以及旧版本没有商业收入上限。

SD 1.5、SDXL和SD 3.5有什么区别?

SD 1.5(2022年)是最小、最轻量的版本,拥有迄今为止最大的社区检查点生态系统。SDXL(2023年)是一个更大的基础模型,专为更清晰的细节和原生1024×1024输出而构建。SD 3.5(2024年)采用更新的多模态扩散Transformer架构,文本渲染和提示词遵循度有所提升,但改用Stability AI Community License,而非1.5、2.1和SDXL使用的旧版RAIL-M许可证。

我可以微调自己的Stable Diffusion模型吗?

可以。基于Stable Diffusion训练LoRA(轻量级风格/主体微调)和完整的自定义检查点,是开源图像生成社区中文档最完善的工作流程之一,并有专门为此目的构建的工具支持。由此产生的微调模型会继承其训练所基于的基础模型的许可证限制。

结论

Stable Diffusion赢得了本地、开放图像生成基石的地位——并不是因为某个单一版本如今是性能最强的,而是因为自2022年以来围绕它建立起来的生态系统之深厚。愿意安装AUTOMATIC1111、ComfyUI、InvokeAI或Fooocus等界面的读者,可以获得所有本地图像模型中最大的社区检查点、LoRA微调和ControlNet工具库,并完全掌控自己的硬件和数据。这种取舍是真实存在的:它不是一键应用,硬件需求随版本大幅变化,许可证也从完全开放的CreativeML Open RAIL-M(SD 1.5/2.1/SDXL)转变为按收入分级的Stability AI Community License(SD 3/3.5)——这是在任何商业部署前都值得核实的区别。想要开箱即用最佳写实感的读者也应评估FLUX;想要零配置的读者应考虑Midjourney或Adobe Firefly等云端工具。对于任何想要自行部署图像生成并受益于周边最大工具集的人来说,Stable Diffusion仍然是一个合理的起点。

来源

← 返回 本地LLM进阶