Skip to main content
PromptQuorum
主页/本地LLM进阶/ControlNet评测(2026):Stable Diffusion的结构化控制插件
Image & Video Generation

ControlNet评测(2026):Stable Diffusion的结构化控制插件

·12分钟阅读·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

ControlNet是一种神经网络架构,为Stable Diffusion图像生成添加精确的结构化引导——姿势骨架、深度图、边缘轮廓、涂鸦草图——使生成的图像遵循该结构,而不仅仅依赖文本提示词。 它在斯坦福大学Lvmin Zhang、Anyi Rao和Maneesh Agrawala发表于ICCV 2023的论文《Adding Conditional Control to Text-to-Image Diffusion Models》中提出,该论文获得了大会最佳论文奖Marr Prize。ControlNet不是独立应用程序——它以代码(Apache License 2.0)和模型检查点(许可因检查点而异)的形式分发,需要安装到你已在使用的Stable Diffusion界面中,例如通过社区扩展安装的AUTOMATIC1111、通过原生节点的ComfyUI,或通过内置Control Layers的InvokeAI。在任何商业使用之前,请在Hugging Face上核实当前检查点的许可条款。

ControlNet是一种神经网络架构,为Stable Diffusion图像生成添加精确的结构化条件控制——姿势、深度、边缘图、涂鸦草图、语义分割等,使文本到图像模型除提示词外还能接收第二种输入。该技术由斯坦福大学的Lvmin Zhang、Anyi Rao和Maneesh Agrawala在论文Adding Conditional Control to Text-to-Image Diffusion Models中提出,发表于ICCV 2023。ControlNet不是可下载的应用程序:它是一种在GitHub上拥有参考实现的技术,以模型权重形式分发,需要接入你已经安装的Stable Diffusion界面——AUTOMATIC1111、ComfyUI或InvokeAI。本评测将说明ControlNet究竟是什么、其真实的许可条款(代码、原始检查点与更新的社区/官方检查点各不相同)、可用的条件类型、权重获取渠道,以及它与更新的条件控制技术相比如何。

ControlNet评测(2026):Stable Diffusion的结构化控制插件

关键要点

  • ControlNet是一种神经网络架构——而非应用程序——为Stable Diffusion添加精确的结构化条件控制(姿势、深度、边缘、涂鸦草图、语义分割),使生成图像遵循该结构,而不仅仅是提示词的字面表述。
  • 它出自斯坦福大学Lvmin Zhang、Anyi Rao和Maneesh Agrawala的论文《Adding Conditional Control to Text-to-Image Diffusion Models》,发表于ICCV 2023,并获得大会最佳论文奖Marr Prize。
  • 同一位研究者Lvmin Zhang(GitHub账号lllyasviel)还创建了Fooocus,一款简化版Stable Diffusion界面。
  • 许可并非单一答案:参考代码采用Apache License 2.0,原始SD 1.5检查点在Hugging Face上标注为"openrail",社区版SDXL检查点(例如xinsir账号发布的)通常为Apache-2.0,而Stability AI官方的SD 3.5 Large ControlNet则采用按营收限制的Stability AI Community License——商业使用前请查阅每个检查点各自的许可。
  • 使用它需要已安装的界面:通过社区扩展sd-webui-controlnet的AUTOMATIC1111、通过原生核心节点的ComfyUI,或通过内置Control Layers的InvokeAI。
  • 它免费且开放权重,没有单独的付费ControlNet产品——唯一的成本是通过所用界面消耗的自有GPU和电费。

ControlNet是什么

ControlNet的工作原理是复制预训练扩散模型的编码层,并通过论文所称的"零卷积"层将副本连接到原始网络——这些卷积层的权重从零开始,因此训练从基础模型完全原始的行为出发,仅逐步学习新的条件信号。原始模型的权重在此过程中保持锁定(冻结),这也是添加ControlNet不会降低基础Stable Diffusion模型图像质量的原因。

在实践中,这意味着流程接收两种输入而非一种:一个文本提示词(一如既往)和一张控制图像——姿势骨架、深度图、边缘轮廓或粗略的涂鸦草图。输出会遵循控制图像的构图和结构,同时仍纳入提示词的风格和主体描述。

ControlNet不是一个完整的应用程序。 论文描述的是一种架构,参考GitHub仓库提供代码和预训练模型权重,但并不存在可双击运行的ControlNet安装程序。要真正使用它,你需要将其作为扩展或内置功能安装到你已经在使用的Stable Diffusion界面中——参见下方的如何安装和使用ControlNet

第一作者Lvmin Zhang是斯坦福大学的研究者(此前曾在香港中文大学和苏州大学学习),以GitHub账号lllyasviel发布作品。同一人还创建了Fooocus,一款以最少点击生成第一张图像为设计目标的简化版Stable Diffusion界面——如果你同时使用这两个项目,值得了解这层关系,因为其中一个项目的设计决策有时会延续到另一个项目中。

📍 简单一句话

ControlNet是一种神经网络架构,为预训练的Stable Diffusion模型附加一个精确成形的额外输入——边缘图、深度图、姿势骨架或涂鸦草图——使输出遵循该结构,而不仅仅依赖文本提示词。

💬 简单来说

文本提示词用文字告诉画家该画什么;而ControlNet输入则相当于给这位画家一张描摹好的轮廓图让他照着画——轮廓图确定姿势和构图,提示词依然决定风格和内容。

ControlNet背后的研究

ControlNet的代码和首批预训练权重于2023年2月连同arXiv预印本一起在GitHub上发布。更完善的"ControlNet 1.1"版本随后于2023年4月14日发布,扩展了支持的条件类型并提升了各类型的稳健性。该论文正式发表于ICCV 2023,并获得大会Marr Prize,这一点已在Computer Vision Foundation官方获奖页面上得到确认。

ControlNet是围绕原始Stable Diffusion 1.5架构构建的,并首先在其上得到验证。此后,开源社区——以及后来的Stability AI自身——为更新的基础模型(包括Stable Diffusion XL和Stable Diffusion 3.5)训练了更多ControlNet检查点,将同样的条件控制技术延伸到每一代新模型。关于这些基础模型的背景,请参见Stable Diffusion评测

论文标题

经核实的事实:
《Adding Conditional Control to Text-to-Image Diffusion Models》

作者

经核实的事实:
Lvmin Zhang、Anyi Rao、Maneesh Agrawala

机构

经核实的事实:
斯坦福大学

arXiv编号

经核实的事实:
2302.05543

发表会议

经核实的事实:
ICCV 2023(IEEE/CVF International Conference on Computer Vision)

奖项

经核实的事实:
Marr Prize——ICCV 2023最佳论文奖

代码许可

经核实的事实:
Apache License 2.0

事实已于2026-09-06直接对照arxiv.org、GitHub上的lllyasviel/ControlNet仓库、CVF的ICCV 2023开放获取页面以及thecvf.com官方获奖名单进行核实。

ControlNet的条件类型

ControlNet 1.1还在这一核心集合之外包含其他专用模型,例如M-LSD(用于建筑和室内设计的直线检测)、Shuffle(保留内容的重新构图)、Inpaint以及Tile(用于放大工作流程的细节增强)。每种条件类型都是独立的模型文件——你需要加载与控制图像相匹配的那一个,而不是单一的通用模型。

📍 简单一句话

ControlNet 1.1为不同的条件类型提供了独立的模型——Canny边缘、深度、人体姿势、涂鸦草图、语义分割、线稿、软边缘和法线贴图是最常用的几种。

Canny边缘

控制内容:
追踪参考图像中检测到的边缘,在改变风格的同时保留结构

深度

控制内容:
使用深度图保留空间布局和透视关系

OpenPose

控制内容:
提取人体姿势骨架(身体、手部、面部关键点)以固定人物姿势

涂鸦草图(Scribble)

控制内容:
以手绘的粗略草图作为宽松的构图指引

语义分割

控制内容:
使用颜色编码的区域图确定每个物体或表面出现的位置

线稿(Lineart)

控制内容:
遵循干净的线稿轮廓,常用于插画类工作流程

软边缘(HED)

控制内容:
使用比Canny更柔和、不那么严格的边缘检测,实现更灵活的结构

法线贴图

控制内容:
编码表面朝向数据,适用于接近3D的工作或贴图制作

模型名称和行为已参照lllyasviel/ControlNet-v1-1-nightly仓库的文档核实。某个界面默认提供哪些类型因界面而异——请查看该界面自身的模型列表。

如何在AUTOMATIC1111或ComfyUI中安装和使用ControlNet

ControlNet的设置因界面而异,因为它不是独立的安装程序。下面概述了两种最常见的方式。

  1. 1
    确认你已经拥有可正常运行的Stable Diffusion界面
    Why it matters: 如果AUTOMATIC1111、ComfyUI或InvokeAI尚未安装并能正常生成图像,ControlNet将无处依附——如果你尚未搭建好其中之一,请参见[Stable Diffusion评测](/power-local-llm/stable-diffusion-review)。
  2. 2
    安装ControlNet扩展(AUTOMATIC1111)或确认原生支持(ComfyUI/InvokeAI)
    Why it matters: AUTOMATIC1111并未内置ControlNet——请通过Extensions标签添加社区扩展[sd-webui-controlnet](https://github.com/Mikubill/sd-webui-controlnet)。ComfyUI的核心已包含ControlNet相关节点;InvokeAI通过其内置的Control Layers功能提供ControlNet,因此两者都无需单独安装扩展。
  3. 3
    下载与你的基础模型匹配的ControlNet检查点
    Why it matters: 为SD 1.5训练的检查点无法在SDXL或SD 3.5上正确工作——请将ControlNet模型与你使用的Stable Diffusion版本相匹配,并在下载前确认其许可(见下方许可部分)。
  4. 4
    将检查点放入正确的模型文件夹
    Why it matters: AUTOMATIC1111期望ControlNet模型位于`extensions/sd-webui-controlnet/models`;ComfyUI和InvokeAI各自使用其文档记录的模型目录——请查阅该界面当前的搭建指南以获取确切路径。
  5. 5
    选择条件类型并提供控制图像
    Why it matters: 为你的控制图像选择匹配的预处理器(Canny、深度、OpenPose等),或让界面根据上传的参考照片自动生成一张。
  6. 6
    设置ControlNet权重/强度并生成
    Why it matters: 较低的强度让提示词对构图的影响更大;较高的强度会让输出更紧密地贴合控制图像——大多数界面默认使用中间值,可根据结果逐次调整。

ControlNet许可:代码与模型权重

这是在商业产品中使用ControlNet前需要核实的最重要事实:许可并非单一数字。参考实现的代码采用Apache License 2.0,一种不受限制的宽松许可。但你下载的模型检查点是一个独立的文件,拥有自己的许可,通常反映该检查点所训练依据的Stable Diffusion基础模型的许可系列。

发布在Hugging Face上lllyasviel账号下的Stable Diffusion 1.5原始ControlNet检查点,标注为"openrail"——与SD 1.5本身相同的CreativeML OpenRAIL-M许可系列,允许在基于用途的内容限制下商业使用,而非营收上限限制。

由社区训练的SDXL版ControlNet检查点,例如广泛使用的、发布在Hugging Face上xinsir账号下的模型,通常以简单的Apache License 2.0发布——请查阅具体的模型卡片,因为不同的社区作者可能为自己的检查点选择不同的条款。

Stability AI自身为Stable Diffusion 3.5 Large推出的官方ControlNet——涵盖Blur、Canny和Depth条件控制,于2024年11月26日发布——采用Stability AI Community License,与SD 3.5本身相同的按营收限制的许可:个人和组织在注册后、年累计营收低于100万美元的情况下免费使用,超过该门槛则需要Enterprise许可。

📍 简单一句话

GitHub上的ControlNet参考代码采用Apache License 2.0,但你实际下载的模型检查点会根据所依据的Stable Diffusion基础版本以及训练它的组织而携带不同的许可。

💬 简单来说

配方(代码)是不受限制的开源;具体的原料(模型权重)各自带有自己的标签——请阅读所下载检查点的标签,而不仅仅是代码许可。

ControlNet参考代码(GitHub)

许可:
Apache License 2.0
商业使用:
允许,无限制

原始SD 1.5 ControlNet检查点(Hugging Face上的lllyasviel账号)

许可:
"openrail"(继承自Stable Diffusion的CreativeML OpenRAIL-M系列)
商业使用:
允许,须遵守基于用途的内容限制

社区版SDXL检查点(例如xinsir账号)

许可:
通常为Apache License 2.0
商业使用:
允许,无限制——需逐个检查点核实

Stability AI官方SD 3.5 Large ControlNet

许可:
Stability AI Community License
商业使用:
年营收低于100万美元且已注册的情况下免费;超过该门槛需申请Enterprise许可

许可条款是法律文本,而非营销文案——本节总结了截至2026-09-06公开发布的条款,但不构成法律建议。在任何商业部署前,请务必查阅你计划使用的具体检查点的实际LICENSE文件或Hugging Face模型卡片。

ControlNet的硬件与显存需求

ControlNet会在你使用的Stable Diffusion模型之上添加一组复制的编码层,因此会在基础模型自身需求之外增加显存占用,而不是取代该需求。

社区报告和界面文档通常将在Stable Diffusion 1.5上使用单个ControlNet模型的额外显存占用描述为约1–2 GB,而在SDXL上则会有更大幅度的增加——常被引用为每个模型约2–4 GB,因为其编码层更大,复制成本也更高。同时使用多个ControlNet模型(例如同时使用深度、姿势和Canny)会进一步累加这一开销。像T2I-Adapter这样更轻量的替代方案(见下方替代方案部分)设计为比ControlNet大幅减少显存开销,但在某些社区对比中,其控制精度会略逊一筹。

由于这些数字来自社区基准测试,而非PromptQuorum自行进行的受控测试,请将其视为规划范围:在假设某块处于临界状态的GPU能够胜任特定基础模型与ControlNet组合之前,请在你具体使用的界面的文档或问题跟踪器中确认当前的显存表现。

价格:免费且开放权重

ControlNet没有单独的价格——它免费且开放权重,以代码和模型检查点的形式分发,而不是拥有自身订阅或许可费用的产品。 原始研究团队并未提供任何PromptQuorum所追踪到的付费级别、会员服务,或托管式ControlNet即服务方案。

你的实际成本来自你已经在使用的Stable Diffusion界面(AUTOMATIC1111、ComfyUI和InvokeAI本身都是免费和开源的),再加上自有的GPU硬件和电费。唯一可能产生的经常性成本,是你为运行该界面而选择的托管或云端GPU服务,这与ControlNet本身无关。

ControlNet与替代条件控制技术对比

ControlNet、T2I-Adapter和IP-Adapter并非互斥——许多工作流程会在同一次生成中结合使用ControlNet(用于姿势或构图)与IP-Adapter(用于风格或角色一致性)。哪种组合合理取决于你想固定的是什么:结构(ControlNet、T2I-Adapter)还是外观(IP-Adapter)。

关于这些技术所依附的Stable Diffusion基础模型选择,请参见Stable Diffusion评测。关于本地与云端图像生成的更广泛对比,请参见本地AI图像生成对比云端

在界面方面,ComfyUI拥有原生ControlNet节点,无需单独扩展;AUTOMATIC1111需要社区扩展sd-webui-controlnetInvokeAI将其作为内置Control Layers集成到画布中;而由创建ControlNet的同一位研究者开发的Fooocus,则内置了自己简化的、基于ControlNet的结构引导功能,而不是直接暴露原始的ControlNet模型选择。

ControlNet

最适合:
最精确的结构控制、最广泛的条件类型、最大的预训练检查点生态系统
显存开销:
较高——根据基础模型不同,每个模型约1–4 GB
许可/成本:
Apache-2.0代码;检查点许可各异(openrail/Apache-2.0/Stability Community License)
主要权衡:
比更轻量的适配器需要更多显存和设置;检查点许可需要逐个文件核实
关于ControlNet的文章(5篇)

其他提及:

T2I-Adapter

最适合:
以更快的推理速度和更低的显存实现类似的条件类型(草图、深度、Canny)
显存开销:
明显低于ControlNet
许可/成本:
免费,开放权重
主要权衡:
模型更小,在社区对比中通常被认为精度略逊于ControlNet

IP-Adapter

最适合:
基于参考图像的风格或主体(而非结构)进行条件控制
显存开销:
较低——轻量级交叉注意力适配器
许可/成本:
免费,开放权重
主要权衡:
控制外观/风格迁移,而非姿势或构图——通常与ControlNet搭配使用,而非替代它

仅靠提示词工程(不使用条件控制插件)

最适合:
不需要精确姿势或布局的简单构图
显存开销:
许可/成本:
不适用
主要权衡:
仅靠文字无法可靠地固定精确的姿势、镜头角度或物体位置

适合使用ControlNet的人群

  • 需要精确姿势、镜头角度或物体位置的读者。 ControlNet是将生成图像固定到特定结构的最直接方式,而这种结构是单靠提示词表述无法可靠复现的。
  • 已经熟悉Stable Diffusion界面的读者。 如果你已经在使用AUTOMATIC1111、ComfyUI或InvokeAI,添加ControlNet只需下载一个检查点并调整一项设置,而无需学习新平台。
  • 从草图出发工作的插画师和概念艺术家。 涂鸦草图和线稿条件控制让粗略的草图或干净的线稿能够直接引导最终构图。
  • 重复使用参考几何形态的摄影师或3D艺术家。 深度和法线贴图条件控制能将参考照片或3D渲染的空间布局延续到新的风格化图像中。
  • 处于相关营收门槛以下的小型企业或个人。 Apache-2.0代码以及openrail/Apache-2.0许可的检查点都支持在此规模下无需订阅进行商业使用;采用Stability Community License的检查点在注册后、年营收不超过100万美元时同样如此。

不适合使用ControlNet的人群

  • 尚未搭建Stable Diffusion界面的完全新手。 ControlNet会在本已不算简单的本地安装之上增加真实的设置和配置步骤——建议先熟悉基本的提示词生成流程,等这套工作流程熟悉之后再添加ControlNet。
  • 希望零配置、一键即用应用程序的读者。 并不存在ControlNet应用程序;它是加装在现有界面上的插件,各界面的呈现方式略有不同。希望零设置的读者应考虑改用云端工具。
  • 仅依靠提示词表述生成简单图像的读者。 如果精确的姿势或布局对你的使用场景并不重要,单纯的提示词工程更快,也能避免ControlNet所需的额外显存和设置。
  • 显存有限、基础模型已接近上限的GPU用户。 ControlNet会在Stable Diffusion本身之上增加可观的显存开销——见硬件与显存——像T2I-Adapter这样更轻量的选项可能更合适。
  • 营收超过相关门槛、计划使用Stability AI官方SD 3.5 ControlNet的组织。 Stability AI Community License要求年营收超过100万美元时申请Enterprise许可——请为这一谈判预留预算,或者如果适合你的使用场景,改用采用Apache-2.0许可的SDXL检查点。

常见问题

ControlNet是什么?

ControlNet是一种神经网络架构,为Stable Diffusion图像生成添加精确的结构化条件控制——姿势、深度、边缘图、涂鸦草图、语义分割等。它由斯坦福大学的Lvmin Zhang、Anyi Rao和Maneesh Agrawala在论文《Adding Conditional Control to Text-to-Image Diffusion Models》中提出,发表于ICCV 2023。

ControlNet是独立应用程序吗?

不是。ControlNet是一种拥有参考实现的技术,以代码和模型检查点的形式分发,而非消费级应用程序。要使用它,你需要将其安装到你已经在使用的Stable Diffusion界面中——AUTOMATIC1111的社区扩展sd-webui-controlnet、ComfyUI的原生节点,或InvokeAI内置的Control Layers。

ControlNet免费吗?

是的。GitHub上的参考代码采用Apache License 2.0,一种不受限制的开源许可,也不存在单独的付费ControlNet产品。各个模型检查点携带自己的许可,因所针对的Stable Diffusion基础版本而异——详见许可部分。

我可以将ControlNet用于商业用途吗?

这取决于具体的检查点。原始SD 1.5 ControlNet检查点标注为"openrail",在内容限制下允许商业使用。社区版SDXL检查点(例如xinsir账号发布的)通常为不受限制的Apache License 2.0。Stability AI官方的SD 3.5 Large ControlNet采用Stability AI Community License,注册后年营收低于100万美元可免费使用,超过该门槛则需要Enterprise许可。商业使用前请务必查阅具体检查点的许可页面。

ControlNet是谁开发的?

ControlNet由斯坦福大学的Lvmin Zhang、Anyi Rao和Maneesh Agrawala在论文《Adding Conditional Control to Text-to-Image Diffusion Models》中提出,发表于ICCV 2023,并获得大会最佳论文奖Marr Prize。以GitHub账号lllyasviel发布作品的Lvmin Zhang,还创建了简化版Stable Diffusion界面Fooocus。

哪些Stable Diffusion界面支持ControlNet?

AUTOMATIC1111的Stable Diffusion WebUI通过社区扩展sd-webui-controlnet支持ControlNet(默认未内置)。ComfyUI在其核心中原生包含ControlNet相关节点。InvokeAI在其画布工作流程中将ControlNet作为内置的Control Layers集成进来。由ControlNet创建者开发的Fooocus,内置了自己简化的、基于ControlNet的结构引导功能,而不是直接暴露原始的模型选择。

ControlNet支持哪些条件类型?

ControlNet 1.1包含Canny边缘检测、深度图、OpenPose人体姿势骨架、涂鸦草图、语义分割图、线稿、软边缘(HED)检测、法线贴图等模型,此外还有M-LSD(直线检测)、Shuffle、Inpaint和Tile等专用类型。

ControlNet会额外占用多少显存?

它是在Stable Diffusion基础模型之上增加显存占用,而不是取代该需求。社区报告通常将在Stable Diffusion 1.5上每个ControlNet模型的额外显存占用描述为约1–2 GB,而在SDXL上由于其编码层更大,增幅也会更大。同时使用多个ControlNet模型会进一步累加这一开销;这些是规划范围,而非PromptQuorum自行进行的受控基准测试。

ControlNet、T2I-Adapter和IP-Adapter有什么区别?

ControlNet和T2I-Adapter都基于边缘、深度或姿势等结构化输入对生成过程进行条件控制,但T2I-Adapter采用更小的架构,显存开销更低、推理更快,在社区对比中会牺牲一些精度。IP-Adapter则基于参考图像的风格或主体外观(而非其结构)进行条件控制,通常与ControlNet搭配使用,而不是作为其替代品。

结论

ControlNet赢得了为Stable Diffusion添加精确结构控制的标准方式这一地位——它本身并不是一款独立产品,而是一种记录详尽的研究技术,自ICCV 2023首次亮相以来,围绕它已经建立起庞大的检查点生态系统。已经使用AUTOMATIC1111、ComfyUI或InvokeAI的读者,无需更换平台即可添加姿势、深度、边缘或涂鸦草图条件控制,其底层代码采用不受限制的Apache-2.0许可。这种权衡是真实存在的:它不是一个应用程序,会在基础模型之上带来实实在在的设置步骤和可观的显存开销,而许可也并非单一答案——取决于你下载的检查点,从最古老SD 1.5模型的"openrail",到Stability自家SD 3.5 ControlNet上按营收限制的Stability AI Community License各不相同。希望以更轻的显存开销获得类似结构控制的读者,也应评估T2I-Adapter;尚未搭建Stable Diffusion界面的读者,应先从那里入手,因为ControlNet本身并无依附之处。对于所有已经在本地生成图像、需要比单纯提示词表述更强控制力的人来说,ControlNet依然是获得这种控制力最完善的支持方式。

资料来源

← 返回 本地LLM进阶