Wichtigste Erkenntnisse
- ControlNet ist eine neuronale Netzwerkarchitektur — keine App —, die Stable Diffusion um präzise strukturelle Steuerung (Pose, Tiefe, Kanten, Skizzen, Segmentierung) erweitert, sodass ein generiertes Bild dieser Struktur folgt, nicht nur dem Wortlaut des Prompts.
- Es stammt aus dem Paper "Adding Conditional Control to Text-to-Image Diffusion Models" von Lvmin Zhang, Anyi Rao und Maneesh Agrawala von der Stanford University, veröffentlicht auf der ICCV 2023, wo es den Marr Prize der Konferenz für das beste Paper gewann.
- Derselbe Forscher, Lvmin Zhang (GitHub-Konto lllyasviel), hat auch Fooocus entwickelt, eine vereinfachte Stable-Diffusion-Oberfläche.
- Die Lizenz ist nicht einheitlich: Der Referenzcode steht unter Apache License 2.0, die ursprünglichen SD-1.5-Checkpoints sind auf Hugging Face als "openrail" gelistet, Community-SDXL-Checkpoints (z. B. vom xinsir-Konto) sind meist Apache-2.0, und Stability AIs offizielle SD-3.5-Large-ControlNets nutzen die umsatzabhängige Stability AI Community License — prüfen Sie vor kommerzieller Nutzung die Lizenz jedes einzelnen Checkpoints.
- Zur Nutzung brauchen Sie eine bereits installierte Oberfläche: AUTOMATIC1111 über die Community-Erweiterung sd-webui-controlnet, ComfyUI über native Kern-Nodes, oder InvokeAI über integrierte Control Layers.
- Es ist kostenlos und offen, ohne separates kostenpflichtiges ControlNet-Produkt — die einzigen Kosten sind eigene GPU und Strom über die jeweils genutzte Oberfläche.
Was ControlNet ist
ControlNet verdoppelt die Encoder-Schichten eines vortrainierten Diffusionsmodells und verbindet die Kopie über sogenannte "Zero-Convolution"-Schichten mit dem Originalnetzwerk — Faltungsschichten, deren Gewichte bei null starten, sodass das Training beim exakten Ausgangsverhalten des Basismodells beginnt und die neue Konditionierung nur schrittweise erlernt wird. Die Gewichte des Originalmodells bleiben dabei eingefroren, weshalb ControlNet die Bildqualität des Basismodells nicht verschlechtert.
Praktisch bedeutet das: Sie füttern die Pipeline mit zwei Eingaben statt einer — einem Text-Prompt (wie gewohnt) und einem Kontrollbild (Pose-Skelett, Tiefenkarte, Kantenzeichnung oder grobe Skizze). Das Ergebnis folgt der Komposition und Struktur des Kontrollbilds und übernimmt gleichzeitig Stil und Motivbeschreibung aus dem Prompt.
ControlNet ist keine fertige Anwendung. Das Paper beschreibt eine Architektur, und das Referenz-Repository auf GitHub stellt Code und vortrainierte Modellgewichte bereit, aber es gibt keinen ControlNet-Installer zum Doppelklicken. Um es zu nutzen, installieren Sie es als Erweiterung oder integrierte Funktion in einer bereits genutzten Stable-Diffusion-Oberfläche — siehe Installation und Nutzung unten.
Hauptautor Lvmin Zhang ist Forscher an der Stanford University (zuvor an der Chinese University of Hong Kong und der Soochow University), der unter dem GitHub-Konto lllyasviel veröffentlicht. Dieselbe Person hat auch Fooocus entwickelt, eine vereinfachte Stable-Diffusion-Oberfläche mit möglichst wenigen Klicks zum ersten Bild — eine Verbindung, die nützlich zu kennen ist, wenn Sie beide Projekte nutzen, da Designentscheidungen manchmal von einem zum anderen übertragen werden.
📍 In einem Satz
ControlNet ist eine neuronale Netzwerkarchitektur, die einem vortrainierten Stable-Diffusion-Modell eine zusätzliche, präzise geformte Eingabe hinzufügt — eine Kantenkarte, eine Tiefenkarte, ein Pose-Skelett oder eine Skizze —, sodass das Ergebnis dieser Struktur folgt, statt sich allein auf den Text-Prompt zu verlassen.
💬 In einfachen Worten
Ein Text-Prompt sagt einem Künstler in Worten, was er zeichnen soll; eine ControlNet-Eingabe gibt diesem Künstler eine durchgepauste Umrisslinie zum Nachzeichnen — die Umrisslinie legt Pose und Komposition fest, während der Prompt weiterhin Stil und Inhalt bestimmt.
Die Forschung hinter ControlNet
Code und erste vortrainierte Gewichte von ControlNet wurden im Februar 2023 zusammen mit dem arXiv-Preprint auf GitHub veröffentlicht. Am 14. April 2023 folgte eine überarbeitete "ControlNet 1.1"-Version mit mehr unterstützten Konditionierungstypen und verbesserter Robustheit. Das Paper wurde offiziell auf der ICCV 2023 veröffentlicht und erhielt den Marr Prize der Konferenz, bestätigt auf der offiziellen Awards-Seite der Computer Vision Foundation.
ControlNet wurde rund um die ursprüngliche Stable-Diffusion-1.5-Architektur entwickelt und zuerst daran demonstriert. Die Open-Source-Community — und später Stability AI selbst — trainierte anschließend zusätzliche ControlNet-Checkpoints für neuere Basismodelle, darunter Stable Diffusion XL und Stable Diffusion 3.5, und übertrug damit dieselbe Konditionierungstechnik auf jede neue Modellgeneration. Siehe Stable Diffusion Test für Hintergründe zu diesen Basismodellen.
Paper-Titel
- Verifizierte Angabe:
- "Adding Conditional Control to Text-to-Image Diffusion Models"
Autoren
- Verifizierte Angabe:
- Lvmin Zhang, Anyi Rao, Maneesh Agrawala
Institution
- Verifizierte Angabe:
- Stanford University
arXiv-ID
- Verifizierte Angabe:
- 2302.05543
Konferenz
- Verifizierte Angabe:
- ICCV 2023 (IEEE/CVF International Conference on Computer Vision)
Auszeichnung
- Verifizierte Angabe:
- Marr Prize — Best-Paper-Award der ICCV 2023
Code-Lizenz
- Verifizierte Angabe:
- Apache License 2.0
Fakten am 2026-09-06 direkt gegen arxiv.org, das GitHub-Repository lllyasviel/ControlNet, die CVF-ICCV-2023-Open-Access-Seite und die offizielle Awards-Liste auf thecvf.com verifiziert.
ControlNet-Konditionierungstypen
ControlNet 1.1 enthält über diesen Kernbestand hinaus weitere spezialisierte Modelle, etwa M-LSD (Geradenerkennung für Architektur und Innenräume), Shuffle (inhaltserhaltende Neukomposition), Inpaint und Tile (Detailverbesserung für Upscaling-Workflows). Jeder Konditionierungstyp ist eine eigene Modelldatei — Sie laden die zu Ihrem Kontrollbild passende, nicht ein einziges universelles Modell.
📍 In einem Satz
ControlNet 1.1 stellt separate Modelle für verschiedene Konditionierungstypen bereit — Canny-Kanten, Tiefe, menschliche Pose, Skizzen, Segmentierung, Lineart, Soft Edge und Normal Map sind die am häufigsten genutzten.
Canny-Kanten
- Was gesteuert wird:
- Übernimmt erkannte Kanten eines Referenzbilds, um Struktur bei geändertem Stil zu erhalten
Tiefe
- Was gesteuert wird:
- Nutzt eine Tiefenkarte, um räumliche Anordnung und Perspektive zu erhalten
OpenPose
- Was gesteuert wird:
- Extrahiert ein menschliches Pose-Skelett (Körper, Hände, Gesichtspunkte), um die Figurenpose festzulegen
Skizze (Scribble)
- Was gesteuert wird:
- Folgt einer groben Handskizze als lockere Kompositionsvorgabe
Segmentierung
- Was gesteuert wird:
- Nutzt farbcodierte Bereichskarten, um festzulegen, wo jedes Objekt oder jede Fläche erscheint
Lineart
- Was gesteuert wird:
- Folgt sauberen Lineart-Umrissen, üblich bei Illustrations-Workflows
Soft Edge (HED)
- Was gesteuert wird:
- Nutzt weichere, weniger starre Kantenerkennung als Canny für flexiblere Struktur
Normal Map
- Was gesteuert wird:
- Kodiert Oberflächenausrichtungsdaten, nützlich für 3D-nahe Arbeiten oder Texturen
Modellnamen und Verhalten anhand der Dokumentation im lllyasviel/ControlNet-v1-1-nightly-Repository verifiziert. Welche Typen eine bestimmte Oberfläche standardmäßig anbietet, variiert — prüfen Sie die eigene Modellliste dieser Oberfläche.
ControlNet in AUTOMATIC1111 oder ComfyUI installieren und nutzen
Die Einrichtung von ControlNet unterscheidet sich je Oberfläche, da es keinen eigenständigen Installer gibt. Die beiden häufigsten Wege sind unten skizziert.
- 1Prüfen, ob bereits eine funktionierende Stable-Diffusion-Oberfläche läuft
Why it matters: ControlNet hat nichts, woran es andocken kann, ohne dass AUTOMATIC1111, ComfyUI oder InvokeAI bereits installiert sind und Bilder erzeugen — siehe [Stable Diffusion Test](/power-local-llm/stable-diffusion-review), falls noch keine Oberfläche eingerichtet ist. - 2ControlNet-Erweiterung installieren (AUTOMATIC1111) oder native Unterstützung prüfen (ComfyUI/InvokeAI)
Why it matters: AUTOMATIC1111 bringt ControlNet nicht integriert mit — fügen Sie die Community-Erweiterung [sd-webui-controlnet](https://github.com/Mikubill/sd-webui-controlnet) über den Extensions-Tab hinzu. ComfyUI enthält ControlNet-bezogene Nodes im Kern; InvokeAI stellt ControlNet über die integrierte Control-Layers-Funktion bereit, sodass in beiden Fällen keine separate Erweiterung nötig ist. - 3Einen zum Basismodell passenden ControlNet-Checkpoint herunterladen
Why it matters: Ein für SD 1.5 trainierter Checkpoint funktioniert nicht korrekt mit SDXL oder SD 3.5 — passen Sie das ControlNet-Modell an die genutzte Stable-Diffusion-Version an und prüfen Sie die Lizenz vor dem Download (siehe Lizenzabschnitt unten). - 4Checkpoint im richtigen Modellordner ablegen
Why it matters: AUTOMATIC1111 erwartet ControlNet-Modelle unter `extensions/sd-webui-controlnet/models`; ComfyUI und InvokeAI nutzen eigene dokumentierte Modellverzeichnisse — prüfen Sie den aktuellen Einrichtungsleitfaden der jeweiligen Oberfläche für den genauen Pfad. - 5Konditionierungstyp wählen und Kontrollbild bereitstellen
Why it matters: Wählen Sie den passenden Preprocessor (Canny, Tiefe, OpenPose usw.) für Ihr Kontrollbild, oder lassen Sie die Oberfläche eines automatisch aus einem hochgeladenen Referenzfoto erzeugen. - 6ControlNet-Gewicht/Stärke festlegen und generieren
Why it matters: Geringere Stärke lässt den Prompt die Komposition stärker beeinflussen; höhere Stärke bindet das Ergebnis enger an das Kontrollbild — die meisten Oberflächen setzen standardmäßig einen mittleren Wert, den Sie je Ergebnis anpassen können.
ControlNet-Lizenz: Code vs. Modellgewichte
Das ist die wichtigste Angabe, die vor kommerzieller Nutzung von ControlNet zu prüfen ist: Die Lizenz ist keine einzelne feste Größe. Der Code der Referenzimplementierung steht unter Apache License 2.0, einer uneingeschränkten, permissiven Lizenz. Der heruntergeladene Modell-Checkpoint ist jedoch eine separate Datei mit eigener Lizenz, die in der Regel der Lizenzfamilie des Stable-Diffusion-Basismodells entspricht, gegen das der Checkpoint trainiert wurde.
Die ursprünglichen ControlNet-Checkpoints für Stable Diffusion 1.5, veröffentlicht unter dem lllyasviel-Konto auf Hugging Face, sind als "openrail" gelistet — dieselbe CreativeML-OpenRAIL-M-Lizenzfamilie wie SD 1.5 selbst, die kommerzielle Nutzung unter nutzungsbasierten Inhaltsbeschränkungen statt einer Umsatzgrenze erlaubt.
Von der Community trainierte SDXL-ControlNet-Checkpoints, etwa die weit verbreiteten Modelle unter dem xinsir-Konto auf Hugging Face, werden meist unter der einfachen Apache License 2.0 veröffentlicht — prüfen Sie die konkrete Model Card, da verschiedene Community-Autoren unterschiedliche Bedingungen für ihre eigenen Checkpoints wählen können.
Stability AIs eigene offizielle ControlNets für Stable Diffusion 3.5 Large — für Blur-, Canny- und Depth-Konditionierung, veröffentlicht am 26. November 2024 — tragen die Stability AI Community License, dieselbe umsatzabhängige Lizenz wie SD 3.5 selbst: kostenlos für Einzelpersonen und Organisationen unter 1.000.000 USD kumuliertem Jahresumsatz mit Registrierung, darüber ist eine Enterprise-Lizenz nötig.
📍 In einem Satz
Der ControlNet-Referenzcode auf GitHub steht unter Apache License 2.0, aber die tatsächlich heruntergeladenen Modell-Checkpoints tragen je nach zugrunde liegender Stable-Diffusion-Version und trainierender Organisation unterschiedliche Lizenzen.
💬 In einfachen Worten
Das Rezept (Code) ist uneingeschränkt Open Source; die konkreten Zutaten (Modellgewichte) tragen jeweils ein eigenes Etikett — lesen Sie das Etikett des heruntergeladenen Checkpoints, nicht nur die Code-Lizenz.
ControlNet-Referenzcode (GitHub)
- Lizenz:
- Apache License 2.0
- Kommerzielle Nutzung:
- Erlaubt, keine Einschränkungen
Ursprüngliche SD-1.5-ControlNet-Checkpoints (lllyasviel auf Hugging Face)
- Lizenz:
- "openrail" (CreativeML-OpenRAIL-M-Familie, von Stable Diffusion übernommen)
- Kommerzielle Nutzung:
- Erlaubt, mit nutzungsbasierten Inhaltsbeschränkungen
Community-SDXL-Checkpoints (z. B. xinsir-Konto)
- Lizenz:
- Meist Apache License 2.0
- Kommerzielle Nutzung:
- Erlaubt, keine Einschränkungen — je Checkpoint prüfen
Offizielle SD-3.5-Large-ControlNets von Stability AI
- Lizenz:
- Stability AI Community License
- Kommerzielle Nutzung:
- Kostenlos unter 1 Mio. USD Jahresumsatz mit Registrierung; darüber Enterprise-Lizenz nötig
Lizenzbedingungen sind Rechtstext, keine Marketingaussage — dieser Abschnitt fasst öffentlich veröffentlichte Bedingungen zum Stand 2026-09-06 zusammen, ist aber keine Rechtsberatung. Lesen Sie vor kommerziellem Einsatz stets die tatsächliche LICENSE-Datei oder Hugging-Face-Model-Card des konkret genutzten Checkpoints.
Hardware und VRAM mit ControlNet
ControlNet fügt einen verdoppelten Satz an Encoder-Schichten zum jeweils genutzten Stable-Diffusion-Modell hinzu und erhöht damit den VRAM-Bedarf zusätzlich zum Basismodell, statt ihn zu ersetzen.
Community-Berichte und Dokumentationen der Oberflächen beschreiben für ein einzelnes ControlNet-Modell auf Stable Diffusion 1.5 üblicherweise etwa 1–2 GB zusätzlichen VRAM-Bedarf, und einen größeren Anstieg — häufig um 2–4 GB je Modell genannt — bei SDXL, da dessen Encoder-Schichten größer und damit aufwendiger zu duplizieren sind. Werden mehrere ControlNet-Modelle gleichzeitig genutzt (z. B. Tiefe plus Pose plus Canny zugleich), summiert sich dieser Mehrbedarf weiter. Leichtere Alternativen wie T2I-Adapter (siehe Alternativen-Abschnitt unten) sind darauf ausgelegt, deutlich weniger VRAM-Mehrbedarf als ControlNet zu verursachen, allerdings mit in manchen Community-Vergleichen etwas weniger präziser Kontrolle.
Da diese Werte aus Community-Benchmarks stammen und nicht aus einem von PromptQuorum selbst durchgeführten kontrollierten Test, sollten Sie sie als Planungsrahmen behandeln: Prüfen Sie aktuelles VRAM-Verhalten in der Dokumentation oder dem Issue-Tracker Ihrer konkreten Oberfläche, bevor Sie annehmen, dass eine grenzwertige GPU eine bestimmte Kombination aus Basismodell und ControlNet bewältigt.
Preise: Kostenlos und offen (Open-Weights)
ControlNet hat keinen separaten Preis — es ist kostenlos und offen, verteilt als Code und Modell-Checkpoints statt als Produkt mit eigenem Abonnement oder eigener Lizenzgebühr. Es gibt keine von PromptQuorum erfasste kostenpflichtige Stufe, Mitgliedschaft oder gehostetes ControlNet-as-a-Service-Angebot vom ursprünglichen Forschungsteam.
Die tatsächlichen Kosten entstehen durch die bereits genutzte Stable-Diffusion-Oberfläche (AUTOMATIC1111, ComfyUI und InvokeAI sind selbst alle kostenlos und Open Source) sowie durch eigene GPU-Hardware und Strom. Der einzige laufende Kostenpunkt, der anfallen könnte, ist ein gehosteter Cloud-GPU-Dienst, auf dem diese Oberfläche betrieben wird — unabhängig von ControlNet selbst.
ControlNet vs. alternative Konditionierungstechniken
ControlNet, T2I-Adapter und IP-Adapter schließen sich nicht gegenseitig aus — viele Workflows kombinieren ControlNet (für Pose oder Komposition) mit IP-Adapter (für Stil- oder Charakterkonsistenz) in derselben Generierung. Welche Kombination sinnvoll ist, hängt davon ab, was Sie festlegen wollen: Struktur (ControlNet, T2I-Adapter) versus Erscheinungsbild (IP-Adapter).
Zur zugrunde liegenden Stable-Diffusion-Modellwahl, an die diese Techniken andocken, siehe Stable Diffusion Test. Für einen breiteren Vergleich von lokaler versus Cloud-Bildgenerierung insgesamt siehe Lokale KI-Bildgenerierung vs. Cloud.
Auf Oberflächen-Seite hat ComfyUI native ControlNet-Nodes ohne separate Erweiterung; AUTOMATIC1111 benötigt die Community-Erweiterung sd-webui-controlnet; InvokeAI integriert es als eingebaute Control Layers in der Canvas; und Fooocus — entwickelt vom selben Forscher, der ControlNet geschaffen hat — enthält eigene vereinfachte, ControlNet-basierte Funktionen zur strukturellen Steuerung, statt die rohe ControlNet-Modellauswahl offenzulegen.
ControlNet
- Am besten für:
- Präziseste strukturelle Kontrolle, breiteste Palette an Konditionierungstypen, größtes Ökosystem vortrainierter Checkpoints
- VRAM-Mehrbedarf:
- Höher — je nach Basismodell etwa 1–4 GB je Modell
- Lizenz / Kosten:
- Apache-2.0-Code; Checkpoint-Lizenz variiert (openrail / Apache-2.0 / Stability Community License)
- Wichtiger Kompromiss:
- Mehr VRAM und Einrichtungsaufwand als leichtere Adapter; Checkpoint-Lizenz muss je Datei geprüft werden
Artikel über ControlNet (5)
- AUTOMATIC1111 Review (2026): Stable Diffusion WebUI ExplainedAktualisiert 6. September 2026
- ControlNet Review (2026): Structural Control for Stable DiffusionAktualisiert 6. September 2026
- Fooocus Review (2026): The Simplest Local Stable Diffusion UIAktualisiert 6. September 2026
- Stable Diffusion Review (2026): Free Local Text-to-Image ModelsAktualisiert 5. September 2026
- AnimateDiff Guide 2026: Animate Any Stable Diffusion ModelAktualisiert 2. September 2026
Auch erwähnt in:
- Draw Things Review (2026): Free Offline Image AI for Mac & iOSAktualisiert 7. September 2026
- ComfyUI Review (2026): Free Node-Based UI for Stable Diffusion & FluxAktualisiert 6. September 2026
- Apple Silicon vs NVIDIA GPU for Local LLMs 2026: Performance, Cost, Workflow ComparedAktualisiert 1. September 2026
- Local AI Images Are Free. Cloud AI Images Are Instant. Your GPU Decides.Aktualisiert 21. August 2026
T2I-Adapter
- Am besten für:
- Ähnliche Konditionierungstypen (Skizze, Tiefe, Canny) mit schnellerer Inferenz und geringerem VRAM-Bedarf
- VRAM-Mehrbedarf:
- Deutlich geringer als ControlNet
- Lizenz / Kosten:
- Kostenlos, offen (Open-Weights)
- Wichtiger Kompromiss:
- Kleineres Modell, in Community-Vergleichen meist als etwas weniger präzise als ControlNet eingeschätzt
IP-Adapter
- Am besten für:
- Konditionierung auf Stil oder Motiv eines Referenzbilds statt auf dessen Struktur
- VRAM-Mehrbedarf:
- Gering — leichtgewichtiger Cross-Attention-Adapter
- Lizenz / Kosten:
- Kostenlos, offen (Open-Weights)
- Wichtiger Kompromiss:
- Steuert Erscheinungsbild/Stilübertragung, nicht Pose oder Komposition — üblicherweise zusammen mit ControlNet genutzt, nicht als Ersatz dafür
Nur Prompt Engineering (kein Konditionierungs-Add-on)
- Am besten für:
- Einfache Kompositionen, bei denen exakte Pose oder Layout keine Rolle spielen
- VRAM-Mehrbedarf:
- Keiner
- Lizenz / Kosten:
- Entfällt
- Wichtiger Kompromiss:
- Kein zuverlässiger Weg, eine exakte Pose, einen Kamerawinkel oder eine Objektplatzierung allein über Wortwahl festzulegen
Für wen sich ControlNet eignet
- Leser, die eine exakte Pose, einen Kamerawinkel oder eine Objektplatzierung brauchen. ControlNet ist der direkteste Weg, ein generiertes Bild auf eine bestimmte Struktur festzulegen, die reine Prompt-Formulierung nicht zuverlässig reproduzieren kann.
- Leser, die bereits mit einer Stable-Diffusion-Oberfläche vertraut sind. Wer bereits AUTOMATIC1111, ComfyUI oder InvokeAI nutzt, kann ControlNet über einen Checkpoint-Download und eine Einstellung hinzufügen, ohne eine neue Plattform zu erlernen.
- Illustratoren und Concept Artists, die von Skizzen ausgehen. Skizzen- und Lineart-Konditionierung lassen eine grobe Skizze oder saubere Strichzeichnung die finale Komposition direkt steuern.
- Fotografen oder 3D-Künstler, die vorhandene Geometrie wiederverwenden. Tiefen- und Normal-Map-Konditionierung übertragen die räumliche Anordnung eines Referenzfotos oder 3D-Renders in ein neues, stilisiertes Bild.
- Kleinunternehmen oder Einzelpersonen unter der jeweiligen Umsatzschwelle. Sowohl der Apache-2.0-Code als auch die openrail-/Apache-2.0-lizenzierten Checkpoints unterstützen kommerzielle Nutzung in dieser Größenordnung ohne Abonnement; die Checkpoints unter der Stability Community License ebenso, bis 1.000.000 USD Jahresumsatz mit Registrierung.
Für wen sich ControlNet nicht eignet
- Absolute Einsteiger, die noch keine Stable-Diffusion-Oberfläche eingerichtet haben. ControlNet bringt einen echten zusätzlichen Einrichtungs- und Konfigurationsschritt zur ohnehin nicht trivialen lokalen Installation — machen Sie sich zuerst mit einfachen Prompts vertraut, bevor Sie ControlNet hinzufügen.
- Leser, die eine Ein-Klick-App ohne Konfiguration wollen. Es gibt keine ControlNet-App; es ist ein Add-on für eine bestehende Oberfläche, und jede Oberfläche stellt es leicht unterschiedlich dar. Wer keinerlei Einrichtung möchte, sollte stattdessen ein Cloud-Tool in Betracht ziehen.
- Leser, die sich für einfache Bilder allein auf die Prompt-Formulierung verlassen. Wenn exakte Pose oder Layout für den eigenen Anwendungsfall keine Rolle spielen, ist reines Prompt Engineering schneller und vermeidet den zusätzlichen VRAM- und Einrichtungsaufwand von ControlNet.
- Leser mit einer VRAM-begrenzten GPU, die mit dem Basismodell bereits an ihrer Grenze ist. ControlNet erhöht den VRAM-Bedarf zusätzlich zu Stable Diffusion selbst spürbar — siehe Hardware und VRAM — eine leichtere Option wie T2I-Adapter passt hier möglicherweise besser.
- Organisationen oberhalb der jeweiligen Umsatzschwelle, die Stability AIs offizielle SD-3.5-ControlNets nutzen wollen. Die Stability AI Community License erfordert oberhalb von 1.000.000 USD Jahresumsatz eine Enterprise-Lizenz — planen Sie diese Verhandlung ein, oder nutzen Sie stattdessen einen Apache-2.0-lizenzierten SDXL-Checkpoint, falls dieser zum Anwendungsfall passt.
Häufig gestellte Fragen
Was ist ControlNet?
ControlNet ist eine neuronale Netzwerkarchitektur, die Stable-Diffusion-Bildgenerierung um präzise strukturelle Steuerung erweitert — Pose, Tiefe, Kantenkarten, Skizzen, Segmentierung und mehr. Vorgestellt wurde die Methode im Paper "Adding Conditional Control to Text-to-Image Diffusion Models" von Lvmin Zhang, Anyi Rao und Maneesh Agrawala von der Stanford University, veröffentlicht auf der ICCV 2023.
Ist ControlNet eine eigenständige App?
Nein. ControlNet ist eine Technik mit Referenzimplementierung, verteilt als Code und Modell-Checkpoints statt als Verbraucher-Anwendung. Zur Nutzung installieren Sie es in eine bereits genutzte Stable-Diffusion-Oberfläche — die Community-Erweiterung sd-webui-controlnet für AUTOMATIC1111, native Nodes in ComfyUI, oder integrierte Control Layers in InvokeAI.
Ist ControlNet kostenlos?
Ja. Der Referenzcode auf GitHub steht unter Apache License 2.0, einer uneingeschränkten Open-Source-Lizenz, und es gibt kein separates kostenpflichtiges ControlNet-Produkt. Einzelne Modell-Checkpoints tragen eigene Lizenzen, die je nach zugrunde liegender Stable-Diffusion-Version variieren — Details siehe Lizenzabschnitt.
Darf ich ControlNet kommerziell nutzen?
Das hängt vom konkreten Checkpoint ab. Ursprüngliche SD-1.5-ControlNet-Checkpoints sind als "openrail" gelistet und erlauben kommerzielle Nutzung unter Inhaltsbeschränkungen. Community-SDXL-Checkpoints (etwa vom xinsir-Konto) stehen meist unter Apache License 2.0 ohne Einschränkungen. Stability AIs offizielle SD-3.5-Large-ControlNets nutzen die Stability AI Community License, kostenlos unter 1.000.000 USD Jahresumsatz mit Registrierung, darüber ist eine Enterprise-Lizenz nötig. Prüfen Sie vor kommerzieller Nutzung stets die Lizenzseite des konkreten Checkpoints.
Wer hat ControlNet entwickelt?
ControlNet wurde von Lvmin Zhang, Anyi Rao und Maneesh Agrawala von der Stanford University im Paper "Adding Conditional Control to Text-to-Image Diffusion Models" vorgestellt, veröffentlicht auf der ICCV 2023, wo es den Marr Prize der Konferenz für das beste Paper gewann. Lvmin Zhang, der unter dem GitHub-Konto lllyasviel veröffentlicht, hat außerdem Fooocus entwickelt, eine vereinfachte Stable-Diffusion-Oberfläche.
Welche Stable-Diffusion-Oberflächen unterstützen ControlNet?
AUTOMATIC1111s Stable Diffusion WebUI unterstützt ControlNet über die Community-Erweiterung sd-webui-controlnet (nicht standardmäßig integriert). ComfyUI enthält ControlNet-bezogene Nodes nativ im Kern. InvokeAI integriert ControlNet als eingebaute Control Layers im Canvas-Workflow. Fooocus, entwickelt vom Schöpfer von ControlNet, enthält eigene vereinfachte ControlNet-basierte Funktionen zur strukturellen Steuerung, statt die rohe Modellauswahl offenzulegen.
Welche Konditionierungstypen unterstützt ControlNet?
ControlNet 1.1 umfasst Modelle für Canny-Kantenerkennung, Tiefenkarten, OpenPose-Pose-Skelette, Skizzen, Segmentierungskarten, Lineart, Soft-Edge-Erkennung (HED), Normal Maps sowie zusätzliche Spezialtypen wie M-LSD (Geraden), Shuffle, Inpaint und Tile.
Wie viel zusätzlichen VRAM benötigt ControlNet?
Es erhöht den VRAM-Bedarf zusätzlich zum Basismodell von Stable Diffusion, statt diesen zu ersetzen. Community-Berichte nennen üblicherweise etwa 1–2 GB zusätzlichen VRAM je ControlNet-Modell auf Stable Diffusion 1.5, und einen größeren Anstieg bei SDXL aufgrund der größeren Encoder-Schichten. Werden mehrere ControlNet-Modelle gleichzeitig genutzt, summiert sich dieser Mehrbedarf weiter; dies sind Planungsrahmen, kein von PromptQuorum selbst durchgeführter kontrollierter Benchmark.
Was ist der Unterschied zwischen ControlNet, T2I-Adapter und IP-Adapter?
ControlNet und T2I-Adapter konditionieren die Generierung beide auf strukturelle Eingaben wie Kanten, Tiefe oder Pose, aber T2I-Adapter nutzt eine kleinere Architektur mit geringerem VRAM-Bedarf und schnellerer Inferenz, was in Community-Vergleichen etwas an Präzision kostet. IP-Adapter konditioniert auf Stil oder Motiv-Erscheinungsbild eines Referenzbilds statt auf dessen Struktur und wird meist zusammen mit ControlNet genutzt statt als Ersatz dafür.
Fazit
ControlNet hat sich als Standardweg etabliert, um Stable Diffusion um präzise strukturelle Kontrolle zu erweitern — nicht als eigenständiges Produkt, sondern als gut dokumentierte Forschungstechnik mit einem großen Ökosystem an Checkpoints, das seit dem ICCV-2023-Debüt rund um sie entstanden ist. Wer bereits AUTOMATIC1111, ComfyUI oder InvokeAI nutzt, kann Pose-, Tiefen-, Kanten- oder Skizzen-Konditionierung hinzufügen, ohne die Plattform zu wechseln, und der zugrunde liegende Code trägt eine uneingeschränkte Apache-2.0-Lizenz. Der Kompromiss ist real: Es ist keine App, es bringt einen echten Einrichtungsschritt und spürbaren VRAM-Mehrbedarf zum Basismodell mit sich, und die Lizenzierung ist keine einzelne Antwort — sie hängt vom heruntergeladenen Checkpoint ab, von "openrail" bei den ältesten SD-1.5-Modellen bis zur umsatzabhängigen Stability AI Community License bei Stabilitys eigenen SD-3.5-ControlNets. Wer geringeren VRAM-Mehrbedarf bei ähnlicher struktureller Kontrolle sucht, sollte zusätzlich T2I-Adapter prüfen; wer noch keine Stable-Diffusion-Oberfläche eingerichtet hat, sollte dort zuerst ansetzen, da ControlNet allein nichts hat, woran es andocken kann. Für alle, die bereits lokal Bilder generieren und mehr Kontrolle brauchen, als reine Prompt-Formulierung bietet, bleibt ControlNet der am gründlichsten unterstützte Weg dorthin.
Quellen
- "Adding Conditional Control to Text-to-Image Diffusion Models" — arXiv:2302.05543 — das Original-Paper von Lvmin Zhang, Anyi Rao und Maneesh Agrawala.
- ControlNet — ICCV 2023 Open Access (CVF) — offizieller Konferenzeintrag.
- Computer Vision Foundation — Awards — offizielle Bestätigung des Marr Prize (Best Paper Award) der ICCV 2023.
- lllyasviel/ControlNet auf GitHub — Referenzimplementierung und Apache-License-2.0-Code-Lizenz.
- lllyasviel/ControlNet-v1-1-nightly auf GitHub — Dokumentation der ControlNet-1.1-Konditionierungstypen.
- lllyasviel/ControlNet auf Hugging Face — Downloads der ursprünglichen SD-1.5-Checkpoints und "openrail"-Lizenzangabe.
- xinsir/controlnet-canny-sdxl-1.0 auf Hugging Face — Beispiel eines Community-SDXL-ControlNet-Checkpoints und seiner Apache-2.0-Lizenz.
- stabilityai/stable-diffusion-3.5-large-controlnet-depth auf Hugging Face — Stability AIs offizielles SD-3.5-ControlNet und dessen Community-License-Bedingungen.
- Stability AI — ControlNets for Stable Diffusion 3.5 Large — offizielle Ankündigung, 26. November 2024.
- Mikubill/sd-webui-controlnet auf GitHub — die Community-ControlNet-Erweiterung für AUTOMATIC1111.
- Fooocus auf GitHub — die vereinfachte Stable-Diffusion-Oberfläche von ControlNet-Schöpfer Lvmin Zhang.
