Points clés
- ControlNet est une architecture de réseau de neurones — pas une application — qui ajoute un conditionnement structurel précis (pose, profondeur, contours, gribouillis, segmentation) à Stable Diffusion, afin qu'une image générée suive cette structure et pas uniquement le libellé du prompt.
- Il provient de l'article « Adding Conditional Control to Text-to-Image Diffusion Models » de Lvmin Zhang, Anyi Rao et Maneesh Agrawala, de l'université Stanford, publié à l'ICCV 2023, où il a remporté le Marr Prize du meilleur article de la conférence.
- Le même chercheur, Lvmin Zhang (compte GitHub lllyasviel), a aussi créé Fooocus, une interface Stable Diffusion simplifiée.
- La licence n'est pas unique : le code de référence est sous Apache License 2.0, les checkpoints SD 1.5 d'origine sont listés comme « openrail » sur Hugging Face, les checkpoints SDXL communautaires (par exemple du compte xinsir) sont généralement en Apache-2.0, et les ControlNets officiels SD 3.5 Large de Stability AI utilisent la Stability AI Community License, plafonnée selon le chiffre d'affaires — vérifiez la licence de chaque checkpoint avant tout usage commercial.
- Pour l'utiliser, il faut une interface déjà installée : AUTOMATIC1111 via l'extension communautaire sd-webui-controlnet, ComfyUI via des nœuds de base natifs, ou InvokeAI via des Control Layers intégrées.
- C'est gratuit et à poids ouverts, sans produit ControlNet payant séparé — le seul coût est votre propre GPU et l'électricité via l'interface utilisée.
Ce qu'est ControlNet
ControlNet fonctionne en dupliquant les couches d'encodage d'un modèle de diffusion pré-entraîné et en connectant la copie au réseau d'origine via ce que l'article appelle des couches de « convolution zéro » — des couches de convolution dont les poids démarrent à zéro, de sorte que l'entraînement part du comportement exact du modèle de base et n'apprend que progressivement le nouveau signal de conditionnement. Les poids du modèle d'origine restent gelés pendant ce processus, ce qui explique pourquoi l'ajout de ControlNet ne dégrade pas la qualité d'image du modèle de base Stable Diffusion.
En pratique, cela signifie que le pipeline reçoit deux entrées au lieu d'une : un prompt textuel (comme d'habitude) et une image de contrôle — un squelette de pose, une carte de profondeur, un contour de bords ou un gribouillis approximatif. Le résultat suit la composition et la structure de l'image de contrôle tout en intégrant le style et la description du sujet du prompt.
ControlNet n'est pas une application finie. L'article décrit une architecture, et le dépôt GitHub de référence fournit le code et des poids de modèle pré-entraînés, mais il n'existe aucun installateur ControlNet sur lequel double-cliquer. Pour l'utiliser réellement, on l'installe comme extension ou fonctionnalité intégrée dans une interface Stable Diffusion déjà utilisée — voir Installer et utiliser ControlNet ci-dessous.
L'auteur principal, Lvmin Zhang, est chercheur affilié à l'université Stanford (avec des études antérieures à la Chinese University of Hong Kong et à la Soochow University), qui publie sous le compte GitHub lllyasviel. La même personne a aussi créé Fooocus, une interface Stable Diffusion simplifiée conçue pour obtenir une première image en le moins de clics possible — un lien utile à connaître si vous utilisez les deux projets, certains choix de conception se retrouvant parfois de l'un à l'autre.
📍 En une phrase
ControlNet est une architecture de réseau de neurones qui ajoute une entrée supplémentaire précisément formée — une carte de contours, une carte de profondeur, un squelette de pose ou un gribouillis — à un modèle Stable Diffusion pré-entraîné, afin que le résultat suive cette structure plutôt que de dépendre uniquement du prompt textuel.
💬 En termes simples
Un prompt textuel indique à un artiste, en mots, quoi dessiner ; une entrée ControlNet lui remet un contour calqué à redessiner — le contour fixe la pose et la composition, tandis que le prompt continue de déterminer le style et le contenu.
La recherche à l'origine de ControlNet
Le code et les premiers poids pré-entraînés de ControlNet ont été publiés sur GitHub en février 2023, en même temps que la prépublication arXiv. Une version plus aboutie, « ControlNet 1.1 », a suivi le 14 avril 2023, élargissant les types de conditionnement pris en charge et améliorant leur robustesse. L'article a été officiellement publié à l'ICCV 2023 et a reçu le Marr Prize de la conférence, confirmé sur la page officielle des récompenses de la Computer Vision Foundation.
ControlNet a été conçu autour de l'architecture originale de Stable Diffusion 1.5 et démontré d'abord sur celle-ci. La communauté open source — puis Stability AI elle-même — a ensuite entraîné des checkpoints ControlNet supplémentaires pour des modèles de base plus récents, dont Stable Diffusion XL et Stable Diffusion 3.5, étendant la même technique de conditionnement à chaque nouvelle génération de modèle. Voir Test de Stable Diffusion pour le contexte sur ces modèles de base.
Titre de l'article
- Fait vérifié:
- « Adding Conditional Control to Text-to-Image Diffusion Models »
Auteurs
- Fait vérifié:
- Lvmin Zhang, Anyi Rao, Maneesh Agrawala
Institution
- Fait vérifié:
- Université Stanford
ID arXiv
- Fait vérifié:
- 2302.05543
Conférence
- Fait vérifié:
- ICCV 2023 (IEEE/CVF International Conference on Computer Vision)
Récompense
- Fait vérifié:
- Marr Prize — meilleur article de l'ICCV 2023
Licence du code
- Fait vérifié:
- Apache License 2.0
Faits vérifiés directement sur arxiv.org, le dépôt GitHub lllyasviel/ControlNet, la page d'accès libre CVF de l'ICCV 2023 et la liste officielle des récompenses sur thecvf.com le 2026-09-06.
Types de conditionnement ControlNet
ControlNet 1.1 comprend aussi des modèles spécialisés supplémentaires au-delà de cet ensemble de base, comme M-LSD (détection de lignes droites pour l'architecture et l'intérieur), Shuffle (recomposition préservant le contenu), Inpaint et Tile (amélioration du détail pour les flux d'upscaling). Chaque type de conditionnement est un fichier de modèle distinct — on charge celui qui correspond à l'image de contrôle, pas un modèle universel unique.
📍 En une phrase
ControlNet 1.1 propose des modèles distincts pour différents types de conditionnement — contours Canny, profondeur, pose humaine, gribouillis, segmentation, lineart, soft edge et normal map sont les plus utilisés.
Contours Canny
- Ce qu'il contrôle:
- Reprend les contours détectés d'une image de référence pour préserver la structure en changeant le style
Profondeur
- Ce qu'il contrôle:
- Utilise une carte de profondeur pour préserver l'agencement spatial et la perspective
OpenPose
- Ce qu'il contrôle:
- Extrait un squelette de pose humaine (corps, mains, points clés du visage) pour fixer la pose du personnage
Gribouillis (Scribble)
- Ce qu'il contrôle:
- Suit une esquisse approximative dessinée à la main comme guide de composition souple
Segmentation
- Ce qu'il contrôle:
- Utilise des cartes de régions codées par couleur pour fixer l'emplacement de chaque objet ou surface
Lineart
- Ce qu'il contrôle:
- Suit des contours de line art nets, courants dans les flux d'illustration
Soft edge (HED)
- Ce qu'il contrôle:
- Utilise une détection de contours plus souple et moins rigide que Canny pour une structure plus flexible
Normal map
- Ce qu'il contrôle:
- Encode les données d'orientation de surface, utile pour des travaux proches de la 3D ou de texturage
Noms de modèles et comportement vérifiés à partir de la documentation du dépôt lllyasviel/ControlNet-v1-1-nightly. Les types proposés par défaut varient selon l'interface — consultez la liste de modèles propre à celle-ci.
Comment installer et utiliser ControlNet dans AUTOMATIC1111 ou ComfyUI
L'installation de ControlNet diffère selon l'interface, car ce n'est pas un installateur autonome. Les deux chemins les plus courants sont décrits ci-dessous.
- 1Vérifier qu'une interface Stable Diffusion fonctionne déjà
Why it matters: ControlNet n'a rien où se greffer si AUTOMATIC1111, ComfyUI ou InvokeAI ne sont pas déjà installés et ne génèrent pas d'images — voir [Test de Stable Diffusion](/power-local-llm/stable-diffusion-review) si ce n'est pas encore fait. - 2Installer l'extension ControlNet (AUTOMATIC1111) ou vérifier la prise en charge native (ComfyUI/InvokeAI)
Why it matters: AUTOMATIC1111 n'inclut pas ControlNet par défaut — ajoutez l'extension communautaire [sd-webui-controlnet](https://github.com/Mikubill/sd-webui-controlnet) depuis l'onglet Extensions. ComfyUI inclut des nœuds liés à ControlNet dans son cœur ; InvokeAI expose ControlNet via sa fonctionnalité intégrée de Control Layers, donc aucune extension séparée n'est nécessaire dans les deux cas. - 3Télécharger un checkpoint ControlNet correspondant au modèle de base
Why it matters: Un checkpoint entraîné pour SD 1.5 ne fonctionnera pas correctement avec SDXL ou SD 3.5 — faites correspondre le modèle ControlNet à la version de Stable Diffusion utilisée, et vérifiez sa licence avant de le télécharger (voir la section licence ci-dessous). - 4Placer le checkpoint dans le bon dossier de modèles
Why it matters: AUTOMATIC1111 attend les modèles ControlNet dans `extensions/sd-webui-controlnet/models` ; ComfyUI et InvokeAI utilisent leurs propres répertoires de modèles documentés — consultez le guide d'installation actuel de cette interface pour le chemin exact. - 5Choisir un type de conditionnement et fournir une image de contrôle
Why it matters: Sélectionnez le préprocesseur correspondant (Canny, profondeur, OpenPose, etc.) pour votre image de contrôle, ou laissez l'interface en générer une automatiquement à partir d'une photo de référence téléchargée. - 6Régler le poids/la force de ControlNet et générer
Why it matters: Une force plus faible laisse le prompt influencer davantage la composition ; une force plus élevée verrouille davantage le résultat sur l'image de contrôle — la plupart des interfaces utilisent par défaut une valeur médiane ajustable selon le résultat.
Licence ControlNet : code vs poids du modèle
C'est l'élément le plus important à vérifier avant d'utiliser ControlNet dans un produit commercial : la licence n'est pas un chiffre unique. Le code de l'implémentation de référence est sous Apache License 2.0, une licence permissive sans restriction. Mais le checkpoint de modèle téléchargé est un fichier distinct avec sa propre licence, qui reflète généralement la famille de licence du modèle de base Stable Diffusion pour lequel le checkpoint a été entraîné.
Les checkpoints ControlNet d'origine pour Stable Diffusion 1.5, publiés sous le compte lllyasviel sur Hugging Face, sont listés comme « openrail » — la même famille de licence CreativeML OpenRAIL-M que SD 1.5 lui-même, qui autorise l'usage commercial sous réserve de restrictions de contenu liées à l'usage plutôt qu'un plafond de chiffre d'affaires.
Les checkpoints ControlNet SDXL entraînés par la communauté, comme les modèles largement utilisés publiés sous le compte xinsir sur Hugging Face, sont généralement publiés sous la simple Apache License 2.0 — vérifiez la fiche du modèle concerné, différents auteurs communautaires pouvant choisir des conditions différentes pour leurs propres checkpoints.
Les ControlNets officiels de Stability AI pour Stable Diffusion 3.5 Large — pour les conditionnements Blur, Canny et Depth, publiés le 26 novembre 2024 — portent la Stability AI Community License, la même licence plafonnée selon le chiffre d'affaires que SD 3.5 lui-même : gratuite pour les particuliers et organisations sous 1 000 000 USD de chiffre d'affaires annuel agrégé avec inscription, et nécessitant une licence Enterprise au-delà de ce seuil.
📍 En une phrase
Le code de référence de ControlNet sur GitHub est sous licence Apache License 2.0, mais les checkpoints de modèle réellement téléchargés portent des licences différentes selon la version de base de Stable Diffusion et l'organisation qui les a entraînés.
💬 En termes simples
La recette (le code) est de l'open source sans restriction ; les ingrédients précis (les poids du modèle) portent chacun leur propre étiquette — lisez l'étiquette du checkpoint téléchargé, pas seulement la licence du code.
Code de référence ControlNet (GitHub)
- Licence:
- Apache License 2.0
- Usage commercial:
- Autorisé, sans restriction
Checkpoints ControlNet SD 1.5 d'origine (lllyasviel sur Hugging Face)
- Licence:
- « openrail » (famille CreativeML OpenRAIL-M, héritée de Stable Diffusion)
- Usage commercial:
- Autorisé, sous réserve de restrictions de contenu liées à l'usage
Checkpoints SDXL communautaires (ex. compte xinsir)
- Licence:
- Généralement Apache License 2.0
- Usage commercial:
- Autorisé, sans restriction — à vérifier par checkpoint
ControlNets officiels SD 3.5 Large de Stability AI
- Licence:
- Stability AI Community License
- Usage commercial:
- Gratuit sous 1 000 000 USD de chiffre d'affaires annuel avec inscription ; licence Enterprise requise au-delà
Les conditions de licence sont un texte juridique, pas un argument marketing — cette section résume des conditions publiées publiquement au 2026-09-06 mais ne constitue pas un conseil juridique. Lisez toujours le fichier LICENSE réel ou la fiche de modèle Hugging Face du checkpoint précis envisagé avant tout déploiement commercial.
Matériel et VRAM avec ControlNet
ControlNet ajoute un ensemble dupliqué de couches d'encodage au-dessus du modèle Stable Diffusion utilisé, ce qui augmente l'utilisation de VRAM en plus de l'exigence propre du modèle de base plutôt que de la remplacer.
Les retours de la communauté et la documentation des interfaces décrivent généralement environ 1 à 2 Go de VRAM supplémentaire pour un seul modèle ControlNet sur Stable Diffusion 1.5, et une hausse plus importante — souvent citée autour de 2 à 4 Go par modèle — sur SDXL, dont les couches d'encodage plus grandes sont plus coûteuses à dupliquer. L'utilisation simultanée de plusieurs modèles ControlNet (par exemple profondeur, pose et Canny en même temps) cumule encore cette surcharge. Des alternatives plus légères comme T2I-Adapter (voir la section alternatives ci-dessous) sont conçues pour ajouter nettement moins de surcharge VRAM que ControlNet, au prix d'un contrôle un peu moins précis dans certaines comparaisons communautaires.
Ces chiffres provenant de tests communautaires et non d'un test contrôlé mené par PromptQuorum lui-même, traitez-les comme des fourchettes de planification : vérifiez le comportement VRAM actuel dans la documentation ou le suivi des problèmes de votre interface spécifique avant de supposer qu'un GPU à la limite gérera une combinaison donnée de modèle de base et de ControlNet.
Tarifs : gratuit et à poids ouverts
ControlNet n'a pas de prix distinct — il est gratuit et à poids ouverts, distribué sous forme de code et de checkpoints de modèle plutôt que comme un produit avec son propre abonnement ou frais de licence. Il n'existe aucune offre payante, aucun abonnement ni service ControlNet hébergé suivi par PromptQuorum de la part de l'équipe de recherche d'origine.
Le coût réel est celui de l'interface Stable Diffusion déjà utilisée (AUTOMATIC1111, ComfyUI et InvokeAI sont elles-mêmes gratuites et open source) plus votre propre matériel GPU et l'électricité. Le seul coût récurrent envisageable est celui d'un service GPU hébergé ou cloud choisi pour exécuter cette interface, sans rapport avec ControlNet lui-même.
ControlNet face aux techniques de conditionnement alternatives
ControlNet, T2I-Adapter et IP-Adapter ne s'excluent pas mutuellement — de nombreux flux de travail combinent ControlNet (pour la pose ou la composition) avec IP-Adapter (pour la cohérence de style ou de personnage) dans la même génération. La combinaison pertinente dépend de ce que l'on cherche à fixer : la structure (ControlNet, T2I-Adapter) ou l'apparence (IP-Adapter).
Pour le choix du modèle de base Stable Diffusion auquel ces techniques se rattachent, voir Test de Stable Diffusion. Pour une comparaison plus large entre génération d'images locale et cloud, voir Génération d'images IA locale vs cloud.
Côté interfaces, ComfyUI dispose de nœuds ControlNet natifs sans extension séparée nécessaire ; AUTOMATIC1111 nécessite l'extension communautaire sd-webui-controlnet ; InvokeAI l'intègre sous forme de Control Layers intégrées dans son canevas ; et Fooocus — créé par le même chercheur qui a créé ControlNet — inclut ses propres fonctionnalités simplifiées de guidage structurel basées sur ControlNet plutôt que d'exposer la sélection brute des modèles ControlNet.
ControlNet
- Idéal pour:
- Contrôle structurel le plus précis, plus large éventail de types de conditionnement, plus vaste écosystème de checkpoints pré-entraînés
- Surcharge VRAM:
- Plus élevée — environ 1 à 4 Go par modèle selon le modèle de base
- Licence / coût:
- Code Apache-2.0 ; licence du checkpoint variable (openrail / Apache-2.0 / Stability Community License)
- Compromis clé:
- Plus de VRAM et de configuration que des adaptateurs plus légers ; la licence du checkpoint doit être vérifiée fichier par fichier
Articles sur ControlNet (5)
- AUTOMATIC1111 Review (2026): Stable Diffusion WebUI ExplainedMis à jour 6 septembre 2026
- ControlNet Review (2026): Structural Control for Stable DiffusionMis à jour 6 septembre 2026
- Fooocus Review (2026): The Simplest Local Stable Diffusion UIMis à jour 6 septembre 2026
- Stable Diffusion Review (2026): Free Local Text-to-Image ModelsMis à jour 5 septembre 2026
- AnimateDiff Guide 2026: Animate Any Stable Diffusion ModelMis à jour 2 septembre 2026
Également mentionné dans :
- Draw Things Review (2026): Free Offline Image AI for Mac & iOSMis à jour 7 septembre 2026
- ComfyUI Review (2026): Free Node-Based UI for Stable Diffusion & FluxMis à jour 6 septembre 2026
- Apple Silicon vs NVIDIA GPU for Local LLMs 2026: Performance, Cost, Workflow ComparedMis à jour 1 septembre 2026
- Local AI Images Are Free. Cloud AI Images Are Instant. Your GPU Decides.Mis à jour 21 août 2026
T2I-Adapter
- Idéal pour:
- Types de conditionnement similaires (esquisse, profondeur, Canny) avec une inférence plus rapide et moins de VRAM
- Surcharge VRAM:
- Nettement inférieure à ControlNet
- Licence / coût:
- Gratuit, à poids ouverts
- Compromis clé:
- Modèle plus petit, généralement considéré comme un peu moins précis que ControlNet dans les comparaisons communautaires
IP-Adapter
- Idéal pour:
- Conditionner sur le style ou le sujet d'une image de référence plutôt que sur sa structure
- Surcharge VRAM:
- Faible — adaptateur d'attention croisée léger
- Licence / coût:
- Gratuit, à poids ouverts
- Compromis clé:
- Contrôle l'apparence/le transfert de style, pas la pose ni la composition — souvent utilisé avec ControlNet, pas à sa place
Prompt engineering seul (sans module de conditionnement)
- Idéal pour:
- Compositions simples où la pose ou la disposition exacte importent peu
- Surcharge VRAM:
- Aucune
- Licence / coût:
- Non applicable
- Compromis clé:
- Aucun moyen fiable de fixer une pose exacte, un angle de caméra ou un placement d'objet par les mots seuls
À qui s'adresse ControlNet
- Au lecteur qui a besoin d'une pose exacte, d'un angle de caméra ou d'un placement d'objet précis. ControlNet est le moyen le plus direct de fixer une image générée sur une structure spécifique que la seule formulation du prompt ne peut reproduire de façon fiable.
- Au lecteur déjà à l'aise avec une interface Stable Diffusion. Pour qui utilise déjà AUTOMATIC1111, ComfyUI ou InvokeAI, ajouter ControlNet consiste à télécharger un checkpoint et à régler un paramètre, pas à apprendre une nouvelle plateforme.
- Aux illustrateurs et concept artists partant d'esquisses. Le conditionnement par gribouillis et lineart permet à une esquisse approximative ou à un dessin au trait net de guider directement la composition finale.
- Aux photographes ou artistes 3D réutilisant une géométrie de référence. Le conditionnement par profondeur et normal map reporte l'agencement spatial d'une photo de référence ou d'un rendu 3D vers une nouvelle image stylisée.
- Aux petites entreprises ou particuliers sous le seuil de chiffre d'affaires concerné. Le code Apache-2.0 comme les checkpoints sous licence openrail/Apache-2.0 permettent un usage commercial sans abonnement à cette échelle ; les checkpoints sous Stability Community License aussi, jusqu'à 1 000 000 USD de chiffre d'affaires annuel avec inscription.
À qui ControlNet ne convient pas
- Au débutant absolu qui n'a pas encore configuré d'interface Stable Diffusion. ControlNet ajoute une véritable étape de configuration supplémentaire à une installation locale déjà non triviale — familiarisez-vous d'abord avec des prompts simples, puis ajoutez ControlNet une fois ce flux maîtrisé.
- Au lecteur qui veut une application en un clic, sans configuration. Il n'existe pas d'application ControlNet ; c'est un module ajouté à une interface existante, et chaque interface l'expose un peu différemment. Qui veut zéro configuration devrait plutôt envisager un outil cloud.
- Au lecteur qui compte uniquement sur la formulation du prompt pour des images simples. Si la pose ou la disposition exacte importent peu pour l'usage visé, le prompt engineering seul est plus rapide et évite la VRAM et la configuration supplémentaires qu'exige ControlNet.
- Au lecteur avec un GPU limité en VRAM déjà proche de sa limite avec le modèle de base. ControlNet ajoute une surcharge VRAM notable en plus de Stable Diffusion lui-même — voir Matériel et VRAM — et une option plus légère comme T2I-Adapter pourrait mieux convenir.
- À l'organisation au-dessus du seuil de chiffre d'affaires concerné qui prévoit d'utiliser les ControlNets officiels SD 3.5 de Stability AI. La Stability AI Community License exige une licence Enterprise au-delà de 1 000 000 USD de chiffre d'affaires annuel — prévoyez cette négociation, ou utilisez plutôt un checkpoint SDXL sous licence Apache-2.0 si cela convient à l'usage visé.
Questions fréquentes
Qu'est-ce que ControlNet ?
ControlNet est une architecture de réseau de neurones qui ajoute un conditionnement structurel précis — pose, profondeur, cartes de contours, gribouillis, segmentation et plus encore — à la génération d'images Stable Diffusion. Il a été présenté dans l'article « Adding Conditional Control to Text-to-Image Diffusion Models » de Lvmin Zhang, Anyi Rao et Maneesh Agrawala, de l'université Stanford, publié à l'ICCV 2023.
ControlNet est-il une application autonome ?
Non. ControlNet est une technique dotée d'une implémentation de référence, distribuée sous forme de code et de checkpoints de modèle plutôt que comme une application grand public. Pour l'utiliser, on l'installe dans une interface Stable Diffusion déjà utilisée — l'extension communautaire sd-webui-controlnet pour AUTOMATIC1111, des nœuds natifs dans ComfyUI, ou des Control Layers intégrées dans InvokeAI.
ControlNet est-il gratuit ?
Oui. Le code de référence sur GitHub est sous licence Apache License 2.0, une licence open source sans restriction, et il n'existe pas de produit ControlNet payant séparé. Les checkpoints de modèle individuels portent leurs propres licences, qui varient selon la version de base de Stable Diffusion ciblée — voir la section licence pour les détails.
Puis-je utiliser ControlNet commercialement ?
Cela dépend du checkpoint précis. Les checkpoints ControlNet SD 1.5 d'origine sont listés comme « openrail », autorisant l'usage commercial sous réserve de restrictions de contenu. Les checkpoints SDXL communautaires (comme ceux du compte xinsir) sont généralement sous Apache License 2.0 sans restriction. Les ControlNets officiels SD 3.5 Large de Stability AI utilisent la Stability AI Community License, gratuite sous 1 000 000 USD de chiffre d'affaires annuel avec inscription, nécessitant une licence Enterprise au-delà de ce seuil. Vérifiez toujours la page de licence du checkpoint précis avant un usage commercial.
Qui a créé ControlNet ?
ControlNet a été présenté par Lvmin Zhang, Anyi Rao et Maneesh Agrawala, de l'université Stanford, dans l'article « Adding Conditional Control to Text-to-Image Diffusion Models », publié à l'ICCV 2023, où il a remporté le Marr Prize du meilleur article de la conférence. Lvmin Zhang, qui publie sous le compte GitHub lllyasviel, a également créé Fooocus, une interface Stable Diffusion simplifiée.
Quelles interfaces Stable Diffusion prennent en charge ControlNet ?
La Stable Diffusion WebUI d'AUTOMATIC1111 prend en charge ControlNet via l'extension communautaire sd-webui-controlnet (non intégrée par défaut). ComfyUI inclut des nœuds liés à ControlNet nativement dans son cœur. InvokeAI intègre ControlNet sous forme de Control Layers intégrées dans son flux de canevas. Fooocus, créé par le créateur de ControlNet, inclut ses propres fonctionnalités simplifiées de guidage structurel basées sur ControlNet plutôt que d'exposer la sélection brute des modèles.
Quels types de conditionnement ControlNet prend-il en charge ?
ControlNet 1.1 inclut des modèles pour la détection de contours Canny, les cartes de profondeur, les squelettes de pose humaine OpenPose, les gribouillis, les cartes de segmentation, le lineart, la détection soft edge (HED), les normal maps, ainsi que des types spécialisés supplémentaires comme M-LSD (lignes droites), Shuffle, Inpaint et Tile.
Quelle surcharge de VRAM ControlNet entraîne-t-il ?
Il ajoute de la VRAM en plus du modèle de base Stable Diffusion plutôt que de remplacer cette exigence. Les retours communautaires décrivent généralement environ 1 à 2 Go de VRAM supplémentaire par modèle ControlNet sur Stable Diffusion 1.5, et une hausse plus importante sur SDXL en raison de ses couches d'encodage plus grandes. L'utilisation simultanée de plusieurs modèles ControlNet cumule encore cette surcharge ; ce sont des fourchettes de planification, pas un benchmark contrôlé mené par PromptQuorum lui-même.
Quelle est la différence entre ControlNet, T2I-Adapter et IP-Adapter ?
ControlNet et T2I-Adapter conditionnent tous deux la génération sur des entrées structurelles comme les contours, la profondeur ou la pose, mais T2I-Adapter utilise une architecture plus petite avec moins de surcharge VRAM et une inférence plus rapide, au prix d'un peu de précision dans les comparaisons communautaires. IP-Adapter conditionne sur le style ou l'apparence du sujet d'une image de référence plutôt que sur sa structure, et est généralement combiné avec ControlNet plutôt qu'utilisé à sa place.
Verdict
ControlNet a mérité sa place comme moyen standard d'ajouter un contrôle structurel précis à Stable Diffusion — non pas comme un produit en soi, mais comme une technique de recherche bien documentée entourée d'un vaste écosystème de checkpoints construit depuis ses débuts à l'ICCV 2023. Qui utilise déjà AUTOMATIC1111, ComfyUI ou InvokeAI peut ajouter un conditionnement par pose, profondeur, contours ou gribouillis sans changer de plateforme, et le code sous-jacent porte une licence Apache-2.0 sans restriction. Le compromis est réel : ce n'est pas une application, cela ajoute une véritable étape de configuration et une surcharge VRAM notable en plus du modèle de base, et la licence n'a pas de réponse unique — elle dépend du checkpoint téléchargé, du « openrail » des plus anciens modèles SD 1.5 jusqu'à la Stability AI Community License plafonnée selon le chiffre d'affaires des ControlNets propres à SD 3.5 de Stability. Qui recherche une surcharge VRAM plus légère pour un contrôle structurel comparable devrait aussi évaluer T2I-Adapter ; qui n'a pas encore configuré d'interface Stable Diffusion devrait commencer par là, car ControlNet seul n'a rien où se greffer. Pour quiconque génère déjà des images localement et a besoin de plus de contrôle que ce que la seule formulation du prompt permet, ControlNet reste le moyen le plus solidement pris en charge d'y parvenir.
Sources
- « Adding Conditional Control to Text-to-Image Diffusion Models » — arXiv:2302.05543 — l'article original de Lvmin Zhang, Anyi Rao et Maneesh Agrawala.
- ControlNet — ICCV 2023 Open Access (CVF) — fiche officielle de publication de la conférence.
- Computer Vision Foundation — Awards — confirmation officielle du Marr Prize (meilleur article) de l'ICCV 2023.
- lllyasviel/ControlNet sur GitHub — implémentation de référence et licence de code Apache License 2.0.
- lllyasviel/ControlNet-v1-1-nightly sur GitHub — documentation des types de conditionnement de ControlNet 1.1.
- lllyasviel/ControlNet sur Hugging Face — téléchargements des checkpoints SD 1.5 d'origine et licence « openrail ».
- xinsir/controlnet-canny-sdxl-1.0 sur Hugging Face — exemple de checkpoint ControlNet SDXL communautaire et sa licence Apache-2.0.
- stabilityai/stable-diffusion-3.5-large-controlnet-depth sur Hugging Face — le ControlNet officiel SD 3.5 de Stability AI et les conditions de sa Community License.
- Stability AI — ControlNets for Stable Diffusion 3.5 Large — annonce officielle, 26 novembre 2024.
- Mikubill/sd-webui-controlnet sur GitHub — l'extension communautaire ControlNet pour AUTOMATIC1111.
- Fooocus sur GitHub — l'interface Stable Diffusion simplifiée du créateur de ControlNet, Lvmin Zhang.
