Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/ControlNet : Test (2026) : contrôle structurel pour Stable Diffusion
Image & Video Generation

ControlNet : Test (2026) : contrôle structurel pour Stable Diffusion

·12 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

ControlNet est une architecture de réseau de neurones qui ajoute un guidage structurel précis — un squelette de pose, une carte de profondeur, un contour de bords, un gribouillis — à la génération d'images Stable Diffusion, afin qu'une image générée suive cette structure plutôt que de dépendre uniquement du prompt textuel. Il a été présenté dans l'article de l'ICCV 2023 « Adding Conditional Control to Text-to-Image Diffusion Models » de Lvmin Zhang, Anyi Rao et Maneesh Agrawala (université Stanford), qui a remporté le Marr Prize du meilleur article de la conférence. ControlNet n'est pas une application autonome — il est distribué sous forme de code (licence Apache 2.0) et de checkpoints de modèle (licence variable selon le checkpoint) qui s'installent dans une interface Stable Diffusion déjà utilisée, comme AUTOMATIC1111 via une extension communautaire, ComfyUI via des nœuds natifs, ou InvokeAI via des Control Layers intégrées. Vérifiez les licences actuelles des checkpoints sur Hugging Face avant tout usage commercial.

ControlNet est une architecture de réseau de neurones qui ajoute un conditionnement structurel précis — pose, profondeur, cartes de contours, gribouillis, segmentation — à la génération d'images avec Stable Diffusion, en donnant à un modèle texte-image une seconde entrée en plus du prompt. Il a été présenté dans l'article Adding Conditional Control to Text-to-Image Diffusion Models de Lvmin Zhang, Anyi Rao et Maneesh Agrawala, de l'université Stanford, publié à l'ICCV 2023. ControlNet n'est pas une application téléchargeable : c'est une technique dotée d'une implémentation de référence sur GitHub, distribuée sous forme de poids de modèle qui s'intègrent à une interface Stable Diffusion déjà installée — AUTOMATIC1111, ComfyUI ou InvokeAI. Ce test explique ce qu'est réellement ControlNet, ses véritables conditions de licence (qui diffèrent entre le code, les checkpoints d'origine et les checkpoints communautaires ou officiels plus récents), les types de conditionnement disponibles, où trouver les poids, et comment il se compare aux techniques de conditionnement plus récentes.

ControlNet : Test (2026) : contrôle structurel pour Stable Diffusion

Points clés

  • ControlNet est une architecture de réseau de neurones — pas une application — qui ajoute un conditionnement structurel précis (pose, profondeur, contours, gribouillis, segmentation) à Stable Diffusion, afin qu'une image générée suive cette structure et pas uniquement le libellé du prompt.
  • Il provient de l'article « Adding Conditional Control to Text-to-Image Diffusion Models » de Lvmin Zhang, Anyi Rao et Maneesh Agrawala, de l'université Stanford, publié à l'ICCV 2023, où il a remporté le Marr Prize du meilleur article de la conférence.
  • Le même chercheur, Lvmin Zhang (compte GitHub lllyasviel), a aussi créé Fooocus, une interface Stable Diffusion simplifiée.
  • La licence n'est pas unique : le code de référence est sous Apache License 2.0, les checkpoints SD 1.5 d'origine sont listés comme « openrail » sur Hugging Face, les checkpoints SDXL communautaires (par exemple du compte xinsir) sont généralement en Apache-2.0, et les ControlNets officiels SD 3.5 Large de Stability AI utilisent la Stability AI Community License, plafonnée selon le chiffre d'affaires — vérifiez la licence de chaque checkpoint avant tout usage commercial.
  • Pour l'utiliser, il faut une interface déjà installée : AUTOMATIC1111 via l'extension communautaire sd-webui-controlnet, ComfyUI via des nœuds de base natifs, ou InvokeAI via des Control Layers intégrées.
  • C'est gratuit et à poids ouverts, sans produit ControlNet payant séparé — le seul coût est votre propre GPU et l'électricité via l'interface utilisée.

Ce qu'est ControlNet

ControlNet fonctionne en dupliquant les couches d'encodage d'un modèle de diffusion pré-entraîné et en connectant la copie au réseau d'origine via ce que l'article appelle des couches de « convolution zéro » — des couches de convolution dont les poids démarrent à zéro, de sorte que l'entraînement part du comportement exact du modèle de base et n'apprend que progressivement le nouveau signal de conditionnement. Les poids du modèle d'origine restent gelés pendant ce processus, ce qui explique pourquoi l'ajout de ControlNet ne dégrade pas la qualité d'image du modèle de base Stable Diffusion.

En pratique, cela signifie que le pipeline reçoit deux entrées au lieu d'une : un prompt textuel (comme d'habitude) et une image de contrôle — un squelette de pose, une carte de profondeur, un contour de bords ou un gribouillis approximatif. Le résultat suit la composition et la structure de l'image de contrôle tout en intégrant le style et la description du sujet du prompt.

ControlNet n'est pas une application finie. L'article décrit une architecture, et le dépôt GitHub de référence fournit le code et des poids de modèle pré-entraînés, mais il n'existe aucun installateur ControlNet sur lequel double-cliquer. Pour l'utiliser réellement, on l'installe comme extension ou fonctionnalité intégrée dans une interface Stable Diffusion déjà utilisée — voir Installer et utiliser ControlNet ci-dessous.

L'auteur principal, Lvmin Zhang, est chercheur affilié à l'université Stanford (avec des études antérieures à la Chinese University of Hong Kong et à la Soochow University), qui publie sous le compte GitHub lllyasviel. La même personne a aussi créé Fooocus, une interface Stable Diffusion simplifiée conçue pour obtenir une première image en le moins de clics possible — un lien utile à connaître si vous utilisez les deux projets, certains choix de conception se retrouvant parfois de l'un à l'autre.

📍 En une phrase

ControlNet est une architecture de réseau de neurones qui ajoute une entrée supplémentaire précisément formée — une carte de contours, une carte de profondeur, un squelette de pose ou un gribouillis — à un modèle Stable Diffusion pré-entraîné, afin que le résultat suive cette structure plutôt que de dépendre uniquement du prompt textuel.

💬 En termes simples

Un prompt textuel indique à un artiste, en mots, quoi dessiner ; une entrée ControlNet lui remet un contour calqué à redessiner — le contour fixe la pose et la composition, tandis que le prompt continue de déterminer le style et le contenu.

La recherche à l'origine de ControlNet

Le code et les premiers poids pré-entraînés de ControlNet ont été publiés sur GitHub en février 2023, en même temps que la prépublication arXiv. Une version plus aboutie, « ControlNet 1.1 », a suivi le 14 avril 2023, élargissant les types de conditionnement pris en charge et améliorant leur robustesse. L'article a été officiellement publié à l'ICCV 2023 et a reçu le Marr Prize de la conférence, confirmé sur la page officielle des récompenses de la Computer Vision Foundation.

ControlNet a été conçu autour de l'architecture originale de Stable Diffusion 1.5 et démontré d'abord sur celle-ci. La communauté open source — puis Stability AI elle-même — a ensuite entraîné des checkpoints ControlNet supplémentaires pour des modèles de base plus récents, dont Stable Diffusion XL et Stable Diffusion 3.5, étendant la même technique de conditionnement à chaque nouvelle génération de modèle. Voir Test de Stable Diffusion pour le contexte sur ces modèles de base.

Titre de l'article

Fait vérifié:
« Adding Conditional Control to Text-to-Image Diffusion Models »

Auteurs

Fait vérifié:
Lvmin Zhang, Anyi Rao, Maneesh Agrawala

Institution

Fait vérifié:
Université Stanford

ID arXiv

Fait vérifié:
2302.05543

Conférence

Fait vérifié:
ICCV 2023 (IEEE/CVF International Conference on Computer Vision)

Récompense

Fait vérifié:
Marr Prize — meilleur article de l'ICCV 2023

Licence du code

Fait vérifié:
Apache License 2.0

Faits vérifiés directement sur arxiv.org, le dépôt GitHub lllyasviel/ControlNet, la page d'accès libre CVF de l'ICCV 2023 et la liste officielle des récompenses sur thecvf.com le 2026-09-06.

Types de conditionnement ControlNet

ControlNet 1.1 comprend aussi des modèles spécialisés supplémentaires au-delà de cet ensemble de base, comme M-LSD (détection de lignes droites pour l'architecture et l'intérieur), Shuffle (recomposition préservant le contenu), Inpaint et Tile (amélioration du détail pour les flux d'upscaling). Chaque type de conditionnement est un fichier de modèle distinct — on charge celui qui correspond à l'image de contrôle, pas un modèle universel unique.

📍 En une phrase

ControlNet 1.1 propose des modèles distincts pour différents types de conditionnement — contours Canny, profondeur, pose humaine, gribouillis, segmentation, lineart, soft edge et normal map sont les plus utilisés.

Contours Canny

Ce qu'il contrôle:
Reprend les contours détectés d'une image de référence pour préserver la structure en changeant le style

Profondeur

Ce qu'il contrôle:
Utilise une carte de profondeur pour préserver l'agencement spatial et la perspective

OpenPose

Ce qu'il contrôle:
Extrait un squelette de pose humaine (corps, mains, points clés du visage) pour fixer la pose du personnage

Gribouillis (Scribble)

Ce qu'il contrôle:
Suit une esquisse approximative dessinée à la main comme guide de composition souple

Segmentation

Ce qu'il contrôle:
Utilise des cartes de régions codées par couleur pour fixer l'emplacement de chaque objet ou surface

Lineart

Ce qu'il contrôle:
Suit des contours de line art nets, courants dans les flux d'illustration

Soft edge (HED)

Ce qu'il contrôle:
Utilise une détection de contours plus souple et moins rigide que Canny pour une structure plus flexible

Normal map

Ce qu'il contrôle:
Encode les données d'orientation de surface, utile pour des travaux proches de la 3D ou de texturage

Noms de modèles et comportement vérifiés à partir de la documentation du dépôt lllyasviel/ControlNet-v1-1-nightly. Les types proposés par défaut varient selon l'interface — consultez la liste de modèles propre à celle-ci.

Comment installer et utiliser ControlNet dans AUTOMATIC1111 ou ComfyUI

L'installation de ControlNet diffère selon l'interface, car ce n'est pas un installateur autonome. Les deux chemins les plus courants sont décrits ci-dessous.

  1. 1
    Vérifier qu'une interface Stable Diffusion fonctionne déjà
    Why it matters: ControlNet n'a rien où se greffer si AUTOMATIC1111, ComfyUI ou InvokeAI ne sont pas déjà installés et ne génèrent pas d'images — voir [Test de Stable Diffusion](/power-local-llm/stable-diffusion-review) si ce n'est pas encore fait.
  2. 2
    Installer l'extension ControlNet (AUTOMATIC1111) ou vérifier la prise en charge native (ComfyUI/InvokeAI)
    Why it matters: AUTOMATIC1111 n'inclut pas ControlNet par défaut — ajoutez l'extension communautaire [sd-webui-controlnet](https://github.com/Mikubill/sd-webui-controlnet) depuis l'onglet Extensions. ComfyUI inclut des nœuds liés à ControlNet dans son cœur ; InvokeAI expose ControlNet via sa fonctionnalité intégrée de Control Layers, donc aucune extension séparée n'est nécessaire dans les deux cas.
  3. 3
    Télécharger un checkpoint ControlNet correspondant au modèle de base
    Why it matters: Un checkpoint entraîné pour SD 1.5 ne fonctionnera pas correctement avec SDXL ou SD 3.5 — faites correspondre le modèle ControlNet à la version de Stable Diffusion utilisée, et vérifiez sa licence avant de le télécharger (voir la section licence ci-dessous).
  4. 4
    Placer le checkpoint dans le bon dossier de modèles
    Why it matters: AUTOMATIC1111 attend les modèles ControlNet dans `extensions/sd-webui-controlnet/models` ; ComfyUI et InvokeAI utilisent leurs propres répertoires de modèles documentés — consultez le guide d'installation actuel de cette interface pour le chemin exact.
  5. 5
    Choisir un type de conditionnement et fournir une image de contrôle
    Why it matters: Sélectionnez le préprocesseur correspondant (Canny, profondeur, OpenPose, etc.) pour votre image de contrôle, ou laissez l'interface en générer une automatiquement à partir d'une photo de référence téléchargée.
  6. 6
    Régler le poids/la force de ControlNet et générer
    Why it matters: Une force plus faible laisse le prompt influencer davantage la composition ; une force plus élevée verrouille davantage le résultat sur l'image de contrôle — la plupart des interfaces utilisent par défaut une valeur médiane ajustable selon le résultat.

Licence ControlNet : code vs poids du modèle

C'est l'élément le plus important à vérifier avant d'utiliser ControlNet dans un produit commercial : la licence n'est pas un chiffre unique. Le code de l'implémentation de référence est sous Apache License 2.0, une licence permissive sans restriction. Mais le checkpoint de modèle téléchargé est un fichier distinct avec sa propre licence, qui reflète généralement la famille de licence du modèle de base Stable Diffusion pour lequel le checkpoint a été entraîné.

Les checkpoints ControlNet d'origine pour Stable Diffusion 1.5, publiés sous le compte lllyasviel sur Hugging Face, sont listés comme « openrail » — la même famille de licence CreativeML OpenRAIL-M que SD 1.5 lui-même, qui autorise l'usage commercial sous réserve de restrictions de contenu liées à l'usage plutôt qu'un plafond de chiffre d'affaires.

Les checkpoints ControlNet SDXL entraînés par la communauté, comme les modèles largement utilisés publiés sous le compte xinsir sur Hugging Face, sont généralement publiés sous la simple Apache License 2.0 — vérifiez la fiche du modèle concerné, différents auteurs communautaires pouvant choisir des conditions différentes pour leurs propres checkpoints.

Les ControlNets officiels de Stability AI pour Stable Diffusion 3.5 Large — pour les conditionnements Blur, Canny et Depth, publiés le 26 novembre 2024 — portent la Stability AI Community License, la même licence plafonnée selon le chiffre d'affaires que SD 3.5 lui-même : gratuite pour les particuliers et organisations sous 1 000 000 USD de chiffre d'affaires annuel agrégé avec inscription, et nécessitant une licence Enterprise au-delà de ce seuil.

📍 En une phrase

Le code de référence de ControlNet sur GitHub est sous licence Apache License 2.0, mais les checkpoints de modèle réellement téléchargés portent des licences différentes selon la version de base de Stable Diffusion et l'organisation qui les a entraînés.

💬 En termes simples

La recette (le code) est de l'open source sans restriction ; les ingrédients précis (les poids du modèle) portent chacun leur propre étiquette — lisez l'étiquette du checkpoint téléchargé, pas seulement la licence du code.

Code de référence ControlNet (GitHub)

Licence:
Apache License 2.0
Usage commercial:
Autorisé, sans restriction

Checkpoints ControlNet SD 1.5 d'origine (lllyasviel sur Hugging Face)

Licence:
« openrail » (famille CreativeML OpenRAIL-M, héritée de Stable Diffusion)
Usage commercial:
Autorisé, sous réserve de restrictions de contenu liées à l'usage

Checkpoints SDXL communautaires (ex. compte xinsir)

Licence:
Généralement Apache License 2.0
Usage commercial:
Autorisé, sans restriction — à vérifier par checkpoint

ControlNets officiels SD 3.5 Large de Stability AI

Licence:
Stability AI Community License
Usage commercial:
Gratuit sous 1 000 000 USD de chiffre d'affaires annuel avec inscription ; licence Enterprise requise au-delà

Les conditions de licence sont un texte juridique, pas un argument marketing — cette section résume des conditions publiées publiquement au 2026-09-06 mais ne constitue pas un conseil juridique. Lisez toujours le fichier LICENSE réel ou la fiche de modèle Hugging Face du checkpoint précis envisagé avant tout déploiement commercial.

Matériel et VRAM avec ControlNet

ControlNet ajoute un ensemble dupliqué de couches d'encodage au-dessus du modèle Stable Diffusion utilisé, ce qui augmente l'utilisation de VRAM en plus de l'exigence propre du modèle de base plutôt que de la remplacer.

Les retours de la communauté et la documentation des interfaces décrivent généralement environ 1 à 2 Go de VRAM supplémentaire pour un seul modèle ControlNet sur Stable Diffusion 1.5, et une hausse plus importante — souvent citée autour de 2 à 4 Go par modèle — sur SDXL, dont les couches d'encodage plus grandes sont plus coûteuses à dupliquer. L'utilisation simultanée de plusieurs modèles ControlNet (par exemple profondeur, pose et Canny en même temps) cumule encore cette surcharge. Des alternatives plus légères comme T2I-Adapter (voir la section alternatives ci-dessous) sont conçues pour ajouter nettement moins de surcharge VRAM que ControlNet, au prix d'un contrôle un peu moins précis dans certaines comparaisons communautaires.

Ces chiffres provenant de tests communautaires et non d'un test contrôlé mené par PromptQuorum lui-même, traitez-les comme des fourchettes de planification : vérifiez le comportement VRAM actuel dans la documentation ou le suivi des problèmes de votre interface spécifique avant de supposer qu'un GPU à la limite gérera une combinaison donnée de modèle de base et de ControlNet.

Tarifs : gratuit et à poids ouverts

ControlNet n'a pas de prix distinct — il est gratuit et à poids ouverts, distribué sous forme de code et de checkpoints de modèle plutôt que comme un produit avec son propre abonnement ou frais de licence. Il n'existe aucune offre payante, aucun abonnement ni service ControlNet hébergé suivi par PromptQuorum de la part de l'équipe de recherche d'origine.

Le coût réel est celui de l'interface Stable Diffusion déjà utilisée (AUTOMATIC1111, ComfyUI et InvokeAI sont elles-mêmes gratuites et open source) plus votre propre matériel GPU et l'électricité. Le seul coût récurrent envisageable est celui d'un service GPU hébergé ou cloud choisi pour exécuter cette interface, sans rapport avec ControlNet lui-même.

ControlNet face aux techniques de conditionnement alternatives

ControlNet, T2I-Adapter et IP-Adapter ne s'excluent pas mutuellement — de nombreux flux de travail combinent ControlNet (pour la pose ou la composition) avec IP-Adapter (pour la cohérence de style ou de personnage) dans la même génération. La combinaison pertinente dépend de ce que l'on cherche à fixer : la structure (ControlNet, T2I-Adapter) ou l'apparence (IP-Adapter).

Pour le choix du modèle de base Stable Diffusion auquel ces techniques se rattachent, voir Test de Stable Diffusion. Pour une comparaison plus large entre génération d'images locale et cloud, voir Génération d'images IA locale vs cloud.

Côté interfaces, ComfyUI dispose de nœuds ControlNet natifs sans extension séparée nécessaire ; AUTOMATIC1111 nécessite l'extension communautaire sd-webui-controlnet ; InvokeAI l'intègre sous forme de Control Layers intégrées dans son canevas ; et Fooocus — créé par le même chercheur qui a créé ControlNet — inclut ses propres fonctionnalités simplifiées de guidage structurel basées sur ControlNet plutôt que d'exposer la sélection brute des modèles ControlNet.

ControlNet

Idéal pour:
Contrôle structurel le plus précis, plus large éventail de types de conditionnement, plus vaste écosystème de checkpoints pré-entraînés
Surcharge VRAM:
Plus élevée — environ 1 à 4 Go par modèle selon le modèle de base
Licence / coût:
Code Apache-2.0 ; licence du checkpoint variable (openrail / Apache-2.0 / Stability Community License)
Compromis clé:
Plus de VRAM et de configuration que des adaptateurs plus légers ; la licence du checkpoint doit être vérifiée fichier par fichier
Articles sur ControlNet (5)

Également mentionné dans :

T2I-Adapter

Idéal pour:
Types de conditionnement similaires (esquisse, profondeur, Canny) avec une inférence plus rapide et moins de VRAM
Surcharge VRAM:
Nettement inférieure à ControlNet
Licence / coût:
Gratuit, à poids ouverts
Compromis clé:
Modèle plus petit, généralement considéré comme un peu moins précis que ControlNet dans les comparaisons communautaires

IP-Adapter

Idéal pour:
Conditionner sur le style ou le sujet d'une image de référence plutôt que sur sa structure
Surcharge VRAM:
Faible — adaptateur d'attention croisée léger
Licence / coût:
Gratuit, à poids ouverts
Compromis clé:
Contrôle l'apparence/le transfert de style, pas la pose ni la composition — souvent utilisé avec ControlNet, pas à sa place

Prompt engineering seul (sans module de conditionnement)

Idéal pour:
Compositions simples où la pose ou la disposition exacte importent peu
Surcharge VRAM:
Aucune
Licence / coût:
Non applicable
Compromis clé:
Aucun moyen fiable de fixer une pose exacte, un angle de caméra ou un placement d'objet par les mots seuls

À qui s'adresse ControlNet

  • Au lecteur qui a besoin d'une pose exacte, d'un angle de caméra ou d'un placement d'objet précis. ControlNet est le moyen le plus direct de fixer une image générée sur une structure spécifique que la seule formulation du prompt ne peut reproduire de façon fiable.
  • Au lecteur déjà à l'aise avec une interface Stable Diffusion. Pour qui utilise déjà AUTOMATIC1111, ComfyUI ou InvokeAI, ajouter ControlNet consiste à télécharger un checkpoint et à régler un paramètre, pas à apprendre une nouvelle plateforme.
  • Aux illustrateurs et concept artists partant d'esquisses. Le conditionnement par gribouillis et lineart permet à une esquisse approximative ou à un dessin au trait net de guider directement la composition finale.
  • Aux photographes ou artistes 3D réutilisant une géométrie de référence. Le conditionnement par profondeur et normal map reporte l'agencement spatial d'une photo de référence ou d'un rendu 3D vers une nouvelle image stylisée.
  • Aux petites entreprises ou particuliers sous le seuil de chiffre d'affaires concerné. Le code Apache-2.0 comme les checkpoints sous licence openrail/Apache-2.0 permettent un usage commercial sans abonnement à cette échelle ; les checkpoints sous Stability Community License aussi, jusqu'à 1 000 000 USD de chiffre d'affaires annuel avec inscription.

À qui ControlNet ne convient pas

  • Au débutant absolu qui n'a pas encore configuré d'interface Stable Diffusion. ControlNet ajoute une véritable étape de configuration supplémentaire à une installation locale déjà non triviale — familiarisez-vous d'abord avec des prompts simples, puis ajoutez ControlNet une fois ce flux maîtrisé.
  • Au lecteur qui veut une application en un clic, sans configuration. Il n'existe pas d'application ControlNet ; c'est un module ajouté à une interface existante, et chaque interface l'expose un peu différemment. Qui veut zéro configuration devrait plutôt envisager un outil cloud.
  • Au lecteur qui compte uniquement sur la formulation du prompt pour des images simples. Si la pose ou la disposition exacte importent peu pour l'usage visé, le prompt engineering seul est plus rapide et évite la VRAM et la configuration supplémentaires qu'exige ControlNet.
  • Au lecteur avec un GPU limité en VRAM déjà proche de sa limite avec le modèle de base. ControlNet ajoute une surcharge VRAM notable en plus de Stable Diffusion lui-même — voir Matériel et VRAM — et une option plus légère comme T2I-Adapter pourrait mieux convenir.
  • À l'organisation au-dessus du seuil de chiffre d'affaires concerné qui prévoit d'utiliser les ControlNets officiels SD 3.5 de Stability AI. La Stability AI Community License exige une licence Enterprise au-delà de 1 000 000 USD de chiffre d'affaires annuel — prévoyez cette négociation, ou utilisez plutôt un checkpoint SDXL sous licence Apache-2.0 si cela convient à l'usage visé.

Questions fréquentes

Qu'est-ce que ControlNet ?

ControlNet est une architecture de réseau de neurones qui ajoute un conditionnement structurel précis — pose, profondeur, cartes de contours, gribouillis, segmentation et plus encore — à la génération d'images Stable Diffusion. Il a été présenté dans l'article « Adding Conditional Control to Text-to-Image Diffusion Models » de Lvmin Zhang, Anyi Rao et Maneesh Agrawala, de l'université Stanford, publié à l'ICCV 2023.

ControlNet est-il une application autonome ?

Non. ControlNet est une technique dotée d'une implémentation de référence, distribuée sous forme de code et de checkpoints de modèle plutôt que comme une application grand public. Pour l'utiliser, on l'installe dans une interface Stable Diffusion déjà utilisée — l'extension communautaire sd-webui-controlnet pour AUTOMATIC1111, des nœuds natifs dans ComfyUI, ou des Control Layers intégrées dans InvokeAI.

ControlNet est-il gratuit ?

Oui. Le code de référence sur GitHub est sous licence Apache License 2.0, une licence open source sans restriction, et il n'existe pas de produit ControlNet payant séparé. Les checkpoints de modèle individuels portent leurs propres licences, qui varient selon la version de base de Stable Diffusion ciblée — voir la section licence pour les détails.

Puis-je utiliser ControlNet commercialement ?

Cela dépend du checkpoint précis. Les checkpoints ControlNet SD 1.5 d'origine sont listés comme « openrail », autorisant l'usage commercial sous réserve de restrictions de contenu. Les checkpoints SDXL communautaires (comme ceux du compte xinsir) sont généralement sous Apache License 2.0 sans restriction. Les ControlNets officiels SD 3.5 Large de Stability AI utilisent la Stability AI Community License, gratuite sous 1 000 000 USD de chiffre d'affaires annuel avec inscription, nécessitant une licence Enterprise au-delà de ce seuil. Vérifiez toujours la page de licence du checkpoint précis avant un usage commercial.

Qui a créé ControlNet ?

ControlNet a été présenté par Lvmin Zhang, Anyi Rao et Maneesh Agrawala, de l'université Stanford, dans l'article « Adding Conditional Control to Text-to-Image Diffusion Models », publié à l'ICCV 2023, où il a remporté le Marr Prize du meilleur article de la conférence. Lvmin Zhang, qui publie sous le compte GitHub lllyasviel, a également créé Fooocus, une interface Stable Diffusion simplifiée.

Quelles interfaces Stable Diffusion prennent en charge ControlNet ?

La Stable Diffusion WebUI d'AUTOMATIC1111 prend en charge ControlNet via l'extension communautaire sd-webui-controlnet (non intégrée par défaut). ComfyUI inclut des nœuds liés à ControlNet nativement dans son cœur. InvokeAI intègre ControlNet sous forme de Control Layers intégrées dans son flux de canevas. Fooocus, créé par le créateur de ControlNet, inclut ses propres fonctionnalités simplifiées de guidage structurel basées sur ControlNet plutôt que d'exposer la sélection brute des modèles.

Quels types de conditionnement ControlNet prend-il en charge ?

ControlNet 1.1 inclut des modèles pour la détection de contours Canny, les cartes de profondeur, les squelettes de pose humaine OpenPose, les gribouillis, les cartes de segmentation, le lineart, la détection soft edge (HED), les normal maps, ainsi que des types spécialisés supplémentaires comme M-LSD (lignes droites), Shuffle, Inpaint et Tile.

Quelle surcharge de VRAM ControlNet entraîne-t-il ?

Il ajoute de la VRAM en plus du modèle de base Stable Diffusion plutôt que de remplacer cette exigence. Les retours communautaires décrivent généralement environ 1 à 2 Go de VRAM supplémentaire par modèle ControlNet sur Stable Diffusion 1.5, et une hausse plus importante sur SDXL en raison de ses couches d'encodage plus grandes. L'utilisation simultanée de plusieurs modèles ControlNet cumule encore cette surcharge ; ce sont des fourchettes de planification, pas un benchmark contrôlé mené par PromptQuorum lui-même.

Quelle est la différence entre ControlNet, T2I-Adapter et IP-Adapter ?

ControlNet et T2I-Adapter conditionnent tous deux la génération sur des entrées structurelles comme les contours, la profondeur ou la pose, mais T2I-Adapter utilise une architecture plus petite avec moins de surcharge VRAM et une inférence plus rapide, au prix d'un peu de précision dans les comparaisons communautaires. IP-Adapter conditionne sur le style ou l'apparence du sujet d'une image de référence plutôt que sur sa structure, et est généralement combiné avec ControlNet plutôt qu'utilisé à sa place.

Verdict

ControlNet a mérité sa place comme moyen standard d'ajouter un contrôle structurel précis à Stable Diffusion — non pas comme un produit en soi, mais comme une technique de recherche bien documentée entourée d'un vaste écosystème de checkpoints construit depuis ses débuts à l'ICCV 2023. Qui utilise déjà AUTOMATIC1111, ComfyUI ou InvokeAI peut ajouter un conditionnement par pose, profondeur, contours ou gribouillis sans changer de plateforme, et le code sous-jacent porte une licence Apache-2.0 sans restriction. Le compromis est réel : ce n'est pas une application, cela ajoute une véritable étape de configuration et une surcharge VRAM notable en plus du modèle de base, et la licence n'a pas de réponse unique — elle dépend du checkpoint téléchargé, du « openrail » des plus anciens modèles SD 1.5 jusqu'à la Stability AI Community License plafonnée selon le chiffre d'affaires des ControlNets propres à SD 3.5 de Stability. Qui recherche une surcharge VRAM plus légère pour un contrôle structurel comparable devrait aussi évaluer T2I-Adapter ; qui n'a pas encore configuré d'interface Stable Diffusion devrait commencer par là, car ControlNet seul n'a rien où se greffer. Pour quiconque génère déjà des images localement et a besoin de plus de contrôle que ce que la seule formulation du prompt permet, ControlNet reste le moyen le plus solidement pris en charge d'y parvenir.

Sources

← Retour aux LLM locaux avancés