Skip to main content
PromptQuorum
Início/LLMs locais avançados/ControlNet: Análise (2026): Controle Estrutural para o Stable Diffusion
Image & Video Generation

ControlNet: Análise (2026): Controle Estrutural para o Stable Diffusion

·12 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O ControlNet é uma arquitetura de rede neural que adiciona orientação estrutural precisa — um esqueleto de pose, um mapa de profundidade, um contorno de bordas, um rabisco — à geração de imagens do Stable Diffusion, para que a imagem gerada siga essa estrutura em vez de depender apenas do prompt de texto. Foi apresentado no artigo da ICCV 2023 "Adding Conditional Control to Text-to-Image Diffusion Models", de Lvmin Zhang, Anyi Rao e Maneesh Agrawala (Universidade Stanford), que ganhou o Marr Prize de melhor artigo da conferência. O ControlNet não é um aplicativo independente — é distribuído como código (Apache License 2.0) e checkpoints de modelo (a licença varia conforme o checkpoint) que se instalam em uma interface de Stable Diffusion já em uso, como o AUTOMATIC1111 via extensão da comunidade, o ComfyUI via nós nativos, ou o InvokeAI via Control Layers integradas. Verifique as licenças atuais dos checkpoints no Hugging Face antes de qualquer uso comercial.

O ControlNet é uma arquitetura de rede neural que adiciona condicionamento estrutural preciso — pose, profundidade, mapas de bordas, rabiscos, segmentação — à geração de imagens com Stable Diffusion, dando a um modelo texto-para-imagem uma segunda entrada além do prompt. Foi apresentado no artigo Adding Conditional Control to Text-to-Image Diffusion Models, de Lvmin Zhang, Anyi Rao e Maneesh Agrawala, da Universidade Stanford, publicado na ICCV 2023. O ControlNet não é um aplicativo para baixar: é uma técnica com implementação de referência no GitHub, distribuída como pesos de modelo que se conectam a uma interface de Stable Diffusion já instalada — AUTOMATIC1111, ComfyUI ou InvokeAI. Esta análise explica o que o ControlNet realmente é, seus termos reais de licença (que diferem entre o código, os checkpoints originais e checkpoints mais novos da comunidade/oficiais), os tipos de condicionamento disponíveis, onde obter os pesos, e como ele se compara a técnicas de condicionamento mais recentes.

ControlNet: Análise (2026): Controle Estrutural para o Stable Diffusion

Principais conclusões

  • O ControlNet é uma arquitetura de rede neural — não um app — que adiciona condicionamento estrutural preciso (pose, profundidade, bordas, rabiscos, segmentação) ao Stable Diffusion, para que a imagem gerada siga essa estrutura, não apenas o texto do prompt.
  • Vem do artigo "Adding Conditional Control to Text-to-Image Diffusion Models", de Lvmin Zhang, Anyi Rao e Maneesh Agrawala, da Universidade Stanford, publicado na ICCV 2023, onde ganhou o Marr Prize de melhor artigo da conferência.
  • O mesmo pesquisador, Lvmin Zhang (conta do GitHub lllyasviel), também criou o Fooocus, uma interface simplificada do Stable Diffusion.
  • A licença não é única: o código de referência é Apache License 2.0, os checkpoints originais de SD 1.5 aparecem como "openrail" no Hugging Face, os checkpoints de SDXL da comunidade (por exemplo, da conta xinsir) costumam ser Apache-2.0, e os ControlNets oficiais de SD 3.5 Large da Stability AI usam a Stability AI Community License, limitada por receita — verifique a licença de cada checkpoint antes de uso comercial.
  • Para usar, é preciso ter uma interface já instalada: AUTOMATIC1111 via extensão da comunidade sd-webui-controlnet, ComfyUI via nós principais nativos, ou InvokeAI via Control Layers integradas.
  • É gratuito e de pesos abertos, sem produto ControlNet pago separado — o único custo é sua própria GPU e eletricidade pela interface usada.

O que é o ControlNet

O ControlNet funciona duplicando as camadas de codificação de um modelo de difusão pré-treinado e conectando a cópia à rede original por meio do que o artigo chama de camadas de "convolução zero" — camadas convolucionais cujos pesos começam em zero, de modo que o treinamento parte exatamente do comportamento original do modelo base e aprende apenas gradualmente o novo sinal de condicionamento. Os pesos do modelo original permanecem congelados durante esse processo, por isso adicionar o ControlNet não degrada a qualidade de imagem do modelo base do Stable Diffusion.

Na prática, isso significa alimentar o pipeline com duas entradas em vez de uma: um prompt de texto (como de costume) e uma imagem de controle — um esqueleto de pose, um mapa de profundidade, um contorno de bordas ou um rabisco aproximado. A saída segue a composição e a estrutura da imagem de controle enquanto ainda incorpora o estilo e a descrição do sujeito do prompt.

O ControlNet não é uma aplicação finalizada. O artigo descreve uma arquitetura, e o repositório de referência no GitHub fornece código e pesos de modelo pré-treinados, mas não existe um instalador de ControlNet para clicar duas vezes. Para usá-lo de fato, você o instala como extensão ou recurso integrado dentro de uma interface de Stable Diffusion já em uso — veja Como instalar e usar o ControlNet abaixo.

O autor principal, Lvmin Zhang, é pesquisador afiliado à Universidade Stanford (com estudos anteriores na Chinese University of Hong Kong e na Soochow University) que publica sob a conta do GitHub lllyasviel. A mesma pessoa também criou o Fooocus, uma interface simplificada do Stable Diffusion construída para chegar à primeira imagem com o menor número de cliques possível — uma conexão que vale conhecer se você usa os dois projetos, já que decisões de design de um às vezes se refletem no outro.

📍 Em uma frase

O ControlNet é uma arquitetura de rede neural que anexa uma entrada extra e precisamente formatada — um mapa de bordas, um mapa de profundidade, um esqueleto de pose ou um rabisco — a um modelo Stable Diffusion pré-treinado, para que a saída siga essa estrutura em vez de depender apenas do prompt de texto.

💬 Em termos simples

Um prompt de texto diz a um artista, em palavras, o que desenhar; uma entrada do ControlNet entrega a esse artista um contorno decalcado para desenhar em cima — o contorno fixa a pose e a composição, enquanto o prompt continua decidindo estilo e conteúdo.

A pesquisa por trás do ControlNet

O código e os primeiros pesos pré-treinados do ControlNet foram publicados no GitHub em fevereiro de 2023, junto com o preprint no arXiv. Uma versão mais refinada, "ControlNet 1.1", veio em seguida em 14 de abril de 2023, ampliando os tipos de condicionamento suportados e melhorando a robustez. O artigo foi formalmente publicado na ICCV 2023 e recebeu o Marr Prize da conferência, confirmado na página oficial de prêmios da Computer Vision Foundation.

O ControlNet foi construído em torno da arquitetura original do Stable Diffusion 1.5 e demonstrado primeiro sobre ela. A comunidade de código aberto — e depois a própria Stability AI — treinou posteriormente checkpoints adicionais de ControlNet para modelos base mais novos, incluindo Stable Diffusion XL e Stable Diffusion 3.5, estendendo a mesma técnica de condicionamento a cada nova geração de modelo. Veja Análise do Stable Diffusion para o contexto sobre esses modelos base.

Título do artigo

Fato verificado:
"Adding Conditional Control to Text-to-Image Diffusion Models"

Autores

Fato verificado:
Lvmin Zhang, Anyi Rao, Maneesh Agrawala

Instituição

Fato verificado:
Universidade Stanford

ID no arXiv

Fato verificado:
2302.05543

Evento

Fato verificado:
ICCV 2023 (IEEE/CVF International Conference on Computer Vision)

Prêmio

Fato verificado:
Marr Prize — melhor artigo da ICCV 2023

Licença do código

Fato verificado:
Apache License 2.0

Fatos verificados diretamente em arxiv.org, no repositório do GitHub lllyasviel/ControlNet, na página de acesso aberto da CVF na ICCV 2023 e na lista oficial de prêmios do thecvf.com em 2026-09-06.

Tipos de condicionamento do ControlNet

O ControlNet 1.1 também inclui modelos especializados adicionais além desse conjunto principal, como M-LSD (detecção de linhas retas para arquitetura e interiores), Shuffle (recomposição que preserva o conteúdo), Inpaint e Tile (aprimoramento de detalhes para fluxos de upscaling). Cada tipo de condicionamento é um arquivo de modelo separado — você carrega o que corresponde à sua imagem de controle, não um único modelo universal.

📍 Em uma frase

O ControlNet 1.1 oferece modelos separados para diferentes tipos de condicionamento — bordas Canny, profundidade, pose humana, rabiscos, segmentação, lineart, soft edge e normal map são os mais usados.

Bordas Canny

O que controla:
Traça bordas detectadas de uma imagem de referência para preservar a estrutura ao mudar o estilo

Profundidade

O que controla:
Usa um mapa de profundidade para preservar a disposição espacial e a perspectiva

OpenPose

O que controla:
Extrai um esqueleto de pose humana (corpo, mãos, pontos-chave do rosto) para fixar a pose da figura

Rabisco (Scribble)

O que controla:
Segue um esboço aproximado desenhado à mão como guia solto de composição

Segmentação

O que controla:
Usa mapas de regiões codificados por cor para fixar onde cada objeto ou superfície aparece

Lineart

O que controla:
Segue contornos de line art limpos, comuns em fluxos de ilustração

Soft edge (HED)

O que controla:
Usa uma detecção de bordas mais suave e menos rígida que a Canny para uma estrutura mais flexível

Normal map

O que controla:
Codifica dados de orientação de superfície, útil para trabalhos próximos de 3D ou texturização

Nomes de modelos e comportamento verificados na documentação do repositório lllyasviel/ControlNet-v1-1-nightly. Quais tipos uma determinada interface expõe por padrão varia — confira a lista de modelos própria dessa interface.

Como instalar e usar o ControlNet no AUTOMATIC1111 ou ComfyUI

A configuração do ControlNet muda conforme a interface, porque não é um instalador independente. Os dois caminhos mais comuns estão descritos abaixo.

  1. 1
    Confirme que já existe uma interface de Stable Diffusion funcionando
    Why it matters: O ControlNet não tem a que se conectar sem AUTOMATIC1111, ComfyUI ou InvokeAI já instalados e gerando imagens — veja [Análise do Stable Diffusion](/power-local-llm/stable-diffusion-review) caso ainda não tenha configurado nenhum.
  2. 2
    Instale a extensão do ControlNet (AUTOMATIC1111) ou confirme o suporte nativo (ComfyUI/InvokeAI)
    Why it matters: O AUTOMATIC1111 não vem com o ControlNet integrado — adicione a extensão da comunidade [sd-webui-controlnet](https://github.com/Mikubill/sd-webui-controlnet) pela aba Extensions. O ComfyUI inclui nós relacionados ao ControlNet no núcleo; o InvokeAI expõe o ControlNet por meio do recurso integrado de Control Layers, então nenhum dos dois exige a instalação de uma extensão separada.
  3. 3
    Baixe um checkpoint de ControlNet compatível com seu modelo base
    Why it matters: Um checkpoint treinado para SD 1.5 não funcionará corretamente com SDXL ou SD 3.5 — combine o modelo de ControlNet com a versão do Stable Diffusion que você usa, e confirme a licença antes de baixar (veja a seção de licença abaixo).
  4. 4
    Coloque o checkpoint na pasta de modelos correta
    Why it matters: O AUTOMATIC1111 espera os modelos de ControlNet em `extensions/sd-webui-controlnet/models`; o ComfyUI e o InvokeAI usam seus próprios diretórios de modelos documentados — consulte o guia de configuração atual dessa interface para o caminho exato.
  5. 5
    Escolha um tipo de condicionamento e forneça uma imagem de controle
    Why it matters: Selecione o pré-processador correspondente (Canny, profundidade, OpenPose, etc.) para sua imagem de controle, ou deixe a interface gerar uma automaticamente a partir de uma foto de referência enviada.
  6. 6
    Ajuste o peso/força do ControlNet e gere
    Why it matters: Uma força menor deixa o prompt influenciar mais a composição; uma força maior prende o resultado mais rigidamente à imagem de controle — a maioria das interfaces usa por padrão um valor intermediário que pode ser ajustado a cada resultado.

Licença do ControlNet: código vs. pesos do modelo

Esse é o fato mais importante a verificar antes de usar o ControlNet em um produto comercial: a licença não é um único número. O código da implementação de referência é Apache License 2.0, uma licença permissiva sem restrições. Mas o checkpoint de modelo que você baixa é um arquivo separado com sua própria licença, que geralmente reflete a família de licença do modelo base do Stable Diffusion contra o qual o checkpoint foi treinado.

Os checkpoints originais de ControlNet para o Stable Diffusion 1.5, publicados na conta lllyasviel no Hugging Face, aparecem como "openrail" — a mesma família de licença CreativeML OpenRAIL-M usada pelo próprio SD 1.5, que permite uso comercial sujeito a restrições de conteúdo baseadas no uso, e não a um teto de receita.

Checkpoints de ControlNet para SDXL treinados pela comunidade, como os modelos amplamente usados publicados na conta xinsir no Hugging Face, costumam ser lançados sob a simples Apache License 2.0 — verifique o model card específico, já que diferentes autores da comunidade podem escolher termos diferentes para seus próprios checkpoints.

Os ControlNets oficiais da própria Stability AI para o Stable Diffusion 3.5 Large — cobrindo condicionamento Blur, Canny e Depth, lançados em 26 de novembro de 2024 — carregam a Stability AI Community License, a mesma licença limitada por receita usada pelo próprio SD 3.5: gratuita para indivíduos e organizações com receita anual agregada abaixo de US$ 1.000.000 com cadastro, exigindo licença Enterprise acima desse limite.

📍 Em uma frase

O código de referência do ControlNet no GitHub tem licença Apache License 2.0, mas os checkpoints de modelo que você realmente baixa carregam licenças diferentes conforme a versão base do Stable Diffusion e a organização que os treinou.

💬 Em termos simples

A receita (o código) é código aberto sem restrições; os ingredientes específicos (os pesos do modelo) trazem cada um seu próprio rótulo — leia o rótulo do checkpoint que você baixa, não apenas a licença do código.

Código de referência do ControlNet (GitHub)

Licença:
Apache License 2.0
Uso comercial:
Permitido, sem restrições

Checkpoints originais de ControlNet para SD 1.5 (lllyasviel no Hugging Face)

Licença:
"openrail" (família CreativeML OpenRAIL-M, herdada do Stable Diffusion)
Uso comercial:
Permitido, sujeito a restrições de conteúdo baseadas no uso

Checkpoints de SDXL da comunidade (ex.: conta xinsir)

Licença:
Geralmente Apache License 2.0
Uso comercial:
Permitido, sem restrições — verificar por checkpoint

ControlNets oficiais de SD 3.5 Large da Stability AI

Licença:
Stability AI Community License
Uso comercial:
Gratuito abaixo de US$ 1.000.000 de receita anual com cadastro; acima disso exige licença Enterprise

Termos de licença são texto jurídico, não material de marketing — esta seção resume termos publicados publicamente até 2026-09-06, mas não é aconselhamento jurídico. Leia sempre o arquivo LICENSE real ou o model card no Hugging Face do checkpoint específico que pretende usar antes de qualquer implantação comercial.

Hardware e VRAM com o ControlNet

O ControlNet adiciona um conjunto duplicado de camadas de codificação sobre o modelo de Stable Diffusion em uso, portanto aumenta o uso de VRAM além do requisito próprio do modelo base, em vez de substituí-lo.

Relatos da comunidade e a documentação das interfaces geralmente descrevem cerca de 1–2 GB de VRAM adicional para um único modelo de ControlNet no Stable Diffusion 1.5, e um aumento maior — comumente citado em torno de 2–4 GB por modelo — no SDXL, já que suas camadas de codificação são maiores e mais custosas de duplicar. Usar vários modelos de ControlNet ao mesmo tempo (por exemplo, profundidade mais pose mais Canny simultaneamente) acumula ainda mais essa sobrecarga. Alternativas mais leves como o T2I-Adapter (veja a seção de alternativas abaixo) são projetadas para adicionar bem menos sobrecarga de VRAM que o ControlNet, ao custo de um controle um pouco menos preciso em algumas comparações da comunidade.

Como esses números vêm de benchmarks da comunidade e não de um teste controlado realizado pela própria PromptQuorum, trate-os como faixas de planejamento: confirme o comportamento atual de VRAM na documentação ou no rastreador de problemas da sua interface específica antes de assumir que uma GPU no limite dará conta de determinada combinação de modelo base e ControlNet.

Preço: gratuito e de pesos abertos

O ControlNet não tem preço separado — é gratuito e de pesos abertos, distribuído como código e checkpoints de modelo, e não como um produto com assinatura ou taxa de licença próprias. Não existe um nível pago, associação ou serviço de ControlNet hospedado rastreado pela PromptQuorum vindo da equipe de pesquisa original.

Seu custo real é a interface de Stable Diffusion que você já usa (AUTOMATIC1111, ComfyUI e InvokeAI são, elas mesmas, gratuitas e de código aberto) mais o hardware de GPU e a eletricidade. O único custo recorrente que pode se aplicar é o de um serviço de GPU hospedado ou em nuvem que você escolha para rodar essa interface, algo sem relação com o ControlNet em si.

ControlNet vs. técnicas de condicionamento alternativas

ControlNet, T2I-Adapter e IP-Adapter não são mutuamente exclusivos — muitos fluxos de trabalho combinam ControlNet (para pose ou composição) com IP-Adapter (para consistência de estilo ou personagem) na mesma geração. Qual combinação faz sentido depende do que você quer fixar: estrutura (ControlNet, T2I-Adapter) versus aparência (IP-Adapter).

Para a escolha do modelo base de Stable Diffusion ao qual essas técnicas se conectam, veja Análise do Stable Diffusion. Para uma comparação mais ampla entre geração de imagens local e em nuvem no geral, veja Geração de imagens com IA local vs. nuvem.

Do lado das interfaces, o ComfyUI tem nós nativos de ControlNet sem necessidade de extensão separada; o AUTOMATIC1111 precisa da extensão da comunidade sd-webui-controlnet; o InvokeAI o integra como Control Layers embutidas em sua tela; e o Fooocus — criado pelo mesmo pesquisador que criou o ControlNet — inclui seus próprios recursos simplificados de orientação estrutural baseados em ControlNet, em vez de expor a seleção bruta de modelos de ControlNet.

ControlNet

Melhor para:
Controle estrutural mais preciso, maior variedade de tipos de condicionamento, maior ecossistema de checkpoints pré-treinados
Sobrecarga de VRAM:
Maior — cerca de 1–4 GB por modelo conforme o modelo base
Licença / custo:
Código Apache-2.0; a licença do checkpoint varia (openrail / Apache-2.0 / Stability Community License)
Principal contrapartida:
Mais VRAM e configuração que adaptadores mais leves; a licença do checkpoint exige verificação arquivo por arquivo
Artigos sobre ControlNet (5)

Também mencionado em:

T2I-Adapter

Melhor para:
Tipos de condicionamento semelhantes (esboço, profundidade, Canny) com inferência mais rápida e menos VRAM
Sobrecarga de VRAM:
Substancialmente menor que o ControlNet
Licença / custo:
Gratuito, de pesos abertos
Principal contrapartida:
Modelo menor, geralmente considerado um pouco menos preciso que o ControlNet em comparações da comunidade

IP-Adapter

Melhor para:
Condicionar pelo estilo ou sujeito de uma imagem de referência em vez de sua estrutura
Sobrecarga de VRAM:
Baixa — adaptador de atenção cruzada leve
Licença / custo:
Gratuito, de pesos abertos
Principal contrapartida:
Controla aparência/transferência de estilo, não pose ou composição — geralmente usado junto com o ControlNet, não em seu lugar

Apenas prompt engineering (sem complemento de condicionamento)

Melhor para:
Composições simples em que pose ou layout exatos não importam
Sobrecarga de VRAM:
Nenhuma
Licença / custo:
Não aplicável
Principal contrapartida:
Nenhuma forma confiável de fixar uma pose exata, um ângulo de câmera ou o posicionamento de um objeto só com palavras

Para quem o ControlNet é indicado

  • Leitor que precisa de uma pose exata, um ângulo de câmera ou um posicionamento de objeto preciso. O ControlNet é a forma mais direta de prender uma imagem gerada a uma estrutura específica que a redação do prompt sozinha não consegue reproduzir de forma confiável.
  • Leitor que já se sente à vontade com uma interface de Stable Diffusion. Quem já usa AUTOMATIC1111, ComfyUI ou InvokeAI pode adicionar o ControlNet baixando um checkpoint e ajustando uma configuração, sem aprender uma plataforma nova.
  • Ilustradores e artistas conceituais que partem de esboços. O condicionamento por rabisco e lineart permite que um esboço aproximado ou um desenho de linhas limpo guie diretamente a composição final.
  • Fotógrafos ou artistas 3D que reaproveitam geometria de referência. O condicionamento por profundidade e normal map transfere a disposição espacial de uma foto de referência ou renderização 3D para uma nova imagem estilizada.
  • Pequenas empresas ou indivíduos abaixo do limite de receita relevante. Tanto o código Apache-2.0 quanto os checkpoints com licença openrail/Apache-2.0 suportam uso comercial sem assinatura nessa escala; os checkpoints sob a Stability Community License também, até US$ 1.000.000 de receita anual com cadastro.

Para quem o ControlNet não é indicado

  • Iniciante absoluto que ainda não configurou uma interface de Stable Diffusion. O ControlNet adiciona uma etapa real de configuração sobre uma instalação local já não trivial — familiarize-se primeiro com prompts simples, e adicione o ControlNet quando esse fluxo já for conhecido.
  • Leitor que quer um app de um clique sem configuração. Não existe um app de ControlNet; é um complemento para uma interface já existente, e cada interface o expõe de forma um pouco diferente. Quem quer zero configuração deve considerar uma ferramenta em nuvem em vez disso.
  • Leitor que depende só da redação do prompt para imagens simples. Se pose ou layout exatos não importam para o seu caso de uso, o prompt engineering puro é mais rápido e evita a VRAM e a configuração extras exigidas pelo ControlNet.
  • Leitor com uma GPU limitada em VRAM já perto do limite com o modelo base. O ControlNet adiciona uma sobrecarga de VRAM significativa em cima do próprio Stable Diffusion — veja Hardware e VRAM — e uma opção mais leve como o T2I-Adapter pode encaixar melhor.
  • Organização acima do limite de receita relevante que planeja usar os ControlNets oficiais de SD 3.5 da Stability AI. A Stability AI Community License exige licença Enterprise acima de US$ 1.000.000 de receita anual — planeje essa negociação, ou use um checkpoint de SDXL com licença Apache-2.0 em vez disso, se atender ao seu caso de uso.

Perguntas frequentes

O que é o ControlNet?

O ControlNet é uma arquitetura de rede neural que adiciona condicionamento estrutural preciso — pose, profundidade, mapas de bordas, rabiscos, segmentação e mais — à geração de imagens do Stable Diffusion. Foi apresentado no artigo "Adding Conditional Control to Text-to-Image Diffusion Models", de Lvmin Zhang, Anyi Rao e Maneesh Agrawala, da Universidade Stanford, publicado na ICCV 2023.

O ControlNet é um app independente?

Não. O ControlNet é uma técnica com implementação de referência, distribuída como código e checkpoints de modelo em vez de como uma aplicação de consumo. Para usá-lo, você o instala em uma interface de Stable Diffusion já em uso — a extensão da comunidade sd-webui-controlnet para o AUTOMATIC1111, nós nativos no ComfyUI, ou Control Layers integradas no InvokeAI.

O ControlNet é gratuito?

Sim. O código de referência no GitHub tem licença Apache License 2.0, uma licença de código aberto sem restrições, e não existe um produto ControlNet pago separado. Checkpoints de modelo individuais carregam suas próprias licenças, que variam conforme a versão base do Stable Diffusion a que se destinam — veja a seção de licença para detalhes.

Posso usar o ControlNet comercialmente?

Depende do checkpoint específico. Os checkpoints originais de ControlNet para SD 1.5 aparecem como "openrail", permitindo uso comercial sujeito a restrições de conteúdo. Checkpoints de SDXL da comunidade (como os da conta xinsir) costumam ser Apache License 2.0 sem restrições. Os ControlNets oficiais de SD 3.5 Large da Stability AI usam a Stability AI Community License, gratuita abaixo de US$ 1.000.000 de receita anual com cadastro, exigindo licença Enterprise acima disso. Verifique sempre a página de licença do checkpoint específico antes de uso comercial.

Quem criou o ControlNet?

O ControlNet foi apresentado por Lvmin Zhang, Anyi Rao e Maneesh Agrawala, da Universidade Stanford, no artigo "Adding Conditional Control to Text-to-Image Diffusion Models", publicado na ICCV 2023, onde ganhou o Marr Prize de melhor artigo da conferência. Lvmin Zhang, que publica sob a conta do GitHub lllyasviel, também criou o Fooocus, uma interface simplificada do Stable Diffusion.

Quais interfaces de Stable Diffusion suportam o ControlNet?

A Stable Diffusion WebUI do AUTOMATIC1111 suporta o ControlNet pela extensão da comunidade sd-webui-controlnet (não integrada por padrão). O ComfyUI inclui nós relacionados ao ControlNet nativamente no núcleo. O InvokeAI integra o ControlNet como Control Layers embutidas em seu fluxo de tela. O Fooocus, criado pelo criador do ControlNet, inclui seus próprios recursos simplificados de orientação estrutural baseados em ControlNet, em vez de expor a seleção bruta de modelos.

Quais tipos de condicionamento o ControlNet suporta?

O ControlNet 1.1 inclui modelos para detecção de bordas Canny, mapas de profundidade, esqueletos de pose humana OpenPose, rabiscos, mapas de segmentação, lineart, detecção soft edge (HED), normal maps, além de tipos especializados adicionais como M-LSD (linhas retas), Shuffle, Inpaint e Tile.

Quanta VRAM extra o ControlNet usa?

Ele adiciona VRAM em cima do modelo base do Stable Diffusion, em vez de substituir esse requisito. Relatos da comunidade geralmente descrevem cerca de 1–2 GB de VRAM adicional por modelo de ControlNet no Stable Diffusion 1.5, e um aumento maior no SDXL devido às suas camadas de codificação maiores. Usar vários modelos de ControlNet ao mesmo tempo acumula ainda mais essa sobrecarga; são faixas de planejamento, não um benchmark controlado realizado pela própria PromptQuorum.

Qual é a diferença entre ControlNet, T2I-Adapter e IP-Adapter?

ControlNet e T2I-Adapter condicionam a geração a entradas estruturais como bordas, profundidade ou pose, mas o T2I-Adapter usa uma arquitetura menor com menor sobrecarga de VRAM e inferência mais rápida, a algum custo de precisão em comparações da comunidade. O IP-Adapter condiciona pelo estilo ou aparência do sujeito de uma imagem de referência em vez de sua estrutura, e é comumente combinado com o ControlNet em vez de usado como substituto.

Veredito

O ControlNet conquistou seu lugar como a forma padrão de adicionar controle estrutural preciso ao Stable Diffusion — não como um produto em si, mas como uma técnica de pesquisa bem documentada, com um grande ecossistema de checkpoints construído ao seu redor desde sua estreia na ICCV 2023. Quem já usa AUTOMATIC1111, ComfyUI ou InvokeAI pode adicionar condicionamento por pose, profundidade, bordas ou rabisco sem trocar de plataforma, e o código subjacente carrega uma licença Apache-2.0 sem restrições. A contrapartida é real: não é um app, adiciona uma etapa genuína de configuração e uma sobrecarga significativa de VRAM sobre o modelo base, e a licença não tem uma resposta única — depende do checkpoint baixado, do "openrail" nos modelos mais antigos de SD 1.5 até a Stability AI Community License limitada por receita nos ControlNets próprios de SD 3.5 da Stability. Quem quer menor sobrecarga de VRAM para um controle estrutural semelhante deve avaliar também o T2I-Adapter; quem ainda não configurou uma interface de Stable Diffusion deve começar por aí primeiro, já que o ControlNet sozinho não tem a que se conectar. Para quem já gera imagens localmente e precisa de mais controle do que a redação do prompt oferece, o ControlNet continua sendo a forma mais amplamente suportada de consegui-lo.

Fontes

← Voltar para LLMs locais avançados