Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/ControlNet: Análisis (2026): Control estructural para Stable Diffusion
Image & Video Generation

ControlNet: Análisis (2026): Control estructural para Stable Diffusion

·12 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

ControlNet es una arquitectura de red neuronal que añade guía estructural precisa —un esqueleto de pose, un mapa de profundidad, un contorno de bordes, un garabato— a la generación de imágenes con Stable Diffusion, de modo que la imagen generada siga esa estructura en lugar de depender solo del prompt de texto. Se presentó en el artículo de ICCV 2023 "Adding Conditional Control to Text-to-Image Diffusion Models" de Lvmin Zhang, Anyi Rao y Maneesh Agrawala (Universidad de Stanford), que ganó el Marr Prize al mejor artículo de la conferencia. ControlNet no es una aplicación independiente: se distribuye como código (Apache License 2.0) y checkpoints de modelo (la licencia varía según el checkpoint) que se instalan en una interfaz de Stable Diffusion que ya uses, como AUTOMATIC1111 mediante una extensión de la comunidad, ComfyUI mediante nodos nativos, o InvokeAI mediante Control Layers integradas. Verifica las licencias actuales de los checkpoints en Hugging Face antes de cualquier uso comercial.

ControlNet es una arquitectura de red neuronal que añade condicionamiento estructural preciso —pose, profundidad, mapas de bordes, garabatos, segmentación— a la generación de imágenes con Stable Diffusion, dando a un modelo de texto a imagen una segunda entrada además del prompt. Se presentó en el artículo Adding Conditional Control to Text-to-Image Diffusion Models de Lvmin Zhang, Anyi Rao y Maneesh Agrawala, de la Universidad de Stanford, publicado en ICCV 2023. ControlNet no es una aplicación descargable: es una técnica con una implementación de referencia en GitHub, distribuida como pesos de modelo que se conectan a una interfaz de Stable Diffusion que ya tienes instalada —AUTOMATIC1111, ComfyUI o InvokeAI—. Este análisis explica qué es ControlNet en realidad, sus condiciones de licencia reales (que difieren entre el código, los checkpoints originales y los checkpoints más recientes de la comunidad u oficiales), los tipos de condicionamiento disponibles, dónde conseguir los pesos, y cómo se compara con técnicas de condicionamiento más recientes.

ControlNet: Análisis (2026): Control estructural para Stable Diffusion

Conclusiones clave

  • ControlNet es una arquitectura de red neuronal —no una app— que añade condicionamiento estructural preciso (pose, profundidad, bordes, garabatos, segmentación) a Stable Diffusion, de modo que la imagen generada siga esa estructura y no solo el texto del prompt.
  • Proviene del artículo "Adding Conditional Control to Text-to-Image Diffusion Models" de Lvmin Zhang, Anyi Rao y Maneesh Agrawala, de la Universidad de Stanford, publicado en ICCV 2023, donde ganó el Marr Prize al mejor artículo de la conferencia.
  • El mismo investigador, Lvmin Zhang (cuenta de GitHub lllyasviel), también creó Fooocus, una interfaz simplificada de Stable Diffusion.
  • La licencia no es una sola: el código de referencia es Apache License 2.0, los checkpoints originales de SD 1.5 aparecen como "openrail" en Hugging Face, los checkpoints de SDXL de la comunidad (p. ej. de la cuenta xinsir) suelen ser Apache-2.0, y los ControlNets oficiales de SD 3.5 Large de Stability AI usan la Stability AI Community License, limitada por ingresos —revisa la licencia de cada checkpoint antes de un uso comercial.
  • Para usarlo necesitas una interfaz ya instalada: AUTOMATIC1111 mediante la extensión de la comunidad sd-webui-controlnet, ComfyUI mediante nodos nativos, o InvokeAI mediante Control Layers integradas.
  • Es gratuito y de pesos abiertos, sin producto ControlNet de pago independiente —el único coste es tu propia GPU y electricidad a través de la interfaz que uses.

Qué es ControlNet

ControlNet funciona duplicando las capas de codificación de un modelo de difusión preentrenado y conectando la copia a la red original mediante lo que el artículo llama capas de "convolución cero" —capas convolucionales cuyos pesos empiezan en cero, de modo que el entrenamiento parte del comportamiento exacto del modelo base y solo aprende gradualmente la nueva señal de condicionamiento. Los pesos del modelo original permanecen fijos durante este proceso, por lo que añadir ControlNet no degrada la calidad de imagen del modelo base de Stable Diffusion.

En la práctica, esto significa que alimentas el pipeline con dos entradas en lugar de una: un prompt de texto (como siempre) y una imagen de control —un esqueleto de pose, un mapa de profundidad, un contorno de bordes o un garabato aproximado. El resultado sigue la composición y estructura de la imagen de control mientras incorpora el estilo y la descripción del sujeto del prompt.

ControlNet no es una aplicación terminada. El artículo describe una arquitectura, y el repositorio de referencia en GitHub proporciona código y pesos de modelo preentrenados, pero no hay un instalador de ControlNet en el que hacer doble clic. Para usarlo de verdad, se instala como extensión o función integrada dentro de una interfaz de Stable Diffusion que ya uses —ver Cómo instalar y usar ControlNet más abajo.

El autor principal, Lvmin Zhang, es investigador de la Universidad de Stanford (con estudios previos en la Chinese University of Hong Kong y la Soochow University), que publica bajo la cuenta de GitHub lllyasviel. La misma persona también creó Fooocus, una interfaz simplificada de Stable Diffusion diseñada para llegar a la primera imagen con el menor número de clics posible —una conexión útil de conocer si usas ambos proyectos, ya que algunas decisiones de diseño se trasladan de uno a otro.

📍 En una frase

ControlNet es una arquitectura de red neuronal que añade una entrada extra y precisa —un mapa de bordes, un mapa de profundidad, un esqueleto de pose o un garabato— a un modelo de Stable Diffusion preentrenado, de modo que el resultado siga esa estructura en lugar de depender solo del prompt de texto.

💬 En términos simples

Un prompt de texto le dice a un artista qué dibujar con palabras; una entrada de ControlNet le entrega a ese artista un contorno calcado para dibujar encima —el contorno fija la pose y la composición, mientras el prompt sigue decidiendo el estilo y el contenido.

La investigación detrás de ControlNet

El código y los primeros pesos preentrenados de ControlNet se publicaron en GitHub en febrero de 2023, junto con el preprint de arXiv. Una versión más refinada, "ControlNet 1.1", llegó el 14 de abril de 2023, ampliando los tipos de condicionamiento admitidos y mejorando su robustez. El artículo se publicó formalmente en ICCV 2023 y recibió el Marr Prize de la conferencia, confirmado en la página oficial de premios de la Computer Vision Foundation.

ControlNet se diseñó en torno a la arquitectura original de Stable Diffusion 1.5 y se demostró primero sobre ella. La comunidad de código abierto —y más tarde Stability AI misma— entrenó después checkpoints adicionales de ControlNet para modelos base más nuevos, incluidos Stable Diffusion XL y Stable Diffusion 3.5, extendiendo la misma técnica de condicionamiento a cada nueva generación de modelos. Consulta Análisis de Stable Diffusion para más contexto sobre esos modelos base.

Título del artículo

Dato verificado:
"Adding Conditional Control to Text-to-Image Diffusion Models"

Autores

Dato verificado:
Lvmin Zhang, Anyi Rao, Maneesh Agrawala

Institución

Dato verificado:
Universidad de Stanford

ID de arXiv

Dato verificado:
2302.05543

Sede

Dato verificado:
ICCV 2023 (IEEE/CVF International Conference on Computer Vision)

Premio

Dato verificado:
Marr Prize — mejor artículo de ICCV 2023

Licencia del código

Dato verificado:
Apache License 2.0

Datos verificados directamente en arxiv.org, el repositorio de GitHub lllyasviel/ControlNet, la página de acceso abierto de CVF ICCV 2023 y el listado oficial de premios de thecvf.com el 2026-09-06.

Tipos de condicionamiento de ControlNet

ControlNet 1.1 también incluye modelos especializados adicionales más allá de este conjunto principal, como M-LSD (detección de líneas rectas para arquitectura e interiores), Shuffle (recomposición que preserva el contenido), Inpaint y Tile (mejora de detalle para flujos de upscaling). Cada tipo de condicionamiento es un archivo de modelo independiente —cargas el que coincide con tu imagen de control, no un único modelo universal.

📍 En una frase

ControlNet 1.1 incluye modelos separados para distintos tipos de condicionamiento —bordes Canny, profundidad, pose humana, garabatos, segmentación, lineart, soft edge y normal map son los más usados.

Bordes Canny

Qué controla:
Traza los bordes detectados de una imagen de referencia para conservar la estructura al cambiar el estilo

Profundidad

Qué controla:
Usa un mapa de profundidad para conservar la disposición espacial y la perspectiva

OpenPose

Qué controla:
Extrae un esqueleto de pose humana (cuerpo, manos, puntos clave del rostro) para fijar la pose de la figura

Garabato (Scribble)

Qué controla:
Sigue un boceto aproximado dibujado a mano como guía de composición flexible

Segmentación

Qué controla:
Usa mapas de regiones codificados por color para fijar dónde aparece cada objeto o superficie

Lineart

Qué controla:
Sigue contornos de line art limpios, habitual en flujos de ilustración

Soft edge (HED)

Qué controla:
Usa una detección de bordes más suave y menos rígida que Canny para una estructura más flexible

Normal map

Qué controla:
Codifica datos de orientación de superficie, útil para trabajos cercanos a 3D o texturizado

Nombres de modelos y comportamiento verificados con la documentación del repositorio lllyasviel/ControlNet-v1-1-nightly. Qué tipos expone cada interfaz por defecto varía —consulta la lista de modelos propia de esa interfaz.

Cómo instalar y usar ControlNet en AUTOMATIC1111 o ComfyUI

La instalación de ControlNet difiere según la interfaz porque no es un instalador independiente. A continuación se describen las dos rutas más comunes.

  1. 1
    Confirma que ya tienes una interfaz de Stable Diffusion funcionando
    Why it matters: ControlNet no tiene a qué conectarse si AUTOMATIC1111, ComfyUI o InvokeAI no están ya instalados y generando imágenes —consulta [Análisis de Stable Diffusion](/power-local-llm/stable-diffusion-review) si aún no has configurado ninguno.
  2. 2
    Instala la extensión de ControlNet (AUTOMATIC1111) o confirma el soporte nativo (ComfyUI/InvokeAI)
    Why it matters: AUTOMATIC1111 no incluye ControlNet integrado —añade la extensión de la comunidad [sd-webui-controlnet](https://github.com/Mikubill/sd-webui-controlnet) desde la pestaña Extensions. ComfyUI incluye nodos relacionados con ControlNet en su núcleo; InvokeAI expone ControlNet mediante su función integrada de Control Layers, así que en ninguno de los dos hace falta instalar una extensión aparte.
  3. 3
    Descarga un checkpoint de ControlNet que coincida con tu modelo base
    Why it matters: Un checkpoint entrenado para SD 1.5 no funcionará correctamente con SDXL o SD 3.5 —haz coincidir el modelo de ControlNet con la versión de Stable Diffusion que uses, y verifica su licencia antes de descargarlo (ver la sección de licencia más abajo).
  4. 4
    Coloca el checkpoint en la carpeta de modelos correcta
    Why it matters: AUTOMATIC1111 espera los modelos de ControlNet en `extensions/sd-webui-controlnet/models`; ComfyUI e InvokeAI usan sus propios directorios de modelos documentados —consulta la guía de configuración actual de esa interfaz para la ruta exacta.
  5. 5
    Elige un tipo de condicionamiento y proporciona una imagen de control
    Why it matters: Selecciona el preprocesador que coincida (Canny, profundidad, OpenPose, etc.) para tu imagen de control, o deja que la interfaz genere una automáticamente a partir de una foto de referencia subida.
  6. 6
    Ajusta el peso/fuerza de ControlNet y genera
    Why it matters: Una fuerza más baja deja que el prompt influya más en la composición; una fuerza más alta ata el resultado más estrechamente a la imagen de control —la mayoría de interfaces usan un valor intermedio por defecto que puedes ajustar por resultado.

Licencia de ControlNet: código frente a pesos del modelo

Este es el dato más importante a comprobar antes de usar ControlNet en un producto comercial: la licencia no es un único valor. El código de la implementación de referencia es Apache License 2.0, una licencia permisiva sin restricciones. Pero el checkpoint de modelo que descargas es un archivo aparte con su propia licencia, que generalmente refleja la familia de licencias del modelo base de Stable Diffusion contra el que se entrenó el checkpoint.

Los checkpoints originales de ControlNet para Stable Diffusion 1.5, publicados bajo la cuenta lllyasviel en Hugging Face, aparecen como "openrail" —la misma familia de licencia CreativeML OpenRAIL-M que usa SD 1.5 en sí, que permite el uso comercial sujeto a restricciones de contenido según el uso, no a un límite de ingresos.

Los checkpoints de ControlNet para SDXL entrenados por la comunidad, como los modelos ampliamente usados publicados bajo la cuenta xinsir en Hugging Face, suelen publicarse bajo la simple Apache License 2.0 —revisa la ficha de modelo concreta, ya que distintos autores de la comunidad pueden elegir condiciones diferentes para sus propios checkpoints.

Los ControlNets oficiales de Stability AI para Stable Diffusion 3.5 Large —para condicionamiento Blur, Canny y Depth, publicados el 26 de noviembre de 2024— llevan la Stability AI Community License, la misma licencia limitada por ingresos que usa SD 3.5: gratuita para individuos y organizaciones por debajo de 1.000.000 USD de ingresos anuales agregados con registro, y requiere una licencia Enterprise por encima de ese umbral.

📍 En una frase

El código de referencia de ControlNet en GitHub tiene licencia Apache License 2.0, pero los checkpoints de modelo que realmente descargas llevan licencias distintas según la versión base de Stable Diffusion y la organización que los entrenó.

💬 En términos simples

La receta (el código) es de código abierto sin restricciones; los ingredientes concretos (los pesos del modelo) llevan cada uno su propia etiqueta —lee la etiqueta del checkpoint que descargas, no solo la licencia del código.

Código de referencia de ControlNet (GitHub)

Licencia:
Apache License 2.0
Uso comercial:
Permitido, sin restricciones

Checkpoints originales de ControlNet para SD 1.5 (lllyasviel en Hugging Face)

Licencia:
"openrail" (familia CreativeML OpenRAIL-M, heredada de Stable Diffusion)
Uso comercial:
Permitido, sujeto a restricciones de contenido según el uso

Checkpoints de SDXL de la comunidad (p. ej. cuenta xinsir)

Licencia:
Comúnmente Apache License 2.0
Uso comercial:
Permitido, sin restricciones —verificar por checkpoint

ControlNets oficiales de SD 3.5 Large de Stability AI

Licencia:
Stability AI Community License
Uso comercial:
Gratis por debajo de 1.000.000 USD de ingresos anuales con registro; por encima requiere licencia Enterprise

Las condiciones de licencia son texto legal, no material de marketing —esta sección resume condiciones publicadas públicamente a fecha de 2026-09-06, pero no constituye asesoría legal. Lee siempre el archivo LICENSE real o la ficha de modelo en Hugging Face del checkpoint concreto que planeas usar antes de un despliegue comercial.

Hardware y VRAM con ControlNet

ControlNet añade un conjunto duplicado de capas de codificación sobre el modelo de Stable Diffusion que estés usando, por lo que aumenta el uso de VRAM más allá del requisito propio del modelo base, en lugar de sustituirlo.

Los informes de la comunidad y la documentación de las interfaces suelen describir aproximadamente 1–2 GB de VRAM adicional para un único modelo de ControlNet en Stable Diffusion 1.5, y un aumento mayor —comúnmente citado alrededor de 2–4 GB por modelo— en SDXL, ya que sus capas de codificación son más grandes de duplicar. Usar varios modelos de ControlNet a la vez (por ejemplo, profundidad más pose más Canny simultáneamente) acumula aún más este sobrecoste. Alternativas más ligeras como T2I-Adapter (ver la sección de alternativas más abajo) están diseñadas para añadir bastante menos sobrecoste de VRAM que ControlNet, a costa de un control algo menos preciso en algunas comparativas de la comunidad.

Como estas cifras provienen de pruebas de la comunidad y no de un test controlado que PromptQuorum haya realizado por sí mismo, trátalas como rangos de planificación: confirma el comportamiento actual de VRAM en la documentación o el gestor de incidencias de tu interfaz concreta antes de asumir que una GPU al límite podrá con una combinación determinada de modelo base y ControlNet.

Precio: gratuito y de pesos abiertos

ControlNet no tiene un precio aparte: es gratuito y de pesos abiertos, distribuido como código y checkpoints de modelo en lugar de como un producto con su propia suscripción o tarifa de licencia. No existe un nivel de pago, membresía u oferta de ControlNet-como-servicio alojada, registrada por PromptQuorum, por parte del equipo de investigación original.

Tu coste real es la interfaz de Stable Diffusion que ya uses (AUTOMATIC1111, ComfyUI e InvokeAI son en sí mismas gratuitas y de código abierto) más tu propio hardware de GPU y electricidad. El único coste recurrente que podría aplicarse es el de un servicio de GPU alojado o en la nube que elijas para ejecutar esa interfaz, algo ajeno a ControlNet en sí.

ControlNet frente a técnicas de condicionamiento alternativas

ControlNet, T2I-Adapter e IP-Adapter no son mutuamente excluyentes —muchos flujos de trabajo combinan ControlNet (para pose o composición) con IP-Adapter (para consistencia de estilo o personaje) en la misma generación. Qué combinación tiene sentido depende de lo que quieras fijar: estructura (ControlNet, T2I-Adapter) frente a apariencia (IP-Adapter).

Para la elección del modelo base de Stable Diffusion al que se conectan estas técnicas, consulta Análisis de Stable Diffusion. Para una comparación más amplia entre generación de imágenes local y en la nube, consulta Generación de imágenes con IA local frente a la nube.

En el lado de las interfaces, ComfyUI tiene nodos nativos de ControlNet sin necesidad de una extensión aparte; AUTOMATIC1111 necesita la extensión de la comunidad sd-webui-controlnet; InvokeAI lo integra como Control Layers incorporadas en su lienzo; y Fooocus —creado por el mismo investigador que creó ControlNet— incluye sus propias funciones simplificadas de guía estructural basadas en ControlNet, en lugar de exponer la selección de modelos de ControlNet en bruto.

ControlNet

Mejor para:
Control estructural más preciso, mayor variedad de tipos de condicionamiento, ecosistema más grande de checkpoints preentrenados
Sobrecoste de VRAM:
Mayor —aproximadamente 1–4 GB por modelo según el modelo base
Licencia / coste:
Código Apache-2.0; la licencia del checkpoint varía (openrail / Apache-2.0 / Stability Community License)
Compromiso clave:
Más VRAM y configuración que adaptadores más ligeros; la licencia del checkpoint requiere verificación archivo por archivo
Artículos sobre ControlNet (5)

También mencionado en:

T2I-Adapter

Mejor para:
Tipos de condicionamiento similares (boceto, profundidad, Canny) con inferencia más rápida y menor VRAM
Sobrecoste de VRAM:
Sustancialmente menor que ControlNet
Licencia / coste:
Gratuito, de pesos abiertos
Compromiso clave:
Modelo más pequeño, generalmente considerado algo menos preciso que ControlNet en comparativas de la comunidad

IP-Adapter

Mejor para:
Condicionar sobre el estilo o el sujeto de una imagen de referencia en lugar de su estructura
Sobrecoste de VRAM:
Bajo —adaptador de atención cruzada ligero
Licencia / coste:
Gratuito, de pesos abiertos
Compromiso clave:
Controla apariencia/transferencia de estilo, no pose ni composición —se usa habitualmente junto con ControlNet, no en su lugar

Solo prompt engineering (sin complemento de condicionamiento)

Mejor para:
Composiciones sencillas donde la pose o el diseño exacto no importan
Sobrecoste de VRAM:
Ninguno
Licencia / coste:
No aplica
Compromiso clave:
No hay forma fiable de fijar una pose exacta, un ángulo de cámara o la colocación de un objeto solo con palabras

A quién le conviene ControlNet

  • Al lector que necesita una pose exacta, un ángulo de cámara o la colocación precisa de un objeto. ControlNet es la forma más directa de fijar una imagen generada a una estructura específica que la sola redacción del prompt no puede reproducir de forma fiable.
  • Al lector que ya se maneja con una interfaz de Stable Diffusion. Si ya usas AUTOMATIC1111, ComfyUI o InvokeAI, añadir ControlNet es descargar un checkpoint y ajustar una opción, no aprender una plataforma nueva.
  • A ilustradores y artistas conceptuales que parten de bocetos. El condicionamiento por garabato y lineart permite que un boceto aproximado o un dibujo de líneas limpio guíe directamente la composición final.
  • A fotógrafos o artistas 3D que reutilizan geometría de referencia. El condicionamiento por profundidad y normal map traslada la disposición espacial de una foto de referencia o un render 3D a una nueva imagen estilizada.
  • A pequeñas empresas o particulares por debajo del umbral de ingresos correspondiente. Tanto el código Apache-2.0 como los checkpoints con licencia openrail/Apache-2.0 admiten uso comercial sin suscripción a esta escala; los checkpoints bajo la Stability Community License también, hasta 1.000.000 USD de ingresos anuales con registro.

A quién no le conviene ControlNet

  • Al principiante absoluto que aún no ha configurado una interfaz de Stable Diffusion. ControlNet añade un paso real de configuración adicional sobre una instalación local que ya de por sí no es trivial —familiarízate primero con prompts sencillos, y añade ControlNet cuando ese flujo te resulte conocido.
  • Al lector que quiere una app de un solo clic sin configuración. No existe una app de ControlNet; es un complemento para una interfaz existente, y cada interfaz lo expone de forma ligeramente distinta. Quien quiera cero configuración debería considerar una herramienta en la nube en su lugar.
  • Al lector que depende solo de la redacción del prompt para imágenes sencillas. Si la pose o el diseño exacto no importan para tu caso de uso, el prompt engineering puro es más rápido y evita el VRAM y la configuración adicionales que exige ControlNet.
  • Al lector con una GPU limitada en VRAM que ya está cerca de su límite con el modelo base. ControlNet añade un sobrecoste de VRAM notable sobre Stable Diffusion en sí —ver Hardware y VRAM— y una opción más ligera como T2I-Adapter puede encajar mejor.
  • A la organización por encima del umbral de ingresos correspondiente que planea usar los ControlNets oficiales de SD 3.5 de Stability AI. La Stability AI Community License exige una licencia Enterprise por encima de 1.000.000 USD de ingresos anuales —presupuesta esa negociación, o usa en su lugar un checkpoint de SDXL con licencia Apache-2.0 si encaja con tu caso de uso.

Preguntas frecuentes

¿Qué es ControlNet?

ControlNet es una arquitectura de red neuronal que añade condicionamiento estructural preciso —pose, profundidad, mapas de bordes, garabatos, segmentación y más— a la generación de imágenes con Stable Diffusion. Se presentó en el artículo "Adding Conditional Control to Text-to-Image Diffusion Models" de Lvmin Zhang, Anyi Rao y Maneesh Agrawala, de la Universidad de Stanford, publicado en ICCV 2023.

¿Es ControlNet una app independiente?

No. ControlNet es una técnica con una implementación de referencia, distribuida como código y checkpoints de modelo en lugar de una aplicación de consumo. Para usarlo, se instala en una interfaz de Stable Diffusion que ya uses —la extensión de la comunidad sd-webui-controlnet para AUTOMATIC1111, nodos nativos en ComfyUI, o Control Layers integradas en InvokeAI.

¿Es gratuito ControlNet?

Sí. El código de referencia en GitHub tiene licencia Apache License 2.0, una licencia de código abierto sin restricciones, y no existe un producto ControlNet de pago aparte. Los checkpoints de modelo individuales llevan licencias propias que varían según la versión base de Stable Diffusion a la que apuntan —ver la sección de licencia para más detalle.

¿Puedo usar ControlNet comercialmente?

Depende del checkpoint concreto. Los checkpoints originales de ControlNet para SD 1.5 aparecen como "openrail", que permite uso comercial sujeto a restricciones de contenido. Los checkpoints de SDXL de la comunidad (como los de la cuenta xinsir) suelen tener licencia Apache License 2.0 sin restricciones. Los ControlNets oficiales de SD 3.5 Large de Stability AI usan la Stability AI Community License, gratuita por debajo de 1.000.000 USD de ingresos anuales con registro, y requieren una licencia Enterprise por encima de ese umbral. Comprueba siempre la página de licencia del checkpoint concreto antes de un uso comercial.

¿Quién creó ControlNet?

ControlNet fue presentado por Lvmin Zhang, Anyi Rao y Maneesh Agrawala, de la Universidad de Stanford, en el artículo "Adding Conditional Control to Text-to-Image Diffusion Models", publicado en ICCV 2023, donde ganó el Marr Prize al mejor artículo de la conferencia. Lvmin Zhang, que publica bajo la cuenta de GitHub lllyasviel, también creó Fooocus, una interfaz simplificada de Stable Diffusion.

¿Qué interfaces de Stable Diffusion admiten ControlNet?

La Stable Diffusion WebUI de AUTOMATIC1111 admite ControlNet mediante la extensión de la comunidad sd-webui-controlnet (no integrada por defecto). ComfyUI incluye nodos relacionados con ControlNet de forma nativa en su núcleo. InvokeAI integra ControlNet como Control Layers incorporadas dentro de su flujo de lienzo. Fooocus, creado por el mismo autor de ControlNet, incluye sus propias funciones simplificadas de guía estructural basadas en ControlNet en lugar de exponer la selección de modelos en bruto.

¿Qué tipos de condicionamiento admite ControlNet?

ControlNet 1.1 incluye modelos para detección de bordes Canny, mapas de profundidad, esqueletos de pose humana OpenPose, garabatos, mapas de segmentación, lineart, detección soft edge (HED), normal maps, y tipos especializados adicionales como M-LSD (líneas rectas), Shuffle, Inpaint y Tile.

¿Cuánto VRAM adicional usa ControlNet?

Añade VRAM sobre el modelo base de Stable Diffusion en lugar de sustituir ese requisito. Los informes de la comunidad suelen describir aproximadamente 1–2 GB de VRAM adicional por modelo de ControlNet en Stable Diffusion 1.5, y un aumento mayor en SDXL debido a sus capas de codificación más grandes. Usar varios modelos de ControlNet a la vez acumula aún más este sobrecoste; son rangos de planificación, no un benchmark controlado que PromptQuorum haya realizado por sí mismo.

¿Cuál es la diferencia entre ControlNet, T2I-Adapter e IP-Adapter?

ControlNet y T2I-Adapter condicionan ambos la generación sobre entradas estructurales como bordes, profundidad o pose, pero T2I-Adapter usa una arquitectura más pequeña con menor sobrecoste de VRAM e inferencia más rápida, a costa de algo de precisión en comparativas de la comunidad. IP-Adapter condiciona sobre el estilo o la apariencia del sujeto de una imagen de referencia en lugar de su estructura, y se combina habitualmente con ControlNet en lugar de usarse como sustituto.

Veredicto

ControlNet se ha ganado su lugar como la forma estándar de añadir control estructural preciso a Stable Diffusion —no como un producto en sí mismo, sino como una técnica de investigación bien documentada con un gran ecosistema de checkpoints construido a su alrededor desde su debut en ICCV 2023. Quienes ya usan AUTOMATIC1111, ComfyUI o InvokeAI pueden añadir condicionamiento por pose, profundidad, bordes o garabato sin cambiar de plataforma, y el código subyacente lleva una licencia Apache-2.0 sin restricciones. El compromiso es real: no es una app, añade un paso de configuración genuino y un sobrecoste de VRAM notable sobre el modelo base, y la licencia no tiene una única respuesta —depende del checkpoint que descargues, desde "openrail" en los modelos más antiguos de SD 1.5 hasta la Stability AI Community License limitada por ingresos en los ControlNets propios de SD 3.5 de Stability. Quienes busquen un sobrecoste de VRAM menor con un control estructural similar deberían evaluar también T2I-Adapter; quienes aún no hayan configurado una interfaz de Stable Diffusion deberían empezar por ahí, porque ControlNet por sí solo no tiene a qué conectarse. Para cualquiera que ya genere imágenes localmente y necesite más control del que ofrece la sola redacción del prompt, ControlNet sigue siendo la forma más completamente respaldada de conseguirlo.

Fuentes

← Volver a LLM locales avanzados