핵심 요점
- ControlNet은 앱이 아니라 신경망 아키텍처로, Stable Diffusion에 포즈·깊이·엣지·스케치·세그멘테이션 등 정밀한 구조적 조건을 추가해 생성 이미지가 프롬프트 문구뿐 아니라 그 구조를 따르게 합니다.
- 스탠퍼드 대학교의 Lvmin Zhang, Anyi Rao, Maneesh Agrawala가 쓴 논문 "Adding Conditional Control to Text-to-Image Diffusion Models"에서 나왔으며, ICCV 2023에서 발표되어 학회 최우수 논문상인 Marr Prize를 수상했습니다.
- 같은 연구자인 Lvmin Zhang(GitHub 계정 lllyasviel)은 단순화된 Stable Diffusion UI인 Fooocus도 만들었습니다.
- 라이선스는 하나로 통일되어 있지 않습니다: 참조 코드는 Apache License 2.0이고, 원본 SD 1.5 체크포인트는 Hugging Face에 "openrail"로 표기되어 있으며, 커뮤니티 SDXL 체크포인트(예: xinsir 계정)는 대개 Apache-2.0이고, Stability AI 공식 SD 3.5 Large ControlNet은 매출 기준으로 제한되는 Stability AI Community License를 사용합니다 — 상업적 이용 전 각 체크포인트의 라이선스를 확인하세요.
- 사용하려면 이미 설치된 UI가 필요합니다: 커뮤니티 확장 기능 sd-webui-controlnet을 통한 AUTOMATIC1111, 네이티브 핵심 노드를 통한 ComfyUI, 또는 내장 Control Layers를 통한 InvokeAI입니다.
- 무료이며 오픈 웨이트로, 별도의 유료 ControlNet 제품은 없습니다 — 유일한 비용은 사용하는 UI를 통한 자체 GPU와 전기료입니다.
ControlNet이란
ControlNet은 사전 학습된 확산 모델의 인코딩 레이어를 복제하고, 논문이 "제로 컨볼루션"이라고 부르는 레이어 — 가중치가 0에서 시작하는 컨볼루션 레이어 — 를 통해 그 복제본을 원본 네트워크에 연결하는 방식으로 작동합니다. 그 결과 학습은 기반 모델의 원래 동작 그대로에서 시작해 새로운 조건화 신호를 점진적으로만 학습합니다. 이 과정에서 원본 모델의 가중치는 고정(동결)된 상태로 유지되므로, ControlNet을 추가해도 기반 Stable Diffusion 모델의 이미지 품질이 저하되지 않습니다.
실제로는 파이프라인에 하나가 아닌 두 가지 입력을 넣는다는 뜻입니다: 평소처럼 텍스트 프롬프트, 그리고 컨트롤 이미지 — 포즈 스켈레톤, 깊이 맵, 엣지 윤곽, 또는 대략적인 스케치입니다. 출력은 컨트롤 이미지의 구도와 구조를 따르면서도 프롬프트의 스타일과 피사체 설명을 함께 반영합니다.
ControlNet은 완성된 애플리케이션이 아닙니다. 논문은 아키텍처를 설명하고, 참조 GitHub 저장소는 코드와 사전 학습된 모델 가중치를 제공하지만, 더블클릭으로 실행하는 ControlNet 설치 프로그램은 존재하지 않습니다. 실제로 사용하려면 이미 사용 중인 Stable Diffusion용 UI에 확장 기능이나 내장 기능으로 설치해야 합니다 — 아래 설치 및 사용 방법을 참고하세요.
제1저자인 Lvmin Zhang은 스탠퍼드 대학교 소속 연구자로(이전에는 홍콩중문대학교와 쑤저우대학교에서 공부했습니다), GitHub 계정 lllyasviel로 활동합니다. 같은 인물이 최소한의 클릭으로 첫 이미지를 얻도록 설계된 단순화된 Stable Diffusion UI인 Fooocus도 만들었습니다 — 두 프로젝트를 모두 사용한다면 알아둘 가치가 있는 연결 고리로, 한쪽의 설계 결정이 다른 쪽으로 이어지는 경우가 있습니다.
📍 한 문장으로
ControlNet은 사전 학습된 Stable Diffusion 모델에 엣지 맵, 깊이 맵, 포즈 스켈레톤, 스케치 같은 정밀하게 형성된 추가 입력을 연결하는 신경망 아키텍처로, 출력이 텍스트 프롬프트에만 의존하지 않고 그 구조를 따르게 합니다.
💬 쉽게 말하면
텍스트 프롬프트는 화가에게 무엇을 그릴지 말로 알려주는 것이고, ControlNet 입력은 그 화가에게 따라 그릴 밑그림 윤곽선을 건네주는 것과 같습니다 — 윤곽선이 포즈와 구도를 정하고, 프롬프트는 여전히 스타일과 내용을 결정합니다.
ControlNet의 배경이 된 연구
ControlNet의 코드와 초기 사전 학습 가중치는 arXiv 프리프린트와 함께 2023년 2월 GitHub에 공개되었습니다. 더 정교해진 "ControlNet 1.1" 버전이 2023년 4월 14일에 뒤이어 출시되어 지원되는 조건화 유형을 확장하고 각 유형의 견고성을 향상시켰습니다. 이 논문은 ICCV 2023에서 정식으로 발표되었으며, Computer Vision Foundation의 공식 수상 페이지에서 확인된 대로 학회의 Marr Prize를 수상했습니다.
ControlNet은 원본 Stable Diffusion 1.5 아키텍처를 중심으로 만들어졌으며 먼저 그 위에서 검증되었습니다. 이후 오픈소스 커뮤니티가, 그리고 나중에는 Stability AI 자체가 Stable Diffusion XL과 Stable Diffusion 3.5를 포함한 더 새로운 기반 모델을 위해 추가적인 ControlNet 체크포인트를 학습시켜, 동일한 조건화 기법을 각 새로운 세대의 모델로 확장했습니다. 이 기반 모델들에 대한 배경은 Stable Diffusion 리뷰를 참고하세요.
논문 제목
- 검증된 사실:
- "Adding Conditional Control to Text-to-Image Diffusion Models"
저자
- 검증된 사실:
- Lvmin Zhang, Anyi Rao, Maneesh Agrawala
소속 기관
- 검증된 사실:
- 스탠퍼드 대학교
arXiv ID
- 검증된 사실:
- 2302.05543
발표 학회
- 검증된 사실:
- ICCV 2023 (IEEE/CVF International Conference on Computer Vision)
수상
- 검증된 사실:
- Marr Prize — ICCV 2023 최우수 논문상
코드 라이선스
- 검증된 사실:
- Apache License 2.0
사실은 2026-09-06 기준 arxiv.org, GitHub의 lllyasviel/ControlNet 저장소, CVF의 ICCV 2023 오픈 액세스 페이지, thecvf.com의 공식 수상 목록과 직접 대조하여 검증했습니다.
ControlNet 조건화 유형
ControlNet 1.1에는 이 핵심 세트 외에도 건축 및 실내용 직선 검출을 위한 M-LSD, 콘텐츠를 유지하는 재구성인 Shuffle, Inpaint, 업스케일링 작업 흐름을 위한 세부 향상 기능인 Tile 같은 추가 전문 모델이 포함됩니다. 각 조건화 유형은 별도의 모델 파일입니다 — 단일 범용 모델이 아니라 컨트롤 이미지에 맞는 것을 불러옵니다.
📍 한 문장으로
ControlNet 1.1은 조건화 유형별로 별도의 모델을 제공합니다 — Canny 엣지, 깊이, 사람 포즈, 스케치, 세그멘테이션, 라인아트, 소프트 엣지, 노멀 맵이 가장 많이 사용됩니다.
Canny 엣지
- 제어 대상:
- 참조 이미지에서 검출한 엣지를 따라 스타일을 바꾸면서도 구조를 유지
깊이
- 제어 대상:
- 깊이 맵을 사용해 공간적 배치와 원근감을 유지
OpenPose
- 제어 대상:
- 사람 포즈 스켈레톤(신체, 손, 얼굴 키포인트)을 추출해 인물의 포즈를 고정
스케치(Scribble)
- 제어 대상:
- 손으로 그린 대략적인 스케치를 느슨한 구도 가이드로 따름
세그멘테이션
- 제어 대상:
- 색상으로 구분된 영역 맵을 사용해 각 오브젝트나 표면이 나타나는 위치를 고정
라인아트(Lineart)
- 제어 대상:
- 깔끔한 라인아트 윤곽선을 따르며, 일러스트 작업 흐름에서 흔히 사용
소프트 엣지(HED)
- 제어 대상:
- Canny보다 부드럽고 덜 엄격한 엣지 검출을 사용해 더 유연한 구조를 구현
노멀 맵
- 제어 대상:
- 표면 방향 데이터를 인코딩하며, 3D에 가까운 작업이나 텍스처링에 유용
모델 이름과 동작은 lllyasviel/ControlNet-v1-1-nightly 저장소 문서와 대조하여 검증했습니다. 특정 UI가 기본으로 제공하는 유형은 UI마다 다르므로 해당 UI 자체의 모델 목록을 확인하세요.
AUTOMATIC1111이나 ComfyUI에서 ControlNet 설치 및 사용 방법
ControlNet은 독립 실행형 설치 프로그램이 아니므로 설정 방법이 UI마다 다릅니다. 가장 흔한 두 가지 방법을 아래에 정리했습니다.
- 1이미 작동하는 Stable Diffusion용 UI가 있는지 확인한다
Why it matters: AUTOMATIC1111, ComfyUI, InvokeAI 중 하나가 이미 설치되어 이미지를 생성하고 있지 않다면 ControlNet이 연결될 곳이 없습니다 — 아직 설정하지 않았다면 [Stable Diffusion 리뷰](/power-local-llm/stable-diffusion-review)를 참고하세요. - 2ControlNet 확장 기능을 설치하거나(AUTOMATIC1111) 네이티브 지원을 확인한다(ComfyUI/InvokeAI)
Why it matters: AUTOMATIC1111에는 ControlNet이 기본 내장되어 있지 않습니다 — Extensions 탭에서 커뮤니티 확장 기능 [sd-webui-controlnet](https://github.com/Mikubill/sd-webui-controlnet)을 추가하세요. ComfyUI는 핵심에 ControlNet 관련 노드를 포함하고 있으며, InvokeAI는 내장된 Control Layers 기능을 통해 ControlNet을 제공하므로 둘 다 별도의 확장 기능 설치가 필요 없습니다. - 3기반 모델에 맞는 ControlNet 체크포인트를 다운로드한다
Why it matters: SD 1.5용으로 학습된 체크포인트는 SDXL이나 SD 3.5에서 제대로 작동하지 않습니다 — 사용 중인 Stable Diffusion 버전에 ControlNet 모델을 맞추고, 다운로드 전에 라이선스를 확인하세요(아래 라이선스 섹션 참고). - 4체크포인트를 올바른 모델 폴더에 넣는다
Why it matters: AUTOMATIC1111은 ControlNet 모델이 `extensions/sd-webui-controlnet/models`에 있기를 기대합니다. ComfyUI와 InvokeAI는 각자 문서화된 모델 디렉터리를 사용하므로, 정확한 경로는 해당 UI의 현재 설정 가이드를 확인하세요. - 5조건화 유형을 선택하고 컨트롤 이미지를 제공한다
Why it matters: 컨트롤 이미지에 맞는 전처리기(Canny, 깊이, OpenPose 등)를 선택하거나, 업로드한 참조 사진에서 UI가 자동으로 생성하도록 둡니다. - 6ControlNet 가중치/강도를 설정하고 생성한다
Why it matters: 강도를 낮추면 프롬프트가 구도에 더 큰 영향을 미치고, 강도를 높이면 결과물이 컨트롤 이미지에 더 엄격하게 묶입니다 — 대부분의 UI는 기본값으로 중간 값을 사용하며 결과에 따라 조정할 수 있습니다.
ControlNet 라이선스: 코드 대 모델 가중치
이것이 상업용 제품에 ControlNet을 사용하기 전에 확인해야 할 가장 중요한 사실입니다: 라이선스는 하나의 숫자가 아닙니다. 참조 구현의 코드는 Apache License 2.0으로, 제한 없는 허용적 라이선스입니다. 하지만 다운로드하는 모델 체크포인트는 자체 라이선스를 가진 별도의 파일이며, 그 라이선스는 대개 체크포인트가 학습된 대상인 Stable Diffusion 기반 모델의 라이선스 계열을 반영합니다.
Hugging Face의 lllyasviel 계정에 게시된 Stable Diffusion 1.5용 원본 ControlNet 체크포인트는 "openrail"로 표기되어 있습니다 — SD 1.5 자체와 동일한 CreativeML OpenRAIL-M 라이선스 계열로, 매출 상한이 아니라 사용 방식에 기반한 콘텐츠 제한 하에서 상업적 이용을 허용합니다.
Hugging Face의 xinsir 계정에 게시되어 널리 쓰이는 모델처럼 커뮤니티가 학습시킨 SDXL용 ControlNet 체크포인트는 대개 단순한 Apache License 2.0으로 공개됩니다 — 커뮤니티 제작자마다 자신의 체크포인트에 다른 조건을 선택할 수 있으므로 구체적인 모델 카드를 확인하세요.
Stability AI가 자체적으로 Stable Diffusion 3.5 Large용으로 내놓은 공식 ControlNet — Blur, Canny, Depth 조건화를 대상으로 2024년 11월 26일 출시 — 은 SD 3.5 자체와 동일하게 매출 기준으로 제한되는 Stability AI Community License를 사용합니다: 등록 시 개인 및 조직의 연간 합산 매출이 100만 달러 미만이면 무료이며, 그 기준을 초과하면 Enterprise 라이선스가 필요합니다.
📍 한 문장으로
GitHub의 ControlNet 참조 코드는 Apache License 2.0이지만, 실제로 다운로드하는 모델 체크포인트는 기반이 되는 Stable Diffusion 버전과 이를 학습시킨 조직에 따라 서로 다른 라이선스를 가집니다.
💬 쉽게 말하면
레시피(코드)는 제한 없는 오픈소스이지만, 구체적인 재료(모델 가중치)는 각각 자체 라벨을 달고 있습니다 — 코드 라이선스만이 아니라 다운로드하는 체크포인트의 라벨을 확인하세요.
ControlNet 참조 코드(GitHub)
- 라이선스:
- Apache License 2.0
- 상업적 이용:
- 허용, 제한 없음
원본 SD 1.5 ControlNet 체크포인트(Hugging Face의 lllyasviel 계정)
- 라이선스:
- "openrail"(Stable Diffusion에서 물려받은 CreativeML OpenRAIL-M 계열)
- 상업적 이용:
- 허용, 사용 방식에 기반한 콘텐츠 제한 적용
커뮤니티 SDXL 체크포인트(예: xinsir 계정)
- 라이선스:
- 대개 Apache License 2.0
- 상업적 이용:
- 허용, 제한 없음 — 체크포인트별 확인 필요
Stability AI 공식 SD 3.5 Large ControlNet
- 라이선스:
- Stability AI Community License
- 상업적 이용:
- 등록 시 연 매출 100만 달러 미만이면 무료; 초과 시 Enterprise 라이선스 필요
라이선스 조건은 마케팅 문구가 아니라 법적 텍스트입니다 — 이 섹션은 2026-09-06 기준으로 공개된 조건을 요약한 것이며 법률 자문이 아닙니다. 상업적으로 배포하기 전에는 반드시 사용할 구체적인 체크포인트의 실제 LICENSE 파일이나 Hugging Face 모델 카드를 읽어보세요.
ControlNet의 하드웨어와 VRAM
ControlNet은 사용 중인 Stable Diffusion 모델 위에 복제된 인코딩 레이어 세트를 추가하므로, 기반 모델 자체의 요구 사항을 대체하는 것이 아니라 그 위에 VRAM 사용량을 더합니다.
커뮤니티 보고와 UI 문서에서는 일반적으로 Stable Diffusion 1.5에서 단일 ControlNet 모델당 약 1–2GB의 추가 VRAM을 설명하며, SDXL에서는 인코딩 레이어가 더 커서 복제 비용도 더 크기 때문에 더 큰 증가폭(모델당 약 2–4GB로 흔히 언급됨)을 보입니다. 여러 ControlNet 모델을 동시에 사용하면(예: 깊이와 포즈와 Canny를 동시에) 이 부담이 더 쌓입니다. T2I-Adapter 같은 더 가벼운 대안(아래 대안 섹션 참고)은 ControlNet보다 VRAM 부담을 상당히 줄이도록 설계되었지만, 일부 커뮤니티 비교에서는 제어 정밀도가 다소 떨어집니다.
이 수치는 PromptQuorum이 직접 수행한 통제된 테스트가 아니라 커뮤니티 벤치마크에서 나온 것이므로 계획용 참고 범위로 다루세요 — 한계에 가까운 GPU가 특정 기반 모델과 ControlNet 조합을 감당할 것이라고 가정하기 전에, 사용 중인 UI의 문서나 이슈 트래커에서 현재의 VRAM 동작을 확인하세요.
가격: 무료이며 오픈 웨이트
ControlNet은 별도의 가격이 없습니다 — 무료이며 오픈 웨이트로, 자체 구독료나 라이선스 비용이 있는 제품이 아니라 코드와 모델 체크포인트로 배포됩니다. 원래 연구팀이 제공하는, PromptQuorum이 확인한 유료 등급, 멤버십, 호스팅형 ControlNet-as-a-Service 같은 것은 존재하지 않습니다.
실제 비용은 이미 사용 중인 Stable Diffusion용 UI(AUTOMATIC1111, ComfyUI, InvokeAI 모두 그 자체로 무료이며 오픈소스입니다)에 더해 자체 GPU 하드웨어와 전기료입니다. 발생할 수 있는 유일한 반복 비용은 그 UI를 실행하기 위해 선택하는 호스팅형 또는 클라우드 GPU 서비스 비용이며, 이는 ControlNet 자체와는 무관합니다.
ControlNet과 대안 조건화 기법 비교
ControlNet, T2I-Adapter, IP-Adapter는 서로 배타적이지 않습니다 — 많은 작업 흐름이 같은 생성 과정에서 ControlNet(포즈나 구도용)과 IP-Adapter(스타일이나 캐릭터 일관성용)를 함께 사용합니다. 어떤 조합이 적절한지는 고정하려는 대상이 구조(ControlNet, T2I-Adapter)인지 외형(IP-Adapter)인지에 달려 있습니다.
이러한 기법들이 연결되는 Stable Diffusion 기반 모델 선택에 대해서는 Stable Diffusion 리뷰를 참고하세요. 로컬 이미지 생성과 클라우드 전반의 더 폭넓은 비교는 로컬 AI 이미지 생성 대 클라우드를 참고하세요.
UI 측면에서 ComfyUI는 별도의 확장 기능 없이 네이티브 ControlNet 노드를 갖추고 있고, AUTOMATIC1111은 커뮤니티 확장 기능 sd-webui-controlnet이 필요하며, InvokeAI는 캔버스에 내장된 Control Layers로 이를 통합합니다. 그리고 ControlNet을 만든 바로 그 연구자가 만든 Fooocus는 원시적인 ControlNet 모델 선택을 노출하는 대신, ControlNet 기반의 자체 단순화된 구조 유도 기능을 내장하고 있습니다.
ControlNet
- 적합한 용도:
- 가장 정밀한 구조적 제어, 가장 다양한 조건화 유형, 가장 큰 사전 학습 체크포인트 생태계
- VRAM 부담:
- 더 높음 — 기반 모델에 따라 모델당 약 1–4GB
- 라이선스 / 비용:
- Apache-2.0 코드; 체크포인트 라이선스는 다양(openrail / Apache-2.0 / Stability Community License)
- 주요 트레이드오프:
- 더 가벼운 어댑터보다 VRAM과 설정 부담이 큼; 체크포인트 라이선스는 파일별 확인 필요
ControlNet 관련 문서 (5개)
- AUTOMATIC1111 Review (2026): Stable Diffusion WebUI Explained업데이트 2026년 9월 6일
- ControlNet Review (2026): Structural Control for Stable Diffusion업데이트 2026년 9월 6일
- Fooocus Review (2026): The Simplest Local Stable Diffusion UI업데이트 2026년 9월 6일
- Stable Diffusion Review (2026): Free Local Text-to-Image Models업데이트 2026년 9월 5일
- AnimateDiff Guide 2026: Animate Any Stable Diffusion Model업데이트 2026년 9월 2일
기타 언급:
- Draw Things Review (2026): Free Offline Image AI for Mac & iOS업데이트 2026년 9월 7일
- ComfyUI Review (2026): Free Node-Based UI for Stable Diffusion & Flux업데이트 2026년 9월 6일
- Apple Silicon vs NVIDIA GPU for Local LLMs 2026: Performance, Cost, Workflow Compared업데이트 2026년 9월 1일
- Local AI Images Are Free. Cloud AI Images Are Instant. Your GPU Decides.업데이트 2026년 8월 21일
T2I-Adapter
- 적합한 용도:
- 더 빠른 추론과 더 낮은 VRAM으로 유사한 조건화 유형(스케치, 깊이, Canny) 구현
- VRAM 부담:
- ControlNet보다 상당히 낮음
- 라이선스 / 비용:
- 무료, 오픈 웨이트
- 주요 트레이드오프:
- 모델이 더 작으며, 커뮤니티 비교에서는 대체로 ControlNet보다 정밀도가 다소 떨어진다고 평가됨
IP-Adapter
- 적합한 용도:
- 구조가 아니라 참조 이미지의 스타일이나 피사체를 조건으로 삼음
- VRAM 부담:
- 낮음 — 경량 크로스 어텐션 어댑터
- 라이선스 / 비용:
- 무료, 오픈 웨이트
- 주요 트레이드오프:
- 외형/스타일 전이를 제어하며 포즈나 구도는 제어하지 않음 — 대체재가 아니라 ControlNet과 함께 쓰이는 경우가 많음
프롬프트 엔지니어링만 사용(조건화 애드온 없음)
- 적합한 용도:
- 정확한 포즈나 레이아웃이 중요하지 않은 단순한 구도
- VRAM 부담:
- 없음
- 라이선스 / 비용:
- 해당 없음
- 주요 트레이드오프:
- 문구만으로는 정확한 포즈, 카메라 각도, 오브젝트 배치를 신뢰성 있게 고정할 방법이 없음
ControlNet에 적합한 사용자
- 정확한 포즈, 카메라 각도, 오브젝트 배치가 필요한 독자. ControlNet은 프롬프트 문구만으로는 신뢰성 있게 재현할 수 없는 특정 구조에 생성 이미지를 고정하는 가장 직접적인 방법입니다.
- 이미 Stable Diffusion용 UI에 익숙한 독자. 이미 AUTOMATIC1111, ComfyUI, InvokeAI를 사용 중이라면 ControlNet 추가는 체크포인트 다운로드와 설정 조정 정도이지, 새 플랫폼을 배우는 일이 아닙니다.
- 스케치에서 시작하는 일러스트레이터와 콘셉트 아티스트. 스케치와 라인아트 조건화를 이용하면 대략적인 스케치나 깔끔한 선화가 최종 구도를 직접 유도할 수 있습니다.
- 참조 지오메트리를 재사용하는 사진가나 3D 아티스트. 깊이 및 노멀 맵 조건화는 참조 사진이나 3D 렌더링의 공간적 배치를 새로운 스타일화된 이미지로 그대로 옮깁니다.
- 해당 매출 기준 미만의 소규모 사업체나 개인. Apache-2.0 코드와 openrail/Apache-2.0 라이선스 체크포인트 모두 이 규모에서 구독 없이 상업적 이용을 지원합니다. Stability Community License 체크포인트도 등록 시 연 매출 100만 달러까지는 마찬가지입니다.
ControlNet에 적합하지 않은 사용자
- 아직 Stable Diffusion용 UI를 설정하지 않은 완전 초보자. ControlNet은 이미 간단하지 않은 로컬 설치 위에 실질적인 설정 및 구성 단계를 추가로 요구합니다 — 먼저 단순한 프롬프트 생성에 익숙해진 다음, 그 작업 흐름에 익숙해지면 ControlNet을 추가하세요.
- 설정 없는 원클릭 앱을 원하는 독자. ControlNet 앱이라는 것은 존재하지 않습니다. 기존 UI에 얹는 애드온이며, UI마다 이를 조금씩 다르게 표시합니다. 설정을 전혀 하고 싶지 않은 독자는 클라우드 도구를 고려해야 합니다.
- 단순한 이미지에 프롬프트 문구만 의존하는 독자. 사용 사례에서 정확한 포즈나 레이아웃이 중요하지 않다면 순수한 프롬프트 엔지니어링이 더 빠르고, ControlNet이 요구하는 추가 VRAM과 설정을 피할 수 있습니다.
- 기반 모델만으로도 이미 한계에 가까운 VRAM 제약 GPU를 사용하는 독자. ControlNet은 Stable Diffusion 자체 위에 상당한 VRAM 부담을 추가합니다 — 하드웨어와 VRAM 참고 — T2I-Adapter 같은 더 가벼운 옵션이 더 적합할 수 있습니다.
- Stability AI 공식 SD 3.5 ControlNet을 사용할 계획이며 해당 매출 기준을 초과하는 조직. Stability AI Community License는 연 매출 100만 달러를 초과하면 Enterprise 라이선스를 요구합니다 — 그 협상을 예산에 반영하거나, 사용 사례에 맞는다면 대신 Apache-2.0 라이선스 SDXL 체크포인트를 사용하세요.
자주 묻는 질문
ControlNet이란 무엇인가요?
ControlNet은 포즈, 깊이, 엣지 맵, 스케치, 세그멘테이션 등 정밀한 구조적 조건을 Stable Diffusion 이미지 생성에 추가하는 신경망 아키텍처입니다. 스탠퍼드 대학교의 Lvmin Zhang, Anyi Rao, Maneesh Agrawala가 쓴 논문 "Adding Conditional Control to Text-to-Image Diffusion Models"에서 소개되었으며, ICCV 2023에서 발표되었습니다.
ControlNet은 독립 실행형 앱인가요?
아닙니다. ControlNet은 참조 구현이 있는 기법으로, 소비자용 애플리케이션이 아니라 코드와 모델 체크포인트로 배포됩니다. 사용하려면 이미 사용 중인 Stable Diffusion용 UI — AUTOMATIC1111용 커뮤니티 확장 기능 sd-webui-controlnet, ComfyUI의 네이티브 노드, 또는 InvokeAI에 내장된 Control Layers — 에 설치해야 합니다.
ControlNet은 무료인가요?
네. GitHub의 참조 코드는 제한 없는 오픈소스 라이선스인 Apache License 2.0이며, 별도의 유료 ControlNet 제품은 없습니다. 개별 모델 체크포인트는 대상으로 하는 Stable Diffusion 기반 버전에 따라 다른 자체 라이선스를 가집니다 — 자세한 내용은 라이선스 섹션을 참고하세요.
ControlNet을 상업적으로 사용할 수 있나요?
구체적인 체크포인트에 따라 다릅니다. 원본 SD 1.5 ControlNet 체크포인트는 "openrail"로 표기되어 있으며 콘텐츠 제한 하에 상업적 이용을 허용합니다. 커뮤니티 SDXL 체크포인트(예: xinsir 계정)는 대개 제한 없는 Apache License 2.0입니다. Stability AI 공식 SD 3.5 Large ControlNet은 Stability AI Community License를 사용하며, 등록 시 연 매출 100만 달러 미만이면 무료이고 초과하면 Enterprise 라이선스가 필요합니다. 상업적 이용 전에는 항상 구체적인 체크포인트의 라이선스 페이지를 확인하세요.
ControlNet은 누가 만들었나요?
ControlNet은 스탠퍼드 대학교의 Lvmin Zhang, Anyi Rao, Maneesh Agrawala가 논문 "Adding Conditional Control to Text-to-Image Diffusion Models"에서 소개했으며, ICCV 2023에서 발표되어 학회 최우수 논문상인 Marr Prize를 수상했습니다. GitHub 계정 lllyasviel로 활동하는 Lvmin Zhang은 단순화된 Stable Diffusion UI인 Fooocus도 만들었습니다.
어떤 Stable Diffusion용 UI가 ControlNet을 지원하나요?
AUTOMATIC1111의 Stable Diffusion WebUI는 커뮤니티 확장 기능 sd-webui-controlnet을 통해 ControlNet을 지원합니다(기본 내장은 아님). ComfyUI는 핵심에 ControlNet 관련 노드를 네이티브로 포함합니다. InvokeAI는 캔버스 작업 흐름 안에 내장된 Control Layers로 ControlNet을 통합합니다. ControlNet의 제작자가 만든 Fooocus는 원시적인 모델 선택을 노출하는 대신 ControlNet 기반의 자체 단순화된 구조 유도 기능을 내장하고 있습니다.
ControlNet은 어떤 조건화 유형을 지원하나요?
ControlNet 1.1에는 Canny 엣지 검출, 깊이 맵, OpenPose 사람 포즈 스켈레톤, 스케치, 세그멘테이션 맵, 라인아트, 소프트 엣지(HED) 검출, 노멀 맵을 위한 모델과 더불어 M-LSD(직선), Shuffle, Inpaint, Tile 같은 추가 전문 유형이 포함됩니다.
ControlNet은 VRAM을 얼마나 추가로 사용하나요?
그 요구 사항을 대체하는 것이 아니라 Stable Diffusion 기반 모델 위에 VRAM을 추가합니다. 커뮤니티 보고는 일반적으로 Stable Diffusion 1.5에서 ControlNet 모델당 약 1–2GB의 추가 VRAM을 설명하며, SDXL에서는 인코딩 레이어가 더 커서 증가폭이 더 큽니다. 여러 ControlNet 모델을 동시에 사용하면 이 부담이 더 쌓입니다. 이는 계획용 참고 범위이며, PromptQuorum이 직접 수행한 통제된 벤치마크가 아닙니다.
ControlNet, T2I-Adapter, IP-Adapter의 차이는 무엇인가요?
ControlNet과 T2I-Adapter는 모두 엣지, 깊이, 포즈 같은 구조적 입력으로 생성을 조건화하지만, T2I-Adapter는 더 작은 아키텍처를 사용해 VRAM 부담이 낮고 추론이 더 빠른 대신, 커뮤니티 비교에서는 정밀도를 다소 희생합니다. IP-Adapter는 구조가 아니라 참조 이미지의 스타일이나 피사체 외형을 조건으로 삼으며, 대체재가 아니라 ControlNet과 함께 조합되는 경우가 많습니다.
총평
ControlNet은 그 자체로 하나의 제품이 아니라, ICCV 2023 데뷔 이후 그 주위에 방대한 체크포인트 생태계가 형성된, 잘 문서화된 연구 기법으로서 Stable Diffusion에 정밀한 구조적 제어를 더하는 표준적인 방법이라는 지위를 얻었습니다. 이미 AUTOMATIC1111, ComfyUI, InvokeAI를 사용 중인 독자는 플랫폼을 바꾸지 않고도 포즈, 깊이, 엣지, 스케치 조건화를 추가할 수 있으며, 기반 코드는 제한 없는 Apache-2.0 라이선스를 갖고 있습니다. 트레이드오프는 실재합니다 — 이것은 앱이 아니며, 기반 모델 위에 실질적인 설정 단계와 상당한 VRAM 부담을 추가하고, 라이선스도 하나의 정답이 아니라 다운로드하는 체크포인트에 따라 달라집니다. 가장 오래된 SD 1.5 모델의 "openrail"부터 Stability 자체 SD 3.5 ControlNet의 매출 기준 제한이 있는 Stability AI Community License까지 다양합니다. 비슷한 구조적 제어를 더 가벼운 VRAM 부담으로 원하는 독자는 T2I-Adapter도 함께 검토해야 하며, 아직 Stable Diffusion용 UI를 설정하지 않은 독자는 그것부터 먼저 시작해야 합니다. ControlNet만으로는 연결될 곳이 없기 때문입니다. 이미 로컬에서 이미지를 생성하고 있고 프롬프트 문구만으로는 얻을 수 없는 더 강력한 제어가 필요한 모든 이에게, ControlNet은 여전히 이를 얻을 수 있는 가장 폭넓게 지원되는 방법입니다.
출처
- "Adding Conditional Control to Text-to-Image Diffusion Models" — arXiv:2302.05543 — Lvmin Zhang, Anyi Rao, Maneesh Agrawala의 원본 논문.
- ControlNet — ICCV 2023 Open Access (CVF) — 공식 학회 발표 기록.
- Computer Vision Foundation — Awards — ICCV 2023 Marr Prize(최우수 논문상)의 공식 확인.
- GitHub의 lllyasviel/ControlNet — 참조 구현 및 Apache License 2.0 코드 라이선스.
- GitHub의 lllyasviel/ControlNet-v1-1-nightly — ControlNet 1.1 조건화 유형 문서.
- Hugging Face의 lllyasviel/ControlNet — 원본 SD 1.5 체크포인트 다운로드 및 "openrail" 라이선스 표기.
- Hugging Face의 xinsir/controlnet-canny-sdxl-1.0 — 커뮤니티 SDXL ControlNet 체크포인트 예시 및 Apache-2.0 라이선스.
- Hugging Face의 stabilityai/stable-diffusion-3.5-large-controlnet-depth — Stability AI 공식 SD 3.5 ControlNet 및 Community License 조건.
- Stability AI — ControlNets for Stable Diffusion 3.5 Large — 공식 발표, 2024년 11월 26일.
- GitHub의 Mikubill/sd-webui-controlnet — AUTOMATIC1111용 커뮤니티 ControlNet 확장 기능.
- GitHub의 Fooocus — ControlNet 제작자 Lvmin Zhang의 단순화된 Stable Diffusion UI.
