Skip to main content
PromptQuorum
/고급 로컬 LLM/로컬 이미지·영상·비전 도구 비교(2026): 생성, 비전, OCR
Image & Video Generation

로컬 이미지·영상·비전 도구 비교(2026): 생성, 비전, OCR

·9분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

PromptQuorum 디렉터리의 로컬 이미지 도구 16개는 따로 비교해야 하는 두 가지 작업, 즉 이미지·영상 생성(13개)과 비전·OCR(3개)로 나뉩니다. 생성 도구 중 ComfyUI, InvokeAI, StableSwarmUI는 노드 기반 워크플로를 문서화하고 있고, AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge, StableSwarmUI, ToolNeuron은 확장 시스템을, AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge, ToolNeuron은 로컬 API를 문서화하고 있습니다. 비전 도구 중 LLaVA는 이미지 속 텍스트 읽기를, Idefics는 프롬프트 하나에 여러 이미지 입력을 문서화하고 있습니다. 아래 비교표를 활용하고, 설치하기 전에 각 도구의 리뷰를 읽어 보십시오.

로컬 이미지 도구는 프롬프트로 이미지와 영상을 생성하는 일과 사용자가 넣은 이미지를 이해하는 일, 두 가지 서로 다른 작업을 하며, 하나의 기능 목록으로는 이들을 공정하게 비교할 수 없습니다. 이 가이드는 자신의 하드웨어에서 실행되는 무료 및 유료 도구 16개를 작업별로 나누어 비교합니다. 비교표는 각 도구의 PromptQuorum 리뷰와 같은 데이터에서 생성되므로 표와 리뷰가 서로 어긋날 수 없습니다.

이 페이지에는 타사 제품에 대한 참조 링크가 포함되어 있습니다. PromptQuorum은 어떤 제휴 프로그램에도 등록되어 있지 않습니다 — 이는 수수료가 발생하지 않는 일반 링크입니다. 링크 클릭 및 이후 단계는 전적으로 귀하의 책임입니다. 이 링크는 PromptQuorum의 어떠한 보증이나 검증을 나타내지 않습니다.

핵심 요점

  • 도구 16개, 작업 두 가지: 이미지·영상 생성(13개)과 비전·OCR(3개).
  • 표는 각 도구의 레코드에서 생성되며 공식 README나 사이트와 대조해 확인합니다. 대시는 "문서에 명시되지 않음"을 뜻하며, "아니오"를 뜻하지 않습니다.
  • 라이선스는 중요한 방식으로 서로 다릅니다. 예를 들어 AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge, Locally Uncensored는 AGPL-3.0, ComfyUI와 Fooocus는 GPL-3.0, AnimateDiff, ControlNet, InvokeAI는 Apache-2.0, StableSwarmUI와 ToolNeuron은 MIT이며, Stable Diffusion은 OpenRAIL 라이선스를 사용합니다.
  • 표의 모든 도구 이름은 해당 도구의 PromptQuorum 리뷰로 연결되며, 설치 단계와 한계는 그 리뷰에서 다룹니다.

📍 한 문장으로

로컬 이미지 도구는 이미지·영상을 생성하는 일과 이미지를 이해하는 일이라는 서로 다른 두 작업이므로, PromptQuorum 디렉터리의 도구 16개는 각 도구의 리뷰와 같은 도구 데이터에서 생성한 표를 사용해 작업별로 비교합니다.

💬 쉽게 말하면

어떤 도구는 텍스트 프롬프트로 그림을 그리고, 어떤 도구는 그림을 보고 그것에 대한 질문에 답합니다. 그림을 그리는 도구와 그림을 읽는 모델을 "인페인팅"으로 비교하는 것은 의미가 없으므로, 이 가이드는 같은 종류끼리 비교합니다.

비교 방법

각 도구의 사실 정보(가격, 라이선스, 플랫폼, 하드웨어 요구 사항, 카테고리별 속성)는 해당 도구의 디렉터리 레코드에 한 번만 저장됩니다. 아래 비교표는 이 레코드에서 생성되고 도구의 리뷰도 같은 레코드를 바탕으로 작성되므로, 두 곳이 서로 다른 값을 표시할 수 없습니다.

카테고리별 속성(예: 인페인팅이나 확장 지원)은 각 프로젝트의 공식 README나 웹사이트에서 가져와 그곳의 정확한 표현과 대조해 확인했습니다. 문서에 언급이 없는 경우 표에는 추측하지 않고 대시를 표시하며, 조건이 붙는 주장(실험적 기능, 포크에 의존하는 기능, 로컬 기능이 아닌 호스팅 서비스)은 표에서 제외하고 해당 도구의 리뷰에서 다룹니다.

자체 PromptQuorum 리뷰가 있는 도구만 표에 포함됩니다. 이 비교는 사용자의 하드웨어에서 실행되는 도구를 나열할 뿐 순위를 매기지 않습니다. 적합한 도구는 사용자의 조건에 따라 달라지기 때문입니다.

비교표

아래에서 작업을 선택한 다음 행을 따라 읽으십시오. 도구 이름을 클릭하면 PromptQuorum 리뷰 전문이 열립니다.

도구가격라이선스플랫폼실행 방식하드웨어버전인페인팅영상 생성노드/그래프 워크플로 편집기확장 기능 / 플러그인저VRAM 모드로컬 API 서버리뷰제품 링크 · 공개됨
AnimateDiff무료Apache-2.0Windows, Linux, macOS로컬VRAM 13 GB리뷰 읽기AnimateDiff
AUTOMATIC1111무료AGPL-3.0macOS, Windows, Linux로컬CPU만으로 충분v1.10.1리뷰 읽기AUTOMATIC1111
ComfyUI무료GPL-3.0macOS, Windows, Linux로컬CPU만으로 충분v0.36.0리뷰 읽기ComfyUI
ControlNet무료Apache-2.0Windows, Linux, macOS로컬VRAM 8 GB리뷰 읽기ControlNet
DiffusionBee무료AGPL-3.0macOS로컬CPU만으로 충분리뷰 읽기DiffusionBee
Draw Things무료ProprietarymacOS, iOS로컬RAM 8 GB리뷰 읽기Draw Things
Fooocus무료GPL-3.0Windows, Linux, macOS로컬CPU만으로 충분v2.5.5리뷰 읽기Fooocus
Invoke AI프리미엄Apache-2.0Windows, Linux, macOS로컬VRAM 4 GB리뷰 읽기Invoke AI
Locally Uncensored유료AGPL-3.0Windows로컬모델에 따라 다름리뷰 읽기Locally Uncensored
Stable Diffusion무료OpenRAILmacOS, Windows, Linux로컬VRAM 10 GB리뷰 읽기Stable Diffusion
Stable Diffusion WebUI Forge무료AGPL-3.0Linux, macOS, Windows로컬모델에 따라 다름리뷰 읽기Stable Diffusion WebUI Forge
StableSwarmUI무료MITWindows, Linux로컬VRAM 8 GB리뷰 읽기StableSwarmUI
ToolNeuron무료MITAndroid로컬모델에 따라 다름리뷰 읽기ToolNeuron

"—"는 프로젝트 자체 문서에 해당 내용이 명시되어 있지 않다는 뜻이며, 기능이 없다는 뜻이 아닙니다. 값은 각 프로젝트의 공식 README 또는 사이트에서 가져왔으며, 도구의 리뷰가 갱신될 때 다시 확인합니다.

이미지·영상 생성: 무엇이 다른가

  • 워크플로 방식. ComfyUI, Invoke AI, StableSwarmUI는 노드 기반 또는 그래프 워크플로를 문서화하고 있습니다. 나머지 도구의 문서에는 노드 편집기가 설명되어 있지 않습니다.
  • 확장과 플러그인. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge, StableSwarmUI, ToolNeuron은 확장 또는 플러그인 시스템을 문서화하고 있습니다.
  • 영상. ComfyUI, StableSwarmUI, DiffusionBee, Draw Things, Locally Uncensored, AnimateDiff는 영상 또는 애니메이션 생성을 문서화하고 있습니다.
  • 인페인팅. AUTOMATIC1111, ComfyUI, DiffusionBee, Fooocus, Invoke AI는 인페인팅을 문서화하고 있습니다.
  • 저VRAM 동작. AUTOMATIC1111, Fooocus, ControlNet은 저VRAM 모드 또는 명시된 소용량 VRAM 요구 사항을 문서화하고 있습니다. 나머지 도구는 요구 사항이 불러오는 모델에 따라 달라지므로 리뷰를 확인하십시오.
  • 로컬 API. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge, ToolNeuron은 다른 앱이 호출할 수 있는 API를 문서화하고 있습니다.
  • 라이선스와 가격. AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge, Locally Uncensored는 AGPL-3.0, ComfyUI와 Fooocus는 GPL-3.0, AnimateDiff, ControlNet, Invoke AI는 Apache-2.0, StableSwarmUI와 ToolNeuron은 MIT이며, Stable Diffusion은 OpenRAIL 라이선스를 사용합니다. Draw Things는 폐쇄 소스 앱, Locally Uncensored는 유료 앱, Invoke AI는 프리미엄(freemium)입니다. 카피레프트 라이선스는 수정본을 배포할 때 조건을 붙입니다. 자세한 내용은 AI 도구 라이선스 해설을 참고하십시오.

비전·OCR: 무엇이 다른가

  • 이미지 속 텍스트 읽기. LLaVAOllama 비전 모델은 이미지 속 텍스트를 읽거나 인식하는 기능을 문서화하고 있습니다.
  • 프롬프트당 여러 이미지. Idefics는 하나의 프롬프트에서 여러 이미지를 받는 기능을 문서화하고 있습니다.
  • 로컬 API. Ollama 비전 모델은 로컬 API를 문서화하고 있습니다. Idefics가 문서화한 API는 로컬이 아니라 호스팅 방식이므로 포함하지 않습니다.
  • 라이선스. LLaVA와 Idefics는 Apache-2.0입니다. Ollama 비전 모델은 라이선스가 서로 다른 모델들의 집합이므로 각 모델의 라이선스를 직접 확인하십시오.

이 비교가 알려주지 못하는 것

  • 이 비교는 품질이 아니라 문서화된 기능을 비교합니다. 이미지가 얼마나 좋아 보이는지, 텍스트 읽기가 얼마나 정확한지는 알려주지 않으며, 그것은 사용자의 프롬프트와 하드웨어로 직접 확인해야 합니다.
  • 속도 벤치마크는 포함하지 않습니다. PromptQuorum은 이 도구들의 속도를 측정하지 않았습니다.
  • 대시는 프로젝트 문서의 공백이지 부정적인 판정이 아닙니다. README에 언급되지 않았더라도 해당 기능을 지원하는 도구가 있을 수 있습니다.
  • 편집·업스케일링 도구(Real-ESRGAN, FunClip)와 Ollama를 통한 DALL-E 3은 여기서 비교하지 않습니다. 앞의 두 가지는 공통점이 너무 적어 비교할 수 없고, 마지막은 PromptQuorum 리뷰가 없기 때문입니다.
  • 도구는 빠르게 바뀝니다. 각 도구의 리뷰에는 확인 기준이 된 버전이 명시되어 있으며, 이 가이드는 리뷰가 갱신될 때 함께 갱신됩니다.

자주 묻는 질문

이미지 생성 도구와 비전 모델을 따로 비교하는 이유는 무엇입니까?

두 도구는 서로 다른 작업을 하므로 대부분의 속성은 한 작업 안에서만 의미가 있습니다. 인페인팅은 이미지 생성에, 이미지 속 텍스트 읽기는 비전 모델에 해당합니다. 하나의 표에 합치면 대부분의 칸이 비거나 의미가 없어집니다.

비교표의 대시는 무슨 뜻입니까?

프로젝트 자체 문서에 해당 속성이 명시되어 있지 않다는 뜻입니다. 기능이 없다는 뜻이 아니므로, 도구의 리뷰나 저장소를 확인하십시오.

Stable Diffusion 자체도 앱입니까?

Stable Diffusion은 앱이 아니라 이미지 모델 계열입니다. 자체 PromptQuorum 리뷰가 있어서 앱과 함께 나열했으며, 여기 나온 생성 도구 대부분이 Stable Diffusion 모델을 실행할 수 있습니다.

이 도구들 중에 제휴(어필리에이트) 링크가 있습니까?

아니요. 작성 시점 기준으로 PromptQuorum은 이 비교에 포함된 어떤 도구와도 제휴 관계가 없으며, 여기 있는 어떤 링크도 수수료를 발생시키지 않습니다.

이 비교는 얼마나 자주 갱신됩니까?

연 2회 갱신하며, 표가 각 리뷰와 같은 데이터에서 생성되므로 나열된 도구의 리뷰가 갱신될 때마다 함께 갱신합니다.

출처

← 고급 로컬 LLM으로 돌아가기