핵심 요점
- 멀티모달 지원은 Ollama v0.1.15(2023년 12월 12일)에서 추가되었으며, 2026년 5월 전용 멀티모달 엔진으로 재구축되었다.
- 현재 등록이 확인된 비전 지원 모델: LLaVA(llava-llama3, llava-phi3, bakllava 포함), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4, Mistral Small 3.1.
- CLI:
ollama run프롬프트 텍스트 안에 이미지 파일 경로를 직접 적는다 — 별도 플래그 없음. - HTTP API:
/api/generate와/api/chat은 Ollama 자체의docs/api.md에 문서화된 대로images배열에 base64로 인코딩된 이미지를 받는다. - Ollama는 추론 전용: 모델을 실행할 뿐, 파인튜닝하거나 학습시키지 않는다.
- Ollama가 2023년 중반에 등장한 이후 줄곧 llama.cpp를 기반으로 함(GitHub 저장소는 2023년 6월 26일 생성, MIT 라이선스); 현재는 Apple Silicon에서 대체 백엔드로 Apple의 MLX도 지원한다.
📍 한 문장으로
Ollama는 2023년 12월 버전 0.1.15부터 비전 지원(멀티모달) 모델의 로컬 실행을 지원하며, 현재 라이브러리에는 LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4, Mistral Small 3.1이 등록되어 있고, 간단한 CLI(프롬프트에 이미지 파일 경로 지정)와 HTTP API(JSON images 배열에 base64로 인코딩된 이미지) 방식을 모두 지원한다.
💬 쉽게 말하면
Ollama는 명령어 하나로 자신의 컴퓨터에 AI 모델을 내려받아 실행할 수 있게 해주는 도구이며, 그중 일부 모델은 이미지를 보고 그에 관한 질문에 답할 수도 있다 — 이 가이드는 그렇게 하기 위한 실제 명령어와 API 호출 방법을 보여준다.
📌참고: 위 모델 목록은 본 리뷰 작성 시점에 PromptQuorum이 ollama.com/library에서 실시간으로 확인한 내용을 반영한 것이다. Ollama의 라이브러리는 변경되므로, 특정 모델에 의존하기 전에 현재 등록 상태를 확인하라 — 정확히 확인한 라이브러리 URL은 출처 섹션을 참고하라.
역사: Ollama, llama.cpp, 그리고 멀티모달 지원
**Ollama의 GitHub 저장소는 2023년 6월 26일에 생성되었으며**, MIT 라이선스로 배포된다. GGUF 형식 모델용 C/C++ 추론 엔진인 llama.cpp를 Docker와 유사한 명령줄 인터페이스와 로컬 HTTP API로 감싸고 있다 — 핵심 가치는 ollama run llama3 한 번으로 사용자가 의존성, GPU 드라이버, 추론 엔진 자체를 직접 관리할 필요 없이 모델을 다운로드하고 실행할 수 있다는 점이다.
**멀티모달(이미지 입력) 지원은 2023년 12월 12일 출시된 Ollama v0.1.15에서 추가되었으며**, 첫 지원 비전 모델로 LLaVA가 함께 도입되었다. 릴리스 노트에는 ollama run llava를 실행한 뒤 대화형 프롬프트에 이미지 파일 경로를 직접 입력하는 방법과, /api/generate HTTP 엔드포인트에 추가된 새로운 images 매개변수(최대 100MB의 base64 인코딩 PNG 또는 JPEG 이미지 지원)가 설명되어 있다.
Ollama는 2026년 5월경 멀티모달 지원을 전용 멀티모달 엔진으로 재구축했다. Ollama 자체 블로그에 따르면, 이 업데이트는 Llama 4, Gemma 3, Qwen2.5-VL, Mistral Small 3.1 등 최신 모델 계열을 위한 정식 비전 지원을 추가했으며, 기존 LLaVA 통합에 사용되던 보다 범용적인 방식 대신 이미지 해상도, 위치 메타데이터, 어텐션 메커니즘을 모델별로 처리한다. 같은 업데이트에서 llama.cpp 백엔드를 통해 Apple Silicon에서 멀티모달 모델에 대한 Metal GPU 오프로드도 도입되었다.
Ollama는 주로 llama.cpp 백엔드에서 동작하며, 별도로 Apple Silicon 하드웨어에서 대체 백엔드로 Apple의 MLX 프레임워크도 지원한다. 일부 최신 멀티모달 모델은 Mac에서 더 나은 성능을 위해 이를 활용할 수 있다.
Ollama는 언제 비전 모델 지원을 추가했는가?
Ollama는 2023년 12월 12일 출시된 버전 0.1.15에서 멀티모달(이미지 입력) 지원을 추가했으며, 첫 지원 비전 모델은 LLaVA였다. 2026년 5월경에는 Llama 4, Gemma 3, Qwen2.5-VL, Mistral Small 3.1 같은 최신 모델 계열을 위해 전용 멀티모달 엔진으로 재구축했다.
Ollama 라이브러리에 실제로 있는 비전 모델
PromptQuorum은 본 리뷰 작성 시점에 다음 모델들을 ollama.com/library에서 직접 확인했다 — 이 목록은 Ollama용으로 패키징되었는지 여부가 불확실한 비전 언어 모델 전반에 대한 일반적인 조사가 아니라, 오늘 실제로 pull 가능한 모델을 반영한다.
llava
- 개발사:
- UW-Madison / Microsoft Research / Columbia(연구 프로젝트)
- 비고:
- 7B/13B/34B; PromptQuorum의 LLaVA 전문 리뷰 참고
llava-llama3 / llava-phi3 / bakllava
- 개발사:
- 커뮤니티 변형
- 비고:
- 서로 다른 베이스 LLM에 파인튜닝된 LLaVA 아키텍처 모델
llama3.2-vision
- 개발사:
- Meta
- 비고:
- 11B 및 90B 크기; 범용 이미지 질의응답에 강함
qwen2.5vl
- 개발사:
- 알리바바(Qwen 팀)
- 비고:
- 3B/7B/32B/72B; 강력한 OCR 및 문서 이해 능력
qwen3-vl
- 개발사:
- 알리바바(Qwen 팀)
- 비고:
- 2B~235B; qwen2.5vl보다 최신이며 최대 256K 컨텍스트, 이 표에서 가장 강력한 OCR/비주얼 에이전트 옵션
minicpm-v
- 개발사:
- OpenBMB
- 비고:
- 약 8B, 약 5.5GB; 낮은 VRAM에서도 강력한 문서 OCR, 다중 이미지 지원
moondream
- 개발사:
- 개인 개발자(Vikhyat K.)
- 비고:
- 1.8B, 약 1.7GB; 이 목록에서 가장 작은 옵션으로 경량/엣지 용도에 적합
granite3.2-vision
- 개발사:
- IBM
- 비고:
- 약 2.4GB; 표, 차트, 인포그래픽 등 시각적 문서 분석에 특화
gemma3
- 개발사:
- 비고:
- 4B/12B/27B 크기가 멀티모달(270M과 1B는 텍스트 전용)
llama4
- 개발사:
- Meta
- 비고:
- 전문가 혼합(Mixture-of-Experts) 구조로 네이티브 멀티모달; 다운로드 용량이 큼(67GB 이상)
mistral-small3.1
- 개발사:
- Mistral AI
- 비고:
- 24B, 약 15GB; Apache-2.0 라이선스, 비전과 텍스트 모두 지원
Ollama 라이브러리는 빠르게 변화한다: 본문의 나머지 부분을 작성한 이후, 더 새롭고 강력한 Qwen 비전 모델 옵션으로 qwen3-vl(최대 256K 컨텍스트)이 qwen2.5vl과 함께 추가되었다. 본 리뷰 작성 시점 기준 Ollama 라이브러리에 자체 페이지가 있는지 확인되지 않았지만 다른 곳에서 비전 모델로 언급되는 모델: qwen2-vl(qwen2.5vl로 대체됨), 그리고 독립된 llava-next 항목(LLaVA-NeXT/1.6 개선 사항은 llava 목록 자체에 통합됨). 특정 모델 이름에 의존하기 전에는 항상 ollama.com/library/<이름>을 직접 확인하라 — 이 표는 특정 시점의 스냅샷이지 실시간 피드가 아니다.
비전 모델 다운로드 및 실행: 단계별 가이드
이 가이드는 LLaVA를 예시로 사용하지만, 동일한 절차가 위 표의 모든 모델에 적용된다.
- 1Ollama를 설치한다.
Why it matters: macOS, Linux, Windows용 [Ollama](https://ollama.com)를 다운로드한다. 설치는 표준 설치 프로그램/패키지 형태이며 2분이 채 걸리지 않는다. - 2비전 모델을 다운로드한다.
Why it matters: `ollama pull llava`(또는 `ollama pull qwen2.5vl`, `ollama pull minicpm-v` 등)를 실행한다 — 이렇게 하면 모델 가중치가 다운로드되며, 크기는 2GB 미만(Moondream)에서 수십 GB(Llama 4)까지 다양하다. - 3프롬프트에 이미지를 지정하여 실행한다.
Why it matters: `ollama run llava "describe this image: ./photo.jpg"`를 실행한다. Ollama는 프롬프트 텍스트 안의 `.jpg`/`.png` 파일 경로를 감지하여 자동으로 이미지를 첨부한다 — 이 방식은 2023년 12월 v0.1.15 이후 계속 작동해왔다. - 4또는 HTTP API를 직접 호출한다.
Why it matters: `http://localhost:11434/api/generate` 또는 `/api/chat`에 base64로 인코딩된 이미지를 `images` 배열에 담아 POST 요청을 보낸다 — 정확한 JSON 형식은 Ollama 자체의 [docs/api.md](https://github.com/ollama/ollama/blob/main/docs/api.md)에 문서화되어 있으며, 아래 사용 예시 섹션에서도 보여준다. - 5(선택 사항) 공식 클라이언트 라이브러리를 사용한다.
Why it matters: 공식 `ollama` Python 및 JavaScript 라이브러리는 이미지 파일 경로를 직접 받아들이고 base64 인코딩을 대신 처리해주므로, 스크립트에서 수동으로 인코딩할 필요가 없다.
실제 사용 예시: CLI와 HTTP API
아래 예시들은 Ollama 자체 문서와 검증된 요청/응답 형식에서 직접 가져온 것으로, 임의로 지어낸 문법이 아니다.
- CLI에는 별도의 이미지 플래그가 없다. Ollama는 프롬프트 텍스트 자체에 포함된
.jpg/.png등의 파일 경로를 감지하여 자동으로 첨부한다. /api/generate는prompt를 사용하고,/api/chat은messages를 사용한다.** 둘 다 base64로 인코딩된 문자열의images배열을 받으며,/api/chat은 개별 메시지에 이미지를 첨부한 멀티턴 대화를 지원한다.
# CLI로 다운로드하고 실행 — 프롬프트에 이미지 경로를 직접 지정
ollama pull llava
ollama run llava "describe this image: ./photo.jpg"
# --- HTTP API: /api/generate (Ollama의 docs/api.md에 문서화됨) ---
curl http://localhost:11434/api/generate -d '{
"model": "llava",
"prompt": "What is in this picture?",
"stream": false,
"images": ["<base64-encoded image data>"]
}'
# --- HTTP API: /api/chat (멀티턴, 마찬가지로 docs/api.md에 문서화됨) ---
curl http://localhost:11434/api/chat -d '{
"model": "llava",
"messages": [
{ "role": "user", "content": "What is in this image?", "images": ["<base64-encoded image data>"] }
]
}'
# --- Python: 공식 ollama 라이브러리 (base64 인코딩을 대신 처리) ---
import ollama
response = ollama.chat(
model="llava",
messages=[{
"role": "user",
"content": "What is in this image?",
"images": ["photo.jpg"],
}],
)
print(response["message"]["content"])
# --- Python: 수동 base64 인코딩을 사용한 원시 HTTP API 호출 ---
import base64
import requests
def ask_vision_model(image_path: str, prompt: str, model: str = "llava") -> str:
with open(image_path, "rb") as f:
image_b64 = base64.b64encode(f.read()).decode("utf-8")
response = requests.post(
"http://localhost:11434/api/generate",
json={"model": model, "prompt": prompt, "images": [image_b64], "stream": False},
)
return response.json()["response"]VRAM 및 하드웨어 가이드
Ollama 자체 모델 라이브러리 페이지에는 각 모델의 다운로드 크기가 나와 있으며, 이는 양자화된 모델을 실행하는 데 필요한 VRAM이나 RAM의 합리적인 대략치로 볼 수 있다 — PromptQuorum은 모델별 다운로드 크기 외에 Ollama가 별도로 공개한 권위 있는 VRAM 표는 찾지 못했다.
모델 | 대략적인 크기 | 실용적인 최소 사양 |
|---|---|---|
| Moondream | 약 1.7GB | VRAM 4GB / 사양이 낮은 하드웨어에서도 동작 |
| Granite 3.2 Vision | 약 2.4GB | VRAM 4-6GB |
| LLaVA 7B / MiniCPM-V | 약 4.7-5.5GB | VRAM 6-8GB |
| Llama 3.2 Vision 11B / Qwen2.5-VL 7B | 약 6-8GB | VRAM 8-10GB |
| Mistral Small 3.1 | 약 15GB | VRAM 16-24GB |
| LLaVA 34B / Qwen2.5-VL 32B | 약 20-21GB | VRAM 24GB 이상 |
| Llama 3.2 Vision 90B / Llama 4 | 약 55-67GB 이상 | 멀티 GPU 또는 대용량 메모리의 Apple Silicon |
📌참고: 이는 대략적인 다운로드 크기이지 실측된 VRAM 벤치마크가 아니다 — PromptQuorum은 이 글을 위해 자체 하드웨어 테스트를 진행하지 않았다. 사용 가능한 VRAM에 맞지 않으면 모델은 CPU만으로도 훨씬 느리게 실행될 수 있다. 실제로 사용 가능한 VRAM 여유분은 컨텍스트 길이와 배치 크기에도 좌우된다.
Ollama가 적합하지 않은 경우
Ollama는 비전 지원 모델을 로컬에서 실행하는 견고하고 활발히 개발되고 있는 방법이지만, 다음과 같은 상황에는 적합하지 않다.
- 모델 파인튜닝이나 학습. Ollama는 추론 전용이다 — 학습된 모델 가중치를 실행할 뿐, 학습이나 파인튜닝 파이프라인을 제공하지 않는다. 자체 데이터로 비전 언어 모델을 파인튜닝해야 한다면, 원본 LLaVA 저장소 자체의 학습 스크립트나 Hugging Face Transformers 같은 프레임워크 등 별도의 도구 체인이 필요하다.
- 최첨단 독점 멀티모달 성능. Ollama의 라이브러리는 오픈 웨이트 모델을 중심으로 구축되어 있다. 본 리뷰 작성 시점 기준, GPT-4o, Claude, Gemini의 클라우드 비전 API는 복잡한 장면 이해, 손글씨 인식, 모호한 이미지 처리에서 일반적으로 오픈된 로컬 모델을 앞선다 — Ollama는 이미지당 한계 비용 제로로 프라이빗하게 자체 호스팅하는 용도에 적합하며, 절대적인 최첨단 성능을 따라잡기 위한 도구는 아니다.
- 차트와 그래프에서의 정확한 수치 추출. 이는 Ollama라는 실행 도구 자체의 한계가 아니라 기반이 되는 비전 언어 모델 자체의 한계다 — 어떤 모델이나 실행 도구를 사용하든 추출한 수치는 항상 원본 데이터와 대조 확인해야 한다.
- "어떤 모델이 최고인가"에 대한 단일한 답. Ollama에서 어떤 비전 모델이 적합한지는 작업에 따라 다르다: OCR 비중이 높은 문서 작업에는 Qwen2.5-VL, 낮은 VRAM에서의 OCR에는 MiniCPM-V, 범용 이미지 질의응답에는 Llama 3.2 Vision, 가장 가벼운 용도에는 Moondream이 적합하다. 작업별 세부 지침은 PromptQuorum의 로컬 비전 모델 비교를 참고하라.
Ollama 비전 모델의 대안
LM Studio
- 가장 적합한 용도:
- GUI 중심의 로컬 모델 실행 도구; 채팅 인터페이스에서 이미지 첨부를 통한 비전 지원 모델 사용을 확인함
- 라이선스:
- 무료, 독점 애플리케이션
llama.cpp 직접 사용
- 가장 적합한 용도:
- Ollama의 래퍼 계층 없이, 멀티모달(llava.cpp 방식) 지원을 포함한 추론에 대한 최대한의 저수준 제어
- 라이선스:
- MIT
LLaVA 자체 저장소
- 가장 적합한 용도:
- 연구 수준의 제어, 학습/파인튜닝 스크립트 — PromptQuorum의 LLaVA 리뷰 참고
- 라이선스:
- Apache-2.0(코드); 체크포인트는 베이스 모델에 따라 다름
MLC-LLM / MLC Chat
- 가장 적합한 용도:
- 여러 플랫폼에 걸친 온디바이스 LLM 배포; 본 리뷰 작성 시점 기준 공식적으로 문서화된 비전 언어 모델(VLM) 지원은 확인되지 않았다 — 비전 작업에 의존하기 전에 최신 상태를 확인하라
- 라이선스:
- Apache-2.0
클라우드 VLM API(GPT-4o, Claude, Gemini 비전)
- 가장 적합한 용도:
- 현재 이용 가능한 최고의 멀티모달 성능, 로컬 하드웨어나 설정 불필요
- 라이선스:
- 독점(유료 API)
자주 묻는 질문
Ollama는 비전 모델을 지원하는가?
그렇다. Ollama는 2023년 12월 12일 출시된 버전 0.1.15에서 멀티모달(이미지 입력) 지원을 추가했고, 2026년 5월경 전용 멀티모달 엔진으로 재구축했다. 본 리뷰 작성 시점 기준, 라이브러리에는 LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4, Mistral Small 3.1이 비전 지원 모델로 등록되어 있다.
Ollama에서 모델에 이미지를 전달하려면 어떻게 해야 하는가?
CLI에서는 프롬프트 텍스트 안에 이미지의 파일 경로를 직접 적으면 된다: ollama run llava "describe this image: ./photo.jpg". 별도의 --image 플래그는 없다. 프로그래밍 방식으로는 Ollama 자체의 docs/api.md에 따라 /api/generate 또는 /api/chat에 base64로 인코딩된 이미지를 images 배열에 담아 POST하면 된다.
Ollama의 API에 이미지를 보낼 때 정확한 JSON 형식은 무엇인가?
/api/generate의 경우: `{"model": "llava", "prompt": "...", "images": ["<base64 string>"]}. /api/chat의 경우: {"model": "llava", "messages": [{"role": "user", "content": "...", "images": ["<base64 string>"]}]}. 둘 다 Ollama의 GitHub 저장소 내 docs/api.md`에 문서화되어 있다.
현재 Ollama 라이브러리에서 이용 가능한 비전 모델은 무엇인가?
본 리뷰에서 확인한 바로는: LLaVA(llava-llama3, llava-phi3, bakllava 변형 포함), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3(4B 이상), Llama 4, Mistral Small 3.1이다. 이 목록은 바뀔 수 있으므로 ollama.com/library를 직접 확인하라.
Ollama로 비전 모델을 파인튜닝할 수 있는가?
아니다. Ollama는 추론 전용이다 — 학습된 모델 가중치를 실행할 뿐, 학습이나 파인튜닝 파이프라인은 제공하지 않는다. 파인튜닝을 하려면 원본 모델 자체의 학습 스크립트나 Hugging Face Transformers 같은 프레임워크 등 별도의 도구 체인이 필요하다.
Ollama는 llama.cpp를 기반으로 하는가?
그렇다. Ollama는 GGUF 형식 모델용 C/C++ 추론 엔진인 llama.cpp를 더 단순한 명령줄 인터페이스와 HTTP API로 감싼 것이다. Ollama의 GitHub 저장소는 2023년 6월 26일에 생성되었다. Apple Silicon에서 대체 백엔드로 Apple의 MLX 프레임워크도 지원한다.
Ollama는 GPT-4o나 Gemini 같은 클라우드 비전 API와 비교하면 어떤가?
Ollama는 요청당 한계 비용 제로로 모델을 로컬에서 실행하며 이미지를 기기 안에 유지할 수 있지만, 그 라이브러리는 오픈 웨이트 모델을 중심으로 구축되어 있어 복잡한 장면 이해, 손글씨, 모호한 이미지 처리에서 대체로 독점 클라우드 비전 API에 뒤처진다. 프라이버시, 대량 사용 시 비용 관리, 오프라인 사용을 원한다면 Ollama를, 이용 가능한 최고 성능을 원한다면 클라우드 API를 선택하라.
결론
Ollama는 2023년 12월 이후 비전 지원 모델을 로컬에서 실행하는 진정으로 간단한 방법을 제공해왔으며, 2026년 5월의 멀티모달 엔진 재구축은 LLaVA 같은 기존 옵션과 나란히 Llama 4, Gemma 3, Qwen2.5-VL, Mistral Small 3.1 같은 최신 모델 계열에 대해서도 그 경험을 최신 상태로 유지했다. 핵심 워크플로우 — ollama pull 후 프롬프트에 이미지 경로를 넣어 ollama run을 실행하거나, 문서화된 /api/generate//api/chat HTTP 엔드포인트를 사용하는 방식 — 는 최초의 v0.1.15 릴리스 이후 안정적으로 유지되어 왔으며, 이는 그 위에 무언가를 구축하려는 사람들에게 그 자체로 Ollama의 장점이다. 학습 도구는 아니며 최신 독점 클라우드 멀티모달 성능에는 미치지 못하지만, 프라이빗하고 자체 호스팅되며 한계 비용이 제로인 이미지 이해 용도로는 여전히 가장 실용적인 진입점 중 하나로 남아 있다. 특정 모델을 더 깊이 알고 싶다면 PromptQuorum의 LLaVA 리뷰를, 전체 로컬 비전 모델 환경에서 작업별로 모델을 선택하고 싶다면 로컬 비전 모델 비교를 함께 참고하라.
출처
- GitHub의 Ollama — 저장소 생성일, 라이선스, 릴리스 이력.
- Ollama v0.1.15 릴리스 노트 — 2023년 12월 12일, 멀티모달/LLaVA 지원에 대한 최초 발표.
- 멀티모달 모델을 위한 Ollama의 새 엔진 — 2026년 5월의 멀티모달 엔진 재구축, Llama 4, Gemma 3, Qwen2.5-VL, Mistral Small 3.1을 다룸.
- Ollama API 문서 — 이미지에 대한
/api/generate및/api/chat의 문서화된 요청/응답 형식. - Ollama 모델 라이브러리 — 본 글에 나열된 모든 모델을 확인하는 데 사용한 실시간 라이브러리이며, llava, llama3.2-vision, qwen2.5vl, minicpm-v, moondream, granite3.2-vision, gemma3, llama4, mistral-small3.1의 개별 페이지를 포함한다.
