핵심 요점
- CLIP 비전 인코더와 Vicuna(Llama 2 기반) 텍스트 디코더를 결합한 비전-언어 모델.
- 코드 라이선스: Apache-2.0. 사전 학습된 체크포인트는 Vicuna 기반을 통해 Llama 2 커뮤니티 라이선스를 상속.
ollama pull llava로 세 가지 크기(7B, 13B, 34B)로 실행 가능.- 공식 GitHub 저장소는 2024년 5월 11일 이후 커밋 없음; 25,000개 이상의 스타, 아카이브되지 않음.
- 이후 대부분의 로컬 비전-언어 모델이 사용하는 아키텍처 패턴을 확립.
- 더 새로운 모델(Qwen2.5-VL, Llama 3.2 Vision, MiniCPM-V)이 이제 OCR, 차트, 다국어 문서에서 이를 능가.
📍 한 문장으로
LLaVA는 UW-Madison, Microsoft Research, 컬럼비아 대학교의 오픈소스 비전-언어 모델로, 대부분의 로컬 멀티모달 AI가 여전히 사용하는 비전 인코더 플러스 LLM 아키텍처를 확립했으며, 코드는 Apache-2.0, 사전 학습된 체크포인트는 Llama 2에서 파생된 라이선스 조건을 가지고 있고, 이제는 Ollama를 통해 명령어 하나로 실행할 수 있습니다.
💬 쉽게 말하면
이미지를 보고 그에 관한 질문에 답할 수 있는 무료 AI 모델입니다——이것이 잘, 그리고 저렴하게 작동할 수 있음을 증명한 연구 프로젝트로, 오늘날 가장 간단하게는 ollama run llava를 입력하고 이미지 파일을 지정하는 것만으로 실행할 수 있습니다.
📌참고: LLaVA의 원래 프로젝트 페이지는 데이터, 코드, 체크포인트가 "연구 목적으로만 의도되었고 그렇게 라이선스가 부여되었다"고 명시하고 있으며, 이는 이후 GitHub 저장소의 코드에 적용된 Apache-2.0 라이선스보다 더 오래되고 더 엄격한 내용입니다. 상업적 사용 전에 GitHub의 LICENSE 파일과 프로젝트 페이지를 모두 읽어보세요——아래 라이선스와 비용 섹션을 참조하세요.
역사: 연구 논문에서 로컬 AI 표준으로
LLaVA는 위스콘신-매디슨 대학교, Microsoft Research, 컬럼비아 대학교에 소속된 Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee가 개발했으며, 2023년 논문 "Visual Instruction Tuning"에서 소개되었고 NeurIPS 2023 구두 발표로 채택되었습니다.
논문의 핵심 아이디어는 GPT-4를 사용해 멀티모달 지시 따르기 훈련 데이터를 생성한 다음, 이 데이터를 사용해 오픈소스 비전 인코더와 언어 모델이 시각적 지시를 따르도록 가르치는 것이었습니다——이미지를 설명하고, 그에 관한 질문에 답하며, 대화 형식으로 시각적 콘텐츠에 대해 추론하도록——이는 처음부터 독점 멀티모달 모델을 구축하는 훈련 비용의 극히 일부만으로 가능했습니다.
2023년 10월에 출시된 LLaVA-1.5는 원래 아키텍처에 대한 단순한 수정만으로 11개 벤치마크에서 최첨단 결과를 달성했습니다——주로 더 높은 용량의 비전-언어 커넥터와 학술 작업 지향적인 훈련 데이터로——프로젝트 자체 페이지에 따르면 8개의 A100 GPU에서 약 하루 만에 훈련되었습니다.
2024년 1월에 출시된 LLaVA-NeXT(LLaVA-1.6이라고도 함)는 동적 패칭을 통해 더 높은 해상도의 이미지 입력 지원을 추가했으며(최대 672×672, 또는 가로/세로가 긴 이미지의 경우 336×1344), OCR 및 시각적 추론 개선과 함께 Vicuna를 넘어선 추가 기본 LLM 지원도 추가되었습니다.
**공개된 haotian-liu/LLaVA GitHub 저장소는 25,000개 이상의 스타를 모았으며**, 아카이브로 표시되어 있지는 않지만——PromptQuorum은 프로젝트 자체의 공개 커밋 이력을 기준으로 메인 브랜치에 2024년 5월 11일 이후 커밋이 없음을 확인했습니다. 이는 지속적인 상업 제품이라기보다는 목표(아키텍처의 확립과 대중화)를 달성한 대학 연구 발표와 일치합니다.
LLaVA는 누가 개발했나요?
LLaVA는 위스콘신-매디슨 대학교, Microsoft Research, 컬럼비아 대학교에 소속된 Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee가 개발했으며, 2023년 논문 "Visual Instruction Tuning"에서 소개되었고 NeurIPS 2023 구두 발표로 채택되었습니다.
LLaVA가 실제로 하는 일
LLaVA는 비전 인코더를 대형 언어 모델에 연결하여 결합된 시스템이 이미지와 텍스트 프롬프트를 함께 받아들이고, 그 이미지에 관한 자연어 응답을 생성할 수 있도록 합니다——질문에 답하고, 장면을 설명하고, 보이는 텍스트를 읽고, 시각적 콘텐츠에 대해 대화 형식으로 추론합니다.
- CLIP 인코더 플러스 LLM 디코더. LLaVA는 CLIP ViT-L/14 비전 인코더를 사용해 이미지를 일련의 시각적 특징으로 변환하고, 커넥터 모듈을 통해 이 특징들을 언어 모델의 텍스트 토큰과 동일한 임베딩 공간에 투영한 다음, 결합된 시퀀스를 Vicuna(Llama 2 기반) 또는 이후 버전에서는 Mistral이나 다른 기본 LLM에 입력하여 응답을 생성합니다.
- 시각적 지시 튜닝. 원시 이미지-캡션 쌍으로 훈련하는 대신, LLaVA는 LLaVA-Instruct-150K에서 미세 조정되었습니다. 이는 GPT-4에 이미지 캡션과 객체 감지 주석을 제시하여 생성한 다중 턴 시각 대화 데이터셋입니다——모델에게 단순히 캡션을 생성하는 것이 아니라 개방형 시각적 지시를 따르도록 가르칩니다.
- Ollama를 통한 세 가지 모델 크기. Ollama 라이브러리는 LLaVA를 7B(4.7GB), 13B(8.0GB), 34B(20GB) 크기로 패키징합니다——일반적으로 더 큰 모델일수록 더 상세하고 정확한 설명을 생성하지만, 더 많은 VRAM과 더 느린 추론을 대가로 합니다.
- LLaVA-1.6(LLaVA-NeXT)의 해상도 개선. Ollama와 공식 저장소를 통해 지원되는 현재 버전은 동적 패칭을 통해 더 높은 입력 해상도를 처리하며, 2023년 원본 릴리스에 비해 텍스트 읽기 및 세부 사항 작업이 눈에 띄게 향상되었습니다.
- 영어 중심 훈련. LLaVA-Instruct-150K와 이를 평가하는 데 사용된 기본 벤치마크는 대부분 영어이므로, 이미지 내 비영어 텍스트에 대한 기본 성능은 다국어 문서 데이터로 특별히 훈련된 모델보다 약합니다.
LLaVA 설치 및 실행: 단계별 안내
이 안내서는 가장 빠르고 일반적인 경로(Ollama)를 다루며, 참고용으로 원본 저장소 자체의 경로도 언급합니다.
- 1Ollama를 설치합니다.
Why it matters: macOS, Linux, Windows용 [Ollama](https://ollama.com)를 다운로드하여 설치합니다. 이는 [Ollama 라이브러리 페이지](https://ollama.com/library/llava)에 따르면 LLaVA를 실행하는 공식적으로 명시된 방법이며, 2분도 채 걸리지 않습니다. - 2LLaVA 모델 크기를 다운로드합니다.
Why it matters: 기본 7B 모델(~4.7GB)을 위해 `ollama pull llava`를 실행하거나, 더 높은 품질을 원하지만 더 많은 VRAM과 디스크 공간을 감수할 경우 `ollama pull llava:13b`(~8.0GB) 또는 `ollama pull llava:34b`(~20GB)를 실행합니다. - 3CLI에서 이미지와 함께 실행합니다.
Why it matters: `ollama run llava "describe this image: ./photo.jpg"`를 실행하여 프롬프트 텍스트 내에서 로컬 이미지 파일 경로를 직접 참조합니다——별도의 플래그가 필요하지 않습니다. - 4(대안) 연구 수준의 제어를 위해 원본 저장소를 사용합니다.
Why it matters: [haotian-liu/LLaVA](https://github.com/haotian-liu/LLaVA)를 클론하고, `requirements.txt`를 설치하고, Hugging Face에서 체크포인트를 다운로드하여 훈련 스크립트, 평가 도구, Gradio 웹 데모에 완전히 접근합니다——연구나 미세 조정에는 유용하지만 Ollama보다 훨씬 높은 설치 장벽입니다. - 5(선택 사항) Ollama API를 통해 프로그래밍 방식으로 호출합니다.
Why it matters: `images` 배열에 Base64로 인코딩된 문자열로 이미지를 담아 `http://localhost:11434/api/generate`에 POST 요청을 보내거나, 공식 `ollama` Python 또는 JavaScript 라이브러리를 사용합니다——아래 코드 예시를 참조하세요.
실제 사용 예시
이 예시들은 Ollama의 문서화된 CLI 구문과 HTTP API를 사용합니다——오늘날 LLaVA를 실행하는 주요 지원 방법입니다.
- CLI 프롬프트에서 파일 경로를 참조하는 것만으로 충분합니다 — Ollama가
.jpg/.png경로를 감지해 자동으로 이미지를 첨부합니다. 별도의--image플래그는 없습니다. - 더 큰 모델 크기는 더 많은 VRAM과 시간을 소모합니다. 7B 모델은 가장 빠르고 VRAM 소비가 가장 적은 옵션입니다. 설명 정확도가 속도보다 더 중요할 때는 13B 또는 34B를 사용하세요.
# 설치 및 모델 다운로드
# (먼저 https://ollama.com 에서 Ollama를 다운로드하세요)
ollama pull llava
# CLI: 프롬프트에서 파일 경로를 참조하여 이미지 설명
ollama run llava "describe this image: ./photo.jpg"
# --- HTTP API(Ollama 자체 docs/api.md에 문서화됨) ---
# Base64로 인코딩된 이미지를 사용하는 /api/generate
curl http://localhost:11434/api/generate -d '{
"model": "llava",
"prompt": "What is in this picture?",
"stream": false,
"images": ["<Base64로 인코딩된 이미지 데이터>"]
}'
# Base64로 인코딩된 이미지를 사용하는 /api/chat(다중 턴 대화)
curl http://localhost:11434/api/chat -d '{
"model": "llava",
"messages": [
{ "role": "user", "content": "What is in this image?", "images": ["<Base64로 인코딩된 이미지 데이터>"] }
]
}'
# --- 공식 ollama 라이브러리를 사용한 Python 예시 ---
import ollama
response = ollama.chat(
model="llava",
messages=[{
"role": "user",
"content": "What is in this image?",
"images": ["photo.jpg"],
}],
)
print(response["message"]["content"])라이선스와 비용
공식 GitHub 저장소에 있는 LLaVA의 코드는 Apache-2.0 라이선스를 따릅니다**. 이는 저장소의 LICENSE 파일과 GitHub가 보고하는 라이선스 메타데이터를 통해 확인됩니다. Apache-2.0은 관대한 라이선스로, 저작자 표시와 특허 부여를 조건으로 하며 그 외에는 최소한의 제한만으로 코드를 상업적 용도를 포함해 사용, 수정, 재배포할 수 있습니다.
사전 학습된 체크포인트는 이야기가 다릅니다: 기본 LLM으로부터 조건을 상속받습니다. 공식적으로 발표된 LLaVA 체크포인트는 Meta의 Llama 2 위에 구축된 지시 튜닝 챗봇인 Vicuna로부터 미세 조정되었으며, 프로젝트 자체 문서에는 사용자가 원본 라이선스의 "모든 조건"을 준수해야 한다고 명시되어 있습니다——구체적으로 Llama 2, Vicuna, CLIP의 라이선스 조건과 OpenAI의 이용 약관(GPT-4가 훈련 데이터 생성에 사용되었기 때문)을 언급합니다. 이는 체크포인트의 허용된 사용이 Apache-2.0뿐만 아니라 Llama 2 커뮤니티 라이선스의 조건(허용되는 사용에 대한 제한 및 매우 대규모의 상업적 배포는 Meta로부터 별도 라이선스를 취득해야 한다는 요건 포함)에도 지배받는다는 것을 의미합니다.
LLaVA의 원래 프로젝트 페이지(GitHub 저장소와는 별개의 사이트)는 더 엄격하고 오래된 명시를 추가합니다: "데이터, 코드, 체크포인트"를 "연구 목적으로만 의도되었고 그렇게 라이선스가 부여되었다"고 설명하며, 별도로 훈련 데이터셋의 CC BY-NC 4.0(비상업적) 지정도 언급합니다. 이는 GitHub에 현재 표시된 Apache-2.0 코드 라이선스보다 앞서 있고 더 엄격합니다——같은 프로젝트가 서로 다른 두 페이지에서 보이는 진정으로 혼란스러운 명시의 조합으로, 가장 편리한 것을 골라 취하기보다는 이 점 자체를 짚어볼 가치가 있습니다.
이 중 어느 것도 법률 자문이 아닙니다. LLaVA——또는 이를 기반으로 미세 조정된 체크포인트——를 상업 제품에 출시하기 전에, GitHub의 LICENSE 파일, 프로젝트 페이지에 명시된 조건, Llama 2 커뮤니티 라이선스를 읽고, 특정 기본 모델과 배포 방식에 대해 변호사와 상담하세요.
LLaVA는 어떤 라이선스를 사용하나요?
GitHub의 LLaVA 코드는 상업적 사용을 허용하는 관대한 라이선스인 Apache-2.0을 따릅니다. 그러나 공식적으로 발표된 사전 학습된 체크포인트는 Meta의 Llama 2 위에 구축된 Vicuna로부터 미세 조정되었기 때문에, 그 사용은 Llama 2 커뮤니티 라이선스의 조건에도 지배받습니다. 프로젝트의 별개의 홈페이지는 또한 데이터, 코드, 체크포인트를 연구 목적으로만 사용하도록 의도되었다고 설명하고, 훈련 데이터를 비상업적(CC BY-NC 4.0)이라고 설명합니다——이는 GitHub 라이선스보다 더 오래되고 엄격한 명시입니다. 이는 법률 자문이 아닙니다. 특정 체크포인트를 상업적으로 사용하기 전에 위 내용을 모두 직접 읽어보세요.
LLaVA가 적합하지 않은 용도
LLaVA는 여전히 진정으로 유용하고 잘 문서화된 모델이지만, 2026년 기준으로는 모든 비전 작업에서 더 이상 가장 강력한 선택은 아닙니다. 다음과 같은 상황에는 적합하지 않은 도구입니다:
- 순수 텍스트 작업. LLaVA는 비전-언어 모델입니다. 이미지가 관련되지 않은 순수 텍스트 대화에는 전용 텍스트 LLM(Ollama를 통하거나 다른 방식으로)을 사용하세요——텍스트 전용 채팅에 멀티모달 모델을 실행하면 아무런 이득 없이 비전 인코더가 차지하는 VRAM만 낭비하게 됩니다.
- 이용 가능한 가장 강력한 로컬 OCR이나 문서 이해가 필요한 경우. 2026년 기준, LLaVA-NeXT 이후에 출시된 모델——MiniCPM-V, Qwen2.5-VL, Llama 3.2 Vision——은 PromptQuorum의 로컬 비전 모델 비교에 따르면 문서 OCR, 표, 구조화된 추출에서 LLaVA를 능가합니다. LLaVA의 비전 인코더는 이 세대의 고해상도, 문서 중심 훈련 데이터가 존재하기 전에 설계되고 훈련되었습니다.
- 이미지 속 비영어 텍스트 읽기. LLaVA-Instruct-150K와 모델의 핵심 훈련 데이터는 대부분 영어입니다. 중국어, 일본어, 한국어 또는 기타 비라틴 문자 문서 OCR의 경우, 다국어 문서 코퍼스로 특별히 훈련된 모델(Qwen2.5-VL)이 눈에 띄게 더 우수한 성능을 보입니다.
- 차트와 그래프에서의 정밀한 수치 추출. 2026년 기준 거의 모든 로컬 비전-언어 모델과 마찬가지로, LLaVA는 복잡한 차트에서 정확한 값을 읽는 데 신뢰할 수 없습니다——사용하는 모델과 관계없이 추출된 수치는 항상 원본 데이터와 대조하여 확인하세요.
- 지속적인 활발한 개발을 가정하는 것. 공식 저장소에 2024년 5월 11일 이후 커밋이 없으므로, 원본 프로젝트로부터 새로운 기능, 버그 수정, 또는 더 최신 체크포인트를 기대하지 마세요——Ollama 자체의 멀티모달 엔진 업데이트와 더 새로운 모델 계열이 사실상 활발하게 개발되는 옵션으로서 이를 대체했습니다.
- 단일하고 간단한 라이선스 설명. 코드(Apache-2.0)와 공식적으로 발표된 체크포인트(Apache-2.0에 더해 상속된 Llama 2 커뮤니티 라이선스 조건, 그리고 프로젝트의 별개 홈페이지에 있는 더 엄격한 연구 전용 명시)가 완전히 정렬되지 않는 세 가지 중첩된 명시에 의해 지배되기 때문에, LLaVA는 Bark(완전히 MIT, 추가 조건 없음) 같은 프로젝트가 제공하는 한 줄로 정리되는 라이선스 명확성을 제공하지 않습니다.
LLaVA의 대안
Llama 3.2 Vision(Ollama 경유)
- 최적 용도:
- 최고의 일반적인 로컬 이미지 질의응답 품질; 11B 및 90B 크기
- 라이선스:
- Llama 3.2 커뮤니티 라이선스
Qwen2.5-VL(Ollama 경유)
- 최적 용도:
- 가장 강력한 로컬 OCR 및 다국어 문서 이해
- 라이선스:
- Qwen 라이선스(작은 크기는 Apache-2.0)
MiniCPM-V(Ollama 경유)
- 최적 용도:
- 낮은(~6GB) VRAM에서 높은 문서 OCR 정확도
- 라이선스:
- Apache-2.0 파생(OpenBMB)
Idefics3(Hugging Face)
- 최적 용도:
- 강력한 문서/OCR 벤치마크를 갖춘 개방형 연구용 VLM, 아직 Ollama용으로 패키징되지 않음
- 라이선스:
- Apache-2.0(Llama3 변형에는 기본 모델 조건 적용)
클라우드 VLM API(GPT-4o, Claude, Gemini Vision)
- 최적 용도:
- 이용 가능한 최고의 멀티모달 성능, 로컬 하드웨어 불필요
- 라이선스:
- 독점(유료 API)
자주 묻는 질문
LLaVA란 무엇인가요?
LLaVA(Large Language and Vision Assistant)는 위스콘신-매디슨 대학교, Microsoft Research, 컬럼비아 대학교의 연구진이 만든 오픈소스 비전-언어 모델로, 비전 인코더와 대형 언어 모델을 결합해 이미지에 관한 질문에 답하며, 2023년 논문 "Visual Instruction Tuning"에서 소개되었습니다.
LLaVA를 상업적으로 사용할 수 있나요?
GitHub의 LLaVA 코드는 상업적 사용을 허용하는 Apache-2.0 라이선스를 따릅니다. 그러나 공식적으로 발표된 사전 학습된 체크포인트는 Meta의 Llama 2 위에 구축된 Vicuna로부터 미세 조정되었기 때문에, 그 사용은 Llama 2 커뮤니티 라이선스의 조건에도 지배받습니다. 프로젝트의 별개의 홈페이지는 또한 데이터, 코드, 체크포인트를 연구 목적으로만 사용하도록 설명하고, 훈련 데이터를 비상업적(CC BY-NC 4.0)이라고 설명합니다——이는 GitHub 라이선스보다 더 오래되고 엄격한 명시입니다. 이는 법률 자문이 아닙니다. 특정 체크포인트를 상업적으로 배포하기 전에 적용 가능한 모든 라이선스를 읽어보세요.
LLaVA는 어떻게 실행하나요?
가장 일반적인 방법은 Ollama를 통하는 것입니다: Ollama를 설치하고, ollama pull llava를 실행한 다음, ollama run llava "describe this image: ./photo.jpg"를 실행합니다. 원본 저장소도 연구 수준의 제어를 위해 자체 Python 추론 스크립트와 Gradio 데모를 제공합니다.
LLaVA, LLaVA-1.5, LLaVA-NeXT(LLaVA-1.6)의 차이는 무엇인가요?
LLaVA(2023년)는 원래 아키텍처였습니다. LLaVA-1.5(2023년 10월)는 더 높은 용량의 커넥터와 더 나은 훈련 데이터로 벤치마크 결과를 개선했습니다. LLaVA-NeXT, 즉 LLaVA-1.6(2024년 1월)은 동적 패칭을 통해 더 높은 해상도의 이미지 입력을 추가하고 OCR과 시각적 추론을 개선했습니다. Ollama와 현재 GitHub 저장소를 통해 배포되는 버전은 LLaVA-1.6/NeXT의 개선 사항을 반영합니다.
LLaVA는 여전히 활발하게 유지보수되고 있나요?
공식 GitHub 저장소는 아카이브로 표시되어 있지 않지만, PromptQuorum은 2024년 5월 11일 이후 커밋을 발견하지 못했습니다. 이를 활발하게 개발되는 소프트웨어가 아니라 완료된 연구 발표로 취급하세요——더 새로운 모델과 Ollama 자체의 멀티모달 엔진 업데이트가 신규 프로젝트에서 이를 대체로 대체했습니다.
LLaVA는 Qwen2.5-VL이나 Llama 3.2 Vision 같은 더 새로운 모델과 비교해 어떤가요?
LLaVA는 이러한 더 새로운 모델들도 따르는 아키텍처를 확립했지만, PromptQuorum의 로컬 비전 모델 비교에 따르면 2026년 기준으로는 문서 OCR, 차트 읽기, (특히 Qwen2.5-VL의 경우) 비영어 텍스트에서 Qwen2.5-VL과 Llama 3.2 Vision에 뒤처집니다. LLaVA는 설치의 용이성, 큰 커뮤니티, 광범위한 튜토리얼 커버리지로 여전히 유의미합니다.
Ollama가 실제로 LLaVA 실행을 지원하나요?
예——ollama run llava는 Ollama 라이브러리에 공식적으로 등재된 모델로, 7B, 13B, 34B 크기로 제공되며, 원본 저장소 자체의 추론 스크립트와 더불어 오늘날 LLaVA를 실행하는 가장 일반적인 방법 중 하나입니다.
LLaVA를 실행하려면 어떤 하드웨어가 필요한가요?
7B 모델은 약 4.7GB의 디스크 공간이 필요하며 6-8GB VRAM을 가진 GPU(또는 CPU, 더 느림)에서 실행할 수 있습니다. 13B와 34B 모델은 더 나은 설명 품질을 위해 비례적으로 더 많은 VRAM과 디스크 공간이 필요합니다.
결론
LLaVA는 로컬 AI 역사에서 자신의 자리를 확보했습니다: GPT-4가 생성한 지시 데이터로 미세 조정된, 오픈소스 LLM에 연결된 소박한 비전 인코더가 독점적인 훈련 예산 없이도 진정으로 유용한 이미지 이해를 제공할 수 있음을 증명했으며——그것이 확립한 비전 인코더 플러스 LLM 패턴은 오늘날에도 여전히 대부분의 로컬 멀티모달 모델의 작동 기반입니다. 코드 라이선스(Apache-2.0)는 관대하지만, 공식적으로 발표된 체크포인트는 Vicuna 기반을 통해 Llama 2에서 파생된 조건을 지니고 있고, 프로젝트의 별개 홈페이지에는 더 오래되고 엄격한 연구 전용 명시가 추가로 있습니다——상업적 사용 전에 이 세 가지를 모두 읽어보세요. 2026년 순수 성능 면에서 LLaVA는 더 이상 가장 강력한 로컬 비전 모델이 아닙니다: 2024년 5월 이후 커밋이 없으며, Qwen2.5-VL, Llama 3.2 Vision, MiniCPM-V 같은 더 새로운 옵션들이 OCR, 차트, 다국어 문서에서 이를 능가합니다. 가장 간단한 설치, 가장 큰 커뮤니티, 가장 많은 기존 튜토리얼을 원한다면 ollama run llava는 여전히 진정으로 좋은 출발점입니다. 문서 정확도나 비영어 텍스트가 중요하다면, 모델을 선택하기 전에 이 리뷰를 PromptQuorum의 로컬 비전 모델 비교와 Ollama 비전 모델 가이드와 함께 참고하세요.
출처
- GitHub의 LLaVA — 공식 저장소: README, LICENSE, 설치 안내, 커밋 이력.
- "Visual Instruction Tuning" 논문(NeurIPS 2023) — 논문 링크, 라이선스 명시, 버전 이력이 포함된 프로젝트 홈페이지.
- Ollama의 LLaVA — 공식적으로 등재된 모델 페이지: 크기, 설명, 라이브러리 메타데이터.
- Ollama API 문서 — 멀티모달 모델을 위한
/api/generate및/api/chat요청/응답 형식이 문서화된 자료. - 로컬 비전 모델 2026: LLaVA, Llama 3.2 Vision, Qwen3-VL & Ollama 멀티모달 설정 — 현재 로컬 비전 모델 전반에 대한 PromptQuorum의 더 폭넓은 비교.
