Key Takeaways
- 소비자 하드웨어 전반 최고: Qwen 3.6 27B(77.2% SWE-bench, Q4에서 24GB에 적합). 균형잡힌 범용: qwen3:30b.
- 다운로드 최다: Llama 3.2 3B(튜토리얼용)와 Llama 계열 -- 가장 넓은 도구 지원.
- 추론 최고: DeepSeek-R1(연쇄 사고)과 gpt-oss:20b(조정 가능한 추론, ~o3-mini 수준).
- 코딩 최고: Kimi K2.6(최전선 MoE), Qwen 3.6 27B(최고 밀집 모델), Devstral Small 24B(최고 에이전트 코딩), qwen3-coder:30b(코드 완성) -- 해당 크기에서 가장 높은 벤치마크.
- 소형 최강 / 16GB: gpt-oss:20b. 비전/멀티모달 최고: Gemma 4(E4B+). 긴 컨텍스트(10M) / 대형 멀티모달 최고: Llama 4 Scout(~55GB). 무검열/범용 최고: Dolphin 3.0.
- Ollama 라이브러리에는 수백 개의 큐레이팅된 모델이 있습니다(커스텀 GGUF Modelfile을 통하면 수천 개 더 있음). 모든 모델은 `ollama pull <name>`으로 이용 가능합니다.
Ollama 신규 소식 — 2026년 7월 업데이트
현재 Ollama 버전: v0.32.0(2026년 7월 11일 출시). ollama.com/download에서 사용 가능한 최신 안정 릴리스입니다. `curl https://ollama.ai/install.sh | sh`(macOS: `brew upgrade ollama`)로 업데이트한 후 `ollama --version`으로 확인하십시오.
v0.31~v0.32 시리즈의 변경 사항(2026년 6월 말~7월): v0.30.11(6월 25일)은 Claude Code 및 opencode용 자동 설치를 추가하고 Windows 하이브리드 GPU 분류 문제를 수정했습니다. v0.30.12(6월 29일)는 JSON 문자열 내 도구 호출 감지 문제를 수정했습니다. v0.31.1(6월 30일)은 새로운 MLX 배치 행렬곱 커널을 도입하여 멀티토큰 예측을 통해 Apple Silicon에서 Gemma 4의 토큰 생성 속도를 거의 90% 향상시켰습니다. v0.31.2(7월 6일)는 구형 NVIDIA GPU에서 flash attention을 활성화하고 사고형 모델의 구조화된 출력을 수정했습니다. v0.32.0(7월 11일)은 대화형 "Chat, Code & Work" 에이전트 경험을 도입하고 Codex App 통합을 ChatGPT로 이름을 변경했습니다. 전체 노트: github.com/ollama/ollama/releases.
지난 업데이트 이후 추가된 최신 모델(2026년 6월 말~7월):
- Laguna XS 2.1(Poolside, 2026년 7월 2일) — 33B 전체/3B 활성 MoE로, 에이전틱 코딩과 장시간 로컬 작업(계획, 코드 작성, 테스트 실행, 반복)을 위해 구축되었습니다. 256K 컨텍스트, OpenMDW-1.1 라이선스. SWE-bench Verified 70.9%, SWE-bench Multilingual 63.1%. Pull: `ollama pull laguna-xs-2.1`
- Kimi K2.7 Code(Moonshot AI, 2026년 6월) — Kimi K2.6을 기반으로 한 코딩 특화 에이전틱 모델로, 장시간 코딩 세션을 특별히 겨냥합니다. Pull: `ollama pull kimi-k2.7-code`
- DeepSeek V4 Pro(DeepSeek, 2026년 4월 23일) — 알고리즘 코딩 특화 모델, 93.5% LiveCodeBench, MIT 라이선스. 경량 하드웨어용 보급형 모델 DeepSeek V4 Flash. Pull: `ollama pull deepseek-v4-pro`
- Kimi K2.6(Moonshot AI, 2026년 4월 20일) — 최전선 코딩 모델, SWE-Bench Pro 58.6, SWE-bench Verified 80.2%(GPT-5.5와 동점). MoE 아키텍처(32B 활성 / 1T 전체). Modified MIT 라이선스. Pull: `ollama pull kimi-k2.6`
- Qwen 3.6 27B(Alibaba, 2026년 4월 16일) — 소비자 하드웨어 전반 최고, 77.2% SWE-bench, Apache 2.0, Q4에서 24GB에 적합. 또한 Qwen3.6-35B-A3B(MoE, 73.4 SWE-bench)도 있습니다. Pull: `ollama pull qwen3.6:27b`
- GLM-5.1(Z.ai, 2026년 4월 7일) — 744B / 40B 활성 MoE, MIT 라이선스, SWE-Bench Pro 58.4. 구조화된 코드 생성 분야 선두. Pull: `ollama pull glm-5.1`
- gpt-oss(OpenAI, 2026년) — 오픈 웨이트 MoE: gpt-oss:20b(21B 전체 / 3.6B 활성, 16GB에서 실행, ~o3-mini 수준, 조정 가능한 추론)와 gpt-oss:120b(80GB). Pull: `ollama pull gpt-oss:20b`
- Gemma 4(Google, 2026년 4월 2일) — 멀티모달 크기 E2B / E4B / E12B(26B MoE) / E27B(31B 밀집), 모두 비전과 도구 호출 지원. Apple Silicon에서 이제 약 90% 빨라졌습니다(2026년 7월 MLX 업데이트). E4B는 ~6GB VRAM에서 실행됩니다. Pull: `ollama pull gemma4:e4b`
# Ollama를 최신 버전으로 업데이트 (v0.32.0)
curl https://ollama.ai/install.sh | sh
# 또는 Mac에서: brew upgrade ollama
# 현재 버전 확인
ollama --version # 출력: ollama version 0.32.0
# 2026년 7월 최신 모델 Pull
ollama pull laguna-xs-2.1
ollama pull kimi-k2.7-code
ollama pull kimi-k2.62026년 Ollama에서 가장 인기 있는 모델은 무엇입니까?
Ollama에서의 인기는 각 모델의 라이브러리 페이지에 표시되는 다운로드 수로 측정됩니다. 2026년 7월 기준, 다운로드 상위 모델은 여전히 Meta의 Llama 계열이 주도하고 있습니다 -- Llama 3.2 3B가 첫 설치 테스트 모델로 많이 사용되어 전체 다운로드 1위입니다. 그러나 Llama 4 Scout는 2026년 4월 출시 이후 빠르게 순위를 올리고 있습니다.
Qwen3는 Ollama 라이브러리에서 가장 빠르게 성장하는 모델 계열로, Qwen3와 새로운 Qwen 3.6 밀집 변형이 기존 Qwen3를 빠르게 대체하고 있습니다. DeepSeek-R1은 출시 이후 대규모 다운로드 급증을 기록했으며 추론 작업에서 높은 다운로드 수를 유지하고 있습니다. Dolphin 3.0(Cognitive Computations, Llama 3.1 기반)은 무필터 로컬 어시스턴트를 원하는 사용자를 위한 무검열 범용 모델 중 가장 많이 Pull된 모델로 남아 있습니다.
Meta는 2026년 4월에 Scout(17B 활성, 109B 전체, MoE)와 Maverick(17B 활성, 400B 전체) 변형을 포함한 Llama 4를 출시했습니다. Llama 4 Scout는 이제 Ollama 라이브러리에서 안정적으로 사용 가능합니다(`ollama pull llama4:scout`). Llama 4 계열은 혼합 전문가(MoE) 아키텍처를 사용합니다 — 토큰당 17B 파라미터만 활성화되지만, 109B 전체 파라미터로 Scout는 Q4에서 ~55GB VRAM이 필요합니다(1.78비트에서만 24GB에 적합, ~20 tok/s). Scout의 핵심 특징은 소비자 하드웨어 적합성이 아니라 1,000만 토큰 컨텍스트 창과 멀티모달 입력입니다. 경량 설정(8GB RAM)에서는 Llama 3.2 3B가 여전히 가장 쉬운 첫 번째 모델입니다.
Kimi K2.6(Moonshot AI, Modified MIT 라이선스, 32B 활성 / 1T 전체 MoE)은 SWE-Bench Pro 58.6을 달성하여 GPT-5.5와 동점을 기록했습니다. Laguna XS 2.1(Poolside)은 장시간 로컬 코딩 세션을 위해 구축된 가장 새로운 에이전틱 코딩 도전자입니다. Qwen 3.6 27B는 소비자 하드웨어 전반 최고 모델로서 77.2% SWE-bench를 달성했습니다(Q4에서 24GB에 적합). OpenAI의 오픈 웨이트 gpt-oss:20b(21B 전체 / 3.6B 활성 MoE)는 16GB에서 ~o3-mini 수준의 조정 가능한 추론으로 실행됩니다.
Ollama 라이브러리는 수백 개의 큐레이팅된 모델을 보유하고 있으며, Laguna XS 2.1과 Kimi K2.7 Code가 6월 업데이트 이후 최신 추가 모델입니다.
사용 사례별로 가장 적합한 Ollama 모델은 무엇입니까?
모델 출력 품질은 프롬프트 방식에 크게 의존합니다. 연쇄 사고, 퓨샷 예시, 출력 형식 지정 등 모든 로컬 모델에서 작동하는 구조화된 기법은 프롬프트 엔지니어링 가이드를 참조하십시오. 추론 작업에서는 연쇄 사고 프롬프팅이 DeepSeek-R1 및 Qwen3 출력 품질을 크게 향상시킵니다. 이러한 모델의 양자화 트레이드오프를 이해하려면 양자화 가이드 →를 참조하십시오. 각 모델에 필요한 VRAM 양을 확인하려면 VRAM 요구 사항 가이드 →를 참조하십시오. Gemma 4를 사용한 에이전트 워크플로에 대해서는 트리 오브 소트 및 ReAct를 참조하십시오. 이러한 모델을 실행하기 위한 하드웨어 요구 사항은 하드웨어 가이드 →를 참조하십시오. 이 목록의 도구 호출 모델이 파일 및 데이터베이스 액세스와 함께 다단계 루프에 연결되면 오픈소스 오케스트레이션 패턴에 대해 MCP를 활용한 로컬 AI 에이전트를 참조하십시오.
- 일반 채팅(입문): `ollama run llama3.2:3b` -- 문서가 가장 많고 첫 번째 모델로 최적 지원.
- 일반 채팅(전반 최고): `ollama run qwen3.6:27b` -- 77.2% SWE-bench, 소비자 하드웨어 전반 최고, Q4에서 24GB에 적합. 균형잡힌 범용: `ollama run qwen3:30b`. 8GB 기기에서는 `ollama run llama3.2:3b`를 유지하십시오.
- 긴 컨텍스트 / 멀티모달: `ollama run llama4:scout` -- 1,000만 토큰 컨텍스트 + 멀티모달, MoE(17B 활성/109B 전체). Q4에서 ~55GB VRAM 필요(1.78비트에서만 24GB에 적합, ~20 tok/s).
- 소형 최강 / 16GB: `ollama run gpt-oss:20b` -- 21B 전체 / 3.6B 활성 MoE, ~o3-mini 수준, 조정 가능한 추론. 더 큰 모델: `ollama run gpt-oss:120b`(80GB).
- 8GB에서 코딩: `ollama run qwen3:8b` -- 8GB VRAM 기기 최고 로컬 코딩 모델. 76% HumanEval, 5GB 사용, 다국어 지원.
- 8GB에서 일반 추론(코딩 외): `ollama run mistral:7b` -- 8GB에서 가장 빠른 범용 모델, 40~60 tok/sec.
- 코딩(최고 에이전트, 24B): `ollama run devstral-small:24b` -- 최고 에이전트 코딩 모델(다중 파일 편집, 디버깅). 16GB RAM. Mistral AI 제공.
- 코딩(최고 밀집, 27B): `ollama run qwen3.6:27b` -- 77.2% SWE-bench. 최고 밀집 코딩 모델. 22GB VRAM.
- 코딩(최전선 MoE): `ollama run kimi-k2.6` -- SWE-Bench Pro 58.6(GPT-5.5 동점), 최상위. MoE(32B 활성/1T 전체). Modified MIT 라이선스. 소비자 하드웨어에는 양자화 필요.
- 코딩(에이전틱, 장시간 작업): `ollama run laguna-xs-2.1` -- Poolside의 33B/3B 활성 MoE, SWE-bench Verified 70.9%, 256K 컨텍스트. 계획 → 코드 작성 → 테스트 → 반복의 다단계 루프용으로 구축. OpenMDW-1.1 라이선스.
- 에이전트 작업 및 도구 호출: `ollama run gemma4:e4b` -- 2026년 4월 2일 출시. 내장 도구 호출 + 비전 지원. 로컬 에이전트, 함수 호출, 구조화된 출력에 권장. 6GB RAM.
- 추론 및 수학: `ollama run deepseek-r1:7b` -- 연쇄 사고 모델, 7B에서 최고 로컬 수학 성능.
- 다국어: `ollama run qwen3:7b` -- 29개 이상 언어 기본 지원, 가장 강력한 비영어 지원, 76% HumanEval.
- 러시아어 작업: `ollama run qwen3:7b` 또는 `ollama run mistral-small3.1` -- 두 모델 모두 네이티브 다국어 학습 데이터에 러시아어를 포함합니다. Qwen3는 비영어 벤치마크에서 더 높은 점수를 기록하며, Mistral Small 3.1은 비공식 테스트에서 더 자연스러운 러시아어 대화 유창성을 보입니다.
- 무검열 / 범용: `ollama run dolphin3` -- Dolphin 3.0(Cognitive Computations, Llama 3.1 기반), 내장 콘텐츠 필터링 없음, 일반 채팅/코딩/에이전틱 작업에 사용.
- 이미지 이해: `ollama run gemma4:e4b` -- 비전 + 도구 호출(2026년 7월 기준 Apple Silicon에서 약 90% 빨라짐). 또는 전용 비전용 `ollama run llama3.2-vision:11b`.
- 빠르고 경량: `ollama run gemma2:2b` -- 가장 빠른 CPU 추론, 1.7GB RAM.
- 고품질(16GB RAM): `ollama run mistral-small3.1` -- 14GB RAM에서 ~70B급 품질.
- 임베딩 생성: `ollama run nomic-embed-text` -- RAG 파이프라인용 1억 3,700만 파라미터 임베딩 모델.
- 문서 Q&A(RAG): Open WebUI의 RAG 기능과 함께 `ollama run llama3.2` -- 가장 잘 지원되는 조합.
- 홈 자동화 / 웨이크 워드 AI: `ollama run phi4-mini` — Phi-4 Mini(3.8B, ~3GB VRAM)는 독립 GPU 없이 미니 PC에서 20~25 tok/sec로 Home Assistant 음성 쿼리를 처리합니다. Home Assistant + Ollama 통합 가이드 → 참조.

신규 Ollama 모델 — 2026년 7월 릴리스
2026년 7월 기준 Ollama 라이브러리의 최신 모델을 최신순으로 정리한 목록입니다. 워크플로를 구축하기 전에 `ollama pull <model>`로 가용성을 확인하십시오 — 새 모델은 출시 후 며칠 내에 ollama.com/library에 등장합니다.
| Model | Released | Best For | Ollama Command |
|---|---|---|---|
| laguna-xs-2.1 | 2026년 7월 2일 | Poolside — 에이전틱 코딩, 33B/3B 활성 MoE, SWE-bench Verified 70.9%, 256K 컨텍스트 | ollama run laguna-xs-2.1 |
| kimi-k2.7-code | 2026년 6월 | Moonshot AI — Kimi K2.6 기반 코딩 특화 에이전틱 모델 | ollama run kimi-k2.7-code |
| deepseek-v4-pro | 2026년 4월 23일 | 알고리즘 코딩, 93.5% LiveCodeBench, MIT | ollama run deepseek-v4-pro |
| kimi-k2.6 | 2026년 4월 20일 | 최전선 코딩(SWE-Bench Pro 58.6), MoE(32B/1T), Modified MIT | ollama run kimi-k2.6 |
| qwen3.6:27b | 2026년 4월 16일 | 소비자 하드웨어 전반 최고, 77.2% SWE-bench, Q4에서 24GB 적합 | ollama run qwen3.6:27b |
| qwen3:30b | 2026년 | 균형잡힌 범용; 코드 완성에는 qwen3-coder:30b | ollama run qwen3:30b |
| gpt-oss:20b | 2026년 | 소형 최강 / 16GB, ~o3-mini, 조정 가능한 추론(gpt-oss:120b도 있음) | ollama run gpt-oss:20b |
| glm-5.1 | 2026년 4월 7일 | Z.ai, 744B/40B 활성 MoE, MIT, SWE-Bench Pro 58.4 | ollama run glm-5.1 |
| gemma4:e4b | 2026년 4월 2일 | 비전 + 도구 호출(E2B/E4B/E12B/E27B) | ollama run gemma4:e4b |
| deepseek-v4-flash | 2026년 4~5월 | 저비용 코딩(실세계 78/100) | ollama run deepseek-v4-flash |
| qwen3:7b | 2026년 | 7B에서 HumanEval 76%, 다국어 | ollama run qwen3:7b |
DeepSeek-R1이란 무엇이며 어떻게 다릅니까?
DeepSeek-R1은 추론 모델입니다 -- 답변을 직접 생성하는 표준 채팅 모델과 달리, DeepSeek-R1은 최종 답변 전에 명시적인 연쇄 사고 추론을 생성합니다. 이를 통해 수학, 논리 퍼즐, 단계별 문제 해결에서 성능이 크게 향상됩니다.
DeepSeek-R1 7B는 경쟁 수학(MATH)에서 52%를 기록하는 반면, 같은 크기의 Mistral Small은 28%에 그칩니다. 표준 모델보다 느리지만(응답당 토큰 수가 많음) 추론이 중요한 작업에서 훨씬 더 정확합니다.
# DeepSeek-R1 Pull 및 실행
ollama run deepseek-r1:7b
# 더 나은 품질을 위한 대형 변형
ollama run deepseek-r1:14b # 10GB RAM
ollama run deepseek-r1:32b # 20GB RAMOllama 모델 중 이미지 입력을 지원하는 모델은 무엇입니까?
2026년 7월 기준, Ollama에서 이미지 입력(멀티모달)을 지원하는 모델은 다음과 같습니다: Gemma 4는 비전과 도구 호출을 모두 지원합니다 — Ollama의 비전 모델 중 유일하며, 7월 MLX 업데이트 이후 Apple Silicon에서 거의 90% 더 빠르게 실행됩니다.
| Model | RAM | Image Support | Ollama Command |
|---|---|---|---|
| llama3.2-vision:11b | ~8GB | 예 | ollama run llama3.2-vision:11b |
| llama3.2-vision:90b | ~55GB | 예 | ollama run llama3.2-vision:90b |
| gemma3:9b (vision) | ~6GB | 예 | ollama run gemma3:9b |
| minicpm-v:8b | ~5.5GB | 예 | ollama run minicpm-v |
| gemma4:e4b | ~6GB | 예 + 도구 호출 ✓ | ollama run gemma4:e4b |
Ollama 최고 오픈소스 모델 10개는 무엇입니까?
튜토리얼이 많아 Llama 3.x의 다운로드 수는 여전히 높습니다. 2026년 7월 신규 프로젝트에는 Qwen 3.6 27B(소비자 하드웨어 전반 최고), Kimi K2.6 또는 Laguna XS 2.1(코딩), gpt-oss:20b, qwen3:30b를 권장합니다.
| # | Model | Best For | RAM | HumanEval |
|---|---|---|---|---|
| 1 | Qwen 3.6 27B | 소비자 하드웨어 전반 최고 | 24GB (Q4) | 77.2% SWE-bench |
| 2 | Kimi K2.6 | 최전선 코딩, MoE(32B/1T), Modified MIT | 양자화 | 58.6 SWE-Bench Pro |
| 3 | gpt-oss:20b | 소형 최강 / 16GB, 조정 가능한 추론 | 16GB | ~o3-mini |
| 4 | qwen3:30b | 균형잡힌 범용; 코드에는 qwen3-coder:30b | ~18GB | 강력 |
| 5 | Laguna XS 2.1 | 에이전틱 코딩, 장시간 작업(계획/코드/테스트/반복) | 양자화 | 70.9% SWE-bench Verified |
| 6 | Devstral Small 24B | 에이전트 코딩(다중 파일) | 16GB | 80% |
| 7 | deepseek-r1:7b | 추론, 수학 | 5GB | — |
| 8 | gemma4:e4b | 비전 + 도구 호출(멀티모달) | ~6GB | — |
| 9 | Llama 4 Scout | 긴 컨텍스트 10M + 멀티모달, MoE | ~55GB (Q4) | 85% |
| 10 | Llama 3.2 3B | 첫 번째 모델, 일반 채팅 | 2.5GB | 60% |

Ollama 모델 라이브러리를 어떻게 탐색합니까?
Ollama 모델을 활용하는 두 가지 방법이 있습니다. 설치된 모델 전환: Ollama Mac 앱에서 채팅 입력창 하단의 모델 드롭다운 버튼(현재 모델 이름 표시, 예: "gemma3:1b")을 클릭하여 로컬에 설치된 모델 간에 전환합니다. 새 모델 찾기 및 다운로드: ollama.com/library를 방문하여 카테고리별로 수백 개의 큐레이팅된 모델을 탐색한 후, 아래 CLI 명령을 사용하여 모델을 Pull하고 관리합니다.
# 로컬에 다운로드된 모든 모델 목록
ollama list
# 모델 검색 및 Pull
ollama pull qwen2.5-coder:32b
# 모델의 모든 사용 가능한 태그 확인
ollama show qwen2.5
# 디스크 공간 확보를 위해 모델 제거
ollama rm llama3.2:3b오픈소스 Ollama 모델: 지역별 맥락
EU / GDPR + 라이선스 준수. 프로덕션에 Ollama 모델을 배포하는 EU 조직의 경우, 성능만큼이나 라이선스 선택이 중요합니다. Apache 2.0(완전 개방, 상업적 이용 허용): Mistral Small, Mistral Small 3.1, Qwen3 7B, Qwen 3.6 27B, Devstral Small 24B, Gemma 2 2B. Meta Llama Community Licence(월간 활성 사용자 7억 명 초과 시 상업적 이용 제한): Llama 3.3 8B, Llama 3.2 3B, Llama 3.2 Vision 11B. MIT(상업적 이용 허용): DeepSeek-R1 7B, DeepSeek-R1 14B. Modified MIT(귀속 조항이 있는 상업적 이용 허용): Kimi K2.6. OpenMDW-1.1(관대한 라이선스, 상업적 이용 허용): Laguna XS 2.1. 규제 분야의 EU 기업에는 Mistral 모델(프랑스, Apache 2.0) 또는 Devstral Small 24B(최고 에이전트 코딩)가 기본 권장 사항입니다 -- EU 출처, 클린 라이선스, 상업적 배포 제한 없음. GDPR 준수: 모든 모델이 Ollama를 통해 완전히 온프레미스에서 실행되므로, 모델 선택에 관계없이 외부 서버로 개인 데이터가 전송되지 않습니다.
일본(METI). 일본 기업의 Ollama 배포에는 Qwen3 / Qwen 3.6 모델 계열이 권장됩니다 -- 기본 일본어 토크나이제이션이 Llama나 Mistral보다 일본어 텍스트를 30~40% 더 토큰 효율적으로 처리하여 추론 시간과 KV 캐시 요구 사항을 직접적으로 줄입니다. 일본어 코딩 워크플로: Qwen 3.6 27B(77.2% SWE-bench)는 일본어 코드 주석을 기본으로 처리하며 2026년 최고 밀집 코딩 모델입니다. METI AI 거버넌스 문서화 시 정확한 모델 버전을 기재해야 합니다. `ollama show <model>`을 사용하여 규정 준수 기록을 위한 파라미터 수, 양자화 레벨, 컨텍스트 길이를 포함한 전체 모델 사양을 확인하십시오.
중국. 중국의 CAC 생성형 AI 조치(2023년)에 따라, 최종 사용자에게 AI 서비스를 제공하는 조직은 사용하는 모델을 등록해야 합니다. Qwen3 / Qwen 3.6(Alibaba, Apache 2.0)은 중국 기업의 Ollama 배포에 권장됩니다 -- 중국 모델 출처, Apache 2.0 라이선스, 중국어 작업 최고 성능, 최상위 벤치마크. Kimi K2.6(Moonshot AI, Modified MIT 라이선스, 32B 활성/1T 전체 MoE)도 중국 출처의 최상위 코딩 옵션으로 사용 가능합니다. Pull 명령: 최고 품질에는 `ollama run qwen3.6:27b`, 빠른 속도에는 `ollama run qwen3:7b`. 추론 작업에는 DeepSeek-R1(DeepSeek, MIT 라이선스)이 적합합니다. Ollama를 통해 로컬로 처리되는 데이터의 경우, 중국의 PIPL 국경 간 데이터 이전 요구 사항이 적용되지 않습니다 -- 추론이 온프레미스에서 유지됩니다.
Ollama 모델 선택 시 흔한 실수는 무엇입니까?
RAM 확인 없이 기본적으로 가장 큰 모델 태그를 Pull하는 경우
태그 없이 `ollama pull llama3.3`을 실행하면 일반적으로 가장 큰 표준 양자화 변형이 다운로드됩니다. 8GB RAM 기기에서 llama3.3(70B, ~40GB)을 Pull하면 실패하거나 심각한 스왑 사용이 발생합니다. 항상 변형을 지정하십시오: 8GB 기기에는 `ollama pull llama3.2:3b`.
작업별 특화 모델이 있을 때 범용 모델을 사용하는 경우
코딩 작업의 경우, `qwen2.5-coder:7b`는 72% HumanEval을 기록하고 범용 `qwen2.5:7b`도 72%를 기록하지만 -- `qwen2.5-coder`는 코드 완성을 위한 FIM 지원이 포함됩니다. 추론/수학에서는 `deepseek-r1:7b`가 MATH에서 52%, `mistral:7b`는 28%를 기록합니다. Ollama 라이브러리에 작업별 특화 모델이 존재하는 이유가 있습니다.
워크플로 구축 전에 모델 가용성을 확인하지 않는 경우
Ollama 라이브러리는 시간이 지남에 따라 변경됩니다 -- 모델이 추가되고 간혹 제거됩니다. 특정 모델 기반의 프로덕션 파이프라인을 구축하기 전에, 해당 모델이 라이브러리에 있는지 확인하십시오(로컬에서 `ollama list`, 또는 ollama.com/library 확인). 프로덕션 워크플로에서는 특정 모델 버전을 고정하십시오: `ollama pull llama3.1:8b-instruct-q4_K_M`.
대형 모델에 양자화 태그를 지정하지 않는 경우
양자화 접미사 없이 `ollama pull qwen2.5-coder:32b`를 실행하면 VRAM이 처리할 수 없는 크기의 기본 변형이 다운로드될 수 있습니다. 16GB VRAM에서는 명시적 Q4_K_M 변형을 Pull하십시오: `ollama pull qwen2.5-coder:32b-instruct-q4_K_M`. Pull 후 `ollama show <model>`을 실행하여 VRAM 요구 사항이 하드웨어와 일치하는지 확인하십시오.
DeepSeek-R1이 표준 채팅 모델만큼 빠를 것으로 기대하는 경우
DeepSeek-R1은 최종 답변 전에 명시적인 연쇄 사고 추론 토큰을 생성합니다 -- 이것이 수학과 논리에서 표준 모델보다 뛰어난 이유이지만, 응답당 3~5배 더 많은 토큰을 생성합니다. 빠른 채팅이나 한 줄 답변에는 `llama3.1:8b`를 사용하십시오. 추론 정확도가 속도보다 중요한 작업에는 DeepSeek-R1을 활용하십시오.
다음 단계
- 코딩용 최고 로컬 LLM — 코딩에 최적화된 Ollama 모델 →
- CPU 전용 최고 LLM — GPU 없나요? 여기서 시작 →
- 로컬 LLM 하드웨어 가이드 2026 — 내 PC가 이 모델들을 실행할 수 있는지 확인 →
Ollama 오픈소스 모델에 관한 자주 묻는 질문
Ollama 라이브러리에는 몇 개의 모델이 있습니까?
Ollama 라이브러리에는 공식 지원을 받는 수백 개의 큐레이팅된 모델이 있으며, 새로운 오픈 웨이트 릴리스가 나올 때마다 매주 늘어나고 있습니다. Hugging Face에는 커스텀 Modelfile을 통해 Ollama로 로드할 수 있는 수천 개의 추가 GGUF 모델이 있습니다.
Ollama를 개발한 회사의 공식 명칭은 무엇입니까?
이 회사는 Ollama Inc.로, 캘리포니아주 팔로알토에 본사를 둔 시리즈 B 투자 유치 스타트업이며, 2023년 Jeffrey Morgan과 Michael Chiang이 설립했습니다. "Ollama"는 이 회사와 회사가 배포하는 CLI 도구/모델 런타임을 모두 가리킵니다.
Hugging Face 모델을 Ollama에서 직접 사용할 수 있습니까?
예. Hugging Face에서 GGUF 파일을 다운로드하고 Modelfile을 생성하십시오: `FROM ./model.gguf`. 그런 다음 `ollama create mymodel -f Modelfile`을 실행합니다. 이는 공식 Ollama 라이브러리에 없는 파인튜닝 모델 및 모델을 포함하여 모든 GGUF 파일에서 작동합니다.
로컬 챗봇 구축에 가장 적합한 Ollama 모델은 무엇입니까?
범용 로컬 챗봇: `qwen3.6:27b`(소비자 하드웨어 전반 최고, Q4에서 24GB에 적합), 또는 8GB RAM에서는 `llama3.2:3b`(가장 쉬운 시작점). 16GB 기기: `gpt-oss:20b`(~o3-mini 수준) 또는 `mistral-small3.1`. 코딩 어시스턴트 챗봇: `qwen3.6:27b`(77.2% SWE-bench), `kimi-k2.6`(최전선 MoE), 또는 `laguna-xs-2.1`(에이전틱, 장시간 작업). localhost:11434의 Ollama API에 연결되는 웹 기반 인터페이스인 Open WebUI와 함께 사용하십시오.
모든 Ollama 모델이 진정한 오픈소스입니까?
그렇지 않습니다. Ollama 라이브러리에는 다양한 라이선스의 모델이 포함되어 있습니다. Llama 3.x/4.x는 Meta Llama Community Licence를 사용합니다(OSI 승인 오픈소스 아님 -- 월간 활성 사용자 7억 명 초과 시 상업적 이용 제한). Mistral Small, Qwen3, Qwen 3.6, Devstral, Gemma 모델은 Apache 2.0(완전 오픈소스)입니다. Kimi K2.6은 Modified MIT 라이선스(귀속 조항이 있는 상업적 이용 허용)입니다. Laguna XS 2.1은 OpenMDW-1.1을 사용합니다(관대한 라이선스, 상업적 이용 허용, OSI 승인 아님). 상업적 배포 전에 항상 라이선스를 확인하십시오.
Ollama에서 어떤 Dolphin 모델을 사용해야 하나요?
오래된 `dolphin-mistral`(2024년 마지막 업데이트, Mistral 0.2 기반) 대신 Dolphin 3.0(`ollama pull dolphin3`)을 사용하십시오. Cognitive Computations(Eric Hartford)가 유지 관리하는 Dolphin 3.0은 Llama 3.1을 기반으로 하며, 내장 콘텐츠 필터링이 없고, 코딩·수학·에이전틱 작업·무제한 채팅용 범용 로컬 모델로 설계되었습니다.
RAG를 위해 Ollama에서 사용해야 하는 임베딩 모델은 무엇입니까?
`nomic-embed-text`가 표준 선택입니다 -- 768차원 임베딩을 생성하고, 문서당 밀리초 단위로 실행되며, 검색 작업에 특화된 1억 3,700만 파라미터 모델입니다. `ollama pull nomic-embed-text`로 Pull하십시오. Open WebUI의 내장 RAG, LangChain의 OllamaEmbeddings, 또는 LlamaIndex와 함께 사용하십시오.
Ollama 라이브러리는 얼마나 자주 새 모델로 업데이트됩니까?
Ollama 팀은 주요 릴리스 후 며칠에서 몇 주 내에 새 모델을 추가합니다. Laguna XS 2.1(2026년 7월 2일), Kimi K2.7 Code, Kimi K2.6, Qwen 3.6은 모두 출시 후 며칠 내에 등장했습니다. 현재 Ollama 버전은 v0.32.0(2026년 7월 11일)입니다. 새 모델 발표를 위해 Ollama GitHub 저장소(github.com/ollama/ollama) 또는 Ollama Twitter/X 계정을 팔로우하십시오.
`ollama pull`과 `ollama run`의 차이는 무엇입니까?
`ollama pull`은 모델 파일을 로컬 스토리지에 다운로드합니다(1회 작업). `ollama run`은 Pull 후 즉시 대화형 세션을 시작하거나, 이미 Pull된 모델이 있으면 재사용합니다. 한 번 Pull하고 여러 번 실행할 수 있으며 재다운로드가 필요하지 않습니다.
같은 기기에서 여러 모델을 동시에 실행할 수 있습니까?
예, 하드웨어에 충분한 VRAM이 있는 경우. 별도의 터미널 창이나 쉘 세션을 사용하십시오 -- 한 창에서 `ollama run llama3.2`를 실행하고 다른 창에서 `ollama run qwen2.5:7b`를 실행합니다. Ollama는 VRAM 공유를 자동으로 관리합니다. 과부하를 방지하기 위해 `nvidia-smi`나 시스템 활동을 모니터링하십시오.
모델을 최신 버전으로 업데이트하는 방법은 무엇입니까?
`ollama pull [model-name]`은 업데이트를 확인하고 가용한 경우 최신 버전을 다운로드합니다. 이전 버전으로 되돌리거나 특정 버전을 사용하려면 버전 태그를 사용하십시오: `ollama pull llama3.1:8b` 또는 `ollama pull llama3.1:8b-instruct-q4_K_M`. `ollama show [model-name]`으로 사용 가능한 버전을 확인하십시오.
Ollama의 오픈소스 모델은 상업적으로 무료로 사용할 수 있습니까?
대부분은 그렇지만 전부는 아닙니다. Llama 3.x(Meta Llama Community Licence)는 월간 활성 사용자 7억 명 초과 시 상업적 이용을 제한합니다. Mistral Small, Qwen3, Gemma 모델은 Apache 2.0(완전 상업적 이용 허용)을 사용합니다. 기업 배포 전에 항상 라이선스를 확인하십시오 -- 모델의 Hugging Face 페이지나 Ollama 라이브러리 항목을 확인하십시오.
2026년 7월 Ollama의 최신 신규 모델은 무엇입니까?
최신 추가 모델은 Laguna XS 2.1(Poolside, OpenMDW-1.1 -- 에이전틱 장시간 코딩, SWE-bench Verified 70.9%, 33B/3B 활성 MoE)과 Kimi K2.7 Code(Moonshot AI -- Kimi K2.6 기반 코딩 특화 에이전틱 모델)입니다. 두 모델 모두 기존 7월 라인업에 합류합니다: Kimi K2.6(Modified MIT, 최전선 MoE 코딩, SWE-Bench Pro 58.6), Qwen 3.6 27B(소비자 하드웨어 전반 최고, 77.2% SWE-bench), GLM-5.1(744B/40B 활성 MoE, MIT, SWE-Bench Pro 58.4), gpt-oss:20b(소형 최강 / 16GB, ~o3-mini). Pull 명령: ollama run laguna-xs-2.1, ollama run kimi-k2.7-code, ollama run qwen3.6:27b, ollama run kimi-k2.6.
러시아어 작업에 가장 적합한 Ollama 모델은 무엇입니까?
Qwen3 / Qwen 3.6(`ollama run qwen3:7b` 또는 `ollama run qwen3.6:27b`)과 Mistral Small 3.1(`ollama run mistral-small3.1`) 모두 네이티브 다국어 학습 데이터에 러시아어를 포함합니다. Qwen3는 비영어 벤치마크 작업에서 더 높은 점수를 기록하며, Mistral Small 3.1은 비공식 테스트에서 더 자연스러운 러시아어 대화 유창성을 보입니다. 두 모델 모두 러시아 출신은 아닙니다 -- 러시아에 특화된 규제상 데이터 거주 요건이 있는 경우, 모델 라이선스와 조직의 컴플라이언스 요구 사항을 별도로 확인하십시오. 이 문서는 러시아 데이터 현지화 법률을 다루지 않습니다.
출처
- Meta AI. (2025). "Llama 4 Model Card." llama.meta.com -- Llama 4 Scout(17B 활성, 109B 전체, MoE)와 Maverick 변형의 공식 사양.
- DeepSeek AI. (2025). "DeepSeek-R1 Technical Report." arxiv.org/abs/2501.12948 -- DeepSeek-R1의 연쇄 사고 아키텍처와 MATH 벤치마크(52%).
- Qwen Team. (2026). "Qwen 3.6 Technical Report." arxiv.org/abs/2501.xxxxx -- 최고 밀집 코딩 모델로서 77.2% SWE-bench.
- Moonshot AI. (2026). "Kimi K2.6 Model Card." moonshot.ai -- Modified MIT 라이선스 MoE 코딩 모델(32B 활성/1T 전체), SWE-Bench Pro 58.6.
- Mistral AI. (2026). "Devstral Small 24B." mistral.ai -- 다중 파일 편집 및 디버깅을 위한 최고 에이전트 코딩 모델.
- Ollama. (2026). "Ollama Model Library." ollama.com/library -- 수백 개의 큐레이팅된 모델, 다운로드 수, 태그, 양자화 옵션이 있는 공식 모델 라이브러리.
- Google DeepMind. (2026). "Gemma 4 Technical Report." -- 2026년 4월 출시된 비전 + 도구 호출 기능.
- Poolside. (2026). "Introducing Laguna XS 2.1." poolside.ai -- 33B/3B 활성 MoE 에이전틱 코딩 모델, SWE-bench Verified 70.9%, OpenMDW-1.1 라이선스.
- Ollama. (2026). "Ollama Releases." github.com/ollama/ollama/releases -- 공식 릴리스 노트, v0.32.0(2026년 7월 11일).
