Ollama에서 128K 컨텍스트를 지원하는 모델은 무엇입니까?

빠른 답변
Llama 3.1 8B는 Ollama에서 128K 컨텍스트를 지원합니다. 전문가 혼합(MoE) 모델인 Qwen3-30B-A3B는 256K 컨텍스트에 도달합니다. 주의: 전체 컨텍스트 실행 시 VRAM이 크게 증가합니다 — 128K 윈도우는 기본 4K 윈도우보다 3~4배 더 많은 VRAM이 필요합니다.
- ▸Llama 3.1 8B: 128K 컨텍스트, 전체 컨텍스트 시 ~16 GB VRAM
- ▸Qwen3-30B-A3B: 256K 컨텍스트, 전체 컨텍스트 시 24+ GB VRAM
- ▸일반 사용 시 --num-ctx 4096으로 설정하여 VRAM을 절약하십시오
핵심 요점
- ✓대부분의 Ollama 7B 모델은 128K 컨텍스트를 지원한다고 광고하지만 32K 토큰 이상에서는 품질이 저하됩니다
- ✓Llama 3.1 8B와 Qwen3-30B-A3B는 Ollama에서 128K 이상의 컨텍스트를 안정적으로 제공하는 두 가지 모델입니다
- ✓128K 컨텍스트 윈도우는 VRAM 사용량을 거의 3배까지 늘릴 수 있습니다 — 7B Q4 모델은 기본값 대비 128K에서 ~15 GB VRAM이 필요합니다
- ✓일상적인 작업에는 <code>--num-ctx 4096</code>으로 설정하고, 필요할 때만 컨텍스트를 늘리십시오
실제로 128K에 도달하는 모델
대부분의 Ollama 모델은 128K 컨텍스트를 광고하지만 그 길이에서 유용한 출력 품질을 제공하는 모델은 소수에 불과합니다. 문제는 "lost in the middle" 효과입니다: 일반적인 문서 길이로 학습된 모델은 긴 컨텍스트 깊은 곳에 배치된 정보에 주의를 기울이기 어렵습니다.
Ollama에서 128K 이상의 컨텍스트를 안정적으로 제공하는 모델은 두 가지입니다: Llama 3.1 8B(128K로 네이티브 학습)와 Qwen3-30B-A3B(Ollama 공식 라이브러리에서 256K 컨텍스트 윈도우를 제공하는 전문가 혼합 모델로, 토큰마다 300억 개 파라미터 중 약 30억 개만 활성화). Qwen3의 더 작은 밀집 모델들은 Ollama에서 기본적으로 40K 컨텍스트 윈도우를 사용하며, 대부분의 다른 7B급 모델의 경우도 32K 토큰 이상에서 출력 품질이 눈에 띄게 저하됩니다.
20,000단어 이상의 문서를 처리하는 작업이라면 Llama 3.1 8B부터 시작하십시오. 가장 큰 컨텍스트 윈도우가 필요하고 20 GB 이상의 VRAM을 보유하고 있다면, Qwen3-30B-A3B가 더 나은 선택입니다.
📍 한 문장으로
Ollama에서 128K 이상의 컨텍스트를 안정적으로 제공하는 두 가지 모델은 Llama 3.1 8B(128K, 네이티브 학습)와 Qwen3-30B-A3B(256K, 전문가 혼합 모델)입니다.
💬 쉽게 설명하면
Llama 3.1 8B는 128K 컨텍스트로 네이티브 학습된 모델이라 이 길이에서도 출력 품질이 안정적입니다. Qwen3-30B-A3B는 전문가 혼합(MoE) 모델로, 토큰마다 300억 개 파라미터 중 약 30억 개만 활성화하며 Ollama에서는 256K 컨텍스트 윈도우로 제공됩니다. 대부분의 다른 7B급 모델은 128K를 광고하지만 32K 토큰을 넘어서면 출력 품질이 눈에 띄게 저하됩니다.
긴 컨텍스트의 VRAM 비용
컨텍스트 윈도우를 늘리면 VRAM 사용량이 크게 증가합니다. 컨텍스트의 모든 토큰에 대한 어텐션 상태를 저장하는 KV-cache는 128K 컨텍스트에서 모델 가중치 자체만큼의 VRAM을 추가할 수 있습니다.
아래 표는 Q4_K_M의 7B 모델에서 KV-cache VRAM이 어떻게 확장되는지를 보여줍니다. 이 수치는 grouped query attention(GQA)을 사용하는 모델을 기준으로 합니다 — GQA가 없는 모델은 KV-cache를 훨씬 더 많이 사용합니다.
일상적인 작업에서 VRAM을 절약하려면 Ollama 실행 시 --num-ctx 4096으로 설정하십시오. 특정 작업에 필요한 경우에만 32K 또는 128K로 확장하십시오. 모델 선택과 RAM 분할을 포함한 긴 컨텍스트 로컬 LLM 전체 가이드는 긴 컨텍스트 로컬 LLM 가이드를 참조하십시오.
| 컨텍스트 길이 | KV-Cache (7B) | 총 VRAM (7B Q4) |
|---|---|---|
| 4K (기본값) | ~0.5 GB | ~5.5 GB |
| 16K | ~1.5 GB | ~6.5 GB |
| 32K | ~3 GB | ~8 GB |
| 128K | ~10 GB | ~15 GB |
관련 자료
긴 컨텍스트 모델에 관한 빠른 답변
Ollama에서 128K 컨텍스트를 활성화하는 방법은 무엇입니까?▾
--num-ctx 131072를 추가하십시오: ollama run llama3.1:8b --num-ctx 131072. 이 플래그 없이는 Ollama의 Modelfile 사양이 num_ctx를 기본값 2048로 설정하며, VRAM 등급별 런타임 기본값(24 GiB 미만은 4K, 24-48 GiB는 32K, 그 이상은 256K)도 모델의 최대 용량에 못 미칠 수 있습니다 — 이를 보장하려면 num_ctx를 명시적으로 설정하십시오.