Welche Ollama-Modelle unterstützen 128K Kontext?

Schnelle Antwort
Llama 3.1 8B unterstützt 128K Kontext auf Ollama. Qwen3-30B-A3B, ein Mixture-of-Experts-Modell, erreicht 256K Kontext. Hinweis: Voller Kontext erhöht den VRAM-Bedarf erheblich — ein 128K-Fenster benötigt 3–4× mehr VRAM als das Standard-4K-Fenster.
- ▸Llama 3.1 8B: 128K Kontext, ~16 GB VRAM bei vollem Kontext
- ▸Qwen3-30B-A3B: 256K Kontext, 24+ GB VRAM bei vollem Kontext
- ▸Setzen Sie --num-ctx 4096 für die normale Nutzung, um VRAM zu sparen
Wichtigste Punkte
- ✓Die meisten 7B-Ollama-Modelle werben mit 128K Kontext, liefern aber oberhalb von 32K Tokens sinkende Qualität
- ✓Llama 3.1 8B und Qwen3-30B-A3B sind die zwei Modelle, die zuverlässig 128K+ Kontext auf Ollama liefern
- ✓Ein 128K-Kontextfenster kann den VRAM-Verbrauch fast verdreifachen — ein 7B Q4-Modell benötigt ~15 GB bei 128K statt ~5,5 GB beim Standard
- ✓Setzen Sie <code>--num-ctx 4096</code> für alltägliche Aufgaben; erweitern Sie den Kontext nur, wenn Sie ihn benötigen
Welche Modelle wirklich 128K erreichen
Die meisten Ollama-Modelle werben mit 128K Kontext, aber nur wenige liefern bei dieser Länge nützliche Ausgabequalität. Das Problem ist der „Lost in the Middle"-Effekt: Modelle, die auf typischen Dokumentlängen trainiert wurden, haben Schwierigkeiten, Informationen tief in einem langen Kontext zu finden.
Zwei Modelle liefern zuverlässig 128K+ Kontext auf Ollama: Llama 3.1 8B (nativ auf 128K trainiert) und Qwen3-30B-A3B (ein Mixture-of-Experts-Modell mit 256K Kontextfenster in der offiziellen Ollama-Bibliothek, das pro Token nur rund 3 Mrd. seiner 30 Mrd. Parameter aktiviert). Die kleineren dichten Qwen3-Größen liefern in Ollama standardmäßig ein 40K-Kontextfenster, und bei den meisten anderen 7B-Modellen nimmt die Ausgabequalität oberhalb von 32K Tokens merklich ab.
Wenn Ihre Aufgabe Dokumente mit mehr als 20.000 Wörtern umfasst, beginnen Sie mit Llama 3.1 8B. Wenn Sie das größte Kontextfenster benötigen und 20+ GB VRAM haben, ist Qwen3-30B-A3B die bessere Wahl.
📍 In einem Satz
Die zwei Ollama-Modelle, die zuverlässig 128K+ Kontext liefern, sind Llama 3.1 8B (128K, nativ trainiert) und Qwen3-30B-A3B (256K, Mixture-of-Experts).
💬 In einfachen Worten
Llama 3.1 8B wurde von Anfang an für 128K Tokens Kontext trainiert, daher bleibt die Ausgabequalität auch bei dieser Länge stabil. Qwen3-30B-A3B ist ein Mixture-of-Experts-Modell — es aktiviert pro Token nur rund 3 Milliarden seiner 30 Milliarden Parameter — und Ollama führt es mit einem 256K-Kontextfenster. Die meisten anderen 7B-Modelle werben mit 128K, aber ihre Ausgabequalität sinkt spürbar oberhalb von 32K Tokens.
Die VRAM-Kosten langer Kontextfenster
Die Erweiterung des Kontextfensters erhöht den VRAM-Verbrauch erheblich. Der KV-Cache, der den Attention-Zustand für alle Tokens im Kontext speichert, kann bei 128K Kontext so viel VRAM belegen wie die Modellgewichte selbst.
Die folgende Tabelle zeigt, wie der KV-Cache-VRAM für ein 7B-Modell bei Q4_K_M skaliert. Diese Werte gelten für Modelle mit Grouped Query Attention (GQA) — Modelle ohne GQA verwenden deutlich mehr KV-Cache.
Um VRAM bei alltäglichen Aufgaben zu sparen, setzen Sie --num-ctx 4096 beim Starten von Ollama. Erweitern Sie auf 32K oder 128K nur, wenn Ihre spezifische Aufgabe es erfordert. Den vollständigen Leitfaden zu Long-Context-LLMs einschließlich Modellauswahl und RAM-Splitting finden Sie im Leitfaden für Long-Context-LLMs.
| Kontextlänge | KV-Cache (7B) | Gesamt-VRAM (7B Q4) |
|---|---|---|
| 4K (Standard) | ~0,5 GB | ~5,5 GB |
| 16K | ~1,5 GB | ~6,5 GB |
| 32K | ~3 GB | ~8 GB |
| 128K | ~10 GB | ~15 GB |
Verwandte Leitfäden
- ▸Leitfaden für Long-Context-LLMs -- Modellauswahl und RAM-Splitting
- ▸Kann man Qwen 3 mit Ollama ausführen? -- Einrichtung und VRAM-Anforderungen
- ▸Welche Ollama-Modelle unterstützen Vision? -- multimodale Modelle auf Ollama
Schnelle Antworten zu Long-Context-Modellen
Wie aktiviere ich 128K Kontext in Ollama?▾
--num-ctx 131072 zu Ihrem Run-Befehl hinzu: ollama run llama3.1:8b --num-ctx 131072. Ohne dieses Flag verwendet Ollamas Modelfile-Spezifikation standardmäßig 2048 Tokens, und selbst der VRAM-gestaffelte Laufzeit-Standard (4K unter 24 GiB, 32K bei 24–48 GiB, 256K darüber) kann unter der maximalen Fähigkeit des Modells liegen — setzen Sie num_ctx explizit, um dies zu garantieren.