Skip to main content
PromptQuorumBuilt for humans. Structured for AI.

Welche Ollama-Modelle unterstützen 128K Kontext?

Welche Ollama-Modelle unterstützen 128K Kontext?

Schnelle Antwort

Llama 3.1 8B unterstützt 128K Kontext auf Ollama. Qwen3-30B-A3B, ein Mixture-of-Experts-Modell, erreicht 256K Kontext. Hinweis: Voller Kontext erhöht den VRAM-Bedarf erheblich — ein 128K-Fenster benötigt 3–4× mehr VRAM als das Standard-4K-Fenster.

  • ▸Llama 3.1 8B: 128K Kontext, ~16 GB VRAM bei vollem Kontext
  • ▸Qwen3-30B-A3B: 256K Kontext, 24+ GB VRAM bei vollem Kontext
  • ▸Setzen Sie --num-ctx 4096 für die normale Nutzung, um VRAM zu sparen
Ollama

Wichtigste Punkte

  • ✓Die meisten 7B-Ollama-Modelle werben mit 128K Kontext, liefern aber oberhalb von 32K Tokens sinkende Qualität
  • ✓Llama 3.1 8B und Qwen3-30B-A3B sind die zwei Modelle, die zuverlässig 128K+ Kontext auf Ollama liefern
  • ✓Ein 128K-Kontextfenster kann den VRAM-Verbrauch fast verdreifachen — ein 7B Q4-Modell benötigt ~15 GB bei 128K statt ~5,5 GB beim Standard
  • ✓Setzen Sie <code>--num-ctx 4096</code> für alltägliche Aufgaben; erweitern Sie den Kontext nur, wenn Sie ihn benötigen

Welche Modelle wirklich 128K erreichen

Die meisten Ollama-Modelle werben mit 128K Kontext, aber nur wenige liefern bei dieser Länge nützliche Ausgabequalität. Das Problem ist der „Lost in the Middle"-Effekt: Modelle, die auf typischen Dokumentlängen trainiert wurden, haben Schwierigkeiten, Informationen tief in einem langen Kontext zu finden.

Zwei Modelle liefern zuverlässig 128K+ Kontext auf Ollama: Llama 3.1 8B (nativ auf 128K trainiert) und Qwen3-30B-A3B (ein Mixture-of-Experts-Modell mit 256K Kontextfenster in der offiziellen Ollama-Bibliothek, das pro Token nur rund 3 Mrd. seiner 30 Mrd. Parameter aktiviert). Die kleineren dichten Qwen3-Größen liefern in Ollama standardmäßig ein 40K-Kontextfenster, und bei den meisten anderen 7B-Modellen nimmt die Ausgabequalität oberhalb von 32K Tokens merklich ab.

Wenn Ihre Aufgabe Dokumente mit mehr als 20.000 Wörtern umfasst, beginnen Sie mit Llama 3.1 8B. Wenn Sie das größte Kontextfenster benötigen und 20+ GB VRAM haben, ist Qwen3-30B-A3B die bessere Wahl.

📍 In einem Satz

Die zwei Ollama-Modelle, die zuverlässig 128K+ Kontext liefern, sind Llama 3.1 8B (128K, nativ trainiert) und Qwen3-30B-A3B (256K, Mixture-of-Experts).

💬 In einfachen Worten

Llama 3.1 8B wurde von Anfang an für 128K Tokens Kontext trainiert, daher bleibt die Ausgabequalität auch bei dieser Länge stabil. Qwen3-30B-A3B ist ein Mixture-of-Experts-Modell — es aktiviert pro Token nur rund 3 Milliarden seiner 30 Milliarden Parameter — und Ollama führt es mit einem 256K-Kontextfenster. Die meisten anderen 7B-Modelle werben mit 128K, aber ihre Ausgabequalität sinkt spürbar oberhalb von 32K Tokens.

Die VRAM-Kosten langer Kontextfenster

Die Erweiterung des Kontextfensters erhöht den VRAM-Verbrauch erheblich. Der KV-Cache, der den Attention-Zustand für alle Tokens im Kontext speichert, kann bei 128K Kontext so viel VRAM belegen wie die Modellgewichte selbst.

Die folgende Tabelle zeigt, wie der KV-Cache-VRAM für ein 7B-Modell bei Q4_K_M skaliert. Diese Werte gelten für Modelle mit Grouped Query Attention (GQA) — Modelle ohne GQA verwenden deutlich mehr KV-Cache.

Um VRAM bei alltäglichen Aufgaben zu sparen, setzen Sie --num-ctx 4096 beim Starten von Ollama. Erweitern Sie auf 32K oder 128K nur, wenn Ihre spezifische Aufgabe es erfordert. Den vollständigen Leitfaden zu Long-Context-LLMs einschließlich Modellauswahl und RAM-Splitting finden Sie im Leitfaden für Long-Context-LLMs.

KontextlängeKV-Cache (7B)Gesamt-VRAM (7B Q4)
4K (Standard)~0,5 GB~5,5 GB
16K~1,5 GB~6,5 GB
32K~3 GB~8 GB
128K~10 GB~15 GB

Verwandte Leitfäden

Schnelle Antworten zu Long-Context-Modellen

Wie aktiviere ich 128K Kontext in Ollama?▾
Fügen Sie --num-ctx 131072 zu Ihrem Run-Befehl hinzu: ollama run llama3.1:8b --num-ctx 131072. Ohne dieses Flag verwendet Ollamas Modelfile-Spezifikation standardmäßig 2048 Tokens, und selbst der VRAM-gestaffelte Laufzeit-Standard (4K unter 24 GiB, 32K bei 24–48 GiB, 256K darüber) kann unter der maximalen Fähigkeit des Modells liegen — setzen Sie num_ctx explizit, um dies zu garantieren.
Warum verbraucht langer Kontext so viel VRAM?▾
Der KV-Cache speichert den Attention-Zustand für jeden Token im Kontext. Bei 128K Tokens kann dieser Cache so groß wie die Modellgewichte selbst sein. Ein 7B-Modell bei Q4 benötigt ~5,5 GB für die Gewichte, aber ~10 GB KV-Cache bei 128K Kontext.
Ist 128K Kontext nützlich für das Programmieren?▾
Ja, beim Arbeiten über große Codebasen. Einen gesamten Repository oder mehrere Dateien in den Kontext zu laden, verbessert Refactoring- und dateiübergreifende Reasoning-Aufgaben erheblich. Für das Programmieren über große Codebasen mit 128K+ ist Qwen3-30B-A3B das empfohlene Modell.
Welches Modell eignet sich am besten für die Analyse langer Dokumente?▾
Qwen3-30B-A3B ist die beste Wahl für lange Dokumente auf Ollama — das 256K-Kontextfenster bietet mehr Spielraum als 128K-Modelle, und als Mixture-of-Experts-Modell läuft es schneller als ein dichtes Modell ähnlicher Größe. Siehe Ollama Vision-Modelle, wenn Sie neben langen Dokumenten auch Bildverständnis benötigen.