Skip to main content
PromptQuorumBuilt for humans. Structured for AI.

Wie viel VRAM brauchen Sie für ein lokales LLM?

Wie viel VRAM brauchen Sie für ein lokales LLM?

Schnelle Antwort

4 GB VRAM reichen für Llama 3.2 3B und Phi-3.5-mini mit sicherer Pufferzone für Kontexterweiterung. 6 GB betreiben Llama 3.1 8B bei Q4. 12 GB fassen Qwen3 14B Q4 effizient. Für 70B-Modelle bei Q4 werden 16+ GB benötigt.

  • ▸4 GB: Llama 3.2 3B Q4, Phi-3.5-mini Q4
  • ▸6 GB: Llama 3.1 8B Q4_K_M
  • ▸8–12 GB: Llama 3.1 8B Q5_K_M, Qwen3 14B Q4
Quantization & VRAM

Wichtigste Punkte

  • ✓4 GB VRAM betreibt Llama 3.2 3B und Phi-3.5-mini problemlos
  • ✓6 GB ist der Einstiegspunkt für Llama 3.1 8B bei Q4_K_M — die beliebteste lokale Modellgröße
  • ✓12 GB schaltet Qwen3 14B Q4 frei, die beste Qualitäts-pro-Dollar-Stufe
  • ✓70B-Modelle benötigen 40+ GB — planen Sie für Dual-RTX 3090 oder Apple M-Series mit großem Unified Memory

VRAM-Anforderungen nach Modellgröße

Der VRAM-Bedarf eines Modells folgt einer einfachen, anhand realer GGUF-Dateigrößen verifizierten Formel: Parameteranzahl in Milliarden × 0,6 = ungefähre GB bei Q4-Quantisierung. Ein 8B-Modell benötigt ~4,8 GB für die Gewichte, plus 0,5–1 GB Kontext-Overhead. Deshalb sind 6 GB das Minimum für die 7–8B-Tier und warum 12 GB die 14B-Tier mit Spielraum freischaltet.

Verwenden Sie die nachstehende Tabelle als schnelle Entscheidungsreferenz. Die Spalte "Geschwindigkeit" setzt Ollama auf einer Desktop-GPU mit Standard-Kontext (2048 Tokens) voraus.

Halten Sie stets 1–2 GB VRAM über dem angegebenen Bedarf Ihres Modells frei. Betriebssysteme, Browser-Tabs und die Ollama-Laufzeit verbrauchen 500 MB–1 GB, selbst wenn kein Modell geladen ist. Eine 6-GB-Karte, die Llama 3.1 8B Q4_K_M (~4,8 GB) betreibt, lässt nur etwa 1,2 GB Spielraum — Out-of-Memory-Fehler treten auf, sobald Sie --num-ctx deutlich über 2048 Tokens erhöhen. Für die 6-GB-Tier mit sicherem Spielraum, siehe beste lokale LLMs für 6 GB VRAM.

VRAMBestes Modell bei Q4_K_MGeschwindigkeit
4 GBLlama 3.2 3B oder Phi-3.5-mini Q4~25 tok/s
6 GBLlama 3.1 8B Q4_K_M~20 tok/s
8 GBLlama 3.1 8B Q5_K_M~18 tok/s
12 GBQwen3 14B Q4_K_M~15 tok/s
16+ GBQwen3 32B Q4 oder Llama 3.3 70B partiell~8 tok/s

Was tun, wenn der VRAM nicht ausreicht

Wenn ein Modell Ihren VRAM überschreitet, haben Sie drei Möglichkeiten: Quantisierung reduzieren (Q4_K_M statt Q5), das Kontextfenster mit --num-ctx 2048 verkleinern oder Ollama Schichten in den System-RAM auslagern lassen.

CPU-Offload funktioniert, ist aber langsam — jede in den RAM verschobene Schicht erhöht die Latenz. Für interaktive Nutzung bleiben Sie innerhalb des VRAM-Limits Ihrer GPU. Die Reduzierung des Kontexts von 4096 auf 2048 Tokens spart etwa 2 GB bei einem 7–8B-Modell.

Für eine vollständige Aufschlüsselung der Modellgrößen und die Berechnung hinter VRAM-Schätzungen, siehe den vollständigen VRAM-Leitfaden für lokale LLMs. Speziell für die 7B-Tier, siehe wie viel RAM ein 7B-Modell benötigt.

Schnelle Antworten zum Thema VRAM

Reichen 8 GB VRAM für lokale LLMs aus?▾
Ja. 8 GB betreibt Llama 3.1 8B bei Q5_K_M mit etwa 18 Tokens pro Sekunde, mit Spielraum übrig. Die meisten alltäglichen Chat- und Coding-Aufgaben sind bei dieser Tier gut abgedeckt.
Kann ich ein 7B-Modell auf 4 GB VRAM betreiben?▾
Nein. Ein 7B-Modell bei Q4 benötigt etwa 4,5–5,5 GB VRAM (Parameteranzahl × 0,6, plus Kontext-Overhead). Die kleinste nutzbare Quantisierung überschreitet immer noch 4 GB. Siehe wie viel RAM ein 7B-Modell benötigt für die vollständige Aufschlüsselung.
Beeinflusst die Kontextfenstergröße den VRAM-Verbrauch?▾
Ja. Jede zusätzliche 1.000 Kontext-Tokens verbraucht etwa 250 MB VRAM bei einem 7B-Modell. Der Standard-2048-Token-Kontext verbraucht ~0,5 GB; 16.384 Tokens verbrauchen ~4 GB zusätzlich zum Modellgewicht.
Was sollte ich tun, wenn mein Modell mehr VRAM als erwartet verbraucht?▾
Setzen Sie --num-ctx 2048 in Ihrem Ollama-Befehl. Das reduziert den VRAM-Verbrauch bei 7B-Modellen um bis zu 2 GB, ohne die Modelldatei zu ändern.