Skip to main content
PromptQuorumBuilt for humans. Structured for AI.
Startseite/Lokale LLMs/VRAM-Richtlinie: 7B=4GB, 70B=42GB (2026 Guide)
GPU Buying Guides

VRAM-Richtlinie: 7B=4GB, 70B=42GB (2026 Guide)

·7 min Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Ein 7B-Modell benötigt etwa 4 GB VRAM für die Gewichte bei Q4 (4-Bit); 13B etwa 8 GB; 22B etwa 13 GB; 70B etwa 42 GB. Das sind reine Gewichtsgrößen -- rechnen Sie 1-2 GB Puffer für Kontext (KV-Cache) und System dazu, mehr bei langem Kontextfenster. Bei Q5 (5-Bit) liegen die Werte etwa 15-20% höher, bei Q8 (8-Bit) etwa 75%. Volle Präzision (FP32) benötigt das 4-fache der Q4-Größe und ist auf Consumer-GPUs kaum praktikabel. Die Formel: Modellgröße (Milliarden) × Byte pro Parameter (≈0,6 für Q4, ≈0,7 für Q5, ≈1,05 für Q8) -- verifiziert anhand echter GGUF-Dateigrößen auf Hugging Face.

VRAM-Richtlinie: 7B=4GB, 70B=42GB (2026 Guide)

Wichtigste Erkenntnisse

  • 7B-Modelle: ~4 GB Gewichte bei Q4, ~5 GB bei Q5, ~7 GB bei Q8. 1-2 GB Puffer für eine realistische 6-8 GB-Empfehlung.
  • 13B-Modelle: ~8 GB Gewichte bei Q4, ~9 GB bei Q5. 12 GB VRAM ist komfortabel, nicht "knapp ausreichend".
  • 70B-Modelle: ~42 GB Gewichte (Q4) -- erfordert 2× RTX 4090 oder eine 48 GB+ Karte.
  • Q4-Quantisierung: Reduziert VRAM um 87% gegenüber vollständiger Präzision, unter 1% Qualitätsverlust.
  • Apple Silicon: Einheitlicher Speicher ist vollständig für LLM-Inferenz verfügbar -- MacBook Pro M3 18 GB kann Llama3 13B Q4 ausführen.
  • RTX 4060 Ti 8 GB: 7B Q4 ist machbar, aber der Cache ist eng. RTX 4070 12 GB ist sicherer.
  • CPU-Inferenz: Möglich, aber GPU ist 20-40× schneller -- praktisch wird ein GPU mit mindestens 8 GB empfohlen.

📍 In einem Satz

Bei 4-Bit-Quantisierung rechnen Sie mit 0,6 GB VRAM je Milliarde Parameter — ein 7B-Modell passt in 5 GB, ein 70B-Modell braucht 42 GB.

💬 In einfachen Worten

Die Faustregel ist einfach: Milliarden Parameter mal 0,6 ergibt den Bedarf in Gigabyte bei 4 Bit, plus 1 bis 2 GB Reserve für Kontext und Betriebssystem. Ein 13B-Modell braucht rund 8 GB, ein 22B-Modell rund 13 GB.

VRAM-Berechnungsformel für lokale LLMs

VRAM erforderlich = Modellparameter in Milliarden × Byte pro Parameter + (KV-Cache + Laufzeit-Overhead)

Byte pro Parameter, verifiziert anhand echter GGUF-Dateien: ~1,05 (Q8), ~0,7 (Q5), ~0,6 (Q4).

Beispiel: Llama-3 7B Q4 = 7 × 0,6 + 1,5 GB Overhead = 4,2 + 1,5 ≈ 5,7 GB (echtes Llama-2-7B Q4_K_M GGUF = 4,08 GB Gewichte)

Beispiel: Llama-3.3 70B Q4 = 70 × 0,6 = 42 GB Gewichte (echtes Llama-3.3-70B Q4_K_M GGUF = 42,52 GB)

Q4: real ~0,6 Byte/Parameter (nicht die theoretischen 0,5 Byte -- reale Formate wie Q4_K_M haben etwas Overhead).

Q8: real ~1,05 Byte/Parameter.

FP32: Keine Kompression, vollständige Präzision, 4 Byte/Parameter, VRAM-intensiv.

KV-Cache: Proportional zur Sequenzlänge -- 128-Token-Ausgabe +1-2 GB, 2048-Token +5 GB.

VRAM nach Modellgröße

Modellgröße
FP32
Q8
Q5
Q4
Empfohlene GPU
3B12 GB3 GB2 GB2 GBRTX 3050 4GB oder RTX 2060 6GB
7B28 GB7 GB5 GB4 GBRTX 4060 (8GB), RTX 3060 (12GB)
13B52 GB14 GB9 GB8 GBRTX 3060 (12GB), RTX 4070 (12GB)
70B280 GB74 GB50 GB42 GBZwei RTX 4090 (24GB×2) oder A100 (80GB)
Qwen 3.6 35B-A3B (3B aktiv, MoE)*12 GB3 GB2 GB2 GBRTX 2060 6GB oder RTX 5070 12GB
DeepSeek V4-Flash (13B aktiv / 284B gesamt, MoE)*52 GB14 GB9 GB8 GBRTX 3060 (12GB), RTX 4070 (12GB)
Llama 4 Scout (17B aktiv / 109B gesamt, MoE)†436 GB114 GB76 GB55 GBZwei RTX 4090 (48 GB) — passt in 24 GB nur bei 1,78-Bit (~20 tok/s)
gpt-oss:20b (3,6B aktiv / 21B gesamt, MoE)*84 GB21 GB13 GB12 GBRTX 5070 12GB oder jede 16-GB-GPU
Kimi K2.6 (32B aktiv / 1T gesamt, MoE)*128 GB34 GB22 GB19 GBZwei RTX 4090 oder RTX 5090 32GB (nur Q4)
Kontext (KV-Cache)+40 GB @ 2048 Token+10 GB @ 2048 Token+6 GB @ 2048 Token+3-5 GB @ 2048 TokenDurch Ollama-Kontextlänge und top_k verwaltet

Zahlen sind reine Gewichtsgrößen, verifiziert anhand echter GGUF-Dateigrößen auf Hugging Face (z. B. Llama-2-7B Q4_K_M = 4,08 GB, Mistral-Small-24B Q4_K_M = 14,33 GB, Llama-3.3-70B Q4_K_M = 42,52 GB) -- rechnen Sie 1-2 GB Puffer für Kontext/KV-Cache dazu. * MoE-Modelle: VRAM wird nur aus aktiven Parametern berechnet, nicht aus der Gesamtmodellgröße. † Llama 4 Scout hält alle 109B Parameter resident, daher benötigt es ~55 GB bei Q4 trotz nur 17B aktiver Parameter pro Token.

Faustregel: Modellgröße in Milliarden mit 0,6 multiplizieren, um Q4-VRAM in GB zu erhalten, dann 1-2 GB Puffer addieren.
Faustregel: Modellgröße in Milliarden mit 0,6 multiplizieren, um Q4-VRAM in GB zu erhalten, dann 1-2 GB Puffer addieren.

Wie reduziert Quantisierung VRAM-Anforderungen?

Quantisierung komprimiert Modellgewichte zu niedriger Präzision. Die Umwandlung von FP32 (32-Bit) auf Q4 (4-Bit) reduziert Werte um 87%.

Q4 (4-Bit): Standard für Consumer-GPUs. VRAM: 3,5× Reduktion. Qualität: Unter 1% Verlust. Für fast alle Aufgaben empfohlen.

Q5 (5-Bit): Ähnlich wie Q4, aber 2% bessere Genauigkeit. VRAM: 25% mehr, minimale Qualitätsverbesserung. Nur für fortgeschrittene Anwendungsfälle.

Q8 (8-Bit): Nahezu vollständige Präzision (<0,5% Verlust). VRAM-Reduktion: 4×. RTX 4080+ empfohlen.

FP32 (Vollständige Präzision): Alle Gewichte werden mit 32 Bit gespeichert. Auf Consumer-GPUs nicht praktikabel -- 70B FP32 benötigt 280 GB VRAM.

VRAM bestimmt die Modellgröße, aber das Prompt-Design bestimmt die Ausgabequalität. Techniken wie Chain-of-Thought und Few-Shot-Prompting können die Qualitätslücke zwischen kleineren und größeren Modellen schließen. Entdecken Sie das vollständige Prompt-Engineering-Toolkit, um mehr aus den Modellen herauszuholen, die Ihre Hardware unterstützt. Wenn Sie 12–16 GB VRAM haben und einen konkreten Coding-Workload zum Testen dieses Toolkits suchen, beschreibt GitHub Copilot durch ein lokales LLM ersetzen den Continue.dev + Ollama + Qwen3-Coder-Stack passend zu genau diesen VRAM-Stufen.

Q4 ist für die meisten Nutzer optimal — 87,5% kleiner als FP32 bei nur ~1% Genauigkeitsverlust.
Q4 ist für die meisten Nutzer optimal — 87,5% kleiner als FP32 bei nur ~1% Genauigkeitsverlust.

Batch-Größe und Multi-User-Inferenz

Batch-Größe ist die Anzahl der Text-Eingaben, die in einer Ausführung verarbeitet werden.

Single-User-Inferenz (batch=1): Eine Eingabeaufforderung auf einer GPU. VRAM: Nur Modellgröße + KV-Cache.

Beispiel: Llama3 7B Q4 = 3,5 GB (Modell) + 1,5 GB (KV-Cache) = 5 GB.

Batch-Verarbeitung (batch=4, 8, 16): Mehrere Eingaben gleichzeitig verarbeiten. VRAM: Linear steigend.

batch=4: ×4 VRAM (= 20 GB für 7B Q4). Durchsatz: ×3-3,5 (Parallelisierungsgewinn).

Batch-Inferenz ist wichtig für Multi-User-Server (3-5 Personen, gleichzeitige Anfragen). Für Single-User/Entwicklung nicht erforderlich.

KV-Cache (abhängig von Sequenzlänge):

VRAM-Overhead: Mehr als nur Modellgröße

Die Parametergröße des Modells ist nicht das gesamte VRAM-Anforderungs-Bild. Zusätzlicher Speicher ist erforderlich:

KV-Cache (Key-Value Cache): Das Modell muss vorherige Token „merken". Nebenprodukt des Transformer-Aufmerksamkeitsmechanismus.

  • Proportional zur Eingabe-Ausgabe-Länge.
  • 7B-Modell, 2048-Token-Kontext, batch=1: +2-4 GB.

Aktivierungen: Zwischenrechenergebnisse während der Inferenz.

  • Typischerweise 10-15% der Modellgröße.
  • 7B: +0,7-1,5 GB.

Laufzeit-Overhead: CUDA-Speicherpool, Framebuffer, OS-Reservierungen.

  • Typischerweise 0,5-1,5 GB.

Häufige Fehler

Missverständnis 1: „VRAM erforderlich = Modellgröße"

VRAM ist immer größer als die Modellgröße. Ein 4 GB-Modell (7B Q4) benötigt real eher 5-6 GB mit Puffer. RTX 4060 8 GB ist sicher, aber RTX 3060 6 GB kann eng werden.

Missverständnis 2: „Apple Silicon (M3) Speicher ist nicht das gleiche wie GPU VRAM"

Apple Silicon verwendet Unified Memory -- CPU und GPU teilen einen Speicherpool. M3 18 GB entspricht 18 GB GPU VRAM. Llama3 13B Q4 (~7 GB) kann auf M3 16 GB ausgeführt werden.

Missverständnis 3: „Quantisierung verlangsamt die Inferenz"

Tatsächlich: Q4 ist schneller als Q5/Q8. Niedrigere Speicherbandbreite, effizienterer Cache. Ollama: Q4 ist einige Prozentpunkte schneller.

Regionales Umfeld

EU und Deutschland (DSGVO + BSI)

Die DSGVO verlangt von Unternehmen, dass Modellgewichte und Trainingsdaten auf dem EU-Territorium gespeichert bleiben. Lokale LLM-Inferenz ist eine Compliance-Anforderung, nicht optional. Das BSI (Bundesamt für Sicherheit in der Informationstechnik) empfiehlt lokale Inferenz als Best Practice für Unternehmen mit sensiblen Daten.

Enterprise-Leitlinien für den deutschen Mittelstand:

  • 1-50 Nutzer: RTX 4070 Ti (12 GB) mit Llama3 13B Q4 (7-8 GB). Skalierbar mit Ollama im single-GPU-Modus.
  • 50-500 Nutzer: RTX A6000 (48 GB) oder Dual RTX 4080 (32 GB) für parallele Anfragen und Batch-Verarbeitung. Erfordert vLLM oder Text Generation WebUI.
  • 500+ Nutzer: A100 (80 GB) oder H100 (80 GB). Enterprise-Setup mit Load-Balancing über mehrere Server.

BSI-Sicherheitsempfehlungen:

  • ECC-GPUs (A6000, A100) für Speicherfehler-Detektion.
  • GPU-Speicher-Dumps verhindern durch physische Sicherheit oder Encrypted Memory (wenn verfügbar).
  • DSGVO-Audit für Modell-Abhängigkeiten und Training-Daten-Herkunft obligatorisch.

VRAM-Rechner

Wählen Sie Ihre Modellgröße und Quantisierung aus, um die VRAM-Anforderungen zu schätzen.

Popular Models

Base Model

6.50 GB

Context OH

1.50 GB

Batch OH

0.00 GB

System OH

1.00 GB

Total Minimum

9.00 GB

Recommended (with 25% safety margin)

11.25 GB

👉 Look for a GPU with at least 11.25 GB VRAM

Compatible GPUs

RTX 3060 (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4060 Ti (16 GB)

4.8 GB headroom

✅ Fits

RTX 4070 Ti Super (16 GB)

4.8 GB headroom

✅ Fits

RTX 4080 Super (16 GB)

4.8 GB headroom

✅ Fits

RTX 4090 (24 GB)

12.8 GB headroom

✅ Fits

RTX 5090 (32 GB)

20.8 GB headroom

✅ Fits

Mac Mini M6 (32 GB) (32 GB)

20.8 GB headroom

✅ Fits

Mac Mini M5 Pro (64 GB) (64 GB)

52.8 GB headroom

✅ Fits

Mac Studio M5 Max (128 GB) (128 GB)

116.8 GB headroom

✅ Fits

Mac Studio M5 Ultra (96 GB+) (96 GB)

84.8 GB headroom

✅ Fits

💡 Pro Tips:

  • Always use the "with safety margin" figure when buying a GPU
  • Q4 gives 90-95% quality with 25% size reduction. Q5 is better if you have room
  • Context overhead grows with conversation length. Budget 1-3 GB for typical usage
  • Batch size matters for multi-user APIs. Single-user chat can ignore batch overhead

📋 Share this configuration:

Loading...

Kann ein 3B-Modell auf meiner GPU laufen?

RTX 3060 (3 GB) oder CPU. Q4-Quantisierung benötigt 1,5-2 GB VRAM. Ollama, Llama.cpp, LM Studio unterstützen alle.

Ist RTX 4060 ausreichend für 7B Q4?

Knapp. RTX 4060 (8 GB) sollte 5 GB theoretisch verwalten, aber OS/Laufzeit-Overhead (0,5-1,5 GB) wird eng. RTX 4070 (12 GB) empfohlen.

Sind 12 GB für Llama3 13B ausreichend?

Ja, deutlich. Ein 13B-Modell braucht bei Q4 nur etwa 8 GB, 12 GB lässt also echten Puffer. Bei Q5 (~9 GB) ist es noch komfortabel; bei Q8 (~14 GB) wird es eng.

Benötige ich 24 GB für ein 70B-Modell?

Nein, aber Sie brauchen fast so viel. Ein 70B-Modell benötigt etwa 42 GB bei Q4 allein für die Gewichte. Bei Q5+ sind es 50 GB+. 24 GB reichen bei keiner Quantisierungsstufe.

Reduziert höhere Batch-Größe VRAM für einzelne Inferenz?

Nein. Einzelne Inferenz verwendet immer batch=1. Batch-Größe hilft nur Durchsatz (Multi-User-Szenarios).

Was ist die präziseste Quantisierung?

Q8 nahezu unmerklicher Verlust. Q5 ~2% Verlust. Q4 ~1% Verlust. Für die meisten Fälle Q4 beste Balance.

Kann ich Teil des VRAM auf CPU-RAM auslagern?

Ja, über Layer-Splitting (NVLink). Llama.cpp und Ollama unterstützen es. Leistung sinkt 30-50%.

Was ist die minimale VRAM für lokale LLM-Ausführung?

4 GB VRAM mit 3B Q4-Modell -- Modell ~1,8 GB, KV-Cache hat Platz. Praktisches Minimum 8 GB VRAM + 7B Q4. Unter 6 GB OOM für die meisten 7B-Modelle.

Ist Apple Silicon VRAM dasselbe wie GPU VRAM?

Apple Silicon verwendet Unified Memory zwischen CPU/GPU gemeinsam -- ganzer Speicherpool verfügbar für Modell-Inferenz. M3 18 GB = GPU 18 GB VRAM. MacBook Pro M3 18 GB kann Llama3 13B Q4 (~7 GB) + Overhead ausführen.

Wie viel VRAM benötigt 7B bei verschiedenen Quantisierungen?

7B FP32: ~28 GB -- unpraktisch auf Consumer-GPUs. 7B Q8: ~7 GB -- passt auf RTX 4070 Ti 12 GB mit Puffer. 7B Q5: ~5 GB -- passt auf 8 GB GPU. 7B Q4: ~4 GB Gewichte + ~1-2 GB Overhead = ~5-6 GB -- passt auf 6 GB GPU eng, 8 GB komfortabel.

Was sind die VRAM-Anforderungen für DSGVO-konforme lokale Inferenz in Unternehmen?

Minimum RTX 4070 Ti (12 GB) für bis zu 50 Nutzer mit Llama3 13B Q4. Für 50-500 Nutzer RTX A6000 (48 GB) oder Dual RTX 4080 (32 GB). ECC-GPU empfohlen für Speicherfehler-Detektion. GPU-Speicher-Dumps müssen verhindert werden (Firmware/physische Sicherheit).

Welche GPU empfiehlt sich für einen Team-Server im deutschen Mittelstand?

RTX 4070 Ti (12 GB) für 1-50 Mitarbeiter. RTX A6000 (48 GB) oder Dual RTX 4080 (32 GB) für 50-500 Mitarbeiter. RTX 4070 Ti kann Llama3 13B Q4 + vLLM mit 3-5 gleichzeitigen Anfragen verwalten. Größere Teams benötigen A100 (80 GB) oder H100 und Enterprise-Clustering.

Quellen

  • NVIDIA CUDA-Dokumentation: GPU-Speicherverwaltung, Tensor Cores, Compute Capability
  • Ollama-Dokumentation: VRAM-Anforderungen, Quantisierungsschemata, GPU-Kompatibilitätsmatrix
  • Llama.cpp GitHub: GGUF-Format, Q4/Q5/Q8-Implementierung, Speicher-Profilierung

Sie kennen Ihr VRAM-Budget. Wählen Sie jetzt die richtige GPU dafür.

Beste Budget-GPUs für lokale LLMs →

Hinweis zu Drittanbieter-Fakten

Dieser Artikel referenziert KI-Modelle, Benchmarks, Preise und Lizenzen von Drittanbietern. Die KI-Landschaft verändert sich schnell. Benchmark-Werte, Lizenzbedingungen, Modellnamen und API-Preise können sich zwischen dem Zeitpunkt der Erstellung und dem Zeitpunkt ändern, zu dem Sie dies lesen. Bevor Sie Bereitstellungs- oder Compliance-Entscheidungen auf Basis dieses Artikels treffen, überprüfen Sie aktuelle Zahlen bei der offiziellen Quelle jedes Anbieters: Hugging-Face-Modellkarten für Lizenzen und Benchmarks, Anbieter-Websites für API-Preise und EUR-Lex für den aktuellen DSGVO- und EU-KI-Gesetz-Text.

Nutzen Sie PromptQuorum mit einem lokalen LLM, eigenen API-Schlüsseln oder beidem — Sie wählen das Backend.

PromptQuorum-Beta herunterladen →

← Zurück zu Lokale LLMs