Skip to main content
PromptQuorum
Startseite/Lokale LLMs/VRAM-Richtlinie: 7B=8GB, 70B=40GB (2026 Guide)
GPU Buying Guides

VRAM-Richtlinie: 7B=8GB, 70B=40GB (2026 Guide)

·7 min Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Für 7B-Modelle benötigen Sie 8 GB VRAM; für 13B-22B, 12-16 GB; für 70B, mindestens 40 GB. Stand Juli 2026 gelten diese Zahlen für Q4-Quantisierung (4-Bit) inklusive realistischem Overhead. Volle Präzision (FP32) benötigt 8× mehr VRAM und ist auf Consumer-GPUs kaum praktikabel. Die Formel: Modellgröße (Milliarden) × 0,5 Byte (Q4), plus 10-15% für KV-Cache und Laufzeit-Overhead.

VRAM-Richtlinie: 7B=8GB, 70B=40GB (2026 Guide)

Wichtigste Erkenntnisse

  • 7B-Modelle: Minimum 8 GB (Q4), komfortabel 10 GB (Q5), vollständig 14 GB.
  • 13B-Modelle: Minimum 12 GB (Q4), komfortabel 16 GB (Q5).
  • 70B-Modelle: Minimum 35-40 GB (Q4) -- erfordert 2× RTX 4090 oder A100.
  • Q4-Quantisierung: Reduziert VRAM um 87% gegenüber vollständiger Präzision, unter 1% Qualitätsverlust.
  • Apple Silicon: Einheitlicher Speicher ist vollständig für LLM-Inferenz verfügbar -- MacBook Pro M3 18 GB kann Llama3 13B Q4 ausführen.
  • RTX 4060 Ti 8 GB: 7B Q4 ist machbar, aber der Cache ist eng. RTX 4070 12 GB ist sicherer.
  • CPU-Inferenz: Möglich, aber GPU ist 20-40× schneller -- praktisch wird ein GPU mit mindestens 8 GB empfohlen.

VRAM-Berechnungsformel für lokale LLMs

VRAM erforderlich = (Modellparameter in Milliarden × Bits pro Gewicht) ÷ 8 + (KV-Cache + Laufzeit-Overhead)

Beispiel: Llama3 7B Q4 = (7 × 4) ÷ 8 + 1,5 GB = 3,5 + 1,5 = 5 GB

Q4: 32-Bit-Werte werden auf 4 Bits komprimiert (8× Reduktion).

Q8: 32-Bit → 8-Bit (4× Reduktion), nahezu vollständige Präzision.

FP32: Keine Kompression, vollständige Präzision, VRAM-intensiv.

KV-Cache: Proportional zur Sequenzlänge -- 128-Token-Ausgabe +1-2 GB, 2048-Token +5 GB.

VRAM nach Modellgröße

ModellgrößeFP32Q8Q5Q4Empfohlene GPU
3B12 GB3 GB2 GB1,5 GBCPU oder RTX 3060 (3GB)
7B28 GB7 GB4,5 GB3,5 GBRTX 4060 Ti (8GB), RTX 4070 (12GB)
13B52 GB13 GB8 GB7 GBRTX 4080 (16GB), RTX 6800 XT (16GB)
70B280 GB70 GB44 GB35-40 GBZwei RTX 4090 (24GB×2) oder A100 (80GB)
Qwen 3.6 35B-A3B (3B aktiv, MoE)*12 GB3 GB2 GB1,5 GBCPU oder RTX 3060 (3GB)
DeepSeek V4-Flash (13B aktiv / 284B gesamt, MoE)*52 GB13 GB8 GB7 GBRTX 4060 Ti (8GB), RTX 4070 (12GB)
Llama 4 Scout (17B aktiv / 109B gesamt, MoE)†436 GB109 GB68 GB55 GBZwei RTX 4090 (48 GB) — passt in 24 GB nur bei 1,78-Bit (~20 tok/s)
gpt-oss:20b (3,6B aktiv / 21B gesamt, MoE)*84 GB21 GB13 GB12 GBRTX 5070 12GB oder jede 16-GB-GPU
Kimi K2.6 (32B aktiv / 1T gesamt, MoE)*128 GB32 GB20 GB16 GBZwei RTX 4090 (24GB×2) oder A100 (80GB)
Kontext (KV-Cache)+40 GB @ 2048 Token+10 GB @ 2048 Token+6 GB @ 2048 Token+3-5 GB @ 2048 TokenDurch Ollama-Kontextlänge und top_k verwaltet

* MoE-Modelle: VRAM wird nur aus aktiven Parametern berechnet, nicht aus der Gesamtmodellgröße. † Llama 4 Scout hält alle 109B Parameter resident, daher benötigt es ~55 GB bei Q4 trotz nur 17B aktiver Parameter pro Token.

Faustregel: Modellgröße in Milliarden durch ~8 teilen, um Q4-VRAM in GB zu erhalten.
Faustregel: Modellgröße in Milliarden durch ~8 teilen, um Q4-VRAM in GB zu erhalten.

Bester lokaler LLM nach VRAM-Stufe

Die meisten kennen bereits die VRAM ihrer GPU und wollen die umgekehrte Suche: „Ich habe 12 GB -- was ist das beste Modell?" Nutzen Sie diese Tabelle statt der Formel.

📍 In einem Satz

Ordnen Sie die VRAM Ihrer GPU der größten Modellstufe zu, die bei Q4 passt, und schauen Sie dann in der Tabelle "VRAM nach Modellgröße" oben für das genaue Modell nach.

💬 In einfachen Worten

Wenn Sie bereits wissen, wie viel VRAM Ihre GPU hat, überspringen Sie die Modellgrößen-Rechnung -- finden Sie die VRAM Ihrer Karte in der Tabelle unten und nutzen Sie die daneben stehende Modellstufe.

VRAM-StufeBestes Modell (Q4)Beispiel-GPUsWas passt
4 GBLlama 3.2 3B oder Phi-3.5-mini (~1,5-2 GB)RTX 3050 4 GB, GTX 1650Nur 3B-Klasse -- 7B-Modelle laufen in OOM
6 GBQwen3 4B, oder Llama 3.1 8B bei aggressivem Q4 (~3-4 GB)RTX 2060 6 GB, RTX 3050 Ti4B komfortabel; 8B ist eng
8 GBLlama 3.3 8B oder Qwen3 8B (~3,5-5 GB) mit echtem PufferRTX 4060 Ti 8 GB, RTX 3070Der häufigste Sweet Spot für 7-8B-Modelle
12 GBQwen3 14B (~6,5 GB), oder 7-8B bei Q5/Q8 für höhere QualitätRTX 3060 12 GB, RTX 407014B komfortabel, Platz für größeren Kontext
16 GBQwen3 14B bei Q5/Q8, oder 22B-Klasse (Gemma, Qwen) bei Q4 (~11 GB)RTX 4060 Ti 16 GB, RTX 408022B ist die praktische Obergrenze bei dieser Stufe
24 GB22-32B komfortabel bei vollem Q8; 70B nur unter 4-Bit mit QualitätsverlustRTX 4090, RTX 309070B benötigt eigentlich ~35 GB -- diese Stufe reicht nicht ganz
32 GB22-32B in voller Präzision, oder als eine Karte in einem Dual-GPU-70B-SetupRTX 5090Reicht allein noch nicht für vollständiges 70B Q4 (~35 GB nötig)
48 GB70B-Modelle komfortabel bei Q4 (~35 GB), eng bei Q5 (~44 GB)2× RTX 4090, RTX 6000 AdaErste Stufe, die 70B ohne qualitätsmindernde Quantisierungstricks abdeckt

Dies sind Q4-Kaufziel-Werte mit realistischem Overhead -- siehe die Tabelle "VRAM nach Modellgröße" oben für die reinen Rechenminima pro Quantisierungsstufe.

MoE-Modelle benötigen deutlich weniger VRAM als ihre Größe vermuten lässt

Mixture-of-Experts-Modelle (MoE) teilen ihre Parameter auf viele „Experten"-Subnetze auf und aktivieren pro Token nur einen Bruchteil davon. Aktive Parameter senken den Rechenaufwand und beschleunigen die Inferenz, aber bei den meisten MoE-Modellen muss trotzdem jeder Experte in den VRAM geladen werden -- der Speicherbedarf richtet sich also nach den Gesamtparametern, nicht nach den aktiven.

Regel für dichte Modelle: VRAM = Gesamtparameter × Bytes pro Parameter

Regel für MoE-Modelle (Rechenleistung): Aktive Parameter bestimmen Tokens/Sekunde -- aber der VRAM skaliert weiterhin mit den geladenen Gesamtgewichten.

Beispiel: Llama 4 Scout hat 109B Gesamtparameter, davon nur 17B aktiv pro Token. Es läuft schnell für seine Größe, benötigt bei Q4 aber trotzdem ~55 GB VRAM, um alle Experten zu halten -- außerhalb der Reichweite einer einzelnen 24-GB-GPU, außer bei aggressiver 1,78-Bit-Quantisierung (~20 Tok/s auf einer RTX 4090).

Manche Laufzeitumgebungen können inaktive Experten in den System-RAM auslagern und tauschen so Geschwindigkeit gegen einen kleineren VRAM-Bedarf. Die zentrale Erkenntnis: Gehen Sie nicht davon aus, dass ein MoE-Modell in VRAM entsprechend seiner aktiven Parameter passt -- prüfen Sie die tatsächliche Größe auf der Festplatte bei Ihrer Quantisierungsstufe.

Wie reduziert Quantisierung VRAM-Anforderungen?

Quantisierung komprimiert Modellgewichte zu niedriger Präzision. Die Umwandlung von FP32 (32-Bit) auf Q4 (4-Bit) reduziert Werte um 87%.

Q4 (4-Bit): Standard für Consumer-GPUs. VRAM: 3,5× Reduktion. Qualität: Unter 1% Verlust. Für fast alle Aufgaben empfohlen.

Q5 (5-Bit): Ähnlich wie Q4, aber 2% bessere Genauigkeit. VRAM: 25% mehr, minimale Qualitätsverbesserung. Nur für fortgeschrittene Anwendungsfälle.

Q8 (8-Bit): Nahezu vollständige Präzision (<0,5% Verlust). VRAM-Reduktion: 4×. RTX 4080+ empfohlen.

FP32 (Vollständige Präzision): Alle Gewichte werden mit 32 Bit gespeichert. Auf Consumer-GPUs nicht praktikabel -- 70B FP32 benötigt 280 GB VRAM.

VRAM bestimmt die Modellgröße, aber das Prompt-Design bestimmt die Ausgabequalität. Techniken wie Chain-of-Thought und Few-Shot-Prompting können die Qualitätslücke zwischen kleineren und größeren Modellen schließen. Entdecken Sie das vollständige Prompt-Engineering-Toolkit, um mehr aus den Modellen herauszuholen, die Ihre Hardware unterstützt. Wenn Sie 12–16 GB VRAM haben und einen konkreten Coding-Workload zum Testen dieses Toolkits suchen, beschreibt GitHub Copilot durch ein lokales LLM ersetzen den Continue.dev + Ollama + Qwen3-Coder-Stack passend zu genau diesen VRAM-Stufen.

Q4 ist für die meisten Nutzer optimal — 87,5% kleiner als FP32 bei nur ~1% Genauigkeitsverlust.
Q4 ist für die meisten Nutzer optimal — 87,5% kleiner als FP32 bei nur ~1% Genauigkeitsverlust.

Batch-Größe und Multi-User-Inferenz

Batch-Größe ist die Anzahl der Text-Eingaben, die in einer Ausführung verarbeitet werden.

Single-User-Inferenz (batch=1): Eine Eingabeaufforderung auf einer GPU. VRAM: Nur Modellgröße + KV-Cache.

Beispiel: Llama3 7B Q4 = 3,5 GB (Modell) + 1,5 GB (KV-Cache) = 5 GB.

Batch-Verarbeitung (batch=4, 8, 16): Mehrere Eingaben gleichzeitig verarbeiten. VRAM: Linear steigend.

batch=4: ×4 VRAM (= 20 GB für 7B Q4). Durchsatz: ×3-3,5 (Parallelisierungsgewinn).

Batch-Inferenz ist wichtig für Multi-User-Server (3-5 Personen, gleichzeitige Anfragen). Für Single-User/Entwicklung nicht erforderlich.

KV-Cache (abhängig von Sequenzlänge):

VRAM-Overhead: Mehr als nur Modellgröße

Die Parametergröße des Modells ist nicht das gesamte VRAM-Anforderungs-Bild. Zusätzlicher Speicher ist erforderlich:

KV-Cache (Key-Value Cache): Das Modell muss vorherige Token „merken". Nebenprodukt des Transformer-Aufmerksamkeitsmechanismus.

  • Proportional zur Eingabe-Ausgabe-Länge.
  • 7B-Modell, 2048-Token-Kontext, batch=1: +2-4 GB.

Aktivierungen: Zwischenrechenergebnisse während der Inferenz.

  • Typischerweise 10-15% der Modellgröße.
  • 7B: +0,7-1,5 GB.

Laufzeit-Overhead: CUDA-Speicherpool, Framebuffer, OS-Reservierungen.

  • Typischerweise 0,5-1,5 GB.

LM Studio Hardware-Anforderungen

LM Studio führt GGUF-Modelle intern über llama.cpp aus, daher ist die VRAM-Rechnung identisch zu den Tabellen oben -- es kommt nur der eigene ~1-2 GB Laufzeit-/UI-Overhead hinzu.

  • Minimum: 8 GB System-RAM für kleine (3B) Modelle im reinen CPU-Betrieb. Eine dedizierte GPU ist optional, aber 10-20× schneller.
  • Empfohlen: 8 GB VRAM für komfortable 7-8B-Inferenz; 12 GB+ für 13-14B-Modelle.
  • GPU-Unterstützung: NVIDIA (CUDA), AMD (ROCm unter Linux, Vulkan unter Windows), Apple Silicon (Metal, Unified Memory zählt als VRAM).
  • Der Modell-Browser von LM Studio zeigt pro Modell einen Kompatibilitätsindikator (grün/gelb/rot) basierend auf Ihrer erkannten VRAM -- er markiert ein Modell schon vor dem Download, falls es nicht passt.

Nutzen Sie die VRAM-Stufentabelle oben, um eine Modellgröße zu wählen, und gleichen Sie diese dann mit dem Indikator von LM Studio für Ihre konkrete GPU ab.

Ollama Hardware-Anforderungen

Ollama läuft ebenfalls auf llama.cpp, daher entsprechen die VRAM-Anforderungen 1:1 den Tabellen oben -- es gibt keine separate „Ollama-Steuer" zusätzlich zum Modell selbst.

  • Minimum: 8 GB System-RAM für reine CPU-Inferenz von Modellen der 3B-Klasse.
  • GPU-Unterstützung: NVIDIA (CUDA 11+), AMD (ROCm -- die offiziell unterstützte Kartenliste ist enger als bei LM Studio), Apple Silicon (Metal via Unified Memory).
  • `ollama ps` zeigt die aktuelle VRAM-Nutzung pro geladenem Modell. `ollama run <modell> --verbose` gibt Ladezeit und Token-Durchsatz aus.
  • Passt ein Modell nicht vollständig, teilt Ollama automatisch die Schichten zwischen GPU und System-RAM auf, statt komplett zu scheitern -- rechnen Sie mit 30-50% Geschwindigkeitseinbußen beim ausgelagerten Teil (siehe Overhead oben).

Gleiche Regel wie bei LM Studio: die VRAM-Stufe Ihrer GPU bestimmt die Modellgröße, nicht umgekehrt.

Häufige Fehler

Missverständnis 1: „VRAM erforderlich = Modellgröße"

VRAM ist immer größer als die Modellgröße. 3,5 GB-Modell benötigt mindestens 5 GB. RTX 4060 Ti 8 GB ist sicher, aber RTX 3060 6 GB birgt Risiken.

Missverständnis 2: „Apple Silicon (M3) Speicher ist nicht das gleiche wie GPU VRAM"

Apple Silicon verwendet Unified Memory -- CPU und GPU teilen einen Speicherpool. M3 18 GB entspricht 18 GB GPU VRAM. Llama3 13B Q4 (~7 GB) kann auf M3 16 GB ausgeführt werden.

Missverständnis 3: „Quantisierung verlangsamt die Inferenz"

Tatsächlich: Q4 ist schneller als Q5/Q8. Niedrigere Speicherbandbreite, effizienterer Cache. Ollama: Q4 ist einige Prozentpunkte schneller.

Regionales Umfeld

EU und Deutschland (DSGVO + BSI)

Die DSGVO verlangt von Unternehmen, dass Modellgewichte und Trainingsdaten auf dem EU-Territorium gespeichert bleiben. Lokale LLM-Inferenz ist eine Compliance-Anforderung, nicht optional. Das BSI (Bundesamt für Sicherheit in der Informationstechnik) empfiehlt lokale Inferenz als Best Practice für Unternehmen mit sensiblen Daten.

Enterprise-Leitlinien für den deutschen Mittelstand:

  • 1-50 Nutzer: RTX 4070 Ti (12 GB) mit Llama3 13B Q4 (7-8 GB). Skalierbar mit Ollama im single-GPU-Modus.
  • 50-500 Nutzer: RTX A6000 (48 GB) oder Dual RTX 4080 (32 GB) für parallele Anfragen und Batch-Verarbeitung. Erfordert vLLM oder Text Generation WebUI.
  • 500+ Nutzer: A100 (80 GB) oder H100 (80 GB). Enterprise-Setup mit Load-Balancing über mehrere Server.

BSI-Sicherheitsempfehlungen:

  • ECC-GPUs (A6000, A100) für Speicherfehler-Detektion.
  • GPU-Speicher-Dumps verhindern durch physische Sicherheit oder Encrypted Memory (wenn verfügbar).
  • DSGVO-Audit für Modell-Abhängigkeiten und Training-Daten-Herkunft obligatorisch.

VRAM-Rechner

Wählen Sie Ihre Modellgröße und Quantisierung aus, um die VRAM-Anforderungen zu schätzen.

Popular Models

Base Model

6.50 GB

Context OH

1.50 GB

Batch OH

0.00 GB

System OH

1.00 GB

Total Minimum

9.00 GB

Recommended (with 25% safety margin)

11.25 GB

👉 Look for a GPU with at least 11.25 GB VRAM

Compatible GPUs

RTX 3060 (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4070 (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4070 Ti (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4080 (16 GB)

4.8 GB headroom

✅ Fits

RTX 4090 (24 GB)

12.8 GB headroom

✅ Fits

Mac mini M5 (16 GB) (16 GB)

4.8 GB headroom

✅ Fits

Mac mini M4 (16 GB) (16 GB)

4.8 GB headroom

✅ Fits

MacBook Pro (24 GB) (24 GB)

12.8 GB headroom

✅ Fits

M3 Max (36 GB) (36 GB)

24.8 GB headroom

✅ Fits

💡 Pro Tips:

  • Always use the "with safety margin" figure when buying a GPU
  • Q4 gives 90-95% quality with 25% size reduction. Q5 is better if you have room
  • Context overhead grows with conversation length. Budget 1-3 GB for typical usage
  • Batch size matters for multi-user APIs. Single-user chat can ignore batch overhead

📋 Share this configuration:

Loading...

Kann ein 3B-Modell auf meiner GPU laufen?

RTX 3060 (3 GB) oder CPU. Q4-Quantisierung benötigt 1,5-2 GB VRAM. Ollama, Llama.cpp, LM Studio unterstützen alle.

Ist RTX 4060 ausreichend für 7B Q4?

Knapp. RTX 4060 (8 GB) sollte 5 GB theoretisch verwalten, aber OS/Laufzeit-Overhead (0,5-1,5 GB) wird eng. RTX 4070 (12 GB) empfohlen.

Sind 12 GB für Llama3 13B ausreichend?

Ja, komfortabel. Ein 13B-Modell braucht bei Q4 rund 6,5 GB reine Gewichte, sodass 12 GB reichlich Puffer für KV-Cache und Kontext lassen. Bei Q5 oder Q8 wird es enger -- dort sind 16 GB sicherer.

Benötige ich 40 GB für ein 70B-Modell?

Bei Q4 ja -- realistisch rund 35-40 GB inklusive KV-Cache und System-Overhead. Bei Q5+ werden 44 GB oder mehr benötigt. 24-GB-GPUs reichen für ein echtes 70B-Modell nicht aus.

Reduziert höhere Batch-Größe VRAM für einzelne Inferenz?

Nein. Einzelne Inferenz verwendet immer batch=1. Batch-Größe hilft nur Durchsatz (Multi-User-Szenarios).

Was ist die präziseste Quantisierung?

Q8 nahezu unmerklicher Verlust. Q5 ~2% Verlust. Q4 ~1% Verlust. Für die meisten Fälle Q4 beste Balance.

Kann ich Teil des VRAM auf CPU-RAM auslagern?

Ja, über Layer-Splitting (NVLink). Llama.cpp und Ollama unterstützen es. Leistung sinkt 30-50%.

Was ist die minimale VRAM für lokale LLM-Ausführung?

4 GB VRAM mit 3B Q4-Modell -- Modell ~1,8 GB, KV-Cache hat Platz. Praktisches Minimum 8 GB VRAM + 7B Q4. Unter 6 GB OOM für die meisten 7B-Modelle.

Ist Apple Silicon VRAM dasselbe wie GPU VRAM?

Apple Silicon verwendet Unified Memory zwischen CPU/GPU gemeinsam -- ganzer Speicherpool verfügbar für Modell-Inferenz. M3 18 GB = GPU 18 GB VRAM. MacBook Pro M3 18 GB kann Llama3 13B Q4 (~7 GB) + Overhead ausführen.

Wie viel VRAM benötigt 7B bei verschiedenen Quantisierungen?

7B FP32: ~28 GB -- unpraktisch auf Consumer-GPUs. 7B Q8: ~7 GB -- passt auf RTX 4070 Ti 12 GB mit Puffer. 7B Q5: ~4,5 GB -- passt auf 8 GB GPU. 7B Q4: ~3,5 GB Modell + ~1,5 GB Overhead = ~5 GB -- passt auf 6 GB GPU eng, 8 GB komfortabel.

Was sind die VRAM-Anforderungen für DSGVO-konforme lokale Inferenz in Unternehmen?

Minimum RTX 4070 Ti (12 GB) für bis zu 50 Nutzer mit Llama3 13B Q4. Für 50-500 Nutzer RTX A6000 (48 GB) oder Dual RTX 4080 (32 GB). ECC-GPU empfohlen für Speicherfehler-Detektion. GPU-Speicher-Dumps müssen verhindert werden (Firmware/physische Sicherheit).

Welche GPU empfiehlt sich für einen Team-Server im deutschen Mittelstand?

RTX 4070 Ti (12 GB) für 1-50 Mitarbeiter. RTX A6000 (48 GB) oder Dual RTX 4080 (32 GB) für 50-500 Mitarbeiter. RTX 4070 Ti kann Llama3 13B Q4 + vLLM mit 3-5 gleichzeitigen Anfragen verwalten. Größere Teams benötigen A100 (80 GB) oder H100 und Enterprise-Clustering.

Was sind die Systemanforderungen von LM Studio für lokale LLMs?

LM Studio läuft auf llama.cpp, daher entspricht der VRAM-Bedarf genau den Modelltabellen auf dieser Seite, plus ~1-2 GB eigenem Laufzeit-Overhead. 8 GB VRAM sind komfortabel für 7-8B-Modelle; 12 GB+ für 13-14B.

Was sind die Hardware-Anforderungen von Ollama?

Ollama läuft ebenfalls auf llama.cpp, daher entspricht der VRAM-Bedarf identisch den Tabellen dieser Seite. Minimum 8 GB System-RAM für CPU-only-3B-Modelle; eine GPU mit 8 GB+ VRAM macht 7-8B-Modelle 10-20× schneller.

Weiterführende Literatur

  • /de/local-llms/best-local-llms-2026
  • /de/local-llms/how-to-run-ollama-locally
  • /de/local-llms/local-llm-hardware-guide-2026
  • /de/local-llms/best-amd-gpus-local-llm
  • /de/local-llms/local-llm-security-privacy-checklist
  • /de/local-llms/how-much-unified-memory-for-local-llm
  • /de/local-llms/running-70b-models-apple-silicon-m5-max
  • /de/local-llms/best-models-apple-silicon-2026
  • /de/local-llms/gpu-vs-cpu-vs-apple-silicon

Quellen

  • NVIDIA CUDA-Dokumentation: GPU-Speicherverwaltung, Tensor Cores, Compute Capability
  • Ollama-Dokumentation: VRAM-Anforderungen, Quantisierungsschemata, GPU-Kompatibilitätsmatrix
  • Llama.cpp GitHub: GGUF-Format, Q4/Q5/Q8-Implementierung, Speicher-Profilierung

Sie kennen Ihr VRAM-Budget. Wählen Sie jetzt die richtige GPU dafür.

Beste Budget-GPUs für lokale LLMs →

Hinweis zu Drittanbieter-Fakten

Dieser Artikel referenziert KI-Modelle, Benchmarks, Preise und Lizenzen von Drittanbietern. Die KI-Landschaft verändert sich schnell. Benchmark-Werte, Lizenzbedingungen, Modellnamen und API-Preise können sich zwischen dem Zeitpunkt der Erstellung und dem Zeitpunkt ändern, zu dem Sie dies lesen. Bevor Sie Bereitstellungs- oder Compliance-Entscheidungen auf Basis dieses Artikels treffen, überprüfen Sie aktuelle Zahlen bei der offiziellen Quelle jedes Anbieters: Hugging-Face-Modellkarten für Lizenzen und Benchmarks, Anbieter-Websites für API-Preise und EUR-Lex für den aktuellen DSGVO- und EU-KI-Gesetz-Text. Dieser Artikel spiegelt öffentlich verfügbare Informationen vom Mai 2026 wider.

Nutzen Sie PromptQuorum mit einem lokalen LLM, eigenen API-Schlüsseln oder beidem — Sie wählen das Backend.

PromptQuorum-Beta herunterladen →

← Zurück zu Lokale LLMs