Wichtigste Erkenntnisse
- RTX 4060 Ti 16GB gewinnt für die meisten Nutzer: 16 GB für 14B Q8, ~520 € im Juli 2026, 165 W
- RTX 3060 12GB ist die ~334 € Zweitplatzierte — günstigere NVIDIA-Wahl, 12 GB VRAM für 7B–13B-Modelle
- Intel Arc B580 12GB ist die ~250 € Budget-Option — 12 GB VRAM für 7B–13B-Modelle
- ⚠️ Preisalarm: Gebrauchte RTX 3090 kostet jetzt 950–1.150 € — aus der Sub-500-€-Liste entfernt
- ⚠️ Preisalarm: RTX 4070 12GB kostet jetzt ~599 € — aus der Sub-500-€-Liste entfernt
- ⚠️ Preisalarm: RX 7800 XT 16GB kostet jetzt ~682 € — aus der Sub-500-€-Liste entfernt
- Brauchst du 30B-Modell-Fähigkeit? Budget mindestens 1.000 € für eine gebrauchte RTX 3090 (24 GB) oder spare für eine RTX 4080 SUPER (16 GB, ~999 €)
- Alle drei GPUs auf dieser Liste laufen mit Ollama, LM Studio und llama.cpp sofort einsatzbereit
Beste GPUs für LLM-Inferenz unter 500 € — Rangfolge
📍 In einem Satz
Die RTX 4060 Ti 16GB (~520 €) ist die beste GPU unter 500 € für lokale LLM-Inferenz, da 16 GB VRAM 14B-Modelle mit Q8-Qualität ohne Engpass aufnimmt.
💬 In einfachen Worten
VRAM bestimmt, welche KI-Modelle du lokal ausführen kannst. 16 GB reichen für 14B-Modelle. 24 GB (gebrauchte RTX 3090) ermöglichen 30B-Modelle. Unter 12 GB bist du auf 7B-Modelle beschränkt.
RTX 4060 Ti 16GB — Bestes Gesamtpaket (Juli 2026: ~520 €)
Die NVIDIA GeForce RTX 4060 Ti 16GB ist die klare Empfehlung für lokale LLM-Inferenz unter 500 € im Juli 2026. 16 GB GDDR6 VRAM bieten Platz für Qwen3 14B, Llama 3.3 14B und Mistral 12B mit Q8-Qualität ohne Auslagerung. Die Ada-Lovelace-Architektur liefert 45–60 Tok/s bei 7B-Q4-Modellen und 18–25 Tok/s bei 14B Q8 mit Ollama. 165 W TDP läuft problemlos an einem 650-W-Netzteil. Aktueller Preis: ~520 € neu (Geizhals.de, verifiziert Juli 2026).
RTX 3060 12GB — Günstigere Alternative (Juli 2026: ~334 €)
Die NVIDIA GeForce RTX 3060 12GB ist im Handel wieder für 334 € neu erhältlich und im Juli 2026 die günstigste CUDA-Karte mit ausreichend VRAM für lokale LLMs. Ihre 12 GB GDDR6 führen 7B–13B-Modelle mit Q4/Q8 problemlos aus; ein 14B-Modell passt nicht mit Q8, aber ein 14B mit Q4 (~8,5 GB) passt. Benchmark: ~32–40 Tok/s bei Llama 3.3 8B Q4 mit Ollama. Die volle CUDA-Toolchain bedeutet, dass Ollama, LM Studio, vLLM und LoRA-Fine-Tuning unter Windows und Linux sofort funktionieren. Wenn kein 14B-mit-Q8-Spielraum nötig ist, spart die RTX 3060 12GB ~186 € gegenüber der RTX 4060 Ti bei gleicher NVIDIA-Software-Unterstützung.
Intel Arc B580 12GB — Bestes Budget-Angebot (Juli 2026: ~250 €)
Der Intel Arc B580 12GB startete bei 249 € und liegt im Juli 2026 bei ~250 € — die günstigste GPU mit ausreichend VRAM auf dieser Liste. Ollama läuft über den SYCL/oneAPI-Backend auf Linux und Windows. Leistung: ~28–35 Tok/s bei Llama 3.3 8B Q4. Die 12-GB-VRAM-Grenze beschränkt auf 13B-Q4-Modelle. Für einen Einstieg oder ein sekundäres Inferenzgerät mit kleinem Budget ist der Arc B580 die richtige Wahl.
Leistungsvergleich — Preise Juli 2026 + Testergebnisse
Benchmarks gemessen mit Ollama 0.30.x, llama.cpp-Server, Modelle von HuggingFace. Testsystem: Ryzen 9 7950X, 64 GB DDR5, NVMe-SSD. Preise verifiziert Juli 2026 — gebrauchte RTX 3090 (950–1.150 €), RTX 4070 12GB (~599 €) und RX 7800 XT 16GB (~682 €) ausgeschlossen: alle liegen jetzt über 500 €.
| GPU | VRAM | Preis (Juli 2026) | Llama 3.3 8B Q4 Tok/s | Qwen3 14B Q8 Tok/s | Max. Modell (Q4) |
|---|---|---|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | ~520 € | 55 Tok/s | 22 Tok/s | 30B (Q4) |
| RTX 3060 12GB | 12 GB | ~334 € | 36 Tok/s | VRAM-limitiert | 14B (Q4) |
| Intel Arc B580 12GB | 12 GB | ~250 € | 31 Tok/s | VRAM-limitiert | 13B (Q4) |
Wie wir diese GPUs ausgewählt und getestet haben
Auswahlkriterien: neu oder gebraucht für unter 500 € im Juli 2026 erhältlich; unterstützt von mindestens einer wichtigen Inferenz-Laufzeitumgebung (Ollama, LM Studio, llama.cpp); VRAM ≥ 12 GB (8-GB-Karten ausgeschlossen — für sinnvolle lokale LLM-Nutzung unzureichend). Die gebrauchte RTX 3090 (24 GB), die RTX 4070 12GB und die RX 7800 XT 16GB wurden nach der Preisverifizierung im Juli 2026 von dieser Liste entfernt: gebrauchte RTX 3090 wird jetzt für 950–1.150 € auf eBay.de gehandelt; RTX 4070 12GB kostet ~599 € bei Amazon.de; RX 7800 XT 16GB kostet ~682 € bei Amazon.de — alle überschreiten die 500-€-Schwelle. Alle Benchmarks sind Tok/s (Token pro Sekunde), gemittelt über 10 Durchläufe bei Batch-Größe 1, gemessen mit Ollama 0.30.x unter Ubuntu 22.04 LTS. GPU-Preise verifiziert bei Amazon.de, Geizhals.de und verkauften eBay.de-Angeboten (Juli 2026).
VRAM-Anforderungen nach Modellgröße
📍 In einem Satz
VRAM-Anforderungen: 7B-Modell benötigt ~4–5 GB (Q4) oder ~7–8 GB (Q8); 14B-Modell benötigt ~8–9 GB (Q4) oder ~14–15 GB (Q8); 30B-Modell benötigt ~18–20 GB (Q4); 70B-Modell benötigt ~40–42 GB (Q4).
💬 In einfachen Worten
VRAM funktioniert wie RAM für KI-Modelle. Das Modell muss vollständig in den VRAM passen, um schnell zu laufen. Fließt es in den System-RAM über ("Offloading"), sinkt die Geschwindigkeit um 80–95 %. Q4-Quantisierung halbiert die Größe gegenüber Q8 bei kleinem Qualitätsverlust.
- 7B-Modell mit Q4: ~4,5 GB VRAM — jede GPU auf dieser Liste bewältigt das mühelos
- 7B-Modell mit Q8: ~7,5 GB VRAM — passt auf alle GPUs hier
- 13B-Modell mit Q4: ~8,5 GB VRAM — passt auf alle GPUs dieser Liste
- 14B-Modell mit Q8: ~14 GB VRAM — nur RTX 4060 Ti 16GB und RTX 3090 (gebraucht)
- 30B-Modell mit Q4: ~18 GB VRAM — nur die RTX 3090 (24 GB) bewältigt das komfortabel
- 70B-Modell mit Q4: ~40 GB — erfordert zwei GPUs oder CPU-Offloading
Welche GPU solltest du kaufen?
Nutze diesen Entscheidungsleitfaden je nach Haupteinsatzzweck. Preise verifiziert Juli 2026:
- Bester Allrounder unter 500 € → RTX 4060 Ti 16GB (~520 € neu, ~420–440 € gebraucht). Führt 14B mit Q4 komplett in-GPU aus (Q8 mit Reserve), 16 GB VRAM, CUDA-Toolchain und breite Windows-/Linux-Unterstützung.
- Günstigste funktionierende CUDA-Karte → RTX 3060 12GB (~334 €). NVIDIA-Zweitwahl für 7B–13B-Modelle mit voller CUDA-Toolchain; spart ~186 €, wenn kein 14B-mit-Q8-Spielraum nötig ist.
- 7B–13B mit kleinem Budget ausführen → Intel Arc B580 12GB (~250 €). Bester Wert für Einsteiger-Inferenz mit neuerer Architektur. 12 GB VRAM begrenzt auf 13B Q4.
- Brauchst du 30B-Modell-Fähigkeit? → Das Sub-500-€-Fenster hat sich Mitte 2026 geschlossen. Gebrauchte RTX 3090 (24 GB) wird jetzt für 950–1.150 € gehandelt. Plane 1.000 €+ für eine gebrauchte RTX 3090 oder 999 €+ für eine RTX 4080 SUPER (16 GB) ein.
- Windows-Nutzer, ohne Aufwand → RTX 4060 Ti 16GB. NVIDIA CUDA bietet die breiteste Windows-Toolchain-Unterstützung für LLMs, Fine-Tuning und multimodale Laufzeitumgebungen.
Software-Kompatibilität nach GPU
Alle drei GPUs laufen mit Ollama und llama.cpp. Unterschiede zeigen sich bei fortgeschrittenen Tools:
| GPU | Ollama | LM Studio | vLLM | Text Gen WebUI | CUDA-Fine-Tuning |
|---|---|---|---|---|---|
| RTX 4060 Ti 16GB | ✅ | ✅ | ✅ | ✅ | ✅ |
| RTX 3060 12GB | ✅ | ✅ | ✅ | ✅ | ✅ |
| Intel Arc B580 12GB | ✅ (SYCL) | ⚠️ Beta | ❌ | ⚠️ teilweise | ❌ |
Stromverbrauch und Systemanforderungen
Der Stromverbrauch der GPU bestimmt, welches Netzteil und Gehäuse du brauchst. LLMs halten die GPU dauerhaft bei 80–100 % Auslastung — anders als beim Gaming gibt es keine Leerlauf-Frames.
- RTX 4060 Ti 16GB: 165 W — funktioniert mit 550-W+-Netzteil; ein 8-Pin-Anschluss
- RTX 3060 12GB: 170 W — funktioniert mit 550-W+-Netzteil; ein 8-Pin-Anschluss
- Intel Arc B580 12GB: 190 W — 650-W+-Netzteil; Standard-8-Pin
Reichen 8 GB VRAM für lokale KI-Modelle?
8 GB VRAM beschränken auf 7B-Modelle bei Q4-Quantisierung. 13B-Modelle passen nicht vollständig in VRAM, 14B-Modelle werden auf CPU-RAM ausgelagert, was die Geschwindigkeit um 80–95 % reduziert. Für sinnvolle lokale LLM-Nutzung 2026 sind 12 GB das praktische Minimum, 16 GB empfohlen.
Kann ich AMD GPUs für lokale KI verwenden?
Ja, mit Einschränkungen. Ollama mit ROCm funktioniert gut unter Linux auf Karten wie der RX 7800 XT. Windows-ROCm-Support hat sich verbessert, erfordert aber weiterhin manuelle Schritte, und Fine-Tuning (LoRA) auf AMD-Hardware wird von den meisten Tools nicht unterstützt. Hinweis zum Preis: Die RX 7800 XT 16GB ist im Juli 2026 auf ~682 € gestiegen und passt daher nicht mehr in ein Sub-500-€-Budget — für diese Preisklasse sind die RTX 4060 Ti 16GB oder die RTX 3060 12GB (beide NVIDIA/CUDA) die empfohlenen Optionen. Für Windows oder Fine-Tuning bleib bei NVIDIA.
Kann ich eine gebrauchte RTX 3090 noch für unter 500 € kaufen?
Nein — im Juli 2026 werden gebrauchte RTX 3090 für 950–1.150 € auf eBay.de gehandelt. Der Preis ist seit 2024 deutlich gestiegen, da LLM-Enthusiasten den Wert der 24 GB VRAM erkannt haben. Sie ist keine Sub-500-€-Option mehr. Für 30B-Modell-Fähigkeit (erfordert 24 GB VRAM) sollte man 1.000 €+ für eine gebrauchte RTX 3090 budgetieren oder eine RTX 4080 SUPER (16 GB, ~999 € neu) für schnellere 14B-Q8-Leistung in Betracht ziehen.
Was ist mit Intel-Arc-GPUs für KI?
Der Intel Arc B580 12GB ist 2026 die beste Arc-Option. Er führt Ollama über den SYCL-Backend sowohl unter Windows als auch Linux aus, wobei die Leistung 30–40 % unter NVIDIA in reinen Tok/s liegt. Das Preis-Leistungs-Verhältnis ist stark: 12 GB VRAM für ~250 € ohne Treiberprobleme auf modernen Systemen. Die Hauptbeschränkung ist Software: vLLM, Fine-Tuning-Tools und multimodale Laufzeitumgebungen unterstützen Arc noch nicht gut.
Kann ich ein 70B-Modell auf einer einzigen GPU unter 500 € ausführen?
Nicht mit voller Geschwindigkeit. Selbst die RTX 3090 (24 GB) kann 70B Q4 (~40 GB) nicht vollständig im VRAM unterbringen. Mit CPU-Offloading über llama.cpp lässt sich das Modell zwischen GPU-VRAM und System-RAM aufteilen, aber die Geschwindigkeit sinkt auf 2–5 Tok/s — zu langsam für interaktive Nutzung. Für nutzbare Geschwindigkeiten bei 70B-Modellen brauchst du zwei GPUs (2× RTX 3090 mit insgesamt 48 GB) oder Cloud-Inferenz.
Machen neuere GPUs (RTX 5060 Ti) diese Karten überflüssig?
NVIDIAs RTX 5060 Ti wurde für 2026 bestätigt, mit erwarteten Preisen unter der RTX 4060 Ti. Die RTX 4060 Ti 16GB bleibt heute (Juli 2026) der am besten verifizierte Wert. Wenn du 2–3 Monate warten kannst, beobachte die Verfügbarkeit der RTX 5060 Ti — sie könnte mit besserer Leistung in den Sub-500-€-Bereich fallen. Brauchst du jetzt eine GPU, ist die RTX 4060 Ti 16GB der sichere Kauf.
Was kostet eine gebrauchte RTX 4060 Ti 16GB im Juli 2026?
Gebrauchte RTX 4060 Ti 16GB-Karten kosten in der Regel 15–20 % weniger als der Neupreis von ~520 € — auf eBay.de sind daher etwa 420–440 € realistisch, abhängig von Zustand und Restgarantie. Da die Karte relativ neu ist und die Nachfrage durch LLM-Nutzer den Wiederverkaufswert stützt, fällt die Ersparnis gegenüber älteren Karten wie der RTX 3090 geringer aus. Prüfe verkaufte (nicht aktive) eBay-Angebote für den realen Marktpreis und stelle sicher, dass es sich um die 16-GB-Variante handelt — es gibt auch eine RTX 4060 Ti mit 8 GB, die 14B-Modelle bei Q4 nicht ausführen kann.
