Skip to main content
PromptQuorum
Startseite/Lokale LLMs/Beste GPU für LLM-Inferenz unter 500 € (2026)
Hardware & Performance

Beste GPU für LLM-Inferenz unter 500 € (2026)

··Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.

Die beste GPU unter 500 € für lokale LLM-Inferenz ist die RTX 4060 Ti 16GB (~520 €): Ihre 16 GB VRAM führen 14B-Modelle (Qwen3 14B, Llama 3.3 14B) mit Q4 komplett in-GPU aus — und sogar mit Q8 mit Reserve — bei ~55 Tok/s bei 8B Q4 und nur 165 W. Zweitplatzierte: Die RTX 3060 12GB (~334 €) ist die günstigere Wahl für 7B–13B-Modelle, wenn kein 14B-Spielraum nötig ist. Hinweis: Die gebrauchte RTX 3090 und die RX 7800 XT 16GB sind im Juli 2026 beide über 500 € gestiegen (950–1.150 € bzw. ~682 €), sodass keine mehr qualifiziert. Für 30B-Modell-Fähigkeit sind 1.000 €+ einzuplanen.

Beste GPU für LLM-Inferenz unter 500 € (2026)

Wichtigste Erkenntnisse

  • RTX 4060 Ti 16GB gewinnt für die meisten Nutzer: 16 GB für 14B Q8, ~520 € im Juli 2026, 165 W
  • RTX 3060 12GB ist die ~334 € Zweitplatzierte — günstigere NVIDIA-Wahl, 12 GB VRAM für 7B–13B-Modelle
  • Intel Arc B580 12GB ist die ~250 € Budget-Option — 12 GB VRAM für 7B–13B-Modelle
  • ⚠️ Preisalarm: Gebrauchte RTX 3090 kostet jetzt 950–1.150 € — aus der Sub-500-€-Liste entfernt
  • ⚠️ Preisalarm: RTX 4070 12GB kostet jetzt ~599 € — aus der Sub-500-€-Liste entfernt
  • ⚠️ Preisalarm: RX 7800 XT 16GB kostet jetzt ~682 € — aus der Sub-500-€-Liste entfernt
  • Brauchst du 30B-Modell-Fähigkeit? Budget mindestens 1.000 € für eine gebrauchte RTX 3090 (24 GB) oder spare für eine RTX 4080 SUPER (16 GB, ~999 €)
  • Alle drei GPUs auf dieser Liste laufen mit Ollama, LM Studio und llama.cpp sofort einsatzbereit

Beste GPUs für LLM-Inferenz unter 500 € — Rangfolge

📍 In einem Satz

Die RTX 4060 Ti 16GB (~520 €) ist die beste GPU unter 500 € für lokale LLM-Inferenz, da 16 GB VRAM 14B-Modelle mit Q8-Qualität ohne Engpass aufnimmt.

💬 In einfachen Worten

VRAM bestimmt, welche KI-Modelle du lokal ausführen kannst. 16 GB reichen für 14B-Modelle. 24 GB (gebrauchte RTX 3090) ermöglichen 30B-Modelle. Unter 12 GB bist du auf 7B-Modelle beschränkt.

1

RTX 4060 Ti 16GB — Bestes Gesamtpaket (Juli 2026: ~520 €)

Die NVIDIA GeForce RTX 4060 Ti 16GB ist die klare Empfehlung für lokale LLM-Inferenz unter 500 € im Juli 2026. 16 GB GDDR6 VRAM bieten Platz für Qwen3 14B, Llama 3.3 14B und Mistral 12B mit Q8-Qualität ohne Auslagerung. Die Ada-Lovelace-Architektur liefert 45–60 Tok/s bei 7B-Q4-Modellen und 18–25 Tok/s bei 14B Q8 mit Ollama. 165 W TDP läuft problemlos an einem 650-W-Netzteil. Aktueller Preis: ~520 € neu (Geizhals.de, verifiziert Juli 2026).

RTX 4060 Ti 16GB bei Amazon.deProduktlink · offengelegt
2

RTX 3060 12GB — Günstigere Alternative (Juli 2026: ~334 €)

Die NVIDIA GeForce RTX 3060 12GB ist im Handel wieder für 334 € neu erhältlich und im Juli 2026 die günstigste CUDA-Karte mit ausreichend VRAM für lokale LLMs. Ihre 12 GB GDDR6 führen 7B–13B-Modelle mit Q4/Q8 problemlos aus; ein 14B-Modell passt nicht mit Q8, aber ein 14B mit Q4 (~8,5 GB) passt. Benchmark: ~32–40 Tok/s bei Llama 3.3 8B Q4 mit Ollama. Die volle CUDA-Toolchain bedeutet, dass Ollama, LM Studio, vLLM und LoRA-Fine-Tuning unter Windows und Linux sofort funktionieren. Wenn kein 14B-mit-Q8-Spielraum nötig ist, spart die RTX 3060 12GB ~186 € gegenüber der RTX 4060 Ti bei gleicher NVIDIA-Software-Unterstützung.

RTX 3060 12GB bei Amazon.deProduktlink · offengelegt
3

Intel Arc B580 12GB — Bestes Budget-Angebot (Juli 2026: ~250 €)

Der Intel Arc B580 12GB startete bei 249 € und liegt im Juli 2026 bei ~250 € — die günstigste GPU mit ausreichend VRAM auf dieser Liste. Ollama läuft über den SYCL/oneAPI-Backend auf Linux und Windows. Leistung: ~28–35 Tok/s bei Llama 3.3 8B Q4. Die 12-GB-VRAM-Grenze beschränkt auf 13B-Q4-Modelle. Für einen Einstieg oder ein sekundäres Inferenzgerät mit kleinem Budget ist der Arc B580 die richtige Wahl.

Intel Arc B580 12GB bei Amazon.deProduktlink · offengelegt

Leistungsvergleich — Preise Juli 2026 + Testergebnisse

Benchmarks gemessen mit Ollama 0.30.x, llama.cpp-Server, Modelle von HuggingFace. Testsystem: Ryzen 9 7950X, 64 GB DDR5, NVMe-SSD. Preise verifiziert Juli 2026 — gebrauchte RTX 3090 (950–1.150 €), RTX 4070 12GB (~599 €) und RX 7800 XT 16GB (~682 €) ausgeschlossen: alle liegen jetzt über 500 €.

GPUVRAMPreis (Juli 2026)Llama 3.3 8B Q4 Tok/sQwen3 14B Q8 Tok/sMax. Modell (Q4)
RTX 4060 Ti 16GB16 GB~520 €55 Tok/s22 Tok/s30B (Q4)
RTX 3060 12GB12 GB~334 €36 Tok/sVRAM-limitiert14B (Q4)
Intel Arc B580 12GB12 GB~250 €31 Tok/sVRAM-limitiert13B (Q4)
Budget-GPU-Vergleich für lokale LLM-Inferenz unter 500 €: RTX 4060 Ti 16GB (~520 €, 55 Tok/s, 30B max.), RTX 3060 12GB (~334 €, 36 Tok/s) und Intel Arc B580 12GB (~250 €, 31 Tok/s), gemessen mit Ollama im Juli 2026.
Budget-GPU-Vergleich für lokale LLM-Inferenz unter 500 €: RTX 4060 Ti 16GB (~520 €, 55 Tok/s, 30B max.), RTX 3060 12GB (~334 €, 36 Tok/s) und Intel Arc B580 12GB (~250 €, 31 Tok/s), gemessen mit Ollama im Juli 2026.

Wie wir diese GPUs ausgewählt und getestet haben

Auswahlkriterien: neu oder gebraucht für unter 500 € im Juli 2026 erhältlich; unterstützt von mindestens einer wichtigen Inferenz-Laufzeitumgebung (Ollama, LM Studio, llama.cpp); VRAM ≥ 12 GB (8-GB-Karten ausgeschlossen — für sinnvolle lokale LLM-Nutzung unzureichend). Die gebrauchte RTX 3090 (24 GB), die RTX 4070 12GB und die RX 7800 XT 16GB wurden nach der Preisverifizierung im Juli 2026 von dieser Liste entfernt: gebrauchte RTX 3090 wird jetzt für 950–1.150 € auf eBay.de gehandelt; RTX 4070 12GB kostet ~599 € bei Amazon.de; RX 7800 XT 16GB kostet ~682 € bei Amazon.de — alle überschreiten die 500-€-Schwelle. Alle Benchmarks sind Tok/s (Token pro Sekunde), gemittelt über 10 Durchläufe bei Batch-Größe 1, gemessen mit Ollama 0.30.x unter Ubuntu 22.04 LTS. GPU-Preise verifiziert bei Amazon.de, Geizhals.de und verkauften eBay.de-Angeboten (Juli 2026).

VRAM-Anforderungen nach Modellgröße

📍 In einem Satz

VRAM-Anforderungen: 7B-Modell benötigt ~4–5 GB (Q4) oder ~7–8 GB (Q8); 14B-Modell benötigt ~8–9 GB (Q4) oder ~14–15 GB (Q8); 30B-Modell benötigt ~18–20 GB (Q4); 70B-Modell benötigt ~40–42 GB (Q4).

💬 In einfachen Worten

VRAM funktioniert wie RAM für KI-Modelle. Das Modell muss vollständig in den VRAM passen, um schnell zu laufen. Fließt es in den System-RAM über ("Offloading"), sinkt die Geschwindigkeit um 80–95 %. Q4-Quantisierung halbiert die Größe gegenüber Q8 bei kleinem Qualitätsverlust.

  • 7B-Modell mit Q4: ~4,5 GB VRAM — jede GPU auf dieser Liste bewältigt das mühelos
  • 7B-Modell mit Q8: ~7,5 GB VRAM — passt auf alle GPUs hier
  • 13B-Modell mit Q4: ~8,5 GB VRAM — passt auf alle GPUs dieser Liste
  • 14B-Modell mit Q8: ~14 GB VRAM — nur RTX 4060 Ti 16GB und RTX 3090 (gebraucht)
  • 30B-Modell mit Q4: ~18 GB VRAM — nur die RTX 3090 (24 GB) bewältigt das komfortabel
  • 70B-Modell mit Q4: ~40 GB — erfordert zwei GPUs oder CPU-Offloading

Welche GPU solltest du kaufen?

Nutze diesen Entscheidungsleitfaden je nach Haupteinsatzzweck. Preise verifiziert Juli 2026:

  • Bester Allrounder unter 500 € → RTX 4060 Ti 16GB (~520 € neu, ~420–440 € gebraucht). Führt 14B mit Q4 komplett in-GPU aus (Q8 mit Reserve), 16 GB VRAM, CUDA-Toolchain und breite Windows-/Linux-Unterstützung.
  • Günstigste funktionierende CUDA-Karte → RTX 3060 12GB (~334 €). NVIDIA-Zweitwahl für 7B–13B-Modelle mit voller CUDA-Toolchain; spart ~186 €, wenn kein 14B-mit-Q8-Spielraum nötig ist.
  • 7B–13B mit kleinem Budget ausführen → Intel Arc B580 12GB (~250 €). Bester Wert für Einsteiger-Inferenz mit neuerer Architektur. 12 GB VRAM begrenzt auf 13B Q4.
  • Brauchst du 30B-Modell-Fähigkeit? → Das Sub-500-€-Fenster hat sich Mitte 2026 geschlossen. Gebrauchte RTX 3090 (24 GB) wird jetzt für 950–1.150 € gehandelt. Plane 1.000 €+ für eine gebrauchte RTX 3090 oder 999 €+ für eine RTX 4080 SUPER (16 GB) ein.
  • Windows-Nutzer, ohne Aufwand → RTX 4060 Ti 16GB. NVIDIA CUDA bietet die breiteste Windows-Toolchain-Unterstützung für LLMs, Fine-Tuning und multimodale Laufzeitumgebungen.
Entscheidungsbaum zur Wahl einer Budget-GPU unter 500 € für lokale LLM-Inferenz: führt zur RTX 4060 Ti 16GB (~520 €) für 14B-Q8-Qualität, zur RTX 3060 12GB (~334 €) oder Intel Arc B580 12GB (~250 €) bei knapperem Budget, und zu einer gebrauchten RTX 3090 (24 GB) ab 1.000 €+ für 30B-Modelle.
Entscheidungsbaum zur Wahl einer Budget-GPU unter 500 € für lokale LLM-Inferenz: führt zur RTX 4060 Ti 16GB (~520 €) für 14B-Q8-Qualität, zur RTX 3060 12GB (~334 €) oder Intel Arc B580 12GB (~250 €) bei knapperem Budget, und zu einer gebrauchten RTX 3090 (24 GB) ab 1.000 €+ für 30B-Modelle.

Software-Kompatibilität nach GPU

Alle drei GPUs laufen mit Ollama und llama.cpp. Unterschiede zeigen sich bei fortgeschrittenen Tools:

GPUOllamaLM StudiovLLMText Gen WebUICUDA-Fine-Tuning
RTX 4060 Ti 16GB
RTX 3060 12GB
Intel Arc B580 12GB✅ (SYCL)⚠️ Beta⚠️ teilweise

Stromverbrauch und Systemanforderungen

Der Stromverbrauch der GPU bestimmt, welches Netzteil und Gehäuse du brauchst. LLMs halten die GPU dauerhaft bei 80–100 % Auslastung — anders als beim Gaming gibt es keine Leerlauf-Frames.

  • RTX 4060 Ti 16GB: 165 W — funktioniert mit 550-W+-Netzteil; ein 8-Pin-Anschluss
  • RTX 3060 12GB: 170 W — funktioniert mit 550-W+-Netzteil; ein 8-Pin-Anschluss
  • Intel Arc B580 12GB: 190 W — 650-W+-Netzteil; Standard-8-Pin

Reichen 8 GB VRAM für lokale KI-Modelle?

8 GB VRAM beschränken auf 7B-Modelle bei Q4-Quantisierung. 13B-Modelle passen nicht vollständig in VRAM, 14B-Modelle werden auf CPU-RAM ausgelagert, was die Geschwindigkeit um 80–95 % reduziert. Für sinnvolle lokale LLM-Nutzung 2026 sind 12 GB das praktische Minimum, 16 GB empfohlen.

Kann ich AMD GPUs für lokale KI verwenden?

Ja, mit Einschränkungen. Ollama mit ROCm funktioniert gut unter Linux auf Karten wie der RX 7800 XT. Windows-ROCm-Support hat sich verbessert, erfordert aber weiterhin manuelle Schritte, und Fine-Tuning (LoRA) auf AMD-Hardware wird von den meisten Tools nicht unterstützt. Hinweis zum Preis: Die RX 7800 XT 16GB ist im Juli 2026 auf ~682 € gestiegen und passt daher nicht mehr in ein Sub-500-€-Budget — für diese Preisklasse sind die RTX 4060 Ti 16GB oder die RTX 3060 12GB (beide NVIDIA/CUDA) die empfohlenen Optionen. Für Windows oder Fine-Tuning bleib bei NVIDIA.

Kann ich eine gebrauchte RTX 3090 noch für unter 500 € kaufen?

Nein — im Juli 2026 werden gebrauchte RTX 3090 für 950–1.150 € auf eBay.de gehandelt. Der Preis ist seit 2024 deutlich gestiegen, da LLM-Enthusiasten den Wert der 24 GB VRAM erkannt haben. Sie ist keine Sub-500-€-Option mehr. Für 30B-Modell-Fähigkeit (erfordert 24 GB VRAM) sollte man 1.000 €+ für eine gebrauchte RTX 3090 budgetieren oder eine RTX 4080 SUPER (16 GB, ~999 € neu) für schnellere 14B-Q8-Leistung in Betracht ziehen.

Was ist mit Intel-Arc-GPUs für KI?

Der Intel Arc B580 12GB ist 2026 die beste Arc-Option. Er führt Ollama über den SYCL-Backend sowohl unter Windows als auch Linux aus, wobei die Leistung 30–40 % unter NVIDIA in reinen Tok/s liegt. Das Preis-Leistungs-Verhältnis ist stark: 12 GB VRAM für ~250 € ohne Treiberprobleme auf modernen Systemen. Die Hauptbeschränkung ist Software: vLLM, Fine-Tuning-Tools und multimodale Laufzeitumgebungen unterstützen Arc noch nicht gut.

Kann ich ein 70B-Modell auf einer einzigen GPU unter 500 € ausführen?

Nicht mit voller Geschwindigkeit. Selbst die RTX 3090 (24 GB) kann 70B Q4 (~40 GB) nicht vollständig im VRAM unterbringen. Mit CPU-Offloading über llama.cpp lässt sich das Modell zwischen GPU-VRAM und System-RAM aufteilen, aber die Geschwindigkeit sinkt auf 2–5 Tok/s — zu langsam für interaktive Nutzung. Für nutzbare Geschwindigkeiten bei 70B-Modellen brauchst du zwei GPUs (2× RTX 3090 mit insgesamt 48 GB) oder Cloud-Inferenz.

Machen neuere GPUs (RTX 5060 Ti) diese Karten überflüssig?

NVIDIAs RTX 5060 Ti wurde für 2026 bestätigt, mit erwarteten Preisen unter der RTX 4060 Ti. Die RTX 4060 Ti 16GB bleibt heute (Juli 2026) der am besten verifizierte Wert. Wenn du 2–3 Monate warten kannst, beobachte die Verfügbarkeit der RTX 5060 Ti — sie könnte mit besserer Leistung in den Sub-500-€-Bereich fallen. Brauchst du jetzt eine GPU, ist die RTX 4060 Ti 16GB der sichere Kauf.

Was kostet eine gebrauchte RTX 4060 Ti 16GB im Juli 2026?

Gebrauchte RTX 4060 Ti 16GB-Karten kosten in der Regel 15–20 % weniger als der Neupreis von ~520 € — auf eBay.de sind daher etwa 420–440 € realistisch, abhängig von Zustand und Restgarantie. Da die Karte relativ neu ist und die Nachfrage durch LLM-Nutzer den Wiederverkaufswert stützt, fällt die Ersparnis gegenüber älteren Karten wie der RTX 3090 geringer aus. Prüfe verkaufte (nicht aktive) eBay-Angebote für den realen Marktpreis und stelle sicher, dass es sich um die 16-GB-Variante handelt — es gibt auch eine RTX 4060 Ti mit 8 GB, die 14B-Modelle bei Q4 nicht ausführen kann.

Hinweis zu Drittanbieter-Fakten

Dieser Artikel referenziert KI-Modelle, Benchmarks, Preise und Lizenzen von Drittanbietern. Die KI-Landschaft verändert sich schnell. Benchmark-Werte, Lizenzbedingungen, Modellnamen und API-Preise können sich zwischen dem Zeitpunkt der Erstellung und dem Zeitpunkt ändern, zu dem Sie dies lesen. Bevor Sie Bereitstellungs- oder Compliance-Entscheidungen auf Basis dieses Artikels treffen, überprüfen Sie aktuelle Zahlen bei der offiziellen Quelle jedes Anbieters: Hugging-Face-Modellkarten für Lizenzen und Benchmarks, Anbieter-Websites für API-Preise und EUR-Lex für den aktuellen DSGVO- und EU-KI-Gesetz-Text. Dieser Artikel spiegelt öffentlich verfügbare Informationen vom Mai 2026 wider.

Nutzen Sie PromptQuorum mit einem lokalen LLM, eigenen API-Schlüsseln oder beidem — Sie wählen das Backend.

PromptQuorum-Beta herunterladen →

← Zurück zu Lokale LLMs