Wichtigste Erkenntnisse
- Die RTX 4090 ist seit 2026 eingestellt (EOL) — jede Karte im Handel ist gebraucht, zu ~$2.000-2.600, deutlich über den ~$999-1.299 von Anfang des Jahres.
- Die RTX 5090 wird weiterhin produziert, aber die GDDR7-Speicherknappheit 2026 hat den Straßenpreis auf $4.300-$5.000+ getrieben — mehr als das Doppelte der UVP von $1.999.
- RTX 5090 ist ~30–50% schneller als RTX 4090 bei lokaler LLM-Inferenz bei großen Modellen (70B Q4). Bei 7B–13B-Modellen ist der Abstand kleiner (~20%).
- RTX 5090 hat 32GB GDDR7 gegenüber 24GB GDDR6X bei der RTX 4090 — die 8GB Unterschied sind relevant für 34B Q8 und 70B Q4 mit großem Kontext.
- Eine gebrauchte RTX 4090 (~$56-72 pro M Token) bleibt günstiger pro erzeugtem Token als eine neue RTX 5090 zum aktuellen Straßenpreis (~$83-96 pro M Token).
- Für 7B–13B-Modelle: 4090 ist unabhängig vom Preis Overkill. Sie treffen CPU/Kühlungs-Limits bevor Sie GPU-Auslastung maximieren.
- Für 70B-Modelle: 5090 glänzt. Kann 2–3 kleinere 70B-Modelle parallel ausführen oder einzelne 70B bei höheren Batch-Größen.
- RTX 5080 bietet oft besseren Wert als 5090 für lokale LLMs, außer Sie benötigen Dual-GPU-Setups — ist aber ebenfalls von der knappheitsbedingten Preisinflation betroffen.
📍 In einem Satz
Die RTX 4090 ist eingestellt und nur noch gebraucht erhältlich, während die RTX 5090 weiterhin produziert wird, aber aufgrund eines GDDR7-Speichermangels mehr als das Doppelte ihrer UVP kostet; die 5090 ist bei großen Modellen 30-50 % schneller mit 32 GB VRAM gegenüber den 24 GB der 4090, aber die gebrauchte 4090 erzeugt Tokens pro Dollar immer noch günstiger.
💬 In einfachen Worten
Wer bereits eine RTX 4090 besitzt, hat aktuell wenig Grund zum Upgrade -- der Preisaufschlag der 5090 rechtfertigt den Geschwindigkeitsgewinn für die meisten lokalen LLM-Anwendungen nicht. Wer neu kauft und eine 70B-fähige Karte braucht, fährt mit einer gebrauchten 4090 trotz Aufpreis für die Produktionseinstellung besser, da der Preis der 5090 selbst durch den Speichermangel nach oben getrieben wurde.
Was sind die Geschwindigkeitsunterschiede?
RTX 5090: 21.760 CUDA-Kerne, 1.457 TFLOPS, ~1.792 GB/s Speicherbandbreite, 32GB GDDR7. UVP $1.999, aber Straßenpreis $4.300-$5.000+ (Stand August 2026) wegen der GDDR7-Knappheit.
RTX 4090: 16.384 CUDA-Kerne, 826 TFLOPS, ~1.008 GB/s Speicherbandbreite, 24GB GDDR6X. Eingestellt (EOL) — NVIDIA hat die Produktion gestoppt. Jede Karte im Handel ist gebraucht, zu ~$2.000-2.600.
Real-World LLM-Inferenz (Llama 3.3 70B, Q4, Batch=1): RTX 5090 erreicht ~50-55 Token/s, RTX 4090 erreicht ~36 Token/s. 40-50% schneller bei 70B-Modellen. Diese Geschwindigkeiten pro Karte ändern sich nicht durch die Preisverschiebungen — nur die Kosten, sie zu bekommen, haben sich geändert.
Für 7B-Modelle (speichergebunden, nicht rechengebunden): RTX 5090 erreicht ~90 Token/s, RTX 4090 erreicht ~75 Token/s. ~20% schneller. Der Vorteil ist bei kleineren Modellen geringer.

Spielt VRAM zwischen 4090 und 5090 eine Rolle?
RTX 5090 hat 32GB GDDR7, RTX 4090 hat 24GB GDDR6X. Die 8GB Unterschied ist relevant für bestimmte Modellgrößen — diese VRAM-Rechnung ändert sich weder durch die Einstellung der 4090 noch durch den aktuellen Preis einer der beiden Karten.
34B Q8 Modelle (~28GB) passen problemlos in 32GB, aber kaum in 24GB. 70B Q4 (~38-40GB) passt in keine der beiden Karten allein — dafür brauchen Sie Dual-GPU oder Apple Silicon. Für 7B–13B Modelle sind 24GB mehr als genug für beide Karten.
Kosten pro Token: Welche ist tatsächlich günstiger?
- Gebrauchte RTX 4090: ~$2.000-2.600 (EOL, nur im Gebrauchtmarkt, gegenüber ~$999-1.299 Anfang 2026). Erreicht 36 Token/s auf Llama 70B. Kosten pro Token: ~$56-72 pro M Token.
- RTX 5090 neu: $4.300-5.000+ Straßenpreis (UVP $1.999, durch die GDDR7-Knappheit 2026 aufgebläht). Erreicht ~52 Token/s auf Llama 3.3 70B Q4. Kosten pro Token: ~$83-96 pro M Token.
- Fazit: die 4090 ist weiterhin günstiger pro erzeugten Token, auch nach ihrem EOL-Preisanstieg — der knappheitsbedingte Aufschlag bei der 5090 ist stärker gewachsen als der Aufschlag bei der 4090.

Wann sollten Sie tatsächlich von 4090 auf 5090 upgraden?
Niemals upgraden für 7B–13B-Inferenz. 4090 ist unabhängig vom Preis für diese Overkill. Sie werden ohnehin CPU-gebunden oder Kühlungs-limitiert sein.
Wenn Sie bereits eine 4090 besitzen: behalten Sie sie. Bei einem 5090-Straßenpreis von $4.300-5.000+ ist die Upgrade-Rechnung schlechter als je zuvor. Wechseln Sie nur, wenn Sie mehr als 40 Token/s bei 70B oder die 32GB für 34B Q8 brauchen und die Kosten kein Hindernis sind.
Wenn Sie keine der beiden besitzen und eine 70B-fähige Karte brauchen: Vergleichen Sie aktuelle Angebote. Eine gebrauchte 4090 (~$2.000-2.600, EOL/nur gebraucht) schlägt eine neue 5090 (~$4.300-5.000+) weiterhin bei den Kosten pro Token, zum Preis von 30-50% weniger Durchsatz.
Die Zwei-GPU-Alternative hat sich verändert: zwei gebrauchte RTX 4090 kosten zusammen inzwischen ~$4.000-5.200 — nahe am Straßenpreis einer einzelnen 5090 — für ~65-72 Token/s kombiniert bei 70B Q4 (ähnlich oder besser als eine einzelne 5090). Der Kompromiss: reine Gebrauchtbeschaffung (keine Garantie, EOL-Angebot) und mehr Einrichtungsaufwand (Tensor-Parallelismus).
Häufige Annahmen über die 5090
- Annehmen, die RTX 4090 werde noch neu verkauft — das stimmt nicht. NVIDIA hat die RTX-40-Serie 2026 eingestellt; jede 4090 im Handel ist gebraucht, zu Preisen deutlich über denen von Anfang des Jahres.
- Denken, die UVP von $1.999 der RTX 5090 sei das, was Sie tatsächlich zahlen — Stand August 2026 liegt der Straßenpreis bei $4.300-$5.000+ wegen der GDDR7-Knappheit.
- Denken, 5090 ist 2× schneller als 4090―sie ist nur 40-50% schneller bei 70B, und nur ~20% schneller bei 7B-Modellen.
- Annehmen, VRAM-Unterschied existiere nicht―beide sind unterschiedlich. 5090 hat 32GB, 4090 hat 24GB. Die 8GB Unterschied sind relevant für 34B Q8 Modelle.
- Glauben, Sie benötigen 5090 um 70B-Modelle auszuführen―4090 führt sie gut aus mit 36 Token/s. Das ist „ausreichend" für die meisten Nutzer, und sie bleibt selbst nach ihrem EOL-Preisanstieg die günstigere Karte pro Token.
Häufig gestellte Fragen
Wird die RTX 4090 2026 noch neu verkauft?
Nein. NVIDIA hat die RTX-40-Serie 2026 eingestellt. Jede RTX 4090 im Handel ist jetzt gebraucht, und die Preise sind auf ~$2.000-2.600 gestiegen — durch die EOL-Knappheit sowie die Nachfrage, die von der eigenen GDDR7-Knappheit der RTX-50-Serie ausgeht.
Lohnt sich RTX 5090 zum Ausführen von Llama 3.3 70B?
Hängt mehr denn je vom Preis ab. 4090 gibt Ihnen ~36 Token/s für ~$2.000-2.600 gebraucht. 5090 gibt ~52 Token/s, kostet aber $4.300-$5.000+ Straßenpreis (Stand August 2026). Lohnt sich bei durchgehender 70B-Nutzung; ansonsten ist eine gebrauchte 4090 die pragmatische Wahl.
Sollte ich RTX 5090 oder zwei RTX 4090er kaufen?
Zwei gebrauchte 4090er (~$4.000-5.200 insgesamt) schlagen eine 5090 (~$4.300-5.000+ Straßenpreis) bei roher 70B-Geschwindigkeit (~72 Token/s kombiniert). 5090 hat einfacheres Setup und wird weiter produziert, aber zwei gebrauchte 4090er kommen ohne Garantie.
Hat RTX 5090 besseres VRAM als 4090?
Ja. RTX 5090 hat 32GB GDDR7 gegenüber 24GB GDDR6X bei der RTX 4090. Die 8GB extra erlauben 34B Q8 Modelle (~28GB benötigt) ohne Engpass. Beide Karten passen kein 70B Q4 (~38-40GB) ohne Aufteilung auf mehrere GPUs. Dieser VRAM-Unterschied hat nichts mit der Einstellung der 4090 zu tun.
Ist die RTX 5090 für ein 14B-Modell überdimensioniert?
Ja, in den meisten Fällen. Ein 14B Q4 Modell braucht ~9GB VRAM und läuft auf einer 4090 bereits mit ~55-65 Token/s — bereits schnell. Die 5090 würde ~65-75 Token/s liefern, eine geringe Verbesserung. Eine gebrauchte 4090 (oder sogar eine 3090) ist für 14B-Inferenz deutlich wirtschaftlicher, gerade bei den aktuellen 5090-Preisen.
Hat die RTX 5090 Laptop-GPU 32GB VRAM?
Nein. Die RTX 5090 Laptop GPU hat 24GB GDDR7 (reduziert von den 32GB der Desktop-Version wegen Strom- und Wärmegrenzen). Sie ist deutlich langsamer als die Desktop-5090, aber immer noch schneller als eine 4090 bei derselben Aufgabe.
Werden 5090-Preise auf die UVP von $1.999 fallen?
Erst wenn sich die GDDR7-Speicherknappheit 2026 entspannt — dafür gibt es keinen festen Zeitplan. Der aktuelle Straßenpreis liegt bei $4.300-$5.000+, mehr als das Doppelte der UVP. Die Preisgeschichte der 4090 zeigt, dass Gebrauchtpreise nicht immer nur sinken: Sie fiel von $1.499 (Launch 2022) auf ein Tief von ~$999 gebraucht und stieg nach der Einstellung 2026 wieder auf ~$2.000-2.600.
Kann ich RTX 5090 mit 750W Stromversorgung nutzen?
Kaum. RTX 5090 verbraucht allein 575W. Kombinieren Sie mit 850W oder 1000W PSU, um Spannungsabfälle unter Last zu vermeiden.
Ist RTX 5080 besser als 5090?
Oft ja — 5080 erreicht rund 80% der 5090-Geschwindigkeit zu einem deutlich niedrigeren Preis, ist aber ebenfalls von der knappheitsbedingten Preisinflation 2026 betroffen. Für lokale LLMs ist 5080 meist der Sweet Spot.
Wie viel schneller ist 5090 auf Multimodal-Modellen wie Qwen-VL 70B?
Ähnliche 20–25% Steigerung. Multimodal-Compute ist noch speichergebunden, daher hilft der Bandbreiten-Vorteil der 5090, aber nicht dramatisch.
Quellen
- NVIDIA RTX 5090 und 4090 offizielle Spezifikationen: CUDA-Kerne, TFLOPS, Speicherbandbreite
- MLCommons MLPerf Inference Benchmark: Token-Generierungsgeschwindigkeit auf LLaMA 70B und Mistral-Modellen
- TechPowerUp GPU-Datenbank: RTX 5090 vs. 4090 Stromverbrauch und Speicherbandbreiten-Vergleich
