Skip to main content
PromptQuorum

Günstigster praktikabler Weg, ein 70B-Modell lokal zu betreiben 2026

Der günstigste praktikable Weg, ein 70B-Q4-Modell lokal zu betreiben, ist eine gebrauchte Dual-RTX-3090-Konfiguration (~48 GB kombinierter VRAM) — wenn Sie bereit sind, einen PC selbst zusammenzubauen. Für die einfachste Ein-Geräte-Lösung braucht ein Apple-Silicon-Mac mit 64 GB+ Unified Memory keinen Multi-GPU-Aufbau. Eine einzelne 24-GB-GPU kann ein vollständiges 70B-Q4-Modell allein nicht aufnehmen. Apples Update vom August 2026 brachte eine neue Option: den Mac mini mit M5 Pro (64 GB Unified Memory, ab 1.699 $) — das günstigste neue Apple-Silicon-Gerät, das die 70B-Speichergrenze schafft, während der Basis-Mac-mini mit M6 (max. 32 GB) das nicht kann.

Günstigster praktikabler Weg, ein 70B-Modell lokal zu betreiben 2026

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.

Schnelle Antwort

Eine gebrauchte Dual-RTX-3090-Konfiguration (~48 GB kombinierter VRAM) ist der günstigste praktikable Weg, ein 70B-Q4-Modell mit nutzbarer Geschwindigkeit zu betreiben. Ein Apple-Silicon-Mac mit 64 GB+ Unified Memory ist die einfachste Ein-Geräte-Alternative — kein Multi-GPU-Aufbau nötig. Prüfen Sie aktuelle Preise statt einer festen Zahl — gebrauchte GPU-Preise schwanken stark.

  • Günstigste praktikable Lösung: 2× gebrauchte RTX 3090 24 GB (~48 GB kombinierter VRAM) — vollständiges Q4-Offload, erfordert PC-Bau-Kenntnisse
  • Am einfachsten: Apple-Silicon-Mac mit 64 GB+ — das gesamte Modell passt in den Unified Memory, kein Multi-GPU-Aufbau
  • Günstigste Hardware absolut: 64–128 GB RAM, reines CPU-Setup — funktioniert, aber quälend langsam bei 1–3 Tok/s
  • Beste Leistung: ein hoch-VRAM-Multi-GPU-System für ernsthafte, dauerhafte 70B-Workloads
  • Neu seit August 2026: Der Mac mini mit M5 Pro (64 GB, ab 1.699 $) ist das günstigste neue Apple-Silicon-Gerät, das 70B betreiben kann — der Basis-Mac-mini mit M6 (max. 32 GB) kann das nicht
Hardware & PerformanceFortgeschritten

Wichtigste Punkte

  • 70B Q4 benötigt etwa 40–48 GB Speicher — eine einzelne 24-GB-GPU kann das vollständige Modell nicht aufnehmen
  • Günstigste praktikable Lösung: 2× gebrauchte RTX 3090 24 GB, vollständiges Q4-Offload — aktuelle Gebrauchtpreise prüfen
  • Am einfachsten: Apple-Silicon-Mac mit 64 GB+ — kein Multi-GPU-Aufbau nötig
  • Günstigste Hardware absolut: 64–128 GB RAM, reines CPU-Setup — nutzbar, aber langsam (1–3 Tok/s)
  • Nur gelegentliche Nutzung? Eine Cloud-GPU zu mieten ist oft günstiger als überhaupt Hardware zu kaufen
  • Update August 2026: Der neue Mac mini mit M5 Pro (64 GB, ab 1.699 $) kann jetzt 70B betreiben — der Basis-Mac-mini mit M6 (max. 32 GB) weiterhin nicht

Günstigste praktikable Lösung: 2× gebrauchte RTX 3090

Zwei gebrauchte RTX-3090-Karten (je 24 GB VRAM) ergeben mit Tensor-Parallel-Splitting in llama.cpp zusammen etwa 48 GB nutzbaren VRAM — genug, um ein 70B-Q4_K_M-Modell vollständig ohne CPU-Fallback zu laden. Sie brauchen ein Mainboard mit zwei x16-PCIe-Slots und ein Netzteil mit 1000 W+.

Die Preise für gebrauchte RTX-3090-Karten schwanken je nach Zustand, Kühlung und Verkäufer stark — prüfen Sie aktuelle Angebote statt einer festen Zahl zu vertrauen. In Deutschland liegen Angebote auf Kleinanzeigen aktuell grob zwischen 900 € und 1.200 € pro Karte, je nach Zustand.

Kaufen Sie sie, wenn: Sie gerne PCs zusammenbauen und die beste Inferenzgeschwindigkeit pro Euro wollen. Verzichten Sie darauf, wenn: Sie ein leises, einfaches Ein-Geräte-System wollen — siehe die Mac-Option unten.

70B-Hardware-Vergleich

Alle Optionen unten passen ein 70B-Q4_K_M-Modell (~42 GB) mit nutzbarer Qualität. Prüfen Sie aktuelle Preise für jede Option, bevor Sie entscheiden — Preise für gebrauchte GPUs und RAM ändern sich häufig.

SetupGeschwindigkeitKomplexitätAm besten für
CPU + 64–128 GB RAM🐌 1–3 Tok/s⭐ NiedrigGünstigste Hardware, Tests
2× gebrauchte RTX 3090🏆 20–35 Tok/s⚠️ HochBestes Preis-Leistungs-Verhältnis
Apple-Silicon-Mac 64 GB+⭐⭐⭐ 12–18 Tok/s🟢 NiedrigEinfachheit, ein Gerät
Mac mini M5 Pro 64 GB (neu)🆕 Noch nicht getestet🟢 NiedrigGünstigstes neues Komplettsystem
Einzelne RTX 4090 + Offload⭐⭐ 8–12 Tok/s⚠️ MittelBereits eine 4090 vorhanden
Apple-Silicon-Mac 128 GB🚀 25–35 Tok/s🟢 NiedrigGrößere Modelle, volle Qualität

Am einfachsten: Apple-Silicon-Mac mit 64 GB+

Wenn Sie keinen Dual-GPU-PC bauen wollen, ist Apple Silicon deutlich einfacher: Das Modell liegt direkt im Unified Memory, es muss also nichts zwischen Systemspeicher und VRAM aufgeteilt werden, und es gibt kein Multi-GPU-Treiber-Setup. 64 GB Unified Memory ist das Ziel, um 70B Q4 komfortabel ohne Layer-Offloading auf die Festplatte zu betreiben.

Apples Hardware-Update vom 25. August 2026 hat neben dem Mac Studio auch den Mac mini aktualisiert. Der Basis-Mac-mini mit M6-Chip startet bei 899 $, ist aber auf maximal 32 GB Unified Memory begrenzt — das reicht nicht für ein 70B-Q4-Modell, für diesen Einsatzzweck also ungeeignet. Der Mac mini mit M5-Pro-Chip startet bei 1.699 $ mit bis zu 64 GB Unified Memory und erreicht damit das 64-GB-Ziel — das günstigste neue Apple-Silicon-Gerät, das ein 70B-Modell betreiben kann. Beide erscheinen am 22. September 2026; prüfen Sie den aktuellen Preis, bevor Sie kaufen, da sich Preise für neue Hardware verschieben können.

Apple hat die Mac-Studio-Reihe in derselben Ankündigung im August 2026 auf M5 Max/M5 Ultra aktualisiert, ab 2.499 $, konfigurierbar bis 128 GB Unified Memory — prüfen Sie den aktuellen Preis für eine 64-GB-Konfiguration statt sich auf eine alte Zahl zu verlassen. Ein MacBook Pro mit 64 GB+ Unified Memory ist das portable Äquivalent, mit einem Preisaufschlag gegenüber dem Desktop.

Wenn Sie bei null anfangen — also keinen vorhandenen PC haben, dem Sie GPUs hinzufügen können —, ist der 1.699-$-Mac-mini mit M5 Pro oft günstiger als der komplette Eigenbau einer Dual-RTX-3090-Maschine, sobald Sie Mainboard, Netzteil und Gehäuse mitrechnen und nicht nur die zwei GPUs. Wenn Sie bereits einen leistungsfähigen PC besitzen, ist das Nachrüsten mit zwei gebrauchten RTX 3090 wahrscheinlich weiterhin der günstigere und schnellere Weg.

Kaufen Sie ihn, wenn: Ihnen Einfachheit, geringer Stromverbrauch und leiser Betrieb wichtiger sind als reine Geschwindigkeit. Verzichten Sie darauf, wenn: Sie die höchstmögliche Token-pro-Sekunde-Zahl pro Euro wollen — dort gewinnt der Dual-3090-Aufbau.

Mac-mini-M5-Pro-Preise prüfenProduktlink · offengelegtMac-Studio-Preise prüfenProduktlink · offengelegtMacBook-Pro-Preise prüfenProduktlink · offengelegt

Günstigste Hardware absolut: CPU + 64–128 GB RAM

Technisch brauchen Sie überhaupt keine GPU — ein 70B-Q4_K_M-Modell kann vollständig im Systemspeicher laufen. Rechnen Sie mit etwa 1–3 Tokens pro Sekunde, was für Batch-Aufgaben oder Tests nutzbar ist, für interaktiven Chat aber frustrierend langsam.

Kaufen Sie keine reine 128-GB-CPU-Maschine speziell für interaktiven 70B-Chat, es sei denn, die reinen Kosten sind Ihnen wirklich wichtiger als Geschwindigkeit — die Dual-3090- oder Mac-Optionen oben kosten mehr, sind aber im Alltag deutlich nutzbarer.

Eine Alternative: Mieten statt kaufen

Wenn Sie ein 70B-Modell nur gelegentlich brauchen, kaufen Sie gar keine Hardware. Cloud-GPU-Miete ist für gelegentliche Nutzung oft deutlich günstiger als eine Hardware-Anschaffung für 1.500–3.000 $ — RunPods Community-Cloud-A40 mit 48 GB (die kleinste GPU, die 70B Q4 vollständig aufnimmt) kostet nach diesem Check rund 0,44 $/Stunde, und gehostete Inferenz-APIs für Llama 3.3 70B existieren ganz ohne eigene Hardware, mit Preis pro Token.

Das sollte man klar benennen statt zu übergehen, denn eine Seite, die nur je Hardware-Kauf empfiehlt, wirkt, als wolle sie allen Hardware verkaufen — bei gelegentlicher oder unregelmäßiger Nutzung ist Mieten die ehrlichere Antwort.

RunPod GPU CloudProduktlink · offengelegt

Quantisierung für 70B

Für ein 70B-Modell ist Q4_K_M der Standard-Kompromiss aus Größe und Qualität. Die Qualitätsprozentangaben unten sind Näherungswerte — der tatsächliche Qualitätsverlust hängt vom konkreten Modell und der Bewertungsmethode ab, nicht von einer universellen Konstante.

QuantisierungGrößeQualität vs. FP16
Q4_K_M~42 GB~96 % (bester Kompromiss)
Q3_K_M~32 GB~90 %
Q2_K~25 GB~82 %, merklicher Verlust
FP16 (voll)~140 GB100 % — auf Consumer-Hardware unrealistisch

Kaufen Sie keine einzelne 24-GB-GPU in Erwartung voller 70B-Geschwindigkeit

  • Eine einzelne 24-GB-Karte (RTX 3090 oder 4090) kann kein vollständiges 70B-Q4-Modell aufnehmen — sie kann eines mit CPU-Offloading betreiben, aber die Geschwindigkeit sinkt auf etwa 8–12 Tok/s.
  • 24-GB-GPU allein → partielles Offload, langsamer
  • 48 GB kombinierter VRAM (2× 24 GB) → vollständiges 70B-Q4-Offload
  • 64 GB+ Unified Memory (Mac) → komfortabel, kein Offloading nötig
  • Basis-Mac-mini mit M6 (max. 32 GB) → kann ebenfalls kein vollständiges 70B-Modell betreiben, gleiche Kategorie wie eine einzelne 24-GB-GPU

Verwandte Leitfäden

Quick Answers

Kann ich ein 70B-Modell auf einer einzelnen Consumer-GPU betreiben?
Nicht vollständig. Keine einzelne Consumer-GPU hat 2026 genug VRAM für ein 70B-Q4_K_M-Modell (~42 GB) allein. Am nächsten kommt eine RTX 4090 (24 GB), die 70B mit CPU-Offloading betreiben kann — etwa 8–12 Tok/s, funktioniert, aber merklich langsamer als ein Dual-GPU- oder Mac-Setup.
Wie viel RAM brauche ich für ein 70B-Modell nur per CPU?
70B Q4_K_M benötigt mindestens etwa 44 GB RAM. Für praktische reine CPU-Nutzung werden 64 GB empfohlen, um Spielraum für Betriebssystem und Kontextpuffer zu lassen. Rechnen Sie mit 1–3 Tok/s auf einem modernen Desktop-Prozessor — nutzbar, aber langsam. 128 GB beschleunigt das nicht wesentlich, sondern schafft vor allem Spielraum für größeren Kontext.
Reicht die Qualität von Q4 für ein 70B-Modell aus?
Bei 70B-Modellen behält Q4_K_M in typischen Benchmarks etwa 96 % der FP16-Qualität — der Verlust ist geringer als bei kleineren Modellen, weil ein 70B-Modell mehr Redundanz in seinem Parameterraum hat. Die meisten Nutzer können Q4_K_M und Q8_0 bei 70B kaum zuverlässig unterscheiden.
Was ist der günstigste Weg, ein 70B-Modell ohne Hardware-Kauf zu betreiben?
Eine Cloud-GPU mieten. RunPods Community-Cloud-A40 mit 48 GB — die kleinste GPU, die ein 70B-Q4-Modell vollständig aufnimmt — kostet nach diesem Check rund 0,44 $/Stunde. Für gelegentliche Nutzung schlägt das die Kosten jeder lokalen Hardware-Anschaffung — prüfen Sie aktuelle Preise, da sich Cloud-GPU-Tarife ändern.
Kann der neue Mac mini ein 70B-Modell betreiben?
Nur die M5-Pro-Konfiguration. Apples Update vom August 2026 begrenzt den Basis-Mac-mini mit M6 auf 32 GB Unified Memory — nicht genug für ein 70B-Q4-Modell (~42 GB). Der Mac mini mit M5 Pro geht bis 64 GB, startet bei 1.699 $, und erreicht damit die nötige Grenze. Für beide Chips gibt es noch keine unabhängigen Benchmarks; beide erscheinen am 22. September 2026.

Den vollständigen Überblick?

Die vollständige Anleitung lesen →