Skip to main content
PromptQuorumBuilt for humans. Structured for AI.
Startseite/Lokale LLMs/GPU vs CPU vs Apple Silicon für lokale LLMs 2026: Was gewinnt?
Hardware & Leistung

GPU vs CPU vs Apple Silicon für lokale LLMs 2026: Was gewinnt?

·11 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Apple M5 Pro (64 GB, ~2.399 $) ist der beste Allround-Sieger 2026 — größere Modelle als jede einzelne GPU, günstig im Verbrauch (10× weniger Strom als RTX 5090). RTX 50-Serie nur wählen für maximale Geschwindigkeit bei 7B–14B oder Produktionsworkloads.

Apple M5 Pro (64 GB, ~2.399 $) ist 2026 die beste Allround-Plattform für lokale LLMs. Er führt 30B+-Modelle im einheitlichen Speicher mit 40–60 Tok/s bei geringer Leistungsaufnahme (~25 W) aus. Die NVIDIA RTX 5090 ist bei 7B–14B-Modellen schneller, kann jedoch 30B+ nicht ohne CPU-Offloading laden. Nur-CPU ist für 7B-Modelle mit 10–20 Tok/s auf moderner Hardware nutzbar.

Präsentation: GPU vs CPU vs Apple Silicon für lokale LLMs 2026: Was gewinnt?

Das Folien-Deck unten deckt ab: NVIDIA RTX 50-Serie vs Apple M5 vs Nur-CPU-Leistung (M5 Pro 307 GB/s, M5 Max 460–614 GB/s, RTX 5090 1.792 GB/s), Stromverbrauchsvergleich (25 W vs 450 W), Kosten-pro-Tok/s-Analyse und ein klares Urteil je Budgetstufe. Laden Sie die PDF als GPU-vs-Apple-Silicon-Referenzkarte für 2026 herunter.

Folien unten ansehen oder als PDF herunterladen. Präsentation herunterladen (PDF)

GPU vs CPU vs Apple Silicon für lokale LLMs 2026: Was gewinnt?

Wichtigste Erkenntnisse

  • Apple M5 Pro (64 GB, ~2.399 $): bestes Allround-Gerät für die meisten Nutzer. 40–60 Tok/s bei 30B-Modellen, geringer Verbrauch (~25 W bei Inferenz), keine VRAM-Grenze.
  • NVIDIA RTX 5090 (32 GB, 2.000 $): am schnellsten für 7B–14B-Modelle mit 150–200 Tok/s. Kann 30B+ nicht ohne CPU-Offloading laden. Am besten für Produktions-Workloads.
  • NVIDIA RTX 5070 (12 GB, ~600 $): bestes Preis-Leistungs-Verhältnis bei GPUs. 60–80 Tok/s bei 8B-Modellen. Auf 7B–8B bei voller Präzision begrenzt.
  • Apple M5 Max (64–128 GB, ~3.199 $+): 460–614 GB/s Bandbreite. Führt 30B–70B nativ aus. Am besten für Forscher und intensive 30B+-Nutzung.
  • Nur CPU (moderne Ryzen/Intel): 10–20 Tok/s bei 7B-Modellen mit schnellem DDR5-RAM. Für gelegentliche Nutzung geeignet, unpraktisch für Echtzeit-Chat.
  • Fazit: Für die meisten Nutzer gewinnt Apple M5 Pro mit 64 GB — größere Modelle als jede einzelne GPU, geringere Kosten als ein GPU-Build, 10× weniger Stromverbrauch. RTX 50-Serie nur wählen für maximale Geschwindigkeit bei 7B–14B oder Produktions-Workloads.

📍 In einem Satz

Für lokale LLMs: Apple M5 Pro 64 GB (~2.399 $) ist das beste Allround-Gerät mit 40–60 Tok/s bei 30B-Modellen; RTX 5090 32 GB (~2.000 $) ist am schnellsten für 7B–14B (150–200 Tok/s), aber kein 30B+; RTX 5070 12 GB (~600 $) bietet bestes GPU-Preis-Leistungs-Verhältnis; CPU-only: 10–20 Tok/s bei 7B.

💬 In einfachen Worten

GPUs sind bei kleinen Modellen (unter 14B) am schnellsten dank hoher Compute-Bandbreite. Apple Silicon gewinnt bei größeren Modellen (30B+) durch integrierten Speicher und niedrige Leistungsaufnahme. CPU-only ist am langsamsten, funktioniert aber auf jedem Laptop.

Leistungsvergleich: Geschwindigkeit, Bandbreite und Kosten

*Erfordert CPU-Offloading – erhebliche Geschwindigkeitseinbuße und Qualitätsverlust bei niedrigen Bit-Breiten

Hardware
Qwen3 8B
Qwen3 30B
Verbrauch
Kosten
RTX 5090 (GPU, 32 GB GDDR7)150–200 Tok/sNicht möglich*~450W2.000 $
RTX 5080 (GPU, 16 GB GDDR7)100–130 Tok/sNicht möglich*~360W1.000 $
RTX 5070 Ti (GPU, 16 GB)80–100 Tok/sNicht möglich*~300W750 $
RTX 5070 (GPU, 12 GB)60–80 Tok/sNicht möglich*~250W600 $
MacBook Pro M5 Pro (36–64 GB, 307 GB/s)40–60 Tok/s20–30 Tok/s~25W2.399 $+
MacBook Pro M5 Max (64–128 GB, 460–614 GB/s)60–80 Tok/s35–50 Tok/s~35W3.199 $+
Mac mini M5 base (16–32 GB, 200 GB/s)25–35 Tok/sOffload*~15W599 $+
Intel Core Ultra 9 / AMD Ryzen 9 (CPU, DDR5)10–20 Tok/s3–5 Tok/s~65WEnthalten
Apple M5 Pro führt 30B-Modelle mit 20–30 Tok/s bei 25 W Verbrauch aus. RTX 5090 ist bei 8B schneller, kann aber 30B ohne Offloading nicht in den VRAM laden.
Apple M5 Pro führt 30B-Modelle mit 20–30 Tok/s bei 25 W Verbrauch aus. RTX 5090 ist bei 8B schneller, kann aber 30B ohne Offloading nicht in den VRAM laden.

Wann man sich für GPU entscheidet (RTX 50-Serie)

Wählen Sie eine NVIDIA-GPU der RTX 50-Serie, wenn Sie maximale Geschwindigkeit bei 7B–14B-Modellen benötigen oder 24/7-Produktions-Workloads betreiben.

  • RTX 5090 (32 GB GDDR7, 1.792 GB/s): 150–200 Tok/s bei 8B-Modellen. 2.000 $. Am besten für Produktions-Pipelines, Fine-Tuning und geschwindigkeitskritische Anwendungen.
  • RTX 5080 (16 GB GDDR7): 100–130 Tok/s bei 8B. 1.000 $. Gutes Verhältnis von Geschwindigkeit und Kosten für 8B–13B.
  • RTX 5070 Ti / 5070 (12–16 GB): 60–100 Tok/s bei 8B. 600–750 $. Bestes Preis-Leistungs-Verhältnis für Chat und Coding mit einem Nutzer.
  • CUDA-Ökosystem-Vorteil: vLLM, llama.cpp, LM Studio sind alle nativ optimiert. Schnellste Inferenz bei nativer Präzision.
  • Harte Grenze: Keine RTX 50-Serie-Karte lädt 30B-Modelle in voller Qualität (erfordert 20+ GB VRAM). Auslagerung auf System-RAM erzeugt 5–10× Geschwindigkeitsstrafe.

Der Stromverbrauch ist der zentrale Trade-off: RTX 5090 zieht 450 W unter Last gegenüber 25 W beim M5 Pro. Bei 0,35 €/kWh kostet die RTX 5090 ~55 € mehr pro Monat an Strom bei 8 Std./Tag.

Wann man sich für Apple Silicon entscheidet (M5)

Wählen Sie Apple Silicon M5, wenn Sie 14B–70B-Modelle ausführen müssen, Energieeffizienz schätzen oder macOS als Hauptsystem nutzen.

  • M5 base (16–32 GB, 200 GB/s): führt 7B–8B nativ mit 25–35 Tok/s aus. Ab 599 $ (Mac mini). Guter Einstiegspunkt.
  • M5 Pro (36–64 GB, 307 GB/s): führt bis zu 30B nativ mit 20–30 Tok/s aus. ~2.399 $ (MacBook Pro). Bestes Allround-Preis-Leistungs-Verhältnis.
  • M5 Max (64–128 GB, 460–614 GB/s): führt 30B–70B nativ mit 35–50 Tok/s aus. ~3.199 $+. Am besten für Forscher und intensive 70B-Workloads.
  • Vorteil des einheitlichen Speichers: keine VRAM-Obergrenze. Ein M5 Pro mit 64 GB lädt 30B-Modelle nativ; ein M5 Max mit 128 GB lädt 70B-Modelle nativ.
  • Apple-Angaben: 4× schnellere LLM-Inferenz gegenüber M4 in der M5-Generation.
  • MLX-Framework: Apples MLX ist für Apple Silicon optimiert. Qwen3-Modelle laufen hervorragend auf MLX. DeepSeek-R1 14B liefert gute Ergebnisse.

Trade-off: kann die rohe Geschwindigkeit der RTX 5090 bei 7B nicht erreichen. Langsamer für Fine-Tuning. Keine CUDA-exklusiven Tools.

Wann Nur-CPU ausreicht

Reine CPU-Inferenz ist praktikabel, wenn Sie nur gelegentliche Antworten benötigen und kleine Modelle (7B Q4) ausführen.

  • Moderne Intel Core Ultra 9 / AMD Ryzen 9 mit DDR5-5600: 10–20 Tok/s bei Qwen3 8B oder Llama 3.2 8B. Nutzbar für nicht-interaktive Batch-Aufgaben.
  • Ältere CPU / DDR4: 5–8 Tok/s. Merkliche Latenz (5–8 Sekunden pro Antwort) macht interaktiven Chat unangenehm.
  • Keine zusätzlichen Hardwarekosten: Wenn Sie bereits einen leistungsfähigen Desktop besitzen, funktionieren llama.cpp oder Ollama sofort.
  • Stromverbrauch: CPUs ziehen bei voller Inferenzlast 65–125 W – weniger als eine GPU, mehr als Apple Silicon.

CPU-Inferenz eignet sich für: Dokumentenzusammenfassung im Batch, nächtliche Verarbeitung, gelegentliche Fragen. Vermeiden Sie Nur-CPU für Echtzeit-Chat, Coding-Assistenten oder Modelle größer als 8B.

Speicherbandbreite: Der echte Geschwindigkeitsbottleneck

LLM-Inferenz ist speichergebunden, nicht rechengebunden. Die Token-Generierungsgeschwindigkeit wird dadurch begrenzt, wie schnell Sie Modellgewichte aus dem Speicher laden können. Höhere Speicherbandbreite = schnellere Token-Generierung.

Die Formel: Inferenzgeschwindigkeit ≈ Speicherbandbreite ÷ Modellgewichte im Speicher

  • RTX 5090 mit 1.792 GB/s hat die schnellste Einzel-GPU-Bandbreite, die 2026 verfügbar ist.
  • M5 Max mit 460–614 GB/s erreicht oder übertrifft die RTX 5080 bei der Bandbreite – mit 128 GB einheitlichem Speicher gegenüber 16 GB VRAM.
  • M5 Pro mit 307 GB/s ist der Sweet Spot: genug Bandbreite für 30B-Modelle, halb so teuer wie M5 Max.
  • CPU-DDR5 mit 89 GB/s ist 20× langsamer als RTX 5090, aber 4× schneller als DDR4 – eine deutliche Verbesserung für CPU-Inferenz.
  • Vorteil des einheitlichen Speichers: Kein CPU↔GPU-Übertragungsaufwand. M5 Pro hält ein 30B-Modell vollständig in seinem 64-GB-Pool.
Plattform
Speicherbandbreite
Effektive Geschwindigkeit (8B)
RTX 5090 (GDDR7)1.792 GB/s150–200 Tok/s
RTX 5080 (GDDR7)960 GB/s100–130 Tok/s
RTX 5070 (GDDR7)672 GB/s60–80 Tok/s
M5 Max (einheitlich, 128 GB)460–614 GB/s60–80 Tok/s
M5 Pro (einheitlich, 64 GB)307 GB/s40–60 Tok/s
M5 base (einheitlich, 32 GB)200 GB/s25–35 Tok/s
DDR5-5600 RAM (nur CPU)89 GB/s10–20 Tok/s
DDR4-3200 RAM (nur CPU)51 GB/s5–8 Tok/s

Kosten pro Tok/s: Echte Wertanalyse

Kosten pro Tok/s vergleicht den Hardware-Wert: Anschaffungskosten geteilt durch dauerhafte Tokengeschwindigkeit.

RTX 5070 hat die besten Kosten pro Tok/s bei reiner Geschwindigkeit. M5 Pro gewinnt bei Energie: bei 0,15 €/kWh und 8 Std./Tag kostet M5 Pro ~1,10 €/Monat gegenüber ~16,50 €/Monat für RTX 5090.

Wenn Sie bereits einen Mac mit M5 Pro besitzen, sind die Kosten pro Tok/s für den Hardware-Anteil effektiv 0 €.

Hardware
Anfangskosten
Tok/s (8B)
Kosten pro Tok/s
Verbrauch (Inferenz)
RTX 5090 (32 GB)2.000 $17511,4 $450W
RTX 5070 (12 GB)600 $708,6 $250W
M5 Pro MacBook Pro (64 GB)2.399 $5048 $25W
M5 Max MacBook Pro (128 GB)3.199 $7046 $35W
CPU (moderner DDR5-Desktop)Enthalten150 $65W
RTX 5070 (600 $) bietet die niedrigsten Kosten pro Tok/s bei 8B-Modellen. M5 Pro gewinnt bei den Gesamtbetriebskosten, wenn Stromverbrauch und 30B-Fähigkeit einbezogen werden.
RTX 5070 (600 $) bietet die niedrigsten Kosten pro Tok/s bei 8B-Modellen. M5 Pro gewinnt bei den Gesamtbetriebskosten, wenn Stromverbrauch und 30B-Fähigkeit einbezogen werden.

Entscheidungsleitfaden für Plattformen

Entscheidungsrahmen basierend auf Modellgröße, Budget und Anwendungsfall:

  • RTX 5090 / 5080 wählen: maximale Geschwindigkeit bei 7B–14B, Produktions-Pipelines, Fine-Tuning, 24/7-Server-Workloads.
  • RTX 5070 / 5070 Ti wählen: bestes GPU-Preis-Leistungs-Verhältnis für Chat und Coding mit einem Nutzer bei 7B–13B. 600–750 $.
  • M5 Pro (64 GB) wählen: bestes Allround-Gerät für die meisten Nutzer. Führt 30B nativ aus, geringer Verbrauch, macOS-Workflow. ~2.399 $.
  • M5 Max (128 GB) wählen: für Forschung, 70B-Modelle nativ, maximale Apple-Silicon-Leistung. ~3.199 $+.
  • Nur CPU: keine zusätzliche Investition, gelegentliche 7B-Nutzung, nächtliche Batch-Verarbeitung.
Entscheidungsmatrix: RTX 50-Serie gewinnt bei roher Geschwindigkeit für 7B–14B. M5 Pro gewinnt bei Modellbandbreite (bis 30B), Verbrauch und Gesamtkosten. Nur CPU funktioniert nur für gelegentliche Nutzung.
Entscheidungsmatrix: RTX 50-Serie gewinnt bei roher Geschwindigkeit für 7B–14B. M5 Pro gewinnt bei Modellbandbreite (bis 30B), Verbrauch und Gesamtkosten. Nur CPU funktioniert nur für gelegentliche Nutzung.

Häufige Fehler bei der Hardware-Wahl

  • GPU für 30B+-Modelle wählen. Keine RTX 50-Serie-Karte lädt 30B in den VRAM. Auslagerung auf RAM erzeugt eine 5–10× Geschwindigkeitsstrafe. Verwenden Sie stattdessen M5 Pro oder M5 Max.
  • Annehmen, dass M5 base (16 GB) ausreicht. Er lädt nur 7B. Für 14B-Modelle brauchen Sie 32 GB; für 30B brauchen Sie 64 GB (M5 Pro).
  • Stromkosten für dauerhaft laufende GPU-Server ignorieren. RTX 5090 bei 8 Std./Tag = ~200 $/Jahr Strom bei 0,15 $/kWh. M5 Pro = ~14 $/Jahr.
  • RTX 5090 für 8B-Chat kaufen. RTX 5070 für 600 $ liefert 70 Tok/s bei 8B – 80 % der Geschwindigkeit zu 30 % der Kosten.
  • Erwarten, dass CPU für Echtzeit-Chat praktikabel ist. Selbst 20 Tok/s fühlt sich langsam an. 5–8 Tok/s auf DDR4 ist für interaktive Nutzung unbrauchbar.

Häufig gestellte Fragen

Ist GPU oder CPU besser zum Ausführen lokaler LLMs?

Für Echtzeitinferenz ist NVIDIA-GPU schneller: RTX 5070 führt 8B-Modelle mit 60–80 Tok/s aus gegenüber 10–20 Tok/s auf einer modernen CPU mit DDR5. Apple M5 Pro mit 40–60 Tok/s übertrifft ebenfalls die CPU und kann zusätzlich 30B-Modelle nativ ausführen.

Kann Apple Silicon lokale LLMs ausführen?

Ja. Die Apple M5-Serie führt 7B-Modelle mit 25–80 Tok/s aus, je nach Chip-Klasse. M5 Pro (64 GB) führt 30B-Modelle nativ mit 20–30 Tok/s aus – das kann keine Consumer-GPU erreichen. M5 Max (128 GB) führt 70B-Modelle nativ mit 35–50 Tok/s aus.

Was ist der minimale GPU-VRAM für lokale LLMs?

12 GB VRAM (RTX 5070) führen 7B–8B-Modelle bei Q4–Q8-Quantisierung problemlos aus. 16 GB (RTX 5080) verarbeiten 13B-Modelle. 24–32 GB werden für 30B-Modelle benötigt, aber keine einzelne Consumer-GPU lädt 30B vollständig – verwenden Sie stattdessen Apple M5 Pro mit 64 GB.

Wie viel schneller ist GPU vs CPU bei der LLM-Inferenz?

RTX 5090 ist 8–15× schneller als eine moderne CPU mit DDR5 bei 8B-Modellen (175 Tok/s gegenüber 15 Tok/s). Der Unterschied kommt von der Speicherbandbreite: 1.792 GB/s (GDDR7) gegenüber 89 GB/s (DDR5). Apple M5 Pro mit 307 GB/s liegt mit 40–60 Tok/s dazwischen.

Lohnt sich der GPU-Kauf nur für lokale LLMs?

RTX 5070 (600 $) amortisiert über 3 Jahre kostet weniger als OpenAI-API-Gebühren für Vielnutzer mit 2+ Stunden pro Tag. Mit 70 Tok/s verarbeitet sie Echtzeit-Chat und Coding-Unterstützung. Wenn Sie 30B+-Modelle brauchen, bietet M5 Pro trotz höherer Anschaffungskosten mehr Wert.

Was ist Speicherbandbreite und warum ist sie für LLMs wichtig?

LLM-Inferenz ist speichergebunden. Token-Geschwindigkeit ≈ Speicherbandbreite ÷ Modellgewichte. RTX 5090: 1.792 GB/s. M5 Max: 460–614 GB/s. M5 Pro: 307 GB/s. CPU DDR5: 89 GB/s. Deshalb kann Apple Silicon mit einheitlichem Speicher große Modelle effizient ausführen, trotz geringerer roher Bandbreite als Top-GPUs.

Welcher Apple Silicon Chip ist 2026 am besten für lokale LLMs?

M5 Pro (64 GB, 307 GB/s) ist das beste Allround-Gerät für die meisten Nutzer – führt 30B-Modelle nativ mit 20–30 Tok/s für ~2.399 $ aus. M5 Max (128 GB, 460–614 GB/s) für 70B-Modelle mit 35–50 Tok/s (~3.199 $+). Vermeiden Sie M5 base (16 GB) für alles über 7B hinaus.

Kann Apple Silicon 30B- und 70B-Modelle ausführen?

M5 Pro (64 GB) führt 30B-Modelle nativ mit 20–30 Tok/s aus. M5 Max (128 GB) führt 70B-Modelle nativ mit 35–50 Tok/s aus. Das sind reale Durchsatzwerte ohne CPU-Offloading – keine Consumer-GPU kann das bei 30B+ erreichen.

Lohnt sich RTX 5090 für 2.000 $ bei lokalen LLMs?

Nur, wenn Ihr Workflow 7B–14B-Modelle bei maximaler Geschwindigkeit erfordert oder Sie Produktions-Inferenz-Pipelines betreiben. Für die meisten liefert RTX 5070 (600 $) 80 % der Geschwindigkeit zu 30 % der Kosten. Für 30B+-Modelle ist M5 Pro unabhängig vom Budget die bessere Wahl.

Wie vergleicht sich der Stromverbrauch zwischen GPU und Apple Silicon?

RTX 5090 zieht ~450 W bei Inferenzlast. M5 Pro zieht ~25 W. Bei 8 Std./Tag und 0,15 $/kWh sind das 200 $/Jahr (RTX 5090) gegenüber 14 $/Jahr (M5 Pro). Für Privatnutzer und alle mit gewerblichen Stromtarifen ist die Energieeffizienz von M5 Pro ein spürbarer Kostenvorteil.

Wie schnell ist LLM-Inferenz auf einem Intel MacBook Pro (i9, 16 GB RAM)?

Langsamer als Apple Silicon und langsamer als ein moderner DDR5-Desktop. Intel MacBook Pros haben keinen Unified-Memory-GPU-Pfad für llama.cpp — die Inferenz läuft rein auf der CPU über DDR4, mit etwa 38–45 GB/s Dual-Channel-Bandbreite gegenüber 89 GB/s bei einer modernen DDR5-Desktop-CPU. Mit der oben genannten Formel Speicherbandbreite ÷ Modellgröße landet ein quantisiertes 7B-Modell (~4,5 GB bei Q4) bei theoretisch etwa 8–10 Tok/Sek., realistisch bei 4–7 Tok/Sek. unter Berücksichtigung des CPU-Rechenaufwands. 16 GB Gesamt-RAM begrenzen Sie zudem auf etwa 7B–8B bei Q4 mit Spielraum für das Betriebssystem — erwarten Sie keine 13B+-Modelle ohne starkes Swapping und einen deutlichen Geschwindigkeitseinbruch.

Was ist der Unterschied zwischen pp Tok/Sek. und tg Tok/Sek.?

pp Tok/Sek. (Prompt Processing) misst, wie schnell das Modell Ihren Eingabe-Prompt verarbeitet — die "Prefill"-Phase, die rechengebunden ist und mit paralleler Hardware wie GPUs gut skaliert. tg Tok/Sek. (Token Generation) misst, wie schnell es jedes neue Ausgabe-Token erzeugt — die "Decode"-Phase, die speicherbandbreitengebunden ist (siehe die Bandbreitenformel oben). GPUs zeigen typischerweise eine große pp/tg-Lücke (schnelles Prefill, durch Bandbreite begrenzte Generierung); der Unified Memory von Apple Silicon hält beide Werte näher beieinander. Prüfen Sie beim Vergleich von Benchmarks immer, welche Zahl Sie gerade lesen — pp und tg können auf derselben Hardware um das 5- bis 20-Fache voneinander abweichen.

Muss ich bei der Verwendung lokaler LLMs die DSGVO beachten?

Ja. DSGVO Artikel 28 (Prozessor vs. Verantwortlicher), BSI-IT-Grundschutz-Kataloge. Egal ob RTX 5070 oder Apple M5 Pro: Lokale Inferenz hält Eingabe- und Ausgabedaten auf Ihrer eigenen Hardware — das Art.-44-Transferrisiko für die KI-Schicht entfällt. DSGVO-Konformität und BSI-IT-Grundschutz hängen vom Gesamtsystem und Ihren TOMs ab, nicht vom GPU- oder Chip-Modell.

Ist lokale LLM-Hardware für den deutschen Mittelstand geeignet?

Ja, besonders für den Mittelstand. RTX 5070 (600 $) ist ein kostengünstiger Einstieg, keine Abhängigkeit von US-Cloud-APIs. Lokale Inferenz hält Eingabe- und Ausgabedaten auf Ihrer eigenen Hardware — das Art.-44-Transferrisiko für die KI-Schicht entfällt. DSGVO-Konformität und BSI-IT-Grundschutz-Konformität hängen vom Gesamtsystem und Ihren TOMs ab, nicht vom Hardware-Modell. Lokale Hardware in Deutschland/Österreich/Schweiz vermeidet Datentransfers ins Ausland.

Quellen

  • NVIDIA GPU-Spezifikationen — RTX 50 Serie GPU-Spezifikationen, VRAM, Speicherbandbreite.
  • Apple M3 Leistung — M5 Max einheitliche Speicherarchitektur und Inferenzleistung.
  • vLLM-Benchmarks — Produktions-LLM-Inferenz-Durchsatz-Benchmarks.
  • Unterschiedliche Hardware erzeugt unterschiedliche Token-Raten, aber jede Inferenz profitiert von strukturierten Prompts. Lange Kontextanfragen erfordern andere Techniken als kurze: Kontextfenster erklärt behandelt Strategien für jede Hardware.

Hinweis zu Drittanbieter-Fakten

Dieser Artikel referenziert KI-Modelle, Benchmarks, Preise und Lizenzen von Drittanbietern. Die KI-Landschaft verändert sich schnell. Benchmark-Werte, Lizenzbedingungen, Modellnamen und API-Preise können sich zwischen dem Zeitpunkt der Erstellung und dem Zeitpunkt ändern, zu dem Sie dies lesen. Bevor Sie Bereitstellungs- oder Compliance-Entscheidungen auf Basis dieses Artikels treffen, überprüfen Sie aktuelle Zahlen bei der offiziellen Quelle jedes Anbieters: Hugging-Face-Modellkarten für Lizenzen und Benchmarks, Anbieter-Websites für API-Preise und EUR-Lex für den aktuellen DSGVO- und EU-KI-Gesetz-Text.

Nutzen Sie PromptQuorum mit einem lokalen LLM, eigenen API-Schlüsseln oder beidem — Sie wählen das Backend.

PromptQuorum-Beta herunterladen →

← Zurück zu Lokale LLMs