Wichtigste Erkenntnisse
- Apple Silicon eliminiert VRAM-Grenzen — der gesamte 32–128 GB einheitliche Speicher steht dem Modell zur Verfügung. RTX 4090 hat eine harte 24 GB-Grenze.
- M5 Pro (64 GB) erzeugt 34B-Modelle bei 15–20 Token/Sekunde. M5 Max (128 GB) erzeugt 70B-Modelle bei 12–18 tok/s. Beides bei 25–70 W Stromverbrauch gegenüber 300–450 W für Desktop-GPUs.
- Metal-GPU-Beschleunigung funktioniert automatisch in Ollama, MLX und llama.cpp. Keine Treiber-Abstimmung erforderlich.
- Speicherbandbreite (M5 Pro 307 GB/s, M5 Max 460–614 GB/s) ist der Engpass, nicht GPU-Kernzahl. M5 Pro liefert etwa 1/3 der RTX-4090-Geschwindigkeit basierend auf reiner Bandbreite.
- Kaufen Sie maximalen Speicher zum Zeitpunkt des Kaufs — kann nach dem Kauf nicht aufgerüstet werden. 36 GB Minimum empfohlen; 64 GB+ für Zukunftssicherheit bis 2027–2028.
- M5 Pro bietet das beste Preis-Leistungs-Verhältnis. M5 Max ist nur notwendig, wenn Sie regelmäßig 70B-Modelle oder multimodale Stacks (Vision + LLM + TTS) benötigen.
- M5 Ultra (Mac Studio, ab 5.499 $) ist jetzt tatsächlich lieferbar, keine Projektion mehr — bis zu 512 GB einheitlicher Speicher ermöglicht 70B FP16 (verlustfreie Qualität) und 120B+-Modelle.
📍 In einem Satz
Apple M5 Pro (64 GB) läuft mit 8B-Modellen bei 45–55 Tok/s und 34B bei 15–20 Tok/s; M5 Max (128 GB) mit 70B bei 12–18 Tok/s — alles bei 25–70 W ohne VRAM-Grenzen dank Unified Memory.
💬 In einfachen Worten
Unified Memory bedeutet: CPU, GPU und KI-Engine teilen denselben Speicher. Ein Mac mit 128 GB kann alle 128 GB für ein Modell nutzen, anders als eine GPU, die auf ihren VRAM begrenzt ist (max. 24 GB beim RTX 4090). Deshalb können Macs 70B-Modelle ausführen, die kein Consumer-GPU von NVIDIA fassen kann.
- Alle M-Serie-Chips verwenden einheitlichen Speicher (GPU + CPU teilen denselben RAM-Pool) — dies ist der Hauptvorteil gegenüber diskreten GPUs.
- M6 (Mac mini) sowie M5 Pro/M5 Max/M5 Ultra (Mac mini und Mac Studio) sind nach Apples Refresh vom 25.8.2026 die 2026-Empfehlungen für neue Käufer; M4 und älter sind noch lebensfähig, aber weniger zukunftssicher für wachsende Modellgrößen.
- Metal ist Apples GPU-Programmierframework; es ist in macOS integriert und erfordert keine externen Bibliotheken oder Treiber-Updates.
- Framework-Wahl (Ollama, MLX, llama.cpp) beeinflusst die Geschwindigkeit um 0–25%, ändert aber nicht, welche Modelle in den Speicher passen.
- Mac mini M6 (ab 899 $, max. 32 GB) ist der günstigste Einstiegspunkt und läuft unter Last völlig geräuschlos.
- Durchschnittliche jährliche Stromkosten: Mac mini M6 (ca. 35 $) vs. Desktop RTX 4090 (ca. 400 $) — ein 10× Unterschied in Betriebsausgaben.
Warum Apple Silicon für lokale LLMs?
Apple Silicon zeichnet sich beim lokalen LLM-Inferencing aus einem Grund aus: einheitlicher Speicher. Wenn Sie einen Mac mit 64 GB RAM kaufen, stehen alle 64 GB dem LLM-Modell zur Verfügung. Eine diskrete GPU wie RTX 4090 hat nur 24 GB VRAM (getrennt von Ihrem Arbeitsspeicher) — Modelle größer als 24 GB passen einfach nicht ohne komplexe Multi-GPU-Setups und zusätzliche Hardwarekosten.
Dieser architektonische Unterschied ist transformativ für lokale KI:
- Einheitlicher Speicher: Der gesamte RAM ist verfügbar (32–128 GB). RTX 4090: nur diskreter VRAM (24 GB hartkodiert).
- Metal-Beschleunigung: GPU-Inferencing ohne CUDA-Abhängigkeit oder proprietäre Treiber-Updates.
- Stromeffizienz: 30–70 W unter Last versus 300 W+ für Desktop-GPU. Ermöglicht lüfterloses oder fast lautloses Betrieb.
- Stille: Mac mini und MacBook Air sind bei Leerlauf und unter leichten Lasten völlig lüfterlos. Desktop-GPU-Systeme haben 70+ dB unter Last.
- Keine Treiberverwaltung: Metal funktioniert out-of-the-box auf macOS. Keine CUDA-Versionskonflikte, keine NVIDIA-Treiber-Updates erforderlich.
- Hardwarekosten: M5-Pro-Mac-mini (1.699 $) mit 64-GB-Speicher versus Dual-GPU-Setup (4.000 $+) für entsprechende Modellkapazität.
Apple-Silicon-Chips für LLMs — Vollständiger Vergleich
Chip | Max. Speicher | Speicherbandbreite | GPU-Kerne | LLM-Optimum | Veröffentlicht |
|---|---|---|---|---|---|
| M1 | 16 GB | 68 GB/s | 8 | 7B Q4 | Nov 2020 |
| M1 Pro | 32 GB | 200 GB/s | 16 | 13B Q4 | Okt 2021 |
| M1 Max | 64 GB | 400 GB/s | 32 | 34B Q4 | Okt 2021 |
| M1 Ultra | 128 GB | 800 GB/s | 64 | 70B Q4 | Mär 2022 |
| M2 | 24 GB | 100 GB/s | 10 | 7–13B Q4 | Jun 2022 |
| M2 Pro | 32 GB | 200 GB/s | 19 | 13B Q4 | Jan 2023 |
| M2 Max | 96 GB | 400 GB/s | 38 | 34–70B Q4 | Jan 2023 |
| M2 Ultra | 192 GB | 800 GB/s | 76 | 70B+ Q4 | Jun 2023 |
| M3 | 24 GB | 100 GB/s | 10 | 7–13B Q4 | Okt 2023 |
| M3 Pro | 36 GB | 150 GB/s | 18 | 13–34B Q4 | Okt 2023 |
| M3 Max | 128 GB | 400 GB/s | 40 | 70B Q4 | Okt 2023 |
| M4 | 32 GB | 120 GB/s | 10 | 13B Q4 | Mai 2024 |
| M4 Pro | 48 GB | 273 GB/s | 20 | 34B Q4 | Okt 2024 |
| M4 Max | 128 GB | 546 GB/s | 40 | 70B Q4 | Okt 2024 |
| M5 (Basis) | 32 GB | ~150 GB/s | 10 | 13B Q4 | Okt 2025 |
| M6 (Mac mini) | 32 GB | 170 GB/s | 12 | 13B Q4 | Aug 2026 |
| M5 Pro | 64 GB | 307 GB/s | ~20 | 34B Q5 | Aug 2026 |
| M5 Max | 128 GB | 460–614 GB/s | ~40 | 70B Q5 | Aug 2026 |
| M5 Ultra | 512 GB | Noch nicht veröffentlicht | Noch nicht veröffentlicht | 120B+ Q4 / 70B FP16 | Aug 2026 |
M5 Pro debütierte im MacBook Pro (März 2026); der Refresh vom 25.8.2026 brachte ihn zusammen mit dem neuen M6 in den Mac mini. M5 Max und M5 Ultra sind seit dem 25.8.2026 neu im Mac Studio. Alle vier werden ab 22.9.2026 ausgeliefert, außer der 512-GB-Konfiguration des M5 Ultra, die Ende Oktober 2026 folgt. Apple hat GPU-Kernzahl und Speicherbandbreite für M5 Ultra noch nicht veröffentlicht.
Speicherbandbreite ist wichtiger als Speichergröße
LLM-Inferencing ist speicherbandbreitenbegrenzt, nicht rechenbegrenzt. Das bedeutet, die Token-Generierungsgeschwindigkeit skaliert linear mit der Bandbreite, nicht mit GPU-Kernzahl.
M5 Max bei 614 GB/s gegenüber RTX 4090 bei 1.008 GB/s könnte den Anschein erwecken, dass NVIDIA bei Rohbandbreite gewinnt. Aber Apple-Silicon-Benutzer haben den GESAMTEN Speicher verfügbar (keine diskrete VRAM-Grenze), daher können sie größere Modelle laden, die NVIDIA nicht in 24 GB Speicher passen kann. Der echte Vergleich: M5 Max beim Ausführen eines 70B-Modells versus RTX 4090 beim Scheitern, das 70B-Modell überhaupt zu laden.
- M5 Basis (150 GB/s) → ~25–30 tok/s auf Llama 3.1 8B Q4
- Mac mini M6 (170 GB/s) → ähnlicher Bereich wie M5 Basis, dank höherer Bandbreite etwas höher. Es existieren noch keine unabhängigen Benchmarks — Apple hat auch keine tok/s-Zahlen veröffentlicht.
- M5 Pro (307 GB/s) → ~50–60 tok/s auf Llama 3.1 8B Q4 (2× schneller als M5 Basis wegen 2× Bandbreite)
- M5 Max (614 GB/s) → ~100–120 tok/s auf Llama 3.1 8B Q4
- M5 Ultra: Apple hat die Speicherbandbreite für M5 Ultra nicht veröffentlicht. Behandeln Sie keine tok/s-Schätzung als verifiziert, bis unabhängige Benchmarks vorliegen.
- Fazit: M5 Pro ist genau 2× schneller als M5 Basis beim gleichen Modell, da die Bandbreite verdoppelt wurde. Beim Kauf sollten Sie die Bandbreite gegenüber GPU-Kernzahl priorisieren.

Stromeffizienz und Thermalmanagement — Der stille Vorteil
Setup | Stromverbrauch (Idle) | Stromverbrauch (LLM) | Lautstärke | Wärmestrahlung |
|---|---|---|---|---|
| Mac mini M6 | 5W | 25–35W | Geräuschlos (lüfterlos) | Warm |
| MacBook Air M5 | 3W | 20–30W | Geräuschlos (lüfterlos) | Warm |
| Mac mini M5 Pro | 5W | 40–60W | Leise (Lüfter selten) | Kühl |
| Mac Studio M5 Max | 10W | 60–100W | Leise | Kühl |
| Mac Studio M5 Ultra | 10W | Noch nicht veröffentlicht | Leise | Kühl |
| Desktop RTX 4090 | 50W | 350–450W | Laut (3 Lüfter) | Heiß |
| Desktop RTX 3060 | 30W | 170–200W | Moderat | Warm |
Jährliche Stromkosten bei 0,15$/kWh, 24/7 KI-Server: Mac mini M6 (~35$/Jahr) vs. Desktop RTX 4090 (~400$/Jahr). Lastverbrauch des Mac Studio M5 Ultra von Apple noch nicht veröffentlicht.

Echte Anwenderszenarien auf Apple Silicon
- 1Coding-Agent
Why it matters: Llama 3.1 8B auf M5 Pro liefert 50 tok/s, Code-Vervollständigung in 1–2 Sekunden. Läuft lautlos im Hintergrund auf MacBook Pro. - 2RAG-Pipeline
Why it matters: Embedding-Modell + Llama 3.1 8B + ChromaDB passt vollständig in 36GB M5-Pro-Speicher. Keine GPU-Grenzen. - 3Sprachassistent
Why it matters: Whisper Metal + Ollama Llama + Piper TTS = 1,2s Latenz auf M5 Pro. Lüfterloses Mac mini für Always-On-Setup geeignet. - 4Multimodal
Why it matters: Whisper + LLaVA 7B Vision + Llama 3.1 8B Reasoning = alle passen in 36GB, gleichzeitige Verarbeitung. - 5Private Schrift
Why it matters: Llama 3.3 70B Q5 auf M5 Max 128GB = höchste Qualität, vollständig offline, keine API-Kosten, null Datenlecks. Auf dem neuen Mac Studio M5 Ultra (bis 512GB) werden 120B+-Modelle möglich für maximale Qualitätsansprüche.
Welchen Mac sollten Sie kaufen?
- Unter 900$: Mac mini M6 (32GB) → Modelle bis 13B, 170 GB/s Bandbreite, Auslieferung ab 22.9.2026
- 1.699$: Mac mini M5 Pro (64GB) → bis zu 34B-Modelle bei 40–50 tok/s
- 1.500–2.500€: MacBook Pro M5 Pro (64GB) → tragbare KI-Workstation, gleiche Leistung wie Mac mini
- 2.499$: Mac Studio M5 Max (128GB) → 70B-Modelle bei 15–20 tok/s, Always-On-Server
- Ab 5.499$: Mac Studio M5 Ultra (bis 512GB) → einzige Verbraucher-Hardware für 120B+-Modelle; 512-GB-Konfiguration ab Ende Oktober 2026, erwartet deutlich über 10.000$
- Kritisch: Kaufen Sie immer maximalen Speicher — können nicht später aufgerüstet werden. Speicherkosten beim Verkauf betragen 5–10% der Gesamtsumme; einen ganzen Mac später zu ersetzen kostet 100%.
Erste Schritte: Framework-Überblick
- Ollama: einfachste Einrichtung, automatische Metal-Erkennung, keine Konfiguration. REST-API inbegriffen. Beste für Anfänger.
- MLX: Apples nationales Framework, schnellstes Inferencing (15–25% schneller als Ollama), Python-Integration, LoRA-Feinabstimmung. Steilere Lernkurve.
- llama.cpp: plattformübergreifend, meiste Modellformatunterstützung, Metal-Backend. Beste für Integration in größere Anwendungen.
Was hat Apple am 25. August 2026 für Mac mini und Mac Studio angekündigt?
Apple überarbeitete den Mac mini mit dem neuen M6-Chip (899 $, max. 32 GB) und M5 Pro (1.699 $, max. 64 GB) sowie den Mac Studio mit M5 Max (2.499 $, max. 128 GB) und M5 Ultra (5.499 $, bis 512 GB in der Spitzenkonfiguration). Alle werden ab dem 22. September 2026 ausgeliefert, außer der 512-GB-Konfiguration des M5 Ultra, die Ende Oktober 2026 folgt.
Ist M5 Pro oder M5 Max besser für lokale LLMs?
M5 Pro (64GB) ist das beste Preis-Leistungs-Verhältnis — führt 34B-Modelle gut aus und kostet ab 1.699 $. M5 Max (ab 2.499 $) ist nur notwendig, wenn Sie häufig 70B-Modelle benötigen. Die meisten Benutzer sind mit M5 Pro zufrieden.
Kann ich den Speicher nach dem Kauf eines Mac aufgerüsten?
Nein. Apple-Silicon-Speicher ist gelötet und nicht aufrüstbar. Kaufen Sie den maximalen Speicher, den Sie sich leisten können.
Welche deutschen Compliance-Anforderungen sollte ich beachten?
Für lokale Inferencing müssen Sie DSGVO-Artikel 28 erfüllen und BSI-Grundschutz-Kataloge beachten. Lokale Modelle auf Apple Silicon eliminieren Datentransferprobleme, was die Compliance vereinfacht.
Kann das M5 Pro mit RTX 4090 konkurrieren?
Bei Modellen, die in 24GB VRAM passen, ist RTX 4090 20–30% schneller. Bei 70B-Modellen gewinnt M5 Pro deutlich, weil RTX 4090 sie nicht laden kann (24GB-Grenze).
Ändert der M5 Ultra mit bis zu 512 GB Speicher etwas?
Ja. Der M5 Ultra (Mac Studio, ab 5.499 $, bis 512 GB in der Spitzenkonfiguration, ab 22. September / Ende Oktober 2026 verfügbar) führt 70B-Modelle in FP16 (ohne Qualitätsverlust) aus und ermöglicht erstmals 120B+-Modelle auf Verbraucher-Hardware. Es existieren noch keine unabhängigen Benchmarks — dieser Artikel wird aktualisiert, sobald Dritte tok/s-Zahlen nach dem Marktstart veröffentlichen.
