Wichtigste Erkenntnisse
- 4 GB RAM, nur CPU: Qwen3 1.7B Q4_K_M — 25–40 Tok/s. Schnellste Antwort auf minimaler Hardware.
- 8 GB RAM, nur CPU (Sweet Spot): Phi-4-mini 3.8B Q4_K_M — 15–25 Tok/s. Coding und Reasoning auf alten Notebooks.
- 8 GB RAM + Intel-Iris-iGPU: Qwen3 4B — 12–20 Tok/s mit partiellem GPU-Offload.
- 16 GB RAM, nur CPU: Qwen3 8B Q4_K_M — 8–15 Tok/s. Starke Qualität, keine GPU nötig.
- 16 GB RAM + iGPU: Llama 3.2 3B oder Qwen3 4B — 20–35 Tok/s mit Layer-Offload.
- Fazit: Für die meisten Low-End-PCs ist Phi-4-mini (3.8B) bei Q4_K_M der Sweet Spot — passt in 8 GB RAM, 15–25 Tok/s auf CPU. Wechseln Sie zu Qwen3 1.7B für die schnellstmögliche Antwort.
- Kosten: Alle kostenlos (Open Source) im Vergleich zur ChatGPT-API (~0,002 USD pro 1.000 Token).
📍 In einem Satz
Auf einem CPU-only-PC mit 8 GB RAM läuft Phi-4-mini 3.8B Q4_K_M mit 15–25 Tok/s für Coding und Reasoning; bei 4 GB RAM erreicht Qwen3 1.7B Q4_K_M 25–40 Tok/s.
💬 In einfachen Worten
Du brauchst keine Gaming-GPU für eine lokale KI. Diese Modelle laufen komplett auf CPU und normalem RAM. Kleinere Modelle (1–4B Parameter) sind für Alltagsaufgaben überraschend leistungsfähig und schnell genug für echte Unterhaltungen.
Welches Modell ist das schnellste für Ihre Hardware?
Stimmen Sie Ihre Hardware auf das richtige Modell ab — die falsche Wahl verschenkt 4–10× Geschwindigkeit. Alle Stufen unten sind CPU-only, sofern nicht anders angegeben.
| Ihre Hardware | Empfohlenes Modell | Ollama-Befehl | Erwartete Geschwindigkeit |
|---|---|---|---|
| 4 GB RAM, nur CPU | Qwen3 1.7B Q4_K_M | ollama run qwen3:1.7b | 25–40 Tok/s |
| 8 GB RAM, nur CPU | Phi-4-mini 3.8B Q4_K_M | ollama run phi4-mini | 15–25 Tok/s |
| 8 GB RAM + Intel-Iris-iGPU | Qwen3 4B Q4_K_M | ollama run qwen3:4b | 12–20 Tok/s |
| 16 GB RAM, nur CPU | Qwen3 8B Q4_K_M | ollama run qwen3:8b | 8–15 Tok/s |
| 16 GB RAM + iGPU | Llama 3.2 3B Q4_K_M | ollama run llama3.2:3b | 20–35 Tok/s |
Welches Modell sollten Sie verwenden?
Stimmen Sie Ihre Situation auf das richtige Modell ab — das ist die wichtigste Entscheidung:
- Notebook mit 8 GB RAM (keine dedizierte GPU): Phi-4-mini (3.8B) bei Q4_K_M — 15–25 Tok/s, übernimmt Coding und Reasoning. `ollama run phi4-mini`
- 4 GB RAM, sehr alter PC: Qwen3 1.7B Q4_K_M — 25–40 Tok/s, schnellste Antwort bei minimalem RAM. `ollama run qwen3:1.7b`
- 16 GB RAM, keine GPU: Qwen3 8B Q4_K_M — 8–15 Tok/s, starke Qualität. `ollama run qwen3:8b`
- 8 GB RAM + Intel-Iris-iGPU: Qwen3 4B — verwenden Sie `OLLAMA_NUM_GPU=1` für partiellen Offload, 12–20 Tok/s. `ollama run qwen3:4b`
- Mehrsprachig gewünscht (128K Kontext): Qwen3 4B oder Llama 3.2 3B — beide unterstützen 128K Kontext auf Ollama.
- Empfehlungen je RAM-Stufe und Wärmemanagement finden Sie im Leitfaden zum Betrieb eines lokalen LLM auf einem Notebook.
Welches lokale LLM sollten Sie auf Ihrer Hardware ausführen?
Alle Stufen unten sind CPU-only oder iGPU. Wählen Sie das größte Modell, das bei Q4_K_M in Ihr RAM passt — Quantisierung beeinträchtigt die Qualität weniger als der Wechsel zu einem kleineren Modell.
| Hardware | Model | Quant | Speed | Experience |
|---|---|---|---|---|
| 4 GB RAM, nur CPU | Qwen3 1.7B | Q4_K_M | 25–40 t/s | schnell, nutzbare Qualität |
| 8 GB RAM, nur CPU | Phi-4-mini 3.8B | Q4_K_M | 15–25 t/s | Coding + Reasoning |
| 8 GB RAM + iGPU Iris | Qwen3 4B | Q4_K_M | 12–20 t/s | partieller GPU-Offload |
| 16 GB RAM, nur CPU | Qwen3 8B | Q4_K_M | 8–15 t/s | starke Qualität |
| 16 GB RAM + iGPU | Llama 3.2 3B | Q4_K_M | 20–35 t/s | flüssig mit iGPU |

GPU vs. CPU für lokale LLMs: Was ist schneller auf Low-End-Hardware?
GPU-Inferenz: 15–20 Tok/Sek auf RTX 3060. Erfordert CUDA-Setup. Schnell, beste Qualität. Weitere kostengünstige Optionen finden Sie im Budget-GPU-Leitfaden.
iGPU (integrierte Grafik): 5–8 Tok/Sek auf Intel Iris. Kein Setup erforderlich. Langsamer als dedizierte GPU.
CPU-Inferenz: 1–5 Tok/Sek auf modernem Multi-Core. Läuft überall. Am langsamsten.
Regel: Wenn Sie eine GPU haben (auch integriert), verwenden Sie diese. CPU ist die letzte Option.

Warum kleinere Modelle auf Low-End-PCs schneller sind
Die Modellgröße bestimmt direkt die Geschwindigkeit. Ein 1B–3B-Modell passt vollständig in den Systemspeicher, sodass CPU oder GPU Daten kontinuierlich streamen können. Größere Modelle erfordern Memory-Swapping — das Verschieben von Daten zwischen RAM und Festplatte — was die Generierung um das 10–100-fache verlangsamt (der Engpass ist Disk-I/O, nicht die Berechnung).
Die obige Hardware-Entscheidungstabelle spiegelt dieses Prinzip wider: TinyLlama 1,1B (1B Parameter) erreicht 5–10 Tok/Sek auf alten CPUs, während 13B+-Modelle auf Low-End-Hardware unpraktisch sind, weil Swapping dominiert.
- 1B–3B-Modelle: Passen in 4–8 GB RAM → schnellste Generierung → akzeptable Qualität
- 7B-Modelle: Grenzwertig auf 8-GB-Systemen → langsamer durch Speicherdruck → hohe Qualität
- 13B+-Modelle: Benötigen 16+ GB VRAM oder Swap → zu langsam für interaktive Nutzung
Wie schnell sind lokale LLMs auf Low-End-PCs?
Auf CPU-only-Systemen erwarten Sie:
- 3B-Modelle → 15–40 Token/Sek (ältere CPUs: 10–15, neuere CPUs mit Optimierung: 30–40)
- 7B-Modelle → 10–25 Token/Sek (abhängig von CPU-Kernen und Quantisierung; mit aggressiver Optimierung teils 30+)
- Das ist langsamer als Cloud-APIs (ChatGPT 4o: 80–150 Tok/Sek), aber ausreichend für interaktive Nutzung. Ein 3B-Modell mit 25 Tok/Sek generiert eine 500-Token-Antwort in 20 Sekunden — akzeptabel für nicht zeitkritische Aufgaben wie Code-Review, Zusammenfassung und kreatives Schreiben.
Wie beeinflusst Quantisierung die Geschwindigkeit auf Low-End-PCs?
Q4 (4-Bit): ~1 % Qualitätsverlust, 50 % VRAM-Einsparung. Standardauswahl. Details zu allen Quantisierungsstufen finden Sie im vollständigen Leitfaden.
Q3 (3-Bit): ~3 % Qualitätsverlust, 62 % VRAM-Einsparung. Akzeptabel für Chat.
Q2 (2-Bit): ~10 % Qualitätsverlust, 75 % VRAM-Einsparung. Riskant; nur bei OOM verwenden.
Geschwindigkeitsauswirkung: Q2 ist ~30 % schneller als Q4 durch geringere Speicherbandbreite, nicht durch Berechnung.
Strategie: Größere Modelle quantisieren (Mistral Small Q2) statt winzige Modelle verwenden (TinyLlama).
Mistral Small Q2 > TinyLlama 1,1B Q4 in Geschwindigkeit und Qualität.
Schnellere Modelle opfern Qualität für Geschwindigkeit — aber durch Anpassen von Temperature und top-p lässt sich viel dieser Qualität zurückgewinnen. Niedrigere Temperature (0,1–0,3) bei schnellen Modellen erzeugt konsistentere Ausgabe als Standardeinstellungen. Siehe Temperature und top-p erklärt für die genauen Einstellungen.
Wie beschleunigen Sie CPU-only-Inferenz?
- AVX-512 aktivieren: Wenn die CPU dies unterstützt, verwenden Sie `LLAMACPP_AVX512=1 ollama run phi`. ~20 % Geschwindigkeitszuwachs.
- Kontextfenster reduzieren: Kürzerer Kontext = schneller. Verwenden Sie `--ctx-size 1024` statt 4096.
- llama.cpp statt Ollama verwenden:** Auf CPU leicht schneller (~10 % Gewinn) durch weniger Overhead.
- Multithreading deaktivieren: Kontraintuitiv, aber auf schwachen CPUs ist Single-Threaded schneller (kein Thread-Overhead).
- Auf iGPU auslagern: Selbst eine schwache integrierte GPU schlägt die CPU. Prüfen Sie mit `lspci` die GPU-Verfügbarkeit.
Wie schnell sind diese Modelle? Echte Benchmarks (Juli 2026)
Echte Messungen nach Hardware-Stufe, Juli 2026. Alle mit Ollama und Standardeinstellungen, ohne Tuning. Alle CPU-only oder iGPU — keine dedizierte GPU:
- 4 GB RAM, nur CPU (Intel-N100-Mini-PC) + Qwen3 1.7B Q4_K_M: 25–35 Tok/s. `ollama run qwen3:1.7b`
- 8 GB RAM, nur CPU (Core i5-1235U) + Phi-4-mini Q4_K_M: 15–22 Tok/s. `ollama run phi4-mini`
- 8 GB RAM, nur CPU (Ryzen 5 5600G mit Radeon-iGPU) + Qwen3 4B Q4_K_M: 18–25 Tok/s mit Layer-Offload.
- 8 GB RAM + Intel Iris Xe (i5 der 12. Generation) + Qwen3 4B Q4_K_M: 12–18 Tok/s. `ollama run qwen3:4b`
- 16 GB RAM, nur CPU (Ryzen 7 7700X) + Qwen3 8B Q4_K_M: 8–13 Tok/s. `ollama run qwen3:8b`
- 16 GB RAM + Iris-Xe-iGPU + Llama 3.2 3B Q4_K_M: 20–30 Tok/s. `ollama run llama3.2:3b`
Was ist bei lokalen LLMs tatsächlich „schnell"?
Geschwindigkeit fühlt sich je nach Aufgabe unterschiedlich an — nutzen Sie dies als Referenz:
Läuft Ihr Modell unter 15 Tok/s, verkleinern Sie das Modell (7B → 3B) oder senken Sie eine Quantisierungsstufe (Q5 → Q4), bevor Sie neue Hardware kaufen.
- Unter 10 Tok/s → fühlt sich kaputt an. Wörter erscheinen einzeln mit spürbaren Pausen. Für interaktiven Chat unbrauchbar.
- 15–25 Tok/s → akzeptabel. Lesbare Geschwindigkeit für die meisten Nutzer. Gut für Q&A, Zusammenfassungen und Coding-Hilfe.
- 30+ Tok/s → flüssig. Fühlt sich wie ein echter Assistent an. Angenehm für alle interaktiven Aufgaben.
- 60+ Tok/s → sofort. Schneller als man lesen kann. Ideal für Echtzeit-Autovervollständigung und schnelle Iteration.
Was Sie auf Low-End-PCs vermeiden sollten
- Führen Sie keine 13B+-Modelle aus — sie überschreiten die RAM-Grenzen. Ein 13B-Modell bei Q4 benötigt 8–10 GB VRAM, was die praktische Low-End-PC-Kapazität übersteigt. Selbst mit aggressiver Q2-Quantisierung benötigen 13B-Modelle 5–6 GB und lassen keinen ausreichenden Puffer für Betriebssystem und GPU-Scheduling. Bleiben Sie bei 7B und darunter.
- Vermeiden Sie Q8-Quantisierung — langsamer mit minimalem Qualitätsgewinn. Q8 verwendet fast 2× den VRAM von Q4 (8 GB vs. 5,5 GB für Mistral Small) und liefert nur ~2 % Qualitätsverbesserung. Für 4-GB-Systeme ist Q8 unpraktisch; für 8-GB-Systeme bleibt Q4 optimal. Q3 ist der einzige Kompromiss, der in Betracht gezogen werden sollte, wenn Q4 OOM-Fehler verursacht.
- Erwarten Sie keine Echtzeit-Autovervollständigung. Bei 3 Tok/Sek auf CPU dauert die Generierung von 50 Token 16 Sekunden. Interaktive Autovervollständigung erfordert ≥20 Tok/Sek. Lokale LLMs auf Low-End-CPUs eignen sich für Batch-Chat, Entwürfe und Review — nicht für Live-Autovervollständigung oder Code-während-der-Eingabe-Szenarien.
- Verwenden Sie CPU-only-Inferenz nicht für Produktions-Chatbots. Akzeptabel für interne Tools, Prototypen und Offline-Batch-Arbeit. Cloud-APIs (15–20 ms Latenz) übertreffen Low-End-CPUs (300+ ms Latenz) für benutzerseitige Dienste. Verwenden Sie lokale Inferenz für datenschutzkritische oder Offline-Szenarien, nicht für geschwindigkeitskritische.
Häufige Fehler
- Fehler: TinyLlama für Geschwindigkeit auf CPU wählen. Problem: TinyLlama gehört auf 4 GB VRAM, nicht auf CPU — Phi-4-mini 3.8B ist schneller und deutlich besser auf reiner CPU-Hardware. Lösung: Führen Sie Phi-4-mini 3.8B auf der CPU aus; reservieren Sie TinyLlama Q5 für 4 GB VRAM.
- Fehler: CPU-Beschleunigungsflags nicht aktivieren. Problem: Fehlende AVX/NEON-Aktivierung verschenkt 20 % Geschwindigkeit ohne Kosten. Lösung: Setzen Sie `LLAMACPP_AVX512=1` oder `LLAMACPP_NEON=1` vor dem Start von Ollama.
- Fehler: Q2-Quantisierung erzwingen, um 7B in 4 GB zu pressen. Problem: Q2-Quantisierung führt während der Inferenz oft zu Out-of-Memory-Abstürzen durch KV-Cache-Overhead. Lösung: Verwenden Sie stattdessen ein 3B-Modell bei Q4.
- Fehler: Annehmen, dass neuere Hardware immer schnellere Inferenz bedeutet. Problem: Desktop-Ryzen ist nicht schneller pro Token als mobiles ARM, weil Desktop-Software keine Speicheroptimierung aufweist. Lösung: Benchmarken Sie Ihre tatsächliche Hardware.
- Fehler: Falschen Ollama-Slug für Ihr Modell verwenden. Problem: `ollama run phi` lädt Phi-2, nicht Phi-4-mini. Lösung: Verwenden Sie `ollama run phi4-mini` für das neueste Phi-Modell. Prüfen Sie immer ollama.com/library für exakte Modell-Tags.
Lokale LLMs auf Low-End-PCs: Regionaler Kontext
EU / DSGVO: Lokal auf Low-End-Hardware: Keine Inferenzdaten verlassen das Gerät — für viele KMU und Freiberufler im DACH-Raum eine technisch einfache Methode, Art.-44-Transferrisiken zu vermeiden. Der EU AI Act (gültig ab Februar 2025) stellt für die persönliche Inferenz keine Dokumentationspflichten. Für deutsche KMU empfehlen die BSI-Grundschutz-Kataloge lokale Inferenz für die Verarbeitung sensibler Dokumente. Datenschutzrechtliche Gesamtkonformität hängt jedoch vom Betrieb ab, nicht allein von der Inferenz-Architektur.
Japan: Die METI-AI-Governance-Richtlinien fördern die Datenminimierung. CPU-Inferenz auf Low-End-Hardware erfüllt selbst die strengsten Datensouveränitätsanforderungen — keine API-Aufrufe, keine Protokollierung, kein Datenzugriff durch Dritte. Für japanische Nutzer, die Qwen3 auf der CPU für japanischsprachige Aufgaben ausführen, ist ein Durchsatz von 1–3 Tok/Sek für nicht zeitkritische Dokumentzusammenfassungen akzeptabel.
China: Lokale Inferenz auf Consumer-Hardware ist in China für Qwen3- und DeepSeek-R1-Deployments verbreitet, wo der Cloud-API-Zugang zu nicht-chinesischen Modellen eingeschränkt ist. Qwen3 1.7B und 4B laufen auf CPU-only-Hardware und bieten eine funktionale Alternative zu Cloud-APIs für Nutzer mit eingeschränkter Hardware.
Häufige Fragen zum Betrieb lokaler LLMs auf Low-End-PCs
Was gilt als Low-End-PC für lokale LLMs?
Ein Low-End-PC für lokale LLMs ist jede reine CPU-Maschine (keine dedizierte GPU) mit 4–16 GB Systemspeicher. Dazu gehören die meisten Notebooks mit Intel Iris oder AMD Radeon integrierter Grafik, ältere Desktop-PCs ohne dedizierte GPU sowie Mini-PCs wie der Intel N100. Die entscheidende Einschränkung ist der Systemspeicher für die Modellgewichte, nicht die CPU-Taktfrequenz.
Kann ich ein 7B-Modell ganz ohne GPU ausführen?
Ja — Qwen3 8B bei Q4_K_M läuft mit 8–15 Tok/s bei 16 GB RAM, nur CPU (getestet auf Ryzen 7 7700X). Es ist langsamer als die kleineren Optionen, liefert aber deutlich bessere Qualität. Bei 8 GB RAM bleiben Sie besser bei Phi-4-mini (3.8B) — ein 8B-Modell bei Q4_K_M braucht Spielraum, den ein 8-GB-System nicht zuverlässig garantiert.
Ist CPU-Inferenz für Chatbots nutzbar?
Ja, für interaktive Nutzung, wenn Sie die richtige Modellgröße wählen. Phi-4-mini mit 15–25 Tok/s (8 GB RAM) und Qwen3 1.7B mit 25–40 Tok/s (4 GB RAM) sind beide schnell genug für Echtzeit-Chat. Ein 7B-Modell auf CPU (8–15 Tok/s) eignet sich besser für Batch-Aufgaben — Entwürfe, Zusammenfassungen, Offline-Review — als für Live-Konversation.
Soll ich Phi-4-mini oder Qwen3 1.7B auf reiner CPU-Hardware verwenden?
Verwenden Sie Phi-4-mini (3.8B), wenn Sie 8 GB RAM haben — es übernimmt Coding und Reasoning mit 15–25 Tok/s. Verwenden Sie Qwen3 1.7B, wenn Sie nur 4 GB RAM haben oder die schnellstmögliche Antwort wollen (25–40 Tok/s) — auf Kosten etwas Qualität bei komplexen Aufgaben.
Wie prüfe ich, ob ich überhaupt eine GPU habe?
Führen Sie `nvidia-smi` im Terminal für dedizierte NVIDIA-GPUs aus. Erscheint „command not found", prüfen Sie `lspci` (Linux) oder den Geräte-Manager (Windows) auf eine Intel-Iris-Xe- oder AMD-Radeon-iGPU — diese können auch ohne CUDA-Unterstützung einige Layer auslagern.
Wie beeinflusst Quantisierung die Inferenzgeschwindigkeit?
Quantisierung reduziert primär den Speicherbandbreitenbedarf, nicht die Berechnung. Q2 (2-Bit) ist etwa 30 % schneller als Q4 (4-Bit), weil das Modell pro Forward-Pass weniger Bytes lädt. Q2 hat jedoch eine ~10 % Qualitätseinbuße. Die praktische Regel: Verwenden Sie Q4_K_M als Standard für jede Stufe in diesem Leitfaden, wechseln Sie zu Q3 nur, wenn Q4_K_M nicht in den verfügbaren RAM passt.
Kann ich unter Q2 quantisieren?
Technisch ja (Q1), aber die Qualität degradiert katastrophal — bis zu 30 % Genauigkeitsverlust. Für keinen praktischen Anwendungsfall empfohlen, auch nicht für die 4-GB-RAM-Stufe in diesem Leitfaden.
Wird CPU + iGPU-Hybrid-Inferenz unterstützt?
Ja, über Layer-Offloading. Auf einem 8-GB-RAM-System mit Intel-Iris-Xe-iGPU erreicht Qwen3 4B 12–20 Tok/s mit partiellem Offload gegenüber reiner CPU. Setzen Sie `OLLAMA_NUM_GPU=1`, und Ollama lagert automatisch die passenden Layer aus.
Was ist das schnellste lokale LLM für einen Low-End-PC?
Qwen3 1.7B bei Q4_K_M ist das schnellste Modell in diesem Leitfaden — 25–40 Tok/s auf einem modernen i5/Ryzen 5 mit 4 GB RAM ohne GPU. Für bessere Qualität bei ähnlicher Geschwindigkeit läuft Phi-4-mini (3.8B) mit 15–25 Tok/s bei 8 GB RAM und übernimmt Coding und Reasoning deutlich besser.
Kann ich ein lokales LLM mit 4 GB RAM ausführen?
Ja — Qwen3 1.7B bei Q4_K_M ist die empfohlene Wahl für 4 GB RAM, nur CPU, mit 25–40 Tok/s auf einem modernen i5/Ryzen 5. Es ist das schnellste Modell in diesem Leitfaden und passt mit Puffer für das Betriebssystem.
Ist eine GPU für Geschwindigkeit erforderlich?
Nein — jedes Modell in diesem Leitfaden läuft nur auf CPU. Eine Intel-Iris-iGPU bringt einen spürbaren Geschwindigkeitsschub (Qwen3 4B: 12–20 Tok/s mit partiellem Offload vs. reine CPU), ist aber optional. Eine dedizierte GPU wie eine gebrauchte RTX 4060 8 GB ist 5–10× schneller als jede CPU-Konfiguration, ist aber ein separater Upgrade-Pfad, keine Voraussetzung.
Muss ich bei der Verwendung lokaler LLMs auf Low-End-PCs die DSGVO beachten?
Für den rein privaten Einsatz stellt die DSGVO keine besonderen Anforderungen. Verarbeiten Sie jedoch personenbezogene Daten anderer Personen (z. B. Kundendaten, Patienteninformationen), greift Artikel 28 DSGVO. Da bei lokaler Inferenz keine Daten an externe Server übermittelt werden, entfällt die Notwendigkeit eines Auftragsverarbeitungsvertrags mit einem KI-Anbieter. Die BSI-Grundschutz-Kataloge empfehlen lokale Inferenz explizit für sensible Datenverarbeitung.
Ist der Einsatz lokaler LLMs auf Low-End-Hardware für den deutschen Mittelstand geeignet?
Ja, insbesondere für datenschutzkritische Aufgaben wie die Verarbeitung interner Dokumente, Vertragsanalysen oder die Zusammenfassung von Kundenkommunikation. Für KMU empfehlen sich Phi-4-mini (3.8B) auf einem modernen CPU-System (8 GB RAM) oder Qwen3 8B (16 GB RAM) für höhere Qualität. Die BSI-Grundschutz-Kataloge sowie die Empfehlungen des IT-Sicherheitsverbands TeleTrusT sprechen sich für lokale KI-Verarbeitung in sicherheitskritischen Bereichen aus.
Quellen
- Phi-4-mini Modellkarte — Microsoft Research. 68 % MMLU, 70 % HumanEval. Veröffentlicht 2025.
- Gemma 3 Modellkarte — Google DeepMind. Gemma 3 2B mit 128K-Kontextfenster. Veröffentlicht 2025.
- Llama 4 Scout 8B — Meta. 10M-Kontextfenster, veröffentlicht März 2026.
- TinyLlama 1.1B Repository — Stability AI. Training 2024 abgeschlossen. Stabiles Modell ohne weitere Updates. Weiterhin empfohlen für die 4-GB-VRAM-Stufe.
- llama.cpp CPU-Optimierungsleitfaden — CPU-Beschleunigungsflags inklusive AVX-512, NEON und Thread-Konfiguration.
