Skip to main content
PromptQuorum
Startseite/Lokale LLMs/Schnellste lokale LLMs für Low-End-PCs 2026: CPU-only-Guide
Modelle nach Anwendungsfall

Schnellste lokale LLMs für Low-End-PCs 2026: CPU-only-Guide

·8 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Das schnellste lokale LLM auf einem Low-End-PC (nur CPU, 8 GB RAM) ist Qwen3 1.7B bei Q4_K_M — 25–40 Tok/s auf einem modernen i5/Ryzen 5. Für gute Qualität bei 8 GB läuft Phi-4-mini (3.8B) mit 15–25 Tok/s und übernimmt Coding und Reasoning gut. Kein Modell in diesem Leitfaden benötigt eine GPU.

Nur CPU, 8 GB RAM: Qwen3 1.7B Q4_K_M erreicht 25–40 Tok/s auf einem modernen i5/Ryzen 5. Phi-4-mini (3.8B) läuft mit 15–25 Tok/s und übernimmt Coding und Reasoning. Kein Modell in diesem Leitfaden benötigt eine GPU. Stand Juli 2026 lässt sich ein leistungsfähiges lokales LLM auf einem alten Notebook ohne dedizierte GPU betreiben. Dieser Leitfaden deckt Hardware-Stufen von 4 GB CPU-only bis 16 GB mit Intel-Iris-iGPU ab — mit Ollama-Befehlen für jede Stufe.

Schnellste lokale LLMs für Low-End-PCs (2026)

Die Geschwindigkeit hängt von Ihrer Hardware-Stufe ab. Stimmen Sie CPU/RAM auf das richtige Modell ab — die falsche Wahl verschenkt 4–10× Geschwindigkeit.

  • 4 GB RAM, nur CPU: Qwen3 1.7B Q4_K_M — 25–40 Tok/s auf einem modernen i5/Ryzen 5. `ollama run qwen3:1.7b`
  • 8 GB RAM, nur CPU: Phi-4-mini (3.8B) — 15–25 Tok/s, übernimmt Coding und Reasoning. `ollama run phi4-mini`
  • 8 GB RAM + Intel-Iris-iGPU: Qwen3 4B — 12–20 Tok/s mit partiellem Offload. `ollama run qwen3:4b`
  • 16 GB RAM, nur CPU: Qwen3 8B Q4_K_M — 8–15 Tok/s, starke Qualität. `ollama run qwen3:8b`

Für die meisten Low-End-PCs ist Phi-4-mini (3.8B) bei Q4_K_M der Sweet Spot — passt in 8 GB RAM, 15–25 Tok/s auf CPU. Wechseln Sie zu Qwen3 1.7B für die schnellstmögliche Antwort.

Präsentation: Schnellste lokale LLMs für Low-End-PCs 2026: CPU-only-Guide

Interaktive 14-Folien-Präsentation: Schnellste lokale LLMs für Low-End-PCs. 4 GB RAM CPU-only (Qwen3 1.7B, 25–40 Tok/s), Sweet Spot 8 GB RAM CPU-only (Phi-4-mini, 15–25 Tok/s), 16 GB RAM CPU-only (Qwen3 8B, 8–15 Tok/s) sowie iGPU-beschleunigte Stufen. Folien umfassen Hardware-Modell-Entscheidungstabelle, Empfehlungen pro Stufe mit exakten RAM-Angaben, Quantisierungsleitfaden (Q4/Q3/Q2), Geschwindigkeitswahrnehmungs-Schwellenwerte und häufige Fehler. PDF als lokale LLM Hardware-Referenzkarte herunterladen.

Folien unten ansehen oder als PDF herunterladen. Präsentation herunterladen (PDF)

Schnellste lokale LLMs für Low-End-PCs 2026: CPU-only-Guide

Wichtigste Erkenntnisse

  • 4 GB RAM, nur CPU: Qwen3 1.7B Q4_K_M — 25–40 Tok/s. Schnellste Antwort auf minimaler Hardware.
  • 8 GB RAM, nur CPU (Sweet Spot): Phi-4-mini 3.8B Q4_K_M — 15–25 Tok/s. Coding und Reasoning auf alten Notebooks.
  • 8 GB RAM + Intel-Iris-iGPU: Qwen3 4B — 12–20 Tok/s mit partiellem GPU-Offload.
  • 16 GB RAM, nur CPU: Qwen3 8B Q4_K_M — 8–15 Tok/s. Starke Qualität, keine GPU nötig.
  • 16 GB RAM + iGPU: Llama 3.2 3B oder Qwen3 4B — 20–35 Tok/s mit Layer-Offload.
  • Fazit: Für die meisten Low-End-PCs ist Phi-4-mini (3.8B) bei Q4_K_M der Sweet Spot — passt in 8 GB RAM, 15–25 Tok/s auf CPU. Wechseln Sie zu Qwen3 1.7B für die schnellstmögliche Antwort.
  • Kosten: Alle kostenlos (Open Source) im Vergleich zur ChatGPT-API (~0,002 USD pro 1.000 Token).

📍 In einem Satz

Auf einem CPU-only-PC mit 8 GB RAM läuft Phi-4-mini 3.8B Q4_K_M mit 15–25 Tok/s für Coding und Reasoning; bei 4 GB RAM erreicht Qwen3 1.7B Q4_K_M 25–40 Tok/s.

💬 In einfachen Worten

Du brauchst keine Gaming-GPU für eine lokale KI. Diese Modelle laufen komplett auf CPU und normalem RAM. Kleinere Modelle (1–4B Parameter) sind für Alltagsaufgaben überraschend leistungsfähig und schnell genug für echte Unterhaltungen.

Welches Modell ist das schnellste für Ihre Hardware?

Stimmen Sie Ihre Hardware auf das richtige Modell ab — die falsche Wahl verschenkt 4–10× Geschwindigkeit. Alle Stufen unten sind CPU-only, sofern nicht anders angegeben.

Ihre HardwareEmpfohlenes ModellOllama-BefehlErwartete Geschwindigkeit
4 GB RAM, nur CPUQwen3 1.7B Q4_K_Mollama run qwen3:1.7b25–40 Tok/s
8 GB RAM, nur CPUPhi-4-mini 3.8B Q4_K_Mollama run phi4-mini15–25 Tok/s
8 GB RAM + Intel-Iris-iGPUQwen3 4B Q4_K_Mollama run qwen3:4b12–20 Tok/s
16 GB RAM, nur CPUQwen3 8B Q4_K_Mollama run qwen3:8b8–15 Tok/s
16 GB RAM + iGPULlama 3.2 3B Q4_K_Mollama run llama3.2:3b20–35 Tok/s

Welches Modell sollten Sie verwenden?

Stimmen Sie Ihre Situation auf das richtige Modell ab — das ist die wichtigste Entscheidung:

  • Notebook mit 8 GB RAM (keine dedizierte GPU): Phi-4-mini (3.8B) bei Q4_K_M — 15–25 Tok/s, übernimmt Coding und Reasoning. `ollama run phi4-mini`
  • 4 GB RAM, sehr alter PC: Qwen3 1.7B Q4_K_M — 25–40 Tok/s, schnellste Antwort bei minimalem RAM. `ollama run qwen3:1.7b`
  • 16 GB RAM, keine GPU: Qwen3 8B Q4_K_M — 8–15 Tok/s, starke Qualität. `ollama run qwen3:8b`
  • 8 GB RAM + Intel-Iris-iGPU: Qwen3 4B — verwenden Sie `OLLAMA_NUM_GPU=1` für partiellen Offload, 12–20 Tok/s. `ollama run qwen3:4b`
  • Mehrsprachig gewünscht (128K Kontext): Qwen3 4B oder Llama 3.2 3B — beide unterstützen 128K Kontext auf Ollama.
  • Empfehlungen je RAM-Stufe und Wärmemanagement finden Sie im Leitfaden zum Betrieb eines lokalen LLM auf einem Notebook.

Welches lokale LLM sollten Sie auf Ihrer Hardware ausführen?

Alle Stufen unten sind CPU-only oder iGPU. Wählen Sie das größte Modell, das bei Q4_K_M in Ihr RAM passt — Quantisierung beeinträchtigt die Qualität weniger als der Wechsel zu einem kleineren Modell.

HardwareModelQuantSpeedExperience
4 GB RAM, nur CPUQwen3 1.7BQ4_K_M25–40 t/sschnell, nutzbare Qualität
8 GB RAM, nur CPUPhi-4-mini 3.8BQ4_K_M15–25 t/sCoding + Reasoning
8 GB RAM + iGPU IrisQwen3 4BQ4_K_M12–20 t/spartieller GPU-Offload
16 GB RAM, nur CPUQwen3 8BQ4_K_M8–15 t/sstarke Qualität
16 GB RAM + iGPULlama 3.2 3BQ4_K_M20–35 t/sflüssig mit iGPU
Geschwindigkeit lokaler LLMs nach Hardware-Stufe (CPU-only und iGPU): 4 GB RAM (25–40 Tok/s, Qwen3 1.7B), 8 GB RAM CPU (15–25 Tok/s, Phi-4-mini), 8 GB + iGPU Iris (12–20 Tok/s), 16 GB CPU (8–15 Tok/s), 16 GB + iGPU (20–35 Tok/s). Benchmarks Juli 2026.
Geschwindigkeit lokaler LLMs nach Hardware-Stufe (CPU-only und iGPU): 4 GB RAM (25–40 Tok/s, Qwen3 1.7B), 8 GB RAM CPU (15–25 Tok/s, Phi-4-mini), 8 GB + iGPU Iris (12–20 Tok/s), 16 GB CPU (8–15 Tok/s), 16 GB + iGPU (20–35 Tok/s). Benchmarks Juli 2026.

GPU vs. CPU für lokale LLMs: Was ist schneller auf Low-End-Hardware?

GPU-Inferenz: 15–20 Tok/Sek auf RTX 3060. Erfordert CUDA-Setup. Schnell, beste Qualität. Weitere kostengünstige Optionen finden Sie im Budget-GPU-Leitfaden.

iGPU (integrierte Grafik): 5–8 Tok/Sek auf Intel Iris. Kein Setup erforderlich. Langsamer als dedizierte GPU.

CPU-Inferenz: 1–5 Tok/Sek auf modernem Multi-Core. Läuft überall. Am langsamsten.

Regel: Wenn Sie eine GPU haben (auch integriert), verwenden Sie diese. CPU ist die letzte Option.

CPU- vs. GPU-Geschwindigkeitsvergleich für lokale LLMs: CPU-only erreicht 10–25 Tok/Sek (3B-Modelle) und 15–40 Tok/Sek. GPU (RTX 3060, 8 GB) erreicht 25–60 Tok/Sek — 4–10× schneller als reine CPU-Inferenz.
CPU- vs. GPU-Geschwindigkeitsvergleich für lokale LLMs: CPU-only erreicht 10–25 Tok/Sek (3B-Modelle) und 15–40 Tok/Sek. GPU (RTX 3060, 8 GB) erreicht 25–60 Tok/Sek — 4–10× schneller als reine CPU-Inferenz.

Warum kleinere Modelle auf Low-End-PCs schneller sind

Die Modellgröße bestimmt direkt die Geschwindigkeit. Ein 1B–3B-Modell passt vollständig in den Systemspeicher, sodass CPU oder GPU Daten kontinuierlich streamen können. Größere Modelle erfordern Memory-Swapping — das Verschieben von Daten zwischen RAM und Festplatte — was die Generierung um das 10–100-fache verlangsamt (der Engpass ist Disk-I/O, nicht die Berechnung).

Die obige Hardware-Entscheidungstabelle spiegelt dieses Prinzip wider: TinyLlama 1,1B (1B Parameter) erreicht 5–10 Tok/Sek auf alten CPUs, während 13B+-Modelle auf Low-End-Hardware unpraktisch sind, weil Swapping dominiert.

  • 1B–3B-Modelle: Passen in 4–8 GB RAM → schnellste Generierung → akzeptable Qualität
  • 7B-Modelle: Grenzwertig auf 8-GB-Systemen → langsamer durch Speicherdruck → hohe Qualität
  • 13B+-Modelle: Benötigen 16+ GB VRAM oder Swap → zu langsam für interaktive Nutzung

Wie schnell sind lokale LLMs auf Low-End-PCs?

Auf CPU-only-Systemen erwarten Sie:

  • 3B-Modelle → 15–40 Token/Sek (ältere CPUs: 10–15, neuere CPUs mit Optimierung: 30–40)
  • 7B-Modelle → 10–25 Token/Sek (abhängig von CPU-Kernen und Quantisierung; mit aggressiver Optimierung teils 30+)
  • Das ist langsamer als Cloud-APIs (ChatGPT 4o: 80–150 Tok/Sek), aber ausreichend für interaktive Nutzung. Ein 3B-Modell mit 25 Tok/Sek generiert eine 500-Token-Antwort in 20 Sekunden — akzeptabel für nicht zeitkritische Aufgaben wie Code-Review, Zusammenfassung und kreatives Schreiben.

Wie beeinflusst Quantisierung die Geschwindigkeit auf Low-End-PCs?

Q4 (4-Bit): ~1 % Qualitätsverlust, 50 % VRAM-Einsparung. Standardauswahl. Details zu allen Quantisierungsstufen finden Sie im vollständigen Leitfaden.

Q3 (3-Bit): ~3 % Qualitätsverlust, 62 % VRAM-Einsparung. Akzeptabel für Chat.

Q2 (2-Bit): ~10 % Qualitätsverlust, 75 % VRAM-Einsparung. Riskant; nur bei OOM verwenden.

Geschwindigkeitsauswirkung: Q2 ist ~30 % schneller als Q4 durch geringere Speicherbandbreite, nicht durch Berechnung.

Strategie: Größere Modelle quantisieren (Mistral Small Q2) statt winzige Modelle verwenden (TinyLlama).

Mistral Small Q2 > TinyLlama 1,1B Q4 in Geschwindigkeit und Qualität.

Schnellere Modelle opfern Qualität für Geschwindigkeit — aber durch Anpassen von Temperature und top-p lässt sich viel dieser Qualität zurückgewinnen. Niedrigere Temperature (0,1–0,3) bei schnellen Modellen erzeugt konsistentere Ausgabe als Standardeinstellungen. Siehe Temperature und top-p erklärt für die genauen Einstellungen.

Quantisierungs-Trade-offs für lokale LLMs: Q4 (1 % Qualitätsverlust, 50 % VRAM-Einsparung, 4,5 GB für Mistral Small) ist der Standard. Q2 ist 30 % schneller, aber 10 % Qualitätsverlust. Q8 vermeiden — 2× VRAM-Kosten bei minimalem Gewinn.
Quantisierungs-Trade-offs für lokale LLMs: Q4 (1 % Qualitätsverlust, 50 % VRAM-Einsparung, 4,5 GB für Mistral Small) ist der Standard. Q2 ist 30 % schneller, aber 10 % Qualitätsverlust. Q8 vermeiden — 2× VRAM-Kosten bei minimalem Gewinn.

Wie beschleunigen Sie CPU-only-Inferenz?

  • AVX-512 aktivieren: Wenn die CPU dies unterstützt, verwenden Sie `LLAMACPP_AVX512=1 ollama run phi`. ~20 % Geschwindigkeitszuwachs.
  • Kontextfenster reduzieren: Kürzerer Kontext = schneller. Verwenden Sie `--ctx-size 1024` statt 4096.
  • llama.cpp statt Ollama verwenden:** Auf CPU leicht schneller (~10 % Gewinn) durch weniger Overhead.
  • Multithreading deaktivieren: Kontraintuitiv, aber auf schwachen CPUs ist Single-Threaded schneller (kein Thread-Overhead).
  • Auf iGPU auslagern: Selbst eine schwache integrierte GPU schlägt die CPU. Prüfen Sie mit `lspci` die GPU-Verfügbarkeit.

Wie schnell sind diese Modelle? Echte Benchmarks (Juli 2026)

Echte Messungen nach Hardware-Stufe, Juli 2026. Alle mit Ollama und Standardeinstellungen, ohne Tuning. Alle CPU-only oder iGPU — keine dedizierte GPU:

  • 4 GB RAM, nur CPU (Intel-N100-Mini-PC) + Qwen3 1.7B Q4_K_M: 25–35 Tok/s. `ollama run qwen3:1.7b`
  • 8 GB RAM, nur CPU (Core i5-1235U) + Phi-4-mini Q4_K_M: 15–22 Tok/s. `ollama run phi4-mini`
  • 8 GB RAM, nur CPU (Ryzen 5 5600G mit Radeon-iGPU) + Qwen3 4B Q4_K_M: 18–25 Tok/s mit Layer-Offload.
  • 8 GB RAM + Intel Iris Xe (i5 der 12. Generation) + Qwen3 4B Q4_K_M: 12–18 Tok/s. `ollama run qwen3:4b`
  • 16 GB RAM, nur CPU (Ryzen 7 7700X) + Qwen3 8B Q4_K_M: 8–13 Tok/s. `ollama run qwen3:8b`
  • 16 GB RAM + Iris-Xe-iGPU + Llama 3.2 3B Q4_K_M: 20–30 Tok/s. `ollama run llama3.2:3b`

Was ist bei lokalen LLMs tatsächlich „schnell"?

Geschwindigkeit fühlt sich je nach Aufgabe unterschiedlich an — nutzen Sie dies als Referenz:

Läuft Ihr Modell unter 15 Tok/s, verkleinern Sie das Modell (7B → 3B) oder senken Sie eine Quantisierungsstufe (Q5 → Q4), bevor Sie neue Hardware kaufen.

  • Unter 10 Tok/s → fühlt sich kaputt an. Wörter erscheinen einzeln mit spürbaren Pausen. Für interaktiven Chat unbrauchbar.
  • 15–25 Tok/s → akzeptabel. Lesbare Geschwindigkeit für die meisten Nutzer. Gut für Q&A, Zusammenfassungen und Coding-Hilfe.
  • 30+ Tok/s → flüssig. Fühlt sich wie ein echter Assistent an. Angenehm für alle interaktiven Aufgaben.
  • 60+ Tok/s → sofort. Schneller als man lesen kann. Ideal für Echtzeit-Autovervollständigung und schnelle Iteration.
Geschwindigkeitswahrnehmungs-Schwellenwerte für lokale LLMs: unter 10 Tok/s fühlt sich kaputt an, 15–25 Tok/s ist akzeptabel für Q&A, 30+ Tok/s ist flüssig für alle Aufgaben, 60+ Tok/s ermöglicht Echtzeit-Autovervollständigung.
Geschwindigkeitswahrnehmungs-Schwellenwerte für lokale LLMs: unter 10 Tok/s fühlt sich kaputt an, 15–25 Tok/s ist akzeptabel für Q&A, 30+ Tok/s ist flüssig für alle Aufgaben, 60+ Tok/s ermöglicht Echtzeit-Autovervollständigung.

Was Sie auf Low-End-PCs vermeiden sollten

  • Führen Sie keine 13B+-Modelle aus — sie überschreiten die RAM-Grenzen. Ein 13B-Modell bei Q4 benötigt 8–10 GB VRAM, was die praktische Low-End-PC-Kapazität übersteigt. Selbst mit aggressiver Q2-Quantisierung benötigen 13B-Modelle 5–6 GB und lassen keinen ausreichenden Puffer für Betriebssystem und GPU-Scheduling. Bleiben Sie bei 7B und darunter.
  • Vermeiden Sie Q8-Quantisierung — langsamer mit minimalem Qualitätsgewinn. Q8 verwendet fast 2× den VRAM von Q4 (8 GB vs. 5,5 GB für Mistral Small) und liefert nur ~2 % Qualitätsverbesserung. Für 4-GB-Systeme ist Q8 unpraktisch; für 8-GB-Systeme bleibt Q4 optimal. Q3 ist der einzige Kompromiss, der in Betracht gezogen werden sollte, wenn Q4 OOM-Fehler verursacht.
  • Erwarten Sie keine Echtzeit-Autovervollständigung. Bei 3 Tok/Sek auf CPU dauert die Generierung von 50 Token 16 Sekunden. Interaktive Autovervollständigung erfordert ≥20 Tok/Sek. Lokale LLMs auf Low-End-CPUs eignen sich für Batch-Chat, Entwürfe und Review — nicht für Live-Autovervollständigung oder Code-während-der-Eingabe-Szenarien.
  • Verwenden Sie CPU-only-Inferenz nicht für Produktions-Chatbots. Akzeptabel für interne Tools, Prototypen und Offline-Batch-Arbeit. Cloud-APIs (15–20 ms Latenz) übertreffen Low-End-CPUs (300+ ms Latenz) für benutzerseitige Dienste. Verwenden Sie lokale Inferenz für datenschutzkritische oder Offline-Szenarien, nicht für geschwindigkeitskritische.

Häufige Fehler

  • Fehler: TinyLlama für Geschwindigkeit auf CPU wählen. Problem: TinyLlama gehört auf 4 GB VRAM, nicht auf CPU — Phi-4-mini 3.8B ist schneller und deutlich besser auf reiner CPU-Hardware. Lösung: Führen Sie Phi-4-mini 3.8B auf der CPU aus; reservieren Sie TinyLlama Q5 für 4 GB VRAM.
  • Fehler: CPU-Beschleunigungsflags nicht aktivieren. Problem: Fehlende AVX/NEON-Aktivierung verschenkt 20 % Geschwindigkeit ohne Kosten. Lösung: Setzen Sie `LLAMACPP_AVX512=1` oder `LLAMACPP_NEON=1` vor dem Start von Ollama.
  • Fehler: Q2-Quantisierung erzwingen, um 7B in 4 GB zu pressen. Problem: Q2-Quantisierung führt während der Inferenz oft zu Out-of-Memory-Abstürzen durch KV-Cache-Overhead. Lösung: Verwenden Sie stattdessen ein 3B-Modell bei Q4.
  • Fehler: Annehmen, dass neuere Hardware immer schnellere Inferenz bedeutet. Problem: Desktop-Ryzen ist nicht schneller pro Token als mobiles ARM, weil Desktop-Software keine Speicheroptimierung aufweist. Lösung: Benchmarken Sie Ihre tatsächliche Hardware.
  • Fehler: Falschen Ollama-Slug für Ihr Modell verwenden. Problem: `ollama run phi` lädt Phi-2, nicht Phi-4-mini. Lösung: Verwenden Sie `ollama run phi4-mini` für das neueste Phi-Modell. Prüfen Sie immer ollama.com/library für exakte Modell-Tags.

Lokale LLMs auf Low-End-PCs: Regionaler Kontext

EU / DSGVO: Lokal auf Low-End-Hardware: Keine Inferenzdaten verlassen das Gerät — für viele KMU und Freiberufler im DACH-Raum eine technisch einfache Methode, Art.-44-Transferrisiken zu vermeiden. Der EU AI Act (gültig ab Februar 2025) stellt für die persönliche Inferenz keine Dokumentationspflichten. Für deutsche KMU empfehlen die BSI-Grundschutz-Kataloge lokale Inferenz für die Verarbeitung sensibler Dokumente. Datenschutzrechtliche Gesamtkonformität hängt jedoch vom Betrieb ab, nicht allein von der Inferenz-Architektur.

Japan: Die METI-AI-Governance-Richtlinien fördern die Datenminimierung. CPU-Inferenz auf Low-End-Hardware erfüllt selbst die strengsten Datensouveränitätsanforderungen — keine API-Aufrufe, keine Protokollierung, kein Datenzugriff durch Dritte. Für japanische Nutzer, die Qwen3 auf der CPU für japanischsprachige Aufgaben ausführen, ist ein Durchsatz von 1–3 Tok/Sek für nicht zeitkritische Dokumentzusammenfassungen akzeptabel.

China: Lokale Inferenz auf Consumer-Hardware ist in China für Qwen3- und DeepSeek-R1-Deployments verbreitet, wo der Cloud-API-Zugang zu nicht-chinesischen Modellen eingeschränkt ist. Qwen3 1.7B und 4B laufen auf CPU-only-Hardware und bieten eine funktionale Alternative zu Cloud-APIs für Nutzer mit eingeschränkter Hardware.

Häufige Fragen zum Betrieb lokaler LLMs auf Low-End-PCs

Was gilt als Low-End-PC für lokale LLMs?

Ein Low-End-PC für lokale LLMs ist jede reine CPU-Maschine (keine dedizierte GPU) mit 4–16 GB Systemspeicher. Dazu gehören die meisten Notebooks mit Intel Iris oder AMD Radeon integrierter Grafik, ältere Desktop-PCs ohne dedizierte GPU sowie Mini-PCs wie der Intel N100. Die entscheidende Einschränkung ist der Systemspeicher für die Modellgewichte, nicht die CPU-Taktfrequenz.

Kann ich ein 7B-Modell ganz ohne GPU ausführen?

Ja — Qwen3 8B bei Q4_K_M läuft mit 8–15 Tok/s bei 16 GB RAM, nur CPU (getestet auf Ryzen 7 7700X). Es ist langsamer als die kleineren Optionen, liefert aber deutlich bessere Qualität. Bei 8 GB RAM bleiben Sie besser bei Phi-4-mini (3.8B) — ein 8B-Modell bei Q4_K_M braucht Spielraum, den ein 8-GB-System nicht zuverlässig garantiert.

Ist CPU-Inferenz für Chatbots nutzbar?

Ja, für interaktive Nutzung, wenn Sie die richtige Modellgröße wählen. Phi-4-mini mit 15–25 Tok/s (8 GB RAM) und Qwen3 1.7B mit 25–40 Tok/s (4 GB RAM) sind beide schnell genug für Echtzeit-Chat. Ein 7B-Modell auf CPU (8–15 Tok/s) eignet sich besser für Batch-Aufgaben — Entwürfe, Zusammenfassungen, Offline-Review — als für Live-Konversation.

Soll ich Phi-4-mini oder Qwen3 1.7B auf reiner CPU-Hardware verwenden?

Verwenden Sie Phi-4-mini (3.8B), wenn Sie 8 GB RAM haben — es übernimmt Coding und Reasoning mit 15–25 Tok/s. Verwenden Sie Qwen3 1.7B, wenn Sie nur 4 GB RAM haben oder die schnellstmögliche Antwort wollen (25–40 Tok/s) — auf Kosten etwas Qualität bei komplexen Aufgaben.

Wie prüfe ich, ob ich überhaupt eine GPU habe?

Führen Sie `nvidia-smi` im Terminal für dedizierte NVIDIA-GPUs aus. Erscheint „command not found", prüfen Sie `lspci` (Linux) oder den Geräte-Manager (Windows) auf eine Intel-Iris-Xe- oder AMD-Radeon-iGPU — diese können auch ohne CUDA-Unterstützung einige Layer auslagern.

Wie beeinflusst Quantisierung die Inferenzgeschwindigkeit?

Quantisierung reduziert primär den Speicherbandbreitenbedarf, nicht die Berechnung. Q2 (2-Bit) ist etwa 30 % schneller als Q4 (4-Bit), weil das Modell pro Forward-Pass weniger Bytes lädt. Q2 hat jedoch eine ~10 % Qualitätseinbuße. Die praktische Regel: Verwenden Sie Q4_K_M als Standard für jede Stufe in diesem Leitfaden, wechseln Sie zu Q3 nur, wenn Q4_K_M nicht in den verfügbaren RAM passt.

Kann ich unter Q2 quantisieren?

Technisch ja (Q1), aber die Qualität degradiert katastrophal — bis zu 30 % Genauigkeitsverlust. Für keinen praktischen Anwendungsfall empfohlen, auch nicht für die 4-GB-RAM-Stufe in diesem Leitfaden.

Wird CPU + iGPU-Hybrid-Inferenz unterstützt?

Ja, über Layer-Offloading. Auf einem 8-GB-RAM-System mit Intel-Iris-Xe-iGPU erreicht Qwen3 4B 12–20 Tok/s mit partiellem Offload gegenüber reiner CPU. Setzen Sie `OLLAMA_NUM_GPU=1`, und Ollama lagert automatisch die passenden Layer aus.

Was ist das schnellste lokale LLM für einen Low-End-PC?

Qwen3 1.7B bei Q4_K_M ist das schnellste Modell in diesem Leitfaden — 25–40 Tok/s auf einem modernen i5/Ryzen 5 mit 4 GB RAM ohne GPU. Für bessere Qualität bei ähnlicher Geschwindigkeit läuft Phi-4-mini (3.8B) mit 15–25 Tok/s bei 8 GB RAM und übernimmt Coding und Reasoning deutlich besser.

Kann ich ein lokales LLM mit 4 GB RAM ausführen?

Ja — Qwen3 1.7B bei Q4_K_M ist die empfohlene Wahl für 4 GB RAM, nur CPU, mit 25–40 Tok/s auf einem modernen i5/Ryzen 5. Es ist das schnellste Modell in diesem Leitfaden und passt mit Puffer für das Betriebssystem.

Ist eine GPU für Geschwindigkeit erforderlich?

Nein — jedes Modell in diesem Leitfaden läuft nur auf CPU. Eine Intel-Iris-iGPU bringt einen spürbaren Geschwindigkeitsschub (Qwen3 4B: 12–20 Tok/s mit partiellem Offload vs. reine CPU), ist aber optional. Eine dedizierte GPU wie eine gebrauchte RTX 4060 8 GB ist 5–10× schneller als jede CPU-Konfiguration, ist aber ein separater Upgrade-Pfad, keine Voraussetzung.

Muss ich bei der Verwendung lokaler LLMs auf Low-End-PCs die DSGVO beachten?

Für den rein privaten Einsatz stellt die DSGVO keine besonderen Anforderungen. Verarbeiten Sie jedoch personenbezogene Daten anderer Personen (z. B. Kundendaten, Patienteninformationen), greift Artikel 28 DSGVO. Da bei lokaler Inferenz keine Daten an externe Server übermittelt werden, entfällt die Notwendigkeit eines Auftragsverarbeitungsvertrags mit einem KI-Anbieter. Die BSI-Grundschutz-Kataloge empfehlen lokale Inferenz explizit für sensible Datenverarbeitung.

Ist der Einsatz lokaler LLMs auf Low-End-Hardware für den deutschen Mittelstand geeignet?

Ja, insbesondere für datenschutzkritische Aufgaben wie die Verarbeitung interner Dokumente, Vertragsanalysen oder die Zusammenfassung von Kundenkommunikation. Für KMU empfehlen sich Phi-4-mini (3.8B) auf einem modernen CPU-System (8 GB RAM) oder Qwen3 8B (16 GB RAM) für höhere Qualität. Die BSI-Grundschutz-Kataloge sowie die Empfehlungen des IT-Sicherheitsverbands TeleTrusT sprechen sich für lokale KI-Verarbeitung in sicherheitskritischen Bereichen aus.

Quellen

Hinweis zu Drittanbieter-Fakten

Dieser Artikel referenziert KI-Modelle, Benchmarks, Preise und Lizenzen von Drittanbietern. Die KI-Landschaft verändert sich schnell. Benchmark-Werte, Lizenzbedingungen, Modellnamen und API-Preise können sich zwischen dem Zeitpunkt der Erstellung und dem Zeitpunkt ändern, zu dem Sie dies lesen. Bevor Sie Bereitstellungs- oder Compliance-Entscheidungen auf Basis dieses Artikels treffen, überprüfen Sie aktuelle Zahlen bei der offiziellen Quelle jedes Anbieters: Hugging-Face-Modellkarten für Lizenzen und Benchmarks, Anbieter-Websites für API-Preise und EUR-Lex für den aktuellen DSGVO- und EU-KI-Gesetz-Text. Dieser Artikel spiegelt öffentlich verfügbare Informationen vom Mai 2026 wider.

Nutzen Sie PromptQuorum mit einem lokalen LLM, eigenen API-Schlüsseln oder beidem — Sie wählen das Backend.

PromptQuorum-Beta herunterladen →

← Zurück zu Lokale LLMs