Wichtigste Erkenntnisse
- Bestes Reasoning im kleinen Format: Phi-4 Mini 3.8B -- 68% MMLU, 70% HumanEval, läuft auf 4 GB RAM.
- Bestes kleines/Edge-Modell: Gemma 4 E2B -- MMLU Pro 60%, 128K Kontext, ~2 GB RAM, Apache 2.0. Ersetzt das ältere Gemma 2 2B.
- Bestes kleines Codierungsmodell: Qwen2.5 3B -- 65% HumanEval bei ~2 GB RAM.
- Beste Universal-3B: Llama 3.2 3B -- beste Community-Unterstützung, 128K Kontext, 2,5 GB RAM.
- Kein Sub-2B-Modell produziert Ausgabequalität, die für professionelle Aufgaben geeignet ist. Verwenden Sie 3B+ für echte Arbeit.
📍 In einem Satz
Kleine lokale LLMs (1B-4B Parameter) laufen auf Geräten mit 4-8 GB RAM bei 30-70 Tokens/Sekunde, wobei Phi-4 Mini 3.8B beim Reasoning führt, Gemma 4 E2B mit 128K Kontext am besten für kleine/Edge-Geräte geeignet ist, Qwen2.5 3B am besten fürs Programmieren und Llama 3.2 3B am besten für allgemeine Nutzung ist.
💬 In einfachen Worten
Auch mit nur 4-8 GB RAM im Laptop lassen sich KI-Modelle ausführen -- nur eben kleinere. Diese Sub-4B-Modelle sind schnell genug für Echtzeit-Chat und meistern einfache Aufgaben wie Zusammenfassungen, einfache Fragen und Antworten sowie die Übersetzung kurzer Texte gut, tun sich aber schwer mit mehrstufigem Reasoning oder dem Verfassen langer, zusammenhängender Dokumente. Für die meisten Aufgaben sind sie dennoch eine solide Wahl für Einstiegshardware.
Was ist ein „kleines" lokales LLM und wann sollten Sie eines verwenden?
Ein kleines lokales LLM ist typischerweise definiert als ein Modell mit weniger als 4 Milliarden Parametern. Bei Q4_K_M-Quantisierung benötigen diese Modelle 1,5-3 GB RAM -- gut innerhalb der Einschränkungen von Einstiegs-Laptops mit 4-8 GB Gesamtspeicher.
Kleine Modelle sind geeignet für: schnelle Zusammenfassung, einfache F&A, Erklärung von Code-Snippets, Übersetzung kurzer Texte und Klassifizierungsaufgaben. Sie sind nicht geeignet für mehrstufiges Reasoning, komplexe Code-Generierung oder das Verfassen langer kohärenter Dokumente.
Die Qualitätslücke zwischen einem 3B- und 7B-Modell ist erheblich -- ungefähr der Lücke zwischen GPT-4o mini und GPT-5.5 entsprechend. Für Benutzer mit 8 GB RAM ist ein 7B-Modell bei Q4_K_M fast immer die bessere Wahl. Siehe Beste Anfänger-Lokale-LLM-Modelle für 7B-Empfehlungen.
Welches Modell sollten Sie verwenden? Kurzer Entscheidungsleitfaden
Phi-4 Mini 3.8B -- Beste Reasoning-Leistung in der Sub-4B-Klasse
Microsoft Phi-4 Mini erreicht 68% bei MMLU und 70% bei HumanEval -- Werte, die viele vor 2025 veröffentlichte 7B-Modelle übertreffen. Dies ist möglich, weil Phi-4 Mini auf einem kuratierten synthetischen Datensatz trainiert wurde, der auf Reasoning und Problemlösung fokussiert ist.
Phi-4 Mini ist die empfohlene Wahl für Benutzer, die hauptsächlich Reasoning oder Code-Unterstützung auf Hardware mit 4-6 GB RAM benötigen.
Spec | Value |
|---|---|
| MMLU | 68% |
| HumanEval | 70% |
| RAM (Q4_K_M) | ~2,5 GB |
| Kontext | 128K Token |
| CPU-Geschwindigkeit | 30-50 tok/sek |
| Ollama-Befehl | ollama run phi4-mini |
Gemma 4 E2B -- Bestes kleines Modell/Edge-Modell
Google Gemma 4 E2B ist die aktuelle Generation kleiner Modelle und ersetzt das ältere Gemma 2 2B. Es erreicht 60% auf MMLU Pro (ein anspruchsvollerer Benchmark als das ursprüngliche MMLU), 44% auf LiveCodeBench v6 und 43,4% auf GPQA Diamond, laut Googles eigener Modellkarte. Es hat 2,3B effektive Parameter (5,1B inklusive Embeddings) und passt in ~2 GB RAM.
Das 128K-Kontextfenster ist eine deutliche Verbesserung gegenüber den 8K des alten Gemma 2 2B -- es entspricht nun Phi-4 Mini und Llama 3.2 3B. Die CPU-Geschwindigkeit variiert je nach Hardware und Quantisierung (Google berichtet ~7,6 Token/Sek Decode auf einem Raspberry Pi 5; unabhängige x86-Berichte reichen von 8-48 Token/Sek) -- aktuelle Werte für Ihr Gerät prüfen. Apache-2.0-Lizenz.
Spec | Value |
|---|---|
| MMLU Pro | 60% |
| LiveCodeBench v6 | 44% |
| GPQA Diamond | 43,4% |
| RAM (Q4_K_M) | ~2 GB |
| Kontext | 128K Token |
| Ollama-Befehl | ollama pull gemma4:e2b |
Qwen2.5 3B -- Bestes kleines Modell für Codierungsaufgaben
Qwen2.5 3B erreicht 65% bei HumanEval -- 5 Prozentpunkte über Llama 3.2 3B -- und ist beste Wahl für Codierungsaufgaben im 3B-Format. Es umfasst JSON-Modus und Funktionsaufruf-Unterstützung und verarbeitet nativ 29 Sprachen.
Für nicht-Codierungs-Aufgaben im Englischen erzeugen Llama 3.2 3B und Phi-4 Mini natürlichere Prosa. Wählen Sie Qwen2.5 3B speziell für Codierung oder mehrsprachige Aufgaben.
Spec | Value |
|---|---|
| MMLU | 62% |
| HumanEval | 65% |
| RAM (Q4_K_M) | ~2 GB |
| Kontext | 128K Token |
| CPU-Geschwindigkeit | 25-40 tok/sek |
| Ollama-Befehl | ollama run qwen2.5:3b |
Llama 3.2 3B -- Bestes Universal-Kleinmodell
Meta Llama 3.2 3B ist das am weitesten dokumentierte und von der Community unterstützte 3B-Modell. Es erreicht 58% bei MMLU und 60% bei HumanEval, aber hat breiteste Werkzeugunterstützung, die meisten Fine-Tunes und größte Sammlung von Community-Guides.
Das 128K-Kontextfenster eignet sich für Zusammenfassung von Dokumenten mittlerer Länge. Für ein erstes kleines Modell bleibt Llama 3.2 3B die sicherste Wahl aufgrund vorhersehbaren Verhaltens und umfangreicher Dokumentation.
Spec | Value |
|---|---|
| MMLU | 58% |
| RAM (Q4_K_M) | ~2,5 GB |
| Kontext | 128K Token |
| CPU-Geschwindigkeit | 25-45 tok/sek |
| Ollama-Befehl | ollama run llama3.2:3b |
Llama 3.2 1B -- Absolute Mindestanforderung für nützliche Ausgabe
Llama 3.2 1B ist das kleinste Llama-Modell, das Meta veröffentlicht: Es benötigt nur 1,3 GB RAM und generiert 60-90 tok/sek auf CPU -- das schnellste lokal ausführbare Modell auf dieser Seite. Die Ausgabequalität ist marginal: es bewältigt sehr einfache Klassifizierung, kämpft aber mit kohärenten mehrsätzigen Antworten. Verwenden Sie Llama 3.2 1B nur, wenn RAM die bindende Einschränkung ist oder zum Testen von Tool-Integrationen.
Vollständiger Vergleich: Beste kleine lokale LLMs unter 4B Parametern
Modell | MMLU | HumanEval | RAM | Kontext | Beste für |
|---|---|---|---|---|---|
| Phi-4 Mini 3.8B | 68% | 70% | 2,5 GB | 128K | Reasoning, Codierung |
| Qwen2.5 3B | 62% | 65% | 2 GB | 128K | Codierung, mehrsprachig |
| Llama 3.2 3B | 58% | 60% | 2,5 GB | 128K | Allgemein, erstes Modell |
| Gemma 4 E2B | — | — | 2 GB | 128K | Edge (MMLU Pro 60%) |
| Llama 3.2 1B | 32% | 28% | 1,3 GB | 128K | Minimales RAM |

Kleine lokale LLMs nach Region
EU / DSGVO: Für EU-Profis auf begrenzter Hardware -- Feldarbeit, air-gapped Umgebungen, ältere Enterprise-Laptops -- bieten kleine lokale Modelle DSGVO-konforme Inferenz ohne Datengress. Ein Phi-4 Mini 3.8B auf Standard-Corporate-Laptop (8 GB RAM) behält alle Texte auf Gerät unter DSGVO-Artikel 5. Für BSI-Compliance: Phi-4 Mini (Microsoft, MIT-Lizenz) und Llama 3.2 3B (Meta, Llama Community-Lizenz) bieten versionierte Modell-Identifikatoren via Ollama-Tags. Mistral bietet derzeit kein Sub-4B-Modell. Für EU-Organisationen mit EU-Präferenz sind Optionen begrenzt, bis Mistral Sub-4B freigibt.
Japan (METI): Für japanischsprachige Aufgaben ist Qwen2.5 3B das einzige Modell mit nativer japanischer Tokenisierung. Llama 3.2 3B verarbeitet Japanisch mit niedrigerer Token-Effizienz. Für japanische Zusammenfassung oder Übersetzung: `ollama run qwen2.5:3b`. Der Geschwindigkeitsvorteil ist relevant für japanischen Enterprise-Einsatz: 25-40 tok/sek auf CPU bietet angemessene Echtzeit-Antwort auf Standard-Office-Hardware.
China: Qwen2.5 3B (Alibaba, Apache 2.0) ist natürliche Wahl für chinesischsprachige Bereitstellung. Native chinesische Tokenisierung verarbeitet Mandarin-Text 30-40% effizienter als Llama. Für IoT und Edge unter Chinas Datensicherheitsgesetz: `ollama run qwen2.5:3b` läuft auf jedem Linux-Gerät mit 4 GB RAM ohne externe API-Aufrufe.
Häufige Fehler beim Ausführen kleiner lokaler LLMs
- Verwendung von Q8_0 statt Q4_K_M: Q8_0 benötigt fast doppelt so viel RAM mit minimaler Qualitätsverbesserung. Ein Llama 3.2 3B mit Q8_0 benötigt ~3,8 GB RAM vs ~2,5 GB für Q4_K_M. Auf 4 GB Maschinen kann Q8_0 Swap-Nutzung und 3-5× langsamere Inferenz auslösen. Verwenden Sie immer Q4_K_M für Sub-4B-Modelle.
- Ausführung eines Basis-Modells statt Instruct-Variante: Basis-Modelle (z. B. `llama3.2:3b-text`) folgen keine Anweisungen. Wenn Sie ein Basis-Modell „Was ist 2+2?" fragen, kann es den Satz als Quiz vervollständigen statt „4" zu antworten. Verwenden Sie immer: `llama3.2:3b` (Ollama greift standardmäßig zu Instruct).
- Erwartung von 7B-Qualität aus 3B-Modell: Ein 3B-Modell mit 68% MMLU (Phi-4 Mini) funktioniert ähnlich wie GPT-4o mini aus 2023. Komplexe Reasoning, lange Texte und differenzierter Code haben niedrigere Qualität. Für bessere Qualität: aktualisieren Sie auf 7B (RAM-Unterschied: ~2 GB mehr).
Quantisierung verstehen: RAM- vs. Qualitäts-Kompromiss

Häufig gestellte Fragen
Was ist das kleinste lokale LLM mit nützlicher Ausgabe?
3B bei Q4_K_M ist das praktische Minimum. Modelle unter 2B (Llama 3.2 1B, Gemma 4 E2B) erzeugen kohärente einzelne Sätze, kämpfen aber mit mehrstufigen Anweisungen und Reasoning. Für Zusammenfassung und F&A ist Gemma 4 E2B brauchbar. Für komplexere Aufgaben: beginnen Sie mit 3B.
Kann ein 3B-Modell auf einem Telefon laufen?
Ja -- Llama 3.2 1B und 3B sind für mobile Bereitstellung konzipiert. Meta bietet optimierte Builds für iOS und Android. Inferenz auf modernem Telefon erzeugt 15-30 tok/sek für 1B. LM Studio und Ollama laufen nicht auf iOS/Android -- mobil erfordert separate Frameworks.
Sind kleine Modelle für Zusammenfassung geeignet?
Ja -- Zusammenfassung ist stärkster Anwendungsfall für kleine Modelle. Gemma 4 E2B und Llama 3.2 3B produzieren zuverlässig genaue Zusammenfassungen von Texten bis zu ~4.000 Wörtern. Für längere Dokumente verwenden Sie Modell mit großem Kontext wie Phi-4 Mini oder Llama 3.2 3B (beide 128K).
Wie viel schneller ist 2B als 7B auf gleicher Hardware?
Hängt stark von Hardware und Quantisierung ab -- Google berichtet ~7,6 Token/Sek (Decode) für Gemma 4 E2B auf einem Raspberry Pi 5, unabhängige x86-Tests liegen bei 8-48 Token/Sek. Auf GPU verengt sich Vorteil, da GPU-Durchsatz weniger durch Modellgröße begrenzt ist. Unterschied ist auf reinen CPU-Maschinen deutlichst.
Unterstützen kleine Modelle Funktionsaufrufe?
Einige tun dies. Qwen2.5 3B unterstützt Funktionsaufrufe und JSON. Llama 3.2 3B hat grundlegende Werkzeugunterstützung. Gemma 4 E2B unterstützt keine Funktionsaufrufe. Überprüfen Sie Modelldokumentation vor Pipeline-Aufbau.
Welches kleine Modell ist beste für nicht-englische Sprachen?
Qwen2.5 3B unterstützt nativ 29 Sprachen (Chinesisch, Japanisch, Koreanisch, Arabisch). Gemma 4 E2B und Phi-4 Mini sind hauptsächlich auf Englisch optimiert. Für nicht-englische Aufgaben bei kleinen Modellen ist Qwen2.5 3B klare Wahl.
Unterschied zwischen Phi-4 Mini und Llama 3.2 3B?
Phi-4 Mini übertrifft bei Reasoning, Mathematik, Codierung (68% vs 58% MMLU, 70% vs 60% HumanEval) bei fast identischem RAM (2,5 GB). Für Alltags-Aufgaben ist Lücke spürbar aber nicht dramatisch. Llama 3.2 3B hat breitere Support. Wählen Sie Phi-4 Mini für Reasoning; Llama für Chat.
Kann ich zwei kleine Modelle gleichzeitig laufen lassen?
Ja, wenn RAM zulässt. Zwei 3B-Modelle bei Q4_K_M verwenden ~5 GB kombiniert -- auf 8 GB Maschine mit schlankem OS möglich. Ollama lädt standardmäßig ein Modell pro Prozess. Laufen Sie zwei Ollama-Instanzen auf verschiedenen Ports (OLLAMA_HOST=:11434 und :11435) parallel.
Funktionieren kleine Modelle für RAG?
Ja für einfaches RAG. Llama 3.2 3B und Phi-4 Mini beantworten Fragen über abgerufene Dokumentchunks zuverlässig. Für RAG über große Wissensdatenbanken mit Multi-Hop-Reasoning sind 7B+-Modelle konsistenter. GPT4All LocalDocs nutzt 3B für Dokument-Q&A.
Ist Phi-4 Mini besser als Llama 3.2 3B für Codierung?
Ja. Phi-4 Mini erreicht 70% auf HumanEval vs 60% für Llama 3.2 3B -- aussagekräftige 10-Punkte-Lücke. Für Code-Hilfe auf 4-6 GB RAM ist Phi-4 Mini empfohlen. Für mehrsprachige Codierung (nicht-Python) ist Qwen2.5 3B mit 65% HumanEval wettbewerbsfähig und unterstützt Funktionsaufrufe.
Q8_0-Quantisierung statt Q4_K_M verwenden
Q8_0 benötigt fast doppelt so viel RAM wie Q4_K_M bei minimaler Qualitätsverbesserung im kleinen Maßstab. Ein Llama 3.2 3B-Modell mit Q8_0 benötigt ~3,8 GB RAM statt ~2,5 GB bei Q4_K_M. Auf einer 4-GB-Maschine kann Q8_0 Swap-Nutzung auslösen und die Inferenz um das 3-5-fache verlangsamen. Verwenden Sie für Sub-4B-Modelle immer Q4_K_M als Standard.
Ein Basismodell statt der Instruct-Variante ausführen
Basismodelle (z. B. llama3.2:3b-text) sind Checkpoints vor dem Fine-Tuning, die darauf trainiert sind, das nächste Token in einem Text vorherzusagen. Sie folgen keinen Anweisungen. Wenn Sie ein Basismodell fragen „Was ist 2+2?", vervollständigt es den Satz möglicherweise wie ein Quiz, anstatt „4" zu antworten. Verwenden Sie immer die Instruct-Variante: llama3.2:3b (Ollama verwendet standardmäßig Instruct für benannte Modelle).
7B-Modellqualität von einem 3B-Modell erwarten
Ein 3B-Modell mit 68% MMLU (Phi-4 Mini) schneidet bei allgemeinen Aufgaben ähnlich ab wie ein GPT-3.5 Mini aus dem Jahr 2023. Komplexe Reasoning-Ketten, lange Texte und differenzierte Codegenerierung liefern eine spürbar niedrigere Qualität als ein 7B-Modell. Wenn die Ausgabequalität nicht ausreicht, wechseln Sie zu einem 7B-Modell -- der RAM-Unterschied beträgt ~2 GB (2,5 GB → 4,5 GB).
Was ist das kleinste lokale LLM, das tatsächlich brauchbar ist?
Etwa 1B Parameter sind die Untergrenze für kohärente Ausgaben, und Llama 3.2 1B ist das kleinste Modell in dieser Liste, das sich für echte Arbeit lohnt. Darunter laden und generieren winzige Modelle zwar auf fast jeder Hardware, aber der Text verliert nach wenigen Sätzen seine Kohärenz -- solche Modelle eignen sich eher als Autovervollständigung denn als Assistent. Wenn Speicherplatz und RAM statt Qualität die Einschränkung sind, ist das kleinste brauchbare lokale LLM mit geringem Fußabdruck ein Sub-2B-Modell bei Q4; mit 4 GB oder mehr ist ein 4B-Modell ein großer Kohärenzsprung für sehr wenig zusätzlichen RAM.
Was ist das kleinste LLM-Modell, das Sie lokal ausführen können?
Llama 3.2 1B ist das kleinste Llama-Modell und die praktikabelste Option in diesem Vergleich -- es benötigt nur 1,3 GB RAM und läuft mit 60-90 tok/sek auf der CPU, schneller als jedes andere Modell auf dieser Seite. Es bewältigt kurze Klassifizierungs- und Stichwort-Extraktionsaufgaben, scheitert aber an längeren, mehrstufigen Ausgaben. Wenn Sie ein kleines Modell (manchmal „Mini-LLM" genannt) suchen, das im Alltag wirklich brauchbar ist, betrachten Sie Llama 3.2 1B als Hardware-Untergrenze, nicht als Qualitäts-Untergrenze -- steigen Sie für echte Arbeit auf Gemma 4 E2B oder ein 3B-Modell wie Qwen2.5 3B oder Llama 3.2 3B um.
Quellen
- Hugging Face Open LLM Leaderboard -- open-llm-leaderboard.hf.space (MMLU und HumanEval Werte)
- Microsoft Phi-4 Technical Report -- microsoft.com/en-us/research/publication/phi-4-technical-report/
- Meta Llama 3.2 Model Card -- huggingface.co/meta-llama/Llama-3.2-3B-Instruct
- Google Gemma 4 Model Card -- huggingface.co/google/gemma-4-e2b-it
