Wichtigste Erkenntnisse
- Der schnellste Weg: Ollama installieren → `ollama run llama3.2` ausführen → im Terminal chatten. Gesamtzeit: unter 5 Minuten bei schneller Verbindung.
- Für Rechner mit 8 GB RAM: starten Sie mit `llama3.2:3b` (2 GB Download) oder `phi4-mini` (2,3 GB). Beide laufen auf jedem modernen Laptop.
- Erwarten Sie 15-40 Tokens/Sek auf CPU, 60-120 Tokens/Sek auf einer Mittelklasse-GPU oder Apple Silicon.
- Erste Antworten können langsamer wirken als Cloud-APIs -- lokale Modelle tauschen Geschwindigkeit gegen Privatsphäre und Nullkosten.
- Nach dem initialen Modell-Download läuft alles offline. Für weitere Sitzungen ist kein Internet erforderlich.
📍 In einem Satz
Ihr erstes lokales LLM auszuführen dauert unter 10 Minuten: Ollama installieren, mit einem Befehl wie `ollama run llama3.2` ein kleines Modell laden und im Terminal chatten -- ohne API-Schlüssel, Konto oder Internetverbindung nach dem ersten Download.
💬 In einfachen Worten
Sie brauchen keine besondere Einrichtung, um ein lokales KI-Modell auszuprobieren. Installieren Sie ein kostenloses Programm (Ollama), geben Sie einen einzigen Befehl ein, und es lädt ein kleines Modell herunter und öffnet einen Chat direkt im Terminal. Nach diesem ersten Download läuft alles komplett offline -- kein Konto, kein API-Schlüssel, keine monatliche Rechnung.
Schritt 1: Ollama installieren
Ollama ist der schnellste Weg, ein lokales LLM auszuführen. Installieren Sie es mit einem Befehl oder einem 2-Minuten-Download:
# macOS (Homebrew)
brew install ollama
# Linux
curl -fsSL https://ollama.com/install.sh | sh
# Windows: Installer von ollama.com/download herunterladenPrüfen, ob Ollama läuft
Bestätigen Sie nach der Installation, dass Ollama aktiv ist:
curl http://localhost:11434
# Erwartete Ausgabe: Ollama is runningSchritt 2: Erstes Modell wählen
Wählen Sie ein Modell passend zu Ihrem verfügbaren RAM. Im Zweifel starten Sie mit `llama3.2:3b` -- es läuft auf jedem Rechner mit 4 GB RAM und liefert brauchbare Ergebnisse:
Ihr RAM | Empfohlenes Modell | Downloadgröße | Warum |
|---|---|---|---|
| 4 GB | llama3.2:1b | ~1,3 GB | Kleinstes brauchbares Llama-Modell |
| 8 GB | Llama 3.2 3B | ~2 GB | Bestes Verhältnis Qualität/Größe für Einsteiger |
| 8-16 GB | Llama 3.1 8B | ~4,7 GB | Starkes Allzweckmodell |
| 16+ GB | mistral:7b oder qwen2.5:7b | ~4-5 GB | Wettbewerbsfähige Qualität, schnelle Inferenz |
Schritt 3: Modell herunterladen
Laden Sie das Modell mit `ollama pull` herunter. Das Modell wird unter `~/.ollama/models` gespeichert und muss nur einmal heruntergeladen werden:
ollama pull llama3.2
# Oder eine bestimmte Größenvariante laden
ollama pull llama3.2:3b
ollama pull llama3.1:8bWie sieht der Download aus?
Ollama zeigt den Download-Fortschritt im Terminal an. Ein `llama3.2:3b`-Modell dauert 2-5 Minuten bei einer typischen Breitbandverbindung. Das Modell wird komprimiert gespeichert -- der 2 GB-Download erweitert sich auf der Festplatte auf etwa 2,3 GB.
pulling manifest
pulling 966de95ca8dc... 100% ▕████████████████▏ 1.9 GB
pulling 9f436a92eb8b... 100% ▕████████████████▏ 42 B
verifying sha256 digest
writing manifest
successSchritt 4: Modell ausführen und ersten Prompt senden
Starten Sie eine interaktive Chat-Sitzung:
ollama run llama3.2
# Ollama lädt das Modell und zeigt einen Prompt:
>>> Send a message (/? for help)Ihr erstes Gespräch
Geben Sie eine Nachricht ein und drücken Sie Enter. Das Modell streamt seine Antwort Token für Token:
>>> What are local LLMs?
Local LLMs (large language models) are AI models that run entirely
on your own hardware -- your laptop, desktop, or server. Unlike cloud
services such as ChatGPT or Claude, local LLMs process everything
locally with no data sent to external servers...Was erwarten: Geschwindigkeit, Qualität und Einschränkungen
Geschwindigkeit variiert je nach Hardware. Auf einem Laptop von 2023 (ohne GPU): erwarten Sie 15-25 Tokens/Sek für ein 3B-Modell und 8-15 Tokens/Sek für ein 8B-Modell. Auf Apple M3 Pro: 50-80 Tokens/Sek für 8B. Auf NVIDIA RTX 4070 Ti: 90-130 Tokens/Sek für 8B.
Qualität von `llama3.2:3b` ist bei komplexen Aufgaben spürbar niedriger als bei GPT-5.6 oder Claude Opus 5. Für Zusammenfassungen, einfache F&A und Code-Erklärungen ist die Ausgabe brauchbar. Für mehrstufiges Reasoning oder Langtext-Erstellung sollten Sie auf ein 8B- oder 13B-Modell umsteigen.
Kontextfenster: `llama3.2:3b` unterstützt in Ollama standardmäßig 128K Token. In der Praxis lässt die Qualität nach etwa 16K Token in einem einzelnen Gespräch nach.
Verzögerung bei der ersten Antwort: die erste Antwort nach `ollama run` enthält die Ladezeit des Modells (5-30 Sekunden). Weitere Antworten in derselben Sitzung sind schneller.
Wie nutzen Sie Ihr lokales LLM jenseits des Terminals?
Der Ollama-Terminal-Chat ist nützlich zum Testen, aber die meisten realen Anwendungsfälle brauchen eine bessere Oberfläche:
- Open WebUI: eine voll ausgestattete Web-UI für Ollama. Starten Sie sie mit Docker: `docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway ghcr.io/open-webui/open-webui:main`. Zugriff über http://localhost:3000.
- LM Studio: bevorzugen Sie eine Desktop-GUI, deckt So installieren Sie LM Studio das komplette Setup ab. Der integrierte Chat von LM Studio ist poliert und unterstützt Gesprächsverlauf.
- API-Integration: die Ollama-API unter `localhost:11434` ist kompatibel mit dem OpenAI-SDK. Jede Anwendung, die eine OpenAI-Basis-URL akzeptiert, kann sich mit Ihrem lokalen Modell verbinden.
- VS Code / Cursor: Erweiterungen wie Continue.dev verbinden sich mit Ollama und bieten lokale KI-Codierungsunterstützung direkt in Ihrem Editor.
Ihr erstes lokales LLM ausführen: Regionaler Kontext
EU / DSGVO: Ein lokales LLM mit Ollama auszuführen bedeutet, dass keine Prompt-Daten, kein Kontext und keine Ausgabe Ihren Rechner verlassen -- die Übermittlungsmechanismen nach DSGVO-Artikel 46 kommen nicht zur Anwendung. Für EU-Profis, die personenbezogene Daten verarbeiten, ist dies die datenschutzfreundliche Alternative zu Cloud-KI-APIs. Ihr erstes lokales Modell (llama3.2:3b) nutzt 2 GB Festplattenspeicher, erzeugt null externe API-Aufrufe und erfüllt die Datenminimierungsrichtlinien des deutschen BSI von Haus aus.
Japan (METI): die METI-Leitlinien zur KI-Governance verlangen eine Dokumentation, wo die KI-Inferenz stattfindet. Ihr erstes Ollama-Setup schafft eine vollständige und auditierbare lokale Umgebung: Modelldateien werden unter ~/.ollama/models mit versionsspezifischen Dateinamen gespeichert, es gibt keine externen API-Abhängigkeiten, und die Inferenz lässt sich über `ollama ps` verifizieren. Japanische Fachleute, die Llama oder Qwen3 lokal ausführen, können die genaue Modellversion und Hardware für METI-Compliance-Zwecke dokumentieren.
China: für chinesischsprachige Workflows ersetzen Sie llama3.2:3b durch qwen2.5:3b als erstes Modell: `ollama pull qwen2.5:3b`. Qwen3 verarbeitet chinesischen Text 30-40% token-effizienter als Llama und liefert bessere Ergebnisse auf derselben Hardware-Stufe. Die Befehle ollama pull und run sind identisch.
Häufige Fragen zum ersten lokalen LLM
Die Antwort des Modells ist sehr langsam -- ist das normal?
Auf reiner CPU-Hardware sind 8-20 Tokens/Sek für ein 7B-Modell normal. Jedes Token entspricht etwa 0,75 Wörtern. Bei 10 Tokens/Sek dauert eine 100-Wort-Antwort etwa 13 Sekunden. Um die Inferenz zu beschleunigen: ein kleineres Modell verwenden (3B statt 8B), GPU-Offloading aktivieren, falls verfügbar, oder das Quantisierungslevel Q4_K_M nutzen, das gängigste und schnellste Setup.
Kann ich zwei Modelle gleichzeitig ausführen?
Ollama kann mehrere Modelle gleichzeitig geladen halten, wenn genug RAM vorhanden ist. Standardmäßig entlädt Ollama ein Modell nach 5 Minuten Inaktivität. Dies lässt sich mit der Umgebungsvariable OLLAMA_KEEP_ALIVE ändern. Zwei 7B-Modelle gleichzeitig auszuführen benötigt ~16 GB RAM.
Wie stoppe ich Ollama im Hintergrund?
Auf macOS: Klicken Sie auf das Llama-Symbol in der Menüleiste und wählen Sie Beenden. Auf Linux: führen Sie `systemctl stop ollama` aus. Auf Windows: Rechtsklick auf das Symbol im Systemtray und Beenden wählen. Um zu verhindern, dass Ollama beim Login startet, entfernen Sie es aus den Autostart-Einträgen.
Was ist der einfachste Weg, ein lokales LLM zum ersten Mal auszuführen?
Ollama installieren (ollama.com), `ollama pull llama3.2:3b` ausführen, dann `ollama run llama3.2:3b` ausführen. Das ist alles. Drei Befehle, 2-5 Minuten, und Sie haben ein funktionierendes KI-Modell auf Ihrem Rechner -- nach dem initialen Download ohne Internetverbindung.
Woran erkenne ich, dass mein lokales LLM korrekt läuft?
Führen Sie `ollama ps` im Terminal aus. Läuft das Modell, erscheint es in der Liste mit Name, Größe und Speichernutzung. Senden Sie einen einfachen Prompt wie „Was ist 2+2?" -- antwortet das Modell mit „4", funktioniert es korrekt.
Benötigt mein Rechner eine GPU, um ein lokales LLM auszuführen?
Nein. Lokale LLMs laufen auf der CPU. Eine GPU macht die Inferenz 5-10× schneller, aber CPU-only ist für das Lernen und viele reale Anwendungsfälle ausreichend. Moderne Laptops mit Apple M1/M2, AMD Ryzen oder Intel-CPUs der 12. Generation können 3B-7B-Modelle mit angemessener Geschwindigkeit (10-30 Tokens/Sek) ausführen.
Wie viel Speicherplatz benötigt ein lokales LLM?
`llama3.2:1b` benötigt 1,3 GB, `llama3.2:3b` 2 GB, `llama3.1:8b` 4,7 GB. Das sind die komprimierten Größen, wie Ollama sie speichert. Nach dem Laden in den RAM für die Inferenz unterscheiden sich die Größen (siehe Wie viel VRAM für ein lokales LLM für Details).
Kann ich mein lokales LLM ohne Internetverbindung nutzen?
Ja, vollständig. Laden Sie das Modell einmal mit Ollama herunter (Internet erforderlich), danach läuft es für immer lokal ohne Internet. Ideal für private Netzwerke, Flugzeuge oder vollständig offline Umgebungen.
Wie unterscheidet sich ein lokales LLM von ChatGPT?
ChatGPT läuft auf Servern von Anthropic. Lokale LLMs laufen auf Ihrem Rechner. Lokal = keine Daten verlassen das Gerät, volle Privatsphäre, keine laufenden API-Kosten. ChatGPT = bessere Qualität bei komplexen Aufgaben, benötigt Internet und ein kostenpflichtiges Abo. Beide haben Vor- und Nachteile.
Was ist das beste erste Modell zum Ausprobieren mit Ollama?
`ollama pull llama3.2:3b` -- es ist 2 GB groß, läuft auf jedem modernen Laptop, liefert kompetente Antworten und ist der von Ollama empfohlene Einstiegspunkt. Sehen Sie danach Beste Anfänger-Lokale-LLM-Modelle für Alternativen passend zu Ihrer Hardware.
Nächste Schritte nach dem ersten Durchlauf
Jetzt, da Sie ein funktionierendes lokales LLM haben, erkunden Sie, was es kann. Um zu verstehen, welche Modelle für Ihre Hardware am besten geeignet sind, siehe Beste Anfänger-Lokale-LLM-Modelle. Für laptop-spezifische Performance-Tipps siehe Lokale LLMs auf einem Laptop ausführen. Für Best Practices zu Datenschutz und Sicherheit siehe die Checkliste für Sicherheit und Datenschutz bei lokalen LLMs.
Quellen
- **Ollama-Modellbibliothek** -- Offizielle Liste herunterladbarer Modelle und ihrer Spezifikationen
- **Ollama GitHub-Repository** -- Open-Source-Code, Dokumentation und Issue-Tracking
- **Meta Llama 3.2 Model Card** -- Offizielle Spezifikationen, Trainingsdaten und Performance-Benchmarks
Häufige Fehler nach dem ersten Durchlauf
- Token-Anzahl mit Geschwindigkeit verwechseln -- ein 7B-Modell, das 100 Token bei 20 Tokens/Sek generiert, braucht 5 Sekunden, nicht sofort.
- Inferenz ausführen, während das System mit anderen Aufgaben beschäftigt ist, was die effektiven Tokens/Sek deutlich reduziert.
- Kontextfenster-Grenzen nicht prüfen -- die meisten Einsteigermodelle unterstützen 2K-8K Token, nicht die 100K+ von Frontier-Modellen.
- Sofortige Antworten beim ersten Durchlauf erwarten -- die erste Antwort enthält die Ladezeit des Modells (5-30 Sekunden). Weitere Antworten in derselben Sitzung sind 2-5× schneller.
- Falschen Modell-Tag verwenden -- `llama3.1:8b-text` ist der Basis-Textvervollständigungsmodus und wird endlos wiederholen/loopen. Verwenden Sie für Chat `-instruct`-Tags wie `llama3.1:8b-instruct`.
