Skip to main content
PromptQuorum
Startseite/Lokale LLMs/Führe dein erstes lokales LLM aus: Von Installation bis erste Antwort in 10 Minuten
Erste Schritte

Führe dein erstes lokales LLM aus: Von Installation bis erste Antwort in 10 Minuten

·7 min read·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Dein erstes lokales LLM mit Ollama auszuführen dauert weniger als 10 Minuten. Installiere Ollama, führe einen Befehl aus, um ein Modell zu laden, und beginne, in deinem Terminal zu chatten -- kein API-Schlüssel, kein Konto und keine Internetverbindung nach dem initialen Download erforderlich.

Dein erstes lokales LLM mit Ollama auszuführen dauert weniger als 10 Minuten. Installiere Ollama, führe einen Befehl aus, um ein Modell zu laden, und beginne, in deinem Terminal zu chatten -- kein API-Schlüssel, kein Konto und keine Internetverbindung nach dem initialen Download erforderlich. Ein schnelles Anfängermodell ist Llama 3.2 3B mit 25-45 Tokens/Sekunde auf einer modernen Laptop-CPU.

4-Step Local LLM PipelineA horizontal flow diagram showing the four steps to run a local LLM: Install Ollama, Pull a Model, Run the Model, and Start Chatting.1. Installollama.com2. Pullllama3.2:3b3. Runollama run4. ChatLocal AI2 min2-5 min<1 secInstant

Position: intro

Führe dein erstes lokales LLM aus: Von Installation bis erste Antwort in 10 Minuten

Wichtigste Erkenntnisse

  • Der schnellste Weg: Ollama installieren → `ollama run llama3.2` ausführen → im Terminal chatten. Gesamtzeit: unter 5 Minuten bei schneller Verbindung.
  • Für Rechner mit 8 GB RAM: starten Sie mit `llama3.2:3b` (2 GB Download) oder `phi4-mini` (2,3 GB). Beide laufen auf jedem modernen Laptop.
  • Erwarten Sie 15-40 Tokens/Sek auf CPU, 60-120 Tokens/Sek auf einer Mittelklasse-GPU oder Apple Silicon.
  • Erste Antworten können langsamer wirken als Cloud-APIs -- lokale Modelle tauschen Geschwindigkeit gegen Privatsphäre und Nullkosten.
  • Nach dem initialen Modell-Download läuft alles offline. Für weitere Sitzungen ist kein Internet erforderlich.

📍 In einem Satz

Ihr erstes lokales LLM auszuführen dauert unter 10 Minuten: Ollama installieren, mit einem Befehl wie `ollama run llama3.2` ein kleines Modell laden und im Terminal chatten -- ohne API-Schlüssel, Konto oder Internetverbindung nach dem ersten Download.

💬 In einfachen Worten

Sie brauchen keine besondere Einrichtung, um ein lokales KI-Modell auszuprobieren. Installieren Sie ein kostenloses Programm (Ollama), geben Sie einen einzigen Befehl ein, und es lädt ein kleines Modell herunter und öffnet einen Chat direkt im Terminal. Nach diesem ersten Download läuft alles komplett offline -- kein Konto, kein API-Schlüssel, keine monatliche Rechnung.

Schritt 1: Ollama installieren

Ollama ist der schnellste Weg, ein lokales LLM auszuführen. Installieren Sie es mit einem Befehl oder einem 2-Minuten-Download:

bash
# macOS (Homebrew)
brew install ollama

# Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows: Installer von ollama.com/download herunterladen
Von der Installation zur ersten Antwort in 4 Schritten: Ollama installieren (~2 Min), llama3.2:3b herunterladen (~2 GB, 2-5 Min), ausführen und chatten, dann erste Antwort nach 5-30 Sekunden Ladezeit -- unter 10 Minuten insgesamt, vollständig offline nach dem Download.
Von der Installation zur ersten Antwort in 4 Schritten: Ollama installieren (~2 Min), llama3.2:3b herunterladen (~2 GB, 2-5 Min), ausführen und chatten, dann erste Antwort nach 5-30 Sekunden Ladezeit -- unter 10 Minuten insgesamt, vollständig offline nach dem Download.

Prüfen, ob Ollama läuft

Bestätigen Sie nach der Installation, dass Ollama aktiv ist:

bash
curl http://localhost:11434
# Erwartete Ausgabe: Ollama is running

Schritt 2: Erstes Modell wählen

Wählen Sie ein Modell passend zu Ihrem verfügbaren RAM. Im Zweifel starten Sie mit `llama3.2:3b` -- es läuft auf jedem Rechner mit 4 GB RAM und liefert brauchbare Ergebnisse:

Ihr RAM
Empfohlenes Modell
Downloadgröße
Warum
4 GBllama3.2:1b~1,3 GBKleinstes brauchbares Llama-Modell
8 GBLlama 3.2 3B~2 GBBestes Verhältnis Qualität/Größe für Einsteiger
8-16 GBLlama 3.1 8B~4,7 GBStarkes Allzweckmodell
16+ GBmistral:7b oder qwen2.5:7b~4-5 GBWettbewerbsfähige Qualität, schnelle Inferenz
Erste Modellwahl nach RAM: 4 GB passt zu llama3.2:1b (1,3 GB), 8 GB passt zu Llama 3.2 3B (2 GB, empfohlener Start), 8-16 GB passt zu Llama 3.1 8B (4,7 GB), 16+ GB passt zu mistral:7b oder qwen2.5:7b (4-5 GB).
Erste Modellwahl nach RAM: 4 GB passt zu llama3.2:1b (1,3 GB), 8 GB passt zu Llama 3.2 3B (2 GB, empfohlener Start), 8-16 GB passt zu Llama 3.1 8B (4,7 GB), 16+ GB passt zu mistral:7b oder qwen2.5:7b (4-5 GB).

Schritt 3: Modell herunterladen

Laden Sie das Modell mit `ollama pull` herunter. Das Modell wird unter `~/.ollama/models` gespeichert und muss nur einmal heruntergeladen werden:

bash
ollama pull llama3.2

# Oder eine bestimmte Größenvariante laden
ollama pull llama3.2:3b
ollama pull llama3.1:8b

Wie sieht der Download aus?

Ollama zeigt den Download-Fortschritt im Terminal an. Ein `llama3.2:3b`-Modell dauert 2-5 Minuten bei einer typischen Breitbandverbindung. Das Modell wird komprimiert gespeichert -- der 2 GB-Download erweitert sich auf der Festplatte auf etwa 2,3 GB.

text
pulling manifest
pulling 966de95ca8dc... 100% ▕████████████████▏ 1.9 GB
pulling 9f436a92eb8b... 100% ▕████████████████▏   42 B
verifying sha256 digest
writing manifest
success

Schritt 4: Modell ausführen und ersten Prompt senden

Starten Sie eine interaktive Chat-Sitzung:

bash
ollama run llama3.2

# Ollama lädt das Modell und zeigt einen Prompt:
>>> Send a message (/? for help)

Ihr erstes Gespräch

Geben Sie eine Nachricht ein und drücken Sie Enter. Das Modell streamt seine Antwort Token für Token:

text
>>> What are local LLMs?

Local LLMs (large language models) are AI models that run entirely
on your own hardware -- your laptop, desktop, or server. Unlike cloud
services such as ChatGPT or Claude, local LLMs process everything
locally with no data sent to external servers...

Was erwarten: Geschwindigkeit, Qualität und Einschränkungen

Geschwindigkeit variiert je nach Hardware. Auf einem Laptop von 2023 (ohne GPU): erwarten Sie 15-25 Tokens/Sek für ein 3B-Modell und 8-15 Tokens/Sek für ein 8B-Modell. Auf Apple M3 Pro: 50-80 Tokens/Sek für 8B. Auf NVIDIA RTX 4070 Ti: 90-130 Tokens/Sek für 8B.

Qualität von `llama3.2:3b` ist bei komplexen Aufgaben spürbar niedriger als bei GPT-5.6 oder Claude Opus 5. Für Zusammenfassungen, einfache F&A und Code-Erklärungen ist die Ausgabe brauchbar. Für mehrstufiges Reasoning oder Langtext-Erstellung sollten Sie auf ein 8B- oder 13B-Modell umsteigen.

Kontextfenster: `llama3.2:3b` unterstützt in Ollama standardmäßig 128K Token. In der Praxis lässt die Qualität nach etwa 16K Token in einem einzelnen Gespräch nach.

Verzögerung bei der ersten Antwort: die erste Antwort nach `ollama run` enthält die Ladezeit des Modells (5-30 Sekunden). Weitere Antworten in derselben Sitzung sind schneller.

Wie nutzen Sie Ihr lokales LLM jenseits des Terminals?

Der Ollama-Terminal-Chat ist nützlich zum Testen, aber die meisten realen Anwendungsfälle brauchen eine bessere Oberfläche:

  • Open WebUI: eine voll ausgestattete Web-UI für Ollama. Starten Sie sie mit Docker: `docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway ghcr.io/open-webui/open-webui:main`. Zugriff über http://localhost:3000.
  • LM Studio: bevorzugen Sie eine Desktop-GUI, deckt So installieren Sie LM Studio das komplette Setup ab. Der integrierte Chat von LM Studio ist poliert und unterstützt Gesprächsverlauf.
  • API-Integration: die Ollama-API unter `localhost:11434` ist kompatibel mit dem OpenAI-SDK. Jede Anwendung, die eine OpenAI-Basis-URL akzeptiert, kann sich mit Ihrem lokalen Modell verbinden.
  • VS Code / Cursor: Erweiterungen wie Continue.dev verbinden sich mit Ollama und bieten lokale KI-Codierungsunterstützung direkt in Ihrem Editor.

Ihr erstes lokales LLM ausführen: Regionaler Kontext

EU / DSGVO: Ein lokales LLM mit Ollama auszuführen bedeutet, dass keine Prompt-Daten, kein Kontext und keine Ausgabe Ihren Rechner verlassen -- die Übermittlungsmechanismen nach DSGVO-Artikel 46 kommen nicht zur Anwendung. Für EU-Profis, die personenbezogene Daten verarbeiten, ist dies die datenschutzfreundliche Alternative zu Cloud-KI-APIs. Ihr erstes lokales Modell (llama3.2:3b) nutzt 2 GB Festplattenspeicher, erzeugt null externe API-Aufrufe und erfüllt die Datenminimierungsrichtlinien des deutschen BSI von Haus aus.

Japan (METI): die METI-Leitlinien zur KI-Governance verlangen eine Dokumentation, wo die KI-Inferenz stattfindet. Ihr erstes Ollama-Setup schafft eine vollständige und auditierbare lokale Umgebung: Modelldateien werden unter ~/.ollama/models mit versionsspezifischen Dateinamen gespeichert, es gibt keine externen API-Abhängigkeiten, und die Inferenz lässt sich über `ollama ps` verifizieren. Japanische Fachleute, die Llama oder Qwen3 lokal ausführen, können die genaue Modellversion und Hardware für METI-Compliance-Zwecke dokumentieren.

China: für chinesischsprachige Workflows ersetzen Sie llama3.2:3b durch qwen2.5:3b als erstes Modell: `ollama pull qwen2.5:3b`. Qwen3 verarbeitet chinesischen Text 30-40% token-effizienter als Llama und liefert bessere Ergebnisse auf derselben Hardware-Stufe. Die Befehle ollama pull und run sind identisch.

Häufige Fragen zum ersten lokalen LLM

Die Antwort des Modells ist sehr langsam -- ist das normal?

Auf reiner CPU-Hardware sind 8-20 Tokens/Sek für ein 7B-Modell normal. Jedes Token entspricht etwa 0,75 Wörtern. Bei 10 Tokens/Sek dauert eine 100-Wort-Antwort etwa 13 Sekunden. Um die Inferenz zu beschleunigen: ein kleineres Modell verwenden (3B statt 8B), GPU-Offloading aktivieren, falls verfügbar, oder das Quantisierungslevel Q4_K_M nutzen, das gängigste und schnellste Setup.

Kann ich zwei Modelle gleichzeitig ausführen?

Ollama kann mehrere Modelle gleichzeitig geladen halten, wenn genug RAM vorhanden ist. Standardmäßig entlädt Ollama ein Modell nach 5 Minuten Inaktivität. Dies lässt sich mit der Umgebungsvariable OLLAMA_KEEP_ALIVE ändern. Zwei 7B-Modelle gleichzeitig auszuführen benötigt ~16 GB RAM.

Wie stoppe ich Ollama im Hintergrund?

Auf macOS: Klicken Sie auf das Llama-Symbol in der Menüleiste und wählen Sie Beenden. Auf Linux: führen Sie `systemctl stop ollama` aus. Auf Windows: Rechtsklick auf das Symbol im Systemtray und Beenden wählen. Um zu verhindern, dass Ollama beim Login startet, entfernen Sie es aus den Autostart-Einträgen.

Was ist der einfachste Weg, ein lokales LLM zum ersten Mal auszuführen?

Ollama installieren (ollama.com), `ollama pull llama3.2:3b` ausführen, dann `ollama run llama3.2:3b` ausführen. Das ist alles. Drei Befehle, 2-5 Minuten, und Sie haben ein funktionierendes KI-Modell auf Ihrem Rechner -- nach dem initialen Download ohne Internetverbindung.

Woran erkenne ich, dass mein lokales LLM korrekt läuft?

Führen Sie `ollama ps` im Terminal aus. Läuft das Modell, erscheint es in der Liste mit Name, Größe und Speichernutzung. Senden Sie einen einfachen Prompt wie „Was ist 2+2?" -- antwortet das Modell mit „4", funktioniert es korrekt.

Benötigt mein Rechner eine GPU, um ein lokales LLM auszuführen?

Nein. Lokale LLMs laufen auf der CPU. Eine GPU macht die Inferenz 5-10× schneller, aber CPU-only ist für das Lernen und viele reale Anwendungsfälle ausreichend. Moderne Laptops mit Apple M1/M2, AMD Ryzen oder Intel-CPUs der 12. Generation können 3B-7B-Modelle mit angemessener Geschwindigkeit (10-30 Tokens/Sek) ausführen.

Wie viel Speicherplatz benötigt ein lokales LLM?

`llama3.2:1b` benötigt 1,3 GB, `llama3.2:3b` 2 GB, `llama3.1:8b` 4,7 GB. Das sind die komprimierten Größen, wie Ollama sie speichert. Nach dem Laden in den RAM für die Inferenz unterscheiden sich die Größen (siehe Wie viel VRAM für ein lokales LLM für Details).

Kann ich mein lokales LLM ohne Internetverbindung nutzen?

Ja, vollständig. Laden Sie das Modell einmal mit Ollama herunter (Internet erforderlich), danach läuft es für immer lokal ohne Internet. Ideal für private Netzwerke, Flugzeuge oder vollständig offline Umgebungen.

Wie unterscheidet sich ein lokales LLM von ChatGPT?

ChatGPT läuft auf Servern von Anthropic. Lokale LLMs laufen auf Ihrem Rechner. Lokal = keine Daten verlassen das Gerät, volle Privatsphäre, keine laufenden API-Kosten. ChatGPT = bessere Qualität bei komplexen Aufgaben, benötigt Internet und ein kostenpflichtiges Abo. Beide haben Vor- und Nachteile.

Was ist das beste erste Modell zum Ausprobieren mit Ollama?

`ollama pull llama3.2:3b` -- es ist 2 GB groß, läuft auf jedem modernen Laptop, liefert kompetente Antworten und ist der von Ollama empfohlene Einstiegspunkt. Sehen Sie danach Beste Anfänger-Lokale-LLM-Modelle für Alternativen passend zu Ihrer Hardware.

Nächste Schritte nach dem ersten Durchlauf

Jetzt, da Sie ein funktionierendes lokales LLM haben, erkunden Sie, was es kann. Um zu verstehen, welche Modelle für Ihre Hardware am besten geeignet sind, siehe Beste Anfänger-Lokale-LLM-Modelle. Für laptop-spezifische Performance-Tipps siehe Lokale LLMs auf einem Laptop ausführen. Für Best Practices zu Datenschutz und Sicherheit siehe die Checkliste für Sicherheit und Datenschutz bei lokalen LLMs.

Quellen

Häufige Fehler nach dem ersten Durchlauf

  • Token-Anzahl mit Geschwindigkeit verwechseln -- ein 7B-Modell, das 100 Token bei 20 Tokens/Sek generiert, braucht 5 Sekunden, nicht sofort.
  • Inferenz ausführen, während das System mit anderen Aufgaben beschäftigt ist, was die effektiven Tokens/Sek deutlich reduziert.
  • Kontextfenster-Grenzen nicht prüfen -- die meisten Einsteigermodelle unterstützen 2K-8K Token, nicht die 100K+ von Frontier-Modellen.
  • Sofortige Antworten beim ersten Durchlauf erwarten -- die erste Antwort enthält die Ladezeit des Modells (5-30 Sekunden). Weitere Antworten in derselben Sitzung sind 2-5× schneller.
  • Falschen Modell-Tag verwenden -- `llama3.1:8b-text` ist der Basis-Textvervollständigungsmodus und wird endlos wiederholen/loopen. Verwenden Sie für Chat `-instruct`-Tags wie `llama3.1:8b-instruct`.

Hinweis zu Drittanbieter-Fakten

Dieser Artikel referenziert KI-Modelle, Benchmarks, Preise und Lizenzen von Drittanbietern. Die KI-Landschaft verändert sich schnell. Benchmark-Werte, Lizenzbedingungen, Modellnamen und API-Preise können sich zwischen dem Zeitpunkt der Erstellung und dem Zeitpunkt ändern, zu dem Sie dies lesen. Bevor Sie Bereitstellungs- oder Compliance-Entscheidungen auf Basis dieses Artikels treffen, überprüfen Sie aktuelle Zahlen bei der offiziellen Quelle jedes Anbieters: Hugging-Face-Modellkarten für Lizenzen und Benchmarks, Anbieter-Websites für API-Preise und EUR-Lex für den aktuellen DSGVO- und EU-KI-Gesetz-Text.

Nutzen Sie PromptQuorum mit einem lokalen LLM, eigenen API-Schlüsseln oder beidem — Sie wählen das Backend.

PromptQuorum-Beta herunterladen →

← Zurück zu Lokale LLMs