Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Ollama Review 2026: Die lokale LLM-Laufzeitumgebung mit einem Befehl
Overview & Reference

Ollama Review 2026: Die lokale LLM-Laufzeitumgebung mit einem Befehl

·13 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Ollama ist ein kostenloses, quelloffenes Kommandozeilen-Tool (ollama.com, Quellcode unter github.com/ollama/ollama), das offene KI-Modelle lokal über eine llama.cpp-basierte Engine, eine lokale REST-API und eine offizielle Desktop-App herunterlädt und ausführt. Die Kernsoftware ist MIT-lizenziert und kostenlos, bestätigt durch die LICENSE-Datei des Repositorys; das GitHub-Repository zeigt laut GitHub API 180.722 Sterne, Stand 12. September 2026. Ollama läuft unter macOS (14 Sonoma oder neuer), Windows und Linux, installiert sich mit einem einzigen Terminalbefehl, stellt eine OpenAI-kompatible API unter http://localhost:11434/v1 bereit und bietet separat eine optionale kostenpflichtige Cloud-Stufe (ab 20 $/Monat) für größere Modelle auf Ollamas eigener Infrastruktur statt auf dem eigenen Rechner.

Ollama (ollama.com, Quellcode unter github.com/ollama/ollama) ist ein kostenloses, quelloffenes Tool zum Herunterladen und Ausführen offener KI-Modelle auf dem eigenen Rechner über eine einzige Kommandozeilen-Oberfläche, eine lokale REST-API und — seit Juli 2025 — eine offizielle Desktop-App. Es verpackt llama.cpp-basierte Inferenz in einen Docker-ähnlichen Workflow (ollama pull, ollama run), sodass ein laufendes Modell weder Kompilieren noch manuelle Serverkonfiguration erfordert. Diese Review behandelt, was Ollama tatsächlich kann, wie man es installiert, sein Modelfile- und API-System, seine optionale kostenpflichtige Cloud-Stufe und wo es sich im Vergleich zu anderen lokalen Inferenz-Tools einordnet.

Ollama Review 2026: Die lokale LLM-Laufzeitumgebung mit einem Befehl

Wichtigste Erkenntnisse

  • Ollama ist kostenlos und quelloffen; die offizielle GitHub-LICENSE ist die MIT-Lizenz
  • Führt lokale Modelle über eine eingebaute llama.cpp-basierte Engine aus — keine separate Kompilierung oder Server-Einrichtung nötig
  • Installation mit einem Befehl unter macOS/Linux (curl -fsSL https://ollama.com/install.sh | sh) oder unter Windows (irm https://ollama.com/install.ps1 | iex), zusätzlich signierte Installer, Docker-Images und Paketmanager-Builds (Homebrew, Pacman, Nix und andere)
  • Eigene Modelle werden mit einem Modelfile über die Direktiven FROM, PARAMETER, TEMPLATE, SYSTEM, ADAPTER, LICENSE und MESSAGE definiert
  • Bietet sowohl eine native REST-API (/api/chat, /api/generate) als auch eine OpenAI-kompatible API unter http://localhost:11434/v1 (/v1/chat/completions, /v1/completions, /v1/models, /v1/embeddings)
  • Modellbibliothek unter ollama.com/library, mit Modellnamen wie llama3.2, gemma4, qwen3.5 und gpt-oss laut aktueller offizieller Dokumentation
  • ollama launch verbindet ein lokal laufendes Modell direkt mit Coding-Tools wie Claude Code, Codex, VS Code, OpenCode und Droid
  • Entwickelt von Ollama Inc., einem Unternehmen mit Sitz in Palo Alto, Kalifornien, gegründet 2023 von Jeffrey Morgan und Michael Chiang
  • Verfügbar für macOS, Windows und Linux, zusätzlich über Docker Hub (ollama/ollama) und Paketmanager wie Homebrew, Pacman, Nix und Guix

📍 In einem Satz

Ollama ist ein kostenloses, quelloffenes (MIT-lizenziertes) Kommandozeilen-Tool und eine lokale API, die offene KI-Modelle auf dem eigenen Rechner über eine llama.cpp-basierte Engine herunterlädt und ausführt, mit einer optionalen kostenpflichtigen Cloud-Stufe für gehostete Inferenz.

💬 In einfachen Worten

Statt eine Inferenz-Engine manuell zu kompilieren und einen Server darum herum zu schreiben, gibt Ihnen Ollama zwei Befehle — ein Modell herunterladen, dann ausführen — und übernimmt den Rest. Es funktioniert wie Docker für KI-Modelle: ein Befehl lädt ein Modell herunter, ein anderer führt es aus, und eine lokale Web-Adresse erlaubt anderen Programmen, damit genauso zu kommunizieren wie mit der API von OpenAI.

📌Hinweis: Diese Review ist das vertiefende Begleitstück zu Ollamas Eintrag im lokalen KI-Software-Verzeichnis — dort finden Sie einen schnellen Überblick, wie Ollama im Vergleich zu Dutzenden anderer lokaler KI-Tools abschneidet.

Was ist Ollama?

Ollama ist ein Kommandozeilen-Tool, ein lokaler API-Server und (seit Juli 2025) eine Desktop-App zum Ausführen offener KI-Modelle auf der eigenen Hardware. Das GitHub-Repository beschreibt es als Software, um lokal "mit großen Sprachmodellen loszulegen". Das Design orientiert sich bewusst am Docker-Workflow — die beiden Mitgründer hatten zuvor Kitematic gebaut, eine GUI für Docker, die Docker 2015 übernahm —, sodass ollama pull und ollama run ähnlich funktionieren wie docker pull und docker run.

  • Kernfunktion: offene Modelle herunterladen und lokal über eine eingebaute Inferenz-Engine ausführen, mit CLI, lokaler API und Desktop-Chat-Oberfläche, die alle mit demselben Hintergrunddienst kommunizieren
  • Lokale Inferenz-Engine: basiert auf llama.cpp und GGML und führt Modelle im GGUF-Format aus Ollamas eigener Bibliothek oder aus importierten GGUF-/Safetensors-Dateien aus
  • Schnittstellen: eine Terminal-CLI (ollama run <modell>), eine offizielle Desktop-App für macOS und Windows mit Drag-and-Drop für Dateien und Bilder sowie eine REST-API für die programmatische Nutzung
  • Entwickler: Ollama Inc., ein Unternehmen mit Sitz in Palo Alto, Kalifornien; die den Code hostende GitHub-Organisation heißt ollama
  • Kanonisches Repository: github.com/ollama/ollama, laut der LICENSE-Datei des Repositorys MIT-lizenziert

Unternehmenshintergrund und Meilensteine von Ollama

Ollama wurde 2023 von Jeffrey Morgan und Michael Chiang gegründet, die sich an der University of Waterloo kennenlernten und zuvor Kitematic gebaut hatten, eine quelloffene Docker-GUI, die Docker 2015 übernahm (später in Docker Desktop integriert). Ollama Inc. hat seinen Sitz in Palo Alto, Kalifornien, und hat laut öffentlichen Startup-Finanzierungs-Trackern Wagniskapital unter anderem von Benchmark und Theory Ventures erhalten; PromptQuorum konnte eine exakte Finanzierungssumme nicht unabhängig aus einer Primärquelle verifizieren und empfiehlt, für aktuelle Zahlen Ollamas eigene Ankündigungen zu prüfen.

  1. 1
    2023 — Projektstart
    Why it matters: Ollamas GitHub-Repository und die ersten öffentlichen Releases etablierten den `pull`/`run`-CLI-Workflow, der bis heute das zentrale Interaktionsmodell bleibt.
  2. 2
    Juli 2025 — Offizielle Desktop-App veröffentlicht
    Why it matters: Fügte eine native GUI für macOS und Windows hinzu, mit Modell-Download, Chat, Drag-and-Drop für Dateien/Bilder und einstellbarer Kontextlänge — zuvor waren die CLI und Drittanbieter-GUIs (wie Open WebUI) die einzigen Oberflächen.
  3. 3
    2025–2026 — Erweiterung der OpenAI-kompatiblen API
    Why it matters: Ollama fügte einen OpenAI-kompatiblen Endpunkt unter `/v1` hinzu und erweiterte ihn — inklusive Chat-Completions, Completions, Embeddings und Modell-Listing — und machte es so zu einem drop-in Backend für bereits gegen das OpenAI-SDK gebaute Tools.
  4. 4
    2026 — ollama launch-Integrationen
    Why it matters: Fügte eine Ein-Befehl-Einrichtung hinzu, um Coding-Tools — Claude Code, Codex, VS Code, OpenCode und Droid — laut [offizieller CLI-Referenz](https://docs.ollama.com) auf ein lokal laufendes Modell zeigen zu lassen.
  5. 5
    2026 — Cloud-Stufe eingeführt
    Why it matters: Ollama Inc. begann, kostenpflichtige, gehostete Inferenz auf eigener Infrastruktur anzubieten (Regionen laut [ollama.com](https://ollama.com) unter anderem USA, Europa und Singapur) als Option neben der kostenlosen lokalen Software, für Nutzer, die größere Modelle ausführen möchten, als es die eigene Hardware zulässt.

Was können Sie mit Ollama tun?

Ollamas Funktionsumfang zielt darauf ab, lokale Modell-Inferenz eher wie einen Paketmanager als wie ein Forschungsprojekt wirken zu lassen. Hier ist, was jeder Teil laut Ollamas offizieller Dokumentation und GitHub-README tatsächlich tut.

  • Modellbibliothek — laden Sie einsatzbereite Modelle von ollama.com/library mit einem einzigen Befehl ollama pull <modell> herunter; die aktuelle Dokumentation zeigt unter anderem Llama, Gemma, Qwen, gpt-oss, DeepSeek sowie dedizierte Embedding-Modelle wie nomic-embed-text und embeddinggemma
  • Modelfile-Anpassung — definieren Sie eine benutzerdefinierte Modellkonfiguration mit einem Modelfile über die Direktiven FROM (Basismodell, erforderlich), PARAMETER (Laufzeiteinstellungen wie Temperatur und Kontextlänge), TEMPLATE (Prompt-Format), SYSTEM (System-Prompt), ADAPTER (LoRA-Adapter), LICENSE und MESSAGE (vorgegebene Konversationshistorie), und bauen Sie es mit ollama create <name> -f Modelfile
  • Lokale REST-API — eine native API unter http://localhost:11434 mit Endpunkten wie /api/generate, /api/chat, /api/embeddings, /api/pull und /api/create, dokumentiert in der offiziellen API-Referenz
  • OpenAI-kompatible API — ein zweiter Endpunkt unter http://localhost:11434/v1, der /v1/chat/completions, /v1/completions, /v1/models und /v1/embeddings implementiert, sodass gegen das OpenAI-SDK geschriebene Anwendungen mit einer bloßen Änderung der Basis-URL auf Ollama zeigen können
  • Coding-Tool-Integrationen (ollama launch) — ein interaktiver Befehl, der externe Tools — die aktuelle CLI-Dokumentation nennt Claude Code, Codex, VS Code, OpenCode und Droid — so konfiguriert, dass sie ein lokal laufendes Ollama-Modell als Backend nutzen
  • Multimodalität und Embeddingsollama run akzeptiert Bildeingaben für multimodale Modelle (die CLI-Dokumentation nennt llava als Beispiel), und dedizierte Embedding-Modelle können für Retrieval-/RAG-Pipelines ausgeführt werden
  • Desktop-App — eine native GUI (macOS und Windows, veröffentlicht im Juli 2025) zum Herunterladen von Modellen und Chatten ohne Terminal, zusätzlich zur CLI
  • Optionale Cloud-Stufe — Ollama Inc. verkauft gehostete Inferenz auf eigenen Servern als separate, kostenpflichtige Option für Modelle, die größer sind, als es lokale Hardware bewältigen kann; dies ist für keine der oben genannten lokalen Funktionen erforderlich

Anwendungsbeispiele: Drei Wege, Ollama zu nutzen

Dies sind konkrete Workflows, die auf Ollamas dokumentierten Befehlen und der oben beschriebenen API basieren — keine hypothetischen Anwendungsfälle.

Ollama Preise: Kostenlose Software, optionale kostenpflichtige Cloud

Die Ollama-Software — CLI, lokale API und Desktop-App — ist kostenlos und quelloffen. Die GitHub-LICENSE-Datei ist die Standard-MIT-Lizenz, keine Funktion ist hinter einer Bezahlschranke versteckt. Separat verkauft Ollama Inc. auf ollama.com einen gehosteten Cloud-Dienst für größere Modelle auf eigenen Servern statt auf dem eigenen Rechner.

Lokale Software

Preis:
Kostenlos
Enthält:
CLI, lokale REST-/OpenAI-kompatible API, Desktop-App, Modelfile-Anpassung und die vollständige Modellbibliothek — läuft vollständig auf der eigenen Hardware

Cloud (kostenlos)

Preis:
Kostenlos
Enthält:
Begrenzter gehosteter Zugriff auf Cloud-Modelle laut aktueller Preisseite von ollama.com

Cloud Pro

Preis:
Ab 20 $/Monat
Enthält:
Gehostetes Inferenz-Guthaben und höhere Nutzungslimits auf Ollamas eigenen Servern (Regionen laut Ollamas eigener Website unter anderem USA, Europa und Singapur) — ein von der kostenlosen lokalen Software getrenntes, kostenpflichtiges Produkt

Preise und Details zur Cloud-Stufe ändern sich; prüfen Sie vor einer Kaufentscheidung direkt Ollamas Preisseite. Für die Installation und Nutzung von Ollamas kostenloser lokaler Software ist die kostenpflichtige Cloud-Stufe zu keinem Zeitpunkt erforderlich — der Cloud-Dienst existiert für Modelle, die zu groß für den RAM/VRAM des jeweiligen Rechners sind.

Ollama vs. LM Studio

Ollama und LM Studio gehören zu den am häufigsten empfohlenen Tools zum Ausführen lokaler KI-Modelle und werden ständig verglichen, weil beide llama.cpp-basierte Inferenz hinter einer einfacheren Oberfläche verpacken. Der klarste Unterschied liegt zwischen CLI-first und GUI-first sowie zwischen quelloffen und Closed Source.

Primäre Oberfläche

Ollama:
Zunächst kommandozeilenbasiert, seit Juli 2025 mit offizieller Desktop-GUI
LM Studio:
Zunächst grafische Desktop-App; kein CLI-first-Workflow

Lizenz

Ollama:
MIT (vollständig quelloffen)
LM Studio:
Proprietär — laut eigenen Nutzungsbedingungen kostenlos für private und geschäftliche Nutzung, aber nicht quelloffen

Lokale API

Ollama:
Native REST-API plus OpenAI-kompatibler Endpunkt unter :11434/v1
LM Studio:
OpenAI-kompatibler REST-Endpunkt plus separate Beta-LM-Studio-REST-API

Modellformate

Ollama:
GGUF über eigene Bibliothek und Modelfile-System
LM Studio:
GGUF (via llama.cpp) und MLX (Apple Silicon)

Eingebauter Dokumenten-Chat (RAG)

Ollama:
Keine eingebaute Funktion — Kombination mit einem Client wie Open WebUI oder AnythingLLM nötig
LM Studio:
Eingebaute Funktion "Chat with Documents"

Optionale Cloud-Stufe

Ollama:
Ja, ab 20 $/Monat für gehostete Inferenz
LM Studio:
Ja, "Bionic+" ab 20 $/Monat und "Pro" ab 100 $/Monat für gehostete Modelle und höhere Limits

Wenn Sie ein skriptfähiges, terminalbasiertes Tool wollen, das andere Anwendungen als Backend aufrufen können, passt Ollamas Workflow direkter. Wenn Sie eine einzelne ausgereifte GUI mit eingebautem Modell-Browser und Dokumenten-Chat ohne jede Terminalnutzung wollen, prüfen Sie LM Studio direkt unter lmstudio.ai — Details im vollständigen LM Studio Review. Beide sind für ihre lokale Kernfunktionalität kostenlos; prüfen Sie vor einer Entscheidung die aktuellen Funktionen auf der jeweiligen Projektseite.

Für wen eignet sich Ollama?

Ob Ollama passt, hängt davon ab, ob Sie sich mit einem terminalbasierten Workflow wohlfühlen und ein skriptfähiges Backend wollen, das andere Tools aufrufen können.

Ollama vs. andere lokale Laufzeitumgebungen

Ollama ist eines von mehreren Tools, die lokale Modell-Inferenz hinter einer einfacheren Oberfläche verpacken. Hier sehen Sie, wie es sich im Vergleich zu anderen Optionen in diesem Bereich einordnet — den vollständigen Katalog finden Sie im lokalen KI-Software-Verzeichnis, den direkten Vergleich im Abschnitt Ollama vs. LM Studio oben.

  • LM Studio — eine GUI-first-Desktop-App mit ähnlichem Funktionsumfang (lokale Inferenz, OpenAI-kompatible API), eingebautem Modell-Browser und Dokumenten-Chat; siehe den LM Studio Review und den Vergleichsabschnitt oben für einen direkten Vergleich.
  • llama.cpp — die quelloffene Inferenz-Engine, auf der Ollama selbst aufbaut; die direkte Nutzung bietet mehr Kontrolle auf niedrigerer Ebene (eigene Build-Flags, direktes GGUF-Laden) auf Kosten von Ollamas paketmanagerähnlichem Komfort. Siehe die llama.cpp-Erklärung.
  • KoboldCpp — eine weitere llama.cpp-basierte Laufzeitumgebung, historisch beliebt für kreatives Schreiben und Rollenspiel mit eingebauter Web-UI; siehe den KoboldCpp Review.
  • LocalAI — eine quelloffene, OpenAI-API-kompatible Laufzeitumgebung, die eine breitere Palette an Modell-Backends jenseits von llama.cpp (einschließlich Bild- und Audiomodelle) in einem Server unterstützt; siehe die LocalAI-Erklärung.

Häufige Fehler bei der Bewertung von Ollama

Die meiste Verwirrung um Ollama entsteht durch die Vermischung der kostenlosen lokalen Software mit dem separaten kostenpflichtigen Cloud-Produkt oder durch Erwartungen an Funktionen (wie eingebautes RAG), die bewusst nicht enthalten sind.

Häufig gestellte Fragen

Was ist Ollama?

Ollama (ollama.com, Quellcode unter github.com/ollama/ollama) ist ein kostenloses, quelloffenes Kommandozeilen-Tool, eine lokale API und eine Desktop-App zum Herunterladen und Ausführen offener KI-Modelle auf dem eigenen Rechner über eine eingebaute llama.cpp-basierte Engine.

Ist Ollama kostenlos?

Ja. Die Kernsoftware — CLI, lokale API und Desktop-App — ist MIT-lizenziert und kostenlos, keine Funktion ist hinter einer Bezahlschranke versteckt. Ollama Inc. verkauft separat eine optionale kostenpflichtige Cloud-Stufe (ab 20 $/Monat) für gehostete Inferenz auf eigenen Servern; dieses Cloud-Produkt ist für die Nutzung der kostenlosen lokalen Software nicht erforderlich.

Ist Ollama quelloffen? Welche Lizenz nutzt es?

Ja. Ollamas GitHub-LICENSE-Datei ist die Standard-MIT-Lizenz, eine der freizügigsten Open-Source-Lizenzen, ohne Copyleft-Pflicht.

Welche Plattformen unterstützt Ollama?

macOS (14 Sonoma oder neuer), Windows und Linux, laut der offiziellen Download-Seite. Zusätzlich wird es als Docker-Image (ollama/ollama) und über Paketmanager wie Homebrew, Pacman, Nix und Guix vertrieben.

Hat Ollama eine grafische Oberfläche, oder ist es nur CLI?

Beides. Ollama begann als Kommandozeilen-Tool und zentriert sich weiterhin auf die CLI, aber Ollama Inc. veröffentlichte im Juli 2025 eine offizielle Desktop-App für macOS und Windows, die eine grafische Chat-Oberfläche zusätzlich zum Terminal-Workflow hinzufügte.

Hat Ollama eine OpenAI-kompatible API?

Ja. Zusätzlich zu seiner nativen REST-API unter http://localhost:11434 stellt Ollama einen OpenAI-kompatiblen Endpunkt unter http://localhost:11434/v1 bereit, der /v1/chat/completions, /v1/completions, /v1/models und /v1/embeddings abdeckt.

Was ist ein Modelfile?

Ein Modelfile ist eine Text-Konfigurationsdatei zum Bauen eines eigenen Ollama-Modells. Es unterstützt die Direktiven FROM (Basismodell, erforderlich), PARAMETER, TEMPLATE, SYSTEM, ADAPTER, LICENSE und MESSAGE und wird mit ollama create <name> -f Modelfile zu einem lauffähigen Modell gebaut.

Wie viele GitHub-Sterne hat Ollama?

Ollamas Repository (github.com/ollama/ollama) zeigte, direkt über die GitHub API verifiziert, Stand 12. September 2026 180.722 Sterne. Prüfen Sie das Repository direkt für eine aktuelle Zahl, da sie sich täglich ändert.

Wer entwickelt Ollama?

Ollama Inc., ein Unternehmen mit Sitz in Palo Alto, Kalifornien, gegründet 2023 von Jeffrey Morgan und Michael Chiang, die zuvor Kitematic bauten, eine 2015 von Docker übernommene Docker-GUI.

Bietet Ollama Retrieval-Augmented Generation (RAG) oder Dokumenten-Chat?

Nicht eingebaut. Ollama liefert die Inferenz-Engine und API; Dokumenten-Chat- und RAG-Funktionalität kommt in der Regel von einer separaten, darauf aufsetzenden Client-Schicht wie Open WebUI oder AnythingLLM, die beide sich mit Ollamas API verbinden können.

Quellen

← Zurück zu Lokale LLMs Pro