Wichtigste Erkenntnisse
- Ollama ist kostenlos und quelloffen; die offizielle GitHub-LICENSE ist die MIT-Lizenz
- Führt lokale Modelle über eine eingebaute llama.cpp-basierte Engine aus — keine separate Kompilierung oder Server-Einrichtung nötig
- Installation mit einem Befehl unter macOS/Linux (
curl -fsSL https://ollama.com/install.sh | sh) oder unter Windows (irm https://ollama.com/install.ps1 | iex), zusätzlich signierte Installer, Docker-Images und Paketmanager-Builds (Homebrew, Pacman, Nix und andere) - Eigene Modelle werden mit einem Modelfile über die Direktiven FROM, PARAMETER, TEMPLATE, SYSTEM, ADAPTER, LICENSE und MESSAGE definiert
- Bietet sowohl eine native REST-API (
/api/chat,/api/generate) als auch eine OpenAI-kompatible API unterhttp://localhost:11434/v1(/v1/chat/completions,/v1/completions,/v1/models,/v1/embeddings) - Modellbibliothek unter ollama.com/library, mit Modellnamen wie
llama3.2,gemma4,qwen3.5undgpt-osslaut aktueller offizieller Dokumentation ollama launchverbindet ein lokal laufendes Modell direkt mit Coding-Tools wie Claude Code, Codex, VS Code, OpenCode und Droid- Entwickelt von Ollama Inc., einem Unternehmen mit Sitz in Palo Alto, Kalifornien, gegründet 2023 von Jeffrey Morgan und Michael Chiang
- Verfügbar für macOS, Windows und Linux, zusätzlich über Docker Hub (
ollama/ollama) und Paketmanager wie Homebrew, Pacman, Nix und Guix
📍 In einem Satz
Ollama ist ein kostenloses, quelloffenes (MIT-lizenziertes) Kommandozeilen-Tool und eine lokale API, die offene KI-Modelle auf dem eigenen Rechner über eine llama.cpp-basierte Engine herunterlädt und ausführt, mit einer optionalen kostenpflichtigen Cloud-Stufe für gehostete Inferenz.
💬 In einfachen Worten
Statt eine Inferenz-Engine manuell zu kompilieren und einen Server darum herum zu schreiben, gibt Ihnen Ollama zwei Befehle — ein Modell herunterladen, dann ausführen — und übernimmt den Rest. Es funktioniert wie Docker für KI-Modelle: ein Befehl lädt ein Modell herunter, ein anderer führt es aus, und eine lokale Web-Adresse erlaubt anderen Programmen, damit genauso zu kommunizieren wie mit der API von OpenAI.
📌Hinweis: Diese Review ist das vertiefende Begleitstück zu Ollamas Eintrag im lokalen KI-Software-Verzeichnis — dort finden Sie einen schnellen Überblick, wie Ollama im Vergleich zu Dutzenden anderer lokaler KI-Tools abschneidet.
Was ist Ollama?
Ollama ist ein Kommandozeilen-Tool, ein lokaler API-Server und (seit Juli 2025) eine Desktop-App zum Ausführen offener KI-Modelle auf der eigenen Hardware. Das GitHub-Repository beschreibt es als Software, um lokal "mit großen Sprachmodellen loszulegen". Das Design orientiert sich bewusst am Docker-Workflow — die beiden Mitgründer hatten zuvor Kitematic gebaut, eine GUI für Docker, die Docker 2015 übernahm —, sodass ollama pull und ollama run ähnlich funktionieren wie docker pull und docker run.
- Kernfunktion: offene Modelle herunterladen und lokal über eine eingebaute Inferenz-Engine ausführen, mit CLI, lokaler API und Desktop-Chat-Oberfläche, die alle mit demselben Hintergrunddienst kommunizieren
- Lokale Inferenz-Engine: basiert auf llama.cpp und GGML und führt Modelle im GGUF-Format aus Ollamas eigener Bibliothek oder aus importierten GGUF-/Safetensors-Dateien aus
- Schnittstellen: eine Terminal-CLI (
ollama run <modell>), eine offizielle Desktop-App für macOS und Windows mit Drag-and-Drop für Dateien und Bilder sowie eine REST-API für die programmatische Nutzung - Entwickler: Ollama Inc., ein Unternehmen mit Sitz in Palo Alto, Kalifornien; die den Code hostende GitHub-Organisation heißt ollama
- Kanonisches Repository: github.com/ollama/ollama, laut der LICENSE-Datei des Repositorys MIT-lizenziert
Unternehmenshintergrund und Meilensteine von Ollama
Ollama wurde 2023 von Jeffrey Morgan und Michael Chiang gegründet, die sich an der University of Waterloo kennenlernten und zuvor Kitematic gebaut hatten, eine quelloffene Docker-GUI, die Docker 2015 übernahm (später in Docker Desktop integriert). Ollama Inc. hat seinen Sitz in Palo Alto, Kalifornien, und hat laut öffentlichen Startup-Finanzierungs-Trackern Wagniskapital unter anderem von Benchmark und Theory Ventures erhalten; PromptQuorum konnte eine exakte Finanzierungssumme nicht unabhängig aus einer Primärquelle verifizieren und empfiehlt, für aktuelle Zahlen Ollamas eigene Ankündigungen zu prüfen.
- 12023 — Projektstart
Why it matters: Ollamas GitHub-Repository und die ersten öffentlichen Releases etablierten den `pull`/`run`-CLI-Workflow, der bis heute das zentrale Interaktionsmodell bleibt. - 2Juli 2025 — Offizielle Desktop-App veröffentlicht
Why it matters: Fügte eine native GUI für macOS und Windows hinzu, mit Modell-Download, Chat, Drag-and-Drop für Dateien/Bilder und einstellbarer Kontextlänge — zuvor waren die CLI und Drittanbieter-GUIs (wie Open WebUI) die einzigen Oberflächen. - 32025–2026 — Erweiterung der OpenAI-kompatiblen API
Why it matters: Ollama fügte einen OpenAI-kompatiblen Endpunkt unter `/v1` hinzu und erweiterte ihn — inklusive Chat-Completions, Completions, Embeddings und Modell-Listing — und machte es so zu einem drop-in Backend für bereits gegen das OpenAI-SDK gebaute Tools. - 42026 —
ollama launch-Integrationen
Why it matters: Fügte eine Ein-Befehl-Einrichtung hinzu, um Coding-Tools — Claude Code, Codex, VS Code, OpenCode und Droid — laut [offizieller CLI-Referenz](https://docs.ollama.com) auf ein lokal laufendes Modell zeigen zu lassen. - 52026 — Cloud-Stufe eingeführt
Why it matters: Ollama Inc. begann, kostenpflichtige, gehostete Inferenz auf eigener Infrastruktur anzubieten (Regionen laut [ollama.com](https://ollama.com) unter anderem USA, Europa und Singapur) als Option neben der kostenlosen lokalen Software, für Nutzer, die größere Modelle ausführen möchten, als es die eigene Hardware zulässt.
Was können Sie mit Ollama tun?
Ollamas Funktionsumfang zielt darauf ab, lokale Modell-Inferenz eher wie einen Paketmanager als wie ein Forschungsprojekt wirken zu lassen. Hier ist, was jeder Teil laut Ollamas offizieller Dokumentation und GitHub-README tatsächlich tut.
- Modellbibliothek — laden Sie einsatzbereite Modelle von ollama.com/library mit einem einzigen Befehl
ollama pull <modell>herunter; die aktuelle Dokumentation zeigt unter anderem Llama, Gemma, Qwen, gpt-oss, DeepSeek sowie dedizierte Embedding-Modelle wienomic-embed-textundembeddinggemma - Modelfile-Anpassung — definieren Sie eine benutzerdefinierte Modellkonfiguration mit einem Modelfile über die Direktiven
FROM(Basismodell, erforderlich),PARAMETER(Laufzeiteinstellungen wie Temperatur und Kontextlänge),TEMPLATE(Prompt-Format),SYSTEM(System-Prompt),ADAPTER(LoRA-Adapter),LICENSEundMESSAGE(vorgegebene Konversationshistorie), und bauen Sie es mitollama create <name> -f Modelfile - Lokale REST-API — eine native API unter
http://localhost:11434mit Endpunkten wie/api/generate,/api/chat,/api/embeddings,/api/pullund/api/create, dokumentiert in der offiziellen API-Referenz - OpenAI-kompatible API — ein zweiter Endpunkt unter
http://localhost:11434/v1, der/v1/chat/completions,/v1/completions,/v1/modelsund/v1/embeddingsimplementiert, sodass gegen das OpenAI-SDK geschriebene Anwendungen mit einer bloßen Änderung der Basis-URL auf Ollama zeigen können - Coding-Tool-Integrationen (
ollama launch) — ein interaktiver Befehl, der externe Tools — die aktuelle CLI-Dokumentation nennt Claude Code, Codex, VS Code, OpenCode und Droid — so konfiguriert, dass sie ein lokal laufendes Ollama-Modell als Backend nutzen - Multimodalität und Embeddings —
ollama runakzeptiert Bildeingaben für multimodale Modelle (die CLI-Dokumentation nenntllavaals Beispiel), und dedizierte Embedding-Modelle können für Retrieval-/RAG-Pipelines ausgeführt werden - Desktop-App — eine native GUI (macOS und Windows, veröffentlicht im Juli 2025) zum Herunterladen von Modellen und Chatten ohne Terminal, zusätzlich zur CLI
- Optionale Cloud-Stufe — Ollama Inc. verkauft gehostete Inferenz auf eigenen Servern als separate, kostenpflichtige Option für Modelle, die größer sind, als es lokale Hardware bewältigen kann; dies ist für keine der oben genannten lokalen Funktionen erforderlich
Anwendungsbeispiele: Drei Wege, Ollama zu nutzen
Dies sind konkrete Workflows, die auf Ollamas dokumentierten Befehlen und der oben beschriebenen API basieren — keine hypothetischen Anwendungsfälle.
Ollama installieren unter macOS, Windows und Linux
Ollama ist für macOS, Windows und Linux verfügbar — über Ein-Zeilen-Installationsskripte, signierte Installer, Docker und mehrere Paketmanager. Befehle und Links unten stammen von der offiziellen Download-Seite und dem GitHub-README — prüfen Sie diese Seiten stets direkt, da sich Installationsskripte und Anforderungen zwischen Releases ändern können.
macOS
- Installationsmethode:
- Ollama.dmg (erfordert macOS 14 Sonoma oder neuer) oder
curl -fsSL https://ollama.com/install.sh \| sh
Windows
- Installationsmethode:
- Signierter Installer oder
irm https://ollama.com/install.ps1 \| iexin PowerShell
Linux
- Installationsmethode:
curl -fsSL https://ollama.com/install.sh \| sh, oder manuelle Installation laut offiziellem Linux-Leitfaden
Docker
- Installationsmethode:
docker pull ollama/ollama— offizielles Image auf Docker Hub
Paketmanager
- Installationsmethode:
- Homebrew, Pacman, Nix, Guix, Gentoo, Flox und ein Helm-Chart für Kubernetes — genaue Paketnamen siehe GitHub-README
Ollama hat außer dem unterstützten Betriebssystem keine feste Hardware-Mindestanforderung — die praktische Grenze setzt das jeweils geladene Modell, da größere Modelle mehr RAM (oder VRAM für GPU-Beschleunigung) für nutzbare Geschwindigkeit benötigen. Prüfen Sie die Größe eines Modells auf ollama.com/library, bevor Sie es auf eingeschränkter Hardware herunterladen.
Ollama Preise: Kostenlose Software, optionale kostenpflichtige Cloud
Die Ollama-Software — CLI, lokale API und Desktop-App — ist kostenlos und quelloffen. Die GitHub-LICENSE-Datei ist die Standard-MIT-Lizenz, keine Funktion ist hinter einer Bezahlschranke versteckt. Separat verkauft Ollama Inc. auf ollama.com einen gehosteten Cloud-Dienst für größere Modelle auf eigenen Servern statt auf dem eigenen Rechner.
Lokale Software
- Preis:
- Kostenlos
- Enthält:
- CLI, lokale REST-/OpenAI-kompatible API, Desktop-App, Modelfile-Anpassung und die vollständige Modellbibliothek — läuft vollständig auf der eigenen Hardware
Cloud (kostenlos)
- Preis:
- Kostenlos
- Enthält:
- Begrenzter gehosteter Zugriff auf Cloud-Modelle laut aktueller Preisseite von ollama.com
Cloud Pro
- Preis:
- Ab 20 $/Monat
- Enthält:
- Gehostetes Inferenz-Guthaben und höhere Nutzungslimits auf Ollamas eigenen Servern (Regionen laut Ollamas eigener Website unter anderem USA, Europa und Singapur) — ein von der kostenlosen lokalen Software getrenntes, kostenpflichtiges Produkt
Preise und Details zur Cloud-Stufe ändern sich; prüfen Sie vor einer Kaufentscheidung direkt Ollamas Preisseite. Für die Installation und Nutzung von Ollamas kostenloser lokaler Software ist die kostenpflichtige Cloud-Stufe zu keinem Zeitpunkt erforderlich — der Cloud-Dienst existiert für Modelle, die zu groß für den RAM/VRAM des jeweiligen Rechners sind.
Ollama vs. LM Studio
Ollama und LM Studio gehören zu den am häufigsten empfohlenen Tools zum Ausführen lokaler KI-Modelle und werden ständig verglichen, weil beide llama.cpp-basierte Inferenz hinter einer einfacheren Oberfläche verpacken. Der klarste Unterschied liegt zwischen CLI-first und GUI-first sowie zwischen quelloffen und Closed Source.
Primäre Oberfläche
- Ollama:
- Zunächst kommandozeilenbasiert, seit Juli 2025 mit offizieller Desktop-GUI
- LM Studio:
- Zunächst grafische Desktop-App; kein CLI-first-Workflow
Lizenz
- Ollama:
- MIT (vollständig quelloffen)
- LM Studio:
- Proprietär — laut eigenen Nutzungsbedingungen kostenlos für private und geschäftliche Nutzung, aber nicht quelloffen
Lokale API
- Ollama:
- Native REST-API plus OpenAI-kompatibler Endpunkt unter
:11434/v1 - LM Studio:
- OpenAI-kompatibler REST-Endpunkt plus separate Beta-LM-Studio-REST-API
Modellformate
- Ollama:
- GGUF über eigene Bibliothek und Modelfile-System
- LM Studio:
- GGUF (via llama.cpp) und MLX (Apple Silicon)
Eingebauter Dokumenten-Chat (RAG)
- Ollama:
- Keine eingebaute Funktion — Kombination mit einem Client wie Open WebUI oder AnythingLLM nötig
- LM Studio:
- Eingebaute Funktion "Chat with Documents"
Optionale Cloud-Stufe
- Ollama:
- Ja, ab 20 $/Monat für gehostete Inferenz
- LM Studio:
- Ja, "Bionic+" ab 20 $/Monat und "Pro" ab 100 $/Monat für gehostete Modelle und höhere Limits
Wenn Sie ein skriptfähiges, terminalbasiertes Tool wollen, das andere Anwendungen als Backend aufrufen können, passt Ollamas Workflow direkter. Wenn Sie eine einzelne ausgereifte GUI mit eingebautem Modell-Browser und Dokumenten-Chat ohne jede Terminalnutzung wollen, prüfen Sie LM Studio direkt unter lmstudio.ai — Details im vollständigen LM Studio Review. Beide sind für ihre lokale Kernfunktionalität kostenlos; prüfen Sie vor einer Entscheidung die aktuellen Funktionen auf der jeweiligen Projektseite.
Für wen eignet sich Ollama?
Ob Ollama passt, hängt davon ab, ob Sie sich mit einem terminalbasierten Workflow wohlfühlen und ein skriptfähiges Backend wollen, das andere Tools aufrufen können.
Ollama vs. andere lokale Laufzeitumgebungen
Ollama ist eines von mehreren Tools, die lokale Modell-Inferenz hinter einer einfacheren Oberfläche verpacken. Hier sehen Sie, wie es sich im Vergleich zu anderen Optionen in diesem Bereich einordnet — den vollständigen Katalog finden Sie im lokalen KI-Software-Verzeichnis, den direkten Vergleich im Abschnitt Ollama vs. LM Studio oben.
- LM Studio — eine GUI-first-Desktop-App mit ähnlichem Funktionsumfang (lokale Inferenz, OpenAI-kompatible API), eingebautem Modell-Browser und Dokumenten-Chat; siehe den LM Studio Review und den Vergleichsabschnitt oben für einen direkten Vergleich.
- llama.cpp — die quelloffene Inferenz-Engine, auf der Ollama selbst aufbaut; die direkte Nutzung bietet mehr Kontrolle auf niedrigerer Ebene (eigene Build-Flags, direktes GGUF-Laden) auf Kosten von Ollamas paketmanagerähnlichem Komfort. Siehe die llama.cpp-Erklärung.
- KoboldCpp — eine weitere llama.cpp-basierte Laufzeitumgebung, historisch beliebt für kreatives Schreiben und Rollenspiel mit eingebauter Web-UI; siehe den KoboldCpp Review.
- LocalAI — eine quelloffene, OpenAI-API-kompatible Laufzeitumgebung, die eine breitere Palette an Modell-Backends jenseits von llama.cpp (einschließlich Bild- und Audiomodelle) in einem Server unterstützt; siehe die LocalAI-Erklärung.
Häufige Fehler bei der Bewertung von Ollama
Die meiste Verwirrung um Ollama entsteht durch die Vermischung der kostenlosen lokalen Software mit dem separaten kostenpflichtigen Cloud-Produkt oder durch Erwartungen an Funktionen (wie eingebautes RAG), die bewusst nicht enthalten sind.
Häufig gestellte Fragen
Was ist Ollama?
Ollama (ollama.com, Quellcode unter github.com/ollama/ollama) ist ein kostenloses, quelloffenes Kommandozeilen-Tool, eine lokale API und eine Desktop-App zum Herunterladen und Ausführen offener KI-Modelle auf dem eigenen Rechner über eine eingebaute llama.cpp-basierte Engine.
Ist Ollama kostenlos?
Ja. Die Kernsoftware — CLI, lokale API und Desktop-App — ist MIT-lizenziert und kostenlos, keine Funktion ist hinter einer Bezahlschranke versteckt. Ollama Inc. verkauft separat eine optionale kostenpflichtige Cloud-Stufe (ab 20 $/Monat) für gehostete Inferenz auf eigenen Servern; dieses Cloud-Produkt ist für die Nutzung der kostenlosen lokalen Software nicht erforderlich.
Ist Ollama quelloffen? Welche Lizenz nutzt es?
Ja. Ollamas GitHub-LICENSE-Datei ist die Standard-MIT-Lizenz, eine der freizügigsten Open-Source-Lizenzen, ohne Copyleft-Pflicht.
Welche Plattformen unterstützt Ollama?
macOS (14 Sonoma oder neuer), Windows und Linux, laut der offiziellen Download-Seite. Zusätzlich wird es als Docker-Image (ollama/ollama) und über Paketmanager wie Homebrew, Pacman, Nix und Guix vertrieben.
Hat Ollama eine grafische Oberfläche, oder ist es nur CLI?
Beides. Ollama begann als Kommandozeilen-Tool und zentriert sich weiterhin auf die CLI, aber Ollama Inc. veröffentlichte im Juli 2025 eine offizielle Desktop-App für macOS und Windows, die eine grafische Chat-Oberfläche zusätzlich zum Terminal-Workflow hinzufügte.
Hat Ollama eine OpenAI-kompatible API?
Ja. Zusätzlich zu seiner nativen REST-API unter http://localhost:11434 stellt Ollama einen OpenAI-kompatiblen Endpunkt unter http://localhost:11434/v1 bereit, der /v1/chat/completions, /v1/completions, /v1/models und /v1/embeddings abdeckt.
Was ist ein Modelfile?
Ein Modelfile ist eine Text-Konfigurationsdatei zum Bauen eines eigenen Ollama-Modells. Es unterstützt die Direktiven FROM (Basismodell, erforderlich), PARAMETER, TEMPLATE, SYSTEM, ADAPTER, LICENSE und MESSAGE und wird mit ollama create <name> -f Modelfile zu einem lauffähigen Modell gebaut.
Wie viele GitHub-Sterne hat Ollama?
Ollamas Repository (github.com/ollama/ollama) zeigte, direkt über die GitHub API verifiziert, Stand 12. September 2026 180.722 Sterne. Prüfen Sie das Repository direkt für eine aktuelle Zahl, da sie sich täglich ändert.
Wer entwickelt Ollama?
Ollama Inc., ein Unternehmen mit Sitz in Palo Alto, Kalifornien, gegründet 2023 von Jeffrey Morgan und Michael Chiang, die zuvor Kitematic bauten, eine 2015 von Docker übernommene Docker-GUI.
Bietet Ollama Retrieval-Augmented Generation (RAG) oder Dokumenten-Chat?
Nicht eingebaut. Ollama liefert die Inferenz-Engine und API; Dokumenten-Chat- und RAG-Funktionalität kommt in der Regel von einer separaten, darauf aufsetzenden Client-Schicht wie Open WebUI oder AnythingLLM, die beide sich mit Ollamas API verbinden können.
