Wichtigste Erkenntnisse
- Multimodal-Unterstützung hinzugefügt in Ollama v0.1.15 (12. Dezember 2023); im Mai 2026 zu einer dedizierten Multimodal-Engine umgebaut.
- Verifizierte Vision-fähige Modelle, derzeit gelistet: LLaVA (plus llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4, Mistral Small 3.1.
- CLI: Bilddateipfad direkt im
ollama run-Prompttext referenzieren — kein separates Flag. - HTTP-API:
/api/generateund/api/chatakzeptieren ein Base64-kodiertes Bild in einemimages-Array, dokumentiert in Ollamas eigenemdocs/api.md. - Ollama dient ausschließlich der Inferenz: Es führt Modelle aus, feinabstimmen oder trainieren tut es sie nicht.
- Baut seit Ollamas Ursprung Mitte 2023 auf llama.cpp auf (GitHub-Repository erstellt am 26. Juni 2023, MIT-lizenziert); unterstützt inzwischen auch Apples MLX als alternatives Backend auf Apple Silicon.
📍 In einem Satz
Ollama unterstützt das lokale Ausführen von Vision-fähigen (multimodalen) Modellen seit Version 0.1.15 im Dezember 2023, listet derzeit LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 und Mistral Small 3.1 in seiner Bibliothek und unterstützt sowohl eine einfache CLI (Bilddateipfad im Prompt referenzieren) als auch eine HTTP-API (Base64-kodierte Bilder in einem JSON-images-Array).
💬 In einfachen Worten
Ollama ist das Tool, mit dem Sie KI-Modelle mit einem einzigen Befehl auf Ihrem eigenen Computer herunterladen und ausführen können, und mehrere dieser Modelle können auch Bilder betrachten und Fragen dazu beantworten — dieser Leitfaden zeigt die tatsächlichen Befehle und API-Aufrufe dafür.
📌Hinweis: Die obige Modellliste spiegelt wider, was PromptQuorum zum Zeitpunkt dieses Tests live auf ollama.com/library bestätigt hat. Ollamas Bibliothek ändert sich; überprüfen Sie den aktuellen Eintrag eines Modells, bevor Sie sich darauf verlassen — siehe den Abschnitt Quellen für die genauen geprüften Bibliotheks-URLs.
Geschichte: Ollama, llama.cpp und Multimodal-Unterstützung
**Ollamas GitHub-Repository wurde am 26. Juni 2023 erstellt** und steht unter der MIT-Lizenz. Es umhüllt llama.cpp, die C/C++-Inferenz-Engine für Modelle im GGUF-Format, mit einer Docker-ähnlichen Kommandozeilenschnittstelle und lokalen HTTP-API — der Kernnutzen besteht darin, dass ollama run llama3 ein Modell herunterlädt und ausführt, ohne dass der Nutzer Abhängigkeiten, GPU-Treiber oder die zugrunde liegende Inferenz-Engine direkt verwalten muss.
**Die Unterstützung für Multimodalität (Bildeingabe) wurde in Ollama v0.1.15 hinzugefügt, veröffentlicht am 12. Dezember 2023**, zusammen mit LLaVA als erstem unterstütztem Vision-Modell. Die Release-Notes beschreiben, ollama run llava auszuführen und dann einen Bilddateipfad direkt in die interaktive Eingabeaufforderung einzutippen, plus einen neuen images-Parameter, der zum /api/generate-HTTP-Endpunkt hinzugefügt wurde und Base64-kodierte PNG- oder JPEG-Bilder bis zu 100 MB akzeptiert.
Ollama baute die Multimodal-Unterstützung um Mai 2026 zu einer dedizierten Multimodal-Engine um, laut Ollamas eigenem Blog, und fügte erstklassige Vision-Unterstützung für neuere Modellfamilien hinzu, darunter Llama 4, Gemma 3, Qwen2.5-VL und Mistral Small 3.1 — mit modellspezifischer Behandlung von Bildauflösung, Positionsmetadaten und Attention-Mechanismen statt des generischeren Ansatzes, der für die ursprüngliche LLaVA-Integration verwendet wurde. Dasselbe Update brachte Metal-GPU-Offload für multimodale Modelle auf Apple Silicon über das llama.cpp-Backend.
Ollama läuft primär auf dem llama.cpp-Backend und unterstützt separat Apples MLX-Framework als alternatives Backend auf Apple-Silicon-Hardware, das einige neuere multimodale Modelle für verbesserte Leistung auf dem Mac nutzen können.
Wann fügte Ollama die Unterstützung für Vision-Modelle hinzu?
Ollama fügte die Unterstützung für Multimodalität (Bildeingabe) in Version 0.1.15 hinzu, veröffentlicht am 12. Dezember 2023, mit LLaVA als erstem unterstütztem Vision-Modell. Es baute dies um Mai 2026 zu einer dedizierten Multimodal-Engine für neuere Modellfamilien wie Llama 4, Gemma 3, Qwen2.5-VL und Mistral Small 3.1 um.
Welche Vision-Modelle sich tatsächlich in Ollamas Bibliothek befinden
PromptQuorum hat jedes der folgenden Modelle live auf ollama.com/library zum Zeitpunkt dieses Tests überprüft — diese Liste spiegelt wider, was heute tatsächlich herunterladbar ist, nicht eine allgemeine Übersicht über Vision-Language-Modelle, die möglicherweise für Ollama verpackt sind oder nicht.
llava
- Hersteller:
- UW-Madison / Microsoft Research / Columbia (Forschung)
- Hinweise:
- 7B/13B/34B; siehe PromptQuorums dedizierten LLaVA-Test
llava-llama3 / llava-phi3 / bakllava
- Hersteller:
- Community-Varianten
- Hinweise:
- LLaVA-Architektur-Modelle, feinabgestimmt auf unterschiedlichen Basis-LLMs
llama3.2-vision
- Hersteller:
- Meta
- Hinweise:
- Größen 11B und 90B; starke allgemeine Bild-Q&A
qwen2.5vl
- Hersteller:
- Alibaba (Qwen-Team)
- Hinweise:
- 3B/7B/32B/72B; starke OCR und Dokumentenverständnis
qwen3-vl
- Hersteller:
- Alibaba (Qwen-Team)
- Hinweise:
- 2B-235B; neuer als qwen2.5vl, bis zu 256K Kontext, stärkste OCR-/Agenten-Option hier
minicpm-v
- Hersteller:
- OpenBMB
- Hinweise:
- ~8B, ~5,5 GB; starke Dokument-OCR bei geringem VRAM, Multi-Bild-Unterstützung
moondream
- Hersteller:
- Unabhängig (Vikhyat K.)
- Hinweise:
- 1,8B, ~1,7 GB; die kleinste Option hier, für leichtgewichtige/Edge-Nutzung
granite3.2-vision
- Hersteller:
- IBM
- Hinweise:
- ~2,4 GB; für visuelle Dokumentenanalyse abgestimmt — Tabellen, Diagramme, Infografiken
gemma3
- Hersteller:
- Hinweise:
- Größen 4B/12B/27B sind multimodal (270M und 1B sind reine Textmodelle)
llama4
- Hersteller:
- Meta
- Hinweise:
- Mixture-of-Experts, nativ multimodal; großer (67 GB+) Download
mistral-small3.1
- Hersteller:
- Mistral AI
- Hinweise:
- 24B, ~15 GB; Apache-2.0-lizenziert, Vision plus Text
Ollamas Bibliothek entwickelt sich schnell: qwen3-vl ist bereits als neuere, leistungsfähigere Qwen-Vision-Option (bis zu 256K Kontext) neben qwen2.5vl hinzugekommen, seit der Rest dieses Artikels verfasst wurde. Modelle, für die zum Zeitpunkt dieses Tests keine eigene Ollama-Bibliotheksseite bestätigt werden konnte, obwohl sie andernorts als Vision-Modelle besprochen werden: qwen2-vl (durch qwen2.5vl abgelöst) und ein eigenständiger llava-next-Eintrag (die LLaVA-NeXT/1.6-Verbesserungen sind in den llava-Eintrag selbst integriert). Prüfen Sie immer ollama.com/library/<name> direkt, bevor Sie sich auf einen bestimmten Modellnamen verlassen — diese Tabelle ist eine Momentaufnahme, kein Live-Feed.
Ein Vision-Modell herunterladen und ausführen: Schritt für Schritt
Diese Anleitung verwendet LLaVA als Beispiel, doch dieselben Schritte gelten für jedes Modell aus der obigen Tabelle.
- 1Ollama installieren.
Why it matters: Laden Sie [Ollama](https://ollama.com) für macOS, Linux oder Windows herunter. Die Installation ist ein Standard-Installer/Paket und dauert unter zwei Minuten. - 2Ein Vision-Modell herunterladen.
Why it matters: Führen Sie `ollama pull llava` aus (oder `ollama pull qwen2.5vl`, `ollama pull minicpm-v` usw.) — dies lädt die Modellgewichte herunter, deren Größe von unter 2 GB (Moondream) bis zu mehreren zehn Gigabyte (Llama 4) reicht. - 3Mit einem im Prompt referenzierten Bild ausführen.
Why it matters: Führen Sie `ollama run llava "describe this image: ./photo.jpg"` aus. Ollama erkennt den `.jpg`/`.png`-Dateipfad im Prompttext und hängt das Bild automatisch an — dieses Muster funktioniert seit v0.1.15 im Dezember 2023. - 4Oder die HTTP-API direkt aufrufen.
Why it matters: Senden Sie eine POST-Anfrage an `http://localhost:11434/api/generate` oder `/api/chat` mit dem Base64-kodierten Bild in einem `images`-Array — die genaue JSON-Form ist in Ollamas eigenem [docs/api.md](https://github.com/ollama/ollama/blob/main/docs/api.md) dokumentiert und wird im Abschnitt Nutzungsbeispiele unten gezeigt. - 5(Optional) Die offiziellen Client-Bibliotheken verwenden.
Why it matters: Die offiziellen `ollama`-Python- und JavaScript-Bibliotheken akzeptieren direkt einen Bilddateipfad und übernehmen die Base64-Kodierung für Sie, sodass manuelle Kodierung in Skripten entfällt.
Echte Nutzungsbeispiele: CLI und HTTP-API
Diese Beispiele stammen direkt aus Ollamas eigener Dokumentation und verifizierten Anfrage-/Antwortformen — keine erfundene Syntax.
- Es gibt kein separates Bild-Flag in der CLI. Ollama erkennt einen
.jpg/.png/ähnlichen Dateipfad innerhalb des Prompttextes selbst und hängt ihn automatisch an. /api/generateverwendetprompt;/api/chatverwendetmessages.** Beide akzeptieren einimages-Array aus Base64-kodierten Strings;/api/chatunterstützt mehrstufige Konversationen mit Bildern, die einzelnen Nachrichten zugeordnet sind.
# Herunterladen und über CLI ausführen — Bildpfad direkt im Prompt referenzieren
ollama pull llava
ollama run llava "describe this image: ./photo.jpg"
# --- HTTP-API: /api/generate (dokumentiert in Ollamas docs/api.md) ---
curl http://localhost:11434/api/generate -d '{
"model": "llava",
"prompt": "What is in this picture?",
"stream": false,
"images": ["<Base64-kodierte Bilddaten>"]
}'
# --- HTTP-API: /api/chat (mehrstufig, ebenfalls in docs/api.md dokumentiert) ---
curl http://localhost:11434/api/chat -d '{
"model": "llava",
"messages": [
{ "role": "user", "content": "What is in this image?", "images": ["<Base64-kodierte Bilddaten>"] }
]
}'
# --- Python: offizielle ollama-Bibliothek (übernimmt Base64-Kodierung für Sie) ---
import ollama
response = ollama.chat(
model="llava",
messages=[{
"role": "user",
"content": "What is in this image?",
"images": ["photo.jpg"],
}],
)
print(response["message"]["content"])
# --- Python: rohe HTTP-API mit manueller Base64-Kodierung ---
import base64
import requests
def ask_vision_model(image_path: str, prompt: str, model: str = "llava") -> str:
with open(image_path, "rb") as f:
image_b64 = base64.b64encode(f.read()).decode("utf-8")
response = requests.post(
"http://localhost:11434/api/generate",
json={"model": model, "prompt": prompt, "images": [image_b64], "stream": False},
)
return response.json()["response"]VRAM- und Hardware-Hinweise
Ollamas eigene Modellbibliotheksseiten listen die Downloadgröße jedes Modells auf, was ein vernünftiger Näherungswert für den VRAM- oder RAM-Bedarf eines quantisierten Modells ist — PromptQuorum fand keine separat veröffentlichte, autoritative VRAM-Tabelle von Ollama über diese modellspezifischen Downloadgrößen hinaus.
Modell | Ungefähre Größe | Praktisches Minimum |
|---|---|---|
| Moondream | ~1,7 GB | 4 GB VRAM / läuft auf bescheidener Hardware |
| Granite 3.2 Vision | ~2,4 GB | 4-6 GB VRAM |
| LLaVA 7B / MiniCPM-V | ~4,7-5,5 GB | 6-8 GB VRAM |
| Llama 3.2 Vision 11B / Qwen2.5-VL 7B | ~6-8 GB | 8-10 GB VRAM |
| Mistral Small 3.1 | ~15 GB | 16-24 GB VRAM |
| LLaVA 34B / Qwen2.5-VL 32B | ~20-21 GB | 24 GB+ VRAM |
| Llama 3.2 Vision 90B / Llama 4 | ~55-67 GB+ | Multi-GPU oder Apple Silicon mit viel Speicher |
📌Hinweis: Dies sind ungefähre Downloadgrößen, keine gemessenen VRAM-Benchmarks — PromptQuorum hat für diesen Artikel keine eigenen Hardware-Tests durchgeführt. Ein Modell kann bei viel geringerer Geschwindigkeit allein auf der CPU laufen, wenn es nicht in den verfügbaren VRAM passt; der tatsächlich nutzbare VRAM-Spielraum hängt zudem von Kontextlänge und Batchgröße ab.
Wofür Ollama nicht geeignet ist
Ollama ist ein starker, aktiv weiterentwickelter Weg, um Vision-fähige Modelle lokal auszuführen, ist aber das falsche Werkzeug für die folgenden Situationen:
- Feinabstimmung oder Training eines Modells. Ollama dient ausschließlich der Inferenz — es führt vortrainierte Modellgewichte aus, bietet aber keine Trainings- oder Feinabstimmungs-Pipeline. Wenn Sie ein Vision-Language-Modell mit Ihren eigenen Daten feinabstimmen müssen, benötigen Sie eine andere Toolchain (etwa die eigenen Trainingsskripte des originalen LLaVA-Repositorys oder ein Framework wie Hugging Face Transformers).
- Neueste proprietäre Multimodal-Fähigkeit. Ollamas Bibliothek ist um Open-Weight-Modelle herum aufgebaut. Zum Zeitpunkt dieses Tests führen die Cloud-Vision-APIs von GPT-4o, Claude und Gemini im Allgemeinen bei komplexem Szenenverständnis, Handschrifterkennung und mehrdeutigen Bildern gegenüber offenen lokalen Modellen — Ollama ist das richtige Werkzeug für private, selbst gehostete Nutzung ohne Grenzkosten pro Bild, nicht für das Erreichen des absoluten Stands der Technik.
- Präzise numerische Extraktion aus Diagrammen und Grafiken. Dies ist eine Einschränkung der zugrunde liegenden Vision-Language-Modelle selbst, nicht spezifisch für Ollama als Runner — überprüfen Sie extrahierte Zahlen stets gegen die Quelldaten, unabhängig davon, welches Modell oder welchen Runner Sie verwenden.
- Eine einzige einheitliche Antwort auf „welches Modell ist am besten". Das richtige Vision-Modell über Ollama hängt von der Aufgabe ab: Qwen2.5-VL für OCR-lastige Dokumentenarbeit, MiniCPM-V für OCR bei niedrigerem VRAM, Llama 3.2 Vision für allgemeine Bild-Q&A, Moondream für den geringsten Fußabdruck. Siehe PromptQuorums Vergleich lokaler Vision-Modelle für aufgabenspezifische Hinweise.
Alternativen zu Ollama für Vision-Modelle
LM Studio
- Am besten für:
- GUI-orientierter lokaler Modell-Runner; bestätigt, Vision-fähige Modelle mit Bildanhang in seiner Chat-Oberfläche zu unterstützen
- Lizenz:
- Kostenlos, proprietäre Anwendung
llama.cpp direkt
- Am besten für:
- Maximale Low-Level-Kontrolle über die Inferenz, einschließlich Multimodal-Unterstützung (im Stil von llava.cpp), ohne Ollamas Wrapper-Schicht
- Lizenz:
- MIT
LLaVAs eigenes Repository
- Am besten für:
- Forschungsgerechte Kontrolle, Trainings-/Feinabstimmungsskripte — siehe PromptQuorums LLaVA-Test
- Lizenz:
- Apache-2.0 (Code); basismodellabhängig für Checkpoints
MLC-LLM / MLC Chat
- Am besten für:
- On-Device-LLM-Deployment über Plattformen hinweg; PromptQuorum fand zum Zeitpunkt dieses Tests keine bestätigte, offiziell dokumentierte Unterstützung für Vision-Language-Modelle (VLM) — prüfen Sie den aktuellen Status, bevor Sie sich für Vision-Aufgaben darauf verlassen
- Lizenz:
- Apache-2.0
Cloud-VLM-APIs (GPT-4o, Claude, Gemini Vision)
- Am besten für:
- Höchste verfügbare multimodale Fähigkeit, keine lokale Hardware oder Einrichtung nötig
- Lizenz:
- Proprietär (kostenpflichtige API)
Häufig gestellte Fragen
Unterstützt Ollama Vision-Modelle?
Ja. Ollama fügte die Unterstützung für Multimodalität (Bildeingabe) in Version 0.1.15 hinzu, veröffentlicht am 12. Dezember 2023, und baute sie um Mai 2026 zu einer dedizierten Multimodal-Engine um. Zum Zeitpunkt dieses Tests listet seine Bibliothek LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 und Mistral Small 3.1 als Vision-fähige Modelle.
Wie übergebe ich ein Bild an ein Modell in Ollama?
Referenzieren Sie über die CLI den Dateipfad des Bildes direkt im Prompttext: ollama run llava "describe this image: ./photo.jpg". Es gibt kein separates --image-Flag. Programmatisch senden Sie eine POST-Anfrage an /api/generate oder /api/chat mit dem Base64-kodierten Bild in einem images-Array, gemäß Ollamas eigenem docs/api.md.
Was ist das genaue JSON-Format zum Senden eines Bildes an Ollamas API?
Für /api/generate: `{"model": "llava", "prompt": "...", "images": ["<Base64-String>"]}. Für /api/chat: {"model": "llava", "messages": [{"role": "user", "content": "...", "images": ["<Base64-String>"]}]}. Beide sind in Ollamas GitHub-Repository unter docs/api.md` dokumentiert.
Welche Vision-Modelle sind derzeit in Ollamas Bibliothek verfügbar?
Für diesen Test verifiziert: LLaVA (plus llava-llama3-, llava-phi3-, bakllava-Varianten), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3 (4B und größer), Llama 4 und Mistral Small 3.1. Prüfen Sie ollama.com/library direkt, da sich diese Liste ändern kann.
Kann Ollama ein Vision-Modell feinabstimmen?
Nein. Ollama dient ausschließlich der Inferenz — es führt vortrainierte Modellgewichte aus, bietet aber keine Trainings- oder Feinabstimmungs-Pipeline. Feinabstimmung erfordert eine andere Toolchain, etwa die eigenen Trainingsskripte des Originalmodells oder ein Framework wie Hugging Face Transformers.
Baut Ollama auf llama.cpp auf?
Ja. Ollama umhüllt llama.cpp, die C/C++-Inferenz-Engine für Modelle im GGUF-Format, mit einer einfacheren Kommandozeilenschnittstelle und HTTP-API. Ollamas GitHub-Repository wurde am 26. Juni 2023 erstellt. Es unterstützt außerdem Apples MLX-Framework als alternatives Backend auf Apple Silicon.
Wie schneidet Ollama im Vergleich zu Cloud-Vision-APIs wie GPT-4o oder Gemini ab?
Ollama führt Modelle lokal ohne Grenzkosten pro Anfrage aus und behält Bilder auf dem Gerät, doch seine Bibliothek ist um Open-Weight-Modelle herum aufgebaut, die im Allgemeinen proprietären Cloud-Vision-APIs bei komplexem Szenenverständnis, Handschrift und mehrdeutigen Bildern hinterherhinken. Wählen Sie Ollama für Datenschutz, Kostenkontrolle bei hohem Volumen und Offline-Nutzung; wählen Sie eine Cloud-API für die höchste verfügbare Fähigkeit.
Fazit
Ollama bietet seit Dezember 2023 einen wirklich einfachen Weg, Vision-fähige Modelle lokal auszuführen, und der Umbau der Multimodal-Engine im Mai 2026 hielt dieses Erlebnis für neuere Modellfamilien wie Llama 4, Gemma 3, Qwen2.5-VL und Mistral Small 3.1 neben langjährigen Optionen wie LLaVA aktuell. Der Kern-Workflow — ollama pull, dann ollama run mit einem Bildpfad im Prompt, oder die dokumentierten /api/generate//api/chat-HTTP-Endpunkte — ist seit der ursprünglichen v0.1.15-Veröffentlichung stabil geblieben, was selbst ein Pluspunkt für Ollama für jeden ist, der darauf aufbaut. Es ist kein Trainingswerkzeug, und es wird nicht mit der neuesten proprietären Cloud-Multimodal-Fähigkeit mithalten können, doch für privates, selbst gehostetes Bildverständnis ohne Grenzkosten bleibt es einer der praktischsten verfügbaren Einstiegspunkte. Kombinieren Sie diesen Leitfaden mit PromptQuorums LLaVA-Test für Tiefgang zu einem bestimmten Modell oder dem Vergleich lokaler Vision-Modelle für aufgabenspezifische Modellauswahl über die gesamte lokale Vision-Modell-Landschaft hinweg.
Quellen
- Ollama auf GitHub — Erstellungsdatum des Repositorys, Lizenz und Release-Historie.
- Ollama v0.1.15 Release-Notes — die ursprüngliche Ankündigung der Multimodal-/LLaVA-Unterstützung, 12. Dezember 2023.
- Ollamas neue Engine für multimodale Modelle — der Umbau der Multimodal-Engine im Mai 2026, mit Llama 4, Gemma 3, Qwen2.5-VL und Mistral Small 3.1.
- Ollama-API-Dokumentation — die dokumentierte Form der
/api/generate- und/api/chat-Anfragen/Antworten für Bilder. - Ollama-Modellbibliothek — die Live-Bibliothek, mit der jedes in diesem Artikel gelistete Modell verifiziert wurde, einschließlich einzelner Seiten für llava, llama3.2-vision, qwen2.5vl, minicpm-v, moondream, granite3.2-vision, gemma3, llama4 und mistral-small3.1.
