Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Ollama-Vision-Modelle (2026): So führen Sie Bildmodelle wirklich lokal aus
Voice, Speech & Multimodal

Ollama-Vision-Modelle (2026): So führen Sie Bildmodelle wirklich lokal aus

·12 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Ollama unterstützt das lokale Ausführen von Vision-fähigen (multimodalen) Modellen, und zwar seit Version 0.1.15 im Dezember 2023. Zum Zeitpunkt dieses Tests listet Ollamas eigene Modellbibliothek LLaVA (und seine Varianten llava-llama3/llava-phi3/bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 und Mistral Small 3.1 als Vision-fähig auf. Laden Sie eines mit ollama pull llava herunter, führen Sie es mit ollama run llava "describe this image: ./photo.jpg" aus, oder rufen Sie es programmatisch über /api/generate oder /api/chat mit einem Base64-kodierten Bild in einem images-Array auf. Dieser Leitfaden behandelt die echten Befehle, die dokumentierte API-Form und wo Ollama das richtige Werkzeug ist und wo nicht — für einen dedizierten Test zu LLaVA speziell siehe PromptQuorums LLaVA-Test.

Ollama, der lokale Modell-Runner auf Basis von llama.cpp, fügte die Unterstützung für Multimodalität (Bildeingabe) bereits in Version 0.1.15 im Dezember 2023 hinzu und baute sie im Mai 2026 zu einer dedizierten Multimodal-Engine um. Dieser Leitfaden ist eine fokussierte, praktische Referenz zum tatsächlichen Ausführen von Vision-fähigen Modellen über Ollama: welche Modelle derzeit in seiner Bibliothek gelistet sind, die echte CLI- und HTTP-API-Syntax zum Übergeben eines Bildes, sowie ehrliche Hinweise darauf, wofür Ollama nicht geeignet ist. Für einen Tiefgang zu einem bestimmten Modell siehe PromptQuorums LLaVA-Test; für einen breiteren Vergleich über alle lokalen Vision-Modelle hinweg, unabhängig vom Runner, siehe den Leitfaden zu lokalen Vision-Modellen.

Ollama-Vision-Modelle (2026): So führen Sie Bildmodelle wirklich lokal aus

Wichtigste Erkenntnisse

  • Multimodal-Unterstützung hinzugefügt in Ollama v0.1.15 (12. Dezember 2023); im Mai 2026 zu einer dedizierten Multimodal-Engine umgebaut.
  • Verifizierte Vision-fähige Modelle, derzeit gelistet: LLaVA (plus llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4, Mistral Small 3.1.
  • CLI: Bilddateipfad direkt im ollama run-Prompttext referenzieren — kein separates Flag.
  • HTTP-API: /api/generate und /api/chat akzeptieren ein Base64-kodiertes Bild in einem images-Array, dokumentiert in Ollamas eigenem docs/api.md.
  • Ollama dient ausschließlich der Inferenz: Es führt Modelle aus, feinabstimmen oder trainieren tut es sie nicht.
  • Baut seit Ollamas Ursprung Mitte 2023 auf llama.cpp auf (GitHub-Repository erstellt am 26. Juni 2023, MIT-lizenziert); unterstützt inzwischen auch Apples MLX als alternatives Backend auf Apple Silicon.

📍 In einem Satz

Ollama unterstützt das lokale Ausführen von Vision-fähigen (multimodalen) Modellen seit Version 0.1.15 im Dezember 2023, listet derzeit LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 und Mistral Small 3.1 in seiner Bibliothek und unterstützt sowohl eine einfache CLI (Bilddateipfad im Prompt referenzieren) als auch eine HTTP-API (Base64-kodierte Bilder in einem JSON-images-Array).

💬 In einfachen Worten

Ollama ist das Tool, mit dem Sie KI-Modelle mit einem einzigen Befehl auf Ihrem eigenen Computer herunterladen und ausführen können, und mehrere dieser Modelle können auch Bilder betrachten und Fragen dazu beantworten — dieser Leitfaden zeigt die tatsächlichen Befehle und API-Aufrufe dafür.

📌Hinweis: Die obige Modellliste spiegelt wider, was PromptQuorum zum Zeitpunkt dieses Tests live auf ollama.com/library bestätigt hat. Ollamas Bibliothek ändert sich; überprüfen Sie den aktuellen Eintrag eines Modells, bevor Sie sich darauf verlassen — siehe den Abschnitt Quellen für die genauen geprüften Bibliotheks-URLs.

Geschichte: Ollama, llama.cpp und Multimodal-Unterstützung

**Ollamas GitHub-Repository wurde am 26. Juni 2023 erstellt** und steht unter der MIT-Lizenz. Es umhüllt llama.cpp, die C/C++-Inferenz-Engine für Modelle im GGUF-Format, mit einer Docker-ähnlichen Kommandozeilenschnittstelle und lokalen HTTP-API — der Kernnutzen besteht darin, dass ollama run llama3 ein Modell herunterlädt und ausführt, ohne dass der Nutzer Abhängigkeiten, GPU-Treiber oder die zugrunde liegende Inferenz-Engine direkt verwalten muss.

**Die Unterstützung für Multimodalität (Bildeingabe) wurde in Ollama v0.1.15 hinzugefügt, veröffentlicht am 12. Dezember 2023**, zusammen mit LLaVA als erstem unterstütztem Vision-Modell. Die Release-Notes beschreiben, ollama run llava auszuführen und dann einen Bilddateipfad direkt in die interaktive Eingabeaufforderung einzutippen, plus einen neuen images-Parameter, der zum /api/generate-HTTP-Endpunkt hinzugefügt wurde und Base64-kodierte PNG- oder JPEG-Bilder bis zu 100 MB akzeptiert.

Ollama baute die Multimodal-Unterstützung um Mai 2026 zu einer dedizierten Multimodal-Engine um, laut Ollamas eigenem Blog, und fügte erstklassige Vision-Unterstützung für neuere Modellfamilien hinzu, darunter Llama 4, Gemma 3, Qwen2.5-VL und Mistral Small 3.1 — mit modellspezifischer Behandlung von Bildauflösung, Positionsmetadaten und Attention-Mechanismen statt des generischeren Ansatzes, der für die ursprüngliche LLaVA-Integration verwendet wurde. Dasselbe Update brachte Metal-GPU-Offload für multimodale Modelle auf Apple Silicon über das llama.cpp-Backend.

Ollama läuft primär auf dem llama.cpp-Backend und unterstützt separat Apples MLX-Framework als alternatives Backend auf Apple-Silicon-Hardware, das einige neuere multimodale Modelle für verbesserte Leistung auf dem Mac nutzen können.

Wann fügte Ollama die Unterstützung für Vision-Modelle hinzu?

Ollama fügte die Unterstützung für Multimodalität (Bildeingabe) in Version 0.1.15 hinzu, veröffentlicht am 12. Dezember 2023, mit LLaVA als erstem unterstütztem Vision-Modell. Es baute dies um Mai 2026 zu einer dedizierten Multimodal-Engine für neuere Modellfamilien wie Llama 4, Gemma 3, Qwen2.5-VL und Mistral Small 3.1 um.

Welche Vision-Modelle sich tatsächlich in Ollamas Bibliothek befinden

PromptQuorum hat jedes der folgenden Modelle live auf ollama.com/library zum Zeitpunkt dieses Tests überprüft — diese Liste spiegelt wider, was heute tatsächlich herunterladbar ist, nicht eine allgemeine Übersicht über Vision-Language-Modelle, die möglicherweise für Ollama verpackt sind oder nicht.

llava

Hersteller:
UW-Madison / Microsoft Research / Columbia (Forschung)
Hinweise:
7B/13B/34B; siehe PromptQuorums dedizierten LLaVA-Test

llava-llama3 / llava-phi3 / bakllava

Hersteller:
Community-Varianten
Hinweise:
LLaVA-Architektur-Modelle, feinabgestimmt auf unterschiedlichen Basis-LLMs

llama3.2-vision

Hersteller:
Meta
Hinweise:
Größen 11B und 90B; starke allgemeine Bild-Q&A

qwen2.5vl

Hersteller:
Alibaba (Qwen-Team)
Hinweise:
3B/7B/32B/72B; starke OCR und Dokumentenverständnis

qwen3-vl

Hersteller:
Alibaba (Qwen-Team)
Hinweise:
2B-235B; neuer als qwen2.5vl, bis zu 256K Kontext, stärkste OCR-/Agenten-Option hier

minicpm-v

Hersteller:
OpenBMB
Hinweise:
~8B, ~5,5 GB; starke Dokument-OCR bei geringem VRAM, Multi-Bild-Unterstützung

moondream

Hersteller:
Unabhängig (Vikhyat K.)
Hinweise:
1,8B, ~1,7 GB; die kleinste Option hier, für leichtgewichtige/Edge-Nutzung

granite3.2-vision

Hersteller:
IBM
Hinweise:
~2,4 GB; für visuelle Dokumentenanalyse abgestimmt — Tabellen, Diagramme, Infografiken

gemma3

Hersteller:
Google
Hinweise:
Größen 4B/12B/27B sind multimodal (270M und 1B sind reine Textmodelle)

llama4

Hersteller:
Meta
Hinweise:
Mixture-of-Experts, nativ multimodal; großer (67 GB+) Download

mistral-small3.1

Hersteller:
Mistral AI
Hinweise:
24B, ~15 GB; Apache-2.0-lizenziert, Vision plus Text

Ollamas Bibliothek entwickelt sich schnell: qwen3-vl ist bereits als neuere, leistungsfähigere Qwen-Vision-Option (bis zu 256K Kontext) neben qwen2.5vl hinzugekommen, seit der Rest dieses Artikels verfasst wurde. Modelle, für die zum Zeitpunkt dieses Tests keine eigene Ollama-Bibliotheksseite bestätigt werden konnte, obwohl sie andernorts als Vision-Modelle besprochen werden: qwen2-vl (durch qwen2.5vl abgelöst) und ein eigenständiger llava-next-Eintrag (die LLaVA-NeXT/1.6-Verbesserungen sind in den llava-Eintrag selbst integriert). Prüfen Sie immer ollama.com/library/<name> direkt, bevor Sie sich auf einen bestimmten Modellnamen verlassen — diese Tabelle ist eine Momentaufnahme, kein Live-Feed.

Ein Vision-Modell herunterladen und ausführen: Schritt für Schritt

Diese Anleitung verwendet LLaVA als Beispiel, doch dieselben Schritte gelten für jedes Modell aus der obigen Tabelle.

  1. 1
    Ollama installieren.
    Why it matters: Laden Sie [Ollama](https://ollama.com) für macOS, Linux oder Windows herunter. Die Installation ist ein Standard-Installer/Paket und dauert unter zwei Minuten.
  2. 2
    Ein Vision-Modell herunterladen.
    Why it matters: Führen Sie `ollama pull llava` aus (oder `ollama pull qwen2.5vl`, `ollama pull minicpm-v` usw.) — dies lädt die Modellgewichte herunter, deren Größe von unter 2 GB (Moondream) bis zu mehreren zehn Gigabyte (Llama 4) reicht.
  3. 3
    Mit einem im Prompt referenzierten Bild ausführen.
    Why it matters: Führen Sie `ollama run llava "describe this image: ./photo.jpg"` aus. Ollama erkennt den `.jpg`/`.png`-Dateipfad im Prompttext und hängt das Bild automatisch an — dieses Muster funktioniert seit v0.1.15 im Dezember 2023.
  4. 4
    Oder die HTTP-API direkt aufrufen.
    Why it matters: Senden Sie eine POST-Anfrage an `http://localhost:11434/api/generate` oder `/api/chat` mit dem Base64-kodierten Bild in einem `images`-Array — die genaue JSON-Form ist in Ollamas eigenem [docs/api.md](https://github.com/ollama/ollama/blob/main/docs/api.md) dokumentiert und wird im Abschnitt Nutzungsbeispiele unten gezeigt.
  5. 5
    (Optional) Die offiziellen Client-Bibliotheken verwenden.
    Why it matters: Die offiziellen `ollama`-Python- und JavaScript-Bibliotheken akzeptieren direkt einen Bilddateipfad und übernehmen die Base64-Kodierung für Sie, sodass manuelle Kodierung in Skripten entfällt.

Echte Nutzungsbeispiele: CLI und HTTP-API

Diese Beispiele stammen direkt aus Ollamas eigener Dokumentation und verifizierten Anfrage-/Antwortformen — keine erfundene Syntax.

  • Es gibt kein separates Bild-Flag in der CLI. Ollama erkennt einen .jpg/.png/ähnlichen Dateipfad innerhalb des Prompttextes selbst und hängt ihn automatisch an.
  • /api/generate verwendet prompt; /api/chat verwendet messages.** Beide akzeptieren ein images-Array aus Base64-kodierten Strings; /api/chat unterstützt mehrstufige Konversationen mit Bildern, die einzelnen Nachrichten zugeordnet sind.
bash
# Herunterladen und über CLI ausführen — Bildpfad direkt im Prompt referenzieren
ollama pull llava
ollama run llava "describe this image: ./photo.jpg"

# --- HTTP-API: /api/generate (dokumentiert in Ollamas docs/api.md) ---
curl http://localhost:11434/api/generate -d '{
  "model": "llava",
  "prompt": "What is in this picture?",
  "stream": false,
  "images": ["<Base64-kodierte Bilddaten>"]
}'

# --- HTTP-API: /api/chat (mehrstufig, ebenfalls in docs/api.md dokumentiert) ---
curl http://localhost:11434/api/chat -d '{
  "model": "llava",
  "messages": [
    { "role": "user", "content": "What is in this image?", "images": ["<Base64-kodierte Bilddaten>"] }
  ]
}'

# --- Python: offizielle ollama-Bibliothek (übernimmt Base64-Kodierung für Sie) ---
import ollama

response = ollama.chat(
    model="llava",
    messages=[{
        "role": "user",
        "content": "What is in this image?",
        "images": ["photo.jpg"],
    }],
)
print(response["message"]["content"])

# --- Python: rohe HTTP-API mit manueller Base64-Kodierung ---
import base64
import requests

def ask_vision_model(image_path: str, prompt: str, model: str = "llava") -> str:
    with open(image_path, "rb") as f:
        image_b64 = base64.b64encode(f.read()).decode("utf-8")
    response = requests.post(
        "http://localhost:11434/api/generate",
        json={"model": model, "prompt": prompt, "images": [image_b64], "stream": False},
    )
    return response.json()["response"]

VRAM- und Hardware-Hinweise

Ollamas eigene Modellbibliotheksseiten listen die Downloadgröße jedes Modells auf, was ein vernünftiger Näherungswert für den VRAM- oder RAM-Bedarf eines quantisierten Modells ist — PromptQuorum fand keine separat veröffentlichte, autoritative VRAM-Tabelle von Ollama über diese modellspezifischen Downloadgrößen hinaus.

Modell
Ungefähre Größe
Praktisches Minimum
Moondream~1,7 GB4 GB VRAM / läuft auf bescheidener Hardware
Granite 3.2 Vision~2,4 GB4-6 GB VRAM
LLaVA 7B / MiniCPM-V~4,7-5,5 GB6-8 GB VRAM
Llama 3.2 Vision 11B / Qwen2.5-VL 7B~6-8 GB8-10 GB VRAM
Mistral Small 3.1~15 GB16-24 GB VRAM
LLaVA 34B / Qwen2.5-VL 32B~20-21 GB24 GB+ VRAM
Llama 3.2 Vision 90B / Llama 4~55-67 GB+Multi-GPU oder Apple Silicon mit viel Speicher

📌Hinweis: Dies sind ungefähre Downloadgrößen, keine gemessenen VRAM-Benchmarks — PromptQuorum hat für diesen Artikel keine eigenen Hardware-Tests durchgeführt. Ein Modell kann bei viel geringerer Geschwindigkeit allein auf der CPU laufen, wenn es nicht in den verfügbaren VRAM passt; der tatsächlich nutzbare VRAM-Spielraum hängt zudem von Kontextlänge und Batchgröße ab.

Wofür Ollama nicht geeignet ist

Ollama ist ein starker, aktiv weiterentwickelter Weg, um Vision-fähige Modelle lokal auszuführen, ist aber das falsche Werkzeug für die folgenden Situationen:

  • Feinabstimmung oder Training eines Modells. Ollama dient ausschließlich der Inferenz — es führt vortrainierte Modellgewichte aus, bietet aber keine Trainings- oder Feinabstimmungs-Pipeline. Wenn Sie ein Vision-Language-Modell mit Ihren eigenen Daten feinabstimmen müssen, benötigen Sie eine andere Toolchain (etwa die eigenen Trainingsskripte des originalen LLaVA-Repositorys oder ein Framework wie Hugging Face Transformers).
  • Neueste proprietäre Multimodal-Fähigkeit. Ollamas Bibliothek ist um Open-Weight-Modelle herum aufgebaut. Zum Zeitpunkt dieses Tests führen die Cloud-Vision-APIs von GPT-4o, Claude und Gemini im Allgemeinen bei komplexem Szenenverständnis, Handschrifterkennung und mehrdeutigen Bildern gegenüber offenen lokalen Modellen — Ollama ist das richtige Werkzeug für private, selbst gehostete Nutzung ohne Grenzkosten pro Bild, nicht für das Erreichen des absoluten Stands der Technik.
  • Präzise numerische Extraktion aus Diagrammen und Grafiken. Dies ist eine Einschränkung der zugrunde liegenden Vision-Language-Modelle selbst, nicht spezifisch für Ollama als Runner — überprüfen Sie extrahierte Zahlen stets gegen die Quelldaten, unabhängig davon, welches Modell oder welchen Runner Sie verwenden.
  • Eine einzige einheitliche Antwort auf „welches Modell ist am besten". Das richtige Vision-Modell über Ollama hängt von der Aufgabe ab: Qwen2.5-VL für OCR-lastige Dokumentenarbeit, MiniCPM-V für OCR bei niedrigerem VRAM, Llama 3.2 Vision für allgemeine Bild-Q&A, Moondream für den geringsten Fußabdruck. Siehe PromptQuorums Vergleich lokaler Vision-Modelle für aufgabenspezifische Hinweise.

Alternativen zu Ollama für Vision-Modelle

LM Studio

Am besten für:
GUI-orientierter lokaler Modell-Runner; bestätigt, Vision-fähige Modelle mit Bildanhang in seiner Chat-Oberfläche zu unterstützen
Lizenz:
Kostenlos, proprietäre Anwendung

llama.cpp direkt

Am besten für:
Maximale Low-Level-Kontrolle über die Inferenz, einschließlich Multimodal-Unterstützung (im Stil von llava.cpp), ohne Ollamas Wrapper-Schicht
Lizenz:
MIT

LLaVAs eigenes Repository

Am besten für:
Forschungsgerechte Kontrolle, Trainings-/Feinabstimmungsskripte — siehe PromptQuorums LLaVA-Test
Lizenz:
Apache-2.0 (Code); basismodellabhängig für Checkpoints

MLC-LLM / MLC Chat

Am besten für:
On-Device-LLM-Deployment über Plattformen hinweg; PromptQuorum fand zum Zeitpunkt dieses Tests keine bestätigte, offiziell dokumentierte Unterstützung für Vision-Language-Modelle (VLM) — prüfen Sie den aktuellen Status, bevor Sie sich für Vision-Aufgaben darauf verlassen
Lizenz:
Apache-2.0

Cloud-VLM-APIs (GPT-4o, Claude, Gemini Vision)

Am besten für:
Höchste verfügbare multimodale Fähigkeit, keine lokale Hardware oder Einrichtung nötig
Lizenz:
Proprietär (kostenpflichtige API)

Häufig gestellte Fragen

Unterstützt Ollama Vision-Modelle?

Ja. Ollama fügte die Unterstützung für Multimodalität (Bildeingabe) in Version 0.1.15 hinzu, veröffentlicht am 12. Dezember 2023, und baute sie um Mai 2026 zu einer dedizierten Multimodal-Engine um. Zum Zeitpunkt dieses Tests listet seine Bibliothek LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 und Mistral Small 3.1 als Vision-fähige Modelle.

Wie übergebe ich ein Bild an ein Modell in Ollama?

Referenzieren Sie über die CLI den Dateipfad des Bildes direkt im Prompttext: ollama run llava "describe this image: ./photo.jpg". Es gibt kein separates --image-Flag. Programmatisch senden Sie eine POST-Anfrage an /api/generate oder /api/chat mit dem Base64-kodierten Bild in einem images-Array, gemäß Ollamas eigenem docs/api.md.

Was ist das genaue JSON-Format zum Senden eines Bildes an Ollamas API?

Für /api/generate: `{"model": "llava", "prompt": "...", "images": ["<Base64-String>"]}. Für /api/chat: {"model": "llava", "messages": [{"role": "user", "content": "...", "images": ["<Base64-String>"]}]}. Beide sind in Ollamas GitHub-Repository unter docs/api.md` dokumentiert.

Welche Vision-Modelle sind derzeit in Ollamas Bibliothek verfügbar?

Für diesen Test verifiziert: LLaVA (plus llava-llama3-, llava-phi3-, bakllava-Varianten), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3 (4B und größer), Llama 4 und Mistral Small 3.1. Prüfen Sie ollama.com/library direkt, da sich diese Liste ändern kann.

Kann Ollama ein Vision-Modell feinabstimmen?

Nein. Ollama dient ausschließlich der Inferenz — es führt vortrainierte Modellgewichte aus, bietet aber keine Trainings- oder Feinabstimmungs-Pipeline. Feinabstimmung erfordert eine andere Toolchain, etwa die eigenen Trainingsskripte des Originalmodells oder ein Framework wie Hugging Face Transformers.

Baut Ollama auf llama.cpp auf?

Ja. Ollama umhüllt llama.cpp, die C/C++-Inferenz-Engine für Modelle im GGUF-Format, mit einer einfacheren Kommandozeilenschnittstelle und HTTP-API. Ollamas GitHub-Repository wurde am 26. Juni 2023 erstellt. Es unterstützt außerdem Apples MLX-Framework als alternatives Backend auf Apple Silicon.

Wie schneidet Ollama im Vergleich zu Cloud-Vision-APIs wie GPT-4o oder Gemini ab?

Ollama führt Modelle lokal ohne Grenzkosten pro Anfrage aus und behält Bilder auf dem Gerät, doch seine Bibliothek ist um Open-Weight-Modelle herum aufgebaut, die im Allgemeinen proprietären Cloud-Vision-APIs bei komplexem Szenenverständnis, Handschrift und mehrdeutigen Bildern hinterherhinken. Wählen Sie Ollama für Datenschutz, Kostenkontrolle bei hohem Volumen und Offline-Nutzung; wählen Sie eine Cloud-API für die höchste verfügbare Fähigkeit.

Fazit

Ollama bietet seit Dezember 2023 einen wirklich einfachen Weg, Vision-fähige Modelle lokal auszuführen, und der Umbau der Multimodal-Engine im Mai 2026 hielt dieses Erlebnis für neuere Modellfamilien wie Llama 4, Gemma 3, Qwen2.5-VL und Mistral Small 3.1 neben langjährigen Optionen wie LLaVA aktuell. Der Kern-Workflow — ollama pull, dann ollama run mit einem Bildpfad im Prompt, oder die dokumentierten /api/generate//api/chat-HTTP-Endpunkte — ist seit der ursprünglichen v0.1.15-Veröffentlichung stabil geblieben, was selbst ein Pluspunkt für Ollama für jeden ist, der darauf aufbaut. Es ist kein Trainingswerkzeug, und es wird nicht mit der neuesten proprietären Cloud-Multimodal-Fähigkeit mithalten können, doch für privates, selbst gehostetes Bildverständnis ohne Grenzkosten bleibt es einer der praktischsten verfügbaren Einstiegspunkte. Kombinieren Sie diesen Leitfaden mit PromptQuorums LLaVA-Test für Tiefgang zu einem bestimmten Modell oder dem Vergleich lokaler Vision-Modelle für aufgabenspezifische Modellauswahl über die gesamte lokale Vision-Modell-Landschaft hinweg.

Quellen

← Zurück zu Lokale LLMs Pro