Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Modèles de vision Ollama (2026) : comment exécuter réellement des modèles d'image en local
Voice, Speech & Multimodal

Modèles de vision Ollama (2026) : comment exécuter réellement des modèles d'image en local

·12 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Ollama prend en charge l'exécution locale de modèles capables de vision (multimodaux), et ce depuis la version 0.1.15 en décembre 2023. Au moment de cet avis, la bibliothèque de modèles propre à Ollama liste LLaVA (et ses variantes llava-llama3/llava-phi3/bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 et Mistral Small 3.1 comme capables de vision. Téléchargez-en un avec ollama pull llava, exécutez-le avec ollama run llava "describe this image: ./photo.jpg", ou appelez-le par programmation via /api/generate ou /api/chat avec une image encodée en base64 dans un tableau images. Ce guide couvre les vraies commandes, la forme d'API documentée, et où Ollama est ou n'est pas le bon outil — pour un avis dédié à LLaVA spécifiquement, voir l'avis LLaVA de PromptQuorum.

Ollama, l'exécuteur de modèles locaux construit sur llama.cpp, a ajouté la prise en charge multimodale (entrée d'image) dès la version 0.1.15 en décembre 2023, et l'a reconstruite en un moteur multimodal dédié en mai 2026. Ce guide est une référence pratique et ciblée pour exécuter réellement des modèles capables de vision via Ollama aujourd'hui : quels modèles sont actuellement listés dans sa bibliothèque, la vraie syntaxe CLI et API HTTP pour transmettre une image, et des conseils honnêtes sur ce pour quoi Ollama n'est pas adapté. Pour un approfondissement sur un modèle spécifique, voir l'avis LLaVA de PromptQuorum ; pour une comparaison plus large de tous les modèles de vision locaux quel que soit l'exécuteur, voir le guide des modèles de vision locaux.

Modèles de vision Ollama (2026) : comment exécuter réellement des modèles d'image en local

Points clés

  • Prise en charge multimodale ajoutée dans Ollama v0.1.15 (12 décembre 2023) ; reconstruite en un moteur multimodal dédié en mai 2026.
  • Modèles capables de vision vérifiés actuellement listés : LLaVA (plus llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4, Mistral Small 3.1.
  • CLI : référencer un chemin de fichier image directement dans le texte du prompt ollama run — aucun indicateur séparé.
  • API HTTP : /api/generate et /api/chat acceptent une image encodée en base64 dans un tableau images, documenté dans le docs/api.md propre à Ollama.
  • Ollama est réservé à l'inférence : il exécute des modèles, il ne les affine ni ne les entraîne.
  • Construit sur llama.cpp depuis les origines d'Ollama mi-2023 (dépôt GitHub créé le 26 juin 2023, sous licence MIT) ; prend désormais aussi en charge MLX d'Apple comme backend alternatif sur Apple Silicon.

📍 En une phrase

Ollama prend en charge l'exécution locale de modèles capables de vision (multimodaux) depuis la version 0.1.15 en décembre 2023, liste actuellement LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 et Mistral Small 3.1 dans sa bibliothèque, et prend en charge à la fois une CLI simple (référencer un chemin de fichier image dans le prompt) et une API HTTP (images encodées en base64 dans un tableau JSON images).

💬 En termes simples

Ollama est l'outil qui vous permet de télécharger et d'exécuter des modèles d'IA sur votre propre ordinateur avec une seule commande, et plusieurs de ces modèles peuvent aussi regarder des images et répondre à des questions à leur sujet — ce guide montre les vraies commandes et appels d'API pour y parvenir.

📌Remarque: La liste de modèles ci-dessus reflète ce que PromptQuorum a confirmé en direct sur ollama.com/library au moment de cet avis. La bibliothèque d'Ollama évolue ; vérifiez la fiche actuelle d'un modèle avant d'en dépendre — voir la section Sources pour les URL exactes de bibliothèque vérifiées.

Histoire : Ollama, llama.cpp et la prise en charge multimodale

**Le dépôt GitHub d'Ollama a été créé le 26 juin 2023**, et est sous licence MIT. Il enveloppe llama.cpp, le moteur d'inférence C/C++ pour les modèles au format GGUF, derrière une interface en ligne de commande de type Docker et une API HTTP locale — la proposition de valeur centrale étant que ollama run llama3 télécharge et exécute un modèle sans que l'utilisateur ait à gérer directement les dépendances, les pilotes GPU ou le moteur d'inférence sous-jacent.

**La prise en charge multimodale (entrée d'image) a été ajoutée dans Ollama v0.1.15, sortie le 12 décembre 2023**, avec LLaVA comme premier modèle de vision pris en charge. Les notes de version décrivent l'exécution de ollama run llava puis la saisie directe d'un chemin de fichier image dans l'invite interactive, ainsi qu'un nouveau paramètre images ajouté au point de terminaison HTTP /api/generate acceptant des images PNG ou JPEG encodées en base64 jusqu'à 100 Mo.

Ollama a reconstruit la prise en charge multimodale en un moteur multimodal dédié vers mai 2026, selon le propre blog d'Ollama, ajoutant une prise en charge de vision de premier ordre pour des familles de modèles plus récentes, notamment Llama 4, Gemma 3, Qwen2.5-VL et Mistral Small 3.1 — avec une gestion propre à chaque modèle de la résolution d'image, des métadonnées de position et des mécanismes d'attention, plutôt que l'approche plus générique utilisée pour l'intégration originale de LLaVA. La même mise à jour a apporté le déchargement GPU Metal pour les modèles multimodaux sur Apple Silicon via le backend llama.cpp.

Ollama fonctionne principalement sur le backend llama.cpp, et prend séparément en charge le framework MLX d'Apple comme backend alternatif sur le matériel Apple Silicon, que certains modèles multimodaux plus récents peuvent utiliser pour de meilleures performances sur Mac.

Quand Ollama a-t-il ajouté la prise en charge des modèles de vision ?

Ollama a ajouté la prise en charge multimodale (entrée d'image) dans la version 0.1.15, sortie le 12 décembre 2023, avec LLaVA comme premier modèle de vision pris en charge. Il a reconstruit cela en un moteur multimodal dédié vers mai 2026 pour des familles de modèles plus récentes comme Llama 4, Gemma 3, Qwen2.5-VL et Mistral Small 3.1.

Quels modèles de vision figurent réellement dans la bibliothèque d'Ollama

PromptQuorum a vérifié chacun des modèles suivants en direct sur ollama.com/library au moment de cet avis — cette liste reflète ce qui est réellement téléchargeable aujourd'hui, pas un panorama général des modèles vision-langage qui pourraient ou non être empaquetés pour Ollama.

llava

Créateur:
UW-Madison / Microsoft Research / Columbia (recherche)
Remarques:
7B/13B/34B ; voir l'avis LLaVA dédié de PromptQuorum

llava-llama3 / llava-phi3 / bakllava

Créateur:
Variantes communautaires
Remarques:
Modèles d'architecture LLaVA affinés sur différents LLM de base

llama3.2-vision

Créateur:
Meta
Remarques:
Tailles 11B et 90B ; solide Q&R d'image générale

qwen2.5vl

Créateur:
Alibaba (équipe Qwen)
Remarques:
3B/7B/32B/72B ; forte OCR et compréhension documentaire

qwen3-vl

Créateur:
Alibaba (équipe Qwen)
Remarques:
2B-235B ; plus récent que qwen2.5vl, jusqu'à 256K de contexte, option OCR/agent la plus puissante ici

minicpm-v

Créateur:
OpenBMB
Remarques:
~8B, ~5,5 Go ; forte OCR documentaire à faible VRAM, prise en charge multi-image

moondream

Créateur:
Indépendant (Vikhyat K.)
Remarques:
1,8B, ~1,7 Go ; l'option la plus légère ici, pour un usage léger/embarqué

granite3.2-vision

Créateur:
IBM
Remarques:
~2,4 Go ; réglé pour l'analyse de documents visuels — tableaux, graphiques, infographies

gemma3

Créateur:
Google
Remarques:
Les tailles 4B/12B/27B sont multimodales (270M et 1B sont uniquement textuelles)

llama4

Créateur:
Meta
Remarques:
Mixture-of-experts, nativement multimodal ; téléchargement volumineux (67 Go+)

mistral-small3.1

Créateur:
Mistral AI
Remarques:
24B, ~15 Go ; sous licence Apache-2.0, vision plus texte

La bibliothèque d'Ollama évolue vite : qwen3-vl a déjà rejoint qwen2.5vl comme option Qwen vision plus récente et plus performante (jusqu'à 256K de contexte) depuis la rédaction du reste de cet article. Modèles sans page de bibliothèque Ollama propre confirmée au moment de cet avis, bien que discutés ailleurs comme modèles de vision : qwen2-vl (remplacé par qwen2.5vl) et une entrée autonome llava-next (les améliorations de LLaVA-NeXT/1.6 sont intégrées dans la fiche llava elle-même). Vérifiez toujours directement ollama.com/library/<nom> avant de dépendre d'un nom de modèle spécifique — ce tableau est un instantané, pas un flux en direct.

Télécharger et exécuter un modèle de vision : étape par étape

Ce guide utilise LLaVA comme exemple, mais les mêmes étapes s'appliquent à n'importe quel modèle du tableau ci-dessus.

  1. 1
    Installer Ollama.
    Why it matters: Téléchargez [Ollama](https://ollama.com) pour macOS, Linux ou Windows. L'installation est un installateur/paquet standard et prend moins de deux minutes.
  2. 2
    Télécharger un modèle de vision.
    Why it matters: Exécutez `ollama pull llava` (ou `ollama pull qwen2.5vl`, `ollama pull minicpm-v`, etc.) — cela télécharge les poids du modèle, dont la taille varie de moins de 2 Go (Moondream) à plusieurs dizaines de gigaoctets (Llama 4).
  3. 3
    L'exécuter avec une image référencée dans le prompt.
    Why it matters: Exécutez `ollama run llava "describe this image: ./photo.jpg"`. Ollama détecte le chemin de fichier `.jpg`/`.png` dans le texte du prompt et attache l'image automatiquement — ce schéma fonctionne depuis la v0.1.15 en décembre 2023.
  4. 4
    Ou appeler directement l'API HTTP.
    Why it matters: Envoyez une requête POST à `http://localhost:11434/api/generate` ou `/api/chat` avec l'image encodée en base64 dans un tableau `images` — la forme JSON exacte est documentée dans le [docs/api.md](https://github.com/ollama/ollama/blob/main/docs/api.md) propre à Ollama, et présentée dans la section Exemples d'utilisation ci-dessous.
  5. 5
    (Optionnel) Utiliser les bibliothèques clientes officielles.
    Why it matters: Les bibliothèques officielles Python et JavaScript `ollama` acceptent directement un chemin de fichier image et gèrent l'encodage base64 pour vous, évitant un encodage manuel dans les scripts.

Exemples d'utilisation réels : CLI et API HTTP

Ces exemples proviennent directement de la documentation propre à Ollama et de formes de requête/réponse vérifiées — pas d'une syntaxe inventée.

  • Aucun indicateur image séparé n'existe dans la CLI. Ollama détecte un chemin de fichier .jpg/.png/similaire à l'intérieur du texte du prompt lui-même et l'attache automatiquement.
  • /api/generate utilise prompt ; /api/chat utilise messages.** Les deux acceptent un tableau images de chaînes encodées en base64 ; /api/chat prend en charge les conversations multi-tours avec des images attachées à des messages individuels.
bash
# Télécharger et exécuter via la CLI — référencer le chemin de l'image directement dans le prompt
ollama pull llava
ollama run llava "describe this image: ./photo.jpg"

# --- API HTTP : /api/generate (documentée dans le docs/api.md d'Ollama) ---
curl http://localhost:11434/api/generate -d '{
  "model": "llava",
  "prompt": "What is in this picture?",
  "stream": false,
  "images": ["<données image encodées en base64>"]
}'

# --- API HTTP : /api/chat (multi-tours, également documentée dans docs/api.md) ---
curl http://localhost:11434/api/chat -d '{
  "model": "llava",
  "messages": [
    { "role": "user", "content": "What is in this image?", "images": ["<données image encodées en base64>"] }
  ]
}'

# --- Python : bibliothèque officielle ollama (gère l'encodage base64 pour vous) ---
import ollama

response = ollama.chat(
    model="llava",
    messages=[{
        "role": "user",
        "content": "What is in this image?",
        "images": ["photo.jpg"],
    }],
)
print(response["message"]["content"])

# --- Python : API HTTP brute avec encodage base64 manuel ---
import base64
import requests

def ask_vision_model(image_path: str, prompt: str, model: str = "llava") -> str:
    with open(image_path, "rb") as f:
        image_b64 = base64.b64encode(f.read()).decode("utf-8")
    response = requests.post(
        "http://localhost:11434/api/generate",
        json={"model": model, "prompt": prompt, "images": [image_b64], "stream": False},
    )
    return response.json()["response"]

Conseils VRAM et matériel

Les propres pages de bibliothèque de modèles d'Ollama listent la taille de téléchargement de chaque modèle, ce qui constitue une approximation raisonnable de la VRAM ou de la RAM nécessaire pour exécuter un modèle quantifié — PromptQuorum n'a trouvé aucun tableau VRAM faisant autorité publié séparément par Ollama au-delà de ces tailles de téléchargement par modèle.

Modèle
Taille approx.
Minimum pratique
Moondream~1,7 Go4 Go de VRAM / fonctionne sur du matériel modeste
Granite 3.2 Vision~2,4 Go4-6 Go de VRAM
LLaVA 7B / MiniCPM-V~4,7-5,5 Go6-8 Go de VRAM
Llama 3.2 Vision 11B / Qwen2.5-VL 7B~6-8 Go8-10 Go de VRAM
Mistral Small 3.1~15 Go16-24 Go de VRAM
LLaVA 34B / Qwen2.5-VL 32B~20-21 Go24 Go+ de VRAM
Llama 3.2 Vision 90B / Llama 4~55-67 Go+Multi-GPU ou Apple Silicon à forte mémoire

📌Remarque: Il s'agit de tailles de téléchargement approximatives, pas de benchmarks VRAM mesurés — PromptQuorum n'a pas réalisé ses propres tests matériels pour cet article. Un modèle peut fonctionner uniquement sur CPU à une vitesse bien plus lente s'il ne tient pas dans la VRAM disponible ; la marge de VRAM réellement utilisable dépend aussi de la longueur de contexte et de la taille de lot.

Pour quoi Ollama n'est pas adapté

Ollama est un moyen solide et activement développé d'exécuter des modèles capables de vision en local, mais c'est le mauvais outil pour les situations suivantes :

  • Affiner ou entraîner un modèle. Ollama est réservé à l'inférence — il exécute des poids de modèle pré-entraînés, il ne fournit pas de pipeline d'entraînement ou d'affinage. Si vous devez affiner un modèle vision-langage sur vos propres données, il vous faut une autre chaîne d'outils (comme les propres scripts d'entraînement du dépôt LLaVA original, ou un framework comme Hugging Face Transformers).
  • La toute dernière capacité multimodale propriétaire. La bibliothèque d'Ollama est construite autour de modèles à poids ouverts. Au moment de cet avis, les API cloud de vision de GPT-4o, Claude et Gemini devancent généralement les modèles locaux ouverts sur la compréhension de scènes complexes, la reconnaissance d'écriture manuscrite et les images ambiguës — Ollama est le bon outil pour un usage privé et auto-hébergé à coût marginal nul par image, pas pour égaler l'état de l'art absolu.
  • L'extraction numérique précise de graphiques et diagrammes. C'est une limite des modèles vision-langage sous-jacents eux-mêmes, pas spécifique à Ollama en tant qu'exécuteur — vérifiez tout chiffre extrait par rapport aux données source, quel que soit le modèle ou l'exécuteur utilisé.
  • Une réponse unique et unifiée à « quel est le meilleur modèle ». Le bon modèle de vision via Ollama dépend de la tâche : Qwen2.5-VL pour un travail documentaire à forte composante OCR, MiniCPM-V pour l'OCR à VRAM plus faible, Llama 3.2 Vision pour la Q&R d'image générale, Moondream pour l'empreinte la plus légère. Voir la comparaison des modèles de vision locaux de PromptQuorum pour des conseils tâche par tâche.

Alternatives à Ollama pour les modèles de vision

LM Studio

Idéal pour:
Exécuteur de modèles locaux orienté interface graphique ; confirmé pour prendre en charge des modèles capables de vision avec pièce jointe image dans son interface de chat
Licence:
Gratuit, application propriétaire

llama.cpp directement

Idéal pour:
Contrôle bas niveau maximal sur l'inférence, y compris la prise en charge multimodale (style llava.cpp), sans la couche d'encapsulation d'Ollama
Licence:
MIT

Le propre dépôt de LLaVA

Idéal pour:
Contrôle de niveau recherche, scripts d'entraînement/affinage — voir l'avis LLaVA de PromptQuorum
Licence:
Apache-2.0 (code) ; dépendant du modèle de base pour les checkpoints

MLC-LLM / MLC Chat

Idéal pour:
Déploiement de LLM sur l'appareil sur plusieurs plateformes ; PromptQuorum n'a trouvé aucune prise en charge confirmée et officiellement documentée de modèles vision-langage (VLM) au moment de cet avis — vérifiez l'état actuel avant de vous y fier pour des tâches de vision
Licence:
Apache-2.0

API VLM cloud (GPT-4o, Claude, Gemini Vision)

Idéal pour:
Capacité multimodale la plus élevée disponible, aucun matériel local ni configuration nécessaire
Licence:
Propriétaire (API payante)

Questions fréquemment posées

Ollama prend-il en charge les modèles de vision ?

Oui. Ollama a ajouté la prise en charge multimodale (entrée d'image) dans la version 0.1.15, sortie le 12 décembre 2023, et l'a reconstruite en un moteur multimodal dédié vers mai 2026. Au moment de cet avis, sa bibliothèque liste LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 et Mistral Small 3.1 comme modèles capables de vision.

Comment transmettre une image à un modèle dans Ollama ?

Depuis la CLI, référencez le chemin de fichier de l'image directement dans le texte du prompt : ollama run llava "describe this image: ./photo.jpg". Il n'existe pas d'indicateur --image séparé. Par programmation, envoyez une requête POST à /api/generate ou /api/chat avec l'image encodée en base64 dans un tableau images, selon le propre docs/api.md d'Ollama.

Quel est le format JSON exact pour envoyer une image à l'API d'Ollama ?

Pour /api/generate : `{"model": "llava", "prompt": "...", "images": ["<chaîne base64>"]}. Pour /api/chat : {"model": "llava", "messages": [{"role": "user", "content": "...", "images": ["<chaîne base64>"]}]}. Les deux sont documentés dans le dépôt GitHub d'Ollama sous docs/api.md`.

Quels modèles de vision sont actuellement disponibles dans la bibliothèque d'Ollama ?

Vérifiés pour cet avis : LLaVA (plus les variantes llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3 (4B et plus), Llama 4 et Mistral Small 3.1. Vérifiez directement ollama.com/library, car cette liste peut changer.

Ollama peut-il affiner un modèle de vision ?

Non. Ollama est réservé à l'inférence — il exécute des poids de modèle pré-entraînés mais ne fournit pas de pipeline d'entraînement ou d'affinage. L'affinage nécessite une autre chaîne d'outils, comme les propres scripts d'entraînement du modèle original ou un framework comme Hugging Face Transformers.

Ollama est-il construit sur llama.cpp ?

Oui. Ollama enveloppe llama.cpp, le moteur d'inférence C/C++ pour les modèles au format GGUF, derrière une interface en ligne de commande et une API HTTP plus simples. Le dépôt GitHub d'Ollama a été créé le 26 juin 2023. Il prend également en charge le framework MLX d'Apple comme backend alternatif sur Apple Silicon.

Comment Ollama se compare-t-il aux API de vision cloud comme GPT-4o ou Gemini ?

Ollama exécute des modèles en local à coût marginal nul par requête et garde les images sur l'appareil, mais sa bibliothèque est construite autour de modèles à poids ouverts, qui accusent généralement un retard sur les API de vision cloud propriétaires en matière de compréhension de scènes complexes, d'écriture manuscrite et d'images ambiguës. Choisissez Ollama pour la confidentialité, le contrôle des coûts à volume et l'usage hors ligne ; choisissez une API cloud pour la capacité la plus élevée disponible.

Verdict

Ollama offre un chemin réellement simple vers l'exécution locale de modèles capables de vision depuis décembre 2023, et la reconstruction de son moteur multimodal en mai 2026 a maintenu cette expérience à jour pour des familles de modèles plus récentes comme Llama 4, Gemma 3, Qwen2.5-VL et Mistral Small 3.1, aux côtés d'options bien établies comme LLaVA. Le flux de travail central — ollama pull, puis ollama run avec un chemin d'image dans le prompt, ou les points de terminaison HTTP documentés /api/generate//api/chat — est resté stable depuis la version originale v0.1.15, ce qui est en soi un point en faveur d'Ollama pour quiconque construit dessus. Ce n'est pas un outil d'entraînement, et il n'égalera pas la toute dernière capacité multimodale propriétaire cloud, mais pour une compréhension d'image privée, auto-hébergée et à coût marginal nul, il reste l'un des points d'entrée les plus pratiques disponibles. Combinez ce guide avec l'avis LLaVA de PromptQuorum pour approfondir un modèle spécifique, ou la comparaison des modèles de vision locaux pour une sélection de modèle tâche par tâche sur l'ensemble du paysage des modèles de vision locaux.

Sources

← Retour aux LLM locaux avancés