Points clés
- Prise en charge multimodale ajoutée dans Ollama v0.1.15 (12 décembre 2023) ; reconstruite en un moteur multimodal dédié en mai 2026.
- Modèles capables de vision vérifiés actuellement listés : LLaVA (plus llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4, Mistral Small 3.1.
- CLI : référencer un chemin de fichier image directement dans le texte du prompt
ollama run— aucun indicateur séparé. - API HTTP :
/api/generateet/api/chatacceptent une image encodée en base64 dans un tableauimages, documenté dans ledocs/api.mdpropre à Ollama. - Ollama est réservé à l'inférence : il exécute des modèles, il ne les affine ni ne les entraîne.
- Construit sur llama.cpp depuis les origines d'Ollama mi-2023 (dépôt GitHub créé le 26 juin 2023, sous licence MIT) ; prend désormais aussi en charge MLX d'Apple comme backend alternatif sur Apple Silicon.
📍 En une phrase
Ollama prend en charge l'exécution locale de modèles capables de vision (multimodaux) depuis la version 0.1.15 en décembre 2023, liste actuellement LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 et Mistral Small 3.1 dans sa bibliothèque, et prend en charge à la fois une CLI simple (référencer un chemin de fichier image dans le prompt) et une API HTTP (images encodées en base64 dans un tableau JSON images).
💬 En termes simples
Ollama est l'outil qui vous permet de télécharger et d'exécuter des modèles d'IA sur votre propre ordinateur avec une seule commande, et plusieurs de ces modèles peuvent aussi regarder des images et répondre à des questions à leur sujet — ce guide montre les vraies commandes et appels d'API pour y parvenir.
📌Remarque: La liste de modèles ci-dessus reflète ce que PromptQuorum a confirmé en direct sur ollama.com/library au moment de cet avis. La bibliothèque d'Ollama évolue ; vérifiez la fiche actuelle d'un modèle avant d'en dépendre — voir la section Sources pour les URL exactes de bibliothèque vérifiées.
Histoire : Ollama, llama.cpp et la prise en charge multimodale
**Le dépôt GitHub d'Ollama a été créé le 26 juin 2023**, et est sous licence MIT. Il enveloppe llama.cpp, le moteur d'inférence C/C++ pour les modèles au format GGUF, derrière une interface en ligne de commande de type Docker et une API HTTP locale — la proposition de valeur centrale étant que ollama run llama3 télécharge et exécute un modèle sans que l'utilisateur ait à gérer directement les dépendances, les pilotes GPU ou le moteur d'inférence sous-jacent.
**La prise en charge multimodale (entrée d'image) a été ajoutée dans Ollama v0.1.15, sortie le 12 décembre 2023**, avec LLaVA comme premier modèle de vision pris en charge. Les notes de version décrivent l'exécution de ollama run llava puis la saisie directe d'un chemin de fichier image dans l'invite interactive, ainsi qu'un nouveau paramètre images ajouté au point de terminaison HTTP /api/generate acceptant des images PNG ou JPEG encodées en base64 jusqu'à 100 Mo.
Ollama a reconstruit la prise en charge multimodale en un moteur multimodal dédié vers mai 2026, selon le propre blog d'Ollama, ajoutant une prise en charge de vision de premier ordre pour des familles de modèles plus récentes, notamment Llama 4, Gemma 3, Qwen2.5-VL et Mistral Small 3.1 — avec une gestion propre à chaque modèle de la résolution d'image, des métadonnées de position et des mécanismes d'attention, plutôt que l'approche plus générique utilisée pour l'intégration originale de LLaVA. La même mise à jour a apporté le déchargement GPU Metal pour les modèles multimodaux sur Apple Silicon via le backend llama.cpp.
Ollama fonctionne principalement sur le backend llama.cpp, et prend séparément en charge le framework MLX d'Apple comme backend alternatif sur le matériel Apple Silicon, que certains modèles multimodaux plus récents peuvent utiliser pour de meilleures performances sur Mac.
Quand Ollama a-t-il ajouté la prise en charge des modèles de vision ?
Ollama a ajouté la prise en charge multimodale (entrée d'image) dans la version 0.1.15, sortie le 12 décembre 2023, avec LLaVA comme premier modèle de vision pris en charge. Il a reconstruit cela en un moteur multimodal dédié vers mai 2026 pour des familles de modèles plus récentes comme Llama 4, Gemma 3, Qwen2.5-VL et Mistral Small 3.1.
Quels modèles de vision figurent réellement dans la bibliothèque d'Ollama
PromptQuorum a vérifié chacun des modèles suivants en direct sur ollama.com/library au moment de cet avis — cette liste reflète ce qui est réellement téléchargeable aujourd'hui, pas un panorama général des modèles vision-langage qui pourraient ou non être empaquetés pour Ollama.
llava
- Créateur:
- UW-Madison / Microsoft Research / Columbia (recherche)
- Remarques:
- 7B/13B/34B ; voir l'avis LLaVA dédié de PromptQuorum
llava-llama3 / llava-phi3 / bakllava
- Créateur:
- Variantes communautaires
- Remarques:
- Modèles d'architecture LLaVA affinés sur différents LLM de base
llama3.2-vision
- Créateur:
- Meta
- Remarques:
- Tailles 11B et 90B ; solide Q&R d'image générale
qwen2.5vl
- Créateur:
- Alibaba (équipe Qwen)
- Remarques:
- 3B/7B/32B/72B ; forte OCR et compréhension documentaire
qwen3-vl
- Créateur:
- Alibaba (équipe Qwen)
- Remarques:
- 2B-235B ; plus récent que qwen2.5vl, jusqu'à 256K de contexte, option OCR/agent la plus puissante ici
minicpm-v
- Créateur:
- OpenBMB
- Remarques:
- ~8B, ~5,5 Go ; forte OCR documentaire à faible VRAM, prise en charge multi-image
moondream
- Créateur:
- Indépendant (Vikhyat K.)
- Remarques:
- 1,8B, ~1,7 Go ; l'option la plus légère ici, pour un usage léger/embarqué
granite3.2-vision
- Créateur:
- IBM
- Remarques:
- ~2,4 Go ; réglé pour l'analyse de documents visuels — tableaux, graphiques, infographies
gemma3
- Créateur:
- Remarques:
- Les tailles 4B/12B/27B sont multimodales (270M et 1B sont uniquement textuelles)
llama4
- Créateur:
- Meta
- Remarques:
- Mixture-of-experts, nativement multimodal ; téléchargement volumineux (67 Go+)
mistral-small3.1
- Créateur:
- Mistral AI
- Remarques:
- 24B, ~15 Go ; sous licence Apache-2.0, vision plus texte
La bibliothèque d'Ollama évolue vite : qwen3-vl a déjà rejoint qwen2.5vl comme option Qwen vision plus récente et plus performante (jusqu'à 256K de contexte) depuis la rédaction du reste de cet article. Modèles sans page de bibliothèque Ollama propre confirmée au moment de cet avis, bien que discutés ailleurs comme modèles de vision : qwen2-vl (remplacé par qwen2.5vl) et une entrée autonome llava-next (les améliorations de LLaVA-NeXT/1.6 sont intégrées dans la fiche llava elle-même). Vérifiez toujours directement ollama.com/library/<nom> avant de dépendre d'un nom de modèle spécifique — ce tableau est un instantané, pas un flux en direct.
Télécharger et exécuter un modèle de vision : étape par étape
Ce guide utilise LLaVA comme exemple, mais les mêmes étapes s'appliquent à n'importe quel modèle du tableau ci-dessus.
- 1Installer Ollama.
Why it matters: Téléchargez [Ollama](https://ollama.com) pour macOS, Linux ou Windows. L'installation est un installateur/paquet standard et prend moins de deux minutes. - 2Télécharger un modèle de vision.
Why it matters: Exécutez `ollama pull llava` (ou `ollama pull qwen2.5vl`, `ollama pull minicpm-v`, etc.) — cela télécharge les poids du modèle, dont la taille varie de moins de 2 Go (Moondream) à plusieurs dizaines de gigaoctets (Llama 4). - 3L'exécuter avec une image référencée dans le prompt.
Why it matters: Exécutez `ollama run llava "describe this image: ./photo.jpg"`. Ollama détecte le chemin de fichier `.jpg`/`.png` dans le texte du prompt et attache l'image automatiquement — ce schéma fonctionne depuis la v0.1.15 en décembre 2023. - 4Ou appeler directement l'API HTTP.
Why it matters: Envoyez une requête POST à `http://localhost:11434/api/generate` ou `/api/chat` avec l'image encodée en base64 dans un tableau `images` — la forme JSON exacte est documentée dans le [docs/api.md](https://github.com/ollama/ollama/blob/main/docs/api.md) propre à Ollama, et présentée dans la section Exemples d'utilisation ci-dessous. - 5(Optionnel) Utiliser les bibliothèques clientes officielles.
Why it matters: Les bibliothèques officielles Python et JavaScript `ollama` acceptent directement un chemin de fichier image et gèrent l'encodage base64 pour vous, évitant un encodage manuel dans les scripts.
Exemples d'utilisation réels : CLI et API HTTP
Ces exemples proviennent directement de la documentation propre à Ollama et de formes de requête/réponse vérifiées — pas d'une syntaxe inventée.
- Aucun indicateur image séparé n'existe dans la CLI. Ollama détecte un chemin de fichier
.jpg/.png/similaire à l'intérieur du texte du prompt lui-même et l'attache automatiquement. /api/generateutiliseprompt;/api/chatutilisemessages.** Les deux acceptent un tableauimagesde chaînes encodées en base64 ;/api/chatprend en charge les conversations multi-tours avec des images attachées à des messages individuels.
# Télécharger et exécuter via la CLI — référencer le chemin de l'image directement dans le prompt
ollama pull llava
ollama run llava "describe this image: ./photo.jpg"
# --- API HTTP : /api/generate (documentée dans le docs/api.md d'Ollama) ---
curl http://localhost:11434/api/generate -d '{
"model": "llava",
"prompt": "What is in this picture?",
"stream": false,
"images": ["<données image encodées en base64>"]
}'
# --- API HTTP : /api/chat (multi-tours, également documentée dans docs/api.md) ---
curl http://localhost:11434/api/chat -d '{
"model": "llava",
"messages": [
{ "role": "user", "content": "What is in this image?", "images": ["<données image encodées en base64>"] }
]
}'
# --- Python : bibliothèque officielle ollama (gère l'encodage base64 pour vous) ---
import ollama
response = ollama.chat(
model="llava",
messages=[{
"role": "user",
"content": "What is in this image?",
"images": ["photo.jpg"],
}],
)
print(response["message"]["content"])
# --- Python : API HTTP brute avec encodage base64 manuel ---
import base64
import requests
def ask_vision_model(image_path: str, prompt: str, model: str = "llava") -> str:
with open(image_path, "rb") as f:
image_b64 = base64.b64encode(f.read()).decode("utf-8")
response = requests.post(
"http://localhost:11434/api/generate",
json={"model": model, "prompt": prompt, "images": [image_b64], "stream": False},
)
return response.json()["response"]Conseils VRAM et matériel
Les propres pages de bibliothèque de modèles d'Ollama listent la taille de téléchargement de chaque modèle, ce qui constitue une approximation raisonnable de la VRAM ou de la RAM nécessaire pour exécuter un modèle quantifié — PromptQuorum n'a trouvé aucun tableau VRAM faisant autorité publié séparément par Ollama au-delà de ces tailles de téléchargement par modèle.
Modèle | Taille approx. | Minimum pratique |
|---|---|---|
| Moondream | ~1,7 Go | 4 Go de VRAM / fonctionne sur du matériel modeste |
| Granite 3.2 Vision | ~2,4 Go | 4-6 Go de VRAM |
| LLaVA 7B / MiniCPM-V | ~4,7-5,5 Go | 6-8 Go de VRAM |
| Llama 3.2 Vision 11B / Qwen2.5-VL 7B | ~6-8 Go | 8-10 Go de VRAM |
| Mistral Small 3.1 | ~15 Go | 16-24 Go de VRAM |
| LLaVA 34B / Qwen2.5-VL 32B | ~20-21 Go | 24 Go+ de VRAM |
| Llama 3.2 Vision 90B / Llama 4 | ~55-67 Go+ | Multi-GPU ou Apple Silicon à forte mémoire |
📌Remarque: Il s'agit de tailles de téléchargement approximatives, pas de benchmarks VRAM mesurés — PromptQuorum n'a pas réalisé ses propres tests matériels pour cet article. Un modèle peut fonctionner uniquement sur CPU à une vitesse bien plus lente s'il ne tient pas dans la VRAM disponible ; la marge de VRAM réellement utilisable dépend aussi de la longueur de contexte et de la taille de lot.
Pour quoi Ollama n'est pas adapté
Ollama est un moyen solide et activement développé d'exécuter des modèles capables de vision en local, mais c'est le mauvais outil pour les situations suivantes :
- Affiner ou entraîner un modèle. Ollama est réservé à l'inférence — il exécute des poids de modèle pré-entraînés, il ne fournit pas de pipeline d'entraînement ou d'affinage. Si vous devez affiner un modèle vision-langage sur vos propres données, il vous faut une autre chaîne d'outils (comme les propres scripts d'entraînement du dépôt LLaVA original, ou un framework comme Hugging Face Transformers).
- La toute dernière capacité multimodale propriétaire. La bibliothèque d'Ollama est construite autour de modèles à poids ouverts. Au moment de cet avis, les API cloud de vision de GPT-4o, Claude et Gemini devancent généralement les modèles locaux ouverts sur la compréhension de scènes complexes, la reconnaissance d'écriture manuscrite et les images ambiguës — Ollama est le bon outil pour un usage privé et auto-hébergé à coût marginal nul par image, pas pour égaler l'état de l'art absolu.
- L'extraction numérique précise de graphiques et diagrammes. C'est une limite des modèles vision-langage sous-jacents eux-mêmes, pas spécifique à Ollama en tant qu'exécuteur — vérifiez tout chiffre extrait par rapport aux données source, quel que soit le modèle ou l'exécuteur utilisé.
- Une réponse unique et unifiée à « quel est le meilleur modèle ». Le bon modèle de vision via Ollama dépend de la tâche : Qwen2.5-VL pour un travail documentaire à forte composante OCR, MiniCPM-V pour l'OCR à VRAM plus faible, Llama 3.2 Vision pour la Q&R d'image générale, Moondream pour l'empreinte la plus légère. Voir la comparaison des modèles de vision locaux de PromptQuorum pour des conseils tâche par tâche.
Alternatives à Ollama pour les modèles de vision
LM Studio
- Idéal pour:
- Exécuteur de modèles locaux orienté interface graphique ; confirmé pour prendre en charge des modèles capables de vision avec pièce jointe image dans son interface de chat
- Licence:
- Gratuit, application propriétaire
llama.cpp directement
- Idéal pour:
- Contrôle bas niveau maximal sur l'inférence, y compris la prise en charge multimodale (style llava.cpp), sans la couche d'encapsulation d'Ollama
- Licence:
- MIT
Le propre dépôt de LLaVA
- Idéal pour:
- Contrôle de niveau recherche, scripts d'entraînement/affinage — voir l'avis LLaVA de PromptQuorum
- Licence:
- Apache-2.0 (code) ; dépendant du modèle de base pour les checkpoints
MLC-LLM / MLC Chat
- Idéal pour:
- Déploiement de LLM sur l'appareil sur plusieurs plateformes ; PromptQuorum n'a trouvé aucune prise en charge confirmée et officiellement documentée de modèles vision-langage (VLM) au moment de cet avis — vérifiez l'état actuel avant de vous y fier pour des tâches de vision
- Licence:
- Apache-2.0
API VLM cloud (GPT-4o, Claude, Gemini Vision)
- Idéal pour:
- Capacité multimodale la plus élevée disponible, aucun matériel local ni configuration nécessaire
- Licence:
- Propriétaire (API payante)
Questions fréquemment posées
Ollama prend-il en charge les modèles de vision ?
Oui. Ollama a ajouté la prise en charge multimodale (entrée d'image) dans la version 0.1.15, sortie le 12 décembre 2023, et l'a reconstruite en un moteur multimodal dédié vers mai 2026. Au moment de cet avis, sa bibliothèque liste LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 et Mistral Small 3.1 comme modèles capables de vision.
Comment transmettre une image à un modèle dans Ollama ?
Depuis la CLI, référencez le chemin de fichier de l'image directement dans le texte du prompt : ollama run llava "describe this image: ./photo.jpg". Il n'existe pas d'indicateur --image séparé. Par programmation, envoyez une requête POST à /api/generate ou /api/chat avec l'image encodée en base64 dans un tableau images, selon le propre docs/api.md d'Ollama.
Quel est le format JSON exact pour envoyer une image à l'API d'Ollama ?
Pour /api/generate : `{"model": "llava", "prompt": "...", "images": ["<chaîne base64>"]}. Pour /api/chat : {"model": "llava", "messages": [{"role": "user", "content": "...", "images": ["<chaîne base64>"]}]}. Les deux sont documentés dans le dépôt GitHub d'Ollama sous docs/api.md`.
Quels modèles de vision sont actuellement disponibles dans la bibliothèque d'Ollama ?
Vérifiés pour cet avis : LLaVA (plus les variantes llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3 (4B et plus), Llama 4 et Mistral Small 3.1. Vérifiez directement ollama.com/library, car cette liste peut changer.
Ollama peut-il affiner un modèle de vision ?
Non. Ollama est réservé à l'inférence — il exécute des poids de modèle pré-entraînés mais ne fournit pas de pipeline d'entraînement ou d'affinage. L'affinage nécessite une autre chaîne d'outils, comme les propres scripts d'entraînement du modèle original ou un framework comme Hugging Face Transformers.
Ollama est-il construit sur llama.cpp ?
Oui. Ollama enveloppe llama.cpp, le moteur d'inférence C/C++ pour les modèles au format GGUF, derrière une interface en ligne de commande et une API HTTP plus simples. Le dépôt GitHub d'Ollama a été créé le 26 juin 2023. Il prend également en charge le framework MLX d'Apple comme backend alternatif sur Apple Silicon.
Comment Ollama se compare-t-il aux API de vision cloud comme GPT-4o ou Gemini ?
Ollama exécute des modèles en local à coût marginal nul par requête et garde les images sur l'appareil, mais sa bibliothèque est construite autour de modèles à poids ouverts, qui accusent généralement un retard sur les API de vision cloud propriétaires en matière de compréhension de scènes complexes, d'écriture manuscrite et d'images ambiguës. Choisissez Ollama pour la confidentialité, le contrôle des coûts à volume et l'usage hors ligne ; choisissez une API cloud pour la capacité la plus élevée disponible.
Verdict
Ollama offre un chemin réellement simple vers l'exécution locale de modèles capables de vision depuis décembre 2023, et la reconstruction de son moteur multimodal en mai 2026 a maintenu cette expérience à jour pour des familles de modèles plus récentes comme Llama 4, Gemma 3, Qwen2.5-VL et Mistral Small 3.1, aux côtés d'options bien établies comme LLaVA. Le flux de travail central — ollama pull, puis ollama run avec un chemin d'image dans le prompt, ou les points de terminaison HTTP documentés /api/generate//api/chat — est resté stable depuis la version originale v0.1.15, ce qui est en soi un point en faveur d'Ollama pour quiconque construit dessus. Ce n'est pas un outil d'entraînement, et il n'égalera pas la toute dernière capacité multimodale propriétaire cloud, mais pour une compréhension d'image privée, auto-hébergée et à coût marginal nul, il reste l'un des points d'entrée les plus pratiques disponibles. Combinez ce guide avec l'avis LLaVA de PromptQuorum pour approfondir un modèle spécifique, ou la comparaison des modèles de vision locaux pour une sélection de modèle tâche par tâche sur l'ensemble du paysage des modèles de vision locaux.
Sources
- Ollama sur GitHub — date de création du dépôt, licence et historique des versions.
- Notes de version d'Ollama v0.1.15 — l'annonce originale de la prise en charge multimodale/LLaVA, le 12 décembre 2023.
- Le nouveau moteur d'Ollama pour les modèles multimodaux — la reconstruction du moteur multimodal de mai 2026, couvrant Llama 4, Gemma 3, Qwen2.5-VL et Mistral Small 3.1.
- Documentation de l'API Ollama — la forme documentée des requêtes/réponses
/api/generateet/api/chatpour les images. - Bibliothèque de modèles Ollama — la bibliothèque en direct utilisée pour vérifier chaque modèle listé dans cet article, y compris les pages individuelles pour llava, llama3.2-vision, qwen2.5vl, minicpm-v, moondream, granite3.2-vision, gemma3, llama4 et mistral-small3.1.
