Quels modèles Ollama supportent la vision ?

Réponse rapide
Les meilleurs modèles de vision d'Ollama en 2026 sont Qwen3-VL et Gemma 4, tous deux nativement multimodaux. LLaVA reste le repli le plus sûr pour une large compatibilité. Llama 3.2 Vision est actuellement cassé sur Ollama (« unknown model architecture: mllama ») — utilisez Qwen3-VL ou Gemma 4 à la place.
- ▸qwen3-vl : famille de vision la plus puissante, idéale pour l'OCR, les graphiques et les captures d'écran
- ▸gemma4 : vision intégrée à chaque taille, plus l'appel d'outils
- ▸llava : repli le plus sûr, compatibilité client la plus large
- ▸llama3.2-vision : cassé sur Ollama v0.30.0+ (« unknown model architecture: mllama »)
Points clés
- ✓Depuis septembre 2026, les modèles de vision phares d'Ollama sont Qwen3-VL et Gemma 4 — tous deux ont remplacé la génération précédente Qwen2.5-VL / Gemma 3
- ✓Llama 3.2 Vision est actuellement cassé sur Ollama v0.30.0 et versions ultérieures : erreur « Error: unknown model architecture: mllama », le moteur basé sur llama.cpp d'Ollama ne supportant pas mllama
- ✓LLaVA 7B reste le repli le plus sûr (~7 GB de VRAM, fonctionne sur toutes les versions d'Ollama)
- ✓Utilisez Qwen3-VL pour l'OCR, les graphiques et les captures d'écran ; Gemma 4 quand vous avez besoin de vision et d'appel d'outils dans un seul modèle
Les principaux modèles de vision sur Ollama
L'offre de vision d'Ollama a beaucoup changé en 2026 : Qwen3-VL et Gemma 4 sont désormais les options les plus solides, et Llama 3.2 Vision ne se charge plus sur les versions récentes d'Ollama. Chaque modèle restant a une force et un profil VRAM distincts.
Qwen3-VL est la famille de modèles vision-langage ouverte la plus puissante disponible sur Ollama — elle excelle sur l'OCR, les graphiques, les diagrammes et la compréhension des captures d'écran/UI, et va d'un modèle 2B pour l'edge jusqu'à une variante 235B en mixture-of-experts. Gemma 4 intègre une vision native à chaque taille (2B–31B) avec l'appel d'outils, ce qui en fait le meilleur choix quand un seul modèle doit voir des images et appeler des outils. LLaVA reste le point de départ le plus sûr pour une large compatibilité client. Qwen2.5-VL, la génération Qwen précédente, fonctionne toujours et reste un choix léger valable si vous l'avez déjà téléchargé.
Tous les modèles de vision chargent un encodeur d'image en parallèle des poids LLM. Cet encodeur ajoute 1–3 GB de VRAM au-delà de ce que le modèle texte seul nécessite — prévoyez cette surcharge lors de la vérification de votre budget VRAM.
Error: unknown model architecture: "mllama" — l'architecture mllama n'a jamais été ajoutée à llama.cpp. Ce problème n'est toujours pas résolu avec Ollama v0.33.2 (août 2026). Utilisez Qwen3-VL ou Gemma 4 à la place, ou conservez une installation Ollama antérieure à la v0.30.0 si vous avez spécifiquement besoin de Llama 3.2 Vision.Besoins en VRAM pour la vision
Chaque modèle de vision nécessite plus de VRAM que son équivalent texte seul. Un modèle de vision 7–8B requiert typiquement 7–9 GB de VRAM, et non les ~6 GB prévus pour un modèle texte seul de taille similaire.
Pour l'OCR, les graphiques et l'analyse de documents, Qwen3-VL 8B est l'option solide la plus efficace en VRAM. Pour la vision plus l'appel d'outils dans un seul modèle, les variantes 12B ou 26B-A4B MoE de Gemma 4 tiennent en 8–14 GB. Pour le guide complet sur les modèles locaux multimodaux, consultez le guide des LLMs locaux multimodaux.
| Modèle | VRAM en Q4 | Capacité image |
|---|---|---|
| LLaVA 7B | ~7 GB | Q&R sur images générales, large compatibilité |
| Qwen3-VL 8B | ~8 GB | OCR, graphiques, captures d'écran, multilingue |
| Gemma 4 (12B) | ~8 GB | Vision + appel d'outils |
| Gemma 4 (26B-A4B MoE) | ~14 GB | Vision + appel d'outils, qualité supérieure |
| Llama 3.2 Vision 11B | ~10 GB | ⚠️ Cassé sur Ollama v0.30.0+ (erreur mllama) |
Guides associés
- ▸Exécuter Qwen 3 sur Ollama -- option multimodale avec appel d'outils
- ▸Modèles Ollama à contexte 128K -- long context models
- ▸Guide des LLMs locaux multimodaux -- guide complet des modèles de vision locaux
- ▸Meilleurs modèles de vision locaux 2026 -- tous les modèles de vision, tous les GPU
Réponses rapides sur les modèles de vision Ollama
Comment envoyer une image à Ollama via l'API ?▾
/api/chat avec l'image en base64 dans le tableau images. Corps JSON minimal : {"model":"llava","messages":[{"role":"user","content":"What is in this image?","images":["<base64>"]}]} Voir Qwen 3 sur Ollama pour une option multimodale avec un fort support de l'appel d'outils.