Skip to main content
PromptQuorum

Quels modèles Ollama supportent la vision ?

Quels modèles Ollama supportent la vision ?

Réponse rapide

Les meilleurs modèles de vision d'Ollama en 2026 sont Qwen3-VL et Gemma 4, tous deux nativement multimodaux. LLaVA reste le repli le plus sûr pour une large compatibilité. Llama 3.2 Vision est actuellement cassé sur Ollama (« unknown model architecture: mllama ») — utilisez Qwen3-VL ou Gemma 4 à la place.

  • qwen3-vl : famille de vision la plus puissante, idéale pour l'OCR, les graphiques et les captures d'écran
  • gemma4 : vision intégrée à chaque taille, plus l'appel d'outils
  • llava : repli le plus sûr, compatibilité client la plus large
  • llama3.2-vision : cassé sur Ollama v0.30.0+ (« unknown model architecture: mllama »)
Ollama

Points clés

  • Depuis septembre 2026, les modèles de vision phares d'Ollama sont Qwen3-VL et Gemma 4 — tous deux ont remplacé la génération précédente Qwen2.5-VL / Gemma 3
  • Llama 3.2 Vision est actuellement cassé sur Ollama v0.30.0 et versions ultérieures : erreur « Error: unknown model architecture: mllama », le moteur basé sur llama.cpp d'Ollama ne supportant pas mllama
  • LLaVA 7B reste le repli le plus sûr (~7 GB de VRAM, fonctionne sur toutes les versions d'Ollama)
  • Utilisez Qwen3-VL pour l'OCR, les graphiques et les captures d'écran ; Gemma 4 quand vous avez besoin de vision et d'appel d'outils dans un seul modèle

Les principaux modèles de vision sur Ollama

L'offre de vision d'Ollama a beaucoup changé en 2026 : Qwen3-VL et Gemma 4 sont désormais les options les plus solides, et Llama 3.2 Vision ne se charge plus sur les versions récentes d'Ollama. Chaque modèle restant a une force et un profil VRAM distincts.

Qwen3-VL est la famille de modèles vision-langage ouverte la plus puissante disponible sur Ollama — elle excelle sur l'OCR, les graphiques, les diagrammes et la compréhension des captures d'écran/UI, et va d'un modèle 2B pour l'edge jusqu'à une variante 235B en mixture-of-experts. Gemma 4 intègre une vision native à chaque taille (2B–31B) avec l'appel d'outils, ce qui en fait le meilleur choix quand un seul modèle doit voir des images et appeler des outils. LLaVA reste le point de départ le plus sûr pour une large compatibilité client. Qwen2.5-VL, la génération Qwen précédente, fonctionne toujours et reste un choix léger valable si vous l'avez déjà téléchargé.

Tous les modèles de vision chargent un encodeur d'image en parallèle des poids LLM. Cet encodeur ajoute 1–3 GB de VRAM au-delà de ce que le modèle texte seul nécessite — prévoyez cette surcharge lors de la vérification de votre budget VRAM.

Llama 3.2 Vision est actuellement cassé sur Ollama. Depuis qu'Ollama v0.30.0 (mai 2026) a basé le chargement des modèles sur llama.cpp, llama3.2-vision échoue avec Error: unknown model architecture: "mllama" — l'architecture mllama n'a jamais été ajoutée à llama.cpp. Ce problème n'est toujours pas résolu avec Ollama v0.33.2 (août 2026). Utilisez Qwen3-VL ou Gemma 4 à la place, ou conservez une installation Ollama antérieure à la v0.30.0 si vous avez spécifiquement besoin de Llama 3.2 Vision.

Besoins en VRAM pour la vision

Chaque modèle de vision nécessite plus de VRAM que son équivalent texte seul. Un modèle de vision 7–8B requiert typiquement 7–9 GB de VRAM, et non les ~6 GB prévus pour un modèle texte seul de taille similaire.

Pour l'OCR, les graphiques et l'analyse de documents, Qwen3-VL 8B est l'option solide la plus efficace en VRAM. Pour la vision plus l'appel d'outils dans un seul modèle, les variantes 12B ou 26B-A4B MoE de Gemma 4 tiennent en 8–14 GB. Pour le guide complet sur les modèles locaux multimodaux, consultez le guide des LLMs locaux multimodaux.

ModèleVRAM en Q4Capacité image
LLaVA 7B~7 GBQ&R sur images générales, large compatibilité
Qwen3-VL 8B~8 GBOCR, graphiques, captures d'écran, multilingue
Gemma 4 (12B)~8 GBVision + appel d'outils
Gemma 4 (26B-A4B MoE)~14 GBVision + appel d'outils, qualité supérieure
Llama 3.2 Vision 11B~10 GB⚠️ Cassé sur Ollama v0.30.0+ (erreur mllama)

Guides associés

Réponses rapides sur les modèles de vision Ollama

Comment envoyer une image à Ollama via l'API ?
Faites un POST vers le point de terminaison /api/chat avec l'image en base64 dans le tableau images. Corps JSON minimal : {"model":"llava","messages":[{"role":"user","content":"What is in this image?","images":["<base64>"]}]} Voir Qwen 3 sur Ollama pour une option multimodale avec un fort support de l'appel d'outils.
Pourquoi llama3.2-vision échoue-t-il avec « unknown model architecture: mllama » ?
Ollama v0.30.0 (mai 2026) a basé le chargement des modèles sur llama.cpp, qui n'a jamais reçu de support pour l'architecture mllama utilisée par Llama 3.2 Vision. Cela casse llama3.2-vision sur Ollama v0.30.0 et toutes les versions suivantes, y compris v0.33.2. Il n'existe pas encore de correctif officiel : utilisez Qwen3-VL ou Gemma 4 à la place, ou conservez une installation Ollama antérieure à la v0.30.0 uniquement pour ce modèle.
Les modèles de vision peuvent-ils faire de l'OCR (lire du texte depuis des images) ?
Oui, mais la qualité varie. Qwen3-VL est actuellement le plus performant pour l'OCR parmi les modèles de vision Ollama qui fonctionnent — Llama 3.2 Vision était le choix précédent mais il est cassé sur Ollama v0.30.0 et versions ultérieures. LLaVA 7B peut lire du texte clairement imprimé mais peine avec l'écriture manuscrite ou les petites polices.
Quel modèle de vision Ollama est le meilleur pour les graphiques et diagrammes ?
Qwen3-VL. Il excelle sur les graphiques, tableaux, diagrammes et la compréhension de captures d'écran, et surpasse LLaVA ainsi que la génération précédente Qwen2.5-VL sur les benchmarks de compréhension de documents.
Les modèles de vision supportent-ils plusieurs images dans un seul prompt ?
Le support varie selon le modèle et la version d'Ollama. LLaVA et Qwen2.5-VL traitent actuellement une image par tour dans Ollama. Qwen3-VL et Gemma 4 supportent les entrées multi-images dans des configurations à plus long contexte — vérifiez la limite actuelle sur la page de la bibliothèque Ollama de chaque modèle.