Points clés
- Modèle vision-langage combinant un encodeur visuel CLIP avec un décodeur texte Vicuna (basé sur Llama 2).
- Licence du code : Apache-2.0. Les checkpoints pré-entraînés héritent de la licence communautaire Llama 2 via leur base Vicuna.
- S'exécute via
ollama pull llavaen trois tailles : 7B, 13B et 34B. - Aucun commit sur le dépôt GitHub officiel depuis le 11 mai 2024 ; plus de 25 000 étoiles, non archivé.
- A établi le schéma architectural utilisé par la plupart des modèles vision-langage locaux ultérieurs.
- Des modèles plus récents (Qwen2.5-VL, Llama 3.2 Vision, MiniCPM-V) le surpassent désormais sur l'OCR, les graphiques et les documents multilingues.
📍 En une phrase
LLaVA est le modèle vision-langage open source de l'UW-Madison, de Microsoft Research et de l'université Columbia qui a établi l'architecture encodeur-visuel-plus-LLM que suit encore la plupart de l'IA multimodale locale, sous licence Apache-2.0 pour le code avec des conditions de licence dérivées de Llama 2 pour les checkpoints pré-entraînés, désormais exécutable en une commande via Ollama.
💬 En termes simples
C'est un modèle d'IA gratuit capable de regarder une image et de répondre à des questions à son sujet — le projet de recherche qui a prouvé que cela pouvait bien fonctionner et à moindre coût, aujourd'hui exécutable le plus simplement en tapant ollama run llava et en pointant vers un fichier image.
📌Remarque: La page d'origine du projet LLaVA indique que ses données, code et checkpoints sont « destinés et sous licence pour un usage de recherche uniquement », une affirmation antérieure et plus stricte que la licence Apache-2.0 appliquée ensuite au code du dépôt GitHub. Lisez à la fois le fichier LICENSE de GitHub et la page du projet avant tout usage commercial — voir la section Licence et coût ci-dessous.
Histoire : d'un article de recherche à une référence de l'IA locale
LLaVA a été créé par Haotian Liu, Chunyuan Li, Qingyang Wu et Yong Jae Lee, chercheurs affiliés à l'université du Wisconsin-Madison, à Microsoft Research et à l'université Columbia, et présenté dans l'article de 2023 « Visual Instruction Tuning », accepté en présentation orale à NeurIPS 2023.
L'idée centrale de l'article était de générer des données d'entraînement multimodales de suivi d'instructions en utilisant GPT-4, puis d'utiliser ces données pour apprendre à un encodeur visuel et un modèle de langage open source à suivre des instructions visuelles — décrire des images, répondre à des questions à leur sujet et raisonner sur du contenu visuel dans un format conversationnel, pour une fraction du coût d'entraînement d'un modèle multimodal propriétaire construit de zéro.
LLaVA-1.5, sorti en octobre 2023, a atteint des résultats à l'état de l'art sur 11 benchmarks avec seulement de simples modifications de l'architecture d'origine — principalement un connecteur vision-langage plus performant et des données d'entraînement orientées tâches académiques — tout en s'entraînant en environ une journée sur 8 GPU A100, selon la page du projet.
LLaVA-NeXT (aussi appelé LLaVA-1.6), sorti en janvier 2024, a ajouté la prise en charge d'entrées d'image en plus haute résolution via un découpage dynamique (jusqu'à 672×672, ou 336×1344 pour les images larges/hautes), avec une OCR et un raisonnement visuel améliorés, ainsi que la prise en charge de LLM de base supplémentaires au-delà de Vicuna.
**Le dépôt GitHub public haotian-liu/LLaVA a accumulé plus de 25 000 étoiles**, et n'est pas marqué comme archivé — mais PromptQuorum n'a trouvé aucun commit sur sa branche principale depuis le 11 mai 2024, d'après l'historique public des commits du projet. Cela correspond à une publication de recherche universitaire ayant atteint son objectif (établir et populariser l'architecture) plutôt qu'à un produit commercial en développement continu.
Qui a créé LLaVA ?
LLaVA a été créé par Haotian Liu, Chunyuan Li, Qingyang Wu et Yong Jae Lee, chercheurs affiliés à l'université du Wisconsin-Madison, à Microsoft Research et à l'université Columbia, et présenté dans l'article de 2023 « Visual Instruction Tuning », une présentation orale à NeurIPS 2023.
Ce que fait réellement LLaVA
LLaVA connecte un encodeur visuel à un grand modèle de langage afin que le système combiné puisse accepter une image et un prompt textuel ensemble, puis générer une réponse en langage naturel à propos de l'image — répondre à des questions, décrire des scènes, lire du texte visible et raisonner sur du contenu visuel de manière conversationnelle.
- Encodeur CLIP plus décodeur LLM. LLaVA utilise un encodeur visuel CLIP ViT-L/14 pour convertir une image en une séquence de caractéristiques visuelles, projette ces caractéristiques dans le même espace d'embedding que les tokens texte du modèle de langage via un module connecteur, et alimente la séquence combinée dans un modèle Vicuna (basé sur Llama 2) ou, dans les versions ultérieures, Mistral ou un autre LLM de base pour générer une réponse.
- Instruction tuning visuel. Plutôt que de s'entraîner sur des paires image-légende brutes, LLaVA a été affiné sur LLaVA-Instruct-150K, un ensemble de conversations visuelles multi-tours générées en sollicitant GPT-4 avec des légendes d'images et des annotations de détection d'objets — apprenant au modèle à suivre des instructions visuelles ouvertes plutôt que de simplement générer des légendes.
- Trois tailles de modèle via Ollama. La bibliothèque Ollama propose LLaVA en tailles 7B (4,7 Go), 13B (8,0 Go) et 34B (20 Go) — les modèles plus grands produisent généralement des descriptions plus détaillées et précises, au prix de plus de VRAM et d'une inférence plus lente.
- Améliorations de résolution de LLaVA-1.6 (LLaVA-NeXT). La version actuelle prise en charge via Ollama et le dépôt officiel gère des résolutions d'entrée plus élevées via un découpage dynamique, ce qui améliore sensiblement les tâches de lecture de texte et de détail fin par rapport à la version d'origine de 2023.
- Entraînement centré sur l'anglais. LLaVA-Instruct-150K et les benchmarks sous-jacents sur lesquels il a été évalué sont majoritairement en anglais, donc la performance sur du texte non anglais dans les images est plus faible d'emblée que celle de modèles spécifiquement entraînés sur des données documentaires multilingues.
Installer et exécuter LLaVA : étape par étape
Ce guide couvre le chemin le plus rapide et le plus courant (Ollama) et mentionne pour référence le chemin propre au dépôt d'origine.
- 1Installer Ollama.
Why it matters: Téléchargez et installez [Ollama](https://ollama.com) pour macOS, Linux ou Windows. C'est le moyen officiellement listé d'exécuter LLaVA selon sa [page de bibliothèque Ollama](https://ollama.com/library/llava), et cela prend moins de deux minutes. - 2Télécharger une taille de modèle LLaVA.
Why it matters: Exécutez `ollama pull llava` pour le modèle 7B par défaut (~4,7 Go), ou `ollama pull llava:13b` (~8,0 Go) ou `ollama pull llava:34b` (~20 Go) pour une meilleure qualité au prix de plus de VRAM et d'espace disque. - 3L'exécuter avec une image depuis la CLI.
Why it matters: Exécutez `ollama run llava "describe this image: ./photo.jpg"`, en référençant directement un chemin de fichier image local dans le texte du prompt — aucun indicateur séparé n'est requis. - 4(Alternative) Utiliser le dépôt d'origine pour un contrôle de niveau recherche.
Why it matters: Clonez [haotian-liu/LLaVA](https://github.com/haotian-liu/LLaVA), installez son `requirements.txt`, et téléchargez un checkpoint depuis Hugging Face pour un accès complet aux scripts d'entraînement, aux harnais d'évaluation et à la démo web Gradio — utile pour la recherche ou l'affinage, mais une barrière d'installation nettement plus élevée qu'Ollama. - 5(Optionnel) L'appeler par programmation via l'API Ollama.
Why it matters: Envoyez une requête POST à `http://localhost:11434/api/generate` avec l'image encodée en base64 dans un tableau `images`, ou utilisez la bibliothèque officielle Python ou JavaScript `ollama` — voir l'exemple de code ci-dessous.
Exemples d'utilisation réels
Ces exemples utilisent la syntaxe CLI documentée d'Ollama et son API HTTP — le moyen principal et pris en charge d'exécuter LLaVA aujourd'hui.
- Référencer un chemin de fichier dans le prompt CLI suffit — Ollama détecte le chemin
.jpg/.pnget attache l'image automatiquement ; il n'existe pas d'indicateur--imageséparé. - Les tailles de modèle plus grandes coûtent plus de VRAM et de temps. Le modèle 7B est l'option la plus rapide et la moins gourmande en VRAM ; utilisez 13B ou 34B lorsque la précision de description importe plus que la vitesse.
# Installer et télécharger le modèle
# (téléchargez d'abord Ollama depuis https://ollama.com)
ollama pull llava
# CLI : décrire une image en référençant son chemin de fichier dans le prompt
ollama run llava "describe this image: ./photo.jpg"
# --- API HTTP (documentée dans le docs/api.md propre à Ollama) ---
# /api/generate avec une image encodée en base64
curl http://localhost:11434/api/generate -d '{
"model": "llava",
"prompt": "What is in this picture?",
"stream": false,
"images": ["<données image encodées en base64>"]
}'
# /api/chat avec une image encodée en base64 (conversations multi-tours)
curl http://localhost:11434/api/chat -d '{
"model": "llava",
"messages": [
{ "role": "user", "content": "What is in this image?", "images": ["<données image encodées en base64>"] }
]
}'
# --- Exemple Python avec la bibliothèque officielle ollama ---
import ollama
response = ollama.chat(
model="llava",
messages=[{
"role": "user",
"content": "What is in this image?",
"images": ["photo.jpg"],
}],
)
print(response["message"]["content"])Licence et coût
**Le code de LLaVA, dans le dépôt GitHub officiel, est sous licence Apache-2.0**, confirmé via le fichier LICENSE du dépôt et ses métadonnées de licence rapportées par GitHub. Apache-2.0 est une licence permissive : vous pouvez utiliser, modifier et redistribuer le code, y compris commercialement, avec attribution et une concession de brevet, et une restriction minimale supplémentaire.
Les checkpoints pré-entraînés, c'est une autre histoire : ils héritent de conditions de leur LLM de base. Les checkpoints LLaVA officiellement publiés sont affinés à partir de Vicuna, un chatbot instruction-tuné lui-même construit sur Llama 2 de Meta, et la documentation propre du projet indique que les utilisateurs « doivent se conformer à toutes les conditions » des licences d'origine — nommant spécifiquement les conditions de licence de Llama 2, Vicuna, CLIP, et les conditions d'utilisation d'OpenAI (car GPT-4 a été utilisé pour générer les données d'entraînement). Cela signifie que l'usage autorisé du checkpoint est régi par les conditions de la licence communautaire Llama 2 (y compris ses restrictions d'usage acceptable et l'exigence que les très grands déploiements commerciaux obtiennent une licence séparée de Meta), pas uniquement par Apache-2.0.
La page d'origine du projet LLaVA (un site distinct du dépôt GitHub) ajoute une affirmation plus stricte et plus ancienne : elle décrit les « données, le code et le checkpoint » comme « destinés et sous licence pour un usage de recherche uniquement », et note séparément la désignation CC BY-NC 4.0 (non commerciale) du jeu de données d'entraînement. Cela précède, et est plus strict que, la licence de code Apache-2.0 désormais affichée sur GitHub — une combinaison véritablement déroutante d'affirmations du même projet sur deux pages différentes, qu'il vaut la peine de signaler plutôt que de choisir celle qui arrange le plus.
Rien de tout cela n'est un conseil juridique. Avant de déployer LLaVA — ou tout checkpoint affiné construit dessus — dans un produit commercial, lisez le fichier LICENSE de GitHub, les conditions énoncées sur la page du projet, la licence communautaire Llama 2, et consultez un avocat pour votre modèle de base et déploiement spécifiques.
Quelle licence utilise LLaVA ?
Le code de LLaVA sur GitHub est sous licence Apache-2.0, une licence permissive qui autorise l'usage commercial. Ses checkpoints pré-entraînés officiellement publiés sont affinés à partir de Vicuna (construit sur Llama 2 de Meta), donc leur usage est aussi régi par les conditions de la licence communautaire Llama 2. La page d'accueil distincte du projet décrit en outre les données, le code et les checkpoints comme destinés à un usage de recherche uniquement, et le jeu de données d'entraînement comme CC BY-NC 4.0 (non commercial) — une affirmation plus ancienne et plus stricte que la licence GitHub. Ceci n'est pas un conseil juridique ; lisez tout ce qui précède vous-même avant tout usage commercial d'un checkpoint spécifique.
Pour quoi LLaVA n'est pas adapté
LLaVA reste un modèle véritablement utile et bien documenté, mais ce n'est plus le choix le plus performant pour toute tâche de vision en 2026. C'est le mauvais outil pour les situations suivantes :
- Les tâches purement textuelles. LLaVA est un modèle vision-langage ; pour une conversation textuelle pure sans image impliquée, utilisez un LLM textuel dédié (via Ollama ou autrement) — exécuter un modèle multimodal pour un chat purement textuel gaspille le VRAM occupé par son encodeur visuel sans aucun bénéfice.
- Avoir besoin de l'OCR ou de la compréhension documentaire locale la plus performante disponible. En 2026, les modèles sortis après LLaVA-NeXT — MiniCPM-V, Qwen2.5-VL et Llama 3.2 Vision — le surpassent sur l'OCR de documents, les tableaux et l'extraction structurée, selon la comparaison des modèles de vision locaux de PromptQuorum. L'encodeur visuel de LLaVA a été conçu et entraîné avant que cette génération de données d'entraînement en plus haute résolution et axées documents n'existe.
- Lire du texte non anglais dans des images. LLaVA-Instruct-150K et les données d'entraînement de base du modèle sont majoritairement en anglais. Pour l'OCR de documents en chinois, japonais, coréen ou autre écriture non latine, un modèle spécifiquement entraîné sur des corpus documentaires multilingues (Qwen2.5-VL) le surpassera sensiblement.
- L'extraction numérique précise de graphiques et de diagrammes. Comme pratiquement tous les modèles vision-langage locaux en 2026, LLaVA n'est pas fiable pour lire des valeurs exactes sur des graphiques complexes — vérifiez tout chiffre extrait par rapport aux données source, quel que soit le modèle utilisé.
- Supposer un développement actif continu. Sans commit sur le dépôt officiel depuis le 11 mai 2024, n'attendez pas de nouvelles fonctionnalités, corrections de bugs ou checkpoints plus récents du projet d'origine — les propres mises à jour du moteur multimodal d'Ollama et les familles de modèles plus récentes l'ont effectivement supplanté comme option activement développée.
- Une histoire de licence unique et simple. Comme le code (Apache-2.0) et les checkpoints officiellement publiés (Apache-2.0 plus conditions héritées de la licence communautaire Llama 2, plus une affirmation plus stricte de recherche uniquement sur la page d'accueil distincte du projet) sont régis par trois affirmations qui se chevauchent sans être pleinement alignées, LLaVA n'offre pas la clarté de licence en une ligne qu'offre un projet comme Bark (entièrement MIT, sans condition supplémentaire).
Alternatives à LLaVA
Llama 3.2 Vision (via Ollama)
- Idéal pour:
- Meilleure qualité générale de Q&R image locale ; tailles 11B et 90B
- Licence:
- Licence communautaire Llama 3.2
Qwen2.5-VL (via Ollama)
- Idéal pour:
- OCR locale et compréhension documentaire multilingue les plus performantes
- Licence:
- Licence Qwen (Apache-2.0 pour les petites tailles)
MiniCPM-V (via Ollama)
- Idéal pour:
- Haute précision d'OCR documentaire à faible VRAM (~6 Go)
- Licence:
- Dérivée d'Apache-2.0 (OpenBMB)
Idefics3 (Hugging Face)
- Idéal pour:
- VLM de recherche ouvert avec de solides benchmarks documents/OCR, pas encore packagé pour Ollama
- Licence:
- Apache-2.0 (conditions du modèle de base pour la variante Llama3)
API VLM cloud (GPT-4o, Claude, Gemini Vision)
- Idéal pour:
- Capacité multimodale la plus élevée disponible, aucun matériel local requis
- Licence:
- Propriétaire (API payante)
Questions fréquemment posées
Qu'est-ce que LLaVA ?
LLaVA (Large Language and Vision Assistant) est un modèle vision-langage open source créé par des chercheurs de l'université du Wisconsin-Madison, de Microsoft Research et de l'université Columbia, qui combine un encodeur visuel avec un grand modèle de langage pour répondre à des questions sur des images, présenté dans l'article de 2023 « Visual Instruction Tuning ».
Puis-je utiliser LLaVA commercialement ?
Le code de LLaVA sur GitHub est sous licence Apache-2.0, qui autorise l'usage commercial. Cependant, ses checkpoints pré-entraînés officiellement publiés sont affinés à partir de Vicuna, construit sur Llama 2 de Meta, donc leur usage est aussi régi par les conditions de la licence communautaire Llama 2. Une page d'accueil distincte du projet décrit en outre les données, le code et les checkpoints comme destinés à la recherche uniquement, et les données d'entraînement comme non commerciales (CC BY-NC 4.0) — une affirmation plus ancienne et plus stricte que la licence GitHub. Ceci n'est pas un conseil juridique ; lisez toutes les licences applicables avant tout déploiement commercial d'un checkpoint spécifique.
Comment exécuter LLaVA ?
Le moyen le plus courant est via Ollama : installez Ollama, exécutez ollama pull llava, puis ollama run llava "describe this image: ./photo.jpg". Le dépôt d'origine propose aussi ses propres scripts d'inférence Python et une démo Gradio pour un contrôle de niveau recherche.
Quelle est la différence entre LLaVA, LLaVA-1.5 et LLaVA-NeXT (LLaVA-1.6) ?
LLaVA (2023) était l'architecture d'origine. LLaVA-1.5 (octobre 2023) a amélioré les résultats de benchmark avec un connecteur plus performant et de meilleures données d'entraînement. LLaVA-NeXT, aussi appelé LLaVA-1.6 (janvier 2024), a ajouté des entrées d'image en plus haute résolution via un découpage dynamique et amélioré l'OCR et le raisonnement visuel. La version distribuée via Ollama et le dépôt GitHub actuel reflète les améliorations de LLaVA-1.6/NeXT.
LLaVA est-il encore activement maintenu ?
Le dépôt GitHub officiel n'est pas marqué comme archivé, mais PromptQuorum n'a trouvé aucun commit depuis le 11 mai 2024. Traitez-le comme une publication de recherche achevée plutôt que comme un logiciel activement développé — des modèles plus récents et les propres mises à jour du moteur multimodal d'Ollama l'ont largement supplanté pour de nouveaux projets.
Comment LLaVA se compare-t-il à des modèles plus récents comme Qwen2.5-VL ou Llama 3.2 Vision ?
LLaVA a établi l'architecture que ces modèles plus récents suivent aussi, mais en 2026 il est surpassé par Qwen2.5-VL et Llama 3.2 Vision sur l'OCR de documents, la lecture de graphiques et (spécifiquement pour Qwen2.5-VL) le texte non anglais, selon la comparaison des modèles de vision locaux de PromptQuorum. LLaVA reste pertinent pour sa facilité d'installation, sa grande communauté et sa couverture de tutoriels étendue.
Ollama prend-il réellement en charge l'exécution de LLaVA ?
Oui — ollama run llava est un modèle officiellement listé dans la bibliothèque Ollama, disponible en tailles 7B, 13B et 34B, et c'est aujourd'hui l'un des moyens les plus courants d'exécuter LLaVA, aux côtés des propres scripts d'inférence du dépôt d'origine.
De quel matériel ai-je besoin pour exécuter LLaVA ?
Le modèle 7B nécessite environ 4,7 Go d'espace disque et peut fonctionner sur un GPU avec 6-8 Go de VRAM (ou sur CPU, plus lentement) ; les modèles 13B et 34B nécessitent proportionnellement plus de VRAM et d'espace disque pour une meilleure qualité de description.
Verdict
LLaVA a gagné sa place dans l'histoire de l'IA locale : il a prouvé qu'un encodeur visuel modeste connecté à un LLM open source, affiné sur des données d'instruction générées par GPT-4, pouvait offrir une compréhension d'image réellement utile sans budget d'entraînement propriétaire — et le schéma encodeur-visuel-plus-LLM qu'il a établi est toujours la base de la plupart des modèles multimodaux locaux. Sa licence de code (Apache-2.0) est permissive, mais ses checkpoints officiellement publiés portent des conditions dérivées de Llama 2 via leur base Vicuna, plus une affirmation plus ancienne et plus stricte de recherche uniquement sur la page d'accueil distincte du projet — lisez les trois avant tout usage commercial. En capacité brute en 2026, LLaVA n'est plus le modèle de vision local le plus performant : aucun commit depuis mai 2024, et des options plus récentes comme Qwen2.5-VL, Llama 3.2 Vision et MiniCPM-V le surpassent sur l'OCR, les graphiques et les documents multilingues. Si vous voulez l'installation la plus simple, la plus grande communauté et le plus de tutoriels existants, ollama run llava reste un très bon point de départ. Si la précision documentaire ou le texte non anglais compte, combinez cet avis avec la comparaison des modèles de vision locaux et le guide des modèles de vision Ollama de PromptQuorum avant de choisir un modèle.
Sources
- LLaVA sur GitHub — le dépôt officiel : README, LICENSE, instructions d'installation et historique des commits.
- Article « Visual Instruction Tuning » (NeurIPS 2023) — la page d'accueil du projet avec liens vers l'article, affirmations de licence et historique des versions.
- LLaVA sur Ollama — la page de modèle officiellement listée : tailles, description et métadonnées de bibliothèque.
- Documentation de l'API Ollama — la forme documentée des requêtes/réponses
/api/generateet/api/chatpour les modèles multimodaux. - Modèles de vision locaux 2026 : LLaVA, Llama 3.2 Vision, Qwen3-VL & configuration multimodale Ollama — la comparaison plus large de PromptQuorum des modèles de vision locaux actuels.
