Points clés
- Trois générations existent : Idefics (2023), Idefics2 (avril 2024), Idefics3 (août 2024) — chacune un modèle distinct, pas une simple mise à jour.
- Idefics3 est la recommandation actuelle pour la plupart des tâches ; il améliore substantiellement l'OCR et la compréhension de documents par rapport à Idefics2.
- La licence est nuancée selon les générations : l'Idefics original a une restriction réservée à la recherche ; Idefics2 est entièrement Apache-2.0 (socle Mistral-7B) ; Idefics3 porte les conditions de la licence communautaire Llama 3.1 en plus de son étiquette Apache-2.0 (socle Llama-3.1-8B-Instruct).
- VRAM : environ 18-20 Go en float16 pour Idefics2/3, ou 6-7 Go avec une quantification agressive — plus lourd que LLaVA 7B ou MiniCPM-V.
- Non packagé dans la bibliothèque d'Ollama au moment de cet avis ; des tickets GitHub ouverts suivent les difficultés de conversion GGUF.
- Le mieux adapté : tâches OCR intensives en documents et raisonnement multi-images avec suffisamment de mémoire GPU, pas les configurations locales à ressources limitées ou en temps réel.
📍 En une phrase
Idefics est la reproduction ouverte de Flamingo de DeepMind par HuggingFace M4, désormais dans sa troisième génération (Idefics3, 8B, août 2024), avec des licences et des besoins en VRAM sensiblement différents selon ses trois versions, et n'est actuellement pas packagé dans la bibliothèque de modèles d'Ollama.
💬 En termes simples
Idefics est une famille de modèles d'IA créés par HuggingFace capables de regarder des images et de répondre à des questions à leur sujet, comme LLaVA — cet avis explique laquelle de ses trois versions utiliser réellement, ce qu'elle coûte en mémoire GPU, et ses limites.
📌Remarque: PromptQuorum a vérifié ces faits directement sur les fiches de modèle HuggingFace d'idefics-80b, idefics2-8b et Idefics3-8B-Llama3, ainsi que sur la bibliothèque d'Ollama et son suivi de tickets GitHub — voir la section Sources pour les liens exacts.
Histoire : HuggingFace M4 et la reproduction de Flamingo
**La fiche de modèle de l'Idefics original indique explicitement qu'il s'agit d'"une reproduction en accès ouvert de Flamingo, un modèle vision-langage propriétaire développé par DeepMind."** Il a été publié par l'équipe M4 de HuggingFace en 2023 en deux tailles, 9B et 80B paramètres, combinant un encodeur visuel avec un socle de modèle de langage LLaMA(1).
L'Idefics original porte une licence mixte, pas une seule licence permissive. Son encodeur visuel et les paramètres de connexion nouvellement entraînés sont publiés sous MIT, mais le socle de modèle de langage LLaMA(1) exige le respect de la licence originale de Meta, réservée à la recherche et non commerciale, pour LLaMA. Cela rend l'Idefics original inadapté à un usage commercial dans la plupart des cas, indépendamment de l'étiquette MIT sur certaines parties de la pile.
Idefics2 (8B), sorti autour d'avril 2024, a remplacé le socle LLaMA(1) par Mistral-7B-v0.1 associé à un encodeur visuel SigLIP. Les deux modèles parents étant Apache-2.0, la fiche de modèle d'Idefics2 indique que le modèle complet est Apache-2.0 — résolvant le problème de licence de l'Idefics original. HuggingFace crédite lui-même Idefics2 d'égaler la performance d'Idefics-80B pour une taille environ 10 fois plus petite, avec un OCR et une compréhension de documents nettement meilleurs.
Idefics3 (8B), sorti le 22 août 2024, a conservé l'encodeur visuel SigLIP mais a changé le socle de langage pour Meta-Llama-3.1-8B-Instruct. Sa propre fiche de modèle démontre une amélioration substantielle par rapport à Idefics2, en particulier pour la compréhension de documents, l'OCR et le raisonnement visuel. Il a été intégré à Hugging Face Transformers dans la version 4.46.
Idefics est-il une reproduction de Flamingo de DeepMind ?
Oui. La fiche de modèle de l'Idefics original le décrit explicitement comme "une reproduction en accès ouvert de Flamingo, un modèle vision-langage propriétaire développé par DeepMind." Idefics2 et Idefics3 sont des générations ultérieures de HuggingFace M4, architecturées indépendamment mais issues de cette même filiation.
Idefics vs Idefics2 vs Idefics3 : ce qui a vraiment changé
Les trois générations sont des modèles distincts avec des architectures de base différentes — pas un seul modèle avec des mises à jour de version incrémentales. Voici ce qui diffère réellement, vérifié sur la fiche HuggingFace propre à chaque modèle.
Idefics (9B/80B)
- Sortie:
- 2023
- Socle:
- LLaMA(1) + encodeur visuel maison
- Remarques:
- Restriction de licence réservée à la recherche héritée de LLaMA(1) ; largement dépassé
Idefics2 (8B)
- Sortie:
- Avril 2024
- Socle:
- Mistral-7B-v0.1 + SigLIP
- Remarques:
- Entièrement Apache-2.0 ; égale Idefics-80B pour une taille 10 fois plus petite
Idefics3 (8B)
- Sortie:
- 22 août 2024
- Socle:
- Llama-3.1-8B-Instruct + SigLIP
- Remarques:
- Meilleur OCR/compréhension de documents des trois ; conditions de licence Llama 3.1 applicables
PromptQuorum n'a trouvé aucun "Idefics4" publiquement confirmé au moment de cet avis. Idefics3 est la génération la plus récente et la recommandation actuelle pour la plupart des tâches.
Nuance de licence : ce n'est pas simplement Apache-2.0
Le répertoire de PromptQuorum étiquette la licence d'Idefics comme "Apache 2.0" — c'est exact pour le dépôt et le code du modèle, mais incomplet pour la situation de licence pratique, un peu comme la licence de code Apache-2.0 de LLaVA ne s'étend pas automatiquement à chaque checkpoint de modèle de base.
Idefics2 est le cas le plus clair : à la fois son socle de langage Mistral-7B-v0.1 et son encodeur visuel SigLIP sont Apache-2.0, donc l'ensemble de la pile du modèle est réellement Apache-2.0, sans conditions supplémentaires.
Idefics3 est plus nuancé. Son propre dépôt HuggingFace est étiqueté Apache-2.0, mais son socle de langage, Meta-Llama-3.1-8B-Instruct, est publié sous la licence communautaire Llama 3.1 de Meta — qui inclut une politique d'usage acceptable et une clause exigeant une licence distincte de Meta si un produit en aval dépasse 700 millions d'utilisateurs actifs mensuels. Quiconque déploie Idefics3 commercialement à grande échelle devrait lire directement les conditions de licence Llama 3.1 de Meta, pas seulement l'étiquette Apache-2.0 du dépôt Idefics3.
L'Idefics original est le plus restrictif. Son socle LLaMA(1) porte la licence originale de Meta, réservée à la recherche et non commerciale, ce qui rend l'usage commercial du modèle complet 9B/80B juridiquement incertain au mieux et impossible au pire — même si l'encodeur visuel et les poids de connexion sont sous licence MIT séparée.
Idefics est-il gratuit pour un usage commercial ?
Cela dépend de la génération. Idefics2 est entièrement Apache-2.0 sans restriction supplémentaire. Le dépôt d'Idefics3 est Apache-2.0, mais son socle Llama-3.1-8B-Instruct porte les conditions de la licence communautaire Llama 3.1 de Meta, y compris une obligation de licence distincte au-delà de 700 millions d'utilisateurs actifs mensuels. L'Idefics original porte une restriction réservée à la recherche, non commerciale, issue de son socle LLaMA(1).
Exemple d'utilisation réel : bibliothèque Transformers
Idefics3 s'utilise via les classes AutoModelForVision2Seq et AutoProcessor de Hugging Face Transformers, documentées dans la documentation du modèle Idefics3 de Transformers. La version 4.46 ou ultérieure de Transformers est requise.
- Il n'existe aujourd'hui aucun chemin Ollama ou llama.cpp. Idefics fonctionne via Transformers (ou des serveurs d'inférence compatibles comme Text Generation Inference), pas via des exécuteurs basés sur GGUF.
- Réduire le paramètre de résolution d'image peut diminuer l'usage de mémoire GPU. Les fiches de modèle d'Idefics2/3 documentent la réduction du nombre de sous-parcelles d'image traitées (appelé
Ndans la documentation d'Idefics3) comme moyen d'échanger un peu de précision contre moins de VRAM.
# Nécessite transformers >= 4.46 (selon la documentation du modèle Idefics3 de Hugging Face)
# pip install transformers pillow torch
from transformers import AutoProcessor, AutoModelForVision2Seq
from PIL import Image
import torch
model_id = "HuggingFaceM4/Idefics3-8B-Llama3"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForVision2Seq.from_pretrained(
model_id,
torch_dtype=torch.float16,
).to("cuda")
image = Image.open("photo.jpg")
messages = [
{
"role": "user",
"content": [
{"type": "image"},
{"type": "text", "text": "What is in this image?"},
],
},
]
prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
inputs = processor(text=prompt, images=[image], return_tensors="pt").to("cuda")
generated_ids = model.generate(**inputs, max_new_tokens=200)
generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)
print(generated_text[0])Exigences en VRAM et matériel
Idefics2 et Idefics3 sont nettement plus lourds que des checkpoints LLaVA ou MiniCPM-V de taille comparable, en grande partie à cause de la façon dont ils traitent la résolution d'image. Ces chiffres proviennent directement de la propre fiche de modèle d'Idefics2, qui documente explicitement sa plage de VRAM ; Idefics3 (même nombre de 8B paramètres et même encodeur visuel) devrait être similaire, bien que PromptQuorum n'ait pas trouvé de tableau VRAM publié aussi détaillé spécifiquement pour Idefics3.
Configuration | VRAM approx. | Remarques |
|---|---|---|
| float16 + flash-attention | ~18-20 Go | Documenté sur la fiche de modèle d'Idefics2 comme configuration standard |
| Sans optimisations | Jusqu'à ~55 Go au pic | Borne supérieure de la fiche de modèle d'Idefics2 pour une inférence non optimisée |
| Quantification agressive | ~6-7 Go | Borne inférieure documentée sur la fiche de modèle d'Idefics2 ; attendez-vous à un compromis de précision |
| LLaVA 7B (à titre de comparaison) | ~6-8 Go | Voir l'avis LLaVA de PromptQuorum |
📌Remarque: PromptQuorum n'a pas réalisé ses propres benchmarks matériels pour cet article ; ces chiffres proviennent de la fiche de modèle publiée d'Idefics2. Idefics est réellement plus lourd que LLaVA 7B ou MiniCPM-V à niveaux de capacité comparables — soyez honnête avec vous-même sur la VRAM disponible avant de le choisir pour un déploiement à ressources limitées.
Pour quoi Idefics n'est pas adapté
Idefics3 est un modèle vision-langage ouvert compétent, mais c'est le mauvais choix dans les situations suivantes :
- Configurations locales à ressources limitées. Avec environ 18-20 Go de VRAM dans sa configuration standard float16, Idefics2/3 nécessitent nettement plus de mémoire GPU que LLaVA 7B (~6-8 Go) ou MiniCPM-V (~5,5 Go). Si votre budget matériel est un seul GPU grand public avec 8 Go de VRAM ou moins, Idefics n'est pas une option réaliste sans quantification agressive et un compromis de précision accepté.
- Applications en temps réel ou à faible latence. Un modèle vision-langage de 8B paramètres qui traite plusieurs sous-parcelles d'image par entrée n'est pas conçu pour le temps de réponse le plus rapide possible. Si la latence est la priorité, un modèle plus petit comme Moondream (1,8B) répondra plus vite, avec une capacité réduite.
- Un workflow direct Ollama ou llama.cpp. Idefics n'est actuellement pas packagé dans la bibliothèque d'Ollama, et la conversion GGUF présente des problèmes de compatibilité ouverts et non résolus suivis sur le propre GitHub d'Ollama. Si votre workflow dépend spécifiquement d'Ollama, voir le guide des modèles de vision Ollama de PromptQuorum pour les modèles réellement téléchargeables aujourd'hui.
- Supposer une licence unique et uniforme entre les versions. Traiter "Idefics" comme un seul produit avec une seule licence est une erreur — vérifiez quelle génération vous déployez et lisez les conditions de licence spécifiques de ce modèle, en particulier les obligations de la licence communautaire Llama 3.1 pour Idefics3 à grande échelle.
Alternatives et concurrents
LLaVA
- Meilleur usage:
- Support d'outils plus large, y compris le packaging Ollama et llama.cpp ; empreinte VRAM plus légère à 7B
- Licence:
- Apache-2.0 (code) ; dépend du modèle de base pour les checkpoints
Modèles de vision d'Ollama
- Meilleur usage:
- Configuration locale la plus simple via
ollama pull/ollama run; Idefics n'en fait pas partie au moment de cet avis - Licence:
- Varie selon le modèle
MLC Chat
- Meilleur usage:
- Déploiement sur appareil multiplateforme ; principalement axé sur le texte au moment de cet avis — vérifiez le support vision actuel avant de vous y fier
- Licence:
- Apache-2.0
Articles sur MLC Chat (5)
- MLC Chat Review (2026): The Mobile App Built on MLC LLM, Assessed HonestlyMis à jour 7 septembre 2026
- Best Local LLM Apps for iPhone in 2026 (Run AI Without WiFi)Mis à jour 1 septembre 2026
- Mobile Local LLMs 2026: iPhone 16 Pro, iPad M4 & Snapdragon XMis à jour 28 août 2026
- Best Local LLM Apps for Android in 2026: 6 Apps Compared on Real PhonesMis à jour 24 août 2026
- Best Mobile LLM Models in 2026: Phi-4 Mini vs Gemma 3 vs SmolLMMis à jour 14 juillet 2026
Également mentionné dans :
- Galaxy vs iPhone On-Device AI: Samsung Galaxy AI vs Apple Intelligence (2026)Mis à jour 29 août 2026
- Run a Local LLM on Your Tablet: iPad Pro M5, Galaxy Tab S10, OnePlus Pad 2 (2026)Mis à jour 14 juillet 2026
- Running Local AI on the Galaxy S26: On-Device AI Explained (2026)Mis à jour 15 juin 2026
API VLM cloud (GPT-4o, Claude, Gemini vision)
- Meilleur usage:
- Capacité multimodale disponible la plus élevée, aucun matériel ni configuration locale nécessaire
- Licence:
- Propriétaire (API payante)
Questions fréquentes
Qu'est-ce qu'Idefics ?
Idefics est une famille de modèles vision-langage ouverts créée par l'équipe M4 de HuggingFace, explicitement conçue comme une reproduction ouverte de Flamingo de DeepMind. Elle existe en trois générations : l'Idefics original (2023, 9B/80B), Idefics2 (avril 2024, 8B) et Idefics3 (août 2024, 8B).
Quelle version d'Idefics devrais-je utiliser — Idefics, Idefics2 ou Idefics3 ?
Idefics3 pour la plupart des tâches aujourd'hui — il a le meilleur OCR et la meilleure compréhension de documents des trois. Idefics2 reste pertinent si vous avez spécifiquement besoin d'une pile entièrement Apache-2.0 sans conditions dérivées de Llama. L'Idefics original est largement dépassé et porte une restriction de licence réservée à la recherche.
Idefics est-il entièrement open source et gratuit pour un usage commercial ?
Cela dépend de la génération. Idefics2 est entièrement Apache-2.0. Le dépôt d'Idefics3 est étiqueté Apache-2.0, mais son socle Llama-3.1-8B-Instruct porte les conditions de la licence communautaire Llama 3.1 de Meta, y compris des obligations au-delà de 700 millions d'utilisateurs actifs mensuels. L'Idefics original a une restriction réservée à la recherche, non commerciale, issue de son socle LLaMA(1).
De combien de VRAM Idefics a-t-il besoin ?
Idefics2 (et probablement Idefics3, avec le même nombre de 8B paramètres et le même encodeur visuel) nécessite environ 18-20 Go de VRAM dans la configuration standard float16 avec flash-attention documentée sur la fiche de modèle d'Idefics2, ou aussi peu que 6-7 Go avec une quantification agressive et un compromis de précision. C'est nettement plus lourd que LLaVA 7B ou MiniCPM-V.
Puis-je exécuter Idefics via Ollama ?
Pas au moment de cet avis. Idefics n'est actuellement pas packagé dans la bibliothèque de modèles d'Ollama, et la conversion GGUF présente des problèmes de compatibilité ouverts suivis sur le propre dépôt GitHub d'Ollama. Idefics fonctionne plutôt via Hugging Face Transformers.
Idefics est-il basé sur Flamingo de DeepMind ?
Idefics est explicitement décrit sur sa propre fiche de modèle comme "une reproduction en accès ouvert de Flamingo, un modèle vision-langage propriétaire développé par DeepMind." Idefics2 et Idefics3 sont des successeurs architecturés indépendamment par la même équipe HuggingFace M4.
Verdict
Idefics est une famille de modèles vision-langage ouverts réellement utile, et Idefics3 en particulier tient bien la route pour les tâches OCR intensives en documents et de raisonnement multi-images, là où son empreinte d'environ 18-20 Go de VRAM est abordable. Ce n'est cependant pas un remplacement direct pour des modèles de vision locaux plus légers : il nécessite nettement plus de mémoire GPU que LLaVA 7B ou MiniCPM-V, n'a aucun packaging Ollama ou llama.cpp au moment de cet avis, et sa situation de licence diffère réellement selon la génération — la pile Apache-2.0 propre d'Idefics2 est une proposition juridique différente des obligations de la licence communautaire Llama 3.1 d'Idefics3. Choisissez Idefics3 pour la compréhension de documents et la qualité OCR quand vous disposez de la mémoire GPU nécessaire ; choisissez spécifiquement Idefics2 si une pile purement Apache-2.0 compte ; et choisissez LLaVA, via l'avis LLaVA de PromptQuorum, ou l'un des modèles du guide des modèles de vision Ollama, pour du matériel local plus léger ou des workflows basés sur Ollama.
Sources
- Fiche de modèle Idefics-80B — déclaration de reproduction de Flamingo, structure de licence, tailles de modèle.
- Fiche de modèle Idefics2-8b — modèles de base, licence Apache-2.0, plage de VRAM documentée.
- Fiche de modèle Idefics3-8B-Llama3 — modèle de base, étiquette de licence, détails de sortie.
- Documentation Transformers d'Idefics3 — exemple d'utilisation, version minimale de Transformers.
- Licence communautaire Meta Llama 3.1 — conditions de licence héritées par le socle de langage d'Idefics3.
- Ticket GitHub Ollama #2183 et ticket #3677 — demandes de fonctionnalité ouvertes confirmant qu'Idefics n'est actuellement pas packagé dans la bibliothèque d'Ollama.
