Conclusiones clave
- Existen tres generaciones: Idefics (2023), Idefics2 (abril de 2024), Idefics3 (agosto de 2024) — cada una un modelo distinto, no una simple actualización.
- Idefics3 es la recomendación actual para la mayoría de las tareas; mejora sustancialmente el OCR y la comprensión de documentos respecto a Idefics2.
- La licencia tiene matices según la generación: el Idefics original tiene una restricción solo para investigación; Idefics2 es totalmente Apache-2.0 (base Mistral-7B); Idefics3 conlleva las condiciones de la licencia comunitaria Llama 3.1 además de su etiqueta Apache-2.0 (base Llama-3.1-8B-Instruct).
- VRAM: aproximadamente 18-20 GB en float16 para Idefics2/3, o 6-7 GB con cuantización agresiva — más pesado que LLaVA 7B o MiniCPM-V.
- No está empaquetado en la biblioteca de Ollama al momento de este análisis; hay tickets abiertos en GitHub que siguen las dificultades de conversión a GGUF.
- Mejor uso: tareas intensivas en OCR de documentos y razonamiento multi-imagen con memoria de GPU suficiente, no configuraciones locales con recursos limitados o en tiempo real.
📍 En una frase
Idefics es la reproducción abierta de Flamingo de DeepMind de HuggingFace M4, ahora en su tercera generación (Idefics3, 8B, agosto de 2024), con licencias y necesidades de VRAM notablemente distintas entre sus tres versiones, y no está empaquetado actualmente en la biblioteca de modelos de Ollama.
💬 En términos simples
Idefics es una familia de modelos de IA creados por HuggingFace que pueden mirar imágenes y responder preguntas sobre ellas, similar a LLaVA — este análisis explica cuál de sus tres versiones usar realmente, cuánto cuesta en memoria de GPU y dónde se queda corto.
📌Nota: PromptQuorum verificó estos datos directamente en las fichas de modelo de HuggingFace de idefics-80b, idefics2-8b e Idefics3-8B-Llama3, y en la biblioteca de Ollama y su seguimiento de tickets en GitHub — consulta la sección Fuentes para los enlaces exactos.
Historia: HuggingFace M4 y la reproducción de Flamingo
**La ficha de modelo del Idefics original indica explícitamente que es "una reproducción de acceso abierto de Flamingo, un modelo de visión-lenguaje propietario desarrollado por DeepMind."** Fue publicado por el equipo M4 de HuggingFace en 2023 en dos tamaños, 9B y 80B parámetros, combinando un codificador de visión con una base de modelo de lenguaje LLaMA(1).
El Idefics original conlleva una licencia mixta, no una única licencia permisiva. Su codificador de visión y los parámetros de conexión recién entrenados se publican bajo MIT, pero la base de modelo de lenguaje LLaMA(1) exige cumplir con la licencia original de Meta, solo para investigación y no comercial, para LLaMA. Esto hace que el Idefics original no sea apto para uso comercial en la mayoría de los casos, independientemente de la etiqueta MIT en partes de la pila.
Idefics2 (8B), publicado alrededor de abril de 2024, reemplazó la base LLaMA(1) por Mistral-7B-v0.1 y la combinó con un codificador de visión SigLIP. Como ambos modelos base son Apache-2.0, la propia ficha de modelo de Idefics2 indica que el modelo completo es Apache-2.0 — resolviendo el problema de licencia del Idefics original. La propia HuggingFace atribuye a Idefics2 igualar el rendimiento de Idefics-80B con un tamaño aproximadamente 10 veces menor, con un OCR y una comprensión de documentos notablemente mejores.
Idefics3 (8B), publicado el 22 de agosto de 2024, mantuvo el codificador de visión SigLIP pero cambió la base de lenguaje a Meta-Llama-3.1-8B-Instruct. Su propia ficha de modelo demuestra una mejora sustancial respecto a Idefics2, particularmente en comprensión de documentos, OCR y razonamiento visual. Se añadió a Hugging Face Transformers en la versión 4.46.
¿Idefics es una reproducción de Flamingo de DeepMind?
Sí. La ficha de modelo del Idefics original lo describe explícitamente como "una reproducción de acceso abierto de Flamingo, un modelo de visión-lenguaje propietario desarrollado por DeepMind." Idefics2 e Idefics3 son generaciones posteriores de HuggingFace M4, arquitectónicamente independientes pero dentro de la misma línea de origen.
Idefics vs Idefics2 vs Idefics3: qué cambió realmente
Las tres generaciones son modelos distintos con arquitecturas base diferentes — no un único modelo con incrementos de versión menores. Esto es lo que realmente difiere, verificado en la ficha de HuggingFace propia de cada modelo.
Idefics (9B/80B)
- Publicado:
- 2023
- Base:
- LLaMA(1) + codificador de visión propio
- Notas:
- Restricción de licencia solo para investigación heredada de LLaMA(1); en gran medida superado
Idefics2 (8B)
- Publicado:
- Abril de 2024
- Base:
- Mistral-7B-v0.1 + SigLIP
- Notas:
- Totalmente Apache-2.0; iguala a Idefics-80B con un tamaño 10 veces menor
Idefics3 (8B)
- Publicado:
- 22 de agosto de 2024
- Base:
- Llama-3.1-8B-Instruct + SigLIP
- Notas:
- Mejor OCR/comprensión de documentos de los tres; se aplican las condiciones de licencia de Llama 3.1
PromptQuorum no encontró ningún "Idefics4" confirmado públicamente al momento de este análisis. Idefics3 es la generación más reciente y la recomendación actual para la mayoría de las tareas.
Matiz de licencia: no es simplemente Apache-2.0
El listado de directorio de PromptQuorum para Idefics etiqueta su licencia como "Apache 2.0" — esto es correcto para el repositorio y el código del modelo, pero incompleto para la situación de licencia práctica, de forma similar a cómo la licencia de código Apache-2.0 de LLaVA no se extiende automáticamente a cada checkpoint del modelo base.
Idefics2 es el caso más claro: tanto su base de lenguaje Mistral-7B-v0.1 como su codificador de visión SigLIP son Apache-2.0, por lo que toda la pila del modelo es realmente Apache-2.0, sin condiciones adicionales.
Idefics3 tiene más matices. Su propio repositorio de HuggingFace está etiquetado como Apache-2.0, pero su base de lenguaje, Meta-Llama-3.1-8B-Instruct, se publica bajo la licencia comunitaria Llama 3.1 de Meta — que incluye una política de uso aceptable y una cláusula que exige una licencia separada de Meta si un producto derivado supera los 700 millones de usuarios activos mensuales. Cualquiera que despliegue Idefics3 comercialmente a gran escala debería leer directamente las condiciones de la licencia Llama 3.1 de Meta, no solo la etiqueta Apache-2.0 del repositorio de Idefics3.
El Idefics original es el más restrictivo. Su base LLaMA(1) conlleva la licencia original de Meta, solo para investigación y no comercial, lo que hace que el uso comercial del modelo completo de 9B/80B sea legalmente incierto en el mejor de los casos e inviable en el peor — aunque el codificador de visión y los pesos de conexión tengan licencia MIT por separado.
¿Idefics es gratuito para uso comercial?
Depende de la generación. Idefics2 es totalmente Apache-2.0 sin restricciones adicionales. El repositorio de Idefics3 está etiquetado como Apache-2.0, pero su base Llama-3.1-8B-Instruct conlleva las condiciones de la licencia comunitaria Llama 3.1 de Meta, incluida una obligación de licencia separada por encima de los 700 millones de usuarios activos mensuales. El Idefics original conlleva una restricción solo para investigación, no comercial, de su base LLaMA(1).
Ejemplo de uso real: biblioteca Transformers
Idefics3 se usa mediante las clases AutoModelForVision2Seq y AutoProcessor de Hugging Face Transformers, documentadas en la documentación del modelo Idefics3 de Transformers. Se requiere la versión 4.46 o posterior de Transformers.
- Hoy no existe una ruta de Ollama o llama.cpp. Idefics funciona mediante Transformers (o servidores de inferencia compatibles como Text Generation Inference), no mediante ejecutores basados en GGUF.
- Reducir el parámetro de resolución de imagen puede disminuir el uso de memoria de GPU. Las fichas de modelo de Idefics2/3 documentan reducir el número de subparches de imagen procesados (denominado
Nen la documentación de Idefics3) como una forma de intercambiar algo de precisión por menos VRAM.
# Requiere transformers >= 4.46 (según la documentación del modelo Idefics3 de Hugging Face)
# pip install transformers pillow torch
from transformers import AutoProcessor, AutoModelForVision2Seq
from PIL import Image
import torch
model_id = "HuggingFaceM4/Idefics3-8B-Llama3"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForVision2Seq.from_pretrained(
model_id,
torch_dtype=torch.float16,
).to("cuda")
image = Image.open("photo.jpg")
messages = [
{
"role": "user",
"content": [
{"type": "image"},
{"type": "text", "text": "What is in this image?"},
],
},
]
prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
inputs = processor(text=prompt, images=[image], return_tensors="pt").to("cuda")
generated_ids = model.generate(**inputs, max_new_tokens=200)
generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)
print(generated_text[0])Requisitos de VRAM y hardware
Idefics2 e Idefics3 son notablemente más pesados que checkpoints de LLaVA o MiniCPM-V de tamaño comparable, en gran parte por cómo procesan la resolución de imagen. Estas cifras provienen directamente de la propia ficha de modelo de Idefics2, que documenta explícitamente su rango de VRAM; se espera que Idefics3 (con el mismo número de 8B parámetros y el mismo codificador de visión) sea similar, aunque PromptQuorum no encontró una tabla de VRAM publicada con el mismo nivel de detalle específicamente para Idefics3.
Configuración | VRAM aprox. | Notas |
|---|---|---|
| float16 + flash-attention | ~18-20 GB | Documentado en la ficha de modelo de Idefics2 como configuración estándar |
| Sin optimizaciones | Hasta ~55 GB en pico | Límite superior de la ficha de modelo de Idefics2 para inferencia sin optimizar |
| Cuantización agresiva | ~6-7 GB | Límite inferior documentado en la ficha de modelo de Idefics2; espera un compromiso de precisión |
| LLaVA 7B (para comparar) | ~6-8 GB | Consulta el análisis de LLaVA de PromptQuorum |
📌Nota: PromptQuorum no realizó sus propias pruebas de hardware para este artículo; estas cifras provienen de la ficha de modelo publicada de Idefics2. Idefics es realmente más pesado que LLaVA 7B o MiniCPM-V en niveles de capacidad comparables — sé honesto contigo mismo sobre la VRAM disponible antes de elegirlo para un despliegue con recursos limitados.
Para qué no es bueno Idefics
Idefics3 es un modelo de visión-lenguaje abierto competente, pero es la elección equivocada en las siguientes situaciones:
- Configuraciones locales con recursos limitados. Con aproximadamente 18-20 GB de VRAM en su configuración estándar float16, Idefics2/3 necesitan notablemente más memoria de GPU que LLaVA 7B (~6-8 GB) o MiniCPM-V (~5,5 GB). Si tu presupuesto de hardware es una sola GPU de consumo con 8 GB de VRAM o menos, Idefics no es una opción realista sin cuantización agresiva y un compromiso de precisión aceptado.
- Aplicaciones en tiempo real o de baja latencia. Un modelo de visión-lenguaje de 8B parámetros que procesa múltiples subparches de imagen por entrada no está pensado para el tiempo de respuesta más rápido posible. Si la latencia es la prioridad, un modelo más pequeño como Moondream (1,8B) responderá más rápido, con capacidad reducida.
- Un flujo de trabajo directo con Ollama o llama.cpp. Idefics no está empaquetado actualmente en la biblioteca de Ollama, y la conversión a GGUF presenta problemas de compatibilidad abiertos y sin resolver en el propio GitHub de Ollama. Si tu flujo de trabajo depende específicamente de Ollama, consulta la guía de modelos de visión de Ollama de PromptQuorum para modelos que realmente se pueden descargar hoy.
- Asumir una licencia única y uniforme entre versiones. Tratar "Idefics" como un solo producto con una sola licencia es un error — verifica qué generación estás desplegando y lee las condiciones de licencia específicas de ese modelo, en particular las obligaciones de la licencia comunitaria Llama 3.1 para Idefics3 a gran escala.
Alternativas y competidores
LLaVA
- Mejor uso:
- Soporte de herramientas más amplio, incluido el empaquetado para Ollama y llama.cpp; huella de VRAM más ligera con 7B
- Licencia:
- Apache-2.0 (código); depende del modelo base para los checkpoints
Modelos de visión de Ollama
- Mejor uso:
- Configuración local más sencilla mediante
ollama pull/ollama run; Idefics no está entre ellos al momento de este análisis - Licencia:
- Varía según el modelo
MLC Chat
- Mejor uso:
- Implementación en el dispositivo multiplataforma; centrada principalmente en texto al momento de este análisis — verifica el soporte de visión actual antes de depender de él
- Licencia:
- Apache-2.0
Artículos sobre MLC Chat (5)
- MLC Chat Review (2026): The Mobile App Built on MLC LLM, Assessed HonestlyActualizado 7 de septiembre de 2026
- Best Local LLM Apps for iPhone in 2026 (Run AI Without WiFi)Actualizado 1 de septiembre de 2026
- Mobile Local LLMs 2026: iPhone 16 Pro, iPad M4 & Snapdragon XActualizado 28 de agosto de 2026
- Best Local LLM Apps for Android in 2026: 6 Apps Compared on Real PhonesActualizado 24 de agosto de 2026
- Best Mobile LLM Models in 2026: Phi-4 Mini vs Gemma 3 vs SmolLMActualizado 14 de julio de 2026
También mencionado en:
- Galaxy vs iPhone On-Device AI: Samsung Galaxy AI vs Apple Intelligence (2026)Actualizado 29 de agosto de 2026
- Run a Local LLM on Your Tablet: iPad Pro M5, Galaxy Tab S10, OnePlus Pad 2 (2026)Actualizado 14 de julio de 2026
- Running Local AI on the Galaxy S26: On-Device AI Explained (2026)Actualizado 15 de junio de 2026
APIs de VLM en la nube (GPT-4o, Claude, visión de Gemini)
- Mejor uso:
- La mayor capacidad multimodal disponible, sin necesidad de hardware ni configuración local
- Licencia:
- Propietaria (API de pago)
Preguntas frecuentes
¿Qué es Idefics?
Idefics es una familia de modelos de visión-lenguaje abiertos creada por el equipo M4 de HuggingFace, diseñada explícitamente como una reproducción abierta de Flamingo de DeepMind. Existe en tres generaciones: el Idefics original (2023, 9B/80B), Idefics2 (abril de 2024, 8B) e Idefics3 (agosto de 2024, 8B).
¿Qué versión de Idefics debería usar — Idefics, Idefics2 o Idefics3?
Idefics3 para la mayoría de las tareas hoy — tiene el mejor OCR y comprensión de documentos de los tres. Idefics2 sigue siendo relevante si necesitas específicamente una pila totalmente Apache-2.0 sin condiciones derivadas de Llama. El Idefics original está en gran medida superado y conlleva una restricción de licencia solo para investigación.
¿Idefics es completamente de código abierto y gratuito para uso comercial?
Depende de la generación. Idefics2 es totalmente Apache-2.0. El repositorio de Idefics3 está etiquetado como Apache-2.0, pero su base Llama-3.1-8B-Instruct conlleva las condiciones de la licencia comunitaria Llama 3.1 de Meta, incluidas obligaciones por encima de los 700 millones de usuarios activos mensuales. El Idefics original tiene una restricción solo para investigación, no comercial, de su base LLaMA(1).
¿Cuánta VRAM necesita Idefics?
Idefics2 (y probablemente Idefics3, con el mismo número de 8B parámetros y el mismo codificador de visión) necesita aproximadamente 18-20 GB de VRAM en la configuración estándar float16 con flash-attention documentada en la ficha de modelo de Idefics2, o tan solo 6-7 GB con cuantización agresiva y un compromiso de precisión. Esto es notablemente más pesado que LLaVA 7B o MiniCPM-V.
¿Puedo ejecutar Idefics mediante Ollama?
No al momento de este análisis. Idefics no está empaquetado actualmente en la biblioteca de modelos de Ollama, y la conversión a GGUF presenta problemas de compatibilidad abiertos en el propio repositorio de GitHub de Ollama. Idefics funciona en su lugar mediante Hugging Face Transformers.
¿Idefics está basado en Flamingo de DeepMind?
Idefics se describe explícitamente en su propia ficha de modelo como "una reproducción de acceso abierto de Flamingo, un modelo de visión-lenguaje propietario desarrollado por DeepMind." Idefics2 e Idefics3 son sucesores arquitectónicamente independientes creados por el mismo equipo de HuggingFace M4.
Veredicto
Idefics es una familia de modelos de visión-lenguaje abiertos genuinamente útil, e Idefics3 en particular funciona bien para tareas intensivas en OCR de documentos y razonamiento multi-imagen donde su huella de aproximadamente 18-20 GB de VRAM es asequible. Sin embargo, no es un reemplazo directo para modelos de visión locales más ligeros: necesita notablemente más memoria de GPU que LLaVA 7B o MiniCPM-V, no tiene empaquetado para Ollama ni llama.cpp al momento de este análisis, y su situación de licencia difiere realmente según la generación — la pila Apache-2.0 limpia de Idefics2 es una propuesta legal distinta de las obligaciones de la licencia comunitaria Llama 3.1 de Idefics3. Elige Idefics3 para comprensión de documentos y calidad de OCR cuando dispongas de la memoria de GPU necesaria; elige específicamente Idefics2 si una pila puramente Apache-2.0 importa; y elige LLaVA, mediante el análisis de LLaVA de PromptQuorum, o uno de los modelos de la guía de modelos de visión de Ollama, para hardware local más ligero o flujos de trabajo basados en Ollama.
Fuentes
- Ficha de modelo Idefics-80B — declaración de reproducción de Flamingo, estructura de licencia, tamaños de modelo.
- Ficha de modelo Idefics2-8b — modelos base, licencia Apache-2.0, rango de VRAM documentado.
- Ficha de modelo Idefics3-8B-Llama3 — modelo base, etiqueta de licencia, detalles de publicación.
- Documentación de Transformers de Idefics3 — ejemplo de uso, versión mínima de Transformers.
- Licencia comunitaria Meta Llama 3.1 — condiciones de licencia heredadas por la base de lenguaje de Idefics3.
- Ticket de GitHub de Ollama #2183 y ticket #3677 — solicitudes de funcionalidad abiertas que confirman que Idefics no está empaquetado actualmente en la biblioteca de Ollama.
