Principais conclusões
- Existem três gerações: Idefics (2023), Idefics2 (abril de 2024), Idefics3 (agosto de 2024) — cada uma um modelo distinto, não uma simples atualização.
- O Idefics3 é a recomendação atual para a maioria das tarefas; melhora substancialmente o OCR e a compreensão de documentos em relação ao Idefics2.
- A licença tem nuances entre as gerações: o Idefics original tem uma restrição apenas para pesquisa; o Idefics2 é totalmente Apache-2.0 (base Mistral-7B); o Idefics3 traz as condições da Licença Comunitária Llama 3.1 além de sua etiqueta Apache-2.0 (base Llama-3.1-8B-Instruct).
- VRAM: aproximadamente 18-20 GB em float16 para o Idefics2/3, ou 6-7 GB com quantização agressiva — mais pesado que o LLaVA 7B ou o MiniCPM-V.
- Não empacotado na biblioteca do Ollama no momento desta análise; issues abertas no GitHub acompanham dificuldades de conversão para GGUF.
- Melhor uso: tarefas intensivas em OCR de documentos e raciocínio com múltiplas imagens, com memória de GPU suficiente, não configurações locais com recursos limitados ou em tempo real.
📍 Em uma frase
O Idefics é a reprodução aberta da HuggingFace M4 do Flamingo da DeepMind, agora em sua terceira geração (Idefics3, 8B, agosto de 2024), com licenças e necessidades de VRAM notavelmente diferentes entre suas três versões, e não está atualmente empacotado na biblioteca de modelos do Ollama.
💬 Em termos simples
O Idefics é uma família de modelos de IA feitos pela HuggingFace que conseguem olhar para imagens e responder perguntas sobre elas, semelhante ao LLaVA — esta análise explica qual das três versões realmente usar, quanto ela custa em memória de GPU e onde ela deixa a desejar.
📌Nota: O PromptQuorum verificou esses fatos diretamente nas fichas de modelo da HuggingFace para idefics-80b, idefics2-8b e Idefics3-8B-Llama3, e na biblioteca do Ollama e seu rastreador de issues do GitHub — veja a seção Fontes para os links exatos.
História: HuggingFace M4 e a Reprodução do Flamingo
**A ficha de modelo do Idefics original afirma explicitamente que é "uma reprodução de acesso aberto do Flamingo, um modelo de visão-linguagem de código fechado desenvolvido pela DeepMind."** Foi lançado pela equipe M4 da HuggingFace em 2023, em dois tamanhos, 9B e 80B parâmetros, combinando um codificador de visão com uma base de modelo de linguagem LLaMA(1).
O Idefics original carrega uma licença mista, não uma única licença permissiva. Seu codificador de visão e os parâmetros de conexão recém-treinados são lançados sob MIT, mas a base de modelo de linguagem LLaMA(1) exige conformidade com a licença original da Meta, apenas para pesquisa e não comercial, para o LLaMA. Isso torna o Idefics original inadequado para uso comercial na maioria dos casos, independentemente da etiqueta MIT em partes da pilha.
O Idefics2 (8B), lançado por volta de abril de 2024, substituiu a base LLaMA(1) pelo Mistral-7B-v0.1 e o combinou com um codificador de visão SigLIP. Como ambos os modelos base são Apache-2.0, a própria ficha de modelo do Idefics2 afirma que o modelo completo é Apache-2.0 — resolvendo o problema de licenciamento do Idefics original. A própria HuggingFace credita ao Idefics2 igualar o desempenho do Idefics-80B com um tamanho cerca de 10x menor, com OCR e compreensão de documentos notavelmente melhores.
O Idefics3 (8B), lançado em 22 de agosto de 2024, manteve o codificador de visão SigLIP, mas trocou a base de linguagem para o Meta-Llama-3.1-8B-Instruct. Sua própria ficha de modelo demonstra uma melhoria substancial em relação ao Idefics2, particularmente em compreensão de documentos, OCR e raciocínio visual. Foi adicionado ao Hugging Face Transformers na versão 4.46.
O Idefics é uma reprodução do Flamingo da DeepMind?
Sim. A ficha de modelo do Idefics original o descreve explicitamente como "uma reprodução de acesso aberto do Flamingo, um modelo de visão-linguagem de código fechado desenvolvido pela DeepMind." O Idefics2 e o Idefics3 são gerações subsequentes da HuggingFace M4, com arquitetura independente, mas dentro da mesma linhagem.
Idefics vs Idefics2 vs Idefics3: O Que Realmente Mudou
As três gerações são modelos distintos com arquiteturas base diferentes — não um único modelo com aumentos incrementais de versão. Aqui está o que realmente difere, verificado na ficha da HuggingFace de cada modelo.
Idefics (9B/80B)
- Lançamento:
- 2023
- Base:
- LLaMA(1) + codificador de visão próprio
- Notas:
- Restrição de licença apenas para pesquisa herdada do LLaMA(1); em grande parte superado
Idefics2 (8B)
- Lançamento:
- Abril de 2024
- Base:
- Mistral-7B-v0.1 + SigLIP
- Notas:
- Totalmente Apache-2.0; iguala o Idefics-80B com tamanho 10x menor
Idefics3 (8B)
- Lançamento:
- 22 de agosto de 2024
- Base:
- Llama-3.1-8B-Instruct + SigLIP
- Notas:
- Melhor OCR/compreensão de documentos dos três; aplicam-se as condições de licença do Llama 3.1
O PromptQuorum não encontrou nenhum "Idefics4" confirmado publicamente no momento desta análise. O Idefics3 é a geração mais recente e a recomendação atual para a maioria das tarefas.
Nuance de Licença: Não É Simplesmente Apache-2.0
O diretório do PromptQuorum marca a licença do Idefics como "Apache 2.0" — isso é correto para o repositório e o código do modelo, mas incompleto para a situação prática de licenciamento, de forma semelhante a como a licença Apache-2.0 do código do LLaVA não se estende automaticamente a cada checkpoint de modelo base.
O Idefics2 é o caso mais claro: tanto sua base de linguagem Mistral-7B-v0.1 quanto seu codificador de visão SigLIP são Apache-2.0, então toda a pilha do modelo é genuinamente Apache-2.0, sem termos adicionais.
O Idefics3 é mais nuançado. Seu próprio repositório na HuggingFace é marcado como Apache-2.0, mas sua base de linguagem, o Meta-Llama-3.1-8B-Instruct, é lançada sob a Licença Comunitária Llama 3.1 da Meta — que inclui uma política de uso aceitável e uma cláusula exigindo uma licença separada da Meta caso um produto derivado ultrapasse 700 milhões de usuários ativos mensais. Qualquer um que implante o Idefics3 comercialmente em grande escala deveria ler diretamente os termos da licença Llama 3.1 da Meta, não apenas a etiqueta Apache-2.0 no repositório do Idefics3.
O Idefics original é o mais restritivo. Sua base LLaMA(1) carrega a licença original da Meta, apenas para pesquisa e não comercial, o que torna o uso comercial do modelo completo 9B/80B legalmente incerto na melhor das hipóteses e inviável na pior — mesmo que o codificador de visão e os pesos de conexão tenham licença MIT separada.
O Idefics é gratuito para uso comercial?
Depende da geração. O Idefics2 é totalmente Apache-2.0, sem restrições adicionais. O repositório do Idefics3 é etiquetado como Apache-2.0, mas sua base Llama-3.1-8B-Instruct carrega as condições da Licença Comunitária Llama 3.1 da Meta, incluindo uma exigência de licença separada acima de 700 milhões de usuários ativos mensais. O Idefics original carrega uma restrição apenas para pesquisa, não comercial, de sua base LLaMA(1).
Exemplo Real de Uso: Biblioteca Transformers
O Idefics3 é usado por meio das classes AutoModelForVision2Seq e AutoProcessor do Hugging Face Transformers, documentadas na documentação do modelo Idefics3 do Transformers. É necessária a versão 4.46 ou posterior do Transformers.
- Hoje não existe um caminho para Ollama ou llama.cpp. O Idefics roda por meio do Transformers (ou servidores de inferência compatíveis como o Text Generation Inference), não por meio de executores baseados em GGUF.
- Reduzir o parâmetro de resolução de imagem pode diminuir o uso de memória de GPU. As fichas de modelo do Idefics2/3 documentam a redução do número de sub-recortes de imagem processados (chamado de
Nna documentação do Idefics3) como forma de trocar um pouco de precisão por menos VRAM.
# Requer transformers >= 4.46 (conforme a documentação do modelo Idefics3 da Hugging Face)
# pip install transformers pillow torch
from transformers import AutoProcessor, AutoModelForVision2Seq
from PIL import Image
import torch
model_id = "HuggingFaceM4/Idefics3-8B-Llama3"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForVision2Seq.from_pretrained(
model_id,
torch_dtype=torch.float16,
).to("cuda")
image = Image.open("photo.jpg")
messages = [
{
"role": "user",
"content": [
{"type": "image"},
{"type": "text", "text": "What is in this image?"},
],
},
]
prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
inputs = processor(text=prompt, images=[image], return_tensors="pt").to("cuda")
generated_ids = model.generate(**inputs, max_new_tokens=200)
generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)
print(generated_text[0])Requisitos de VRAM e Hardware
O Idefics2 e o Idefics3 são notavelmente mais pesados que checkpoints de LLaVA ou MiniCPM-V de tamanho comparável, em grande parte pela forma como processam a resolução de imagem. Esses números vêm diretamente da própria ficha de modelo do Idefics2, que documenta explicitamente sua faixa de VRAM; espera-se que o Idefics3 (mesma contagem de 8B parâmetros e mesmo codificador de visão) seja semelhante, embora o PromptQuorum não tenha encontrado uma tabela de VRAM publicada com o mesmo nível de detalhe especificamente para o Idefics3.
Configuração | VRAM aprox. | Notas |
|---|---|---|
| float16 + flash-attention | ~18-20 GB | Documentado na ficha de modelo do Idefics2 como configuração padrão |
| Sem otimizações | Até ~55 GB no pico | Limite superior da ficha de modelo do Idefics2 para inferência não otimizada |
| Quantização agressiva | ~6-7 GB | Limite inferior documentado na ficha de modelo do Idefics2; espere uma perda de precisão |
| LLaVA 7B (para comparação) | ~6-8 GB | Veja a análise do LLaVA do PromptQuorum |
📌Nota: O PromptQuorum não realizou seus próprios testes de hardware para este artigo; esses números vêm da ficha de modelo publicada do Idefics2. O Idefics é genuinamente mais pesado que o LLaVA 7B ou o MiniCPM-V em níveis de capacidade comparáveis — seja honesto consigo mesmo sobre a VRAM disponível antes de escolhê-lo para uma implantação com recursos limitados.
Para que o Idefics Não Serve
O Idefics3 é um modelo de visão-linguagem aberto competente, mas é a escolha errada nas seguintes situações:
- Configurações locais com recursos limitados. Com aproximadamente 18-20 GB de VRAM em sua configuração padrão float16, o Idefics2/3 precisa de notavelmente mais memória de GPU que o LLaVA 7B (~6-8 GB) ou o MiniCPM-V (~5,5 GB). Se o seu orçamento de hardware é uma única GPU de consumidor com 8 GB de VRAM ou menos, o Idefics não é uma opção realista sem quantização agressiva e uma perda de precisão aceita.
- Aplicações em tempo real ou de baixa latência. Um modelo de visão-linguagem de 8B parâmetros que processa múltiplos sub-recortes de imagem por entrada não foi feito para o tempo de resposta mais rápido possível. Se a latência for a prioridade, um modelo menor como o Moondream (1,8B) responderá mais rápido, com capacidade reduzida.
- Um fluxo de trabalho direto com Ollama ou llama.cpp. O Idefics não está atualmente empacotado na biblioteca do Ollama, e a conversão para GGUF tem problemas de compatibilidade em aberto e não resolvidos, rastreados no próprio GitHub do Ollama. Se o seu fluxo de trabalho depende especificamente do Ollama, veja o guia de modelos de visão do Ollama do PromptQuorum para modelos que podem ser realmente baixados hoje.
- Assumir uma licença única e uniforme entre as versões. Tratar "Idefics" como um único produto com uma única licença é um erro — verifique qual geração você está implantando e leia os termos de licença específicos daquele modelo, particularmente as obrigações da Licença Comunitária Llama 3.1 do Idefics3 em grande escala.
Alternativas e Concorrentes
LLaVA
- Melhor uso:
- Suporte de ferramentas mais amplo, incluindo empacotamento para Ollama e llama.cpp; menor pegada de VRAM com 7B
- Licença:
- Apache-2.0 (código); depende do modelo base para os checkpoints
Modelos de visão do Ollama
- Melhor uso:
- Configuração local mais simples via
ollama pull/ollama run; o Idefics não está entre eles no momento desta análise - Licença:
- Varia conforme o modelo
MLC Chat
- Melhor uso:
- Implantação no dispositivo multiplataforma; principalmente focado em texto no momento desta análise — verifique o suporte atual a visão antes de depender dele
- Licença:
- Apache-2.0
Artigos sobre MLC Chat (5)
- MLC Chat Review (2026): The Mobile App Built on MLC LLM, Assessed HonestlyAtualizado 7 de setembro de 2026
- Best Local LLM Apps for iPhone in 2026 (Run AI Without WiFi)Atualizado 1 de setembro de 2026
- Mobile Local LLMs 2026: iPhone 16 Pro, iPad M4 & Snapdragon XAtualizado 28 de agosto de 2026
- Best Local LLM Apps for Android in 2026: 6 Apps Compared on Real PhonesAtualizado 24 de agosto de 2026
- Best Mobile LLM Models in 2026: Phi-4 Mini vs Gemma 3 vs SmolLMAtualizado 14 de julho de 2026
Também mencionado em:
- Galaxy vs iPhone On-Device AI: Samsung Galaxy AI vs Apple Intelligence (2026)Atualizado 29 de agosto de 2026
- Run a Local LLM on Your Tablet: iPad Pro M5, Galaxy Tab S10, OnePlus Pad 2 (2026)Atualizado 14 de julho de 2026
- Running Local AI on the Galaxy S26: On-Device AI Explained (2026)Atualizado 15 de junho de 2026
APIs de VLM em nuvem (GPT-4o, Claude, visão do Gemini)
- Melhor uso:
- A maior capacidade multimodal disponível, sem necessidade de hardware ou configuração local
- Licença:
- Proprietária (API paga)
Perguntas Frequentes
O que é o Idefics?
O Idefics é uma família de modelos de visão-linguagem abertos criada pela equipe M4 da HuggingFace, projetada explicitamente como uma reprodução aberta do Flamingo da DeepMind. Existe em três gerações: o Idefics original (2023, 9B/80B), o Idefics2 (abril de 2024, 8B) e o Idefics3 (agosto de 2024, 8B).
Qual versão do Idefics devo usar — Idefics, Idefics2 ou Idefics3?
O Idefics3 para a maioria das tarefas hoje — tem o melhor OCR e compreensão de documentos dos três. O Idefics2 continua relevante se você precisa especificamente de uma pilha totalmente Apache-2.0, sem termos derivados do Llama. O Idefics original está em grande parte superado e carrega uma restrição de licença apenas para pesquisa.
O Idefics é totalmente open source e gratuito para uso comercial?
Depende da geração. O Idefics2 é totalmente Apache-2.0. O repositório do Idefics3 é etiquetado como Apache-2.0, mas sua base Llama-3.1-8B-Instruct carrega as condições da Licença Comunitária Llama 3.1 da Meta, incluindo obrigações acima de 700 milhões de usuários ativos mensais. O Idefics original tem uma restrição apenas para pesquisa, não comercial, de sua base LLaMA(1).
Quanta VRAM o Idefics precisa?
O Idefics2 (e provavelmente o Idefics3, com a mesma contagem de 8B parâmetros e o mesmo codificador de visão) precisa de aproximadamente 18-20 GB de VRAM na configuração padrão float16 com flash-attention documentada na ficha de modelo do Idefics2, ou apenas 6-7 GB com quantização agressiva e uma perda de precisão. Isso é notavelmente mais pesado que o LLaVA 7B ou o MiniCPM-V.
Posso rodar o Idefics pelo Ollama?
Não, no momento desta análise. O Idefics não está atualmente empacotado na biblioteca de modelos do Ollama, e a conversão para GGUF tem problemas de compatibilidade em aberto rastreados no próprio repositório GitHub do Ollama. O Idefics roda pelo Hugging Face Transformers em vez disso.
O Idefics é baseado no Flamingo da DeepMind?
O Idefics é explicitamente descrito em sua própria ficha de modelo como "uma reprodução de acesso aberto do Flamingo, um modelo de visão-linguagem de código fechado desenvolvido pela DeepMind." O Idefics2 e o Idefics3 são sucessores com arquitetura independente, criados pela mesma equipe HuggingFace M4.
Veredito
O Idefics é uma família de modelos de visão-linguagem abertos genuinamente útil, e o Idefics3 em particular se sai bem para trabalhos intensivos de OCR de documentos e raciocínio com múltiplas imagens, onde sua pegada de aproximadamente 18-20 GB de VRAM é acessível. No entanto, não é um substituto direto para modelos de visão locais mais leves: precisa de notavelmente mais memória de GPU que o LLaVA 7B ou o MiniCPM-V, não tem empacotamento para Ollama ou llama.cpp no momento desta análise, e sua situação de licença realmente difere por geração — a pilha Apache-2.0 limpa do Idefics2 é uma proposta legal diferente das obrigações da Licença Comunitária Llama 3.1 do Idefics3. Escolha o Idefics3 para compreensão de documentos e qualidade de OCR quando tiver memória de GPU de sobra; escolha especificamente o Idefics2 se uma pilha puramente Apache-2.0 for importante; e escolha o LLaVA, pela análise do LLaVA do PromptQuorum, ou um dos modelos no guia de modelos de visão do Ollama, para hardware local mais leve ou fluxos de trabalho baseados no Ollama.
Fontes
- Ficha de modelo Idefics-80B — declaração de reprodução do Flamingo, estrutura de licença, tamanhos de modelo.
- Ficha de modelo Idefics2-8b — modelos base, licença Apache-2.0, faixa de VRAM documentada.
- Ficha de modelo Idefics3-8B-Llama3 — modelo base, etiqueta de licença, detalhes de lançamento.
- Documentação do Transformers para o Idefics3 — exemplo de uso, versão mínima do Transformers.
- Licença Comunitária Meta Llama 3.1 — termos de licença herdados pela base de linguagem do Idefics3.
- Issue #2183 do GitHub do Ollama e issue #3677 — solicitações de recurso em aberto confirmando que o Idefics não está atualmente empacotado na biblioteca do Ollama.
