关键要点
- 存在三代模型:Idefics(2023年)、Idefics2(2024年4月)、Idefics3(2024年8月)——每一代都是独立的模型,而非简单的版本升级。
- Idefics3是目前大多数任务的推荐版本;相较于Idefics2,它在OCR和文档理解方面有实质性提升。
- 许可证在各代之间存在细微差别:原始Idefics有仅限研究的限制;Idefics2完全采用Apache-2.0(Mistral-7B基座);Idefics3除了Apache-2.0仓库标签外,还附带Llama 3.1社区许可条款(Llama-3.1-8B-Instruct基座)。
- VRAM:Idefics2/3在float16下大约需要18-20GB,激进量化下为6-7GB——比LLaVA 7B或MiniCPM-V更重。
- 截至本次评测,尚未被打包进Ollama的模型库;GitHub上有未解决的issue在跟踪GGUF转换的困难。
- 最适合:拥有足够GPU显存的文档密集型OCR和多图推理任务,而非资源有限或实时性要求高的本地环境。
📍 简单一句话
Idefics是HuggingFace M4对DeepMind Flamingo的开源复现,目前已发展到第三代(Idefics3,8B,2024年8月),其三个版本在许可证和VRAM需求上有明显差异,且目前尚未被打包进Ollama的模型库。
💬 简单来说
Idefics是HuggingFace打造的一系列AI模型,能够识别图像并回答关于图像的问题,类似于LLaVA——本评测说明了三个版本中哪个才是实际该用的、它对GPU显存的消耗,以及它的不足之处。
📌注: PromptQuorum直接依据idefics-80b、idefics2-8b和Idefics3-8B-Llama3的HuggingFace模型卡,以及Ollama的模型库和GitHub issue跟踪系统核实了这些事实——具体链接见资料来源部分。
历史:HuggingFace M4与Flamingo复现
**原始Idefics的模型卡明确指出,它是"对Flamingo的开放访问复现,而Flamingo是DeepMind开发的闭源视觉语言模型。"** 该模型由HuggingFace M4团队于2023年发布,有9B和80B两种参数规模,将视觉编码器与LLaMA(1)语言模型基座结合。
原始Idefics采用的是混合许可证,而非单一的宽松许可证。 其视觉编码器和新训练的连接参数以MIT协议发布,但LLaMA(1)语言模型基座要求遵守Meta针对LLaMA的原始许可证——仅限研究、非商用。这使得原始Idefics在大多数情况下都不适合商用,无论技术栈中部分组件是否标注了MIT。
大约于2024年4月发布的Idefics2(8B),用Mistral-7B-v0.1取代了LLaMA(1)基座,并搭配SigLIP视觉编码器。由于两个基座模型均为Apache-2.0协议,Idefics2自己的模型卡指出整个模型为Apache-2.0协议——解决了原始Idefics的许可证问题。HuggingFace自己也表示,Idefics2以约十分之一的体积达到了与Idefics-80B相当的性能,且OCR和文档理解能力明显更强。
于2024年8月22日发布的Idefics3(8B)保留了SigLIP视觉编码器,但将语言基座换成了Meta-Llama-3.1-8B-Instruct。其自己的模型卡显示,相较于Idefics2有实质性提升,尤其是在文档理解、OCR和视觉推理方面。它在Transformers 4.46版本中被加入Hugging Face Transformers库。
Idefics是DeepMind Flamingo的复现吗?
是的。原始Idefics的模型卡明确将其描述为"对Flamingo的开放访问复现,而Flamingo是DeepMind开发的闭源视觉语言模型。"Idefics2和Idefics3是HuggingFace M4在同一血统上独立设计架构的后续版本。
Idefics vs Idefics2 vs Idefics3:究竟发生了哪些变化
这三代是拥有不同基础架构的独立模型——而非一个模型的逐步版本升级。以下是依据每个模型自己的HuggingFace卡核实后的真实差异。
Idefics(9B/80B)
- 发布时间:
- 2023年
- 基座:
- LLaMA(1) + 自研视觉编码器
- 备注:
- 继承自LLaMA(1)的仅限研究许可限制;已在很大程度上被取代
Idefics2(8B)
- 发布时间:
- 2024年4月
- 基座:
- Mistral-7B-v0.1 + SigLIP
- 备注:
- 完全采用Apache-2.0;以十分之一的体积达到Idefics-80B的水平
Idefics3(8B)
- 发布时间:
- 2024年8月22日
- 基座:
- Llama-3.1-8B-Instruct + SigLIP
- 备注:
- 三者中OCR/文档理解能力最强;适用Llama 3.1许可条款
截至本次评测,PromptQuorum未发现任何经公开确认的"Idefics4"。Idefics3是最新一代,也是大多数任务目前的推荐版本。
许可证细节:并非简单的Apache-2.0
PromptQuorum的目录条目将Idefics的许可证标注为"Apache 2.0"——这对模型仓库和代码本身而言是准确的,但对实际的许可证情况而言并不完整,这与LLaVA的Apache-2.0代码许可证并不会自动延伸到每个基座模型的权重文件是同样的道理。
Idefics2是最清晰的情况: 其Mistral-7B-v0.1语言基座和SigLIP视觉编码器都是Apache-2.0协议,因此整个模型技术栈确实是Apache-2.0,没有附加条款。
Idefics3的情况更复杂。 其自己的HuggingFace仓库标注为Apache-2.0,但其语言基座Meta-Llama-3.1-8B-Instruct是在Meta的Llama 3.1社区许可下发布的——该许可包含可接受使用政策,并有一条条款规定:若下游产品的月活跃用户超过7亿,则需向Meta单独申请许可。任何计划大规模商业部署Idefics3的人,都应直接阅读Meta的Llama 3.1许可条款,而不能只看Idefics3仓库上的Apache-2.0标签。
原始Idefics的限制最为严格。 其LLaMA(1)基座带有Meta原始的仅限研究、非商用许可证,这使得完整的9B/80B模型的商业使用在法律上最好也是模糊不清,最坏则完全不可行——即便视觉编码器和连接层权重是单独以MIT协议授权的。
Idefics可以免费商用吗?
这取决于具体的代际。Idefics2完全采用Apache-2.0,没有附加限制。Idefics3自己的仓库标注为Apache-2.0,但其Llama-3.1-8B-Instruct基座带有Meta的Llama 3.1社区许可条款,包括月活跃用户超过7亿时需单独申请许可的要求。原始Idefics因其LLaMA(1)基座而带有仅限研究、非商用的限制。
真实使用示例:Transformers库
Idefics3通过Hugging Face Transformers的AutoModelForVision2Seq和AutoProcessor类使用,相关文档见Transformers的Idefics3模型文档。需要Transformers 4.46或更高版本。
- 目前不存在Ollama或llama.cpp的运行路径。 Idefics通过Transformers(或Text Generation Inference等兼容推理服务器)运行,而非基于GGUF的运行工具。
- 降低图像分辨率参数可以减少GPU显存占用。 Idefics2/3的模型卡中记录了减少处理的图像子块数量(在Idefics3文档中称为
N)作为以部分精度换取更低VRAM占用的方法。
# 需要 transformers >= 4.46 (依据Hugging Face的Idefics3模型文档)
# pip install transformers pillow torch
from transformers import AutoProcessor, AutoModelForVision2Seq
from PIL import Image
import torch
model_id = "HuggingFaceM4/Idefics3-8B-Llama3"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForVision2Seq.from_pretrained(
model_id,
torch_dtype=torch.float16,
).to("cuda")
image = Image.open("photo.jpg")
messages = [
{
"role": "user",
"content": [
{"type": "image"},
{"type": "text", "text": "What is in this image?"},
],
},
]
prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
inputs = processor(text=prompt, images=[image], return_tensors="pt").to("cuda")
generated_ids = model.generate(**inputs, max_new_tokens=200)
generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)
print(generated_text[0])VRAM与硬件要求
Idefics2和Idefics3明显比同等规模的LLaVA或MiniCPM-V模型权重更重,这在很大程度上是因为它们处理图像分辨率的方式。以下数据直接来自Idefics2自己的模型卡,该卡明确记录了其VRAM范围;由于Idefics3拥有相同的8B参数量和相同的视觉编码器,预计与之类似,不过PromptQuorum并未找到专门针对Idefics3的、同样详细的已发布VRAM表格。
配置 | 大致VRAM | 备注 |
|---|---|---|
| float16 + flash-attention | 约18-20GB | Idefics2模型卡中记录的标准配置 |
| 无优化 | 峰值最高约55GB | Idefics2模型卡中未优化推理情况下的上限 |
| 激进量化 | 约6-7GB | Idefics2模型卡中记录的下限;预计会有精度损失 |
| LLaVA 7B(用于比较) | 约6-8GB | 参见PromptQuorum的LLaVA评测 |
📌注: 这些是大致的下载/权重体积数据,并非实测的VRAM基准数据——PromptQuorum并未为本文进行自己的硬件测试。在相当的能力等级上,Idefics确实比LLaVA 7B或MiniCPM-V更重——在为资源有限的部署选择它之前,请如实评估自己可用的VRAM。
Idefics不适合做什么
Idefics3是一款能力出色的开源视觉语言模型,但在以下情况下并非合适的选择:
- 资源有限的本地环境。 在标准float16配置下大约需要18-20GB VRAM,Idefics2/3所需的GPU显存明显多于LLaVA 7B(约6-8GB)或MiniCPM-V(约5.5GB)。如果你的硬件预算只是一块8GB VRAM或更小的消费级GPU,若不接受激进量化和相应的精度损失,Idefics并非现实可行的选择。
- 实时或低延迟应用。 一个每次输入需要处理多个图像子块的8B参数视觉语言模型,并非为最快响应时间而设计。如果延迟是首要考量,像Moondream(1.8B)这样更小的模型响应更快,但能力也更弱。
- 直接对接Ollama或llama.cpp的工作流。 Idefics目前未被打包进Ollama的模型库,其GGUF转换在Ollama自己的GitHub上存在尚未解决的开放兼容性问题。如果你的工作流特别依赖Ollama,请参阅PromptQuorum的Ollama视觉模型指南,了解今天真正可以下载的模型。
- 假设各版本使用统一的单一许可证。 把"Idefics"当作使用单一许可证的单一产品来看待是一个错误——请确认你部署的是哪一代,并阅读该模型具体的许可条款,尤其是Idefics3在大规模使用时的Llama 3.1社区许可义务。
替代方案与竞品
LLaVA
- 最适合场景:
- 更广泛的工具支持,包括Ollama和llama.cpp的打包;7B规模下VRAM占用更轻
- 许可:
- Apache-2.0(代码);权重文件的许可取决于基座模型
Ollama的视觉模型
- 最适合场景:
- 通过
ollama pull/ollama run实现最简单的本地配置;截至本次评测,Idefics并不在其中 - 许可:
- 因模型而异
MLC Chat
- 最适合场景:
- 跨平台端侧部署;截至本次评测主要以文本为主——在依赖其完成视觉任务前请核实当前的视觉支持情况
- 许可:
- Apache-2.0
关于MLC Chat的文章(5篇)
- MLC Chat Review (2026): The Mobile App Built on MLC LLM, Assessed Honestly更新于 2026年9月7日
- Best Local LLM Apps for iPhone in 2026 (Run AI Without WiFi)更新于 2026年9月1日
- Mobile Local LLMs 2026: iPhone 16 Pro, iPad M4 & Snapdragon X更新于 2026年8月28日
- Best Local LLM Apps for Android in 2026: 6 Apps Compared on Real Phones更新于 2026年8月24日
- Best Mobile LLM Models in 2026: Phi-4 Mini vs Gemma 3 vs SmolLM更新于 2026年7月14日
其他提及:
云端VLM API(GPT-4o、Claude、Gemini视觉)
- 最适合场景:
- 可获得的最高多模态能力,无需本地硬件或配置
- 许可:
- 专有(付费API)
常见问题
Idefics是什么?
Idefics是HuggingFace M4团队打造的一系列开源视觉语言模型,明确定位为对DeepMind Flamingo的开放复现。它有三代:原始Idefics(2023年,9B/80B)、Idefics2(2024年4月,8B)和Idefics3(2024年8月,8B)。
我应该使用哪个版本的Idefics——Idefics、Idefics2还是Idefics3?
今天大多数任务应使用Idefics3——它在三者中OCR和文档理解能力最强。如果你特别需要一个不含Llama衍生条款的完全Apache-2.0技术栈,Idefics2仍然适用。原始Idefics已在很大程度上被取代,并带有仅限研究的许可限制。
Idefics是否完全开源、可免费商用?
这取决于具体的代际。Idefics2完全采用Apache-2.0。Idefics3的仓库标注为Apache-2.0,但其Llama-3.1-8B-Instruct基座带有Meta的Llama 3.1社区许可条款,包括月活跃用户超过7亿时的相关义务。原始Idefics因其LLaMA(1)基座而带有仅限研究、非商用的限制。
Idefics需要多少VRAM?
Idefics2(以及很可能拥有相同8B参数量和相同视觉编码器的Idefics3)在Idefics2模型卡中记录的标准float16加flash-attention配置下,大约需要18-20GB VRAM,若采用激进量化并接受精度损失,则可低至6-7GB。这明显比LLaVA 7B或MiniCPM-V更重。
我可以通过Ollama运行Idefics吗?
截至本次评测还不能。Idefics目前未被打包进Ollama的模型库,其GGUF转换在Ollama自己的GitHub仓库中存在尚未解决的兼容性问题。Idefics目前只能通过Hugging Face Transformers运行。
Idefics是基于DeepMind的Flamingo吗?
Idefics在其自己的模型卡中被明确描述为"对Flamingo的开放访问复现,而Flamingo是DeepMind开发的闭源视觉语言模型。"Idefics2和Idefics3是由同一个HuggingFace M4团队独立设计架构的后续版本。
结论
Idefics是一系列真正有用的开源视觉语言模型,其中Idefics3在文档密集型OCR和多图推理工作中表现尤为出色,前提是能够承担其大约18-20GB的VRAM占用。不过,它并不能直接替代更轻量的本地视觉模型:它所需的GPU显存明显多于LLaVA 7B或MiniCPM-V,截至本次评测尚无Ollama或llama.cpp的打包支持,并且其许可证情况确实因代际而异——Idefics2简洁的Apache-2.0技术栈,与Idefics3所附带的Llama 3.1社区许可义务,在法律上是完全不同的两回事。当你有足够的GPU显存时,选择Idefics3以获得文档理解和OCR质量;当纯粹的Apache-2.0技术栈很重要时,特别选择Idefics2;而对于更轻量的本地硬件或基于Ollama的工作流,则可通过PromptQuorum的LLaVA评测选择LLaVA,或在Ollama视觉模型指南中选择其中一个模型。
资料来源
- Idefics-80B模型卡 —— Flamingo复现声明、许可证结构、模型规模。
- Idefics2-8b模型卡 —— 基座模型、Apache-2.0许可证、记录的VRAM范围。
- Idefics3-8B-Llama3模型卡 —— 基座模型、许可证标签、发布细节。
- Idefics3的Transformers文档 —— 使用示例、Transformers最低版本要求。
- Meta Llama 3.1社区许可证 —— Idefics3语言基座所继承的许可条款。
- Ollama GitHub issue #2183 和 issue #3677 —— 确认Idefics目前未被打包进Ollama模型库的开放功能请求。
