哪些Ollama模型支持视觉功能?

快速回答
2026年Ollama最好的视觉模型是Qwen3-VL和Gemma 4,两者均为原生多模态。LLaVA仍是兼容性最广的安全备选。Llama 3.2 Vision目前在Ollama上无法运行("unknown model architecture: mllama")——请改用Qwen3-VL或Gemma 4。
- ▸qwen3-vl:最强视觉模型系列,最适合OCR、图表和截图分析
- ▸gemma4:每个规模都内置视觉功能,还支持工具调用
- ▸llava:最安全的备选,客户端兼容性最广
- ▸llama3.2-vision:在Ollama v0.30.0及以上版本无法运行("unknown model architecture: mllama")
Ollama
关键要点
- ✓截至2026年9月,Ollama领先的视觉模型是Qwen3-VL和Gemma 4——两者都取代了此前的Qwen2.5-VL/Gemma 3一代
- ✓Llama 3.2 Vision在Ollama v0.30.0及以后版本目前无法运行:报错"Error: unknown model architecture: mllama",原因是Ollama基于llama.cpp的新引擎不支持mllama架构
- ✓LLaVA 7B仍是最安全的备选(~7 GB VRAM,兼容所有Ollama版本)
- ✓图表和截图分析使用Qwen3-VL;需要视觉功能加工具调用二合一时使用Gemma 4
Ollama上的顶级视觉模型
2026年Ollama的视觉模型阵容发生了重大变化:Qwen3-VL和Gemma 4现已成为最强选项,而Llama 3.2 Vision在当前Ollama版本上已无法加载。剩下的每个模型都有各自的优势和VRAM需求。
Qwen3-VL是Ollama上可用的最强开源视觉语言模型系列——在OCR、图表、图形和截图/UI理解方面领先,规模从2B的边缘模型一直到235B的混合专家(MoE)版本。Gemma 4在每个规模(2B–31B)都内置了原生视觉能力并支持工具调用,是需要一个模型同时处理图像和调用工具时的最佳选择。LLaVA仍是兼容性最广的最安全入门选择。上一代的Qwen2.5-VL依然可用,如果已经下载过,仍是有效的轻量选择。
所有视觉模型都会在LLM权重的基础上加载图像编码器。此编码器在纯文本模型所需VRAM之上额外增加1–3 GB——规划VRAM预算时请考虑这一开销。
Llama 3.2 Vision目前在Ollama上无法运行。自Ollama v0.30.0(2026年5月)将模型加载改为基于llama.cpp以来,llama3.2-vision会报错
Error: unknown model architecture: "mllama"——mllama架构从未被添加到llama.cpp中。截至Ollama v0.33.2(2026年8月),此问题仍未解决。请改用Qwen3-VL或Gemma 4,或者如果确实需要Llama 3.2 Vision,请保留v0.30.0之前的Ollama版本。视觉功能的VRAM需求
每个视觉模型所需的VRAM都多于其纯文本版本。7–8B视觉模型通常需要7–9 GB VRAM,而不是同等规模纯文本模型预算的~6 GB。
对于OCR、图表和文档分析,Qwen3-VL 8B是VRAM效率最高的强力选项。若需要视觉功能加工具调用二合一,Gemma 4的12B或26B-A4B MoE版本可在8–14 GB内运行。关于多模态本地模型及用例匹配的完整指南,请参阅多模态本地LLM指南。
| 模型 | Q4量化的VRAM | 图像能力 |
|---|---|---|
| LLaVA 7B | ~7 GB | 通用图像问答,广泛兼容 |
| Qwen3-VL 8B | ~8 GB | OCR、图表、截图、多语言 |
| Gemma 4(12B) | ~8 GB | 视觉功能 + 工具调用 |
| Gemma 4(26B-A4B MoE) | ~14 GB | 视觉功能 + 工具调用,质量更高 |
| Llama 3.2 Vision 11B | ~10 GB | ⚠️ 在Ollama v0.30.0+无法运行(mllama错误) |
相关指南
- ▸在Ollama上运行Qwen 3 -- 支持工具调用的多模态选项
- ▸Ollama 128K上下文模型 -- long context models
- ▸多模态本地LLM指南 -- 本地视觉模型完整指南
- ▸2026年最佳本地视觉模型 -- 覆盖每款视觉模型和每种GPU
关于Ollama视觉模型的快速解答
如何通过API向Ollama发送图片?▾
向
/api/chat端点发送POST请求,将图片作为base64字符串放在images数组中。最简JSON请求体:{"model":"llava","messages":[{"role":"user","content":"What is in this image?","images":["<base64>"]}]} 如需多模态能力加强大工具调用支持,参见在Ollama上运行Qwen 3。为什么llama3.2-vision会报错"unknown model architecture: mllama"?▾
Ollama v0.30.0(2026年5月)将模型加载改为基于llama.cpp,而llama.cpp从未加入对Llama 3.2 Vision所用mllama架构的支持。这导致llama3.2-vision在Ollama v0.30.0及此后所有版本(包括v0.33.2)上都无法运行。目前还没有官方修复方案:请改用Qwen3-VL或Gemma 4,或者仅为运行此模型保留一个v0.30.0之前的Ollama安装。
视觉模型可以做OCR(从图片中读取文字)吗?▾
可以,但质量因模型而异。在目前可正常运行的Ollama视觉模型中,Qwen3-VL的OCR能力最强——Llama 3.2 Vision此前是首选,但在Ollama v0.30.0及以上版本已无法运行。LLaVA 7B能读取清晰印刷的文字,但对手写或小字体有困难。
哪个Ollama视觉模型最适合图表和图形?▾
Qwen3-VL。它在图表、表格、图形和截图理解方面领先,在文档理解基准测试中超越了LLaVA和上一代的Qwen2.5-VL。
视觉模型支持在单个提示中处理多张图片吗?▾
支持情况因模型和Ollama版本而异。LLaVA和Qwen2.5-VL目前在Ollama中每轮处理一张图片。Qwen3-VL和Gemma 4在更长上下文配置下支持多图片输入——具体上限请查看各模型的Ollama库页面。