¿Qué modelos de Ollama son compatibles con visión?

Respuesta rápida
Los mejores modelos de visión de Ollama en 2026 son Qwen3-VL y Gemma 4, ambos nativamente multimodales. LLaVA sigue siendo el respaldo más seguro por su amplia compatibilidad. Llama 3.2 Vision está actualmente roto en Ollama ("unknown model architecture: mllama") — usa Qwen3-VL o Gemma 4 en su lugar.
- ▸qwen3-vl: la familia de visión más potente, ideal para OCR, gráficos y capturas de pantalla
- ▸gemma4: visión integrada en cada tamaño, más llamadas a herramientas
- ▸llava: el respaldo más seguro, la mayor compatibilidad con clientes
- ▸llama3.2-vision: roto en Ollama v0.30.0+ ("unknown model architecture: mllama")
Puntos clave
- ✓Desde septiembre de 2026, los modelos de visión líderes de Ollama son Qwen3-VL y Gemma 4 — ambos reemplazaron a la generación anterior Qwen2.5-VL/Gemma 3
- ✓Llama 3.2 Vision está actualmente roto en Ollama v0.30.0 y versiones posteriores: falla con "Error: unknown model architecture: mllama" porque el nuevo motor de Ollama basado en llama.cpp no soporta mllama
- ✓LLaVA 7B sigue siendo el respaldo más seguro (~7 GB de VRAM, funciona en cualquier versión de Ollama)
- ✓Usa Qwen3-VL para OCR, gráficos y capturas de pantalla; usa Gemma 4 cuando necesites visión y llamadas a herramientas en un solo modelo
Los principales modelos de visión en Ollama
El catálogo de visión de Ollama cambió mucho en 2026: Qwen3-VL y Gemma 4 son ahora las opciones más fuertes, y Llama 3.2 Vision ya no carga en las versiones actuales de Ollama. Cada modelo restante tiene una fortaleza y un perfil de VRAM propios.
Qwen3-VL es la familia de modelos de visión-lenguaje abierta más potente disponible en Ollama — lidera en OCR, gráficos, diagramas y comprensión de capturas de pantalla/UI, y va desde un modelo de 2B para dispositivos edge hasta una variante de 235B en mixture-of-experts. Gemma 4 integra visión nativa en cada tamaño (2B–31B) junto con llamadas a herramientas, lo que lo convierte en la mejor opción cuando un solo modelo necesita ver imágenes y llamar a herramientas. LLaVA sigue siendo el punto de partida más seguro por su amplia compatibilidad con clientes. Qwen2.5-VL, la generación anterior de Qwen, sigue funcionando y continúa siendo una opción ligera válida si ya la tienes descargada.
Todos los modelos de visión cargan un codificador de imagen junto a los pesos del LLM. Este codificador añade entre 1 y 3 GB de VRAM sobre lo que necesita el modelo base solo de texto — ten en cuenta este overhead al revisar tu presupuesto de VRAM.
Error: unknown model architecture: "mllama" — la arquitectura mllama nunca se añadió a llama.cpp. Esto sigue sin resolverse en Ollama v0.33.2 (agosto de 2026). Usa Qwen3-VL o Gemma 4 en su lugar, o conserva una instalación de Ollama anterior a la v0.30.0 si necesitas específicamente Llama 3.2 Vision.Requisitos de VRAM para visión
Cada modelo de visión necesita más VRAM que su equivalente solo de texto. Un modelo de visión de 7–8B normalmente requiere entre 7 y 9 GB de VRAM, no los ~6 GB que presupuestarías para un modelo de texto de tamaño similar.
Para OCR, gráficos y análisis de documentos, Qwen3-VL 8B es la opción potente más eficiente en VRAM. Para visión más llamadas a herramientas en un solo modelo, las variantes de 12B o 26B-A4B MoE de Gemma 4 caben en 8–14 GB. Para la guía completa sobre modelos locales multimodales y la elección según el caso de uso, consulta la guía de LLM locales multimodales.
| Modelo | VRAM en Q4 | Capacidad de imagen |
|---|---|---|
| LLaVA 7B | ~7 GB | Preguntas y respuestas generales sobre imágenes, amplia compatibilidad |
| Qwen3-VL 8B | ~8 GB | OCR, gráficos, capturas de pantalla, multilingüe |
| Gemma 4 (12B) | ~8 GB | Visión + llamadas a herramientas |
| Gemma 4 (26B-A4B MoE) | ~14 GB | Visión + llamadas a herramientas, mayor calidad |
| Llama 3.2 Vision 11B | ~10 GB | ⚠️ Roto en Ollama v0.30.0+ (error mllama) |
Guías relacionadas
- ▸Ejecutar Qwen 3 en Ollama -- opción multimodal con llamadas a herramientas
- ▸Modelos Ollama con contexto de 128K -- long context models
- ▸Guía de LLM locales multimodales -- guía completa de modelos de visión locales
- ▸Mejores modelos de visión locales 2026 -- todos los modelos de visión, todas las GPU
Respuestas rápidas sobre los modelos de visión de Ollama
¿Cómo envío una imagen a Ollama a través de la API?▾
/api/chat con la imagen como cadena base64 en el array images. Cuerpo JSON mínimo funcional: {"model":"llava","messages":[{"role":"user","content":"What is in this image?","images":["<base64>"]}]} Consulta Qwen 3 en Ollama para una opción multimodal con soporte potente de llamadas a herramientas.