Skip to main content
PromptQuorum

¿Qué modelos de Ollama son compatibles con visión?

¿Qué modelos de Ollama son compatibles con visión?

Respuesta rápida

Los mejores modelos de visión de Ollama en 2026 son Qwen3-VL y Gemma 4, ambos nativamente multimodales. LLaVA sigue siendo el respaldo más seguro por su amplia compatibilidad. Llama 3.2 Vision está actualmente roto en Ollama ("unknown model architecture: mllama") — usa Qwen3-VL o Gemma 4 en su lugar.

  • qwen3-vl: la familia de visión más potente, ideal para OCR, gráficos y capturas de pantalla
  • gemma4: visión integrada en cada tamaño, más llamadas a herramientas
  • llava: el respaldo más seguro, la mayor compatibilidad con clientes
  • llama3.2-vision: roto en Ollama v0.30.0+ ("unknown model architecture: mllama")
Ollama

Puntos clave

  • Desde septiembre de 2026, los modelos de visión líderes de Ollama son Qwen3-VL y Gemma 4 — ambos reemplazaron a la generación anterior Qwen2.5-VL/Gemma 3
  • Llama 3.2 Vision está actualmente roto en Ollama v0.30.0 y versiones posteriores: falla con "Error: unknown model architecture: mllama" porque el nuevo motor de Ollama basado en llama.cpp no soporta mllama
  • LLaVA 7B sigue siendo el respaldo más seguro (~7 GB de VRAM, funciona en cualquier versión de Ollama)
  • Usa Qwen3-VL para OCR, gráficos y capturas de pantalla; usa Gemma 4 cuando necesites visión y llamadas a herramientas en un solo modelo

Los principales modelos de visión en Ollama

El catálogo de visión de Ollama cambió mucho en 2026: Qwen3-VL y Gemma 4 son ahora las opciones más fuertes, y Llama 3.2 Vision ya no carga en las versiones actuales de Ollama. Cada modelo restante tiene una fortaleza y un perfil de VRAM propios.

Qwen3-VL es la familia de modelos de visión-lenguaje abierta más potente disponible en Ollama — lidera en OCR, gráficos, diagramas y comprensión de capturas de pantalla/UI, y va desde un modelo de 2B para dispositivos edge hasta una variante de 235B en mixture-of-experts. Gemma 4 integra visión nativa en cada tamaño (2B–31B) junto con llamadas a herramientas, lo que lo convierte en la mejor opción cuando un solo modelo necesita ver imágenes y llamar a herramientas. LLaVA sigue siendo el punto de partida más seguro por su amplia compatibilidad con clientes. Qwen2.5-VL, la generación anterior de Qwen, sigue funcionando y continúa siendo una opción ligera válida si ya la tienes descargada.

Todos los modelos de visión cargan un codificador de imagen junto a los pesos del LLM. Este codificador añade entre 1 y 3 GB de VRAM sobre lo que necesita el modelo base solo de texto — ten en cuenta este overhead al revisar tu presupuesto de VRAM.

Llama 3.2 Vision está actualmente roto en Ollama. Desde que Ollama v0.30.0 (mayo de 2026) pasó a cargar modelos sobre llama.cpp, llama3.2-vision falla con Error: unknown model architecture: "mllama" — la arquitectura mllama nunca se añadió a llama.cpp. Esto sigue sin resolverse en Ollama v0.33.2 (agosto de 2026). Usa Qwen3-VL o Gemma 4 en su lugar, o conserva una instalación de Ollama anterior a la v0.30.0 si necesitas específicamente Llama 3.2 Vision.

Requisitos de VRAM para visión

Cada modelo de visión necesita más VRAM que su equivalente solo de texto. Un modelo de visión de 7–8B normalmente requiere entre 7 y 9 GB de VRAM, no los ~6 GB que presupuestarías para un modelo de texto de tamaño similar.

Para OCR, gráficos y análisis de documentos, Qwen3-VL 8B es la opción potente más eficiente en VRAM. Para visión más llamadas a herramientas en un solo modelo, las variantes de 12B o 26B-A4B MoE de Gemma 4 caben en 8–14 GB. Para la guía completa sobre modelos locales multimodales y la elección según el caso de uso, consulta la guía de LLM locales multimodales.

ModeloVRAM en Q4Capacidad de imagen
LLaVA 7B~7 GBPreguntas y respuestas generales sobre imágenes, amplia compatibilidad
Qwen3-VL 8B~8 GBOCR, gráficos, capturas de pantalla, multilingüe
Gemma 4 (12B)~8 GBVisión + llamadas a herramientas
Gemma 4 (26B-A4B MoE)~14 GBVisión + llamadas a herramientas, mayor calidad
Llama 3.2 Vision 11B~10 GB⚠️ Roto en Ollama v0.30.0+ (error mllama)

Guías relacionadas

Respuestas rápidas sobre los modelos de visión de Ollama

¿Cómo envío una imagen a Ollama a través de la API?
Haz un POST al endpoint /api/chat con la imagen como cadena base64 en el array images. Cuerpo JSON mínimo funcional: {"model":"llava","messages":[{"role":"user","content":"What is in this image?","images":["<base64>"]}]} Consulta Qwen 3 en Ollama para una opción multimodal con soporte potente de llamadas a herramientas.
¿Por qué llama3.2-vision falla con "unknown model architecture: mllama"?
Ollama v0.30.0 (mayo de 2026) pasó a cargar modelos sobre llama.cpp, que nunca recibió soporte para la arquitectura mllama que usa Llama 3.2 Vision. Esto rompe llama3.2-vision en Ollama v0.30.0 y todas las versiones posteriores, incluida la v0.33.2. Todavía no hay una solución oficial: usa Qwen3-VL o Gemma 4 en su lugar, o conserva una instalación de Ollama anterior a la v0.30.0 solo para este modelo.
¿Pueden los modelos de visión hacer OCR (leer texto de imágenes)?
Sí, pero la calidad varía. Qwen3-VL es actualmente el más potente para OCR entre los modelos de visión de Ollama que funcionan — Llama 3.2 Vision era la opción anterior, pero está roto en Ollama v0.30.0 y versiones más recientes. LLaVA 7B puede leer texto impreso con claridad, pero tiene dificultades con la escritura a mano o las fuentes pequeñas.
¿Qué modelo de visión de Ollama es el mejor para gráficos y diagramas?
Qwen3-VL. Lidera en gráficos, tablas, diagramas y comprensión de capturas de pantalla, superando a LLaVA y a la generación anterior Qwen2.5-VL en los benchmarks de comprensión de documentos.
¿Los modelos de visión admiten múltiples imágenes en un solo prompt?
El soporte varía según el modelo y la versión de Ollama. LLaVA y Qwen2.5-VL procesan actualmente una imagen por turno en Ollama. Qwen3-VL y Gemma 4 admiten entradas de múltiples imágenes en configuraciones de contexto más largo — consulta el límite actual en la página de la biblioteca de Ollama de cada modelo.