Conclusiones clave
- Soporte multimodal añadido en Ollama v0.1.15 (12 de diciembre de 2023); reconstruido en un motor multimodal dedicado en mayo de 2026.
- Modelos capaces de visión verificados actualmente listados: LLaVA (más llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4, Mistral Small 3.1.
- CLI: referenciar la ruta de un archivo de imagen directamente en el texto del prompt de
ollama run— sin bandera separada. - API HTTP:
/api/generatey/api/chataceptan una imagen codificada en base64 en un arregloimages, documentado en el propiodocs/api.mdde Ollama. - Ollama es solo de inferencia: ejecuta modelos, no los ajusta ni entrena.
- Construido sobre llama.cpp desde los orígenes de Ollama a mediados de 2023 (repositorio de GitHub creado el 26 de junio de 2023, con licencia MIT); ahora también admite MLX de Apple como backend alternativo en Apple Silicon.
📍 En una frase
Ollama admite la ejecución local de modelos capaces de visión (multimodales) desde la versión 0.1.15 en diciembre de 2023, actualmente lista LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 y Mistral Small 3.1 en su biblioteca, y admite tanto una CLI simple (referenciar la ruta de un archivo de imagen en el prompt) como una API HTTP (imágenes codificadas en base64 en un arreglo JSON images).
💬 En términos simples
Ollama es la herramienta que te permite descargar y ejecutar modelos de IA en tu propio ordenador con un solo comando, y varios de esos modelos también pueden mirar imágenes y responder preguntas sobre ellas — esta guía muestra los comandos reales y las llamadas de API para lograrlo.
📌Nota: La lista de modelos anterior refleja lo que PromptQuorum confirmó en vivo en ollama.com/library al momento de este análisis. La biblioteca de Ollama cambia; verifica la ficha actual de un modelo antes de depender de ella — consulta la sección Fuentes para las URL exactas de biblioteca verificadas.
Historia: Ollama, llama.cpp y el soporte multimodal
**El repositorio de GitHub de Ollama se creó el 26 de junio de 2023**, y tiene licencia MIT. Envuelve llama.cpp, el motor de inferencia en C/C++ para modelos en formato GGUF, detrás de una interfaz de línea de comandos al estilo Docker y una API HTTP local — la propuesta de valor central es que ollama run llama3 descarga y ejecuta un modelo sin que el usuario tenga que gestionar directamente dependencias, controladores de GPU o el motor de inferencia subyacente.
**El soporte multimodal (entrada de imagen) se añadió en Ollama v0.1.15, lanzada el 12 de diciembre de 2023**, junto con LLaVA como primer modelo de visión compatible. Las notas de la versión describen ejecutar ollama run llava y luego escribir directamente la ruta de un archivo de imagen en el prompt interactivo, además de un nuevo parámetro images añadido al endpoint HTTP /api/generate que acepta imágenes PNG o JPEG codificadas en base64 de hasta 100 MB.
Ollama reconstruyó el soporte multimodal en un motor multimodal dedicado alrededor de mayo de 2026, según el propio blog de Ollama, añadiendo soporte de visión de primera clase para familias de modelos más recientes, incluyendo Llama 4, Gemma 3, Qwen2.5-VL y Mistral Small 3.1 — con manejo específico por modelo de la resolución de imagen, metadatos posicionales y mecanismos de atención, en lugar del enfoque más genérico usado para la integración original de LLaVA. La misma actualización trajo descarga a GPU Metal para modelos multimodales en Apple Silicon vía el backend llama.cpp.
Ollama funciona principalmente sobre el backend llama.cpp, y por separado admite el framework MLX de Apple como backend alternativo en hardware Apple Silicon, que algunos modelos multimodales más recientes pueden usar para mejor rendimiento en Mac.
¿Cuándo añadió Ollama soporte para modelos de visión?
Ollama añadió soporte multimodal (entrada de imagen) en la versión 0.1.15, lanzada el 12 de diciembre de 2023, con LLaVA como primer modelo de visión compatible. Lo reconstruyó en un motor multimodal dedicado alrededor de mayo de 2026 para familias de modelos más recientes como Llama 4, Gemma 3, Qwen2.5-VL y Mistral Small 3.1.
Qué modelos de visión hay realmente en la biblioteca de Ollama
PromptQuorum verificó cada uno de los siguientes modelos en vivo en ollama.com/library al momento de este análisis — esta lista refleja lo que realmente se puede descargar hoy, no un panorama general de modelos visión-lenguaje que puedan o no estar empaquetados para Ollama.
llava
- Creador:
- UW-Madison / Microsoft Research / Columbia (investigación)
- Notas:
- 7B/13B/34B; consulta el análisis dedicado de LLaVA de PromptQuorum
llava-llama3 / llava-phi3 / bakllava
- Creador:
- Variantes comunitarias
- Notas:
- Modelos de arquitectura LLaVA ajustados sobre distintos LLM base
llama3.2-vision
- Creador:
- Meta
- Notas:
- Tamaños 11B y 90B; sólida Q&A de imagen general
qwen2.5vl
- Creador:
- Alibaba (equipo Qwen)
- Notas:
- 3B/7B/32B/72B; fuerte OCR y comprensión documental
qwen3-vl
- Creador:
- Alibaba (equipo Qwen)
- Notas:
- 2B-235B; más reciente que qwen2.5vl, hasta 256K de contexto, la opción OCR/agente más potente aquí
minicpm-v
- Creador:
- OpenBMB
- Notas:
- ~8B, ~5,5 GB; fuerte OCR documental con bajo VRAM, soporte multi-imagen
moondream
- Creador:
- Independiente (Vikhyat K.)
- Notas:
- 1,8B, ~1,7 GB; la opción más liviana aquí, para uso ligero/en el borde
granite3.2-vision
- Creador:
- IBM
- Notas:
- ~2,4 GB; ajustado para análisis de documentos visuales — tablas, gráficos, infografías
gemma3
- Creador:
- Notas:
- Los tamaños 4B/12B/27B son multimodales (270M y 1B son solo texto)
llama4
- Creador:
- Meta
- Notas:
- Mixture-of-experts, nativamente multimodal; descarga voluminosa (67 GB+)
mistral-small3.1
- Creador:
- Mistral AI
- Notas:
- 24B, ~15 GB; con licencia Apache-2.0, visión más texto
La biblioteca de Ollama avanza rápido: qwen3-vl ya se ha sumado a qwen2.5vl como una opción Qwen de visión más nueva y potente (hasta 256K de contexto) desde que se redactó el resto de este artículo. Modelos sin página propia confirmada en la biblioteca de Ollama al momento de este análisis, aunque se discuten en otros lugares como modelos de visión: qwen2-vl (reemplazado por qwen2.5vl) y una entrada independiente llava-next (las mejoras de LLaVA-NeXT/1.6 están integradas en la propia ficha llava). Verifica siempre directamente ollama.com/library/<nombre> antes de depender de un nombre de modelo específico — esta tabla es una instantánea, no un feed en vivo.
Descargar y ejecutar un modelo de visión: paso a paso
Esta guía usa LLaVA como ejemplo, pero los mismos pasos aplican a cualquier modelo de la tabla anterior.
- 1Instalar Ollama.
Why it matters: Descarga [Ollama](https://ollama.com) para macOS, Linux o Windows. La instalación es un instalador/paquete estándar y toma menos de dos minutos. - 2Descargar un modelo de visión.
Why it matters: Ejecuta `ollama pull llava` (o `ollama pull qwen2.5vl`, `ollama pull minicpm-v`, etc.) — esto descarga los pesos del modelo, cuyo tamaño va desde menos de 2 GB (Moondream) hasta decenas de gigabytes (Llama 4). - 3Ejecutarlo con una imagen referenciada en el prompt.
Why it matters: Ejecuta `ollama run llava "describe this image: ./photo.jpg"`. Ollama detecta la ruta de archivo `.jpg`/`.png` en el texto del prompt y adjunta la imagen automáticamente — este patrón funciona desde la v0.1.15 en diciembre de 2023. - 4O llamar directamente a la API HTTP.
Why it matters: Envía una solicitud POST a `http://localhost:11434/api/generate` o `/api/chat` con la imagen codificada en base64 en un arreglo `images` — la forma JSON exacta está documentada en el propio [docs/api.md](https://github.com/ollama/ollama/blob/main/docs/api.md) de Ollama, y se muestra en la sección Ejemplos de uso a continuación. - 5(Opcional) Usar las bibliotecas cliente oficiales.
Why it matters: Las bibliotecas oficiales de Python y JavaScript de `ollama` aceptan directamente una ruta de archivo de imagen y manejan la codificación base64 por ti, evitando la codificación manual en scripts.
Ejemplos de uso reales: CLI y API HTTP
Estos ejemplos provienen directamente de la propia documentación de Ollama y de formas de solicitud/respuesta verificadas — no de una sintaxis inventada.
- No existe una bandera de imagen separada en la CLI. Ollama detecta una ruta de archivo
.jpg/.png/similar dentro del propio texto del prompt y la adjunta automáticamente. /api/generateusaprompt;/api/chatusamessages.** Ambos aceptan un arregloimagesde cadenas codificadas en base64;/api/chatadmite conversaciones multi-turno con imágenes adjuntas a mensajes individuales.
# Descargar y ejecutar vía CLI — referenciar la ruta de la imagen directamente en el prompt
ollama pull llava
ollama run llava "describe this image: ./photo.jpg"
# --- API HTTP: /api/generate (documentada en el docs/api.md de Ollama) ---
curl http://localhost:11434/api/generate -d '{
"model": "llava",
"prompt": "What is in this picture?",
"stream": false,
"images": ["<datos de imagen codificados en base64>"]
}'
# --- API HTTP: /api/chat (multi-turno, también documentada en docs/api.md) ---
curl http://localhost:11434/api/chat -d '{
"model": "llava",
"messages": [
{ "role": "user", "content": "What is in this image?", "images": ["<datos de imagen codificados en base64>"] }
]
}'
# --- Python: biblioteca oficial ollama (maneja la codificación base64 por ti) ---
import ollama
response = ollama.chat(
model="llava",
messages=[{
"role": "user",
"content": "What is in this image?",
"images": ["photo.jpg"],
}],
)
print(response["message"]["content"])
# --- Python: API HTTP en bruto con codificación base64 manual ---
import base64
import requests
def ask_vision_model(image_path: str, prompt: str, model: str = "llava") -> str:
with open(image_path, "rb") as f:
image_b64 = base64.b64encode(f.read()).decode("utf-8")
response = requests.post(
"http://localhost:11434/api/generate",
json={"model": model, "prompt": prompt, "images": [image_b64], "stream": False},
)
return response.json()["response"]Orientación sobre VRAM y hardware
Las propias páginas de biblioteca de modelos de Ollama listan el tamaño de descarga de cada modelo, lo cual es una aproximación razonable de la VRAM o RAM que necesita ejecutar un modelo cuantizado — PromptQuorum no encontró una tabla de VRAM autoritativa publicada por separado por Ollama más allá de estos tamaños de descarga por modelo.
Modelo | Tamaño aprox. | Mínimo práctico |
|---|---|---|
| Moondream | ~1,7 GB | 4 GB de VRAM / funciona en hardware modesto |
| Granite 3.2 Vision | ~2,4 GB | 4-6 GB de VRAM |
| LLaVA 7B / MiniCPM-V | ~4,7-5,5 GB | 6-8 GB de VRAM |
| Llama 3.2 Vision 11B / Qwen2.5-VL 7B | ~6-8 GB | 8-10 GB de VRAM |
| Mistral Small 3.1 | ~15 GB | 16-24 GB de VRAM |
| LLaVA 34B / Qwen2.5-VL 32B | ~20-21 GB | 24 GB+ de VRAM |
| Llama 3.2 Vision 90B / Llama 4 | ~55-67 GB+ | Multi-GPU o Apple Silicon con mucha memoria |
📌Nota: Estos son tamaños de descarga aproximados, no benchmarks de VRAM medidos — PromptQuorum no realizó sus propias pruebas de hardware para este artículo. Un modelo puede ejecutarse solo en CPU a una velocidad mucho más lenta si no cabe en la VRAM disponible; el margen de VRAM realmente utilizable también depende de la longitud de contexto y el tamaño del lote.
Para qué no es bueno Ollama
Ollama es una forma sólida y activamente desarrollada de ejecutar modelos capaces de visión en local, pero es la herramienta equivocada para las siguientes situaciones:
- Ajustar o entrenar un modelo. Ollama es solo de inferencia — ejecuta pesos de modelo preentrenados, no proporciona un pipeline de entrenamiento o ajuste fino. Si necesitas ajustar un modelo visión-lenguaje con tus propios datos, necesitas otra cadena de herramientas (como los propios scripts de entrenamiento del repositorio original de LLaVA, o un framework como Hugging Face Transformers).
- La más reciente capacidad multimodal propietaria. La biblioteca de Ollama está construida en torno a modelos de pesos abiertos. Al momento de este análisis, las API de visión en la nube de GPT-4o, Claude y Gemini generalmente superan a los modelos locales abiertos en comprensión de escenas complejas, reconocimiento de escritura manuscrita e imágenes ambiguas — Ollama es la herramienta adecuada para uso privado y autoalojado a costo marginal cero por imagen, no para igualar el estado del arte absoluto.
- Extracción numérica precisa de gráficos y diagramas. Esta es una limitación de los propios modelos visión-lenguaje subyacentes, no específica de Ollama como ejecutor — verifica cualquier número extraído contra los datos de origen, sin importar qué modelo o ejecutor uses.
- Una única respuesta unificada a "qué modelo es el mejor". El modelo de visión adecuado vía Ollama depende de la tarea: Qwen2.5-VL para trabajo documental con mucho OCR, MiniCPM-V para OCR con menor VRAM, Llama 3.2 Vision para Q&A de imagen general, Moondream para la huella más ligera. Consulta la comparación de modelos de visión locales de PromptQuorum para orientación tarea por tarea.
Alternativas a Ollama para modelos de visión
LM Studio
- Mejor para:
- Ejecutor de modelos locales centrado en GUI; confirmado que admite modelos capaces de visión con adjunto de imagen en su interfaz de chat
- Licencia:
- Gratuito, aplicación propietaria
llama.cpp directamente
- Mejor para:
- Máximo control de bajo nivel sobre la inferencia, incluido soporte multimodal (estilo llava.cpp), sin la capa envolvente de Ollama
- Licencia:
- MIT
El propio repositorio de LLaVA
- Mejor para:
- Control de nivel de investigación, scripts de entrenamiento/ajuste fino — consulta el análisis de LLaVA de PromptQuorum
- Licencia:
- Apache-2.0 (código); dependiente del modelo base para los checkpoints
MLC-LLM / MLC Chat
- Mejor para:
- Despliegue de LLM en el dispositivo en varias plataformas; PromptQuorum no encontró soporte confirmado y oficialmente documentado de modelos visión-lenguaje (VLM) al momento de este análisis — verifica el estado actual antes de depender de él para tareas de visión
- Licencia:
- Apache-2.0
APIs VLM en la nube (GPT-4o, Claude, Gemini Vision)
- Mejor para:
- La mayor capacidad multimodal disponible, sin necesidad de hardware local ni configuración
- Licencia:
- Propietaria (API de pago)
Preguntas frecuentes
¿Ollama admite modelos de visión?
Sí. Ollama añadió soporte multimodal (entrada de imagen) en la versión 0.1.15, lanzada el 12 de diciembre de 2023, y lo reconstruyó en un motor multimodal dedicado alrededor de mayo de 2026. Al momento de este análisis, su biblioteca lista LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 y Mistral Small 3.1 como modelos capaces de visión.
¿Cómo paso una imagen a un modelo en Ollama?
Desde la CLI, referencia la ruta del archivo de imagen directamente en el texto del prompt: ollama run llava "describe this image: ./photo.jpg". No existe una bandera --image separada. Mediante programación, envía una solicitud POST a /api/generate o /api/chat con la imagen codificada en base64 en un arreglo images, según el propio docs/api.md de Ollama.
¿Cuál es el formato JSON exacto para enviar una imagen a la API de Ollama?
Para /api/generate: `{"model": "llava", "prompt": "...", "images": ["<cadena base64>"]}. Para /api/chat: {"model": "llava", "messages": [{"role": "user", "content": "...", "images": ["<cadena base64>"]}]}. Ambos están documentados en el repositorio de GitHub de Ollama bajo docs/api.md`.
¿Qué modelos de visión están actualmente disponibles en la biblioteca de Ollama?
Verificados para este análisis: LLaVA (más las variantes llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3 (4B y superiores), Llama 4 y Mistral Small 3.1. Verifica directamente ollama.com/library, ya que esta lista puede cambiar.
¿Puede Ollama ajustar un modelo de visión?
No. Ollama es solo de inferencia — ejecuta pesos de modelo preentrenados pero no proporciona un pipeline de entrenamiento o ajuste fino. El ajuste fino requiere otra cadena de herramientas, como los propios scripts de entrenamiento del modelo original o un framework como Hugging Face Transformers.
¿Está Ollama construido sobre llama.cpp?
Sí. Ollama envuelve llama.cpp, el motor de inferencia en C/C++ para modelos en formato GGUF, detrás de una interfaz de línea de comandos y API HTTP más simples. El repositorio de GitHub de Ollama se creó el 26 de junio de 2023. También admite el framework MLX de Apple como backend alternativo en Apple Silicon.
¿Cómo se compara Ollama con las API de visión en la nube como GPT-4o o Gemini?
Ollama ejecuta modelos localmente a costo marginal cero por solicitud y mantiene las imágenes en el dispositivo, pero su biblioteca está construida en torno a modelos de pesos abiertos, que generalmente van por detrás de las API de visión en la nube propietarias en comprensión de escenas complejas, escritura manuscrita e imágenes ambiguas. Elige Ollama para privacidad, control de costos a volumen y uso sin conexión; elige una API en la nube para la mayor capacidad disponible.
Veredicto
Ollama ha ofrecido un camino genuinamente simple para ejecutar modelos capaces de visión en local desde diciembre de 2023, y la reconstrucción de su motor multimodal en mayo de 2026 mantuvo esa experiencia actualizada para familias de modelos más recientes como Llama 4, Gemma 3, Qwen2.5-VL y Mistral Small 3.1, junto a opciones consolidadas como LLaVA. El flujo de trabajo central —ollama pull, luego ollama run con una ruta de imagen en el prompt, o los endpoints HTTP documentados /api/generate//api/chat— se ha mantenido estable desde el lanzamiento original v0.1.15, lo cual es en sí mismo un punto a favor de Ollama para quien construya sobre él. No es una herramienta de entrenamiento, y no igualará la más reciente capacidad multimodal propietaria en la nube, pero para la comprensión de imágenes privada, autoalojada y de costo marginal cero, sigue siendo uno de los puntos de entrada más prácticos disponibles. Combina esta guía con el análisis de LLaVA de PromptQuorum para profundizar en un modelo específico, o la comparación de modelos de visión locales para una selección de modelo tarea por tarea en todo el panorama de modelos de visión locales.
Fuentes
- Ollama en GitHub — fecha de creación del repositorio, licencia e historial de versiones.
- Notas de la versión v0.1.15 de Ollama — el anuncio original del soporte multimodal/LLaVA, 12 de diciembre de 2023.
- El nuevo motor de Ollama para modelos multimodales — la reconstrucción del motor multimodal de mayo de 2026, que cubre Llama 4, Gemma 3, Qwen2.5-VL y Mistral Small 3.1.
- Documentación de la API de Ollama — la forma documentada de solicitudes/respuestas de
/api/generatey/api/chatpara imágenes. - Biblioteca de modelos de Ollama — la biblioteca en vivo usada para verificar cada modelo listado en este artículo, incluidas páginas individuales para llava, llama3.2-vision, qwen2.5vl, minicpm-v, moondream, granite3.2-vision, gemma3, llama4 y mistral-small3.1.
