Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Modelos de visión de Ollama (2026): cómo ejecutar realmente modelos de imagen en local
Voice, Speech & Multimodal

Modelos de visión de Ollama (2026): cómo ejecutar realmente modelos de imagen en local

·12 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Ollama admite la ejecución local de modelos capaces de visión (multimodales), y lo hace desde la versión 0.1.15 en diciembre de 2023. Al momento de este análisis, la propia biblioteca de modelos de Ollama lista LLaVA (y sus variantes llava-llama3/llava-phi3/bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 y Mistral Small 3.1 como capaces de visión. Descarga uno con ollama pull llava, ejecútalo con ollama run llava "describe this image: ./photo.jpg", o llámalo mediante programación vía /api/generate o /api/chat con una imagen codificada en base64 en un arreglo images. Esta guía cubre los comandos reales, la forma de API documentada, y dónde Ollama es y no es la herramienta adecuada — para un análisis dedicado a LLaVA específicamente, consulta el análisis de LLaVA de PromptQuorum.

Ollama, el ejecutor de modelos locales construido sobre llama.cpp, añadió soporte multimodal (entrada de imagen) ya en la versión 0.1.15 en diciembre de 2023, y lo reconstruyó en un motor multimodal dedicado en mayo de 2026. Esta guía es una referencia práctica y enfocada para ejecutar realmente modelos capaces de visión a través de Ollama hoy: qué modelos figuran actualmente en su biblioteca, la sintaxis real de CLI y API HTTP para pasar una imagen, y orientación honesta sobre para qué no es bueno Ollama. Para un análisis profundo de un modelo específico, consulta el análisis de LLaVA de PromptQuorum; para una comparación más amplia entre todos los modelos de visión locales sin importar el ejecutor, consulta la guía de modelos de visión locales.

Modelos de visión de Ollama (2026): cómo ejecutar realmente modelos de imagen en local

Conclusiones clave

  • Soporte multimodal añadido en Ollama v0.1.15 (12 de diciembre de 2023); reconstruido en un motor multimodal dedicado en mayo de 2026.
  • Modelos capaces de visión verificados actualmente listados: LLaVA (más llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4, Mistral Small 3.1.
  • CLI: referenciar la ruta de un archivo de imagen directamente en el texto del prompt de ollama run — sin bandera separada.
  • API HTTP: /api/generate y /api/chat aceptan una imagen codificada en base64 en un arreglo images, documentado en el propio docs/api.md de Ollama.
  • Ollama es solo de inferencia: ejecuta modelos, no los ajusta ni entrena.
  • Construido sobre llama.cpp desde los orígenes de Ollama a mediados de 2023 (repositorio de GitHub creado el 26 de junio de 2023, con licencia MIT); ahora también admite MLX de Apple como backend alternativo en Apple Silicon.

📍 En una frase

Ollama admite la ejecución local de modelos capaces de visión (multimodales) desde la versión 0.1.15 en diciembre de 2023, actualmente lista LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 y Mistral Small 3.1 en su biblioteca, y admite tanto una CLI simple (referenciar la ruta de un archivo de imagen en el prompt) como una API HTTP (imágenes codificadas en base64 en un arreglo JSON images).

💬 En términos simples

Ollama es la herramienta que te permite descargar y ejecutar modelos de IA en tu propio ordenador con un solo comando, y varios de esos modelos también pueden mirar imágenes y responder preguntas sobre ellas — esta guía muestra los comandos reales y las llamadas de API para lograrlo.

📌Nota: La lista de modelos anterior refleja lo que PromptQuorum confirmó en vivo en ollama.com/library al momento de este análisis. La biblioteca de Ollama cambia; verifica la ficha actual de un modelo antes de depender de ella — consulta la sección Fuentes para las URL exactas de biblioteca verificadas.

Historia: Ollama, llama.cpp y el soporte multimodal

**El repositorio de GitHub de Ollama se creó el 26 de junio de 2023**, y tiene licencia MIT. Envuelve llama.cpp, el motor de inferencia en C/C++ para modelos en formato GGUF, detrás de una interfaz de línea de comandos al estilo Docker y una API HTTP local — la propuesta de valor central es que ollama run llama3 descarga y ejecuta un modelo sin que el usuario tenga que gestionar directamente dependencias, controladores de GPU o el motor de inferencia subyacente.

**El soporte multimodal (entrada de imagen) se añadió en Ollama v0.1.15, lanzada el 12 de diciembre de 2023**, junto con LLaVA como primer modelo de visión compatible. Las notas de la versión describen ejecutar ollama run llava y luego escribir directamente la ruta de un archivo de imagen en el prompt interactivo, además de un nuevo parámetro images añadido al endpoint HTTP /api/generate que acepta imágenes PNG o JPEG codificadas en base64 de hasta 100 MB.

Ollama reconstruyó el soporte multimodal en un motor multimodal dedicado alrededor de mayo de 2026, según el propio blog de Ollama, añadiendo soporte de visión de primera clase para familias de modelos más recientes, incluyendo Llama 4, Gemma 3, Qwen2.5-VL y Mistral Small 3.1 — con manejo específico por modelo de la resolución de imagen, metadatos posicionales y mecanismos de atención, en lugar del enfoque más genérico usado para la integración original de LLaVA. La misma actualización trajo descarga a GPU Metal para modelos multimodales en Apple Silicon vía el backend llama.cpp.

Ollama funciona principalmente sobre el backend llama.cpp, y por separado admite el framework MLX de Apple como backend alternativo en hardware Apple Silicon, que algunos modelos multimodales más recientes pueden usar para mejor rendimiento en Mac.

¿Cuándo añadió Ollama soporte para modelos de visión?

Ollama añadió soporte multimodal (entrada de imagen) en la versión 0.1.15, lanzada el 12 de diciembre de 2023, con LLaVA como primer modelo de visión compatible. Lo reconstruyó en un motor multimodal dedicado alrededor de mayo de 2026 para familias de modelos más recientes como Llama 4, Gemma 3, Qwen2.5-VL y Mistral Small 3.1.

Qué modelos de visión hay realmente en la biblioteca de Ollama

PromptQuorum verificó cada uno de los siguientes modelos en vivo en ollama.com/library al momento de este análisis — esta lista refleja lo que realmente se puede descargar hoy, no un panorama general de modelos visión-lenguaje que puedan o no estar empaquetados para Ollama.

llava

Creador:
UW-Madison / Microsoft Research / Columbia (investigación)
Notas:
7B/13B/34B; consulta el análisis dedicado de LLaVA de PromptQuorum

llava-llama3 / llava-phi3 / bakllava

Creador:
Variantes comunitarias
Notas:
Modelos de arquitectura LLaVA ajustados sobre distintos LLM base

llama3.2-vision

Creador:
Meta
Notas:
Tamaños 11B y 90B; sólida Q&A de imagen general

qwen2.5vl

Creador:
Alibaba (equipo Qwen)
Notas:
3B/7B/32B/72B; fuerte OCR y comprensión documental

qwen3-vl

Creador:
Alibaba (equipo Qwen)
Notas:
2B-235B; más reciente que qwen2.5vl, hasta 256K de contexto, la opción OCR/agente más potente aquí

minicpm-v

Creador:
OpenBMB
Notas:
~8B, ~5,5 GB; fuerte OCR documental con bajo VRAM, soporte multi-imagen

moondream

Creador:
Independiente (Vikhyat K.)
Notas:
1,8B, ~1,7 GB; la opción más liviana aquí, para uso ligero/en el borde

granite3.2-vision

Creador:
IBM
Notas:
~2,4 GB; ajustado para análisis de documentos visuales — tablas, gráficos, infografías

gemma3

Creador:
Google
Notas:
Los tamaños 4B/12B/27B son multimodales (270M y 1B son solo texto)

llama4

Creador:
Meta
Notas:
Mixture-of-experts, nativamente multimodal; descarga voluminosa (67 GB+)

mistral-small3.1

Creador:
Mistral AI
Notas:
24B, ~15 GB; con licencia Apache-2.0, visión más texto

La biblioteca de Ollama avanza rápido: qwen3-vl ya se ha sumado a qwen2.5vl como una opción Qwen de visión más nueva y potente (hasta 256K de contexto) desde que se redactó el resto de este artículo. Modelos sin página propia confirmada en la biblioteca de Ollama al momento de este análisis, aunque se discuten en otros lugares como modelos de visión: qwen2-vl (reemplazado por qwen2.5vl) y una entrada independiente llava-next (las mejoras de LLaVA-NeXT/1.6 están integradas en la propia ficha llava). Verifica siempre directamente ollama.com/library/<nombre> antes de depender de un nombre de modelo específico — esta tabla es una instantánea, no un feed en vivo.

Descargar y ejecutar un modelo de visión: paso a paso

Esta guía usa LLaVA como ejemplo, pero los mismos pasos aplican a cualquier modelo de la tabla anterior.

  1. 1
    Instalar Ollama.
    Why it matters: Descarga [Ollama](https://ollama.com) para macOS, Linux o Windows. La instalación es un instalador/paquete estándar y toma menos de dos minutos.
  2. 2
    Descargar un modelo de visión.
    Why it matters: Ejecuta `ollama pull llava` (o `ollama pull qwen2.5vl`, `ollama pull minicpm-v`, etc.) — esto descarga los pesos del modelo, cuyo tamaño va desde menos de 2 GB (Moondream) hasta decenas de gigabytes (Llama 4).
  3. 3
    Ejecutarlo con una imagen referenciada en el prompt.
    Why it matters: Ejecuta `ollama run llava "describe this image: ./photo.jpg"`. Ollama detecta la ruta de archivo `.jpg`/`.png` en el texto del prompt y adjunta la imagen automáticamente — este patrón funciona desde la v0.1.15 en diciembre de 2023.
  4. 4
    O llamar directamente a la API HTTP.
    Why it matters: Envía una solicitud POST a `http://localhost:11434/api/generate` o `/api/chat` con la imagen codificada en base64 en un arreglo `images` — la forma JSON exacta está documentada en el propio [docs/api.md](https://github.com/ollama/ollama/blob/main/docs/api.md) de Ollama, y se muestra en la sección Ejemplos de uso a continuación.
  5. 5
    (Opcional) Usar las bibliotecas cliente oficiales.
    Why it matters: Las bibliotecas oficiales de Python y JavaScript de `ollama` aceptan directamente una ruta de archivo de imagen y manejan la codificación base64 por ti, evitando la codificación manual en scripts.

Ejemplos de uso reales: CLI y API HTTP

Estos ejemplos provienen directamente de la propia documentación de Ollama y de formas de solicitud/respuesta verificadas — no de una sintaxis inventada.

  • No existe una bandera de imagen separada en la CLI. Ollama detecta una ruta de archivo .jpg/.png/similar dentro del propio texto del prompt y la adjunta automáticamente.
  • /api/generate usa prompt; /api/chat usa messages.** Ambos aceptan un arreglo images de cadenas codificadas en base64; /api/chat admite conversaciones multi-turno con imágenes adjuntas a mensajes individuales.
bash
# Descargar y ejecutar vía CLI — referenciar la ruta de la imagen directamente en el prompt
ollama pull llava
ollama run llava "describe this image: ./photo.jpg"

# --- API HTTP: /api/generate (documentada en el docs/api.md de Ollama) ---
curl http://localhost:11434/api/generate -d '{
  "model": "llava",
  "prompt": "What is in this picture?",
  "stream": false,
  "images": ["<datos de imagen codificados en base64>"]
}'

# --- API HTTP: /api/chat (multi-turno, también documentada en docs/api.md) ---
curl http://localhost:11434/api/chat -d '{
  "model": "llava",
  "messages": [
    { "role": "user", "content": "What is in this image?", "images": ["<datos de imagen codificados en base64>"] }
  ]
}'

# --- Python: biblioteca oficial ollama (maneja la codificación base64 por ti) ---
import ollama

response = ollama.chat(
    model="llava",
    messages=[{
        "role": "user",
        "content": "What is in this image?",
        "images": ["photo.jpg"],
    }],
)
print(response["message"]["content"])

# --- Python: API HTTP en bruto con codificación base64 manual ---
import base64
import requests

def ask_vision_model(image_path: str, prompt: str, model: str = "llava") -> str:
    with open(image_path, "rb") as f:
        image_b64 = base64.b64encode(f.read()).decode("utf-8")
    response = requests.post(
        "http://localhost:11434/api/generate",
        json={"model": model, "prompt": prompt, "images": [image_b64], "stream": False},
    )
    return response.json()["response"]

Orientación sobre VRAM y hardware

Las propias páginas de biblioteca de modelos de Ollama listan el tamaño de descarga de cada modelo, lo cual es una aproximación razonable de la VRAM o RAM que necesita ejecutar un modelo cuantizado — PromptQuorum no encontró una tabla de VRAM autoritativa publicada por separado por Ollama más allá de estos tamaños de descarga por modelo.

Modelo
Tamaño aprox.
Mínimo práctico
Moondream~1,7 GB4 GB de VRAM / funciona en hardware modesto
Granite 3.2 Vision~2,4 GB4-6 GB de VRAM
LLaVA 7B / MiniCPM-V~4,7-5,5 GB6-8 GB de VRAM
Llama 3.2 Vision 11B / Qwen2.5-VL 7B~6-8 GB8-10 GB de VRAM
Mistral Small 3.1~15 GB16-24 GB de VRAM
LLaVA 34B / Qwen2.5-VL 32B~20-21 GB24 GB+ de VRAM
Llama 3.2 Vision 90B / Llama 4~55-67 GB+Multi-GPU o Apple Silicon con mucha memoria

📌Nota: Estos son tamaños de descarga aproximados, no benchmarks de VRAM medidos — PromptQuorum no realizó sus propias pruebas de hardware para este artículo. Un modelo puede ejecutarse solo en CPU a una velocidad mucho más lenta si no cabe en la VRAM disponible; el margen de VRAM realmente utilizable también depende de la longitud de contexto y el tamaño del lote.

Para qué no es bueno Ollama

Ollama es una forma sólida y activamente desarrollada de ejecutar modelos capaces de visión en local, pero es la herramienta equivocada para las siguientes situaciones:

  • Ajustar o entrenar un modelo. Ollama es solo de inferencia — ejecuta pesos de modelo preentrenados, no proporciona un pipeline de entrenamiento o ajuste fino. Si necesitas ajustar un modelo visión-lenguaje con tus propios datos, necesitas otra cadena de herramientas (como los propios scripts de entrenamiento del repositorio original de LLaVA, o un framework como Hugging Face Transformers).
  • La más reciente capacidad multimodal propietaria. La biblioteca de Ollama está construida en torno a modelos de pesos abiertos. Al momento de este análisis, las API de visión en la nube de GPT-4o, Claude y Gemini generalmente superan a los modelos locales abiertos en comprensión de escenas complejas, reconocimiento de escritura manuscrita e imágenes ambiguas — Ollama es la herramienta adecuada para uso privado y autoalojado a costo marginal cero por imagen, no para igualar el estado del arte absoluto.
  • Extracción numérica precisa de gráficos y diagramas. Esta es una limitación de los propios modelos visión-lenguaje subyacentes, no específica de Ollama como ejecutor — verifica cualquier número extraído contra los datos de origen, sin importar qué modelo o ejecutor uses.
  • Una única respuesta unificada a "qué modelo es el mejor". El modelo de visión adecuado vía Ollama depende de la tarea: Qwen2.5-VL para trabajo documental con mucho OCR, MiniCPM-V para OCR con menor VRAM, Llama 3.2 Vision para Q&A de imagen general, Moondream para la huella más ligera. Consulta la comparación de modelos de visión locales de PromptQuorum para orientación tarea por tarea.

Alternativas a Ollama para modelos de visión

LM Studio

Mejor para:
Ejecutor de modelos locales centrado en GUI; confirmado que admite modelos capaces de visión con adjunto de imagen en su interfaz de chat
Licencia:
Gratuito, aplicación propietaria

llama.cpp directamente

Mejor para:
Máximo control de bajo nivel sobre la inferencia, incluido soporte multimodal (estilo llava.cpp), sin la capa envolvente de Ollama
Licencia:
MIT

El propio repositorio de LLaVA

Mejor para:
Control de nivel de investigación, scripts de entrenamiento/ajuste fino — consulta el análisis de LLaVA de PromptQuorum
Licencia:
Apache-2.0 (código); dependiente del modelo base para los checkpoints

MLC-LLM / MLC Chat

Mejor para:
Despliegue de LLM en el dispositivo en varias plataformas; PromptQuorum no encontró soporte confirmado y oficialmente documentado de modelos visión-lenguaje (VLM) al momento de este análisis — verifica el estado actual antes de depender de él para tareas de visión
Licencia:
Apache-2.0

APIs VLM en la nube (GPT-4o, Claude, Gemini Vision)

Mejor para:
La mayor capacidad multimodal disponible, sin necesidad de hardware local ni configuración
Licencia:
Propietaria (API de pago)

Preguntas frecuentes

¿Ollama admite modelos de visión?

Sí. Ollama añadió soporte multimodal (entrada de imagen) en la versión 0.1.15, lanzada el 12 de diciembre de 2023, y lo reconstruyó en un motor multimodal dedicado alrededor de mayo de 2026. Al momento de este análisis, su biblioteca lista LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 y Mistral Small 3.1 como modelos capaces de visión.

¿Cómo paso una imagen a un modelo en Ollama?

Desde la CLI, referencia la ruta del archivo de imagen directamente en el texto del prompt: ollama run llava "describe this image: ./photo.jpg". No existe una bandera --image separada. Mediante programación, envía una solicitud POST a /api/generate o /api/chat con la imagen codificada en base64 en un arreglo images, según el propio docs/api.md de Ollama.

¿Cuál es el formato JSON exacto para enviar una imagen a la API de Ollama?

Para /api/generate: `{"model": "llava", "prompt": "...", "images": ["<cadena base64>"]}. Para /api/chat: {"model": "llava", "messages": [{"role": "user", "content": "...", "images": ["<cadena base64>"]}]}. Ambos están documentados en el repositorio de GitHub de Ollama bajo docs/api.md`.

¿Qué modelos de visión están actualmente disponibles en la biblioteca de Ollama?

Verificados para este análisis: LLaVA (más las variantes llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3 (4B y superiores), Llama 4 y Mistral Small 3.1. Verifica directamente ollama.com/library, ya que esta lista puede cambiar.

¿Puede Ollama ajustar un modelo de visión?

No. Ollama es solo de inferencia — ejecuta pesos de modelo preentrenados pero no proporciona un pipeline de entrenamiento o ajuste fino. El ajuste fino requiere otra cadena de herramientas, como los propios scripts de entrenamiento del modelo original o un framework como Hugging Face Transformers.

¿Está Ollama construido sobre llama.cpp?

Sí. Ollama envuelve llama.cpp, el motor de inferencia en C/C++ para modelos en formato GGUF, detrás de una interfaz de línea de comandos y API HTTP más simples. El repositorio de GitHub de Ollama se creó el 26 de junio de 2023. También admite el framework MLX de Apple como backend alternativo en Apple Silicon.

¿Cómo se compara Ollama con las API de visión en la nube como GPT-4o o Gemini?

Ollama ejecuta modelos localmente a costo marginal cero por solicitud y mantiene las imágenes en el dispositivo, pero su biblioteca está construida en torno a modelos de pesos abiertos, que generalmente van por detrás de las API de visión en la nube propietarias en comprensión de escenas complejas, escritura manuscrita e imágenes ambiguas. Elige Ollama para privacidad, control de costos a volumen y uso sin conexión; elige una API en la nube para la mayor capacidad disponible.

Veredicto

Ollama ha ofrecido un camino genuinamente simple para ejecutar modelos capaces de visión en local desde diciembre de 2023, y la reconstrucción de su motor multimodal en mayo de 2026 mantuvo esa experiencia actualizada para familias de modelos más recientes como Llama 4, Gemma 3, Qwen2.5-VL y Mistral Small 3.1, junto a opciones consolidadas como LLaVA. El flujo de trabajo central —ollama pull, luego ollama run con una ruta de imagen en el prompt, o los endpoints HTTP documentados /api/generate//api/chat— se ha mantenido estable desde el lanzamiento original v0.1.15, lo cual es en sí mismo un punto a favor de Ollama para quien construya sobre él. No es una herramienta de entrenamiento, y no igualará la más reciente capacidad multimodal propietaria en la nube, pero para la comprensión de imágenes privada, autoalojada y de costo marginal cero, sigue siendo uno de los puntos de entrada más prácticos disponibles. Combina esta guía con el análisis de LLaVA de PromptQuorum para profundizar en un modelo específico, o la comparación de modelos de visión locales para una selección de modelo tarea por tarea en todo el panorama de modelos de visión locales.

Fuentes

← Volver a LLM locales avanzados