Skip to main content
PromptQuorum
Início/LLMs locais avançados/Modelos de Visão do Ollama (2026): Como Realmente Rodar Modelos de Imagem Localmente
Voice, Speech & Multimodal

Modelos de Visão do Ollama (2026): Como Realmente Rodar Modelos de Imagem Localmente

·12 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O Ollama oferece suporte para rodar modelos com capacidade de visão (multimodais) localmente, desde a versão 0.1.15 em dezembro de 2023. No momento desta análise, a própria biblioteca de modelos do Ollama lista LLaVA (e suas variantes llava-llama3/llava-phi3/bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 e Mistral Small 3.1 como modelos com capacidade de visão. Baixe um com ollama pull llava, execute-o com ollama run llava "describe this image: ./photo.jpg", ou chame-o programaticamente via /api/generate ou /api/chat com uma imagem codificada em base64 em um array images. Este guia cobre os comandos reais, o formato de API documentado e onde o Ollama é — e não é — a ferramenta certa. Para uma análise dedicada ao LLaVA especificamente, veja a análise do LLaVA do PromptQuorum.

O Ollama, o executor de modelos locais construído sobre o llama.cpp, adicionou suporte multimodal (entrada de imagem) na versão 0.1.15 em dezembro de 2023, e o reconstruiu como um mecanismo multimodal dedicado em maio de 2026. Este guia é uma referência prática e focada em realmente rodar modelos com capacidade de visão pelo Ollama hoje: quais modelos estão listados atualmente em sua biblioteca, a sintaxe real de CLI e API HTTP para passar uma imagem, e orientações honestas sobre para que o Ollama não serve. Para um aprofundamento em um modelo específico, veja a análise do LLaVA do PromptQuorum; para uma comparação mais ampla entre todos os modelos de visão locais, independentemente do executor, veja o guia de modelos de visão locais.

Modelos de Visão do Ollama (2026): Como Realmente Rodar Modelos de Imagem Localmente

Principais conclusões

  • Suporte multimodal adicionado no Ollama v0.1.15 (12 de dezembro de 2023); reconstruído como um mecanismo multimodal dedicado em maio de 2026.
  • Modelos com capacidade de visão verificados atualmente listados: LLaVA (mais llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4, Mistral Small 3.1.
  • CLI: referencie o caminho do arquivo de imagem diretamente no texto do prompt de ollama run — sem flag separada.
  • API HTTP: /api/generate e /api/chat aceitam uma imagem codificada em base64 em um array images, documentado no próprio docs/api.md do Ollama.
  • O Ollama é apenas para inferência: ele executa modelos, não faz fine-tuning nem os treina.
  • Construído sobre o llama.cpp desde a origem do Ollama em meados de 2023 (repositório GitHub criado em 26 de junho de 2023, licenciado sob MIT); agora também suporta o MLX da Apple como backend alternativo em Apple Silicon.

📍 Em uma frase

O Ollama suporta rodar modelos com capacidade de visão (multimodais) localmente desde a versão 0.1.15 em dezembro de 2023, atualmente lista LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 e Mistral Small 3.1 em sua biblioteca, e suporta tanto uma CLI simples (referenciando o caminho de um arquivo de imagem no prompt) quanto uma API HTTP (imagens codificadas em base64 em um array JSON images).

💬 Em termos simples

O Ollama é a ferramenta que permite baixar e rodar modelos de IA no seu próprio computador com um único comando, e vários desses modelos também conseguem olhar para imagens e responder perguntas sobre elas — este guia mostra os comandos e chamadas de API reais para fazer isso.

📌Nota: A lista de modelos acima reflete o que o PromptQuorum confirmou ao vivo em ollama.com/library no momento desta análise. A biblioteca do Ollama muda; verifique a listagem atual de um modelo antes de depender dela — veja a seção Fontes para as URLs exatas da biblioteca verificadas.

História: Ollama, llama.cpp e Suporte Multimodal

**O repositório GitHub do Ollama foi criado em 26 de junho de 2023** e é licenciado sob MIT. Ele envolve o llama.cpp, o mecanismo de inferência em C/C++ para modelos no formato GGUF, com uma interface de linha de comando ao estilo Docker e uma API HTTP local — a proposta de valor central é que ollama run llama3 baixa e executa um modelo sem que o usuário precise gerenciar dependências, drivers de GPU ou o próprio mecanismo de inferência diretamente.

**O suporte multimodal (entrada de imagem) foi adicionado no Ollama v0.1.15, lançado em 12 de dezembro de 2023**, junto com o LLaVA como primeiro modelo de visão suportado. As notas de lançamento descrevem executar ollama run llava e depois digitar o caminho de um arquivo de imagem diretamente no prompt interativo, além de um novo parâmetro images adicionado ao endpoint HTTP /api/generate, aceitando imagens PNG ou JPEG codificadas em base64 de até 100MB.

O Ollama reconstruiu o suporte multimodal como um mecanismo multimodal dedicado por volta de maio de 2026, segundo o próprio blog do Ollama, adicionando suporte de visão de primeira classe para famílias de modelos mais novas, incluindo Llama 4, Gemma 3, Qwen2.5-VL e Mistral Small 3.1 — com tratamento por modelo de resolução de imagem, metadados posicionais e mecanismos de atenção, em vez da abordagem mais genérica usada na integração original do LLaVA. A mesma atualização trouxe offload de GPU Metal para modelos multimodais em Apple Silicon via o backend llama.cpp.

O Ollama roda principalmente no backend llama.cpp e, separadamente, suporta o framework MLX da Apple como backend alternativo em hardware Apple Silicon, que alguns modelos multimodais mais novos podem usar para melhor desempenho no Mac.

Quando o Ollama adicionou suporte a modelos de visão?

O Ollama adicionou suporte multimodal (entrada de imagem) na versão 0.1.15, lançada em 12 de dezembro de 2023, com o LLaVA como primeiro modelo de visão suportado. Ele reconstruiu isso como um mecanismo multimodal dedicado por volta de maio de 2026 para famílias de modelos mais novas, como Llama 4, Gemma 3, Qwen2.5-VL e Mistral Small 3.1.

Quais Modelos de Visão Estão Realmente na Biblioteca do Ollama

O PromptQuorum verificou cada um dos modelos a seguir ao vivo em ollama.com/library no momento desta análise — esta lista reflete o que é realmente possível baixar hoje, não um levantamento geral de modelos de visão-linguagem que podem ou não estar empacotados para o Ollama.

llava

Criador:
UW-Madison / Microsoft Research / Columbia (pesquisa)
Notas:
7B/13B/34B; veja a análise dedicada ao LLaVA do PromptQuorum

llava-llama3 / llava-phi3 / bakllava

Criador:
Variantes da comunidade
Notas:
Modelos de arquitetura LLaVA ajustados sobre diferentes LLMs base

llama3.2-vision

Criador:
Meta
Notas:
Tamanhos 11B e 90B; forte em Q&A de imagem geral

qwen2.5vl

Criador:
Alibaba (equipe Qwen)
Notas:
3B/7B/32B/72B; forte OCR e compreensão de documentos

qwen3-vl

Criador:
Alibaba (equipe Qwen)
Notas:
2B-235B; mais recente que o qwen2.5vl, até 256K de contexto, a opção de OCR/agente visual mais forte aqui

minicpm-v

Criador:
OpenBMB
Notas:
~8B, ~5,5 GB; forte OCR de documentos com baixo VRAM, suporte a múltiplas imagens

moondream

Criador:
Independente (Vikhyat K.)
Notas:
1,8B, ~1,7 GB; a menor opção desta lista, para uso leve/em edge

granite3.2-vision

Criador:
IBM
Notas:
~2,4 GB; ajustado para análise visual de documentos — tabelas, gráficos, infográficos

gemma3

Criador:
Google
Notas:
Tamanhos 4B/12B/27B são multimodais (270M e 1B são apenas texto)

llama4

Criador:
Meta
Notas:
Mixture-of-experts, nativamente multimodal; download grande (67 GB+)

mistral-small3.1

Criador:
Mistral AI
Notas:
24B, ~15 GB; licenciado sob Apache-2.0, visão mais texto

A biblioteca do Ollama muda rápido: o qwen3-vl já se juntou ao qwen2.5vl como uma opção de visão Qwen mais nova e capaz (até 256K de contexto) desde que o restante deste artigo foi redigido. Modelos sem página própria confirmada na biblioteca do Ollama no momento desta análise, embora discutidos em outros lugares como modelos de visão: qwen2-vl (substituído por qwen2.5vl) e uma entrada independente llava-next (as melhorias do LLaVA-NeXT/1.6 estão incorporadas à própria listagem llava). Sempre verifique ollama.com/library/<nome> diretamente antes de depender de um nome de modelo específico — esta tabela é um retrato do momento, não um feed ao vivo.

Baixando e Executando um Modelo de Visão: Passo a Passo

Este passo a passo usa o LLaVA como exemplo, mas os mesmos passos se aplicam a qualquer modelo da tabela acima.

  1. 1
    Instale o Ollama.
    Why it matters: Baixe o [Ollama](https://ollama.com) para macOS, Linux ou Windows. A instalação é um instalador/pacote padrão e leva menos de dois minutos.
  2. 2
    Baixe um modelo de visão.
    Why it matters: Execute `ollama pull llava` (ou `ollama pull qwen2.5vl`, `ollama pull minicpm-v`, etc.) — isso baixa os pesos do modelo, com tamanhos que vão de menos de 2 GB (Moondream) a dezenas de gigabytes (Llama 4).
  3. 3
    Execute-o com uma imagem referenciada no prompt.
    Why it matters: Execute `ollama run llava "describe this image: ./photo.jpg"`. O Ollama detecta o caminho de arquivo `.jpg`/`.png` no texto do prompt e anexa a imagem automaticamente — esse padrão funciona desde a v0.1.15 em dezembro de 2023.
  4. 4
    Ou chame a API HTTP diretamente.
    Why it matters: Envie um POST para `http://localhost:11434/api/generate` ou `/api/chat` com a imagem codificada em base64 em um array `images` — o formato JSON exato está documentado no [docs/api.md](https://github.com/ollama/ollama/blob/main/docs/api.md) do próprio Ollama, e mostrado na seção de Exemplos de Uso abaixo.
  5. 5
    (Opcional) Use as bibliotecas de cliente oficiais.
    Why it matters: As bibliotecas oficiais `ollama` para Python e JavaScript aceitam um caminho de arquivo de imagem diretamente e cuidam da codificação base64 para você, evitando codificação manual em scripts.

Exemplos Reais de Uso: CLI e API HTTP

Estes exemplos vêm diretamente da própria documentação do Ollama e de formatos de requisição/resposta verificados — não é sintaxe inventada.

  • Não existe uma flag de imagem separada na CLI. O Ollama detecta um caminho de arquivo .jpg/.png/similar dentro do próprio texto do prompt e o anexa automaticamente.
  • /api/generate usa prompt; /api/chat usa messages.** Ambos aceitam um array images de strings codificadas em base64; /api/chat suporta conversas de múltiplos turnos com imagens anexadas a mensagens individuais.
bash
# Baixar e executar via CLI — referencie o caminho da imagem diretamente no prompt
ollama pull llava
ollama run llava "describe this image: ./photo.jpg"

# --- API HTTP: /api/generate (documentado no docs/api.md do Ollama) ---
curl http://localhost:11434/api/generate -d '{
  "model": "llava",
  "prompt": "What is in this picture?",
  "stream": false,
  "images": ["<base64-encoded image data>"]
}'

# --- API HTTP: /api/chat (múltiplos turnos, também documentado no docs/api.md) ---
curl http://localhost:11434/api/chat -d '{
  "model": "llava",
  "messages": [
    { "role": "user", "content": "What is in this image?", "images": ["<base64-encoded image data>"] }
  ]
}'

# --- Python: biblioteca oficial ollama (trata a codificação base64 para você) ---
import ollama

response = ollama.chat(
    model="llava",
    messages=[{
        "role": "user",
        "content": "What is in this image?",
        "images": ["photo.jpg"],
    }],
)
print(response["message"]["content"])

# --- Python: API HTTP bruta com codificação base64 manual ---
import base64
import requests

def ask_vision_model(image_path: str, prompt: str, model: str = "llava") -> str:
    with open(image_path, "rb") as f:
        image_b64 = base64.b64encode(f.read()).decode("utf-8")
    response = requests.post(
        "http://localhost:11434/api/generate",
        json={"model": model, "prompt": prompt, "images": [image_b64], "stream": False},
    )
    return response.json()["response"]

Orientação de VRAM e Hardware

As próprias páginas da biblioteca de modelos do Ollama listam o tamanho de download de cada modelo, o que é uma boa aproximação da VRAM ou RAM que um modelo quantizado precisa para rodar — o PromptQuorum não encontrou uma tabela de VRAM autoritativa publicada separadamente pelo Ollama além desses tamanhos de download por modelo.

Modelo
Tamanho aprox.
Mínimo prático
Moondream~1,7 GB4 GB de VRAM / roda em hardware modesto
Granite 3.2 Vision~2,4 GB4-6 GB de VRAM
LLaVA 7B / MiniCPM-V~4,7-5,5 GB6-8 GB de VRAM
Llama 3.2 Vision 11B / Qwen2.5-VL 7B~6-8 GB8-10 GB de VRAM
Mistral Small 3.1~15 GB16-24 GB de VRAM
LLaVA 34B / Qwen2.5-VL 32B~20-21 GB24 GB+ de VRAM
Llama 3.2 Vision 90B / Llama 4~55-67 GB+Múltiplas GPUs ou Apple Silicon com muita memória

📌Nota: Estes são tamanhos de download aproximados, não benchmarks de VRAM medidos — o PromptQuorum não realizou seus próprios testes de hardware para este artigo. Um modelo pode rodar apenas na CPU, muito mais lentamente, se não couber na VRAM disponível; a margem de VRAM realmente utilizável também depende do tamanho do contexto e do batch.

Para que o Ollama Não Serve

O Ollama é uma forma sólida e ativamente desenvolvida de rodar modelos com capacidade de visão localmente, mas é a ferramenta errada para as seguintes situações:

  • Fazer fine-tuning ou treinar um modelo. O Ollama é apenas para inferência — ele executa pesos de modelos já treinados, não oferece um pipeline de treinamento ou fine-tuning. Se você precisa fazer fine-tuning de um modelo de visão-linguagem com seus próprios dados, precisa de outro conjunto de ferramentas (como os próprios scripts de treinamento do repositório original do LLaVA, ou um framework como o Hugging Face Transformers).
  • Capacidade multimodal proprietária de última geração. A biblioteca do Ollama é construída em torno de modelos de peso aberto. No momento desta análise, as APIs de visão em nuvem do GPT-4o, Claude e Gemini geralmente lideram em relação aos modelos locais abertos em compreensão de cenas complexas, reconhecimento de caligrafia e imagens ambíguas — o Ollama é a ferramenta certa para uso privado e autogerenciado a custo marginal zero por imagem, não para igualar o estado da arte absoluto.
  • Extração numérica precisa de gráficos e tabelas. Isso é uma limitação dos próprios modelos de visão-linguagem subjacentes, não específica do Ollama como executor — sempre verifique quaisquer números extraídos em relação aos dados de origem, independentemente do modelo ou executor usado.
  • Uma resposta unificada única para "qual modelo é o melhor". O modelo de visão certo via Ollama depende da tarefa: Qwen2.5-VL para trabalho intenso em OCR de documentos, MiniCPM-V para OCR com menos VRAM, Llama 3.2 Vision para Q&A geral de imagens, Moondream para o menor consumo. Veja a comparação de modelos de visão locais do PromptQuorum para orientação tarefa por tarefa.

Alternativas ao Ollama para Modelos de Visão

LM Studio

Melhor uso:
Executor de modelos locais focado em GUI; confirmado suporte a modelos com capacidade de visão com anexo de imagem em sua interface de chat
Licença:
Gratuito, aplicação proprietária

llama.cpp diretamente

Melhor uso:
Controle de baixo nível máximo sobre a inferência, incluindo suporte multimodal (estilo llava.cpp), sem a camada de wrapper do Ollama
Licença:
MIT

Repositório próprio do LLaVA

Melhor uso:
Controle de nível de pesquisa, scripts de treinamento/fine-tuning — veja a análise do LLaVA do PromptQuorum
Licença:
Apache-2.0 (código); depende do modelo base para os checkpoints

MLC-LLM / MLC Chat

Melhor uso:
Implantação de LLM no dispositivo em múltiplas plataformas; o PromptQuorum não encontrou suporte confirmado e oficialmente documentado a modelos de visão-linguagem (VLM) no momento desta análise — verifique o status atual antes de depender dele para tarefas de visão
Licença:
Apache-2.0

APIs de VLM em nuvem (GPT-4o, Claude, visão do Gemini)

Melhor uso:
A maior capacidade multimodal disponível, sem necessidade de hardware ou configuração local
Licença:
Proprietária (API paga)

Perguntas Frequentes

O Ollama suporta modelos de visão?

Sim. O Ollama adicionou suporte multimodal (entrada de imagem) na versão 0.1.15, lançada em 12 de dezembro de 2023, e o reconstruiu como um mecanismo multimodal dedicado por volta de maio de 2026. No momento desta análise, sua biblioteca lista LLaVA, Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3, Llama 4 e Mistral Small 3.1 como modelos com capacidade de visão.

Como passo uma imagem para um modelo no Ollama?

Pela CLI, referencie o caminho do arquivo da imagem diretamente no texto do prompt: ollama run llava "describe this image: ./photo.jpg". Não existe uma flag --image separada. Programaticamente, envie um POST para /api/generate ou /api/chat com a imagem codificada em base64 em um array images, conforme o docs/api.md do próprio Ollama.

Qual é o formato JSON exato para enviar uma imagem para a API do Ollama?

Para /api/generate: `{"model": "llava", "prompt": "...", "images": ["<base64 string>"]}. Para /api/chat: {"model": "llava", "messages": [{"role": "user", "content": "...", "images": ["<base64 string>"]}]}. Ambos estão documentados no repositório GitHub do Ollama, em docs/api.md`.

Quais modelos de visão estão atualmente disponíveis na biblioteca do Ollama?

Conforme verificado para esta análise: LLaVA (mais as variantes llava-llama3, llava-phi3, bakllava), Llama 3.2 Vision, Qwen2.5-VL, MiniCPM-V, Moondream, Granite 3.2 Vision, Gemma 3 (4B em diante), Llama 4 e Mistral Small 3.1. Verifique diretamente em ollama.com/library, já que esta lista pode mudar.

O Ollama consegue fazer fine-tuning de um modelo de visão?

Não. O Ollama é apenas para inferência — ele executa pesos de modelos já treinados, mas não oferece um pipeline de treinamento ou fine-tuning. Fazer fine-tuning exige outro conjunto de ferramentas, como os próprios scripts de treinamento do modelo original ou um framework como o Hugging Face Transformers.

O Ollama é construído sobre o llama.cpp?

Sim. O Ollama envolve o llama.cpp, o mecanismo de inferência em C/C++ para modelos no formato GGUF, com uma interface de linha de comando mais simples e uma API HTTP. O repositório GitHub do Ollama foi criado em 26 de junho de 2023. Ele também suporta o framework MLX da Apple como backend alternativo em Apple Silicon.

Como o Ollama se compara a APIs de visão em nuvem como GPT-4o ou Gemini?

O Ollama executa modelos localmente a custo marginal zero por requisição e mantém as imagens no dispositivo, mas sua biblioteca é construída em torno de modelos de peso aberto, que geralmente ficam atrás das APIs de visão em nuvem proprietárias em compreensão de cenas complexas, caligrafia e imagens ambíguas. Escolha o Ollama para privacidade, controle de custo em volume e uso offline; escolha uma API em nuvem para a maior capacidade disponível.

Veredito

O Ollama oferece um caminho genuinamente simples para rodar modelos com capacidade de visão localmente desde dezembro de 2023, e sua reconstrução do mecanismo multimodal em maio de 2026 manteve essa experiência atualizada para famílias de modelos mais novas, como Llama 4, Gemma 3, Qwen2.5-VL e Mistral Small 3.1, ao lado de opções consolidadas como o LLaVA. O fluxo de trabalho principal — ollama pull, depois ollama run com um caminho de imagem no prompt, ou os endpoints HTTP documentados /api/generate//api/chat — permanece estável desde o lançamento original da v0.1.15, o que já é, em si, um ponto a favor do Ollama para quem constrói sobre ele. Não é uma ferramenta de treinamento, e não vai igualar a capacidade multimodal proprietária em nuvem mais recente, mas para compreensão de imagens privada, autogerenciada e a custo marginal zero, continua sendo uma das portas de entrada mais práticas disponíveis. Combine este guia com a análise do LLaVA do PromptQuorum para aprofundamento em um modelo específico, ou a comparação de modelos de visão locais para escolha de modelo tarefa por tarefa em todo o cenário de modelos de visão locais.

Fontes

← Voltar para LLMs locais avançados