Principais conclusões
- Modelo visão-linguagem que combina um codificador visual CLIP com um decodificador de texto Vicuna (baseado no Llama 2).
- Licença do código: Apache-2.0. Os checkpoints pré-treinados herdam a licença comunitária do Llama 2 através de sua base Vicuna.
- Executa via
ollama pull llavaem três tamanhos: 7B, 13B e 34B. - Sem commits no repositório oficial do GitHub desde 11 de maio de 2024; mais de 25.000 estrelas, não arquivado.
- Estabeleceu o padrão arquitetônico usado pela maioria dos modelos visão-linguagem locais posteriores.
- Modelos mais recentes (Qwen2.5-VL, Llama 3.2 Vision, MiniCPM-V) agora o superam em OCR, gráficos e documentos multilíngues.
📍 Em uma frase
O LLaVA é o modelo visão-linguagem de código aberto da UW-Madison, Microsoft Research e Universidade Columbia que estabeleceu a arquitetura codificador-visual-mais-LLM que a maioria da IA multimodal local ainda usa, licenciado sob Apache-2.0 para o código com condições de licença derivadas do Llama 2 para os checkpoints pré-treinados, agora executável com um único comando via Ollama.
💬 Em termos simples
É um modelo de IA gratuito que consegue olhar para uma imagem e responder perguntas sobre ela — o projeto de pesquisa que provou que isso podia funcionar bem e de forma barata, hoje mais facilmente executado digitando ollama run llava e apontando para um arquivo de imagem.
📌Nota: A página original do projeto LLaVA declara que seus dados, código e checkpoint são "destinados e licenciados apenas para uso de pesquisa", uma declaração anterior e mais rígida do que a licença Apache-2.0 aplicada depois ao código do repositório GitHub. Leia tanto o arquivo LICENSE do GitHub quanto a página do projeto antes do uso comercial — veja a seção Licença e custo abaixo.
História: de um artigo de pesquisa a um padrão de IA local
O LLaVA foi criado por Haotian Liu, Chunyuan Li, Qingyang Wu e Yong Jae Lee, pesquisadores afiliados à Universidade de Wisconsin-Madison, Microsoft Research e Universidade Columbia, e apresentado no artigo de 2023 "Visual Instruction Tuning", aceito como apresentação oral na NeurIPS 2023.
A ideia central do artigo foi gerar dados de treinamento multimodais de seguimento de instruções usando o GPT-4, e então usar esses dados para ensinar um codificador visual e um modelo de linguagem de código aberto a seguir instruções visuais — descrever imagens, responder perguntas sobre elas e raciocinar sobre conteúdo visual em formato conversacional, a uma fração do custo de treinamento de construir um modelo multimodal proprietário do zero.
O LLaVA-1.5, lançado em outubro de 2023, alcançou resultados de estado da arte em 11 benchmarks com apenas modificações simples na arquitetura original — principalmente um conector visão-linguagem de maior capacidade e dados de treinamento orientados a tarefas acadêmicas — enquanto treinava em cerca de um dia em 8 GPUs A100, segundo a própria página do projeto.
O LLaVA-NeXT (também chamado LLaVA-1.6), lançado em janeiro de 2024, adicionou suporte para entrada de imagem em maior resolução via patching dinâmico (até 672×672, ou 336×1344 para imagens largas/altas), junto com OCR e raciocínio visual melhorados, e suporte para LLMs base adicionais além do Vicuna.
**O repositório público haotian-liu/LLaVA no GitHub acumulou mais de 25.000 estrelas**, e não está marcado como arquivado — mas a PromptQuorum não encontrou commits em sua branch principal desde 11 de maio de 2024, com base no histórico público de commits do próprio projeto. Isso é consistente com um lançamento de pesquisa universitária que cumpriu seu objetivo (estabelecer e popularizar a arquitetura) em vez de um produto comercial em desenvolvimento contínuo.
Quem criou o LLaVA?
O LLaVA foi criado por Haotian Liu, Chunyuan Li, Qingyang Wu e Yong Jae Lee, pesquisadores afiliados à Universidade de Wisconsin-Madison, Microsoft Research e Universidade Columbia, e apresentado no artigo de 2023 "Visual Instruction Tuning", uma apresentação oral na NeurIPS 2023.
O que o LLaVA realmente faz
O LLaVA conecta um codificador visual a um grande modelo de linguagem para que o sistema combinado possa aceitar uma imagem e um prompt de texto juntos, e então gerar uma resposta em linguagem natural sobre a imagem — respondendo perguntas, descrevendo cenas, lendo texto visível e raciocinando sobre conteúdo visual de forma conversacional.
- Codificador CLIP mais decodificador LLM. O LLaVA usa um codificador visual CLIP ViT-L/14 para converter uma imagem em uma sequência de características visuais, projeta essas características no mesmo espaço de embeddings dos tokens de texto do modelo de linguagem via um módulo conector, e alimenta a sequência combinada em um modelo Vicuna (baseado no Llama 2) ou, em versões posteriores, Mistral ou outro LLM base para gerar uma resposta.
- Ajuste por instruções visuais. Em vez de treinar com pares brutos de imagem-legenda, o LLaVA foi ajustado no LLaVA-Instruct-150K, um conjunto de dados de conversas visuais multi-turno geradas ao solicitar ao GPT-4 legendas de imagens e anotações de detecção de objetos — ensinando o modelo a seguir instruções visuais abertas em vez de apenas gerar legendas.
- Três tamanhos de modelo via Ollama. A biblioteca do Ollama empacota o LLaVA nos tamanhos 7B (4,7 GB), 13B (8,0 GB) e 34B (20 GB) — modelos maiores geralmente produzem descrições mais detalhadas e precisas, ao custo de mais VRAM e inferência mais lenta.
- Melhorias de resolução do LLaVA-1.6 (LLaVA-NeXT). A versão atual suportada via Ollama e o repositório oficial lida com resoluções de entrada mais altas via patching dinâmico, o que melhora sensivelmente as tarefas de leitura de texto e detalhes finos em comparação com a versão original de 2023.
- Treinamento centrado em inglês. O LLaVA-Instruct-150K e os benchmarks subjacentes usados para avaliá-lo são predominantemente em inglês, então o desempenho em texto não inglês dentro de imagens é mais fraco de fábrica do que em modelos treinados especificamente com dados de documentos multilíngues.
Instalar e executar o LLaVA: passo a passo
Este guia cobre o caminho mais rápido e comum (Ollama) e menciona o próprio caminho do repositório original como referência.
- 1Instalar o Ollama.
Why it matters: Baixe e instale o [Ollama](https://ollama.com) para macOS, Linux ou Windows. Esta é a forma oficialmente listada de executar o LLaVA segundo sua [página na biblioteca do Ollama](https://ollama.com/library/llava), e leva menos de dois minutos. - 2Baixar um tamanho de modelo LLaVA.
Why it matters: Execute `ollama pull llava` para o modelo padrão de 7B (~4,7 GB), ou `ollama pull llava:13b` (~8,0 GB) ou `ollama pull llava:34b` (~20 GB) para maior qualidade ao custo de mais VRAM e espaço em disco. - 3Executá-lo com uma imagem a partir da CLI.
Why it matters: Execute `ollama run llava "describe this image: ./photo.jpg"`, referenciando diretamente um caminho de arquivo de imagem local no texto do prompt — nenhuma flag separada é necessária. - 4(Alternativa) Usar o repositório original para controle de nível de pesquisa.
Why it matters: Clone [haotian-liu/LLaVA](https://github.com/haotian-liu/LLaVA), instale seu `requirements.txt`, e baixe um checkpoint do Hugging Face para acesso completo a scripts de treinamento, ferramentas de avaliação e a demo web Gradio — útil para pesquisa ou ajuste fino, mas uma barreira de instalação sensivelmente maior do que o Ollama. - 5(Opcional) Chamá-lo programaticamente via API do Ollama.
Why it matters: Envie uma requisição POST para `http://localhost:11434/api/generate` com a imagem como uma string codificada em base64 em um array `images`, ou use a biblioteca oficial `ollama` em Python ou JavaScript — veja o exemplo de código abaixo.
Exemplos reais de uso
Estes exemplos usam a sintaxe CLI documentada do Ollama e sua API HTTP — a forma principal e suportada de executar o LLaVA hoje.
- Referenciar um caminho de arquivo no prompt da CLI já é suficiente — o Ollama detecta o caminho
.jpg/.pnge anexa a imagem automaticamente; não existe uma flag--imageseparada. - Tamanhos de modelo maiores custam mais VRAM e tempo. O modelo 7B é a opção mais rápida e com menor consumo de VRAM; use 13B ou 34B quando a precisão da descrição importar mais do que a velocidade.
# Instalar e baixar o modelo
# (baixe primeiro o Ollama de https://ollama.com)
ollama pull llava
# CLI: descrever uma imagem referenciando seu caminho de arquivo no prompt
ollama run llava "describe this image: ./photo.jpg"
# --- API HTTP (documentada no docs/api.md do próprio Ollama) ---
# /api/generate com uma imagem codificada em base64
curl http://localhost:11434/api/generate -d '{
"model": "llava",
"prompt": "What is in this picture?",
"stream": false,
"images": ["<dados de imagem codificados em base64>"]
}'
# /api/chat com uma imagem codificada em base64 (conversas multi-turno)
curl http://localhost:11434/api/chat -d '{
"model": "llava",
"messages": [
{ "role": "user", "content": "What is in this image?", "images": ["<dados de imagem codificados em base64>"] }
]
}'
# --- Exemplo em Python usando a biblioteca oficial ollama ---
import ollama
response = ollama.chat(
model="llava",
messages=[{
"role": "user",
"content": "What is in this image?",
"images": ["photo.jpg"],
}],
)
print(response["message"]["content"])Licença e custo
**O código do LLaVA, no repositório oficial do GitHub, tem licença Apache-2.0**, confirmado pelo arquivo LICENSE do repositório e seus metadados de licença reportados pelo GitHub. A Apache-2.0 é uma licença permissiva: você pode usar, modificar e redistribuir o código, incluindo comercialmente, com atribuição e concessão de patente, e restrição mínima adicional.
Os checkpoints pré-treinados são outra história: herdam condições de seu LLM base. Os checkpoints do LLaVA oficialmente lançados são ajustados a partir do Vicuna, um chatbot ajustado por instruções construído sobre o Llama 2 da Meta, e a própria documentação do projeto declara que os usuários "devem cumprir todos os termos e condições" das licenças originais — nomeando especificamente os termos de licença do Llama 2, Vicuna, CLIP, e os termos de uso da OpenAI (porque o GPT-4 foi usado para gerar os dados de treinamento). Isso significa que o uso permitido do checkpoint é regido pelos termos da licença comunitária do Llama 2 (incluindo suas restrições de uso aceitável e a exigência de que implantações comerciais muito grandes obtenham uma licença separada da Meta), não apenas pela Apache-2.0.
A página original do projeto LLaVA (um site separado do repositório GitHub) adiciona uma declaração mais rígida e mais antiga: descreve os "dados, código e checkpoint" como "destinados e licenciados apenas para uso de pesquisa", e observa separadamente a designação CC BY-NC 4.0 (não comercial) do conjunto de dados de treinamento. Isso antecede, e é mais rígido do que, a licença de código Apache-2.0 agora mostrada no GitHub — uma combinação genuinamente confusa de declarações do mesmo projeto em duas páginas diferentes, que vale a pena sinalizar em vez de simplesmente escolher a mais conveniente.
Nada disso é aconselhamento jurídico. Antes de lançar o LLaVA — ou qualquer checkpoint ajustado construído sobre ele — em um produto comercial, leia o arquivo LICENSE do GitHub, os termos indicados na página do projeto, a licença comunitária do Llama 2, e consulte um advogado para seu modelo base e implantação específicos.
Qual licença o LLaVA usa?
O código do LLaVA no GitHub tem licença Apache-2.0, uma licença permissiva que permite uso comercial. Seus checkpoints pré-treinados oficialmente lançados são ajustados a partir do Vicuna (construído sobre o Llama 2 da Meta), então seu uso também é regido pelos termos da licença comunitária do Llama 2. Uma página inicial separada do projeto descreve ainda os dados, código e checkpoints como destinados apenas à pesquisa, e os dados de treinamento como não comerciais (CC BY-NC 4.0) — uma declaração mais antiga e rígida do que a licença do GitHub. Isso não é aconselhamento jurídico; leia tudo isso você mesmo antes do uso comercial de um checkpoint específico.
Para que o LLaVA não é bom
O LLaVA continua sendo um modelo genuinamente útil e bem documentado, mas não é mais a escolha mais forte para toda tarefa de visão em 2026. É a ferramenta errada para as seguintes situações:
- Tarefas puramente de texto. O LLaVA é um modelo visão-linguagem; para uma conversa puramente textual sem imagem envolvida, use um LLM de texto dedicado (via Ollama ou de outra forma) — executar um modelo multimodal para chat apenas de texto desperdiça a VRAM que seu codificador visual ocupa sem nenhum benefício.
- Precisar da OCR ou compreensão de documentos local mais forte disponível. Em 2026, modelos lançados após o LLaVA-NeXT — MiniCPM-V, Qwen2.5-VL e Llama 3.2 Vision — o superam em OCR de documentos, tabelas e extração estruturada, segundo a comparação de modelos de visão locais da PromptQuorum. O codificador visual do LLaVA foi projetado e treinado antes de existir esta geração de dados de treinamento de maior resolução e focados em documentos.
- Ler texto não inglês em imagens. O LLaVA-Instruct-150K e os dados de treinamento centrais do modelo são predominantemente em inglês. Para OCR de documentos em chinês, japonês, coreano ou outra escrita não latina, um modelo especificamente treinado em corpora de documentos multilíngues (Qwen2.5-VL) o superará sensivelmente.
- Extração numérica precisa de gráficos e diagramas. Como praticamente todos os modelos visão-linguagem locais em 2026, o LLaVA não é confiável para ler valores exatos em gráficos complexos — verifique quaisquer números extraídos contra os dados de origem, independentemente do modelo usado.
- Assumir desenvolvimento ativo contínuo. Sem commits no repositório oficial desde 11 de maio de 2024, não espere novos recursos, correções de bugs ou checkpoints mais recentes do projeto original — as próprias atualizações do motor multimodal do Ollama e famílias de modelos mais recentes o substituíram efetivamente como a opção ativamente desenvolvida.
- Uma história de licença única e simples. Como o código (Apache-2.0) e os checkpoints oficialmente lançados (Apache-2.0 mais termos herdados da licença comunitária do Llama 2, mais uma declaração mais rígida de uso apenas para pesquisa na página inicial separada do projeto) são regidos por três declarações sobrepostas não totalmente alinhadas, o LLaVA não oferece a clareza de licença de uma linha que um projeto como o Bark (totalmente MIT, sem condições extras) oferece.
Alternativas ao LLaVA
Llama 3.2 Vision (via Ollama)
- Melhor para:
- Melhor qualidade geral de Q&A de imagem local; tamanhos 11B e 90B
- Licença:
- Licença comunitária do Llama 3.2
Qwen2.5-VL (via Ollama)
- Melhor para:
- OCR local e compreensão de documentos multilíngue mais fortes
- Licença:
- Licença Qwen (Apache-2.0 para tamanhos menores)
MiniCPM-V (via Ollama)
- Melhor para:
- Alta precisão de OCR documental com baixo VRAM (~6 GB)
- Licença:
- Derivada da Apache-2.0 (OpenBMB)
Idefics3 (Hugging Face)
- Melhor para:
- VLM de pesquisa aberto com fortes benchmarks de documentos/OCR, ainda não empacotado para o Ollama
- Licença:
- Apache-2.0 (termos do modelo base aplicam-se à variante Llama3)
APIs VLM na nuvem (GPT-4o, Claude, Gemini Vision)
- Melhor para:
- A maior capacidade multimodal disponível, sem necessidade de hardware local
- Licença:
- Proprietária (API paga)
Perguntas frequentes
O que é o LLaVA?
O LLaVA (Large Language and Vision Assistant) é um modelo visão-linguagem de código aberto criado por pesquisadores da Universidade de Wisconsin-Madison, Microsoft Research e Universidade Columbia, que combina um codificador visual com um grande modelo de linguagem para responder perguntas sobre imagens, apresentado no artigo de 2023 "Visual Instruction Tuning".
Posso usar o LLaVA comercialmente?
O código do LLaVA no GitHub tem licença Apache-2.0, que permite uso comercial. No entanto, seus checkpoints pré-treinados oficialmente lançados são ajustados a partir do Vicuna, construído sobre o Llama 2 da Meta, então seu uso também é regido pelos termos da licença comunitária do Llama 2. Uma página inicial separada do projeto descreve ainda os dados, código e checkpoints como destinados apenas à pesquisa, e os dados de treinamento como não comerciais (CC BY-NC 4.0) — uma declaração mais antiga e rígida do que a licença do GitHub. Isso não é aconselhamento jurídico; leia todas as licenças aplicáveis antes de qualquer implantação comercial de um checkpoint específico.
Como executo o LLaVA?
A forma mais comum é via Ollama: instale o Ollama, execute ollama pull llava, depois ollama run llava "describe this image: ./photo.jpg". O repositório original também oferece seus próprios scripts de inferência em Python e uma demo Gradio para controle de nível de pesquisa.
Qual é a diferença entre LLaVA, LLaVA-1.5 e LLaVA-NeXT (LLaVA-1.6)?
O LLaVA (2023) foi a arquitetura original. O LLaVA-1.5 (outubro de 2023) melhorou os resultados de benchmark com um conector de maior capacidade e melhores dados de treinamento. O LLaVA-NeXT, também chamado LLaVA-1.6 (janeiro de 2024), adicionou entrada de imagem em maior resolução via patching dinâmico e melhorou a OCR e o raciocínio visual. A versão distribuída via Ollama e o repositório GitHub atual reflete as melhorias do LLaVA-1.6/NeXT.
O LLaVA ainda é ativamente mantido?
O repositório oficial do GitHub não está marcado como arquivado, mas a PromptQuorum não encontrou commits desde 11 de maio de 2024. Trate-o como um lançamento de pesquisa concluído em vez de software ativamente desenvolvido — modelos mais recentes e as próprias atualizações do motor multimodal do Ollama o substituíram amplamente para novos projetos.
Como o LLaVA se compara a modelos mais recentes como Qwen2.5-VL ou Llama 3.2 Vision?
O LLaVA estabeleceu a arquitetura que esses modelos mais recentes também seguem, mas a partir de 2026 ele é superado pelo Qwen2.5-VL e Llama 3.2 Vision em OCR de documentos, leitura de gráficos e (especificamente para o Qwen2.5-VL) texto não inglês, segundo a comparação de modelos de visão locais da PromptQuorum. O LLaVA continua relevante por sua facilidade de instalação, grande comunidade e ampla cobertura de tutoriais.
O Ollama realmente suporta executar o LLaVA?
Sim — ollama run llava é um modelo oficialmente listado na biblioteca do Ollama, disponível nos tamanhos 7B, 13B e 34B, e é uma das formas mais comuns de executar o LLaVA hoje, ao lado dos próprios scripts de inferência do repositório original.
Que hardware preciso para executar o LLaVA?
O modelo 7B requer cerca de 4,7 GB de espaço em disco e pode rodar em uma GPU com 6-8 GB de VRAM (ou CPU, mais lentamente); os modelos 13B e 34B precisam proporcionalmente de mais VRAM e espaço em disco para melhor qualidade de descrição.
Veredito
O LLaVA conquistou seu lugar na história da IA local: provou que um codificador visual modesto conectado a um LLM de código aberto, ajustado com dados de instrução gerados pelo GPT-4, podia entregar uma compreensão de imagem genuinamente útil sem um orçamento de treinamento proprietário — e o padrão codificador-visual-mais-LLM que estabeleceu ainda é a base da maioria dos modelos multimodais locais hoje. Sua licença de código (Apache-2.0) é permissiva, mas seus checkpoints oficialmente lançados carregam termos derivados do Llama 2 através de sua base Vicuna, mais uma declaração mais antiga e rígida de uso apenas para pesquisa na página inicial separada do projeto — leia as três antes de qualquer uso comercial. Em capacidade bruta para 2026, o LLaVA já não é o modelo de visão local mais forte: sem commits desde maio de 2024, e opções mais recentes como Qwen2.5-VL, Llama 3.2 Vision e MiniCPM-V o superam em OCR, gráficos e documentos multilíngues. Se você quer a instalação mais simples, a maior comunidade e mais tutoriais existentes, ollama run llava continua sendo um ponto de partida genuinamente bom. Se a precisão documental ou o texto não inglês importam, combine esta análise com a comparação de modelos de visão locais e o guia de modelos de visão do Ollama da PromptQuorum antes de escolher um modelo.
Fontes
- LLaVA no GitHub — o repositório oficial: README, LICENSE, instruções de instalação e histórico de commits.
- Artigo "Visual Instruction Tuning" (NeurIPS 2023) — a página inicial do projeto com links para o artigo, declarações de licença e histórico de versões.
- LLaVA no Ollama — a página do modelo oficialmente listada: tamanhos, descrição e metadados da biblioteca.
- Documentação da API do Ollama — a forma documentada das requisições/respostas
/api/generatee/api/chatpara modelos multimodais. - Modelos de visão locais 2026: LLaVA, Llama 3.2 Vision, Qwen3-VL & configuração multimodal do Ollama — a comparação mais ampla da PromptQuorum dos modelos de visão locais atuais.
