Skip to main content
PromptQuorum

Os melhores modelos Ollama agora?

Os melhores modelos Ollama agora?

Resposta rápida

Para uso geral, qwen3.5:9b é a escolha mais forte, com 6,6 GB de download. Para código, qwen2.5-coder:7b com 4,7 GB dá conta do recado em bem menos hardware do que a maioria dos guias afirma. Para configurações compactas, llama3.2:3b roda em 2,0 GB. Todos os tamanhos lidos da biblioteca do Ollama em 28 de agosto de 2026.

  • Melhor geral: qwen3.5:9b — 6,6 GB
  • Melhor para código: qwen2.5-coder:7b — 4,7 GB
  • Melhor compacto: llama3.2:3b — 2,0 GB
Ollama

Pontos principais

  • Melhor uso geral: qwen3.5:9b — 6,6 GB de download, a geração Qwen mais recente realmente disponível no Ollama
  • Melhor para código: qwen2.5-coder:7b — 4,7 GB, e é a escolha de custo-benefício porque o qwen3-coder começa em 19 GB
  • Melhor compacto: llama3.2:3b — 2,0 GB, ou deepseek-r1:1.5b com 1,1 GB se você quiser ver o raciocínio
  • Atenção ao número que você compara: estes são tamanhos de download da biblioteca do Ollama, não requisitos de VRAM. Deixe folga acima do tamanho de download para a sua janela de contexto
  • Um modelo de seis meses atrás com quantização madura costuma superar um lançamento novo com suporte limitado da comunidade

Os três líderes por nível

Para uso geral, a escolha atual é qwen3.5:9b, com 6,6 GB de download. Os tamanhos abaixo foram lidos diretamente da biblioteca do Ollama em 28 de agosto de 2026.

"Melhor" na prática significa o maior equilíbrio entre qualidade de saída, velocidade de inferência e eficiência de memória — não apenas pontuação bruta de benchmark. Um modelo 9B que realmente cabe é mais útil do que um modelo 30B que transborda para o disco.

Um número merece correção: modelos de código custam menos do que a maioria dos guias sugere. O qwen2.5-coder:7b tem 4,7 GB de download e lida com Python, TypeScript e Go sem prompts especiais. O mais recente qwen3-coder começa em 19 GB, ou seja, é outra classe de hardware por completo, não uma atualização direta.

NívelModeloDownloadPor que lidera
Compactollama3.2:3b2,0 GBMelhor qualidade por GB na faixa baixa; 81,6 mi de downloads
Geralqwen3.5:9b6,6 GBGeração Qwen mais recente disponível no Ollama
Códigoqwen2.5-coder:7b4,7 GBSaída de código forte por uma fração do tamanho do qwen3-coder
Raciocíniodeepseek-r1:8b5,2 GBSegundo modelo mais baixado do Ollama, com 92 mi de downloads

Quando o mais novo não é o melhor

Um novo lançamento de modelo não se torna automaticamente a melhor escolha no Ollama. A qualidade da quantização, os ajustes finos da comunidade e a maturidade de integração com o Ollama levam 4–8 semanas para acompanhar um lançamento recente.

Os contadores de download mostram isso melhor do que qualquer benchmark. O llama3.1 continua sendo o modelo mais baixado da biblioteca, com 118,9 mi, e o llama3.2 está em 81,6 mi — ambos à frente de todo recém-chegado. Não é inércia: as pessoas escolhem aquilo cujas quantizações estão bem otimizadas e cujo comportamento é previsível entre hardwares.

Se você quer a geração mais nova, gemma4 (7,2 GB) e gpt-oss:20b (14 GB, contexto de 128K) valem um teste. Deixe um modelo manter a liderança por 6 semanas ou mais antes de depender dele em produção. Para uma análise mais profunda sobre avaliar modelos para a sua carga de trabalho, veja os melhores modelos de código aberto para Ollama.

Tamanhos verificados em ollama.com/library em 28 de agosto de 2026. As tags de modelos mudam com frequência — rode ollama pull e confira o tamanho informado antes de planejar com base em qualquer número daqui.

Guias relacionados

Respostas rápidas sobre os modelos Ollama

Devo sempre usar o modelo Ollama mais recente?
Não automaticamente. Novos lançamentos precisam de 4–8 semanas para que as quantizações da comunidade, os ajustes finos e a integração com o Ollama amadureçam — por isso o llama3.1 ainda é o modelo mais baixado da biblioteca. Consulte a tabela acima para as opções verificadas. Para configurações somente CPU, consulte os melhores modelos Ollama para uso somente CPU.
Qual modelo Ollama é o melhor para código agora?
qwen2.5-coder:7b, com 4,7 GB de download. Ele lida com Python, TypeScript e Go sem prompts especiais e cabe com folga em uma placa de 8 GB. Note que o qwen3-coder, apesar do número de versão maior, começa em 19 GB — portanto não é uma atualização direta, a menos que você tenha o hardware.
De quanta VRAM eu realmente preciso?
Os tamanhos citados aqui são de download, não requisitos de VRAM. Como regra prática, reserve alguns GB acima do tamanho de download para a janela de contexto e a sobrecarga. Um modelo de 6,6 GB como o qwen3.5:9b fica confortável em uma placa de 12 GB e é viável em 8 GB com contexto modesto.
Os modelos Qwen são melhores do que os modelos Llama em 2026?
Para código, a linha Qwen lidera — qwen2.5-coder e qwen3-coder não têm equivalente Llama direto na biblioteca. Para uso geral está mais equilibrado do que os números de versão sugerem: llama3.1 e llama3.2 continuam sendo os dois modelos mais baixados do Ollama, à frente de qualquer lançamento mais recente, porque suas quantizações são maduras e seu comportamento é previsível.