Key Takeaways
- Melhor geral em hardware de consumo: Qwen3.8-27B — 61,7% SWE-bench, cabe em 24 GB com Q4.
- Melhor programação frontier: Kimi K2.6 — MoE, SWE-Bench Pro 58,6%, licença MIT modificada.
- Melhor modelo pequeno (16 GB): gpt-oss:20b — nível ~o3-mini, raciocínio ajustável.
- Melhor contexto longo + multimodal: Llama 4 Scout — 10M tokens de contexto, ~55 GB com Q4.
- Melhor raciocínio/matemática: DeepSeek-R1 ou gpt-oss:20b para raciocínio ajustável.
- Melhor eficiência de RAM: Mistral Small 3.1 24B — 14 GB, 79% MMLU.
- Melhor sem censura / uso geral: Dolphin 3.0 — `ollama pull dolphin3`, mantido pela Cognitive Computations sobre a base Llama 3.1, sem filtragem de conteúdo (não confundir com o `dolphin-mistral` de 2024, que está desatualizado).
- Automação residencial / IA de palavra de ativação: `ollama run phi4-mini` — Phi-4 Mini (3,8B, ~3 GB VRAM) processa comandos de voz do Home Assistant a 20–25 tok/seg em um mini PC sem GPU dedicada. Veja guia de integração Home Assistant + Ollama →.
O melhor modelo do Ollama em julho de 2026 é o Qwen3.8-27B (61,7% SWE-bench, cabe em 24 GB com Q4); o melhor para programação é o Kimi K2.6 ou o Laguna XS 2.1.
O Ollama é uma ferramenta gratuita que permite rodar modelos de IA no seu próprio computador — sem precisar de internet ou chave de API. Estes são os melhores modelos disponíveis para download com um único comando, organizados pelo que você realmente precisa.
Próximos passos
- Melhores LLMs locais para código — O melhor modelo Ollama especialmente para programação →
- Melhores LLMs só com CPU — Sem GPU? Comece por aqui →
- Guia de hardware LLM local 2026 — Seu computador aguenta esses modelos? →
Perguntas frequentes
Qual é a versão mais recente do Ollama?
A versão estável mais recente do Ollama é a v0.33.1, lançada em 26 de agosto de 2026. Uma candidata v0.33.2 surgiu em 27 de agosto, mas ainda não foi marcada como estável. Baixe em ollama.com/download ou atualize com `curl https://ollama.ai/install.sh | sh` no Linux e `brew upgrade ollama` no macOS.
Onde encontro o changelog e as notas de versão do Ollama?
As notas de cada versão ficam em github.com/ollama/ollama/releases, com data e changelog de cada tag. As entradas mais recentes são a v0.33.1 (26 de agosto de 2026 -- MLX Qwen3.8 Flash Next, saída estruturada, correções de timeout de GPU), a v0.33.0 (21 de agosto -- gateway do Claude Desktop, pontos de restauração do cache KV) e a v0.32.15 (19 de agosto -- novo onboarding no desktop, carregamento de modelos ~2x mais rápido).
Como verifico qual versão do Ollama tenho instalada?
Rode `ollama --version` no terminal. Ele imprime uma linha como `ollama version 0.33.1`. Se o número for menor que o da versão atual, atualize com `curl https://ollama.ai/install.sh | sh` (Linux) ou `brew upgrade ollama` (macOS) e rode `ollama --version` de novo para confirmar.
Qual é o melhor modelo Ollama em 2026?
Qwen3.8-27B é o melhor em geral em hardware de consumo (61,7% SWE-bench, cabe em 24 GB com Q4). Para programação frontier: Kimi K2.6. Para modelo pequeno/16 GB: gpt-oss:20b. Para contexto longo: Llama 4 Scout.
Qual modelo Ollama é melhor para programação?
Qwen3.8-27B para o melhor desempenho denso (61,7% SWE-bench). Kimi K2.6 para programação frontier (SWE-Bench Pro 58,6%). Devstral Small 24B para fluxos de trabalho agentivos em múltiplos arquivos. Codestral 22B para autocompletar em IDE (FIM).
Os modelos de código aberto no Ollama são realmente gratuitos para uso comercial?
A maioria sim, mas não todos. Llama 3.x (Meta Llama Community Licence) restringe o uso comercial acima de 700M de usuários ativos mensais. Mistral Small, Qwen3 e Gemma 3 usam Apache 2.0 (totalmente compatível com uso comercial). Verifique sempre a licença antes da implantação empresarial.
Quais são os melhores novos modelos do Ollama em 2026?
Lançamentos principais em 2026: Qwen3.8-27B (melhor geral em 24 GB, 61,7% SWE-bench), Kimi K2.6 (programação frontier, MoE), gpt-oss:20b (melhor pequeno/16 GB), Gemma 4 E4B (visão + tool calling) e Llama 4 Scout (contexto 10M, multimodal). Comandos: ollama run qwen3.8:27b, ollama run gpt-oss:20b, ollama run gemma4:e4b, ollama run llama4:scout.
Qual modelo Dolphin devo usar com o Ollama?
Use Dolphin 3.0 (`ollama pull dolphin3`), não o `dolphin-mistral` desatualizado de 2024. Dolphin 3.0 é mantido pela Cognitive Computations, construído sobre a base Llama 3.1, e não aplica filtragem de conteúdo — é o melhor modelo sem censura / uso geral disponível no Ollama.
Qual é o nome oficial da empresa por trás do Ollama?
A empresa é a Ollama Inc., uma startup com financiamento Series B sediada em Palo Alto, Califórnia, fundada em 2023 por Jeffrey Morgan e Michael Chiang.
Quais modelos do Ollama funcionam melhor para tarefas em russo?
Qwen3/Qwen3.8 e Mistral Small 3.1 incluem russo em seu treinamento multilíngue nativo. Qwen3 pontua mais alto em benchmarks não ingleses; Mistral Small 3.1 tem fluência conversacional em russo informalmente mais forte. Nenhum dos dois é de origem russa.
