Skip to main content
PromptQuorum
Início/LLMs locais/Ollama Versão Mais Recente 2026: v0.33.1 + Top 10 Modelos Open Source
Best Models

Ollama Versão Mais Recente 2026: v0.33.1 + Top 10 Modelos Open Source

·14 min de leitura·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

A versão atual do Ollama é a v0.33.1 (26 de agosto de 2026); a v0.33.2 está disponível como candidata a lançamento. Os modelos mais novos adicionados são o Laguna XS 2.1 (Poolside, MoE de 33B total/3B ativo, programação agentiva, contexto de 256K) e o Kimi K2.7 Code (Moonshot AI, agentivo para programação). O melhor geral em hardware de consumo é o Qwen3.8-27B (61,7% SWE-bench, cabe em 24 GB com Q4). Outras opções destacadas: Kimi K2.6 (programação frontier), gpt-oss:20b (melhor pequeno / 16 GB), qwen3:30b (equilibrado), DeepSeek-R1 (raciocínio), Dolphin 3.0 (melhor sem censura / uso geral), Gemma 4 (visão/tool calling) e Llama 4 Scout (contexto longo 10M / multimodal). O mais baixado em geral continua sendo a família Llama.

Atualizado em agosto de 2026. A versão atual do Ollama é a v0.33.1 (lançada em 26 de agosto de 2026), que adiciona suporte MLX ao Qwen3.8 Flash Next, saída estruturada e correções de timeout de GPU. A série v0.33 também trouxe suporte de gateway para o Claude Desktop e reduziu quase pela metade o tempo até o primeiro token. Os modelos mais novos na biblioteca são o Laguna XS 2.1 (Poolside, 2 de julho, MoE de 33B total / 3B ativo, programação agentiva de longo horizonte, contexto de 256K, SWE-bench Verified 70,9%, licença OpenMDW-1.1) e o Kimi K2.7 Code (Moonshot AI, ~junho de 2026, modelo agentivo focado em programação construído sobre o Kimi K2.6), somando-se a Kimi K2.6, Qwen3.8, GLM-5.3, gpt-oss e Gemma 4. O mais baixado em geral continua sendo a família Llama (Llama 4 Scout, Llama 3.x); o melhor geral em hardware de consumo é o Qwen3.8-27B (61,7% SWE-bench).

Slide Deck: Ollama Versão Mais Recente 2026: v0.33.1 + Top 10 Modelos Open Source

A apresentação abaixo cobre: top 10 modelos Ollama por número de downloads, comparação de desempenho (60-74% HumanEval), melhores modelos por caso de uso (chat, programação, raciocínio, visão), raciocínio chain-of-thought do DeepSeek-R1 e comandos exatos de download. Baixe o PDF como seu cartão de referência para seleção de modelos Ollama.

Browse the slides below or download as PDF for offline reference. Download Reference Card (PDF)

Ollama Versão Mais Recente 2026: v0.33.1 + Top 10 Modelos Open Source

Key Takeaways

  • Melhor geral em hardware de consumo: Qwen3.8-27B — 61,7% SWE-bench, cabe em 24 GB com Q4.
  • Melhor programação frontier: Kimi K2.6 — MoE, SWE-Bench Pro 58,6%, licença MIT modificada.
  • Melhor modelo pequeno (16 GB): gpt-oss:20b — nível ~o3-mini, raciocínio ajustável.
  • Melhor contexto longo + multimodal: Llama 4 Scout — 10M tokens de contexto, ~55 GB com Q4.
  • Melhor raciocínio/matemática: DeepSeek-R1 ou gpt-oss:20b para raciocínio ajustável.
  • Melhor eficiência de RAM: Mistral Small 3.1 24B — 14 GB, 79% MMLU.
  • Melhor sem censura / uso geral: Dolphin 3.0 — `ollama pull dolphin3`, mantido pela Cognitive Computations sobre a base Llama 3.1, sem filtragem de conteúdo (não confundir com o `dolphin-mistral` de 2024, que está desatualizado).
  • Automação residencial / IA de palavra de ativação: `ollama run phi4-mini` — Phi-4 Mini (3,8B, ~3 GB VRAM) processa comandos de voz do Home Assistant a 20–25 tok/seg em um mini PC sem GPU dedicada. Veja guia de integração Home Assistant + Ollama →.

O melhor modelo do Ollama em julho de 2026 é o Qwen3.8-27B (61,7% SWE-bench, cabe em 24 GB com Q4); o melhor para programação é o Kimi K2.6 ou o Laguna XS 2.1.

O Ollama é uma ferramenta gratuita que permite rodar modelos de IA no seu próprio computador — sem precisar de internet ou chave de API. Estes são os melhores modelos disponíveis para download com um único comando, organizados pelo que você realmente precisa.

Próximos passos

Perguntas frequentes

Qual é a versão mais recente do Ollama?

A versão estável mais recente do Ollama é a v0.33.1, lançada em 26 de agosto de 2026. Uma candidata v0.33.2 surgiu em 27 de agosto, mas ainda não foi marcada como estável. Baixe em ollama.com/download ou atualize com `curl https://ollama.ai/install.sh | sh` no Linux e `brew upgrade ollama` no macOS.

Onde encontro o changelog e as notas de versão do Ollama?

As notas de cada versão ficam em github.com/ollama/ollama/releases, com data e changelog de cada tag. As entradas mais recentes são a v0.33.1 (26 de agosto de 2026 -- MLX Qwen3.8 Flash Next, saída estruturada, correções de timeout de GPU), a v0.33.0 (21 de agosto -- gateway do Claude Desktop, pontos de restauração do cache KV) e a v0.32.15 (19 de agosto -- novo onboarding no desktop, carregamento de modelos ~2x mais rápido).

Como verifico qual versão do Ollama tenho instalada?

Rode `ollama --version` no terminal. Ele imprime uma linha como `ollama version 0.33.1`. Se o número for menor que o da versão atual, atualize com `curl https://ollama.ai/install.sh | sh` (Linux) ou `brew upgrade ollama` (macOS) e rode `ollama --version` de novo para confirmar.

Qual é o melhor modelo Ollama em 2026?

Qwen3.8-27B é o melhor em geral em hardware de consumo (61,7% SWE-bench, cabe em 24 GB com Q4). Para programação frontier: Kimi K2.6. Para modelo pequeno/16 GB: gpt-oss:20b. Para contexto longo: Llama 4 Scout.

Qual modelo Ollama é melhor para programação?

Qwen3.8-27B para o melhor desempenho denso (61,7% SWE-bench). Kimi K2.6 para programação frontier (SWE-Bench Pro 58,6%). Devstral Small 24B para fluxos de trabalho agentivos em múltiplos arquivos. Codestral 22B para autocompletar em IDE (FIM).

Os modelos de código aberto no Ollama são realmente gratuitos para uso comercial?

A maioria sim, mas não todos. Llama 3.x (Meta Llama Community Licence) restringe o uso comercial acima de 700M de usuários ativos mensais. Mistral Small, Qwen3 e Gemma 3 usam Apache 2.0 (totalmente compatível com uso comercial). Verifique sempre a licença antes da implantação empresarial.

Quais são os melhores novos modelos do Ollama em 2026?

Lançamentos principais em 2026: Qwen3.8-27B (melhor geral em 24 GB, 61,7% SWE-bench), Kimi K2.6 (programação frontier, MoE), gpt-oss:20b (melhor pequeno/16 GB), Gemma 4 E4B (visão + tool calling) e Llama 4 Scout (contexto 10M, multimodal). Comandos: ollama run qwen3.8:27b, ollama run gpt-oss:20b, ollama run gemma4:e4b, ollama run llama4:scout.

Qual modelo Dolphin devo usar com o Ollama?

Use Dolphin 3.0 (`ollama pull dolphin3`), não o `dolphin-mistral` desatualizado de 2024. Dolphin 3.0 é mantido pela Cognitive Computations, construído sobre a base Llama 3.1, e não aplica filtragem de conteúdo — é o melhor modelo sem censura / uso geral disponível no Ollama.

Qual é o nome oficial da empresa por trás do Ollama?

A empresa é a Ollama Inc., uma startup com financiamento Series B sediada em Palo Alto, Califórnia, fundada em 2023 por Jeffrey Morgan e Michael Chiang.

Quais modelos do Ollama funcionam melhor para tarefas em russo?

Qwen3/Qwen3.8 e Mistral Small 3.1 incluem russo em seu treinamento multilíngue nativo. Qwen3 pontua mais alto em benchmarks não ingleses; Mistral Small 3.1 tem fluência conversacional em russo informalmente mais forte. Nenhum dos dois é de origem russa.

Nota sobre informações de terceiros

Este artigo faz referência a modelos de IA, benchmarks, preços e licenças de terceiros. O cenário da IA muda rapidamente. Pontuações de benchmark, termos de licença, nomes de modelos e preços de API podem mudar entre o momento em que foi escrito e quando você está lendo. Antes de tomar decisões de implantação ou conformidade com base neste artigo, verifique os dados atuais na fonte oficial de cada fornecedor: fichas de modelos do Hugging Face para licenças e benchmarks, sites dos fornecedores para preços de API e EUR-Lex para o texto atual do GDPR e da Lei de IA da UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs