Key Takeaways
- Ollama se instala em menos de 2 minutos — um único instalador para macOS, Windows e Linux.
- Após a instalação: `ollama run llama3.2` baixa e executa o modelo automaticamente.
- Sem Python, sem pip, sem dependências — o Ollama gerencia tudo.
- Funciona sem GPU — mas é mais rápido com uma.
- Mais de 200 modelos disponíveis: `ollama list` para ver os instalados, `ollama pull [modelo]` para baixar.
- 👉 Antes de instalar, confirme se rodar localmente é a opção certa para o seu caso de uso — veja LLM local vs API na nuvem para saber quando a nuvem supera a inferência local.
O Ollama é instalado em menos de 2 minutos no macOS, Windows e Linux por meio de um instalador para download ou um único comando curl, e depois um comando `ollama run <modelo>` baixa e executa qualquer modelo da sua biblioteca sem exigir ambiente Python ou GPU.
O Ollama é a forma mais fácil de rodar modelos de IA no seu próprio computador. Baixe-o (ou rode um único comando de instalação no Linux), depois digite um comando como `ollama run llama3.2` e ele baixará o modelo e iniciará um chat -- sem programação, sem arquivos de configuração, e funciona bem em um notebook sem placa de vídeo.
Antes de instalar: o LLM local é a opção certa para o seu caso de uso?
Instalar o Ollama leva 5 minutos, mas colocar o primeiro modelo para rodar bem pode levar de 20 a 40 minutos se você encontrar problemas de detecção de GPU, incompatibilidade de drivers ou limitação de RAM.
Se você não tem certeza se a inferência local é a escolha certa, **compare primeiro os prós e contras completos entre local e nuvem** — você pode descobrir que começar com uma API na nuvem (pronta em 5 minutos, sem solução de problemas) é o caminho mais inteligente. Muitos usuários percebem isso só depois de instalar; melhor decidir agora.
Para quem já decidiu usar local, continue abaixo. Para quem quer avaliar a nuvem primeiro, veja a comparação completa.
O que é o Ollama e por que usá-lo?
O Ollama é um motor de inferência open-source que executa modelos de linguagem grandes localmente. Ele reúne gerenciamento de modelos, o backend de inferência llama.cpp e uma API REST compatível com OpenAI em um único aplicativo leve. Sem Python, sem ambiente conda e sem configuração de CUDA.
O Ollama mantém uma biblioteca de modelos selecionada (ollama.com/library) com downloads em um único comando para Meta Llama 3.3, Microsoft Phi-4, Google Gemma, Mistral, Qwen3 e mais de 100 outros modelos. Um modelo é baixado uma vez e fica em cache no disco -- as execuções seguintes carregam em poucos segundos.
Para alternativas ao Ollama, veja Instaladores de LLM local com um clique. Para comparar o Ollama com o LM Studio, veja Como instalar o LM Studio.
Como instalar o Ollama no macOS
- 1Acesse ollama.com/download e clique em "Download for macOS".
- 2Abra o arquivo Ollama.dmg baixado e arraste o Ollama para a pasta Applications.
- 3Abra o Ollama a partir de Applications. Um ícone de lhama aparece na barra de menus -- o Ollama já está em execução como um serviço em segundo plano.
- 4Abra o Terminal e execute seu primeiro modelo: `ollama run llama3.2`
- 5O modelo é baixado (~2 GB para llama3.2:3b) e um prompt de chat aparece. Digite uma mensagem e pressione Enter.
# Opção 1: Baixe o instalador em ollama.com
# Clique em Download, abra o .dmg, arraste Ollama para Aplicativos
# Opção 2: Homebrew
brew install ollama
# Verificar instalação
ollama --version
# Executar o primeiro modelo
ollama run llama3.2Como instalar o Ollama no Windows
# Baixe OllamaSetup.exe em ollama.com
# Execute o instalador e siga as instruções
# O Ollama adiciona automaticamente o PATH
# No PowerShell ou CMD:
ollama run llama3.2
# Verificar instalação
ollama --versionSuporte a GPU no Windows
O Ollama no Windows detecta e usa automaticamente GPUs NVIDIA (CUDA 11.3+) e AMD (ROCm 6+). Se você tem uma placa NVIDIA RTX, o Ollama transfere as camadas do modelo para a VRAM automaticamente -- sem configuração manual. Para verificar se a GPU está sendo usada, execute `ollama run llama3.2` e confira o Gerenciador de Tarefas → GPU para ver a atividade.
Como instalar o Ollama no Linux
# Script de instalação oficial
curl -fsSL https://ollama.com/install.sh | sh
# Verificar instalação
ollama --version
# Executar o primeiro modelo
ollama run llama3.2Executar o Ollama como serviço systemd no Linux
O script de instalação registra o Ollama automaticamente como serviço systemd. Para gerenciá-lo:
# Verificar status do serviço
systemctl status ollama
# Iniciar / parar / reiniciar
systemctl start ollama
systemctl stop ollama
systemctl restart ollama
# Ver logs
journalctl -u ollama -f
Baixar e executar o primeiro modelo
# Baixar e executar Llama 3.2 (padrão)
ollama run llama3.2
# Outros modelos populares
ollama run phi4-mini # 3.8B, rápido
ollama run qwen3:8b # Qwen3 com PT-BR
ollama run aya:8b # Multilíngue 101 idiomas
# Listar modelos instalados
ollama list
# API REST (compatível com OpenAI)
curl http://localhost:11434/api/generate \
-d '{"model": "llama3.2", "prompt": "Olá!"}'Com qual modelo você deve começar?
Para a primeira execução, estes três modelos cobrem perfis de hardware diferentes:
| Modelo | Tamanho do download | RAM necessária | Melhor para |
|---|---|---|---|
| Llama 3.2 3B | ~2 GB | 4 GB | Primeiro teste -- qualquer máquina |
| Llama 3.1 8B | ~4,7 GB | 8 GB | Uso geral na maioria dos notebooks |
| phi4-mini | ~2,3 GB | 4 GB | Respostas rápidas, pouca RAM |
Como verificar se o Ollama está funcionando?
Teste a API REST diretamente para confirmar que o Ollama está em execução e acessível:
# Verificar se o Ollama está em execução
curl http://localhost:11434
# Esperado: "Ollama is running"
# Listar modelos baixados
ollama list
# Enviar um prompt via API (compatível com OpenAI)
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Quanto é 2+2?",
"stream": false
}'Comandos úteis do Ollama
| Comando | O que faz |
|---|---|
| ollama list | Mostra todos os modelos baixados e seus tamanhos |
| ollama pull <model> | Baixa um modelo sem executá-lo |
| ollama rm <model> | Remove um modelo do disco |
| ollama ps | Mostra os modelos carregados na memória no momento |
| ollama show <model> | Mostra detalhes do modelo (parâmetros, template, licença) |
| ollama serve | Inicia o servidor Ollama manualmente (se não estiver rodando como serviço) |
Solução de problemas comuns na instalação do Ollama

O Ollama mostra "could not connect to ollama app, is it running?"
O Ollama não está rodando como serviço em segundo plano. No macOS: abra o app Ollama em Applications. No Linux: execute `systemctl start ollama` ou `ollama serve` em um terminal. No Windows: abra o Ollama pelo menu Iniciar.
O download do modelo está muito lento ou travou
Downloads de modelo são grandes (2-47 GB). Se o download travar, pressione Ctrl+C e execute `ollama pull <model>` novamente -- o Ollama retoma downloads parciais. Para downloads mais rápidos, use conexão cabeada em vez de Wi-Fi.
Aparece o erro "error: model requires more system memory" ao executar um modelo
O modelo é grande demais para a RAM disponível. Tente uma quantização menor: `ollama run llama3.2-instruct-q4_0` em vez do Q4_K_M padrão. Ou mude para um modelo menor como `llama3.2:3b`. Veja Melhores modelos de LLM local para iniciantes para recomendações compatíveis com sua RAM.
O Ollama está rodando mas minha GPU não está sendo usada
Em uma instalação nativa (sem Docker), você precisa do driver NVIDIA e do runtime CUDA -- verifique com `nvidia-smi`, que deve mostrar sua GPU e a versão do driver. O Ollama transfere camadas para a GPU automaticamente quando há VRAM disponível; execute `ollama ps` e confira se a coluna PROCESSOR mostra 100% GPU. Só é necessário instalar o NVIDIA Container Toolkit no host (mais `--gpus=all` no container) se você estiver rodando o Ollama dentro do Docker.
Meu prompt ou documento é cortado no meio
A janela de contexto do Ollama é 4096 tokens por padrão na maioria das GPUs de consumo (ela escala automaticamente até 32K ou 256K em placas com mais VRAM). Qualquer conteúdo além da janela ativa é truncado silenciosamente. Aumente por sessão com `/set parameter num_ctx 8192` no `ollama run`, por chamada de API com `"options": {"num_ctx": 8192}`, ou para todo modelo com a variável de ambiente `OLLAMA_CONTEXT_LENGTH` antes de iniciar o servidor. Uma janela de contexto maior usa mais memória, então fique de olho na VRAM se aumentar bastante.
Onde ficam armazenados os arquivos de modelo do Ollama?
Os modelos ficam em ~/.ollama/models no macOS e no Linux. No Windows, o caminho padrão é C:\Users\<usuário>\.ollama\models. Você pode mudar o local de armazenamento definindo a variável de ambiente OLLAMA_MODELS antes de iniciar o serviço.
Erros comuns ao instalar o Ollama
- Não verificar se o Ollama está rodando como serviço em segundo plano antes de esperar que a API responda.
- Tentar executar modelos maiores que a RAM disponível sem checar os requisitos de memória primeiro.
- Ignorar a detecção de GPU -- o Ollama suporta NVIDIA e AMD, mas exige drivers atualizados.
Perguntas frequentes sobre Ollama
O Ollama é gratuito?
Sim, o Ollama é totalmente gratuito e open-source. Todos os modelos da biblioteca do Ollama também são gratuitos para uso local.
O Ollama precisa de GPU para funcionar?
Não. O Ollama funciona em CPU somente, mas é mais lento (5–15 tok/s). Com uma GPU discreta (mesmo 4 GB VRAM), a velocidade sobe para 20–40 tok/s.
Como conversar em português com o Ollama?
Basta digitar em português no prompt. Modelos como Aya 8B e Qwen3 têm melhor suporte para PT-BR. Use `ollama run aya:8b` para o modelo com melhor suporte multilíngue.
Posso usar o Ollama com outros aplicativos?
Sim. O Ollama expõe uma API REST compatível com OpenAI na porta 11434. Qualquer aplicativo que suporte OpenAI pode usar o Ollama como backend local.
Como instalo o Ollama no macOS?
Baixe o .dmg em ollama.com, arraste para Applications, abra e execute ollama run llama3.2 no Terminal. Alternativa: brew install ollama && ollama serve.
Como instalo o Ollama no Windows?
Baixe o OllamaSetup.exe em ollama.com/download e execute. O Ollama se instala como serviço em segundo plano. Abra o Prompt de Comando e execute ollama run llama3.2.
Como instalo o Ollama no Linux?
Execute: curl -fsSL https://ollama.com/install.sh | sh. Isso instala o Ollama como serviço systemd. Depois: ollama pull llama3.2 para baixar seu primeiro modelo.
Qual é a RAM mínima exigida pelo Ollama?
Mínimo de 4 GB de RAM para um modelo 3B, 8 GB para um modelo 7B em quantização Q4. Não é preciso GPU -- o Ollama alterna automaticamente para inferência via CPU.
Como faço o download de um novo modelo no Ollama?
Execute: ollama pull nomedomodelo. Por exemplo: ollama pull mistral ou ollama pull qwen2.5:7b. Os modelos ficam em ~/.ollama/models. Liste os modelos baixados com ollama list.
A API do Ollama é compatível com a API da OpenAI?
Sim. O Ollama suporta o endpoint de chat completions da OpenAI em /v1/chat/completions. Qualquer app feito para a OpenAI pode usar o Ollama definindo base_url como http://localhost:11434/v1.
Como atualizo o Ollama para a versão mais recente?
macOS/Windows: baixe novamente o instalador em ollama.com -- ele substitui a versão antiga. Linux: execute novamente curl -fsSL https://ollama.com/install.sh | sh para atualizar no mesmo lugar.
Fontes
- Site oficial do Ollama** -- Downloads de instalação e documentação oficial
- Repositório do Ollama no GitHub** -- Código-fonte, issues e documentação oficial (incluindo tamanho de contexto e suporte a GPU)
- Biblioteca de modelos do Ollama** -- Coleção selecionada de modelos disponíveis com links de download
