Skip to main content
PromptQuorum
Início/LLMs locais/Instalar Ollama: Configuração em 2 Minutos para macOS, Windows e Linux
Getting Started

Instalar Ollama: Configuração em 2 Minutos para macOS, Windows e Linux

·8 min de leitura·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

O Ollama se instala em menos de 2 minutos no macOS, Windows e Linux. Após a instalação, um único comando baixa e executa qualquer modelo da biblioteca do Ollama — sem ambiente Python, sem arquivos de configuração e sem necessidade de GPU para começar.

O Ollama se instala em menos de 2 minutos no macOS, Windows e Linux. Após a instalação, um único comando baixa e executa qualquer modelo da biblioteca do Ollama — sem ambiente Python, sem arquivos de configuração e sem necessidade de GPU para começar. O Ollama mantém uma biblioteca de modelos com download em um único comando, incluindo Meta Llama 3.3, Qwen3 e Mistral.

Instalar Ollama: Configuração em 2 Minutos para macOS, Windows e Linux

Key Takeaways

  • Ollama se instala em menos de 2 minutos — um único instalador para macOS, Windows e Linux.
  • Após a instalação: `ollama run llama3.2` baixa e executa o modelo automaticamente.
  • Sem Python, sem pip, sem dependências — o Ollama gerencia tudo.
  • Funciona sem GPU — mas é mais rápido com uma.
  • Mais de 200 modelos disponíveis: `ollama list` para ver os instalados, `ollama pull [modelo]` para baixar.
  • 👉 Antes de instalar, confirme se rodar localmente é a opção certa para o seu caso de uso — veja LLM local vs API na nuvem para saber quando a nuvem supera a inferência local.

O Ollama é instalado em menos de 2 minutos no macOS, Windows e Linux por meio de um instalador para download ou um único comando curl, e depois um comando `ollama run <modelo>` baixa e executa qualquer modelo da sua biblioteca sem exigir ambiente Python ou GPU.

O Ollama é a forma mais fácil de rodar modelos de IA no seu próprio computador. Baixe-o (ou rode um único comando de instalação no Linux), depois digite um comando como `ollama run llama3.2` e ele baixará o modelo e iniciará um chat -- sem programação, sem arquivos de configuração, e funciona bem em um notebook sem placa de vídeo.

Antes de instalar: o LLM local é a opção certa para o seu caso de uso?

Instalar o Ollama leva 5 minutos, mas colocar o primeiro modelo para rodar bem pode levar de 20 a 40 minutos se você encontrar problemas de detecção de GPU, incompatibilidade de drivers ou limitação de RAM.

Se você não tem certeza se a inferência local é a escolha certa, **compare primeiro os prós e contras completos entre local e nuvem** — você pode descobrir que começar com uma API na nuvem (pronta em 5 minutos, sem solução de problemas) é o caminho mais inteligente. Muitos usuários percebem isso só depois de instalar; melhor decidir agora.

Para quem já decidiu usar local, continue abaixo. Para quem quer avaliar a nuvem primeiro, veja a comparação completa.

O que é o Ollama e por que usá-lo?

O Ollama é um motor de inferência open-source que executa modelos de linguagem grandes localmente. Ele reúne gerenciamento de modelos, o backend de inferência llama.cpp e uma API REST compatível com OpenAI em um único aplicativo leve. Sem Python, sem ambiente conda e sem configuração de CUDA.

O Ollama mantém uma biblioteca de modelos selecionada (ollama.com/library) com downloads em um único comando para Meta Llama 3.3, Microsoft Phi-4, Google Gemma, Mistral, Qwen3 e mais de 100 outros modelos. Um modelo é baixado uma vez e fica em cache no disco -- as execuções seguintes carregam em poucos segundos.

Para alternativas ao Ollama, veja Instaladores de LLM local com um clique. Para comparar o Ollama com o LM Studio, veja Como instalar o LM Studio.

Como instalar o Ollama no macOS

  1. 1
    Acesse ollama.com/download e clique em "Download for macOS".
  2. 2
    Abra o arquivo Ollama.dmg baixado e arraste o Ollama para a pasta Applications.
  3. 3
    Abra o Ollama a partir de Applications. Um ícone de lhama aparece na barra de menus -- o Ollama já está em execução como um serviço em segundo plano.
  4. 4
    Abra o Terminal e execute seu primeiro modelo: `ollama run llama3.2`
  5. 5
    O modelo é baixado (~2 GB para llama3.2:3b) e um prompt de chat aparece. Digite uma mensagem e pressione Enter.
bash
# Opção 1: Baixe o instalador em ollama.com
# Clique em Download, abra o .dmg, arraste Ollama para Aplicativos

# Opção 2: Homebrew
brew install ollama

# Verificar instalação
ollama --version

# Executar o primeiro modelo
ollama run llama3.2

Como instalar o Ollama no Windows

bash
# Baixe OllamaSetup.exe em ollama.com
# Execute o instalador e siga as instruções
# O Ollama adiciona automaticamente o PATH

# No PowerShell ou CMD:
ollama run llama3.2

# Verificar instalação
ollama --version

Suporte a GPU no Windows

O Ollama no Windows detecta e usa automaticamente GPUs NVIDIA (CUDA 11.3+) e AMD (ROCm 6+). Se você tem uma placa NVIDIA RTX, o Ollama transfere as camadas do modelo para a VRAM automaticamente -- sem configuração manual. Para verificar se a GPU está sendo usada, execute `ollama run llama3.2` e confira o Gerenciador de Tarefas → GPU para ver a atividade.

Como instalar o Ollama no Linux

bash
# Script de instalação oficial
curl -fsSL https://ollama.com/install.sh | sh

# Verificar instalação
ollama --version

# Executar o primeiro modelo
ollama run llama3.2

Executar o Ollama como serviço systemd no Linux

O script de instalação registra o Ollama automaticamente como serviço systemd. Para gerenciá-lo:

bash
# Verificar status do serviço
systemctl status ollama

# Iniciar / parar / reiniciar
systemctl start ollama
systemctl stop ollama
systemctl restart ollama

# Ver logs
journalctl -u ollama -f
Fluxo de quatro etapas para executar o Ollama como serviço systemd no Linux: instalar com `curl -fsSL https://ollama.com/install.sh | sh`, verificar o status com `systemctl status ollama`, controlar com `start`/`stop`/`restart` e acompanhar os logs com `journalctl -u ollama -f`.
Fluxo de quatro etapas para executar o Ollama como serviço systemd no Linux: instalar com `curl -fsSL https://ollama.com/install.sh | sh`, verificar o status com `systemctl status ollama`, controlar com `start`/`stop`/`restart` e acompanhar os logs com `journalctl -u ollama -f`.

Baixar e executar o primeiro modelo

bash
# Baixar e executar Llama 3.2 (padrão)
ollama run llama3.2

# Outros modelos populares
ollama run phi4-mini      # 3.8B, rápido
ollama run qwen3:8b       # Qwen3 com PT-BR
ollama run aya:8b         # Multilíngue 101 idiomas

# Listar modelos instalados
ollama list

# API REST (compatível com OpenAI)
curl http://localhost:11434/api/generate \
  -d '{"model": "llama3.2", "prompt": "Olá!"}'

Com qual modelo você deve começar?

Para a primeira execução, estes três modelos cobrem perfis de hardware diferentes:

ModeloTamanho do downloadRAM necessáriaMelhor para
Llama 3.2 3B~2 GB4 GBPrimeiro teste -- qualquer máquina
Llama 3.1 8B~4,7 GB8 GBUso geral na maioria dos notebooks
phi4-mini~2,3 GB4 GBRespostas rápidas, pouca RAM

Como verificar se o Ollama está funcionando?

Teste a API REST diretamente para confirmar que o Ollama está em execução e acessível:

bash
# Verificar se o Ollama está em execução
curl http://localhost:11434
# Esperado: "Ollama is running"

# Listar modelos baixados
ollama list

# Enviar um prompt via API (compatível com OpenAI)
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Quanto é 2+2?",
  "stream": false
}'

Comandos úteis do Ollama

ComandoO que faz
ollama listMostra todos os modelos baixados e seus tamanhos
ollama pull <model>Baixa um modelo sem executá-lo
ollama rm <model>Remove um modelo do disco
ollama psMostra os modelos carregados na memória no momento
ollama show <model>Mostra detalhes do modelo (parâmetros, template, licença)
ollama serveInicia o servidor Ollama manualmente (se não estiver rodando como serviço)

Solução de problemas comuns na instalação do Ollama

Tabela de referência com 5 erros comuns na instalação do Ollama -- serviço parado, downloads de 2-47 GB travados, erros de memória insuficiente, GPUs não detectadas e prompts truncados em 4096 tokens -- cada um com o comando de solução.
Tabela de referência com 5 erros comuns na instalação do Ollama -- serviço parado, downloads de 2-47 GB travados, erros de memória insuficiente, GPUs não detectadas e prompts truncados em 4096 tokens -- cada um com o comando de solução.

O Ollama mostra "could not connect to ollama app, is it running?"

O Ollama não está rodando como serviço em segundo plano. No macOS: abra o app Ollama em Applications. No Linux: execute `systemctl start ollama` ou `ollama serve` em um terminal. No Windows: abra o Ollama pelo menu Iniciar.

O download do modelo está muito lento ou travou

Downloads de modelo são grandes (2-47 GB). Se o download travar, pressione Ctrl+C e execute `ollama pull <model>` novamente -- o Ollama retoma downloads parciais. Para downloads mais rápidos, use conexão cabeada em vez de Wi-Fi.

Aparece o erro "error: model requires more system memory" ao executar um modelo

O modelo é grande demais para a RAM disponível. Tente uma quantização menor: `ollama run llama3.2-instruct-q4_0` em vez do Q4_K_M padrão. Ou mude para um modelo menor como `llama3.2:3b`. Veja Melhores modelos de LLM local para iniciantes para recomendações compatíveis com sua RAM.

O Ollama está rodando mas minha GPU não está sendo usada

Em uma instalação nativa (sem Docker), você precisa do driver NVIDIA e do runtime CUDA -- verifique com `nvidia-smi`, que deve mostrar sua GPU e a versão do driver. O Ollama transfere camadas para a GPU automaticamente quando há VRAM disponível; execute `ollama ps` e confira se a coluna PROCESSOR mostra 100% GPU. Só é necessário instalar o NVIDIA Container Toolkit no host (mais `--gpus=all` no container) se você estiver rodando o Ollama dentro do Docker.

Meu prompt ou documento é cortado no meio

A janela de contexto do Ollama é 4096 tokens por padrão na maioria das GPUs de consumo (ela escala automaticamente até 32K ou 256K em placas com mais VRAM). Qualquer conteúdo além da janela ativa é truncado silenciosamente. Aumente por sessão com `/set parameter num_ctx 8192` no `ollama run`, por chamada de API com `"options": {"num_ctx": 8192}`, ou para todo modelo com a variável de ambiente `OLLAMA_CONTEXT_LENGTH` antes de iniciar o servidor. Uma janela de contexto maior usa mais memória, então fique de olho na VRAM se aumentar bastante.

Onde ficam armazenados os arquivos de modelo do Ollama?

Os modelos ficam em ~/.ollama/models no macOS e no Linux. No Windows, o caminho padrão é C:\Users\<usuário>\.ollama\models. Você pode mudar o local de armazenamento definindo a variável de ambiente OLLAMA_MODELS antes de iniciar o serviço.

Erros comuns ao instalar o Ollama

  • Não verificar se o Ollama está rodando como serviço em segundo plano antes de esperar que a API responda.
  • Tentar executar modelos maiores que a RAM disponível sem checar os requisitos de memória primeiro.
  • Ignorar a detecção de GPU -- o Ollama suporta NVIDIA e AMD, mas exige drivers atualizados.

Perguntas frequentes sobre Ollama

O Ollama é gratuito?

Sim, o Ollama é totalmente gratuito e open-source. Todos os modelos da biblioteca do Ollama também são gratuitos para uso local.

O Ollama precisa de GPU para funcionar?

Não. O Ollama funciona em CPU somente, mas é mais lento (5–15 tok/s). Com uma GPU discreta (mesmo 4 GB VRAM), a velocidade sobe para 20–40 tok/s.

Como conversar em português com o Ollama?

Basta digitar em português no prompt. Modelos como Aya 8B e Qwen3 têm melhor suporte para PT-BR. Use `ollama run aya:8b` para o modelo com melhor suporte multilíngue.

Posso usar o Ollama com outros aplicativos?

Sim. O Ollama expõe uma API REST compatível com OpenAI na porta 11434. Qualquer aplicativo que suporte OpenAI pode usar o Ollama como backend local.

Como instalo o Ollama no macOS?

Baixe o .dmg em ollama.com, arraste para Applications, abra e execute ollama run llama3.2 no Terminal. Alternativa: brew install ollama && ollama serve.

Como instalo o Ollama no Windows?

Baixe o OllamaSetup.exe em ollama.com/download e execute. O Ollama se instala como serviço em segundo plano. Abra o Prompt de Comando e execute ollama run llama3.2.

Como instalo o Ollama no Linux?

Execute: curl -fsSL https://ollama.com/install.sh | sh. Isso instala o Ollama como serviço systemd. Depois: ollama pull llama3.2 para baixar seu primeiro modelo.

Qual é a RAM mínima exigida pelo Ollama?

Mínimo de 4 GB de RAM para um modelo 3B, 8 GB para um modelo 7B em quantização Q4. Não é preciso GPU -- o Ollama alterna automaticamente para inferência via CPU.

Como faço o download de um novo modelo no Ollama?

Execute: ollama pull nomedomodelo. Por exemplo: ollama pull mistral ou ollama pull qwen2.5:7b. Os modelos ficam em ~/.ollama/models. Liste os modelos baixados com ollama list.

A API do Ollama é compatível com a API da OpenAI?

Sim. O Ollama suporta o endpoint de chat completions da OpenAI em /v1/chat/completions. Qualquer app feito para a OpenAI pode usar o Ollama definindo base_url como http://localhost:11434/v1.

Como atualizo o Ollama para a versão mais recente?

macOS/Windows: baixe novamente o instalador em ollama.com -- ele substitui a versão antiga. Linux: execute novamente curl -fsSL https://ollama.com/install.sh | sh para atualizar no mesmo lugar.

Fontes

Nota sobre informações de terceiros

Este artigo faz referência a modelos de IA, benchmarks, preços e licenças de terceiros. O cenário da IA muda rapidamente. Pontuações de benchmark, termos de licença, nomes de modelos e preços de API podem mudar entre o momento em que foi escrito e quando você está lendo. Antes de tomar decisões de implantação ou conformidade com base neste artigo, verifique os dados atuais na fonte oficial de cada fornecedor: fichas de modelos do Hugging Face para licenças e benchmarks, sites dos fornecedores para preços de API e EUR-Lex para o texto atual do GDPR e da Lei de IA da UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs