Key Takeaways
- Nível 1 (simples): `ollama run llama3.2` + OpenWebUI. Sem código necessário.
- Nível 2 (padrão): vLLM + wrapper FastAPI. Python 3.10+, pip install de 2 pacotes, configuração em 30 min.
- Nível 3 (produção): vLLM + balanceador de carga nginx + monitoramento (Prometheus). Multi-GPU, multiusuário, tolerante a falhas.
- Integração com IDE: VS Code Copilot ou Cursor com o endpoint da API OpenAI do vLLM.
- Processamento em batch: envie 10 prompts de uma vez, receba 10 respostas em paralelo.
- Custo: zero (open source) vs. $20/mês (Claude Pro) ou $200/mês (grande equipe na nuvem).
Desenvolvedores que constroem inferência local de nível produção devem usar vLLM + FastAPI + uma extensão VS Code Copilot para completações de código em tempo real, processamento em lote e compatibilidade com a API OpenAI sem dependência de fornecedor, ou a combinação mais simples Ollama + llama.cpp CLI para scripts pontuais.
Há duas formas de configurar IA local para desenvolvimento, dependendo do que você precisa. Se você só quer rodar um script rápido ou testar um prompt, a CLI do Ollama te coloca em funcionamento em minutos. Se você está construindo algo que precisa parecer uma API de produção de verdade -- servida em rede, lidando com muitas requisições, integrada ao seu editor -- o vLLM atrás de um servidor FastAPI é o stack que escala.
Nível 1: Ollama CLI
Para programação: instale a extensão do VS Code "Continue" (`continue.dev`), aponte para a API do Ollama e obtenha completações em tempo real.
- 1`brew install ollama` (macOS) ou baixe o instalador para Windows.
- 2`ollama run llama3.2` (baixa e executa o modelo de 8B).
- 3Abra o navegador: `http://localhost:11434` (interface web do Ollama).
- 4Comece a conversar. Pronto.
Perguntas Frequentes
Qual nível devo usar?
Nível 1 se for uso solo (casual). Nível 2 se for um único desenvolvedor com integração de IDE. Nível 3 se for equipe com serviço 24/7.
Posso usar vLLM em vez do Ollama?
Sim, mas exige mais configuração. O vLLM é mais rápido (batching) e mais flexível (API Python).
Como sirvo modelos em múltiplas GPUs?
vLLM: `--tensor-parallel-size 2`. Divide o modelo entre 2 GPUs, dobrando o throughput.
Posso fazer fine-tuning sobre a inferência do vLLM?
Não. Faça o fine-tuning separadamente (HuggingFace Transformers) e depois carregue o modelo ajustado no vLLM.
E se o vLLM apresentar erro de OOM?
Use uma quantização menor (Q4 em vez de Q8), reduza o tamanho do batch ou aloque menos VRAM por modelo. Verifique com `nvidia-smi`.
O Nível 3 está pronto para produção?
Sim, com monitoramento. Adicione Prometheus, Grafana e alertas (Alertmanager). Padrões de infraestrutura convencionais.
