Key Takeaways
- A pergunta central é "quantas horas por mês?", não uma regra fixa local-vs-nuvem
- O aluguel de GPU na nuvem (RunPod, Vast.ai) custa aproximadamente US$ 0,13–0,69/h para uma GPU classe RTX 4090
- Uma workstation RTX 4090 local recomendada custa cerca de R$ 25.000 no total
- Ponto de equilíbrio ingênuo (preço ÷ tarifa da nuvem): 5.600 horas — mas ignora eletricidade e revenda
- Ponto de equilíbrio de TCO completo (hardware + eletricidade − revenda): ~4.780 horas, cerca de 20 meses a 8h/dia — veja a calculadora abaixo para seus números
- A eletricidade acrescenta aproximadamente US$ 0,02/h (EUA) a US$ 0,06/h (Alemanha) para um sistema de 450 W
- A nuvem vence para cargas esporádicas ou experimentais abaixo de ~100 h/mês
- O local vence para inferência diária contínua, dados sensíveis ou 500+ h/mês
Resposta rápida: qual opção combina com seu uso?
Isso é um ponto de partida, não uma regra rígida — preço do hardware, sua tarifa de nuvem, sua tarifa de energia e o valor de revenda deslocam o ponto de equilíbrio real. A calculadora abaixo dá a resposta exata para seus números.
| Horas/mês | Recomendação |
|---|---|
| Menos de 20 h | Alugar — o local quase nunca se paga |
| 20–100 h | Geralmente alugar |
| 100–250 h | Comparar com cuidado conforme o hardware |
| 250–500 h | O hardware local fica atrativo |
| 500+ h | O local costuma vencer no custo total |
| Contínuo 24/7 | Comprar hardware local |
Calculadora de custo interativa: local vs nuvem
Informe suas horas de uso mensais, tarifa de GPU na nuvem, preço do hardware local, tarifa de energia, valor de revenda esperado e período de posse. A calculadora abaixo computa em tempo real seu custo mensal na nuvem, seu custo operacional local, seu custo total de propriedade e seu ponto de equilíbrio. Todos os valores são estimativas calculadas a partir dos seus dados e de preços de referência pesquisados, não medições feitas pela PromptQuorum.
Average daily use × 30. Example: 8 hr/day = 240 hr/month.
Blended spot/on-demand rate for a comparable GPU (RunPod, Vast.ai, Lambda Labs).
Full system cost — GPU, case, PSU, RAM, storage, not just the GPU.
What you expect to sell the hardware for at the end of the ownership period.
How long you plan to keep and use this hardware.
Recommendation
BUY LOCAL
At this usage, owning hardware costs less than renting over your ownership period.
See the GPU workstation guide →Your numbers
Cloud cost / month
$120
Local operating cost / month
$18
Total local cost over period (hardware + electricity − resale)
$2,461
Break-even (full TCO)
23 months
Break-even in cumulative hours
5,465 hours
Naive break-even (hardware price ÷ cloud rate only, ignoring electricity and resale) for these hardware/cloud-rate inputs: 6,400 hours
Tabela de decisão de hardware
Relacione o tamanho de modelo desejado e seu padrão de uso a um nível de hardware antes de precificar uma configuração específica.
| Nível | VRAM / RAM | Melhor para | Faixa de preço |
|---|---|---|---|
| Mini PC N150 | 16GB RAM | Chat leve, até 7B | Abaixo de R$ 4.500 |
| Mini PC Ryzen | 32–64GB RAM | 7B–14B diário, servidor 24/7 | R$ 4.500–9.000 |
| RTX 3090 (usada) | 24GB VRAM | Até 30B Q4, melhor VRAM/R$ | R$ 7.000–11.500 |
| RTX 4090 (usada) | 24GB VRAM | Até 34B Q4, GPU única mais rápida | R$ 18.000–23.000 |
| Setup GPU 48GB | 48GB VRAM | Até 70B Q4, desenvolvimento | R$ 35.000+ |
| Mac (memória unificada) | 48–128GB unificada | 70B+ via MLX, baixo consumo | R$ 18.000–35.000+ |
Caminho 1 — Uso baixo: alugar GPU na nuvem
Alugar é a escolha certa para experimentação, fine-tuning ocasional, cargas variáveis ou testar antes de investir em hardware. Você paga só as horas usadas, sem manutenção, com acesso imediato a níveis de GPU (H100, A100 80GB) que custariam milhares de dólares para comprar.
Compare preços atuais de GPU na nuvem: preços do RunPod e preços do Vast.ai são links editoriais de referência, não links de afiliado — a PromptQuorum não tem relação de comissão com nenhum dos dois provedores.
Caminho 2 — Uso médio: um mini PC pode superar uma workstation GPU
Para modelos 7B–14B de uso diário — chat, automações do Home Assistant, Ollama 24/7 — um mini PC Ryzen costuma superar uma GPU dedicada em custo por watt e espaço ocupado. Veja a análise do Beelink SER8 para um uso real de Ollama 24/7, além do guia dos melhores mini PCs para LLM local e melhor mini PC AMD para LLM local, incluindo o Minisforum UM890 Pro e o GMKtec G3 Plus.
Caminho 3 — IA local intensa: workstation GPU
Ao precisar de modelos de 30B+, fine-tuning ou inferência rápida multiusuário, uma workstation GPU dedicada é o nível certo. A métrica que importa é VRAM por dólar, não a velocidade bruta de benchmark — o VRAM determina quais tamanhos de modelo sequer carregam. Veja o guia de construção de workstation LLM local e o guia de construção de workstation GPU da PromptQuorum.
"O que devo comprar?" por faixa de preço
Abaixo de R$ 4.500 — Não compre hardware de IA dedicado. Use o que já tem ou alugue para necessidades ocasionais.
R$ 4.500–9.000 — Um mini PC Ryzen com 32GB+ de RAM. Veja o melhor mini PC AMD para LLM local e a análise do Beelink SER8.
R$ 7.000–11.500 — Uma RTX 3090 usada, ou um mini PC mais potente. Veja o guia dos melhores mini PCs e o guia de melhor GPU abaixo de $500.
R$ 18.000–23.000 — Uma workstation GPU dedicada (RTX 4090, preço de mercado usado pós-EOL) ou um Mac com memória unificada grande. Veja o guia de construção de workstation e o guia de Apple Silicon.
R$ 35.000+ — 48GB+ de VRAM, multi-GPU ou classe workstation. Calcule sua utilização com cuidado — este nível só se paga com uso intenso e sustentado. Veja o guia de construção de workstation GPU da PromptQuorum.
No varejo brasileiro: impostos de importação elevam bastante os preços frente aos valores em dólar — as faixas acima já refletem preços de referência em reais (Kabum, Pichau, Mercado Livre); confira o câmbio e a loja antes de comprar, pois variam por região e disponibilidade.
Recomendações de hardware por categoria
- Econômico: GMKtec G3 Plus — mini PC de entrada para modelos 7B
- Intermediário: Beelink SER8 — 7B–14B, Home Assistant, servidor Ollama 24/7; Minisforum UM890 Pro como alternativa Ryzen
- Melhor custo-benefício de GPU: RTX 3090 (usada, ~R$ 7.000–11.500) — melhor VRAM por real em 24GB
- Desempenho de GPU: RTX 4090 (~R$ 18.000–23.000, preço de mercado usado pós-EOL, agosto de 2026 — fim de produção no 2º trimestre de 2026) — a GPU única mais rápida, veja o guia de construção de workstation
- Opção Apple: Mac com bastante memória unificada para modelos 70B+ com baixo consumo — veja o guia de Apple Silicon
Os links de RTX 3090/4090 e Apple acima são apenas links de produto/editoriais — a PromptQuorum não tem programa de afiliados e não recebe comissão em nenhuma compra de hardware.
Quando você NÃO deve comprar hardware de IA local
- Uso ocasional (~10 horas/mês ou menos) — o hardware ficará ocioso na maior parte do tempo
- Carga de trabalho muito variável — alguns meses intensos, outros nulos
- Precisa de GPUs diferentes por projeto — a nuvem permite trocar instantaneamente entre 24GB e 80GB
- Não quer manutenção de hardware — drivers, refrigeração, upgrades e falhas ficam por sua conta no local
- Só precisa ocasionalmente de modelos muito grandes — alugar uma H100 por uma semana supera comprar uma
Quando a IA local vence
- Uso diário e previsível — as horas somam rápido, veja a tabela de uso acima
- Previsibilidade de custo — um custo de hardware fixo é mais fácil de orçar do que faturas de nuvem variáveis
- Dados sensíveis ou necessidade offline — nada sai da sua rede
- Necessidade de inferência ilimitada — a própria documentação da Ollama afirma que rodar modelos no seu próprio hardware é ilimitado; apenas o serviço de nuvem gerenciado da Ollama, um produto separado, tem limites de uso por plano
- Horizonte de uso plurianual com hardware que você consegue manter bem utilizado
Custos de eletricidade por país
Uma workstation local de 450 W rodando 240 horas/mês (8h/dia) custa cerca de US$ 18/mês em eletricidade nos EUA, contra cerca de US$ 40/mês na Alemanha. Use sua própria tarifa na calculadora acima — estes são valores de referência. No Brasil, a tarifa residencial média (com bandeiras) gira em torno de R$ 0,75–0,95/kWh dependendo da distribuidora e região — confira a sua conta de luz.
| País | Tarifa Residencial | Sistema 450W, 240h/mês |
|---|---|---|
| Estados Unidos | ~US$ 0,17/kWh | ~US$ 18/mês |
| Alemanha | ~€ 0,37/kWh (~US$ 0,37) | ~US$ 40/mês |
| Reino Unido | ~£ 0,26/kWh (~US$ 0,33) | ~US$ 36/mês |
| França | ~€ 0,22/kWh (~US$ 0,22) | ~US$ 24/mês |
Comparação de provedores de GPU na nuvem
Tarifas representativas de classe RTX 4090, em agosto de 2026 — verifique sempre os preços atuais antes de alugar, eles mudam com frequência.
| Provedor | Melhor para | Modelo de Preço | Veredito |
|---|---|---|---|
| RunPod | Confiabilidade, pods gerenciados | Por segundo, US$ 0,34–0,69/h | Boa opção padrão para uso constante |
| Vast.ai | Menor preço, flexível | Leilão de mercado, US$ 0,13–0,34/h | O mais barato, qualidade do host variável |
| Lambda Labs | GPUs de data center (A100/H100) | Por hora sob demanda, US$ 1,99–4,29/h | Melhor para treinamento grande, não para alugar uma 4090 barata |
Veredito final: não há um vencedor universal
As regras práticas de horas de uso deste artigo são orientativas, não leis fixas. Seu ponto de equilíbrio real depende da sua tarifa de nuvem, do preço do seu hardware, da sua tarifa de energia e do seu valor de revenda — a calculadora acima calcula a resposta real para os seus dados, não um limiar fixo.
Decida com base em
Use um LLM local se:
- •Você usa LLMs 250+ horas/mês ou continuamente
- •Precisa de previsibilidade de custo em um horizonte de vários anos
- •Privacidade de dados ou capacidade offline é obrigatória
- •Consegue manter o hardware bem utilizado, não ocioso
Use um modelo em nuvem se:
- •Você usa LLMs menos de 100 horas/mês
- •Sua carga de trabalho é esporádica ou experimental
- •Precisa de níveis de GPU caros demais para possuir (H100, A100 80GB)
- •Não quer manutenção nem custo de capital inicial
Decisão rápida:
- →Use a calculadora acima com seus números reais
- →Abaixo de 100 h/mês → alugar na nuvem
- →500+ h/mês ou contínuo → comprar local
- →100–500 h/mês → preço do hardware e tarifa de energia decidem
Próximos passos conforme o que você calculou
- Uso baixo (abaixo de 100 h/mês): compare preços atuais de GPU na nuvem
- Modelos pequenos, uso diário: melhores mini PCs para LLM local
- 7B–14B, servidor 24/7: análise do Beelink SER8 ou melhor mini PC AMD
- Modelos 30B+, uso local intenso: guia de construção de workstation
- Classe 70B, uso contínuo: guia de construção de workstation GPU da PromptQuorum
A IA local é sempre mais barata que a nuvem?
Não. O hardware local só é mais barato acima de um limiar de uso que depende do preço do hardware, da tarifa de energia e da tarifa de nuvem — tipicamente cerca de 250–500 horas/mês para uma workstation GPU intermediária. Abaixo disso, o aluguel na nuvem costuma ser mais barato.
A partir de quantas horas comprar hardware local compensa?
Para uma workstation RTX 4090 de R$ 25.000 frente a uma tarifa de nuvem de US$ 0,50/h, o ponto de equilíbrio ingênuo (preço ÷ tarifa) é de 5.600 horas acumuladas. Incluindo eletricidade e valor de revenda, o ponto de equilíbrio de TCO completo a 240h/mês (8h/dia) é de aproximadamente 4.780 horas — cerca de 20 meses. Use a calculadora acima para seus números.
A eletricidade está incluída nas estimativas de custo de IA local?
Deveria estar, mas costuma faltar em comparações simples. Um sistema de 450 W rodando 8 horas/dia acrescenta cerca de US$ 18/mês nos EUA (~US$ 0,17/kWh) ou cerca de US$ 40/mês na Alemanha (~€ 0,37/kWh). A calculadora acima permite informar sua própria tarifa.
Um Mac é bom para LLMs locais?
Macs com bastante memória unificada conseguem rodar modelos grandes (classe 70B) com baixo consumo de energia, o que melhora o custo total de propriedade, especialmente em países com tarifa de energia alta. Veja o guia de Apple Silicon linkado acima para tamanhos de modelo e detalhes de desempenho atuais.
24GB de VRAM são suficientes para LLMs locais?
24GB (RTX 3090 ou RTX 4090) rodam com folga modelos de até cerca de 30–34B de parâmetros com quantização de 4 bits, cobrindo a maioria dos casos de uso de IA local para um único usuário. Modelos classe 70B precisam de cerca de 48GB, alcançados com configurações de duas GPUs ou Macs com bastante memória unificada.
Devo comprar uma RTX 4090 ou alugar tempo de GPU na nuvem?
Compre se espera uso sustentado acima de cerca de 250–500 horas/mês por vários anos e consegue manter o hardware bem utilizado. Alugue se seu uso é ocasional, esporádico, ou você ainda está validando a carga de trabalho — alugar evita totalmente o investimento inicial de cerca de R$ 18.000–23.000 de uma RTX 4090 (preço de mercado usado pós-EOL, agosto de 2026, fim de produção no 2º trimestre de 2026, já considerando impostos de importação no varejo brasileiro).
Qual é a forma mais barata de rodar um LLM local?
Para o menor custo inicial, um mini PC Ryzen (R$ 4.500–9.000) rodando um modelo quantizado de 7B–14B é a configuração local dedicada mais barata. Para o menor custo por inferência em baixo volume, o aluguel de GPU na nuvem sem nenhuma compra de hardware é mais barato.
Rodar IA localmente significa que os dados nunca saem do meu computador?
Sim, para inferência local por meio de ferramentas como Ollama rodando no seu próprio hardware — nenhum dado é enviado a lugar nenhum. Isso é diferente do serviço de nuvem gerenciado separado da Ollama, que sim envia requisições para a infraestrutura da Ollama; apenas o modo local, no próprio dispositivo, mantém os dados totalmente na sua máquina.
