Principais conclusões
- A RTX 4090 continua a melhor GPU de consumo individual para IA local em 2026: 24 GB VRAM, ~1 TB/s de largura de banda — seu preço de segunda mão até caiu um pouco desde a primavera
- A escassez global de memória de 2026 pesa mais no orçamento do que a variação de preço da GPU — kits DDR5 de 64 GB ficaram de 3 a 6 vezes mais caros no mercado internacional desde maio
- Os modelos 70B Q4 precisam de mais de 40 GB VRAM — exigem dual RTX 3090 ou CPU offloading
- O Ryzen 9 9950X (Zen 5, 16 núcleos) é a única peça que ficou mais barata no período — preço de rua em queda no mercado internacional
- NVMe PCIe Gen 4/5 carrega um modelo de 7B em menos de 2 segundos, mas um SSD Gen 5 de 4 TB ficou bem mais caro no mesmo período
- Os Níveis 1 e 2 compartilham o socket AM5 — atualize GPU/RAM sem trocar a placa-mãe; o Nível 3 exige TRX50
Qual workstation você deveria montar?
Escolha seu build pelo maior modelo que você realmente precisa rodar: 7B–14B → Econômico. 14B–32B → Recomendado. 70B → Profissional. Preços de sistema completo, conferidos em 25 de agosto de 2026.
| Econômico | Recomendado | Profissional | |
|---|---|---|---|
| Preço | ~R$ 25.000 | ~R$ 49.000 | ~R$ 81.000 |
| GPU | RTX 3090 24GB (usada) | RTX 4090 24GB | 2× RTX 3090 (48GB) |
| CPU | Ryzen 7 7700X | Ryzen 9 9950X | Threadripper 7960X |
| RAM | 64GB DDR5 | 64GB DDR5-6000 | 256GB DDR5 ECC |
| Modelo máximo | 32B Q4 na GPU | 30B Q4 GPU / 70B offload | 70B Q4 em velocidade de GPU |
| Ideal para | Orçamento apertado, 7B–14B | A maioria dos usuários, 14B–32B | Cargas 70B, múltiplos usuários |
Os preços no Brasil ficam bem acima da conversão direta de dólar por causa de impostos de importação e ICMS sobre hardware de PC — os totais abaixo já refletem preços de varejo típicos no Brasil (Mercado Livre/Amazon.com.br), não uma conversão cambial simples.
Escolha do editor: Workstation Recomendada RTX 4090
A melhor workstation de IA local no geral para 2026 — o ponto de equilíbrio entre VRAM, margem de upgrade e preço para a gama mais ampla de modelos.
- 24 GB VRAM — roda qualquer modelo até 32B Q4 totalmente na GPU
- 64 GB DDR5-6000 — suficiente para 70B via CPU offload a 10–15 tok/s
- Qwen3 32B Q4 totalmente na GPU a 28–38 tok/s; 70B com offloading
- ~R$ 49.000 em sistema completo, conferido em 25 de agosto de 2026
- Pule se: você só roda modelos 7B–14B — o build Econômico economiza ~R$ 24.000 e cumpre o mesmo papel
A VRAM determina seu build
Não sabe qual nível você precisa? Parta do maior modelo que você realmente vai usar, não daquele que talvez use um dia.
| Tamanho do modelo | VRAM recomendada | Melhor build |
|---|---|---|
| 7B | 8–12 GB | Econômico (RTX 3090 com folga de sobra) |
| 14B | 16–24 GB | Econômico ou Recomendado |
| 32B Q4 | ~20–24 GB | Recomendado (RTX 4090) |
| 70B Q4 | ~40 GB+ | Profissional (dual RTX 3090) ou offload no Recomendado |
| 70B Q8 | ~70 GB+ | Só multi-GPU — veja nosso guia de GPU |
Só quer uma GPU avulsa (não um build completo)? Veja nosso guia de compra de GPU.
Nível 1: ~R$ 25.000 workstation de IA econômica
O build econômico usa uma RTX 3090 usada (24 GB VRAM) como núcleo. Roda Llama 3.1 8B Q8 a 45–60 tok/s, Qwen3 14B Q8 a 20–28 tok/s e Qwen3 32B Q4 a 12–18 tok/s totalmente na GPU. Escolha este build se: seu orçamento está abaixo de R$ 30.000, você usa principalmente modelos 7B–32B, e não se importa em comprar uma GPU usada. Pule se: o 70B é sua carga principal — o offloading para CPU neste nível roda a 5–8 tok/s, funcional mas lento.
- Modelos compatíveis em velocidade total de GPU: 7B (qualquer quantização), 13B (Q4/Q8), 14B (Q4/Q8), 30B (Q4)
- Suporte a 70B: exige CPU offloading — ~5–8 tok/s, funcional mas não ideal
- Consumo elétrico: ~450 W em pico (GPU 350 W + CPU 65 W + restante)
| Componente | Modelo | Preço (ago 2026) |
|---|---|---|
| GPU | NVIDIA RTX 3090 (usada, 24 GB) | ~R$ 8.500 |
| CPU | AMD Ryzen 7 7700X | ~R$ 2.000 |
| Placa-mãe | MSI MAG X670E Tomahawk WiFi | ~R$ 1.750 |
| RAM | 64 GB DDR5-5600 (2×32 GB) | ~R$ 8.000 (maio: ~R$ 1.100) |
| Armazenamento | 2 TB PCIe Gen 4 NVMe | ~R$ 3.300 (maio: ~R$ 900) |
| Fonte | 850 W certificada 80+ Gold | ~R$ 1.000 |
| Gabinete | Torre média ATX, 3+ slots para ventoinhas | ~R$ 750 |
| Cooler de CPU | AIO 240mm ou torre | ~R$ 650 |
| Total | ~R$ 25.950 |
💡Tip: Usada vs. nova: as RTX 3090 usadas custam bem menos que o pouco estoque novo restante, ao custo de uma garantia incerta. Prefira um vendedor com boa reputação e política de devolução, e verifique sinais de desgaste por mineração (ruído do cooler, cheiro de queimado sob carga).
Nível 2: ~R$ 49.000 workstation de IA recomendada
O build recomendado se concentra na RTX 4090 (24 GB, ~1 TB/s de largura de banda de memória) combinada com o AMD Ryzen 9 9950X (Zen 5, 16 núcleos). A 4090 é 30–40% mais rápida que a 3090 por GB de VRAM. Escolha este build se: você quer a melhor workstation mono-GPU, usa modelos 14B–32B regularmente, e ocasionalmente faz offload de um 70B. Pule se: o 70B é sua carga diária principal — vá de Profissional para velocidade de GPU no 70B.
- Velocidade 7B Q4: ~105–125 tok/s no Ollama
- Velocidade 14B Q8: ~48–60 tok/s
- Velocidade 30B Q4: ~28–38 tok/s
- 70B Q4 (CPU offloading): ~10–15 tok/s com 64 GB RAM
- Consumo elétrico: ~550 W em pico
| Componente | Modelo | Preço (ago 2026) |
|---|---|---|
| GPU | NVIDIA GeForce RTX 4090 24 GB | ~R$ 21.500 |
| CPU | AMD Ryzen 9 9950X (16C/32T, Zen 5) | ~R$ 4.700 |
| Placa-mãe | ASUS ProArt X870E-Creator WiFi | ~R$ 5.000 |
| RAM | 64 GB DDR5-6000 CL30 (2×32 GB) | ~R$ 8.500 (maio: ~R$ 1.450) |
| Armazenamento | 4 TB PCIe Gen 5 NVMe | ~R$ 7.700 (maio: ~R$ 2.000) |
| Fonte | 1000 W certificada 80+ Platinum | ~R$ 1.700 |
| Gabinete | Torre completa ATX com bom fluxo de ar | ~R$ 1.300 |
| Cooler de CPU | AIO 360mm | ~R$ 1.000 |
| Total | ~R$ 51.400 |
Nível 3: ~R$ 81.000 workstation profissional 70B
O build profissional é voltado para a inferência de modelos 70B em velocidade de GPU (25–40 tok/s) usando duas RTX 3090 para um total de 48 GB VRAM. O Ryzen Threadripper 7960X (24 núcleos) acelera o CPU offloading. Com 256 GB DDR5 ECC, até os modelos 140B quantizados carregam totalmente na RAM. Escolha este build se: o 70B é sua carga principal, você precisa de 48 GB+ de VRAM de GPU, ou atende vários usuários simultâneos. Pule se: você nunca rodou um modelo maior que 32B — este nível é um investimento excessivo nesse caso.
- Velocidade 70B Q4: 25–40 tok/s (ambas RTX 3090 ativas via paralelismo de tensores)
- CPU offloading com 256 GB RAM: roda modelos de 140B+ a 4–6 tok/s
- Consumo elétrico: ~900 W em pico
| Componente | Modelo | Preço (ago 2026) |
|---|---|---|
| GPU ×2 | 2× NVIDIA RTX 3090 24 GB (usadas) | ~R$ 17.000 |
| CPU | AMD Ryzen Threadripper 7960X (24C) | ~R$ 14.000 (volátil — varia bastante) |
| Placa-mãe | ASUS Pro WS TRX50-SAGE WiFi | ~R$ 8.000 |
| RAM | 256 GB DDR5-5200 ECC (8×32 GB) | ~R$ 27.500 (maio: ~R$ 7.000 — confirme antes de comprar) |
| Armazenamento | 8 TB PCIe Gen 4 NVMe (2×4 TB) | ~R$ 14.000 (maio: ~R$ 3.900) |
| Fonte | 1600 W Platinum modular | ~R$ 3.500 |
| Gabinete | Torre completa HEDT ATX | ~R$ 2.200 |
| Cooler de CPU | AIO 360mm + ventoinhas adicionais | ~R$ 1.500 |
| Total | ~R$ 87.700 |
⚠️Warning: A escassez de DDR5 de 2026 atingiu com mais força a memória de servidor ECC/RDIMM — kits DDR5 ECC de 256 GB são escassos e com preço volátil no Brasil e no exterior. Consiga uma cotação atualizada de RAM listada na QVL da sua placa-mãe antes de comprar.
Hardware que não compraríamos para esse uso
- Uma GPU de 8 GB se o objetivo são modelos de 32B — você bate no limite de VRAM imediatamente
- Uma CPU cara com uma GPU insuficiente — a GPU e sua VRAM decidem a velocidade de inferência muito mais que o clock da CPU
- Um SSD SATA para uma workstation de IA nova — carregamento de modelos 5x mais lento que NVMe Gen 4 por uma diferença pequena de preço
- Uma fonte insuficiente — o nível Profissional chega a picos de ~900 W
- 32 GB de RAM para offloading sério de 70B em CPU — o próprio modelo precisa de ~40 GB só para caber na memória
Montar uma workstation ou alugar GPU na nuvem?
Workstation local vs. aluguel de GPU na nuvem
Use um LLM local se:
- •Você usa modelos locais 2+ horas/dia
- •Privacidade ou residência de dados importam para seu uso
- •Você quer um custo fixo e previsível a longo prazo
- •Você já decidiu por um dos níveis acima
Use um modelo em nuvem se:
- •Você usa modelos locais menos de 1 hora/dia
- •Seu uso é ocasional ou pontual (testes, lotes)
- •Você não quer lidar com manutenção de hardware
- •Você quer testar um modelo 70B+ antes de investir em hardware
Decisão rápida:
- →Uso diário intenso → monte a workstation (veja as tabelas de níveis acima)
- →Uso ocasional/de avaliação → alugue GPU na nuvem
- →Não tem certeza? Veja a tabela de retorno do investimento abaixo
- →Comparar provedores de GPU na nuvem →
Stack de software para qualquer build
Uma vez montado o hardware, colocar o Ollama em funcionamento leva menos de 10 minutos:
- 1Instale o Ubuntu 22.04 LTS ou o Windows 11 (o Ubuntu é preferível pela estabilidade do CUDA)
- 2Instale os drivers da NVIDIA 550+ do nvidia.com ou com
ubuntu-drivers autoinstall - 3Instale o Ollama:
curl -fsSL https://ollama.com/install.sh | sh - 4Baixe um modelo:
ollama pull qwen2.5:14b-instruct-q8_0 - 5Rode como servidor de rede:
OLLAMA_HOST=0.0.0.0 ollama serve - 6Instale o Open WebUI para interface no navegador:
docker run -d -p 3000:8080 --gpus all ghcr.io/open-webui/open-webui:cuda - 7Use o Tailscale para acesso remoto seguro de qualquer dispositivo
Comparação de desempenho nos três builds
O desempenho do hardware é o mesmo das medições anteriores de 2026 — só os preços mudaram.
| Modelo + quantização | Econômico (~R$ 25.000) | Recomendado (~R$ 49.000) | Profissional (~R$ 81.000) |
|---|---|---|---|
| Llama 3.1 8B Q4 | 55–70 tok/s | 105–125 tok/s | 120–140 tok/s |
| Qwen3 14B Q8 | 20–28 tok/s | 48–60 tok/s | 55–70 tok/s |
| Qwen3 32B Q4 | 12–18 tok/s | 28–38 tok/s | 40–55 tok/s |
| Llama 3.3 70B Q4 | 5–8 tok/s (CPU) | 10–15 tok/s (CPU) | 25–40 tok/s (GPU) |
| Mixtral 8x22B Q4 | 15–22 tok/s | 32–45 tok/s | 45–60 tok/s |
Custo total de propriedade: workstation vs. GPU na nuvem
O custo de hardware do build Recomendado subiu no mercado internacional desde maio de 2026 (RAM e armazenamento, não a GPU) — a amortização frente ao aluguel na nuvem mudou na mesma proporção.
| Uso | Custo nuvem/ano (A40 a US$0,44/h) | Custo elétrico workstation/ano | Retorno vs. nuvem |
|---|---|---|---|
| 2 h/dia | ~R$ 1.750 | ~R$ 260 (@R$0,80/kWh) | ~19 anos — a nuvem ganha |
| 4 h/dia | ~R$ 3.500 | ~R$ 520 | ~16 anos |
| 8 h/dia | ~R$ 7.000 | ~R$ 1.040 | ~8 anos |
Com os preços de hardware do Brasil (impostos e câmbio inclusos), a workstation só compensa claramente no cálculo puro de custo com uso muito intenso e prolongado. Privacidade e independência da disponibilidade na nuvem são razões à parte para ir local, independentemente do retorno financeiro.
É melhor montar uma workstation ou alugar GPU na nuvem para rodar modelos de 70B?
Para uso muito regular e intenso, monte a workstation. Uma A40 dedicada de 48 GB na RunPod custa US$0,44/h — a 4 horas por dia, isso dá cerca de R$ 3.500 por ano. Aos preços de hardware do Brasil em 2026, o build Recomendado de ~R$ 49.000 leva bem mais tempo para se pagar frente à nuvem do que em mercados com hardware mais barato. Para uso ocasional, a nuvem é mais econômica.
Por que esse build custa tanto mais que outros guias de 2026?
RAM e armazenamento NVMe, não a GPU. Uma escassez global de DDR5/NAND em 2026 fez os preços internacionais de kits DDR5 de 64 GB subirem de forma acentuada entre maio e agosto, e SSDs NVMe de 4 TB também subiram bastante. No Brasil, esse efeito se soma aos impostos de importação e ao câmbio, tornando RAM e armazenamento proporcionalmente ainda mais caros que a GPU.
Devo comprar uma RTX 3090 usada ou nova?
Usada é a escolha padrão em 2026 — a produção acabou em 2022, então "nova" é apenas estoque antigo com ágio. Verifique ruído excessivo do cooler ou cheiro de queimado sob carga (sinais de uso em mineração), e prefira um vendedor com boa reputação e política de devolução no Mercado Livre.
Preciso de NVLink para rodar o Ollama em duas GPUs?
Não. O Ollama usa paralelismo de tensores CUDA para distribuir as camadas do modelo entre várias GPUs via PCIe — não precisa de NVLink. A configuração com dual RTX 3090 funciona perfeitamente sem NVLink.
Por que uma dual RTX 3090 em vez de uma RTX 4090 para o build profissional?
A VRAM é o fator decisivo. Duas RTX 3090 de 24 GB cada = 48 GB no total, suficiente para Llama 3.3 70B Q4 (~40 GB). Uma única RTX 4090 tem apenas 24 GB — o modelo 70B Q4 não cabe sem CPU offloading.
Upgrades que valem o investimento se você espera crescer
Três upgrades valem a pena se você acha que vai superar seu nível dentro de um ano:
- RAM: 64 GB → 128 GB — útil para modelos 70B com offload de CPU no nível Recomendado
- Armazenamento: 2 TB → 4 TB — útil se você mantém mais de 3–4 modelos grandes instalados ao mesmo tempo
- Refrigeração: AIO 240mm → 360mm — importa mais nos níveis Recomendado e Profissional
Qual workstation você deveria comprar?
Ainda em dúvida? Comece pelo build Recomendado RTX 4090 — oferece o melhor equilíbrio de desempenho, VRAM, consumo e capacidade de upgrade para a maioria dos usuários de IA local.
💰 Até R$ 30.000 — Build Econômico
~R$ 25.000 · RTX 3090 24GB
Roda qualquer modelo até 32B Q4 totalmente na GPU.
⭐ Melhor opção geral — Build Recomendado
~R$ 49.000 · RTX 4090 24GB
O melhor equilíbrio de desempenho, VRAM e preço para a maioria dos usuários.
🚀 70B / profissional — Build Profissional
~R$ 81.000 · Dual RTX 3090 (48GB)
Inferência 70B em velocidade de GPU (25–40 tok/s). Só para uso diário de 70B.
Leitura relacionada
- Melhor GPU para LLMs locais 2026 -- guia de compra de GPU para cada nível de workstation
- Melhor aplicativo de IA local para PC de baixo custo -- opções de software se você ainda não está pronto para uma workstation completa
- Melhor Mac para IA local 2026 -- alternativa Apple Silicon a uma workstation GPU
- Os melhores notebooks para rodar LLMs locais: guia de compra 2026 -- opções portáteis antes de se comprometer com um build de workstation
- Implantação Local do Qwen: Guia Completo de Produção 2026 -- implantação em produção depois de montar sua workstation
