Skip to main content
PromptQuorum
Início/LLMs locais avançados/Melhor workstation para IA local 2026: três níveis de orçamento
Overview & Reference

Melhor workstation para IA local 2026: três níveis de orçamento

··Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

**A melhor workstation de IA local em 2026 para a maioria dos usuários é o build de ~R$ 49.000: RTX 4090 (24 GB VRAM) + Ryzen 9 9950X + 64 GB DDR5. Roda modelos 7B a 100–120 tok/s, 14B em Q8 sem offloading e 30B Q4 a 25–35 tok/s. Vá direto ao nível: Econômico ~R$ 25.000 · Recomendado ~R$ 49.000 · Profissional ~R$ 81.000.**

Esta página contém links de referência para produtos de terceiros. O PromptQuorum não está inscrito em nenhum programa de afiliados — são links simples que não geram comissão. Clicar nos links e os próximos passos são de sua inteira responsabilidade. Estes links não representam qualquer endosso ou verificação por parte do PromptQuorum.

Ver componentes do build Econômico →link de produto · divulgadoVer componentes do build Recomendado →link de produto · divulgadoVer componentes do build Profissional →link de produto · divulgado
Melhor workstation para IA local 2026: três níveis de orçamento

Principais conclusões

  • A RTX 4090 continua a melhor GPU de consumo individual para IA local em 2026: 24 GB VRAM, ~1 TB/s de largura de banda — seu preço de segunda mão até caiu um pouco desde a primavera
  • A escassez global de memória de 2026 pesa mais no orçamento do que a variação de preço da GPU — kits DDR5 de 64 GB ficaram de 3 a 6 vezes mais caros no mercado internacional desde maio
  • Os modelos 70B Q4 precisam de mais de 40 GB VRAM — exigem dual RTX 3090 ou CPU offloading
  • O Ryzen 9 9950X (Zen 5, 16 núcleos) é a única peça que ficou mais barata no período — preço de rua em queda no mercado internacional
  • NVMe PCIe Gen 4/5 carrega um modelo de 7B em menos de 2 segundos, mas um SSD Gen 5 de 4 TB ficou bem mais caro no mesmo período
  • Os Níveis 1 e 2 compartilham o socket AM5 — atualize GPU/RAM sem trocar a placa-mãe; o Nível 3 exige TRX50

Qual workstation você deveria montar?

Escolha seu build pelo maior modelo que você realmente precisa rodar: 7B–14B → Econômico. 14B–32B → Recomendado. 70B → Profissional. Preços de sistema completo, conferidos em 25 de agosto de 2026.

EconômicoRecomendadoProfissional
Preço~R$ 25.000~R$ 49.000~R$ 81.000
GPURTX 3090 24GB (usada)RTX 4090 24GB2× RTX 3090 (48GB)
CPURyzen 7 7700XRyzen 9 9950XThreadripper 7960X
RAM64GB DDR564GB DDR5-6000256GB DDR5 ECC
Modelo máximo32B Q4 na GPU30B Q4 GPU / 70B offload70B Q4 em velocidade de GPU
Ideal paraOrçamento apertado, 7B–14BA maioria dos usuários, 14B–32BCargas 70B, múltiplos usuários

Os preços no Brasil ficam bem acima da conversão direta de dólar por causa de impostos de importação e ICMS sobre hardware de PC — os totais abaixo já refletem preços de varejo típicos no Brasil (Mercado Livre/Amazon.com.br), não uma conversão cambial simples.

Ver componentes do build Econômico →link de produto · divulgadoVer componentes do build Recomendado →link de produto · divulgadoVer componentes do build Profissional →link de produto · divulgado

A VRAM determina seu build

Não sabe qual nível você precisa? Parta do maior modelo que você realmente vai usar, não daquele que talvez use um dia.

Tamanho do modeloVRAM recomendadaMelhor build
7B8–12 GBEconômico (RTX 3090 com folga de sobra)
14B16–24 GBEconômico ou Recomendado
32B Q4~20–24 GBRecomendado (RTX 4090)
70B Q4~40 GB+Profissional (dual RTX 3090) ou offload no Recomendado
70B Q8~70 GB+Só multi-GPU — veja nosso guia de GPU

Só quer uma GPU avulsa (não um build completo)? Veja nosso guia de compra de GPU.

Nível 1: ~R$ 25.000 workstation de IA econômica

O build econômico usa uma RTX 3090 usada (24 GB VRAM) como núcleo. Roda Llama 3.1 8B Q8 a 45–60 tok/s, Qwen3 14B Q8 a 20–28 tok/s e Qwen3 32B Q4 a 12–18 tok/s totalmente na GPU. Escolha este build se: seu orçamento está abaixo de R$ 30.000, você usa principalmente modelos 7B–32B, e não se importa em comprar uma GPU usada. Pule se: o 70B é sua carga principal — o offloading para CPU neste nível roda a 5–8 tok/s, funcional mas lento.

  • Modelos compatíveis em velocidade total de GPU: 7B (qualquer quantização), 13B (Q4/Q8), 14B (Q4/Q8), 30B (Q4)
  • Suporte a 70B: exige CPU offloading — ~5–8 tok/s, funcional mas não ideal
  • Consumo elétrico: ~450 W em pico (GPU 350 W + CPU 65 W + restante)
ComponenteModeloPreço (ago 2026)
GPUNVIDIA RTX 3090 (usada, 24 GB)~R$ 8.500
CPUAMD Ryzen 7 7700X~R$ 2.000
Placa-mãeMSI MAG X670E Tomahawk WiFi~R$ 1.750
RAM64 GB DDR5-5600 (2×32 GB)~R$ 8.000 (maio: ~R$ 1.100)
Armazenamento2 TB PCIe Gen 4 NVMe~R$ 3.300 (maio: ~R$ 900)
Fonte850 W certificada 80+ Gold~R$ 1.000
GabineteTorre média ATX, 3+ slots para ventoinhas~R$ 750
Cooler de CPUAIO 240mm ou torre~R$ 650
Total~R$ 25.950
Comparação das três configurações de workstation de IA local por hardware: a econômica usa uma RTX 3090 (24 GB VRAM) executando modelos 70B a 5-8 tok/s via offload de CPU, a recomendada usa uma RTX 4090 (24 GB VRAM) a 10-15 tok/s, e a profissional usa duas RTX 3090 (48 GB VRAM) a 25-40 tok/s na GPU.
Comparação das três configurações de workstation de IA local por hardware: a econômica usa uma RTX 3090 (24 GB VRAM) executando modelos 70B a 5-8 tok/s via offload de CPU, a recomendada usa uma RTX 4090 (24 GB VRAM) a 10-15 tok/s, e a profissional usa duas RTX 3090 (48 GB VRAM) a 25-40 tok/s na GPU.

💡Tip: Usada vs. nova: as RTX 3090 usadas custam bem menos que o pouco estoque novo restante, ao custo de uma garantia incerta. Prefira um vendedor com boa reputação e política de devolução, e verifique sinais de desgaste por mineração (ruído do cooler, cheiro de queimado sob carga).

RTX 3090 usada no Mercado Livre →link de produto · divulgadoAMD Ryzen 7 7700X na Amazon.com.br →link de produto · divulgadoVer o build Econômico completo →link de produto · divulgado

Nível 2: ~R$ 49.000 workstation de IA recomendada

O build recomendado se concentra na RTX 4090 (24 GB, ~1 TB/s de largura de banda de memória) combinada com o AMD Ryzen 9 9950X (Zen 5, 16 núcleos). A 4090 é 30–40% mais rápida que a 3090 por GB de VRAM. Escolha este build se: você quer a melhor workstation mono-GPU, usa modelos 14B–32B regularmente, e ocasionalmente faz offload de um 70B. Pule se: o 70B é sua carga diária principal — vá de Profissional para velocidade de GPU no 70B.

  • Velocidade 7B Q4: ~105–125 tok/s no Ollama
  • Velocidade 14B Q8: ~48–60 tok/s
  • Velocidade 30B Q4: ~28–38 tok/s
  • 70B Q4 (CPU offloading): ~10–15 tok/s com 64 GB RAM
  • Consumo elétrico: ~550 W em pico
ComponenteModeloPreço (ago 2026)
GPUNVIDIA GeForce RTX 4090 24 GB~R$ 21.500
CPUAMD Ryzen 9 9950X (16C/32T, Zen 5)~R$ 4.700
Placa-mãeASUS ProArt X870E-Creator WiFi~R$ 5.000
RAM64 GB DDR5-6000 CL30 (2×32 GB)~R$ 8.500 (maio: ~R$ 1.450)
Armazenamento4 TB PCIe Gen 5 NVMe~R$ 7.700 (maio: ~R$ 2.000)
Fonte1000 W certificada 80+ Platinum~R$ 1.700
GabineteTorre completa ATX com bom fluxo de ar~R$ 1.300
Cooler de CPUAIO 360mm~R$ 1.000
Total~R$ 51.400
RTX 4090 — ver preço atual →link de produto · divulgadoRyzen 9 9950X na Amazon.com.br →link de produto · divulgadoVer o build Recomendado completo →link de produto · divulgado

Nível 3: ~R$ 81.000 workstation profissional 70B

O build profissional é voltado para a inferência de modelos 70B em velocidade de GPU (25–40 tok/s) usando duas RTX 3090 para um total de 48 GB VRAM. O Ryzen Threadripper 7960X (24 núcleos) acelera o CPU offloading. Com 256 GB DDR5 ECC, até os modelos 140B quantizados carregam totalmente na RAM. Escolha este build se: o 70B é sua carga principal, você precisa de 48 GB+ de VRAM de GPU, ou atende vários usuários simultâneos. Pule se: você nunca rodou um modelo maior que 32B — este nível é um investimento excessivo nesse caso.

  • Velocidade 70B Q4: 25–40 tok/s (ambas RTX 3090 ativas via paralelismo de tensores)
  • CPU offloading com 256 GB RAM: roda modelos de 140B+ a 4–6 tok/s
  • Consumo elétrico: ~900 W em pico
ComponenteModeloPreço (ago 2026)
GPU ×22× NVIDIA RTX 3090 24 GB (usadas)~R$ 17.000
CPUAMD Ryzen Threadripper 7960X (24C)~R$ 14.000 (volátil — varia bastante)
Placa-mãeASUS Pro WS TRX50-SAGE WiFi~R$ 8.000
RAM256 GB DDR5-5200 ECC (8×32 GB)~R$ 27.500 (maio: ~R$ 7.000 — confirme antes de comprar)
Armazenamento8 TB PCIe Gen 4 NVMe (2×4 TB)~R$ 14.000 (maio: ~R$ 3.900)
Fonte1600 W Platinum modular~R$ 3.500
GabineteTorre completa HEDT ATX~R$ 2.200
Cooler de CPUAIO 360mm + ventoinhas adicionais~R$ 1.500
Total~R$ 87.700
Árvore de decisão para escolher o nível de workstation de IA local pelo tamanho máximo do modelo: configurações até 30B levam ao nível Econômico (RTX 3090) ou Recomendado (RTX 4090), enquanto configurações de 70B levam ao Recomendado via offload de CPU (10-15 tok/s) ou ao Profissional com duas RTX 3090 em velocidade total de GPU (25-40 tok/s).
Árvore de decisão para escolher o nível de workstation de IA local pelo tamanho máximo do modelo: configurações até 30B levam ao nível Econômico (RTX 3090) ou Recomendado (RTX 4090), enquanto configurações de 70B levam ao Recomendado via offload de CPU (10-15 tok/s) ou ao Profissional com duas RTX 3090 em velocidade total de GPU (25-40 tok/s).

⚠️Warning: A escassez de DDR5 de 2026 atingiu com mais força a memória de servidor ECC/RDIMM — kits DDR5 ECC de 256 GB são escassos e com preço volátil no Brasil e no exterior. Consiga uma cotação atualizada de RAM listada na QVL da sua placa-mãe antes de comprar.

2× RTX 3090 no Mercado Livre →link de produto · divulgadoRyzen Threadripper 7960X na Amazon.com.br →link de produto · divulgadoVer o build Profissional completo →link de produto · divulgado

Hardware que não compraríamos para esse uso

  • Uma GPU de 8 GB se o objetivo são modelos de 32B — você bate no limite de VRAM imediatamente
  • Uma CPU cara com uma GPU insuficiente — a GPU e sua VRAM decidem a velocidade de inferência muito mais que o clock da CPU
  • Um SSD SATA para uma workstation de IA nova — carregamento de modelos 5x mais lento que NVMe Gen 4 por uma diferença pequena de preço
  • Uma fonte insuficiente — o nível Profissional chega a picos de ~900 W
  • 32 GB de RAM para offloading sério de 70B em CPU — o próprio modelo precisa de ~40 GB só para caber na memória

Montar uma workstation ou alugar GPU na nuvem?

Workstation local vs. aluguel de GPU na nuvem

Use um LLM local se:

  • Você usa modelos locais 2+ horas/dia
  • Privacidade ou residência de dados importam para seu uso
  • Você quer um custo fixo e previsível a longo prazo
  • Você já decidiu por um dos níveis acima

Use um modelo em nuvem se:

  • Você usa modelos locais menos de 1 hora/dia
  • Seu uso é ocasional ou pontual (testes, lotes)
  • Você não quer lidar com manutenção de hardware
  • Você quer testar um modelo 70B+ antes de investir em hardware

Decisão rápida:

  • Uso diário intenso → monte a workstation (veja as tabelas de níveis acima)
  • Uso ocasional/de avaliação → alugue GPU na nuvem
  • Não tem certeza? Veja a tabela de retorno do investimento abaixo
  • Comparar provedores de GPU na nuvem →

Stack de software para qualquer build

Uma vez montado o hardware, colocar o Ollama em funcionamento leva menos de 10 minutos:

  1. 1
    Instale o Ubuntu 22.04 LTS ou o Windows 11 (o Ubuntu é preferível pela estabilidade do CUDA)
  2. 2
    Instale os drivers da NVIDIA 550+ do nvidia.com ou com ubuntu-drivers autoinstall
  3. 3
    Instale o Ollama: curl -fsSL https://ollama.com/install.sh | sh
  4. 4
    Baixe um modelo: ollama pull qwen2.5:14b-instruct-q8_0
  5. 5
    Rode como servidor de rede: OLLAMA_HOST=0.0.0.0 ollama serve
  6. 6
    Instale o Open WebUI para interface no navegador: docker run -d -p 3000:8080 --gpus all ghcr.io/open-webui/open-webui:cuda
  7. 7
    Use o Tailscale para acesso remoto seguro de qualquer dispositivo

Comparação de desempenho nos três builds

O desempenho do hardware é o mesmo das medições anteriores de 2026 — só os preços mudaram.

Modelo + quantizaçãoEconômico (~R$ 25.000)Recomendado (~R$ 49.000)Profissional (~R$ 81.000)
Llama 3.1 8B Q455–70 tok/s105–125 tok/s120–140 tok/s
Qwen3 14B Q820–28 tok/s48–60 tok/s55–70 tok/s
Qwen3 32B Q412–18 tok/s28–38 tok/s40–55 tok/s
Llama 3.3 70B Q45–8 tok/s (CPU)10–15 tok/s (CPU)25–40 tok/s (GPU)
Mixtral 8x22B Q415–22 tok/s32–45 tok/s45–60 tok/s

Custo total de propriedade: workstation vs. GPU na nuvem

O custo de hardware do build Recomendado subiu no mercado internacional desde maio de 2026 (RAM e armazenamento, não a GPU) — a amortização frente ao aluguel na nuvem mudou na mesma proporção.

UsoCusto nuvem/ano (A40 a US$0,44/h)Custo elétrico workstation/anoRetorno vs. nuvem
2 h/dia~R$ 1.750~R$ 260 (@R$0,80/kWh)~19 anos — a nuvem ganha
4 h/dia~R$ 3.500~R$ 520~16 anos
8 h/dia~R$ 7.000~R$ 1.040~8 anos

Com os preços de hardware do Brasil (impostos e câmbio inclusos), a workstation só compensa claramente no cálculo puro de custo com uso muito intenso e prolongado. Privacidade e independência da disponibilidade na nuvem são razões à parte para ir local, independentemente do retorno financeiro.

É melhor montar uma workstation ou alugar GPU na nuvem para rodar modelos de 70B?

Para uso muito regular e intenso, monte a workstation. Uma A40 dedicada de 48 GB na RunPod custa US$0,44/h — a 4 horas por dia, isso dá cerca de R$ 3.500 por ano. Aos preços de hardware do Brasil em 2026, o build Recomendado de ~R$ 49.000 leva bem mais tempo para se pagar frente à nuvem do que em mercados com hardware mais barato. Para uso ocasional, a nuvem é mais econômica.

Por que esse build custa tanto mais que outros guias de 2026?

RAM e armazenamento NVMe, não a GPU. Uma escassez global de DDR5/NAND em 2026 fez os preços internacionais de kits DDR5 de 64 GB subirem de forma acentuada entre maio e agosto, e SSDs NVMe de 4 TB também subiram bastante. No Brasil, esse efeito se soma aos impostos de importação e ao câmbio, tornando RAM e armazenamento proporcionalmente ainda mais caros que a GPU.

Devo comprar uma RTX 3090 usada ou nova?

Usada é a escolha padrão em 2026 — a produção acabou em 2022, então "nova" é apenas estoque antigo com ágio. Verifique ruído excessivo do cooler ou cheiro de queimado sob carga (sinais de uso em mineração), e prefira um vendedor com boa reputação e política de devolução no Mercado Livre.

Preciso de NVLink para rodar o Ollama em duas GPUs?

Não. O Ollama usa paralelismo de tensores CUDA para distribuir as camadas do modelo entre várias GPUs via PCIe — não precisa de NVLink. A configuração com dual RTX 3090 funciona perfeitamente sem NVLink.

Por que uma dual RTX 3090 em vez de uma RTX 4090 para o build profissional?

A VRAM é o fator decisivo. Duas RTX 3090 de 24 GB cada = 48 GB no total, suficiente para Llama 3.3 70B Q4 (~40 GB). Uma única RTX 4090 tem apenas 24 GB — o modelo 70B Q4 não cabe sem CPU offloading.

Upgrades que valem o investimento se você espera crescer

Três upgrades valem a pena se você acha que vai superar seu nível dentro de um ano:

  • RAM: 64 GB → 128 GB — útil para modelos 70B com offload de CPU no nível Recomendado
  • Armazenamento: 2 TB → 4 TB — útil se você mantém mais de 3–4 modelos grandes instalados ao mesmo tempo
  • Refrigeração: AIO 240mm → 360mm — importa mais nos níveis Recomendado e Profissional
Ver kits DDR5 de 128GB →link de produto · divulgadoVer SSDs NVMe de 4TB →link de produto · divulgado

Qual workstation você deveria comprar?

Ainda em dúvida? Comece pelo build Recomendado RTX 4090 — oferece o melhor equilíbrio de desempenho, VRAM, consumo e capacidade de upgrade para a maioria dos usuários de IA local.

1

💰 Até R$ 30.000 — Build Econômico

~R$ 25.000 · RTX 3090 24GB

Roda qualquer modelo até 32B Q4 totalmente na GPU.

Ver o build Econômico →link de produto · divulgado
2

⭐ Melhor opção geral — Build Recomendado

~R$ 49.000 · RTX 4090 24GB

O melhor equilíbrio de desempenho, VRAM e preço para a maioria dos usuários.

Ver o build Recomendado →link de produto · divulgado
3

🚀 70B / profissional — Build Profissional

~R$ 81.000 · Dual RTX 3090 (48GB)

Inferência 70B em velocidade de GPU (25–40 tok/s). Só para uso diário de 70B.

Ver o build Profissional →link de produto · divulgado

Leitura relacionada

← Voltar para LLMs locais avançados