Key Takeaways
- Configuração econômica (~R$15.000): RTX 4090 (24 GB) + Ryzen 9 7950X + 64 GB DDR5. Executa 70B a 14 tok/s.
- Configuração padrão (~R$22.000): Dual RTX 4090 (48 GB combinada) + Threadripper 7970X + 128 GB DDR5. 2–3 usuários simultâneos de 70B.
- Alternativa Apple: Mac Studio M5 Max ($2.499, até 128GB de memória unificada) ou Mac Studio M5 Ultra ($5.499, até 512GB), disponível a partir de 22 de setembro de 2026 (configuração de 512GB em outubro de 2026). Mais silencioso, menor consumo de energia, sem necessidade de montar um PC — em troca de menor throughput multiusuário.
- Fonte mínima: 1.200W para RTX 4090 única. 2.000W+ para dual RTX 4090.
- Refrigeração: AIO 360 mm ou circuito personalizado para inferência 70B sustentada.
Perguntas frequentes
Um Threadripper é necessário, ou posso usar um Ryzen 9?
Apenas para inferência: o Ryzen 9 funciona bem. Para inferência + fine-tuning paralelo: os núcleos extras do Threadripper (32 vs. 16) são essenciais.
Devo usar NVLink para fundir as duas 4090?
Opcional. Pule se estiver rodando modelos separados em cada GPU (7B + 70B). Use se estiver distribuindo um único 70B entre as duas GPUs para batches maiores.
Quantos usuários simultâneos uma configuração dual-4090 suporta?
Para 70B: 2–3 usuários (14 tok/s cada). Para 7B: 8+ usuários (30+ tok/s cada).
Posso migrar para uma RTX 5090 em vez de dual 4090?
RTX 5090 única: desempenho semelhante ao dual 4090, metade da VRAM (24 GB vs. 48 GB), $1.999. Dual 5090: $4.000 (exagero, pior custo-benefício).
Qual o ROI de uma estação de $5.000 vs. API de LLM na nuvem?
Nuvem: $0,001 por 1K tokens. Estação: $5.000 amortizados em 2 anos = $2.500/ano, ~$0,000001 por token. Ponto de equilíbrio em 2,5 bilhões de tokens/ano (uso leve).
