Key Takeaways
- Melhor custo-benefício (2026): RTX 4070 Ti (US$ 600, lida com modelos 7-13B).
- Melhor sem limite de orçamento: RTX 5090 ou RTX 4090 (US$ 1.800-2.000, qualquer modelo em uma única GPU).
- Melhor opção equilibrada: RTX 4080 (US$ 1.200, lida com qualquer modelo com quantização Q5).
- Melhor para modelos de 70B: 2× RTX 4090 (US$ 3.600) ou RTX 6000 Ada (US$ 5.000).
- NVIDIA domina. AMD e Intel ficam significativamente atrás.
A melhor GPU para LLMs locais depende do seu orçamento e da velocidade desejada: a RTX 4090 é a melhor escolha com orçamento ilimitado, a RTX 4070 Ti oferece o melhor custo-benefício, e a RTX 4080 é uma opção intermediária equilibrada, com a NVIDIA dominando o mercado em geral.
Não existe uma única melhor GPU -- depende de quanto você quer gastar. Se dinheiro não é problema, escolha a RTX 4090 para máxima velocidade e VRAM. Se você quer o melhor custo-benefício, a RTX 4070 Ti acerta o ponto ideal. Se quer algo intermediário, a RTX 4080 equilibra preço e desempenho. As placas NVIDIA são a escolha segura padrão, já que quase todo o software de LLM local é desenvolvido e testado nelas primeiro.
Comparativo de GPUs por preço e desempenho
| Nível | GPU | VRAM | Velocidade (7B) | Preço |
|---|---|---|---|---|
| Econômico | RTX 4070 Ti | 12 GB | 80 tok/s | US$ 600-700 |
| Econômico-intermediário | RTX 5070 | 12 GB | 85 tok/s | US$ 550 |
| Intermediário | RTX 4080 | 16 GB | 120 tok/s | US$ 1.200 |
| Premium | RTX 4090 | 24 GB | 150 tok/s | US$ 1.800 |
| Premium | RTX 5090 | 32 GB | 160 tok/s | US$ 1.999 |
Faixa econômica (US$ 400-700)
RTX 4070 Ti (recomendada): US$ 600, 12 GB VRAM, 80 tok/s. Melhor custo-benefício para uso pessoal.
RTX 5070 (nova, início de 2026): US$ 550, 12 GB. Leve melhora de velocidade em relação à RTX 4070 Ti.
RTX 4070 (anterior): US$ 400, 12 GB. Ligeiramente mais lenta, não recomendada para novas builds.
Faixa intermediária (US$ 800-1.500)
RTX 4080 (US$ 1.200): 16 GB VRAM, 120 tok/s. Ideal para qualquer modelo de 7-13B.
RTX 5080 (nova, início de 2026): US$ 1.199, 16 GB. ~15% mais rápida que a RTX 4080.
RTX 4080 Super: Praticamente idêntica à RTX 4080, mesmo preço.
Topo de linha (US$ 1.600+)
RTX 4090 (US$ 1.800): 24 GB VRAM, 150 tok/s. GPU de consumo mais rápida. Pode rodar qualquer modelo em uma única GPU.
RTX 5090 (US$ 1.999): 32 GB VRAM, 160 tok/s. Último flagship. Ganho de velocidade marginal em relação à RTX 4090.
RTX 6000 Ada (US$ 5.000): GPU de servidor, 48 GB. Para deployments em produção.
Qual modelo de LLM local cabe na sua GPU
O nível da GPU determina qual tamanho de modelo você consegue rodar — não o contrário. A tabela abaixo mapeia a VRAM de cada GPU para o maior modelo que cabe confortavelmente em Q4_K_M, usando as mesmas famílias de modelos referenciadas em nossos guias de GPU (Qwen3, Gemma 4, DeepSeek, Llama).
| GPU (VRAM) | Melhor modelo | Quantização | Velocidade | Notas |
|---|---|---|---|---|
| RTX 4070 Ti / RTX 5070 (12 GB) | Qwen3 14B (denso) | Q4_K_M | ~35-45 tok/s | Mesmo nível de 12 GB de uma RTX 3060 econômica, mas 3-4x mais rápida. Também roda Qwen3 8B a 60+ tok/s. |
| RTX 4080 / RTX 5080 (16 GB) | gpt-oss:20b ou Gemma 4 E12B | Q4_K_M | ~55-65 tok/s | 16 GB é o mínimo para gpt-oss:20b (21B total / 3.6B ativos MoE); deixa margem para janelas de contexto maiores. |
| RTX 4090 / RX 7900 XTX (24 GB) | Denso 32-34B em Q5, ou Llama 4 Scout em 1.78-bit | Q5_K_M / IQ1_S | ~90-100 tok/s (34B) / ~20 tok/s (Scout) | O Llama 4 Scout (17B ativos / 109B total MoE) precisa de ~55 GB em Q4 — só cabe em 24 GB com uma quantização agressiva abaixo de 2 bits. |
| RTX 5090 (32 GB) | Denso 34B em Q8, ou Llama 4 Scout em ~2-bit | Q8_0 / IQ2_XS | ~130-150 tok/s (34B) | Os 8 GB extras em relação à RTX 4090 compram principalmente quantização de maior fidelidade nos mesmos tamanhos de modelo, não acesso a uma classe maior. |
| 2× RTX 4090 (48 GB combinados) | Llama 3.3 70B | Q5_K_M | ~100 tok/s | O ponto de entrada prático para modelos de classe 70B. Uma única RTX 6000 Ada (48 GB) é a alternativa profissional. |
GPUs AMD e Intel: status em agosto de 2026
AMD (ROCm): Melhorando e competitiva em preço — a RX 7900 XTX se equipara à RTX 4080. O suporte do driver ROCm exige mais esforço de configuração do que CUDA (agosto de 2026, ROCm 6.x) — verifique a lista de compatibilidade atual antes de comprar. Uma boa opção se você preferir o ecossistema AMD.
Melhor modelo para a RX 7900 XTX (24 GB): O mesmo nível de uma RTX 4090 — modelos densos de 32-34B em Q5, ou Llama 4 Scout em quantização agressiva de 1.78-bit — mas via ROCm em vez de CUDA, e tipicamente 10-20% mais lenta na mesma faixa de VRAM.
Intel Arc A770: Lenta demais para uso prático com LLMs. Não recomendada.
Recomendação: Fique com a NVIDIA pela estabilidade e maturidade do ecossistema.
Comparativo histórico: como a potência das GPUs cresceu
Contexto: a velocidade com que o desempenho das GPUs avançou:
| GPU | VRAM | Velocidade (7B) | Preço |
|---|---|---|---|
| RTX 2080 (2019) | 8 GB | 10 tok/s | US$ 700 |
| RTX 3090 (2020) | 24 GB | 25 tok/s | US$ 1.500 |
| RTX 4070 (2022) | 12 GB | 60 tok/s | US$ 600 |
| RTX 4090 (2022) | 24 GB | 150 tok/s | US$ 1.800 |
| RTX 5090 (2026) | 32 GB | 160 tok/s | US$ 2.000 |
Erros comuns ao escolher uma GPU
- Comprar uma RTX 3090 em 2026. Antiga e mais lenta. Não vale a pena por nenhum preço. Compre apenas a geração atual (série 40/50).
- Supor que mais VRAM = mais velocidade. O tamanho da VRAM não afeta a velocidade. A RTX 4080 (16 GB) é mais rápida que a RTX 3090 (24 GB).
- Achar que precisa de uma RTX 6000 para uso pessoal. Superdimensionamento enorme. A RTX 4090 lida com qualquer modelo pessoal com facilidade.
- Comprar pensando em blindagem contra obsolescência além de 2 anos. A tecnologia de GPU evolui rápido. Compre para as necessidades de hoje e faça upgrade em 2 anos.
Perguntas frequentes
Quanta VRAM eu preciso para LLMs locais?
12 GB de VRAM lida confortavelmente com modelos de 7B e 13B (quantização Q5). 16 GB lida com modelos de até 20B. 24 GB (RTX 4090) roda qualquer modelo em uma única GPU, incluindo 34B em Q5. Para modelos de 70B, você precisa de 2× GPUs de 24 GB ou quantização agressiva para Q2–Q3, com perda severa de qualidade.
A RTX 4090 vale o preço para LLMs locais?
Sim, se você roda regularmente modelos de 13B–34B ou precisa de velocidade máxima de inferência. A US$ 1.800, a RTX 4090 oferece 24 GB de VRAM e 150 tok/s em modelos de 7B. Se você só roda modelos de 7B, a RTX 4070 Ti a US$ 600 entrega 80 tok/s — 80% do desempenho por 33% do custo.
Devo comprar uma GPU AMD para LLMs locais?
A AMD é viável para LLMs em 2026, especialmente se você prefere o ecossistema AMD. A maioria dos frameworks de LLM (vLLM, llama.cpp, Ollama) é otimizada primeiro para CUDA, e o suporte do driver ROCm exige mais esforço de configuração do que o CUDA (agosto de 2026, ROCm 6.x) — verifique a lista de compatibilidade atual antes de comprar. A RX 7900 XTX da AMD compete bem em preço.
Qual é a melhor GPU para rodar modelos de 70B localmente?
Duas GPUs RTX 4090 (US$ 3.600 no total, 48 GB de VRAM combinada) é a melhor opção para consumidores. Isso roda o Llama 3.3 70B em quantização Q5 a ~100 tok/s. Uma única RTX 6000 Ada (US$ 5.000, 48 GB) é a alternativa profissional. Evite tentar rodar 70B em uma única GPU de consumo — a quantização Q2 necessária degrada a qualidade severamente.
Como o tamanho da VRAM afeta o desempenho de LLMs locais?
O tamanho da VRAM determina quais tamanhos de modelo você pode rodar — mais VRAM = modelos maiores. O tamanho da VRAM não afeta diretamente a velocidade de inferência para modelos que cabem nela. Uma RTX 4080 (16 GB, 120 tok/s) é mais rápida que uma RTX 3090 (24 GB, 25 tok/s) apesar de ter menos VRAM, porque a largura de banda de memória e a arquitetura de computação importam mais.
Preciso de uma nova geração de GPU para LLMs locais?
Sim — compre RTX série 40 ou mais recente (série 50 em 2026). A série RTX 30 (3090, 3080) é significativamente mais lenta: uma 3090 alcança 25 tok/s contra 150 tok/s de uma 4090 pelo mesmo preço hoje. A RTX 2080 (8 GB) é impraticável para qualquer coisa além de modelos de 3B. Apenas hardware da geração atual é recomendado para novos sistemas.
Qual GPU tem 32 GB de VRAM para LLMs locais em 2026?
A RTX 5090 (32 GB, ~US$ 1.999) é atualmente a única GPU de consumo com 32 GB de VRAM. Os 8 GB extras em relação à RTX 4090 (24 GB) compram principalmente quantização de maior fidelidade nos mesmos tamanhos de modelo — Q8 em vez de Q5 em modelos densos de 34B — não acesso a uma classe de modelo maior. Para modelos de classe 70B sem compressão agressiva, você ainda precisa de 48 GB no total.
A AMD RX 7900 XTX é boa para inferência de LLMs locais?
Sim, para os mesmos tamanhos de modelo que uma RTX 4090 — seus 24 GB de VRAM comportam modelos densos de 32-34B em Q5 e o Llama 4 Scout em quantização agressiva de 1.78-bit. A contrapartida é de software: o ROCm exige mais configuração de drivers e frameworks do que o CUDA (verifique a lista de compatibilidade atual do llama.cpp/Ollama/vLLM antes de comprar), e o throughput de inferência no ROCm normalmente fica 10-20% atrás do CUDA na mesma faixa de VRAM.
Posso comprar GPU NVIDIA no Brasil para LLMs?
Sim, mas os preços no Brasil são significativamente mais altos devido a impostos de importação. RTX 4070 Ti custa R$ 4.000-5.500. RTX 4090 pode custar R$ 9.000-14.000. Considere importar dos EUA se possível.
Fontes
- Especificações de GPU NVIDIA -- nvidia.com/en-us/geforce
- Banco de dados de GPUs TechPowerUp -- techpowerup.com/gpu-specs
- Benchmarks de desempenho de LLMs -- github.com/vllm-project/vllm/tree/main/benchmarks
