Key Takeaways
- A RTX 4090 está descontinuada (EOL) desde 2026 — toda unidade no mercado é usada, a ~$2.000-2.600, bem acima dos ~$999-1.299 do início do ano.
- A RTX 5090 continua em produção, mas a escassez de memória GDDR7 de 2026 elevou o preço de mercado para $4.300-$5.000+, mais que o dobro do preço sugerido de $1.999.
- A RTX 5090 é ~30-50% mais rápida que a RTX 4090 para inferência de LLM local em modelos grandes (70B Q4). Em modelos 7B-13B a diferença é menor (~20%).
- A RTX 5090 tem 32 GB GDDR7 contra 24 GB GDDR6X da RTX 4090 — os 8 GB extras importam para 34B Q8 e execuções de 70B Q4 com contexto grande.
- Uma RTX 4090 usada (~$56-72 por milhão de tokens) ainda sai mais barata por token gerado que uma RTX 5090 nova pelo preço de mercado atual (~$83-96 por milhão de tokens).
- Para modelos 7B-13B: a 4090 é exagero independentemente do preço. Você atingirá limites de CPU ou refrigeração antes de saturar a GPU.
- Para modelos 70B: a 5090 se destaca. Pode rodar 2-3 modelos 70B menores em paralelo ou um único 70B com lotes maiores.
- A RTX 5080 costuma oferecer melhor custo-benefício que a 5090 para LLMs locais, a menos que você precise de configurações com GPU dupla, mas também está sujeita à inflação de preços causada pela escassez.
A RTX 4090 foi descontinuada e só está disponível no mercado usado, enquanto a RTX 5090 continua em produção, mas custa mais que o dobro do preço sugerido devido à escassez de memória GDDR7; a 5090 é 30-50% mais rápida em modelos grandes com 32GB de VRAM contra os 24GB da 4090, mas a 4090 usada ainda gera tokens mais barato por dólar.
Se você já tem uma RTX 4090, há pouco motivo para fazer upgrade agora -- o ágio de preço da 5090 não compensa o ganho de velocidade para a maioria dos usos de LLM local. Se você está comprando do zero e precisa de uma placa capaz de rodar 70B, uma RTX 4090 usada continua sendo o melhor custo-benefício, apesar do ágio por ser descontinuada, já que o preço da própria 5090 foi puxado para cima pela escassez de memória.
Quais são as diferenças reais de velocidade?
RTX 5090: 21.760 núcleos CUDA, 1.457 TFLOPS, ~1.792 GB/seg de largura de banda de memória, 32 GB GDDR7. Preço sugerido $1.999, mas preço de mercado de $4.300-$5.000+ em agosto de 2026 por causa da escassez de GDDR7.
RTX 4090: 16.384 núcleos CUDA, 826 TFLOPS, ~1.008 GB/seg de largura de banda de memória, 24 GB GDDR6X. Descontinuada (EOL) — a NVIDIA parou a produção. Toda unidade à venda é usada, a ~$2.000-2.600.
Inferência de LLM no mundo real (Llama 3.3 70B, Q4, batch=1): a RTX 5090 atinge ~50-55 tokens/seg, a RTX 4090 atinge ~36 tokens/seg. 40-50% mais rápida em modelos 70B. Essas velocidades por placa não mudam com os preços — só mudou o custo para consegui-las.
Para modelos 7B (limitados por memória, não por processamento): a RTX 5090 atinge ~90 tokens/seg, a RTX 4090 ~75 tokens/seg. ~20% mais rápida. A vantagem é menor em modelos menores.

A VRAM faz diferença entre a 4090 e a 5090?
A RTX 5090 tem 32 GB GDDR7. A RTX 4090 tem 24 GB GDDR6X. A diferença de 8 GB importa para tamanhos de modelo específicos — essa conta de VRAM não muda com a descontinuação da 4090 nem com o preço atual de nenhuma das duas placas.
A vantagem de VRAM da 5090 é real: 34B Q8 (~28 GB) cabe com folga em 32 GB, mas fica apertado em 24 GB. 70B Q4 (~38-40 GB) NÃO cabe em nenhuma das duas placas sozinha — é preciso GPU dupla ou Apple Silicon. Para modelos 7B-13B, 24 GB é mais que suficiente.
Custo por token: qual é realmente mais barata?
- RTX 4090 usada: ~$2.000-2.600 (EOL, só no mercado usado, contra ~$999-1.299 no início de 2026). Atinge 36 tokens/seg no Llama 70B. Custo por token: ~$56-72 por milhão de tokens.
- RTX 5090 nova: preço de mercado de $4.300-5.000+ (preço sugerido $1.999, inflado pela escassez de GDDR7 de 2026). Atinge ~52 tokens/seg no Llama 3.3 70B Q4. Custo por token: ~$83-96 por milhão de tokens.
- Veredito: a 4090 continua mais barata por token gerado, mesmo depois do aumento de preço causado pela descontinuação — o prêmio de escassez da 5090 cresceu mais rápido que o da 4090.

Quando você deve realmente fazer upgrade da 4090 para a 5090?
Nunca faça upgrade para inferência de 7B-13B. A 4090 é exagero para esses modelos, independentemente do preço. De qualquer forma você ficará limitado por CPU ou refrigeração.
Se você já tem uma 4090: mantenha-a. Com a 5090 a $4.300-5.000+ de preço de mercado, a conta do upgrade nunca esteve tão desfavorável. Só migre se precisar de mais de 40 tok/seg em 70B ou dos 32 GB para 34B Q8, e o custo não for um obstáculo.
Se você não tem nenhuma das duas e precisa de uma placa capaz de rodar 70B: compare os anúncios atuais. Uma 4090 usada (~$2.000-2.600, EOL/só usada) ainda vence uma 5090 nova (~$4.300-5.000+) em custo por token, ao custo de 30-50% menos desempenho.
A alternativa de duas GPUs mudou: duas RTX 4090 usadas agora custam juntas ~$4.000-5.200 — perto do preço de mercado de uma única 5090 — por ~65-72 tokens/seg combinados em 70B Q4 (semelhante ou melhor que uma única 5090). A contrapartida é o fornecimento só de placas usadas (sem garantia, oferta EOL) e mais complexidade de configuração (paralelismo de tensores).
Suposições comuns sobre a 5090
- Achar que a RTX 4090 ainda é vendida nova — não é mais. A NVIDIA descontinuou a série RTX 40 em 2026; toda 4090 no mercado é usada, a preços bem acima dos do início do ano.
- Pensar que o preço sugerido de $1.999 da RTX 5090 é o que você vai realmente pagar — em agosto de 2026, o preço de mercado é de $4.300-$5.000+ por causa da escassez de GDDR7.
- Achar que a 5090 é 2× mais rápida que a 4090 — ela é apenas 40-50% mais rápida em 70B, e só ~20% mais rápida em modelos 7B.
- Supor que as duas placas têm a mesma VRAM — não têm. A 5090 tem 32 GB, a 4090 tem 24 GB. A diferença de 8 GB importa para modelos 34B Q8.
- Acreditar que você precisa da 5090 para rodar modelos 70B — a 4090 os roda bem a 36 tokens/seg, o que é "suficiente" para a maioria dos usuários, e continua sendo a placa mais barata por token mesmo depois do aumento de preço por descontinuação.
Perguntas frequentes
A RTX 4090 ainda é vendida nova em 2026?
Não. A NVIDIA descontinuou a série RTX 40 em 2026. Toda RTX 4090 à venda hoje é usada, e os preços subiram para ~$2.000-2.600 por causa da escassez de fim de linha somada à demanda gerada pela própria escassez de GDDR7 da série RTX 50.
Vale a pena a RTX 5090 para rodar o Llama 3.3 70B?
Depende mais do preço do que nunca. A 4090 entrega ~36 tok/seg por ~$2.000-2.600 usada. A 5090 entrega ~52 tok/seg, mas custa $4.300-$5.000+ de preço de mercado em agosto de 2026. Vale a pena para uso contínuo de 70B; uma 4090 usada é a escolha mais prática nos demais casos.
Devo comprar uma RTX 5090 ou duas RTX 4090?
Duas 4090 usadas (~$4.000-5.200 no total) superam uma 5090 (~$4.300-5.000+ de preço de mercado) em velocidade bruta no 70B (~72 tok/seg combinados contra ~52). Mas uma configuração de duas GPUs adiciona complexidade — paralelismo de tensores, sem garantia por serem usadas. A 5090 é mais simples e continua em produção, e traz 32 GB de VRAM unificada para casos de 34B Q8.
A RTX 5090 tem mais VRAM que a 4090?
Sim. A RTX 5090 tem 32 GB GDDR7 contra 24 GB GDDR6X da RTX 4090. Os 8 GB extras permitem rodar modelos 34B Q8 (~28 GB necessários) sem aperto. Nenhuma das duas placas cabe com 70B Q4 (~38-40 GB) sem dividir entre GPUs. Essa diferença de VRAM não tem relação com a descontinuação da 4090.
A RTX 5090 é exagero para um modelo de 14B?
Sim, na maioria dos casos. Um modelo de 14B Q4 precisa de ~9 GB de VRAM e roda a ~55-65 tok/seg numa 4090 — já rápido. A 5090 daria ~65-75 tok/seg, uma melhora marginal. Uma 4090 usada (ou até uma 3090) é bem mais econômica para inferência de 14B, especialmente nos preços atuais da 5090.
A GPU da RTX 5090 para notebook tem 32 GB de VRAM?
Não. A RTX 5090 Laptop GPU tem 24 GB GDDR7 (reduzidos dos 32 GB da versão de mesa por limitações de energia e térmicas). É bem mais lenta que a 5090 de mesa, mas ainda mais rápida que uma 4090 na mesma tarefa.
O preço da 5090 vai cair até o preço sugerido de $1.999?
Só quando a escassez de memória GDDR7 de 2026 diminuir — não há prazo definido. O preço de mercado atual é de $4.300-$5.000+, mais que o dobro do preço sugerido. O histórico de preços da 4090 lembra que o mercado usado nem sempre cai: ela foi de $1.499 (lançamento em 2022) para um mínimo de ~$999 usada, e depois voltou a subir para ~$2.000-2.600 após sua descontinuação em 2026.
Posso usar a RTX 5090 com uma fonte de 750 W?
Por pouco. A RTX 5090 consome 575 W sozinha. Combine com uma fonte de 850 W ou 1000 W para evitar queda de tensão sob carga.
A RTX 5080 tem melhor custo-benefício que a 5090?
Na maioria dos casos, sim — a 5080 chega a cerca de 80% da velocidade da 5090 por um preço bem menor, embora também esteja sujeita à inflação de preços causada pela escassez de GDDR7 de 2026. Para LLMs locais, a 5080 costuma ser o ponto ideal.
Quanto mais rápida é a 5090 em modelos multimodais como o Qwen-VL 70B?
Um ganho semelhante de 20-25%. O processamento multimodal ainda é limitado por memória, então a vantagem de largura de banda da 5090 ajuda, mas não de forma dramática.
Fontes
- Especificações oficiais da NVIDIA RTX 5090 e 4090: núcleos CUDA, TFLOPS, largura de banda de memória
- MLCommons MLPerf Inference Benchmark: velocidade de geração de tokens em LLaMA 70B e modelos Mistral
- Banco de dados de GPUs da TechPowerUp: comparação de consumo de energia e largura de banda de memória RTX 5090 vs. 4090
