Key Takeaways
- La RTX 4090 está descontinuada (EOL) desde 2026 — toda unidad en el mercado es usada, a ~$2.000-2.600, muy por encima de los ~$999-1.299 de principios de año.
- La RTX 5090 sigue en producción, pero la escasez de memoria GDDR7 de 2026 ha elevado el precio de calle a $4.300-$5.000+, más del doble de su PVP de $1.999.
- La RTX 5090 es ~30-50% más rápida que la RTX 4090 para inferencia LLM local en modelos grandes (70B Q4). En modelos de 7B-13B la diferencia es menor (~20%).
- La RTX 5090 tiene 32 GB GDDR7 frente a los 24 GB GDDR6X de la RTX 4090 — los 8 GB extra importan para 34B Q8 y ejecuciones de 70B Q4 con contexto amplio.
- Una RTX 4090 usada (~$56-72 por millón de tokens) sigue siendo más barata por token que una RTX 5090 nueva a precio de calle actual (~$83-96 por millón de tokens).
- Para modelos de 7B-13B: la 4090 es excesiva sin importar el precio. Alcanzarás límites de CPU o refrigeración antes de maximizar la GPU.
- Para modelos de 70B: la 5090 destaca. Puede ejecutar 2-3 modelos de 70B en paralelo o un único 70B con tamaños de lote mayores.
- La RTX 5080 suele ofrecer mejor valor que la 5090 para LLMs locales, salvo que necesites configuraciones de GPU dual, aunque también está sujeta a la inflación de precios por la escasez.
La RTX 4090 está descontinuada y solo se consigue en el mercado de segunda mano, mientras que la RTX 5090 sigue en producción pero cuesta más del doble de su PVP debido a la escasez de memoria GDDR7; la 5090 es un 30-50% más rápida en modelos grandes con 32GB de VRAM frente a los 24GB de la 4090, pero la 4090 usada sigue generando tokens más barato por dólar.
Si ya tienes una RTX 4090, hay poca razón para actualizar ahora mismo: la prima de precio de la 5090 no compensa su ganancia de velocidad para la mayoría de usos de LLM local. Si compras desde cero y necesitas una tarjeta capaz de 70B, una RTX 4090 usada sigue siendo mejor relación calidad-precio, a pesar de llevar una prima por ser descontinuada, ya que el precio de la propia 5090 se ha disparado por la escasez de memoria.
¿Cuáles son las diferencias reales de velocidad?
RTX 5090: 21.760 núcleos CUDA, 1.457 TFLOPS, ~1.792 GB/seg de ancho de banda de memoria, 32 GB GDDR7. PVP $1.999, pero el precio de calle es de $4.300-$5.000+ en agosto de 2026 por la escasez de GDDR7.
RTX 4090: 16.384 núcleos CUDA, 826 TFLOPS, ~1.008 GB/seg de ancho de banda de memoria, 24 GB GDDR6X. Descontinuada (EOL) — NVIDIA ha detenido su producción. Toda unidad a la venta es usada, a ~$2.000-2.600.
Inferencia LLM en el mundo real (Llama 3.3 70B, Q4, batch=1): la RTX 5090 alcanza ~50-55 tokens/seg, la RTX 4090 alcanza ~36 tokens/seg. 40-50% más rápida en modelos de 70B. Estas velocidades por tarjeta no cambian con los precios — solo ha cambiado lo que cuesta conseguirlas.
Para modelos de 7B (limitados por memoria, no por cómputo): la RTX 5090 alcanza ~90 tokens/seg, la RTX 4090 ~75 tokens/seg. ~20% más rápida. La ventaja es menor en modelos más pequeños.

¿Importa la VRAM entre la 4090 y la 5090?
La RTX 5090 tiene 32 GB GDDR7. La RTX 4090 tiene 24 GB GDDR6X. Los 8 GB de diferencia importan para tamaños de modelo específicos — esta relación de VRAM no cambia con la descontinuación de la 4090 ni con el precio actual de ninguna de las dos tarjetas.
La ventaja de VRAM de la 5090 es real: 34B Q8 (~28 GB) cabe cómodamente en 32 GB pero es ajustado en 24 GB. 70B Q4 (~38-40 GB) NO cabe en ninguna de las dos tarjetas sola — necesitas doble GPU o Apple Silicon. Para modelos de 7B-13B, 24 GB es más que suficiente.
Coste por token: ¿cuál es realmente más barata?
- RTX 4090 usada: ~$2.000-2.600 (EOL, solo en el mercado de usados, frente a los ~$999-1.299 de principios de 2026). Alcanza 36 tokens/seg en Llama 70B. Coste por token: ~$56-72 por millón de tokens.
- RTX 5090 nueva: $4.300-5.000+ de precio de calle (PVP $1.999, inflado por la escasez de GDDR7 de 2026). Alcanza ~52 tokens/seg en Llama 3.3 70B Q4. Coste por token: ~$83-96 por millón de tokens.
- Veredicto: la 4090 sigue siendo más barata por token generado, incluso tras su subida de precio por descontinuación — la prima de la 5090 por escasez ha crecido más rápido que la de la 4090.

¿Cuándo deberías actualizar realmente de la 4090 a la 5090?
Nunca actualices para inferencia de 7B-13B. La 4090 es excesiva para esos modelos sin importar el precio. De todos modos estarás limitado por CPU o refrigeración.
Si ya tienes una 4090: consérvala. Con la 5090 a $4.300-5.000+ de precio de calle, la actualización es menos rentable que nunca. Cambia solo si necesitas más de 40 tok/seg en 70B o los 32 GB para 34B Q8 y el coste no es un obstáculo.
Si no tienes ninguna y necesitas una tarjeta capaz de 70B: compara anuncios actuales. Una 4090 usada (~$2.000-2.600, EOL/solo usada) sigue ganando a una 5090 nueva (~$4.300-5.000+) en coste por token, a cambio de un 30-50% menos de rendimiento.
La alternativa de dos GPU ha cambiado: dos RTX 4090 usadas cuestan ahora en conjunto ~$4.000-5.200 — cerca del precio de calle de una sola 5090 — por ~65-72 tokens/seg combinados en 70B Q4 (similar o mejor que una sola 5090). Las contrapartidas son el abastecimiento solo de segunda mano (sin garantía, oferta EOL) y más complejidad de configuración (paralelismo de tensores).
Suposiciones comunes sobre la 5090
- Creer que la RTX 4090 se sigue vendiendo nueva — no es así. NVIDIA descontinuó la serie RTX 40 en 2026; toda 4090 en el mercado es usada, a precios muy por encima de los de principios de año.
- Pensar que el PVP de $1.999 de la RTX 5090 es lo que realmente pagarás — en agosto de 2026, el precio de calle es de $4.300-$5.000+ por la escasez de GDDR7.
- Creer que la 5090 es 2× más rápida que la 4090 — solo es un 40-50% más rápida en 70B, y solo ~20% más rápida en modelos de 7B.
- Asumir que ambas tienen la misma VRAM — no es así. La 5090 tiene 32 GB, la 4090 tiene 24 GB. Los 8 GB de diferencia importan para modelos de 34B Q8.
- Creer que necesitas la 5090 para ejecutar modelos de 70B — la 4090 los ejecuta bien a 36 tokens/seg, lo cual es "suficiente" para la mayoría de los usuarios, y sigue siendo la tarjeta más barata por token incluso tras su subida de precio por descontinuación.
Preguntas frecuentes
¿Se sigue vendiendo nueva la RTX 4090 en 2026?
No. NVIDIA descontinuó la serie RTX 40 en 2026. Toda RTX 4090 a la venta ahora es usada, y los precios han subido a ~$2.000-2.600 por la escasez EOL más la demanda derivada de la propia escasez de GDDR7 de la serie RTX 50.
¿Vale la pena la RTX 5090 para ejecutar Llama 3.3 70B?
Depende más del precio que nunca. La 4090 te da ~36 tok/seg por ~$2.000-2.600 usada. La 5090 da ~52 tok/seg pero cuesta $4.300-$5.000+ de calle en agosto de 2026. Vale la pena si usas 70B de forma continua; una 4090 usada es la opción práctica en otros casos.
¿Debo comprar una RTX 5090 o dos RTX 4090?
Dos 4090 usadas (~$4.000-5.200 en total) superan a una 5090 (~$4.300-5.000+ de calle) en velocidad bruta en 70B (~72 tok/seg combinados frente a ~52). Pero el montaje de dos GPU añade complejidad — paralelismo de tensores, sin garantía por ser usadas. La 5090 es más sencilla y sigue en producción, y añade 32 GB de VRAM unificada para 34B Q8.
¿Tiene la RTX 5090 más VRAM que la 4090?
Sí. La RTX 5090 tiene 32 GB GDDR7, la RTX 4090 tiene 24 GB GDDR6X. Los 8 GB extra permiten ejecutar modelos de 34B Q8 (~28 GB necesarios) sin apuros. Ninguna de las dos cabe con 70B Q4 (~38-40 GB) sin repartir entre GPUs. Esta diferencia de VRAM no tiene relación con la descontinuación de la 4090.
¿Es excesiva la RTX 5090 para un modelo de 14B?
Sí, en la mayoría de los casos. Un modelo de 14B Q4 necesita ~9 GB de VRAM y corre a ~55-65 tok/seg en una 4090 — ya es rápido. La 5090 daría ~65-75 tok/seg, una mejora marginal. Una 4090 usada (o incluso una 3090) es mucho más rentable para inferencia de 14B, especialmente a los precios actuales de la 5090.
¿Tiene la GPU portátil RTX 5090 32 GB de VRAM?
No. La RTX 5090 Laptop GPU tiene 24 GB GDDR7 (reducidos desde los 32 GB de la versión de escritorio por límites de potencia y térmicos). Es notablemente más lenta que la 5090 de escritorio, pero sigue siendo más rápida que una 4090 en la misma tarea.
¿Bajará el precio de la 5090 hasta su PVP de $1.999?
Solo cuando se alivie la escasez de memoria GDDR7 de 2026 — no hay una fecha fija. El precio de calle actual es de $4.300-$5.000+, más del doble del PVP. El historial de precios de la 4090 recuerda que el mercado de usados no siempre baja: cayó de $1.499 (lanzamiento en 2022) a un mínimo de ~$999 usada, y luego rebotó a ~$2.000-2.600 tras su descontinuación en 2026.
¿Puedo usar la RTX 5090 con una fuente de alimentación de 750 W?
Con dificultades. La RTX 5090 consume 575 W por sí sola. Usa una fuente de 850 W o 1000 W para evitar caídas de tensión bajo carga.
¿La RTX 5080 ofrece mejor valor que la 5090?
A menudo sí — la 5080 ronda el 80% de la velocidad de la 5090 a un precio bastante menor, aunque también está sujeta a la inflación de precios por la escasez de GDDR7 de 2026. Para LLMs locales, la 5080 suele ser el punto óptimo.
¿Cuánto más rápida es la 5090 en modelos multimodales como Qwen-VL 70B?
Una mejora similar del 20-25%. El cómputo multimodal sigue siendo limitado por la memoria, por lo que la ventaja de ancho de banda de la 5090 ayuda, pero no de forma dramática.
Fuentes
- Especificaciones oficiales de NVIDIA RTX 5090 y 4090: núcleos CUDA, TFLOPS, ancho de banda de memoria
- MLCommons MLPerf Inference Benchmark: velocidad de generación de tokens en LLaMA 70B y modelos Mistral
- Base de datos de GPU de TechPowerUp: comparativa de consumo energético y ancho de banda de memoria RTX 5090 vs. 4090
