关键要点
- RTX 4090自2026年起已停产(EOL)——市场上所有的卡都是二手的,价格约为$2,000-2,600,远高于年初的约$999-1,299。
- RTX 5090仍在生产,但2026年的GDDR7内存短缺已将市场价推高至$4,300-$5,000以上,超过其$1,999建议零售价的两倍。
- 在大型模型(70B Q4)上,RTX 5090的本地LLM推理速度比RTX 4090快约30-50%。在7B-13B模型上差距较小(约20%)。
- RTX 5090配备32GB GDDR7,而RTX 4090为24GB GDDR6X——这8GB的差异对34B Q8以及大上下文的70B Q4运行很重要。
- 二手RTX 4090(每百万token约$56-72)每token生成成本仍低于按当前市场价购买的全新RTX 5090(每百万token约$83-96)。
- 对于7B-13B模型:无论价格如何,4090都是过剩的。你会在榨干GPU之前先遇到CPU或散热瓶颈。
- 对于70B模型:5090表现出色,可并行运行2-3个较小的70B模型,或以更大的批处理规模运行单个70B模型。
- 除非需要双GPU配置,否则RTX 5080通常在本地LLM上比5090提供更好的性价比,但它同样受到短缺导致的价格上涨影响。
📍 简单一句话
RTX 4090已停产,仅能在二手市场购得,而RTX 5090仍在生产中,但由于GDDR7内存短缺,其价格已超过官方指导价的两倍;RTX 5090在大型模型上快30-50%,拥有32GB显存(相比4090的24GB),但二手4090每美元生成的token数仍然更划算。
💬 简单来说
如果你已经拥有RTX 4090,现在几乎没有理由升级——5090的溢价对大多数本地LLM用途来说并不划算。如果你是全新购买且需要能运行70B模型的显卡,二手4090尽管因停产带来溢价,仍是更好的性价比选择,因为5090本身的价格也因内存短缺被推高了。
真实的速度差异是多少?
RTX 5090:21,760个CUDA核心,1,457 TFLOPS,约1,792 GB/秒显存带宽,32GB GDDR7。建议零售价$1,999,但由于GDDR7短缺,截至2026年8月市场价为$4,300-$5,000以上。
RTX 4090:16,384个CUDA核心,826 TFLOPS,约1,008 GB/秒显存带宽,24GB GDDR6X。已停产(EOL)——NVIDIA已停止生产。 市面上出售的每一张都是二手的,价格约为$2,000-2,600。
真实世界LLM推理(Llama 3.3 70B,Q4,batch=1):RTX 5090达到约50-55 tokens/秒,RTX 4090达到约36 tokens/秒。在70B模型上快40-50%。 这些单卡速度不受价格变化影响——变化的只是获得它们的成本。
对于7B模型(受显存带宽限制而非算力限制):RTX 5090达到约90 tokens/秒,RTX 4090达到约75 tokens/秒。快约20%。 在较小模型上差距更小。

4090和5090之间VRAM重要吗?
RTX 5090拥有32GB GDDR7。RTX 4090拥有24GB GDDR6X。 这8GB的差异对特定模型大小很重要——这一VRAM计算不受4090停产或任一显卡当前价格的影响。
5090的VRAM优势是真实的:34B Q8(约需28GB)在32GB中运行舒适,但在24GB中相当紧张。70B Q4(约需38-40GB)在任一单卡上都无法容纳——需要双GPU或Apple Silicon。对于7B-13B模型,24GB绰绰有余。
每token成本:哪个真正更便宜?
- 二手RTX 4090:约$2,000-2,600(EOL,仅在二手市场,相比2026年初的约$999-1,299)。在Llama 70B上达到36 tokens/秒。每token成本:每百万token约$56-72。
- 全新RTX 5090:市场价$4,300-5,000以上(建议零售价$1,999,因2026年GDDR7短缺而抬高)。在Llama 3.3 70B Q4上达到约52 tokens/秒。每token成本:每百万token约$83-96。
- 结论:4090每生成token的成本仍然更低, 即便在其停产导致价格上涨之后——因为5090的短缺溢价增长得比4090更快。

什么时候真正应该从4090升级到5090?
永远不要为7B-13B推理而升级。 无论价格如何,4090对这些模型都是过剩的。你无论如何都会受限于CPU或散热。
如果你已经拥有4090:请保留它。 在5090市场价为$4,300-5,000以上的情况下,升级的性价比比以往任何时候都差。只有在70B上需要超过40 tok/秒,或需要32GB来运行34B Q8且成本不是障碍时才考虑更换。
如果你两者都没有且需要一张能运行70B的显卡: 比较当前的挂牌价格。二手4090(约$2,000-2,600,EOL/仅二手)在每token成本上仍优于全新5090(约$4,300-5,000以上),代价是吞吐量低30-50%。
双GPU替代方案已经改变: 两张二手RTX 4090合计现在约需$4,000-5,200——接近单张5090的市场价——在70B Q4上合计可获得约65-72 tokens/秒(与单张5090相当或更好)。代价是仅能从二手渠道采购(无保修,EOL供应)以及更复杂的配置(张量并行)。
关于5090的常见误解
- 认为RTX 4090仍在售卖全新款——并非如此。NVIDIA已于2026年停产RTX 40系列;市场上的每一张4090都是二手的,价格远高于年初水平。
- 认为RTX 5090的$1,999建议零售价就是你实际支付的价格——截至2026年8月,由于GDDR7短缺,市场价为$4,300-$5,000以上。
- 认为5090比4090快2倍——在70B上只快40-50%,在7B模型上仅快约20%。
- 假设两张卡显存相同——并非如此。5090有32GB,4090有24GB。这8GB的差异对34B Q8模型很重要。
- 认为运行70B模型必须要5090——4090以36 tokens/秒运行得很好,这对大多数用户来说已经"足够",而且即使在停产导致价格上涨后,它仍是每token成本最低的显卡。
常见问题
2026年RTX 4090还能买到全新的吗?
不能。NVIDIA已于2026年停产RTX 40系列。现在出售的每一张RTX 4090都是二手的,价格已升至约$2,000-2,600——原因是停产导致的稀缺性,以及RTX 50系列自身GDDR7短缺带来的需求外溢。
运行Llama 3.3 70B值得买RTX 5090吗?
现在比以往任何时候都更取决于价格。4090以约$2,000-2,600的二手价提供约36 tok/秒。5090提供约52 tok/秒,但截至2026年8月市场价为$4,300-$5,000以上。如果持续运行70B则值得;否则二手4090是更务实的选择。
应该买一张RTX 5090还是两张RTX 4090?
两张二手4090(总计约$4,000-5,200)在70B原始速度上(合计约72 tok/秒对约52 tok/秒)优于单张5090(市场价约$4,300-5,000以上)。但双GPU配置增加了复杂性——张量并行、二手卡无保修。5090配置更简单且仍在生产,并为34B Q8场景提供32GB统一显存。
RTX 5090的显存比4090多吗?
是的。RTX 5090拥有32GB GDDR7,而RTX 4090为24GB GDDR6X。多出的8GB使5090能够宽裕地运行34B Q8模型(需约28GB)。两张卡都无法在不跨GPU拆分的情况下容纳70B Q4(需约38-40GB)。这一显存差异与4090的停产无关。
对于14B模型来说RTX 5090是否过剩?
在大多数情况下是的。14B Q4模型需要约9GB显存,在4090上已能以约55-65 tok/秒运行——已经很快。5090将提供约65-75 tok/秒,提升有限。二手4090(甚至3090)对于14B推理的性价比要高得多,尤其是在目前的5090价格下。
RTX 5090笔记本电脑显卡有32GB显存吗?
没有。RTX 5090 Laptop GPU由于功耗和散热限制,显存被削减至24GB GDDR7(桌面版为32GB)。它比桌面版5090慢得多,但在同一任务上仍比4090快。
5090的价格会跌回$1,999的建议零售价吗?
只有当2026年的GDDR7内存短缺缓解后才会——目前没有确定的时间表。当前市场价为$4,300-$5,000以上,超过建议零售价的两倍。4090的价格历史提醒我们,二手市场价格并非总是只跌不涨:它从2022年发布时的$1,499跌至二手最低约$999,之后在2026年停产后又反弹至约$2,000-2,600。
我可以用750W电源使用RTX 5090吗?
勉强可以。RTX 5090单卡功耗为575W。请搭配850W或1000W电源,以避免负载下的电压骤降。
RTX 5080比5090更值得购买吗?
对大多数人来说是的——5080的速度约为5090的80%,价格却低得多,尽管它同样受到2026年GDDR7短缺导致的价格上涨影响。对于本地LLM,5080通常是最佳性价比选择。
在Qwen-VL 70B等多模态模型上5090快多少?
同样有20-25%的提升。多模态计算仍然受显存带宽限制,因此5090的带宽优势有帮助,但不算显著。
来源
- NVIDIA RTX 5090和4090官方规格:CUDA核心数、TFLOPS、显存带宽
- MLCommons MLPerf推理基准测试:LLaMA 70B和Mistral模型的token生成速度
- TechPowerUp GPU数据库:RTX 5090对比4090的功耗与显存带宽比较
