Key Takeaways
- RTX 5090 أسرع بـ ~20-25% من RTX 4090 لاستدلال LLM المحلي (مقاسًا بـ tokens/ثانية).
- كلتا البطاقتين بسعة 24 GB من VRAM — متطابقتان للعمل مع نماذج LLM. تأتي أفضلية سرعة 5090 من عرض نطاق ذاكرة أعلى وكفاءة shaders أفضل.
- RTX 5090 تكلّف $1,000 أكثر ($1,999 مقابل $999 لـ 4090 مستعملة). مكسب الأداء لكل سعر لا يبرّر الترقية إذا كنت تملك 4090.
- لنماذج 7B-13B: 4090 مبالغ فيها. ستصطدم بحدود CPU أو التبريد قبل أن تُشبع بطاقة الرسوم.
- لنماذج 70B: تتميّز 5090. يمكنها تشغيل 2-3 نماذج 70B بالتوازي أو نموذج 70B واحد بأحجام دفعات أكبر.
- RTX 5080 ($999) غالبًا ما تقدّم قيمة أفضل من 5090 لنماذج LLM المحلية، إلا إذا كنت تحتاج إلى إعدادات بطاقتي رسوم.
ما الفروق الفعلية في السرعة؟
RTX 5090: 21,760 نواة CUDA، 1,457 TFLOPS، ~1,792 GB/ثانية عرض نطاق ذاكرة، 32GB GDDR7.
RTX 4090: 16,384 نواة CUDA، 826 TFLOPS، ~1,008 GB/ثانية عرض نطاق ذاكرة، 24GB GDDR6X.
استدلال LLM في العالم الحقيقي (Llama 3.3 70B، Q4، batch=1): تبلغ RTX 5090 ~50-55 token/ثانية، وتبلغ RTX 4090 ~36 token/ثانية. أسرع بـ 40-50% على نماذج 70B.
لنماذج 7B: تبلغ RTX 5090 ~90 token/ثانية، وRTX 4090 ~75 token/ثانية. أسرع بـ ~20%. الفجوة أصغر على النماذج الأصغر.

هل تهم VRAM بين 4090 و5090؟
كلتاهما بسعة 24 GB GDDR7 (5090) / GDDR6X (4090). سعة VRAM متطابقة. لا أفضلية.
GDDR7 في 5090 أسرع لكل بايت. يسهم هذا في أفضلية السرعة بنسبة 20-25%. لكن لأعباء عمل LLM التي نشغّلها، GDDR6X (4090) كافٍ.
التكلفة لكل token: أيها أرخص فعلًا؟
- RTX 4090 مستعملة: ~$999-1,299. تبلغ 36 token/ثانية على Llama 70B. التكلفة لكل token: $27-36 لكل مليون token.
- RTX 5090 جديدة: $1,999. تبلغ 45 token/ثانية على Llama 70B. التكلفة لكل token: $44 لكل مليون token.
- الحكم: 4090 أرخص لكل token مولَّد، ليس لأنها أسرع، بل لأنها أرخص في الشراء.

متى ينبغي أن تُرقّي فعلًا من 4090 إلى 5090؟
لا تُرقِّ أبدًا لاستدلال 7B-13B. 4090 مبالغ فيها لتلك النماذج. ستكون محدودًا بـ CPU أو التبريد على أي حال.
رقِّ إذا: شغّلت استدلال 70B ببطاقتي رسوم (2× 4090 = $2,500 مقابل 2× 5090 = $4,000)، أو احتجت إلى 45+ token/ثانية على نماذج 70B، أو واجهت عنق زجاجة في عرض نطاق الذاكرة في أعباء عمل متعددة الدفعات.
أفضل بديل: أضف RTX 4090 ثانية بـ $1,200 بدلًا من الانتقال إلى 5090. اثنتان من 4090 بالتوازي تمنحانك ~72 token/ثانية (لا 90، لكن قريب بما يكفي بنصف التكلفة).
افتراضات شائعة حول 5090
- الاعتقاد بأن 5090 أسرع بـ 2× من 4090 — هي أسرع بـ 20-25% فقط، وأقل من ذلك لنماذج 7B.
- افتراض وجود فرق في VRAM — كلتاهما بسعة 24 GB. السعة نفسها، وأداء مماثل لنماذج LLM.
- الاعتقاد بأنك تحتاج إلى 5090 لتشغيل نماذج 70B — تشغّلها 4090 جيدًا بـ 36 token/ثانية، وهو "كافٍ" لمعظم المستخدمين.
الأسئلة الشائعة
هل تستحق RTX 5090 العناء لتشغيل Llama 3 70B؟
فقط إذا كنت تحتاج إلى 45+ token/ثانية. تمنحك 4090 نسبة 36، وهو "كافٍ" لمعظم المستخدمين. الـ 9 token/ثانية الإضافية تكلّف $1,000.
هل أشتري RTX 5090 واحدة أم RTX 4090 اثنتين؟
اثنتان من 4090 (~$2,500 مستعملة) تتفوقان على 5090 ($1,999) في السرعة والمرونة. يمكنك تشغيل عدة نماذج بالتوازي. لـ 5090 إعداد أبسط، لكنها أغلى.
هل لـ RTX 5090 ذاكرة VRAM أكثر من 4090؟
لا. كلتاهما بسعة 24 GB. GDDR7 أسرع لكل بايت، لكن لنماذج LLM، GDDR6X (4090) كافٍ.
هل ستنخفض أسعار 5090 كما حدث مع 4090؟
نعم، في النهاية. كانت 4090 تكلّف $1,499 عند إطلاقها (2022) وتساوي الآن $999 مستعملة (2026). توقّع أن تصل 5090 إلى $1,200-1,500 مستعملة خلال 2-3 سنوات.
هل يمكنني استخدام RTX 5090 مع مزوّد طاقة 750 واط؟
بصعوبة. تستهلك RTX 5090 575 واط بمفردها. استخدم مزوّد طاقة 850 واط أو 1000 واط لتجنّب انخفاض الجهد تحت الحمل.
هل تقدّم RTX 5080 قيمة أفضل من 5090؟
نعم، لمعظم المستخدمين. تبلغ 5080 ($999) نسبة 80% من سرعة 5090 بنصف السعر. لنماذج LLM المحلية، 5080 هي النقطة المثلى.
كم أسرع 5090 في النماذج متعددة الوسائط مثل Qwen-VL 70B؟
تحسّن مماثل بنسبة 20-25%. تظل الحوسبة متعددة الوسائط محدودة بالذاكرة، لذا تساعد أفضلية عرض النطاق في 5090، لكن ليس بشكل كبير.
المصادر
- المواصفات الرسمية لـ NVIDIA RTX 5090 و4090: أنوية CUDA، TFLOPS، عرض نطاق الذاكرة
- معيار MLCommons MLPerf Inference: سرعة توليد الـ tokens على LLaMA 70B ونماذج Mistral
- قاعدة بيانات بطاقات الرسوم في TechPowerUp: مقارنة استهلاك الطاقة وعرض نطاق الذاكرة RTX 5090 مقابل 4090
