Key Takeaways
- RTX 4060 Ti 16GB تفوز لمعظم المستخدمين: 16 GB تشغّل 14B بتكميم Q4 على GPU (Q8 مع هامش)، ~$424 في يوليو 2026، 165 W
- RTX 3060 12GB هي البديل الأرخص بسعر ~$339 — خيار NVIDIA أرخص، 12 GB VRAM تتعامل مع نماذج 7B–13B
- Intel Arc B580 12GB هي الخيار الاقتصادي بسعر ~$303 — 12 GB VRAM، بنية أحدث، لنماذج 7B–13B
- ⚠️ تنبيه سعر: RTX 3090 المستعملة أصبحت بـ $1,000–1,100 — أُزيلت من قائمة ما دون $500
- ⚠️ تنبيه سعر: RTX 4070 12GB أصبحت بـ ~$700 — أُزيلت من قائمة ما دون $500
- ⚠️ تنبيه سعر: RX 7800 XT 16GB أصبحت بـ ~$832 — أُزيلت من قائمة ما دون $500
- تحتاج قدرة نماذج 30B؟ خصص ميزانية $1,000 على الأقل لـ RTX 3090 مستعملة (24 GB) أو ادّخر لـ RTX 4080 SUPER (16 GB، ~$850)
- كل بطاقات GPU الثلاث في هذه القائمة تعمل مع Ollama وLM Studio وllama.cpp من المصنع
أفضل بطاقات GPU للاستدلال على نماذج LLM بأقل من $500 — مصنّفة
بطاقة RTX 4060 Ti 16GB هي أفضل GPU بأقل من $500 للاستدلال المحلي على نماذج LLM لأن 16 GB من VRAM تستوعب نماذج 14B بجودة Q8 كاملة دون ضغط على الذاكرة.
تحدد VRAM في GPU أي نماذج ذكاء اصطناعي يمكنك تشغيلها. بطاقة بسعة 16 GB تشغّل نماذج 14B بجودة عالية. بطاقة بسعة 24 GB (مثل RTX 3090 مستعملة) تشغّل نماذج 30B أو أكبر. بأقل من 12 GB تكون محدوداً بنماذج 7B أو أصغر.
RTX 4060 Ti 16GB — أفضل خيار شامل (يوليو 2026: ~$424)
بطاقة NVIDIA GeForce RTX 4060 Ti 16GB هي الفائز الواضح للاستدلال المحلي على نماذج LLM بأقل من $500 في يوليو 2026. تتعامل 16 GB من VRAM من نوع GDDR6 مع Qwen3 14B وLlama 3.3 14B وMistral 12B بجودة Q8 دون تبديل. بنية Ada Lovelace بعرض نطاق 288 GB/s تقدّم 45–60 tok/s على نماذج 7B Q4 و18–25 tok/s على 14B Q8 مع Ollama. باستهلاك 165 W TDP، تعمل مع أي مزود طاقة بسعة 650 W. السعر الحالي: ~$424 جديدة (مُحقَّق يوليو 2026).
RTX 3060 12GB — أرخص بديل (يوليو 2026: ~$339)
عادت بطاقة NVIDIA GeForce RTX 3060 12GB إلى المتاجر بسعر $339 جديدة، وهي أرخص بطاقة CUDA بذاكرة VRAM كافية للنماذج المحلية في يوليو 2026. تشغّل 12 GB من GDDR6 نماذج 7B–13B بتكميم Q4/Q8 بأريحية؛ لا تستطيع إيواء نموذج 14B بتكميم Q8، لكن نموذج 14B بتكميم Q4 (~8.5 GB) يناسبها. القياس: ~32–40 tok/s على Llama 3.3 8B Q4 مع Ollama. سلسلة أدوات CUDA الكاملة تعني أن Ollama وLM Studio وvLLM والضبط الدقيق LoRA تعمل جميعها من المصنع على Windows وLinux. إن لم تكن بحاجة إلى هامش 14B عند Q8، توفّر RTX 3060 12GB ~$85 مقارنة بـ RTX 4060 Ti مع الحفاظ على نفس دعم برمجيات NVIDIA.
Intel Arc B580 12GB — أفضل خيار اقتصادي (يوليو 2026: ~$303)
بطاقة Intel Arc B580 12GB صدرت بسعر $249 وتُتداول بـ ~$303 في يوليو 2026 — الأقل تكلفة من حيث VRAM الكافية في هذه القائمة. تشغّل Ollama عبر الواجهة الخلفية SYCL/oneAPI على Linux وWindows. الأداء: ~28–35 tok/s على Llama 3.3 8B Q4. حد 12 GB من VRAM يقيّدك بنماذج 13B Q4. لأول GPU أو جهاز استدلال ثانوي بميزانية محدودة، Arc B580 هي الاختيار الصحيح.
مقارنة الأداء — أسعار يوليو 2026 + نتائج الاختبارات
قياسات أُجريت باستخدام Ollama 0.30.x، وخادم llama.cpp، ونماذج من HuggingFace. نظام الاختبار: Ryzen 9 7950X، و64 GB DDR5، وقرص NVMe SSD. أسعار مُحقَّقة يوليو 2026 — RTX 3090 المستعملة ($1,000–1,100)، وRTX 4070 12GB (~$700)، وRX 7800 XT 16GB (~$832) مستبعدة: جميعها تتخطى $500 الآن.
| GPU | VRAM | السعر (يوليو 2026) | Llama 3.3 8B Q4 tok/s | Qwen3 14B Q8 tok/s | أقصى نموذج (Q4) |
|---|---|---|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | ~$424 | 55 tok/s | 22 tok/s | 30B (Q4) |
| RTX 3060 12GB | 12 GB | ~$339 | 36 tok/s | محدود بـ VRAM | 14B (Q4) |
| Intel Arc B580 12GB | 12 GB | ~$303 | 31 tok/s | محدود بـ VRAM | 13B (Q4) |
كيف اخترنا واختبرنا هذه البطاقات
معايير الاختيار: متاحة للشراء جديدة بأقل من $500 في يوليو 2026؛ متوافقة مع واحد على الأقل من أنظمة تشغيل الاستدلال الرئيسية (Ollama، LM Studio، llama.cpp)؛ VRAM ≥ 12 GB (بطاقات 8 GB مستبعدة). تمّ استبعاد RTX 3090 المستعملة (24 GB) وRTX 4070 12GB وRX 7800 XT 16GB من هذه القائمة بعد التحقق من أسعار يوليو 2026: RTX 3090 المستعملة تُتداول الآن بـ $1,000–1,100 على eBay؛ وRTX 4070 12GB بـ ~$700 على Amazon؛ وRX 7800 XT 16GB بـ ~$832 على Amazon — جميعها يتخطى حد $500. جميع القياسات هي tok/s بمتوسط 10 عمليات بحجم دفعة 1، مقيسة باستخدام Ollama 0.30.x على Ubuntu 22.04 LTS. أسعار مُحقَّقة من Amazon.com و eBay (يوليو 2026).
متطلبات VRAM حسب حجم النموذج
متطلبات VRAM: نموذج 7B يحتاج ~4–5 GB (Q4) أو ~7–8 GB (Q8)؛ نموذج 14B يحتاج ~8–9 GB (Q4) أو ~14–15 GB (Q8)؛ نموذج 30B يحتاج ~18–20 GB (Q4)؛ نموذج 70B يحتاج ~40–42 GB (Q4).
فكّر في VRAM كذاكرة RAM لنماذج الذكاء الاصطناعي. يجب أن يناسب النموذج بالكامل في VRAM لاستدلال سريع. إذا فاض إلى RAM النظام (يُسمى "offloading")، تنخفض السرعة بنسبة 80–95%. تكميم Q4 يقلّص الحجم إلى النصف مقارنة بـ Q8 بتكلفة صغيرة في الجودة.
- نموذج 7B بتكميم Q4: ~4.5 GB VRAM — أي GPU في هذه القائمة تتعامل معه بسهولة
- نموذج 7B بتكميم Q8: ~7.5 GB VRAM — يناسب كل بطاقات GPU هنا
- نموذج 13B بتكميم Q4: ~8.5 GB VRAM — يناسب كل بطاقات GPU في هذه القائمة
- نموذج 14B بتكميم Q8: ~14 GB VRAM — فقط RTX 4060 Ti 16GB وRTX 3090 (مستعملة)
- نموذج 30B بتكميم Q4: ~18 GB VRAM — يتطلب 24 GB (RTX 3090 مستعملة، الآن بـ $1,000+)
- نموذج 70B بتكميم Q4: ~40 GB — يتطلب بطاقتي GPU أو تفريغاً إلى CPU
أي GPU يجب أن تشتري؟
استخدم دليل القرار هذا وفقاً لحالة استخدامك الرئيسية:
- أفضل خيار شامل بأقل من $500 ← RTX 4060 Ti 16GB (~$424 جديدة، ~$340–370 مستعملة). يغطي 7B–14B Q8 بـ 16 GB VRAM وسلسلة أدوات CUDA ودعم واسع على Windows/Linux.
- أرخص بطاقة CUDA تعمل ← RTX 3060 12GB (~$339). بديل NVIDIA لنماذج 7B–13B بسلسلة أدوات CUDA كاملة؛ توفّر ~$85 إن لم تحتج هامش 14B عند Q8.
- تشغيل 7B–13B بميزانية محدودة ← Intel Arc B580 12GB (~$303). أفضل قيمة للاستدلال المبتدئ. 12 GB VRAM تحدّ بنماذج 13B Q4.
- تحتاج قدرة نماذج 30B؟ ← نافذة $500 أُغلقت في منتصف 2026. RTX 3090 المستعملة (24 GB) الآن بـ $1,000–1,100. خصص $1,000+ لـ RTX 3090 مستعملة أو $850+ لـ RTX 4080 SUPER (16 GB).
- مستخدم Windows، دون تعقيدات ← RTX 4060 Ti 16GB. لدى NVIDIA CUDA أوسع دعم على Windows لنماذج LLM والضبط الدقيق وأنظمة التشغيل متعددة الوسائط.
توافق البرمجيات حسب GPU
كل بطاقات GPU الثلاث تشغّل Ollama وllama.cpp. تظهر الفروق في الأدوات المتقدمة:
| GPU | Ollama | LM Studio | vLLM | Text Gen WebUI | Fine-Tuning CUDA |
|---|---|---|---|---|---|
| RTX 4060 Ti 16GB | ✅ | ✅ | ✅ | ✅ | ✅ |
| RTX 3060 12GB | ✅ | ✅ | ✅ | ✅ | ✅ |
| Intel Arc B580 12GB | ✅ (SYCL) | ⚠️ beta | ❌ | ⚠️ جزئي | ❌ |
استهلاك الطاقة ومتطلبات النظام
يحدد استهلاك GPU أي مزود طاقة وصندوق تحتاج. تشغيل نماذج LLM يبقي بطاقات GPU عند 80–100% من الاستخدام بشكل مستمر — على خلاف الألعاب، لا توجد إطارات خاملة.
- RTX 4060 Ti 16GB: 165 W — تعمل مع مزود طاقة بسعة 550 W أو أكثر؛ موصّل 8 سنون واحد
- RTX 3060 12GB: 170 W — تعمل مع مزود طاقة بسعة 550 W أو أكثر؛ موصّل 8 سنون واحد
- Intel Arc B580 12GB: 190 W — مزود طاقة بسعة 650 W أو أكثر؛ 8 سنون قياسي
هل 8 GB من VRAM كافية لتشغيل نماذج LLM محلياً؟
8 GB من VRAM تحدّك بنماذج 7B بتكميم Q4 — النموذج بالكاد يناسب. لا يمكنك تشغيل نماذج 13B بجودة كاملة، ونماذج 14B ستُفرَّغ جزئياً إلى RAM النظام، مما يخفض السرعة بنسبة 80–95%. لاستخدام محلي ذي معنى لنماذج LLM في 2026، 12 GB هو الحد الأدنى العملي؛ ويُنصح بـ 16 GB.
هل لا يزال بإمكاني شراء RTX 3090 مستعملة بأقل من $500 في 2026؟
لا — في يوليو 2026، تُتداول RTX 3090 المستعملة بـ $1,000–1,100 على eBay. ارتفع السعر بشكل ملحوظ من مستويات 2024 مع تزايد إدراك المتحمسين لـ LLM لقيمة 24 GB VRAM. لم تعد خياراً بأقل من $500. إن كنت تحتاج قدرة نماذج 30B (التي تتطلب 24 GB VRAM)، خصص $1,000+ لـ RTX 3090 مستعملة أو فكّر في RTX 4080 SUPER (16 GB، ~$850 جديدة) لأداء أسرع على 14B Q8.
هل تعمل AMD لتشغيل نماذج LLM محلياً؟
نعم، مع تفاصيل دقيقة. Ollama على Linux مع ROCm يعمل جيداً على بطاقات مثل RX 7800 XT. تحسّن دعم ROCm على Windows لكنه لا يزال يتطلب خطوات يدوية، والضبط الدقيق (LoRA) على عتاد AMD غير مدعوم من معظم الأدوات. ملاحظة حول السعر: ارتفعت RX 7800 XT 16GB إلى ~$832 في يوليو 2026، فلم تعد تناسب ميزانية أقل من $500 — لهذا النطاق السعري تُعدّ RTX 4060 Ti 16GB أو RTX 3060 12GB (كلاهما NVIDIA/CUDA) الخياران الموصى بهما. لـ Windows أو الضبط الدقيق، التزم بـ NVIDIA.
ماذا عن بطاقات Intel Arc للذكاء الاصطناعي؟
بطاقة Intel Arc B580 12GB هي أفضل خيار Arc في 2026. تشغّل Ollama على Windows وLinux عبر الواجهة الخلفية SYCL، رغم أن الأداء أقل بنسبة 30–40% من NVIDIA في tok/s الخام. القيمة مقابل السعر قوية: 12 GB من VRAM بسعر $280 دون مشاكل تعريفات على الأنظمة الحديثة. القيد الرئيسي هو البرمجيات: vLLM وأدوات fine-tuning وأنظمة تشغيل متعددة الوسائط لا تدعم Arc جيداً بعد.
هل يمكنني تشغيل نموذج 70B على بطاقة GPU واحدة بأقل من $500؟
ليس بكامل السرعة. حتى RTX 3090 (24 GB) لا تستطيع تخزين 70B Q4 (~40 GB) بالكامل في VRAM. يمكنك استخدام التفريغ إلى CPU مع llama.cpp لتقسيم النموذج بين VRAM وRAM النظام، لكن السرعة تنخفض إلى 2–5 tok/s — بطيء جداً للاستخدام التفاعلي. لتشغيل نماذج 70B بسرعات قابلة للاستخدام، تحتاج إلى بطاقتي GPU (2× RTX 3090 بسعة 48 GB إجمالاً) أو استدلال سحابي.
هل ستجعل البطاقات الجديدة (RTX 5060 Ti) هذه البطاقات قديمة؟
تم تأكيد RTX 5060 Ti من NVIDIA لعام 2026 بأسعار متوقعة أقل من RTX 4060 Ti. تظل RTX 4060 Ti 16GB أفضل قيمة مُتحقَّقة اليوم (يوليو 2026). إن استطعت الانتظار 2–3 أشهر، راقب توفر RTX 5060 Ti — قد تدخل النطاق دون $500 بأداء أفضل. إن كنت تحتاج GPU الآن، فإن RTX 4060 Ti 16GB هي الشراء الآمن.
كم يكلّف RTX 4060 Ti 16GB مستعملة في يوليو 2026؟
عادةً ما تُباع بطاقات RTX 4060 Ti 16GB المستعملة بأقل من سعرها الجديد (~$424) بنسبة 15–20% — أي حوالي $340–370 على eBay، حسب الحالة والضمان المتبقي. بما أن البطاقة حديثة نسبياً وطلب مستخدمي LLM يحافظ على قيمتها في السوق الثانوي، فإن التوفير مقارنة بالشراء الجديد أقل مما هو عليه في بطاقات أقدم مثل RTX 3090. تحقّق من الإعلانات "المُباعة" (وليس النشطة) على eBay لمعرفة السعر الفعلي في السوق، وتأكد من أنها الإصدار بسعة 16 GB — فهناك أيضاً إصدار RTX 4060 Ti بسعة 8 GB لا يمكنه تشغيل نماذج 14B بتكميم Q4.