Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/ابنِ حاسوبًا لـ⁨LLM⁩ المحلي: أفضل محطة عمل (⁨GPU⁩، ⁨VRAM⁩، نماذج ⁨7B⁩–⁨70B⁩)
Hardware Setups

ابنِ حاسوبًا لـ⁨LLM⁩ المحلي: أفضل محطة عمل (⁨GPU⁩، ⁨VRAM⁩، نماذج ⁨7B⁩–⁨70B⁩)

·10 دقائق للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

تكلّف محطة عمل احترافية لاستدلال LLM المحلي في الإنتاج 4,000–6,000$ وتضم بطاقتي RTX 4090 مزدوجتين (48 GB VRAM مجمّعة)، وThreadripper 7970X (32 نواة)، و128 GB DDR5، وتبريدًا مخصصًا، ومزود طاقة 2,000W. اعتبارًا من أبريل 2026: 2–3 مستخدمين متزامنين لـ70B بسرعة 14 رمز/ث، الضبط الدقيق لـLlama 3.3 بالتوازي مع الاستدلال، دون تكاليف API سحابية.

تكلّف محطة عمل احترافية لاستدلال LLM المحلي في الإنتاج 4,000–6,000$ وتضم بطاقتي RTX 4090 مزدوجتين (48 GB VRAM مجمّعة)، ومعالج Threadripper 7970X (32 نواة)، و128 GB ذاكرة RAM من نوع DDR5، وتبريدًا مخصصًا، ومزود طاقة بقدرة 2,000W. اعتبارًا من أبريل 2026، يخدم هذا المستوى 2–3 مستخدمين متزامنين لنماذج 70B بسرعة 14 رمز/ث لكل منهم، ويُشغّل الضبط الدقيق لـLlama 3.3 70B بالتوازي مع الاستدلال، ويوفّر نشرًا داخل المؤسسة دون تكاليف API سحابية.

العرض التقديمي: ابنِ حاسوبًا لـ⁨LLM⁩ المحلي: أفضل محطة عمل (⁨GPU⁩، ⁨VRAM⁩، نماذج ⁨7B⁩–⁨70B⁩)

يغطي العرض التقديمي أدناه البناء الكامل لمحطة عمل استدلال LLM المحلي الاحترافية: الجمهور المستهدف وحالات الاستخدام، مكونات RTX 4090 المزدوجة بتكلفة إجمالية (4,000–6,000$)، خيارات إعداد GPU المزدوجة (بالتوازي، NVLink، التوازي التنسوري)، مقارنة قيمة RTX 5090 مقابل 4090، حلول التبريد لتبديد 1,200W، متطلبات مزود الطاقة والكهرباء، معايير أداء الاستدلال متعدد المستخدمين (28 رمز/ث لمستخدم 70B واحد، 2–3 مستخدمين متزامنين، 8+ مستخدمين 7B متزامنين)، الأخطاء الشائعة التي يجب تجنّبها والأسئلة الشائعة حول المعالجات وNVLink والإدارة الحرارية وقابلية الترقية. نزّل ملف PDF كدليل مرجعي لمحطة عمل LLM المحلي.

تصفّح الشرائح أدناه أو نزّلها بصيغة PDF للرجوع إليها دون اتصال. تنزيل البطاقة المرجعية (PDF)

Key Takeaways

  • CPU: Threadripper 7970X (32 نواة، 2,499$) أو Intel Xeon W9-3495X (5,000$+). يتيح ضبطًا دقيقًا بالتوازي أثناء تقديم الاستدلال.
  • GPU: 2× RTX 4090 24GB (زوج مستعمل ~2,200–2,600$). 48GB VRAM إجمالًا لـ70B متعدد المستخدمين أو 70B واحد + مهام التحضير.
  • RAM: 128GB DDR5 (600–800$). تدعم 8+ مستخدمين متزامنين على 70B أو مستخدم واحد 70B + تكميم بالتوازي.
  • التخزين: 4–8TB NVMe SSD + 12–24TB HDD (800–1,500$). مكتبة متعددة النماذج + نسخ احتياطية + مجموعات بيانات تدريب.
  • مزود الطاقة: 2× 1200W أو 1× 2000W (800–1,200$). يستهلك زوج 4090 قدرة 900W بشكل مستمر؛ هامش الذروات أساسي.
  • التبريد: دائرة سائلة مخصصة أو AIO مزدوج (1,000–2,000$). GPU كبيرة + CPU = 1,200W ناتج حراري.
  • الشبكة: Ethernet بسرعة 10Gbps اختياري (200–400$). وصول متعدد المستخدمين عبر LAN دون اختناقات.
  • الإجمالي: 4,000–6,000$. يدعم 8+ مستخدمين متزامنين لـ70B أو مستخدمًا واحدًا بضبط دقيق + تقديم متزامن.

من يحتاج إلى محطة عمل بقيمة 4–6 آلاف $؟

هذا المستوى مخصص لـ:

  • الشركات الصغيرة والمتوسطة/المؤسسات: تشغيل واجهة API لـLLM داخلية لـ5+ موظفين في آن واحد. يلزم التحكم في البيانات داخل المؤسسة.
  • باحثو الذكاء الاصطناعي: الضبط الدقيق للنماذج الكبيرة (70B LoRA) أثناء تقديم الاستدلال للفريق. لا يستطيع جهاز بـ2 ألف $ المعالجة بالتوازي.
  • مهندسو MLOps: بناء عناقيد استدلال داخلية. البدء بمحطة عمل كعقدة خادم.
  • استوديوهات المحتوى (الجادة): تشغيل ترجمة الفيديو على مدار الساعة، وتوليد الشيفرة، والتلخيص دون تكاليف API.

ما هي قائمة مكونات محطة العمل؟

تبدأ محطة العمل الاحترافية ببطاقتي RTX 4090 مزدوجتين (2,200–2,600$ لزوج مستعمل) ومعالج Threadripper (2,800–3,200$)، إلى جانب 128GB من ذاكرة RAM من نوع DDR5 وتبريد سائل مخصص. هذه هي قائمة المكونات الكاملة وتفصيل التكاليف:

ComponenteModeloPrecio (Abril 2026)Notas
GPU2× RTX 4090 24GB (مستعملة)2,200–2,600$جسور NVLink اختيارية. اختبر كلتا البطاقتين قبل الإقران.
CPUThreadripper 7970X (32 نواة)2,400–2,500$يتيح 32 نواة متوازية للضبط الدقيق أثناء تقديم الاستدلال على كلتا GPU.
اللوحة الأمTRX850 أو Xeon W90400–800$دعم GPU مزدوجة، PCIe 5.0، إمداد طاقة بمستوى المؤسسات.
RAM128GB DDR5 6000 MHz600–800$Corsair Dominator Platinum. تدعم 8+ مستخدمين متزامنين.
التخزين4TB NVMe + 12TB HDD800–1,200$NVMe للنماذج النشطة، HDD للنسخ الاحتياطية ومجموعات البيانات.
مزود الطاقة2000W 80+ Platinum أو 2× 1200W1,000–1,500$زوج 4090 = 900W مستمر، يحتاج هامش 2000W+.
التبريددائرة مخصصة أو 2× AIO 360mm1,500–2,500$CPU + 2 GPU = 1,200W حرارة. التبريد الهوائي غير كافٍ.
الصندوقLian Li O11 Dynamic أو Corsair Crystal200–300$يدعم GPU مزدوجة + AIO كبير أو دائرة.
الإجمالي--4,000–6,000$يتفاوت مع أسعار سوق GPU واختيار التبريد.
مكونات محطة العمل: بطاقتا RTX 4090 مزدوجتان (48GB VRAM إجمالًا)، معالج Threadripper 7970X (32 نواة)، 128GB ذاكرة DDR5، مزود طاقة 2000W ونظام تبريد سائل لتبديد 1,200W.
مكونات محطة العمل: بطاقتا RTX 4090 مزدوجتان (48GB VRAM إجمالًا)، معالج Threadripper 7970X (32 نواة)، 128GB ذاكرة DDR5، مزود طاقة 2000W ونظام تبريد سائل لتبديد 1,200W.

كيف تُعِدّ GPU مزدوجة لأقصى أداء؟

تمنحك بطاقتا RTX 4090 قدرة 48GB من VRAM و~2× من أداء الاستدلال. لديك ثلاثة خيارات إعداد: تشغيل مستقل بالتوازي، أو دمج NVLink لـVRAM موحدة، أو التوازي التنسوري لتسريع نموذج واحد.

تُشغّل بطاقتا GPU المزدوجتان نماذج مستقلة لكل بطاقة (أبسط) أو تجمّعان VRAM عبر NVLink (معقّد لكنه يتيح نماذج أكبر).

تخيّلها كحاسوبين منفصلين (بالتوازي) مقابل حاسوب فائق مشترك (NVLink). التوازي أسهل في الإعداد؛ المشترك يمنح طاقة أكثر للنماذج الضخمة.

  1. 1
    بالتوازي (بلا NVLink): تعمل كل GPU بشكل مستقل. النموذج A على GPU 0، النموذج B على GPU 1. الأفضل للأحمال غير المتجانسة (ضبط دقيق 7B + تقديم 70B).
  2. 2
    جسر NVLink: دمج VRAM (تظهر 48GB كمجمّع واحد بحجم 48GB). يتيح أحجام دفعات أكبر أو نوافذ سياق ضخمة. التكلفة: 200–300$ للجسر + تعقيد الإعداد.
  3. 3
    استدلال GPU مزدوجة: تقسيم نموذج 70B واحد على GPU عددها 2 لمضاعفة الإنتاجية (28 رمز/ث بدلًا من 14). يتطلب دعم tensor-parallel من vLLM أو llama.cpp.
ثلاثة خيارات إعداد GPU مزدوجة: مستقل بالتوازي (أحمال غير متجانسة، بلا NVLink)، جسر NVLink (مجمّع VRAM موحد بحجم 48GB، نوافذ سياق كبيرة) وتوازي تنسوري (نموذج 70B واحد مقسّم بين GPU لإنتاجية 28 رمز/ث).
ثلاثة خيارات إعداد GPU مزدوجة: مستقل بالتوازي (أحمال غير متجانسة، بلا NVLink)، جسر NVLink (مجمّع VRAM موحد بحجم 48GB، نوافذ سياق كبيرة) وتوازي تنسوري (نموذج 70B واحد مقسّم بين GPU لإنتاجية 28 رمز/ث).

💡 Pro Tip: تخطَّ NVLink للأحمال غير المتجانسة. التشغيل المستقل أبسط وأقل تكلفة (200$ موفّرة) ويلغي أخطاء البرنامج الثابت للجسر.

⚠️ Warning: يتطلب جسر NVLink دعم برنامج تشغيل NVIDIA الخاص. لا يدعم ROCm مفتوح المصدر أو مكافئات AMD الربط بين بطاقات GPU مختلفة.

RTX 5090 مزدوجة مقابل RTX 4090 مزدوجة: الأداء والقيمة (أبريل 2026)

لا تزال RTX 4090 مزدوجة مستعملة (2,200–2,600$) خيار القيمة لـQ4 70B بسرعة 100 رمز/ث. تفوز RTX 5090 مزدوجة جديدة (4,000$) بـVRAM أكبر (64 GB) وجودة (صيغة Q8) لكنها تكلّف 1,400–1,800$ أكثر. تتعامل RTX 5090 الفردية (2,000$ جديدة) مع 70B Q4 بسرعة 40–50 رمز/ث دون تعقيد المزدوج.

ConfiguraciónVRAMVelocidad 70BCosto
RTX 4090 مزدوجة (مستعملة)48 GB100 رمز/ث (Q4)2,200–2,600$
RTX 5090 فردية (جديدة)32 GB40–50 رمز/ث (Q4)2,000$
RTX 5090 مزدوجة (جديدة)64 GB120 رمز/ث (Q4)4,000$

💡 Pro Tip: لاستدلال Q4 70B بأقصى أداء: RTX 4090 مزدوجة مستعملة (2,200–2,600$) تقدّم أفضل قيمة في أبريل 2026. تكلّف بطاقات 5090 الجديدة 50%+ أكثر.

📌 Key Point: تفوز 5090 المزدوجة لـQ8 70B (جودة مخرجات أعلى) أو الاستعداد للمستقبل. تلغي 5090 الفردية تعقيد GPU المزدوجة للمستخدمين الأفراد.

كيف تبرّد 1,200W من الحرارة؟

RTX 4090 (450W) + RTX 4090 (450W) + CPU (200W) = 1,100W مستمر، ذروات تصل إلى 1,300W.

  • دائرة سائلة مخصصة: 1,500–2,500$. كتلة ماء CPU + كتل ماء GPU + مشعّ 360mm. تُبقي GPU <75°C، CPU <80°C.
  • AIO مزدوج 360mm: 600–900$. AIO واحد لكل GPU + مبرّد CPU منفصل. أكثر تركيبية، وصيانة أسهل من الدائرة المخصصة.
  • التبريد الهوائي: غير قابل للتطبيق. الخنق الحراري مضمون في استدلال 70B المستمر.
تبديد الحرارة: 1,200W إجمالًا من بطاقتي RTX 4090 المزدوجتين (450W لكل منهما) ومعالج Threadripper (200W). حلول التبريد: دائرة سائلة مخصصة (1,500–2,500$)، AIO مزدوج 360mm (600–900$) أو تبريد هوائي (غير موصى به، يسبب خنقًا حراريًا).
تبديد الحرارة: 1,200W إجمالًا من بطاقتي RTX 4090 المزدوجتين (450W لكل منهما) ومعالج Threadripper (200W). حلول التبريد: دائرة سائلة مخصصة (1,500–2,500$)، AIO مزدوج 360mm (600–900$) أو تبريد هوائي (غير موصى به، يسبب خنقًا حراريًا).

🛠️ Best Practice: استخدم معجونًا حراريًا بموصلية 5+ W/mK (Noctua NT-H2، Corsair TM30). المعجون الرخيص قد يضيف 10–15°C إلى درجات الحرارة ويُبطل ضمان GPU.

ما مزود الطاقة والإعداد الكهربائي الصحيح؟

تتطلب بطاقتا 4090 المزدوجتان (900W مستمر، ذروات 1,300W) مزود طاقة بقدرة 2000W كحد أدنى — أي أقل يسبب هبوط الجهد والأعطال تحت الحمل. يمكنك اختيار مزود طاقة واحد بقدرة 2000W أو اثنين بقدرة 1200W للتكرار، لكن يجب التأكد من أن الدائرة الكهربائية لمنزلك/مكتبك تستطيع التعامل مع 2000W عند ذروة الطلب.

  • الخيار 1: مزود طاقة واحد بقدرة 2000W: Seasonic أو Corsair أو EVGA 80+ Platinum. توجيه كابلات أنظف، نقطة فشل واحدة.
  • الخيار 2: مزودا طاقة مزدوجان بقدرة 1200W: مزود طاقة لكل GPU + لوحة أم مشتركة. تكرار (يتعطّل أحدهما، يستمر الاستدلال بنصف السرعة). إعداد معقّد.
  • قاعدة السعة: 2000W لـGPU المزدوجة هو الحد الأدنى. أي أقل يسبب هبوط الجهد تحت الحمل.
  • تخطيط الدائرة: يستهلك جهاز بـGPU مزدوجة 2000W عند الذروة. تأكد من وجود دائرة 20A (المقبس المنزلي/المكتبي النموذجي 15A، غير كافٍ). استخدم خطًا مخصصًا 240V إن توفّر.
متطلبات الطاقة: ~1,100W مستمرة (450W + 450W GPU، 200W CPU) مع ذروات 1,300W. خيارات مزود الطاقة: واحد بقدرة 2000W (أبسط، كابلات نظيفة) أو مزدوج بقدرة 1200W (تكرار، إعداد معقّد). كلاهما يتطلب دائرة مخصصة 20A 240V.
متطلبات الطاقة: ~1,100W مستمرة (450W + 450W GPU، 200W CPU) مع ذروات 1,300W. خيارات مزود الطاقة: واحد بقدرة 2000W (أبسط، كابلات نظيفة) أو مزدوج بقدرة 1200W (تكرار، إعداد معقّد). كلاهما يتطلب دائرة مخصصة 20A 240V.

⚠️ Warning: المقابس المنزلية عادةً 15A عند 120V (1,800W حد أقصى). جهاز بـ4090 مزدوجة سيقطع قاطع الدائرة. ركّب دائرة مخصصة 240V 20A (200–400$ رسوم كهربائي).

📌 Key Point: استخدم دائمًا مزودات طاقة معيارية. تمتلك بطاقات GPU المزدوجة عشرات دبابيس الطاقة؛ الكابلات غير المعيارية تخلق مخاطر حريق بسبب مقاومة التماس في الموصلات متعددة الدبابيس.

ما أداء الاستدلال متعدد المستخدمين الذي يمكنك توقّعه؟

مع 128GB من ذاكرة RAM وبطاقتي 4090 مزدوجتين، يمكنك خدمة 2–3 مستخدمين متزامنين لـ70B بسرعة 14 رمز/ث لكل منهم، أو 8+ مستخدمين متزامنين لـ7B بسرعة 30+ رمز/ث لكل منهم. تفترض المعايير التالية تكميم Q4 وvLLM لجدولة متعددة المستخدمين:

  • مستخدم واحد، نموذج 70B: 28 رمز/ثانية (2× 14 رمز/ث لكل GPU عبر التوازي التنسوري).
  • مستخدمان متزامنان، 70B لكل منهما: 14 رمز/ثانية لكل مستخدم (تعدد إرسال زمني للطلبات).
  • أربعة مستخدمين متزامنين، 7B لكل منهم: 120 رمز/ثانية إجمالًا (كل مستخدم يحصل على 30 رمز/ث).
  • ضبط دقيق 7B LoRA + تقديم 70B: ضبط دقيق على GPU 0 (100W)، استدلال على GPU 1 (450W). بلا تداخل.

ما الأخطاء الشائعة عند بناء محطة العمل؟

  • شراء طرازي GPU مختلفين (5090 + 4090). يسبب عدم التماثل مشكلات في موازنة الأحمال. استخدم بطاقات متطابقة.
  • التقتير في مزود الطاقة لتوفير 300$. مزود طاقة 1500W + بطاقتا 4090 مزدوجتان سيخنق أو يتعطّل تحت الحمل.
  • استخدام التبريد الهوائي بدلًا من السائل. الخنق الحراري يقلّل الأداء بنسبة 30–50% في الاستدلال المستمر.
  • نسيان تكلفة الكهرباء في حسابات TCO. تستهلك بطاقتا RTX 4090 المزدوجتان في الاستدلال المستمر 900W. بمتوسط الولايات المتحدة (0.14$/kWh) بتشغيل على مدار الساعة: ~1,100$/سنة كهرباء. متوسط أوروبا (~0.32$/kWh): ~2,500$/سنة. في 3 سنوات: 3,300–7,500$ كهرباء فقط. أدرج هذا في العائد على الاستثمار مقابل قرارات API السحابية.
  • التقليل من شأن الشبكة لإعدادات متعددة المستخدمين. Ethernet القياسي بسرعة gigabit (1 Gbps = 125 MB/ث) هو الاختناق عند خدمة 5+ مستخدمين متزامنين باستجابات سياق طويل. رقِّ إلى Ethernet بسرعة 2.5 Gbps أو 10 Gbps لمحطات العمل الإنتاجية التي تخدم الفرق. التكلفة: 200–400$ لكل NIC + محوّل.

⚠️ Warning: بطاقات GPU غير المتطابقة (طرز مختلفة أو أحجام VRAM) تكسر التوازي التنسوري. سيرجع vLLM إلى استدلال GPU واحدة، مما يخفض الإنتاجية إلى النصف.

💡 Pro Tip: اشترِ أزواج RTX 4090 مستعملة (مُتحقق من عملها معًا من قبل المالك السابق) بدلًا من بطاقات فردية جديدة. وفّر 500–800$ وتجنّب يانصيب العتاد.

الأسئلة الشائعة

🔍 Did You Know?: تستهلك بطاقتا RTX 4090 المزدوجتان عند الحمل الكامل للاستدلال 900W بشكل مستمر. فاتورة الكهرباء لديك: ~1,100$/سنة بمتوسط الولايات المتحدة (0.13$/kWh) بتشغيل على مدار الساعة.

هل معالج Threadripper ضروري، أم يمكنني استخدام Ryzen 9؟

للاستدلال فقط: Ryzen 9 يعمل جيدًا. للاستدلال + الضبط الدقيق بالتوازي: الأنوية الإضافية في Threadripper (64 مقابل 16) أساسية.

هل يجب أن أستخدم NVLink لدمج بطاقتي 4090؟

اختياري. تخطَّه إذا شغّلت نماذج منفصلة على كل GPU (7B + 70B). استخدمه إذا قسّمت 70B واحدًا بين كلتا GPU لأحجام دفعات أكبر.

كم عدد المستخدمين المتزامنين الذين يتعامل معهم جهاز بـ4090 مزدوجة؟

لـ70B: 2–3 مستخدمين (كل منهم يحصل على 14 رمز/ث). لـ7B: 8+ مستخدمين (كل منهم يحصل على 30+ رمز/ث).

هل يمكنني الترقية إلى RTX 5090 بدلًا من 4090 المزدوجة؟

5090 فردية: أداء مماثل لـ4090 المزدوجة، نصف VRAM (24GB مقابل 48GB)، 1,999$. 5090 مزدوجة: 4,000$ (مبالغ فيه، قيمة أسوأ).

ما العائد على الاستثمار لمحطة عمل بقيمة 5,000$ مقابل واجهة API لـLLM السحابية؟

السحابة: 0.001$ لكل 1K رمز. محطة العمل: 5,000$ موزّعة على سنتين = 2,500$/سنة، ~0.000001$ لكل رمز. نقطة التعادل عند 2.5 مليار رمز/سنة (استخدام خفيف).

هل تحتاج محطة العمل إلى تبريد مركز بيانات؟

لا. التبريد السائل بمستوى المستهلك (2× AIO 360mm أو دائرة مخصصة) كافٍ. تبريد مركز البيانات (صفّي، مرتفع) مصمّم للكثافة؛ 1,200W لمحطة عمل واحدة تتسع ضمن نظام HVAC المكتبي.

هل يجب أن أنتظر RTX 6090 بدلًا من شراء 4090 المزدوجة الآن؟

يُتوقّع سلسلة RTX 60 من NVIDIA في أواخر 2026 أو 2027 وفقًا لدورات الترقية التاريخية كل سنتين. إذا احتجت محطة عمل الآن: RTX 4090 مزدوجة مستعملة (2,200–2,600$) تقدّم أفضل قيمة لاستدلال 70B في أبريل 2026. إذا استطعت الانتظار 12–18 شهرًا: من المرجّح أن تأتي RTX 6090 بـ48 GB من VRAM في بطاقة واحدة، ملغية الحاجة إلى GPU مزدوجة تمامًا.

ما مستوى ضوضاء محطة عمل بـ4090 مزدوجة؟

تحت استدلال 70B مستمر: 50–60 dB على بعد متر واحد بتبريد سائل مخصص. مماثل لمحادثة مكتبية عادية. بـAIO مزدوج 360mm: 55–65 dB (أعلى مسموعًا تحت الحمل). التبريد الهوائي: 65–75 dB (صاخب، غير عملي للاستخدام المكتبي). للوضع بجانب المكتب: الدائرة المخصصة أو AIO الصامت أساسي. للوضع في غرفة الخوادم: الضوضاء غير مهمة.

المصادر

  • PCPartPicker — أسعار المكونات في الوقت الفعلي لـThreadripper وRTX 4090/5090 وذاكرة DDR5 اعتبارًا من أبريل 2026.
  • قاعدة بيانات CPU في TechPowerUp — مواصفات رسمية لاستهلاك الطاقة وعدد الأنوية لـThreadripper 7970X.
  • توثيق NVIDIA NVLink — مواصفات NVLink الرسمية لتجميع الذاكرة والتوازي التنسوري على بطاقات RTX المزدوجة.
  • vLLM Distributed Serving — إعداد التوازي التنسوري متعدد GPU لنماذج 70B على عتاد استهلاكي.

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs