Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/تجميع كمبيوتر لنماذج LLM محلية بميزانية 2,000 دولار (2026): قائمة قطع بثنائي GPU وذاكرة VRAM 32GB
Hardware Setups

تجميع كمبيوتر لنماذج LLM محلية بميزانية 2,000 دولار (2026): قائمة قطع بثنائي GPU وذاكرة VRAM 32GB

·10 دقائق للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

يحصل تجميع كمبيوتر LLM محلي بميزانية 2,000 دولار على أفضل قيمة VRAM مقابل السعر باستخدام بطاقتي GPU بذاكرة 16GB بدلاً من بطاقة واحدة بذاكرة 24GB. توفّر بطاقتا RTX 5060 Ti 16GB (430 دولاراً لكل منهما، 860 دولاراً إجمالاً) ذاكرة VRAM مجتمعة سعة 32GB — كافية لتشغيل نماذج 70B عند Q4 عبر استدلال بتقسيم tensor — مع Ryzen 7 9700X (330 دولاراً)، وذاكرة 64GB DDR5-6000 (180 دولاراً)، وقرص NVMe Gen4 بسعة 2TB (130 دولاراً)، ولوحة أم B650 مقاس ATX بمنفذي PCIe بوضع x8/x8 (180 دولاراً)، ومزود طاقة 850W بشهادة 80+ Gold (130 دولاراً)، وصندوق ATX (90 دولاراً)، بإجمالي نحو 1,940 دولاراً. يشغّل نماذج 70B Q4 بسرعة 12-18 tok/s موزَّعة على البطاقتين، أو نموذج 32B واحد بسرعة 25-30 tok/s على بطاقة واحدة فقط.

كمبيوتر بميزانية 2,000 دولار مزوّد ببطاقتي RTX 5060 Ti 16GB (32GB VRAM مجتمعة) وRyzen 7 9700X وذاكرة 64GB DDR5 يشغّل نماذج من فئة 70B عبر استدلال multi-GPU بتقسيم tensor — وهو أمر لا تستطيعه أي بطاقة GPU واحدة بسعر 2,000 دولار. بدلاً من شراء بطاقة واحدة غالية بذاكرة 24GB، يجمع هذا التجميع بين بطاقتين متوسطتي المدى بذاكرة 16GB لكل منهما عبر PCIe باستخدام وضع تقسيم tensor في llama.cpp، مما يضاعف سعة VRAM بأقل من سعر بطاقة RTX 5090 واحدة. يغطي هذا الدليل القطع الدقيقة، ومتطلب اللوحة الأم الذي يجعل ثنائي GPU يعمل بشكل صحيح، وسرعات الرموز في الثانية الحقيقية.

Key Takeaways

  • تكلفة التجميع الإجمالية: نحو 1,940 دولاراً. بطاقتا RTX 5060 Ti 16GB (860 دولاراً إجمالاً)، Ryzen 7 9700X (330 دولاراً)، ذاكرة 64GB DDR5-6000 (180 دولاراً)، قرص NVMe Gen4 بسعة 2TB (130 دولاراً)، لوحة أم B650 ATX بمنفذي x8/x8 (180 دولاراً)، مزود طاقة 850W بشهادة 80+ Gold (130 دولاراً)، صندوق ATX (90 دولاراً).
  • بطاقتا GPU بذاكرة 16GB تتفوقان على بطاقة واحدة بذاكرة 24GB من حيث قيمة VRAM مقابل السعر. ذاكرة VRAM مجتمعة سعة 32GB بنحو 860 دولاراً تتفوق على RTX 3090 24GB مستعملة (نحو 700-750 دولاراً لذاكرة إجمالية أقل) وتكلّف أقل بكثير من بطاقة workstation واحدة بذاكرة 32GB.
  • تستوعب نماذج 70B وتعمل بسرعة 12-18 tok/s عبر تقسيم tensor في llama.cpp موزَّعاً على البطاقتين — وهو السبب الكامل وراء استخدام هذا التجميع بطاقتين بدلاً من بطاقة واحدة أكبر.
  • يجب أن تدعم اللوحة الأم تقسيم PCIe بوضع x8/x8، وليس مجرد منفذين ماديين بحجم x16. اللوحة التي تشغّل المنفذ الثاني بوضع x4 كهربائياً تخلق عنق زجاجة حقيقياً في عرض النطاق لاستدلال تقسيم tensor.
  • يظل الخيار الاحتياطي بـ GPU واحدة جيداً: للنماذج الأصغر، يمنح التشغيل على بطاقة RTX 5060 Ti واحدة فقط سرعة 25-30 tok/s لنموذج 32B — أسرع من تقسيم نموذج كان سيتناسب أصلاً مع بطاقة واحدة.
  • تجنّب: أزواج GPU غير المتطابقة (مثل بطاقة 5060 Ti واحدة مع بطاقة 4060 Ti واحدة) — يتحدد أداء تقسيم tensor بالبطاقة الأبطأ، ويسبب اختلاف تعريفات أجيال GPU عدم استقرار.

لماذا بطاقتا GPU بدلاً من بطاقة واحدة أكبر

عند ميزانية 2,000 دولار، يبلغ تجميع GPU واحدة أقصاه عند RTX 3090 24GB مستعملة أو RTX 5070 Ti 16GB — ولا تصل أي منهما إلى سعة نماذج من فئة 70B. يدعم كل من llama.cpp وvLLM استدلال تقسيم tensor، الذي يوزّع طبقات النموذج عبر عدة بطاقات GPU متصلة باللوحة الأم نفسها، معاملاً VRAM المجتمعة كتجمّع واحد. توفّر بطاقتا RTX 5060 Ti 16GB ذاكرة VRAM مجتمعة سعة 32GB بمال أقل من بطاقة واحدة بذاكرة 24GB، وتتجاوز بارتياح ما يحتاجه نموذج 70B عند Q4 (نحو 40GB ميزانية VRAM+نظام إجمالية، إذ يحتاج النموذج بحد ذاته نحو 38-40GB موزَّعة على البطاقتين عند Q4).

يعمل هذا فقط لأن كلتا البطاقتين من الطراز نفسه — تؤدي VRAM أو الحوسبة غير المتطابقة بين البطاقتين إلى تحديد التقسيم بسرعة البطاقة الأضعف، وقد تسبب متطلبات التعريفات غير المتطابقة بين أجيال GPU عدم استقرار مباشراً.

بطاقتا GPU متطابقتان بذاكرة 16GB مجمَّعتان عبر استدلال تقسيم tensor تقدّمان VRAM قابلة للاستخدام أكثر مقابل كل دولار من بطاقة واحدة أكبر عند نفس ميزانية الـ 2,000 دولار.

تقسيم tensor = برمجية توزّع طبقات النموذج عبر بطاقتي GPU بحيث تُجمع ذاكرتاهما معاً، مثل RAID لذاكرة الرسومات.

VRAM المطلوبة حسب حجم النموذج عند التكميم Q4: يحتاج 7B إلى ~5GB، و14B إلى ~9GB، و32B إلى ~15GB — وكلها تتسع ضمن بطاقة 16GB الخاصة ببناء الـ1,000 دولار. يحتاج 70B إلى ~40GB، وهو ما يتطلب إجمالي 32GB من VRAM لبطاقتي GPU في بناء الـ2,000 دولار.
VRAM المطلوبة حسب حجم النموذج عند التكميم Q4: يحتاج 7B إلى ~5GB، و14B إلى ~9GB، و32B إلى ~15GB — وكلها تتسع ضمن بطاقة 16GB الخاصة ببناء الـ1,000 دولار. يحتاج 70B إلى ~40GB، وهو ما يتطلب إجمالي 32GB من VRAM لبطاقتي GPU في بناء الـ2,000 دولار.

قائمة القطع الكاملة

الأسعار هي أسعار السوق كما في يوليو 2026 وتختلف حسب المنطقة والمتجر.

المكوّنالاختيارالسعرالسبب
GPU (×2)بطاقتا RTX 5060 Ti 16GB$860ذاكرة VRAM مجتمعة سعة 32GB عبر تقسيم tensor — الغرض الأساسي من هذا التجميع
CPUAMD Ryzen 7 9700X$3308 نوى تتحمل أعباء PCIe/التعريفات لبطاقتين وأي طبقات مُفرَّغة على CPU
RAM64GB DDR5-6000 (2x32GB)$180تحتاج النماذج الأكبر وأعباء تعريفات ثنائي GPU هامشاً أكبر من تجميع GPU واحدة
التخزينقرص NVMe Gen4 بسعة 2TB$130تستخدم نماذج 70B عند Q4 وحدها نحو 40GB؛ تحتاج مكتبة متعددة النماذج مساحة إضافية
اللوحة الأمB650 ATX بدعم PCIe بوضع x8/x8$180يجب تقسيم مسارات PCIe بوضع x8/x8، وليس x16/x4، لتجنّب عنق زجاجة في عرض نطاق تقسيم tensor
مزود الطاقة850W بشهادة 80+ Gold$130تسحب بطاقتا RTX 5060 Ti نحو 360W مجتمعة؛ يترك 850W هامشاً لذروات الطاقة العابرة
الصندوقصندوق ATX متوسط (مساحة لثنائي GPU)$90يحتاج تباعداً بين بطاقتي GPU ثنائيتي المنفذ لتدفق هواء كافٍ
مبرد CPUمبرد هوائي متوسط المدى$40يستفيد Ryzen 7 9700X تحت حمل استدلال ثنائي GPU المستمر من تبريد أفضل من الأصلي
مقارنة استهلاك الطاقة التقديري للنظام بسعة مزود الطاقة: يستهلك بناء الـ1,000 دولار بكرت GPU واحد نحو 285W من مزود طاقة 650W (هامش 56%)؛ ويستهلك بناء الـ2,000 دولار بكرتي GPU نحو 475W من مزود طاقة 850W (هامش 44%).
مقارنة استهلاك الطاقة التقديري للنظام بسعة مزود الطاقة: يستهلك بناء الـ1,000 دولار بكرت GPU واحد نحو 285W من مزود طاقة 650W (هامش 56%)؛ ويستهلك بناء الـ2,000 دولار بكرتي GPU نحو 475W من مزود طاقة 850W (هامش 44%).

متطلب اللوحة الأم الذي يغفل عنه معظم البناة

منفذا PCIe x16 ماديان لا يضمنان اتصالين كهربائيين بوضع x16. تربط لوحات أم استهلاكية كثيرة المنفذ الثاني بوضع x4 كهربائياً، حتى لو كان حجمه المادي x16. لاستدلال LLM بتقسيم tensor، تنقل كلتا البطاقتين البيانات بنشاط في كل تمريرة أمامية — يصبح المنفذ الثاني بوضع x4 عنق زجاجة حقيقياً، لا نظرياً.

قبل شراء لوحة أم، تحقق من ورقة مواصفاتها بحثاً عن "توزيع مسارات PCIe" أو "وضع x8/x8" — يُذكر هذا عادةً بوضوح للوحات التي تدعمه، إذ يتطلب شريحة تحكم بمسارات PCIe أصلية كافية للتقسيم المتساوي. يفترض هذا التجميع لوحة أم B650 ATX تذكر صراحةً دعم x8/x8.

  • تأكد من x8/x8، وليس x16/x4: تحقق من مخطط مسارات PCIe في دليل اللوحة الأم، وليس فقط من عدد المنافذ المادية.
  • تباعد المنافذ مهم مادياً أيضاً: تحتاج بطاقتا GPU ثنائيتا المنفذ إلى منفذ فارغ واحد على الأقل كمسافة بينهما لتدفق الهواء — تحقق من تباعد المنافذ في تخطيط اللوحة، وليس فقط توزيع المسارات.
  • جيل PCIe أقل أهمية من عدد المسارات في هذا العبء — يتجاوز PCIe 4.0 بوضع x8 بالفعل ما يحتاجه نقل بيانات تقسيم tensor فعلياً؛ ملاحقة منافذ PCIe 5.0 لا تستحق علاوة السعر هنا.

الأداء المتوقع حسب حجم النموذج

جميع الأرقام لتكميم Q4_K_M وقيست باستخدام تقسيم tensor في llama.cpp عبر بطاقتي RTX 5060 Ti 16GB. تستخدم أرقام GPU الواحدة بطاقة واحدة فقط.

حجم النموذجالإعدادVRAM المستخدمة (Q4)رموز/ثانية
7B-14BGPU واحدة (دون حاجة للتقسيم)~4.5-9GB55-65 (7B) / 28-35 (14B)
32BGPU واحدة~14.5-15.5GB25-30 (هامش سياق كامل مقارنة بتجميع الـ 1,000 دولار)
32Bتقسيم tensor (كلتا البطاقتين)~15GB موزَّعة30-38 (التقسيم يساعد حتى عندما يتناسب مع بطاقة واحدة)
70Bتقسيم tensor (كلتا البطاقتين، مطلوب)~38-40GB موزَّعة12-18
عدد الرموز في الثانية (tok/s) حسب حجم النموذج عند التكميم Q4: يتساوى البناءان عند 7B (~60 tok/s) و14B (~31 tok/s)، لكن بناء الـ2,000 دولار بكرتي GPU يتفوق عند 32B عبر tensor-split (~34 مقابل ~13 tok/s)، وهو الوحيد القادر على تشغيل 70B (~15 tok/s).
عدد الرموز في الثانية (tok/s) حسب حجم النموذج عند التكميم Q4: يتساوى البناءان عند 7B (~60 tok/s) و14B (~31 tok/s)، لكن بناء الـ2,000 دولار بكرتي GPU يتفوق عند 32B عبر tensor-split (~34 مقابل ~13 tok/s)، وهو الوحيد القادر على تشغيل 70B (~15 tok/s).

إعداد استدلال تقسيم tensor

يتعامل llama.cpp مع تقسيم tensor عبر علامة سطر أوامر واحدة بمجرد أن يتعرّف التعريف على كلتا البطاقتين. بعد التأكد من ظهور بطاقتي RTX 5060 Ti في `nvidia-smi`، شغّل نموذجاً باستخدام `--tensor-split 1,1` لتقسيم الطبقات بالتساوي بينهما، أو عدّل النسبة (مثل `--tensor-split 1,1.2`) إذا كانت إحدى البطاقتين تشغّل أيضاً شاشة عرض وتحتاج VRAM محجوزة أقل قليلاً للنموذج.

يدعم Ollama عدة بطاقات GPU تلقائياً في الإصدارات الحديثة — يكتشف VRAM المتاحة عبر جميع بطاقات GPU المثبَّتة ويقسّم النماذج الكبيرة دون إعداد يدوي، رغم أن علامات llama.cpp اليدوية تمنح تحكماً أدق في نسبة التقسيم.

  • تحقق من اكتشاف كلتا البطاقتين: يجب أن يسرد `nvidia-smi` كلتا البطاقتين بإصدارات تعريف متطابقة قبل محاولة التقسيم.
  • ابدأ بتقسيم متساوٍ: يُعد `--tensor-split 1,1` في llama.cpp الإعداد الافتراضي الصحيح لبطاقتين متطابقتين.
  • راقب تشبّع عرض نطاق PCIe: إذا كانت سرعة الرموز في الثانية أقل بكثير من النطاق المتوقع، تأكد من أن اللوحة الأم تعمل فعلياً بوضع x8/x8 ولا تعود بصمت إلى x4.

مسار الترقية

الترقية الأوضح من هذا التجميع هي إضافة بطاقة RTX 5060 Ti 16GB ثالثة إذا كان للوحة الأم منفذ PCIe ثالث بعرض نطاق قابل للاستخدام، مما يرفع VRAM المجتمعة إلى 48GB — كافية لتكميمات أكبر لنماذج 70B أو هامش مريح لنوافذ سياق أطول.

ترقية أغلى لكنها أبسط هي استبدال بطاقتي RTX 5060 Ti بعد ذلك ببطاقتي RTX 5070 Ti 16GB، مع الإبقاء على سقف VRAM نفسه عند 32GB لكن مع زيادة الحوسبة الخام وعرض نطاق الذاكرة، مما يحسّن tok/s دون تغيير أحجام النماذج المتناسبة.

الأخطاء الشائعة عند هذه الميزانية

  • شراء لوحة أم بناءً على علامة "تدعم SLI/CrossFire" فقط — يشير هذا المصطلح التسويقي إلى تصيير الألعاب متعدد GPU، وليس توزيع مسارات PCIe لأعباء الحوسبة، ولا يضمن وضع x8/x8.
  • خلط أجيال GPU (مثل بطاقة RTX 5060 Ti واحدة مع بطاقة RTX 4060 Ti واحدة) لتوفير المال — يتحدد أداء تقسيم tensor بالبطاقة الأبطأ/الأقدم، مما يمحو معظم فائدة البطاقة الأحدث.
  • التقليل من هامش مزود الطاقة — قد تسحب بطاقتا GPU قرب TDP المقدَّر مجتمعاً في آن واحد أثناء توليد طويل بذروة قصيرة تتجاوز 360W بوضوح؛ يسبب مزود طاقة صغير الحجم إغلاقاً عشوائياً تحت الحمل، لا تباطؤاً تدريجياً.
  • افتراض أن مضاعفة بطاقات GPU تعني مضاعفة tok/s — يضيف تقسيم tensor عبء نقل PCIe بين الطبقات، لذا فإن الإنتاجية المجتمعة أقل بشكل ملموس من ضعف سرعة بطاقة واحدة على نماذج تتناسب بالفعل مع بطاقة واحدة.

الأسئلة الشائعة

هل يستطيع كمبيوتر بميزانية 2,000 دولار تشغيل نماذج LLM محلية من فئة 70B؟

نعم، باستخدام بطاقتي RTX 5060 Ti 16GB في إعداد تقسيم tensor، والذي يجمع ذاكرة VRAM مجتمعة سعة 32GB — كافية لنماذج 70B عند تكميم Q4، بسرعة 12-18 رمزاً في الثانية.

لماذا استخدام بطاقتي GPU بذاكرة 16GB بدلاً من بطاقة واحدة بذاكرة 24GB أو 32GB؟

توفّر بطاقتا GPU متطابقتان بذاكرة 16GB ذاكرة VRAM مجتمعة أكبر مقابل كل دولار من بطاقة واحدة أكبر بنفس الميزانية، وتتيح ميزة تقسيم tensor في llama.cpp عمل ذاكرة كلتا البطاقتين كتجمّع واحد للاستدلال.

هل تهم اللوحة الأم لتجميع كمبيوتر LLM محلي بثنائي GPU؟

نعم، بشكل كبير. يجب أن تدعم اللوحة توزيع مسارات PCIe بوضع x8/x8 عبر منفذي GPU — اللوحة التي تشغّل المنفذ الثاني بوضع x4 كهربائياً تخلق عنق زجاجة حقيقياً في عرض النطاق أثناء استدلال تقسيم tensor، لا نظرياً فقط.

هل يمكنني خلط طرازات GPU مختلفة في تجميع بثنائي GPU؟

غير موصى به. يتحدد أداء تقسيم tensor بالبطاقة الأبطأ أو الأقدم في الزوج، وقد تسبب متطلبات التعريفات غير المتطابقة بين أجيال GPU عدم استقرار. استخدم بطاقتي GPU متطابقتين.

هل Ollama أم llama.cpp أفضل لاستدلال تقسيم tensor بعدة بطاقات GPU؟

يكتشف Ollama عدة بطاقات GPU تلقائياً ولا يتطلب إعداداً يدوياً، وهو أبسط لمعظم المستخدمين. تمنح علامة --tensor-split اليدوية في llama.cpp تحكماً أدق في نسبة التقسيم، وهو مفيد إذا كانت إحدى البطاقتين تشغّل أيضاً شاشة عرض وتحتاج VRAM محجوزة أقل.

إلى أي مدى يؤثر عرض نطاق PCIe فعلياً على أداء تقسيم tensor؟

بشكل كبير إذا كان المنفذ يعمل بوضع x4 بدلاً من x8. يوفّر PCIe 4.0 بوضع x8 بالفعل عرض نطاق أكبر مما يحتاجه استدلال تقسيم tensor عادة، لكن x4 يصبح عنق زجاجة حقيقياً لأن كلتا البطاقتين تنقلان البيانات بنشاط في كل تمريرة أمامية.

هل مضاعفة بطاقات GPU تضاعف سرعة الرموز في الثانية؟

لا. يضيف تقسيم tensor عبء نقل PCIe بين الطبقات الموزَّعة عبر البطاقات، لذا فإن الإنتاجية المجتمعة على نموذج يتناسب بالفعل مع بطاقة واحدة أقل بشكل ملموس من ضعف سرعة تلك البطاقة الواحدة. الفائدة هي استيعاب نماذج أكبر، لا مضاعفة السرعة خطياً.

ما إجمالي استهلاك الطاقة لبطاقتي RTX 5060 Ti؟

نحو 360W مجتمعة عند الحمل الكامل (180W TDP مقدَّرة لكل منهما)، مع ذروات عابرة قصيرة تتجاوز ذلك. يترك مزود طاقة 850W بشهادة 80+ Gold هامشاً مريحاً لبقية النظام إلى جانب تلك الذروات.

هل يمكن لهذا التجميع تشغيل نماذج أصغر بسرعة أعلى باستخدام بطاقة GPU واحدة فقط؟

نعم — للنماذج التي تتناسب بالفعل مع 16GB (حتى 32B عند Q4)، يتجنّب التشغيل على بطاقة RTX 5060 Ti واحدة عبء PCIe لتقسيم tensor تماماً، وهو أسرع من تقسيم نموذج لم يكن بحاجة إلى التقسيم أصلاً.

ما مسار الترقية بعد هذا التجميع؟

إضافة بطاقة RTX 5060 Ti 16GB ثالثة متطابقة (إذا كان للوحة الأم منفذ PCIe ثالث قابل للاستخدام) ترفع VRAM المجتمعة إلى 48GB. بدلاً من ذلك، يحافظ استبدال كلتا البطاقتين ببطاقتي RTX 5070 Ti 16GB لاحقاً على سقف 32GB نفسه لكنه يزيد الحوسبة وعرض نطاق الذاكرة.

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs