Key Takeaways
- تكلفة التجميع الإجمالية: نحو 1,940 دولاراً. بطاقتا RTX 5060 Ti 16GB (860 دولاراً إجمالاً)، Ryzen 7 9700X (330 دولاراً)، ذاكرة 64GB DDR5-6000 (180 دولاراً)، قرص NVMe Gen4 بسعة 2TB (130 دولاراً)، لوحة أم B650 ATX بمنفذي x8/x8 (180 دولاراً)، مزود طاقة 850W بشهادة 80+ Gold (130 دولاراً)، صندوق ATX (90 دولاراً).
- بطاقتا GPU بذاكرة 16GB تتفوقان على بطاقة واحدة بذاكرة 24GB من حيث قيمة VRAM مقابل السعر. ذاكرة VRAM مجتمعة سعة 32GB بنحو 860 دولاراً تتفوق على RTX 3090 24GB مستعملة (نحو 700-750 دولاراً لذاكرة إجمالية أقل) وتكلّف أقل بكثير من بطاقة workstation واحدة بذاكرة 32GB.
- تستوعب نماذج 70B وتعمل بسرعة 12-18 tok/s عبر تقسيم tensor في llama.cpp موزَّعاً على البطاقتين — وهو السبب الكامل وراء استخدام هذا التجميع بطاقتين بدلاً من بطاقة واحدة أكبر.
- يجب أن تدعم اللوحة الأم تقسيم PCIe بوضع x8/x8، وليس مجرد منفذين ماديين بحجم x16. اللوحة التي تشغّل المنفذ الثاني بوضع x4 كهربائياً تخلق عنق زجاجة حقيقياً في عرض النطاق لاستدلال تقسيم tensor.
- يظل الخيار الاحتياطي بـ GPU واحدة جيداً: للنماذج الأصغر، يمنح التشغيل على بطاقة RTX 5060 Ti واحدة فقط سرعة 25-30 tok/s لنموذج 32B — أسرع من تقسيم نموذج كان سيتناسب أصلاً مع بطاقة واحدة.
- تجنّب: أزواج GPU غير المتطابقة (مثل بطاقة 5060 Ti واحدة مع بطاقة 4060 Ti واحدة) — يتحدد أداء تقسيم tensor بالبطاقة الأبطأ، ويسبب اختلاف تعريفات أجيال GPU عدم استقرار.
لماذا بطاقتا GPU بدلاً من بطاقة واحدة أكبر
عند ميزانية 2,000 دولار، يبلغ تجميع GPU واحدة أقصاه عند RTX 3090 24GB مستعملة أو RTX 5070 Ti 16GB — ولا تصل أي منهما إلى سعة نماذج من فئة 70B. يدعم كل من llama.cpp وvLLM استدلال تقسيم tensor، الذي يوزّع طبقات النموذج عبر عدة بطاقات GPU متصلة باللوحة الأم نفسها، معاملاً VRAM المجتمعة كتجمّع واحد. توفّر بطاقتا RTX 5060 Ti 16GB ذاكرة VRAM مجتمعة سعة 32GB بمال أقل من بطاقة واحدة بذاكرة 24GB، وتتجاوز بارتياح ما يحتاجه نموذج 70B عند Q4 (نحو 40GB ميزانية VRAM+نظام إجمالية، إذ يحتاج النموذج بحد ذاته نحو 38-40GB موزَّعة على البطاقتين عند Q4).
يعمل هذا فقط لأن كلتا البطاقتين من الطراز نفسه — تؤدي VRAM أو الحوسبة غير المتطابقة بين البطاقتين إلى تحديد التقسيم بسرعة البطاقة الأضعف، وقد تسبب متطلبات التعريفات غير المتطابقة بين أجيال GPU عدم استقرار مباشراً.
بطاقتا GPU متطابقتان بذاكرة 16GB مجمَّعتان عبر استدلال تقسيم tensor تقدّمان VRAM قابلة للاستخدام أكثر مقابل كل دولار من بطاقة واحدة أكبر عند نفس ميزانية الـ 2,000 دولار.
تقسيم tensor = برمجية توزّع طبقات النموذج عبر بطاقتي GPU بحيث تُجمع ذاكرتاهما معاً، مثل RAID لذاكرة الرسومات.
قائمة القطع الكاملة
الأسعار هي أسعار السوق كما في يوليو 2026 وتختلف حسب المنطقة والمتجر.
| المكوّن | الاختيار | السعر | السبب |
|---|---|---|---|
| GPU (×2) | بطاقتا RTX 5060 Ti 16GB | $860 | ذاكرة VRAM مجتمعة سعة 32GB عبر تقسيم tensor — الغرض الأساسي من هذا التجميع |
| CPU | AMD Ryzen 7 9700X | $330 | 8 نوى تتحمل أعباء PCIe/التعريفات لبطاقتين وأي طبقات مُفرَّغة على CPU |
| RAM | 64GB DDR5-6000 (2x32GB) | $180 | تحتاج النماذج الأكبر وأعباء تعريفات ثنائي GPU هامشاً أكبر من تجميع GPU واحدة |
| التخزين | قرص NVMe Gen4 بسعة 2TB | $130 | تستخدم نماذج 70B عند Q4 وحدها نحو 40GB؛ تحتاج مكتبة متعددة النماذج مساحة إضافية |
| اللوحة الأم | B650 ATX بدعم PCIe بوضع x8/x8 | $180 | يجب تقسيم مسارات PCIe بوضع x8/x8، وليس x16/x4، لتجنّب عنق زجاجة في عرض نطاق تقسيم tensor |
| مزود الطاقة | 850W بشهادة 80+ Gold | $130 | تسحب بطاقتا RTX 5060 Ti نحو 360W مجتمعة؛ يترك 850W هامشاً لذروات الطاقة العابرة |
| الصندوق | صندوق ATX متوسط (مساحة لثنائي GPU) | $90 | يحتاج تباعداً بين بطاقتي GPU ثنائيتي المنفذ لتدفق هواء كافٍ |
| مبرد CPU | مبرد هوائي متوسط المدى | $40 | يستفيد Ryzen 7 9700X تحت حمل استدلال ثنائي GPU المستمر من تبريد أفضل من الأصلي |
متطلب اللوحة الأم الذي يغفل عنه معظم البناة
منفذا PCIe x16 ماديان لا يضمنان اتصالين كهربائيين بوضع x16. تربط لوحات أم استهلاكية كثيرة المنفذ الثاني بوضع x4 كهربائياً، حتى لو كان حجمه المادي x16. لاستدلال LLM بتقسيم tensor، تنقل كلتا البطاقتين البيانات بنشاط في كل تمريرة أمامية — يصبح المنفذ الثاني بوضع x4 عنق زجاجة حقيقياً، لا نظرياً.
قبل شراء لوحة أم، تحقق من ورقة مواصفاتها بحثاً عن "توزيع مسارات PCIe" أو "وضع x8/x8" — يُذكر هذا عادةً بوضوح للوحات التي تدعمه، إذ يتطلب شريحة تحكم بمسارات PCIe أصلية كافية للتقسيم المتساوي. يفترض هذا التجميع لوحة أم B650 ATX تذكر صراحةً دعم x8/x8.
- تأكد من x8/x8، وليس x16/x4: تحقق من مخطط مسارات PCIe في دليل اللوحة الأم، وليس فقط من عدد المنافذ المادية.
- تباعد المنافذ مهم مادياً أيضاً: تحتاج بطاقتا GPU ثنائيتا المنفذ إلى منفذ فارغ واحد على الأقل كمسافة بينهما لتدفق الهواء — تحقق من تباعد المنافذ في تخطيط اللوحة، وليس فقط توزيع المسارات.
- جيل PCIe أقل أهمية من عدد المسارات في هذا العبء — يتجاوز PCIe 4.0 بوضع x8 بالفعل ما يحتاجه نقل بيانات تقسيم tensor فعلياً؛ ملاحقة منافذ PCIe 5.0 لا تستحق علاوة السعر هنا.
الأداء المتوقع حسب حجم النموذج
جميع الأرقام لتكميم Q4_K_M وقيست باستخدام تقسيم tensor في llama.cpp عبر بطاقتي RTX 5060 Ti 16GB. تستخدم أرقام GPU الواحدة بطاقة واحدة فقط.
| حجم النموذج | الإعداد | VRAM المستخدمة (Q4) | رموز/ثانية |
|---|---|---|---|
| 7B-14B | GPU واحدة (دون حاجة للتقسيم) | ~4.5-9GB | 55-65 (7B) / 28-35 (14B) |
| 32B | GPU واحدة | ~14.5-15.5GB | 25-30 (هامش سياق كامل مقارنة بتجميع الـ 1,000 دولار) |
| 32B | تقسيم tensor (كلتا البطاقتين) | ~15GB موزَّعة | 30-38 (التقسيم يساعد حتى عندما يتناسب مع بطاقة واحدة) |
| 70B | تقسيم tensor (كلتا البطاقتين، مطلوب) | ~38-40GB موزَّعة | 12-18 |
إعداد استدلال تقسيم tensor
يتعامل llama.cpp مع تقسيم tensor عبر علامة سطر أوامر واحدة بمجرد أن يتعرّف التعريف على كلتا البطاقتين. بعد التأكد من ظهور بطاقتي RTX 5060 Ti في `nvidia-smi`، شغّل نموذجاً باستخدام `--tensor-split 1,1` لتقسيم الطبقات بالتساوي بينهما، أو عدّل النسبة (مثل `--tensor-split 1,1.2`) إذا كانت إحدى البطاقتين تشغّل أيضاً شاشة عرض وتحتاج VRAM محجوزة أقل قليلاً للنموذج.
يدعم Ollama عدة بطاقات GPU تلقائياً في الإصدارات الحديثة — يكتشف VRAM المتاحة عبر جميع بطاقات GPU المثبَّتة ويقسّم النماذج الكبيرة دون إعداد يدوي، رغم أن علامات llama.cpp اليدوية تمنح تحكماً أدق في نسبة التقسيم.
- تحقق من اكتشاف كلتا البطاقتين: يجب أن يسرد `nvidia-smi` كلتا البطاقتين بإصدارات تعريف متطابقة قبل محاولة التقسيم.
- ابدأ بتقسيم متساوٍ: يُعد `--tensor-split 1,1` في llama.cpp الإعداد الافتراضي الصحيح لبطاقتين متطابقتين.
- راقب تشبّع عرض نطاق PCIe: إذا كانت سرعة الرموز في الثانية أقل بكثير من النطاق المتوقع، تأكد من أن اللوحة الأم تعمل فعلياً بوضع x8/x8 ولا تعود بصمت إلى x4.
مسار الترقية
الترقية الأوضح من هذا التجميع هي إضافة بطاقة RTX 5060 Ti 16GB ثالثة إذا كان للوحة الأم منفذ PCIe ثالث بعرض نطاق قابل للاستخدام، مما يرفع VRAM المجتمعة إلى 48GB — كافية لتكميمات أكبر لنماذج 70B أو هامش مريح لنوافذ سياق أطول.
ترقية أغلى لكنها أبسط هي استبدال بطاقتي RTX 5060 Ti بعد ذلك ببطاقتي RTX 5070 Ti 16GB، مع الإبقاء على سقف VRAM نفسه عند 32GB لكن مع زيادة الحوسبة الخام وعرض نطاق الذاكرة، مما يحسّن tok/s دون تغيير أحجام النماذج المتناسبة.
الأخطاء الشائعة عند هذه الميزانية
- شراء لوحة أم بناءً على علامة "تدعم SLI/CrossFire" فقط — يشير هذا المصطلح التسويقي إلى تصيير الألعاب متعدد GPU، وليس توزيع مسارات PCIe لأعباء الحوسبة، ولا يضمن وضع x8/x8.
- خلط أجيال GPU (مثل بطاقة RTX 5060 Ti واحدة مع بطاقة RTX 4060 Ti واحدة) لتوفير المال — يتحدد أداء تقسيم tensor بالبطاقة الأبطأ/الأقدم، مما يمحو معظم فائدة البطاقة الأحدث.
- التقليل من هامش مزود الطاقة — قد تسحب بطاقتا GPU قرب TDP المقدَّر مجتمعاً في آن واحد أثناء توليد طويل بذروة قصيرة تتجاوز 360W بوضوح؛ يسبب مزود طاقة صغير الحجم إغلاقاً عشوائياً تحت الحمل، لا تباطؤاً تدريجياً.
- افتراض أن مضاعفة بطاقات GPU تعني مضاعفة tok/s — يضيف تقسيم tensor عبء نقل PCIe بين الطبقات، لذا فإن الإنتاجية المجتمعة أقل بشكل ملموس من ضعف سرعة بطاقة واحدة على نماذج تتناسب بالفعل مع بطاقة واحدة.
الأسئلة الشائعة
هل يستطيع كمبيوتر بميزانية 2,000 دولار تشغيل نماذج LLM محلية من فئة 70B؟
نعم، باستخدام بطاقتي RTX 5060 Ti 16GB في إعداد تقسيم tensor، والذي يجمع ذاكرة VRAM مجتمعة سعة 32GB — كافية لنماذج 70B عند تكميم Q4، بسرعة 12-18 رمزاً في الثانية.
لماذا استخدام بطاقتي GPU بذاكرة 16GB بدلاً من بطاقة واحدة بذاكرة 24GB أو 32GB؟
توفّر بطاقتا GPU متطابقتان بذاكرة 16GB ذاكرة VRAM مجتمعة أكبر مقابل كل دولار من بطاقة واحدة أكبر بنفس الميزانية، وتتيح ميزة تقسيم tensor في llama.cpp عمل ذاكرة كلتا البطاقتين كتجمّع واحد للاستدلال.
هل تهم اللوحة الأم لتجميع كمبيوتر LLM محلي بثنائي GPU؟
نعم، بشكل كبير. يجب أن تدعم اللوحة توزيع مسارات PCIe بوضع x8/x8 عبر منفذي GPU — اللوحة التي تشغّل المنفذ الثاني بوضع x4 كهربائياً تخلق عنق زجاجة حقيقياً في عرض النطاق أثناء استدلال تقسيم tensor، لا نظرياً فقط.
هل يمكنني خلط طرازات GPU مختلفة في تجميع بثنائي GPU؟
غير موصى به. يتحدد أداء تقسيم tensor بالبطاقة الأبطأ أو الأقدم في الزوج، وقد تسبب متطلبات التعريفات غير المتطابقة بين أجيال GPU عدم استقرار. استخدم بطاقتي GPU متطابقتين.
هل Ollama أم llama.cpp أفضل لاستدلال تقسيم tensor بعدة بطاقات GPU؟
يكتشف Ollama عدة بطاقات GPU تلقائياً ولا يتطلب إعداداً يدوياً، وهو أبسط لمعظم المستخدمين. تمنح علامة --tensor-split اليدوية في llama.cpp تحكماً أدق في نسبة التقسيم، وهو مفيد إذا كانت إحدى البطاقتين تشغّل أيضاً شاشة عرض وتحتاج VRAM محجوزة أقل.
إلى أي مدى يؤثر عرض نطاق PCIe فعلياً على أداء تقسيم tensor؟
بشكل كبير إذا كان المنفذ يعمل بوضع x4 بدلاً من x8. يوفّر PCIe 4.0 بوضع x8 بالفعل عرض نطاق أكبر مما يحتاجه استدلال تقسيم tensor عادة، لكن x4 يصبح عنق زجاجة حقيقياً لأن كلتا البطاقتين تنقلان البيانات بنشاط في كل تمريرة أمامية.
هل مضاعفة بطاقات GPU تضاعف سرعة الرموز في الثانية؟
لا. يضيف تقسيم tensor عبء نقل PCIe بين الطبقات الموزَّعة عبر البطاقات، لذا فإن الإنتاجية المجتمعة على نموذج يتناسب بالفعل مع بطاقة واحدة أقل بشكل ملموس من ضعف سرعة تلك البطاقة الواحدة. الفائدة هي استيعاب نماذج أكبر، لا مضاعفة السرعة خطياً.
ما إجمالي استهلاك الطاقة لبطاقتي RTX 5060 Ti؟
نحو 360W مجتمعة عند الحمل الكامل (180W TDP مقدَّرة لكل منهما)، مع ذروات عابرة قصيرة تتجاوز ذلك. يترك مزود طاقة 850W بشهادة 80+ Gold هامشاً مريحاً لبقية النظام إلى جانب تلك الذروات.
هل يمكن لهذا التجميع تشغيل نماذج أصغر بسرعة أعلى باستخدام بطاقة GPU واحدة فقط؟
نعم — للنماذج التي تتناسب بالفعل مع 16GB (حتى 32B عند Q4)، يتجنّب التشغيل على بطاقة RTX 5060 Ti واحدة عبء PCIe لتقسيم tensor تماماً، وهو أسرع من تقسيم نموذج لم يكن بحاجة إلى التقسيم أصلاً.
ما مسار الترقية بعد هذا التجميع؟
إضافة بطاقة RTX 5060 Ti 16GB ثالثة متطابقة (إذا كان للوحة الأم منفذ PCIe ثالث قابل للاستخدام) ترفع VRAM المجتمعة إلى 48GB. بدلاً من ذلك، يحافظ استبدال كلتا البطاقتين ببطاقتي RTX 5070 Ti 16GB لاحقاً على سقف 32GB نفسه لكنه يزيد الحوسبة وعرض نطاق الذاكرة.