Key Takeaways
- تكلفة التجميع الإجمالية: نحو 1,010 دولاراً. RTX 5060 Ti 16GB (430 دولاراً)، Ryzen 5 7600 (180 دولاراً)، ذاكرة 32GB DDR5-6000 (90 دولاراً)، قرص NVMe Gen4 بسعة 1TB (70 دولاراً)، لوحة أم B650 مقاس mATX (130 دولاراً)، مزود طاقة 650W بشهادة 80+ Gold (75 دولاراً)، صندوق mATX (65 دولاراً).
- ذاكرة VRAM بسعة 16GB هي الهدف، وليست سرعة GPU الخام. تتفوق RTX 5060 Ti 16GB على بطاقات أسرع بذاكرة 8-12GB في عمل LLM لأن حجم النموذج، لا عدد الوحدات المظللة (shaders)، هو ما يحدد أساساً ما يمكن تشغيله.
- نماذج 7B: 55-65 tok/s عند Q4. نماذج 14B: 28-35 tok/s. تستوعب نماذج 32B عند Q4 مع هامش 1-2GB متبقٍ للسياق، وتعمل بسرعة 12-15 tok/s.
- نماذج 70B لا تتناسب. يحتاج نموذج 70B عند Q4 إلى نحو 40GB من VRAM؛ يبلغ هذا التجميع أقصاه عند نحو 32B. راجع تجميع الـ 2,000 دولار بثنائي GPU لاستدلال من فئة 70B.
- ذاكرة نظام 32GB، وليست 16GB. يحتاج تحميل النموذج وأعباء نظام التشغيل وأي طبقات مُفرَّغة على CPU إلى هامش يتجاوز ما توفره GPU وحدها؛ تسبب 16GB تبديلاً (swapping) على نماذج 14B فما فوق.
- تجنّب: بطاقات GPU بذاكرة 8GB (RTX 5060، RTX 4060 Ti 8GB) — تبلغ أقصاها عند 7B ولا يمكنها الانتقال إلى 13B-14B دون استبدال GPU بالكامل.
ما الذي تشتريه هذه الميزانية فعلياً
تتحدد سرعة استدلال نماذج LLM المحلية أولاً بسعة VRAM، وثانياً بعرض النطاق الترددي للذاكرة، وثالثاً وبفارق كبير بقوة الحوسبة (نوى CUDA). النموذج الذي لا يتناسب مع VRAM إما يفشل في التحميل أو ينسكب إلى ذاكرة النظام، مما يخفض الإنتاجية بمقدار 5-10 أضعاف. عند ميزانية 1,000 دولار، التخصيص الصحيح الوحيد هو الإفراط في التركيز على GPU والتقليل من كل شيء آخر — لهذا السبب يُعد CPU هنا قطعة متوسطة المدى بسعر 180 دولاراً، وليس قطعة رائدة بسعر 350 دولاراً.
يفترض هذا التجميع استدلال نموذج واحد في كل مرة (نموذج واحد محمّل في وقت واحد عبر Ollama أو LM Studio أو llama.cpp)، وليس خدمة متعددة المستخدمين المتزامنة. لخدمة طلبات متزامنة متعددة، ترتفع متطلبات VRAM أكثر، وتصبح ميزانية 1,000 دولار غير واقعية.
ينبغي لتجميع كمبيوتر LLM محلي بميزانية 1,000 دولار أن يخصص نحو نصف الميزانية لسعة VRAM في GPU، لا لسرعة CPU، لأن VRAM هي ما يحدد أساساً النماذج القابلة للتشغيل.
VRAM = ذاكرة GPU الخاصة التي يعيش فيها النموذج؛ إذا لم يتناسب النموذج معها، يتباطأ كل شيء بمقدار 5-10 أضعاف أو يفشل التحميل.
قائمة القطع الكاملة
الأسعار هي أسعار السوق كما في يوليو 2026 وتختلف حسب المنطقة والمتجر.
| المكوّن | الاختيار | السعر | السبب |
|---|---|---|---|
| GPU | RTX 5060 Ti 16GB | $430 | ذاكرة VRAM بسعة 16GB هي الغرض الأساسي من هذا التجميع — تستوعب 14B بارتياح، و32B عند Q4 ضيق |
| CPU | AMD Ryzen 5 7600 | $180 | 6 نوى كافية لاستدلال نموذج واحد؛ CPU ليس عنق الزجاجة |
| RAM | 32GB DDR5-6000 (2x16GB) | $90 | هامش لنظام التشغيل وتحميل النموذج وأي طبقات مُفرَّغة على CPU |
| التخزين | قرص NVMe Gen4 بسعة 1TB | $70 | أوقات تحميل سريعة للنماذج؛ تستخدم مكتبة من 5 نماذج نحو 40-60GB عند Q4 |
| اللوحة الأم | B650 مقاس mATX | $130 | منفذ PCIe 4.0 x16، دعم DDR5، دون ميزات غير ضرورية |
| مزود الطاقة | 650W بشهادة 80+ Gold | $75 | تسحب RTX 5060 Ti طاقة 180W؛ يترك 650W هامشاً لذروات الطاقة العابرة |
| الصندوق | صندوق متوسط mATX | $65 | تدفق هواء للاستدلال المستمر؛ يستوعب أي طول لبطاقة 5060 Ti |
| مبرد CPU | المبرد الأصلي المرفق | $0 | لا يحتاج Ryzen 5 7600 إلى تبريد إضافي لهذا العبء |
لماذا RTX 5060 Ti 16GB على بطاقات أرخص
إصدارا 8GB و12GB من بطاقات GPU المماثلة في السعر هما وفورات وهمية لعمل LLM المحلي. تأتي RTX 5060 Ti بإصدارين 8GB و16GB بفارق سعر نحو 100 دولار — بطاقة 16GB هي الوحيدة التي تستحق الشراء لاستدلال LLM، لأن إصدار 8GB لا يستوعب بارتياح أي شيء يتجاوز نموذج 7B عند Q4 مع أي طول سياق قابل للاستخدام.
يهم هامش VRAM أيضاً لطول السياق: يحتاج نموذج 7B بحد ذاته نحو 4-4.5GB عند Q4، لكن سياقاً بطول 16K رمز يضيف 1-2GB أخرى من ذاكرة KV المؤقتة. على بطاقة 8GB لا يتبقى شيء تقريباً؛ على بطاقة 16GB هناك مساحة لكل من النموذج ونافذة سياق طويلة.
- RTX 5060 Ti 8GB (330 دولاراً): تستوعب 7B عند Q4 فقط، وبالكاد — ستتجاوز نوافذ السياق الطويلة سعة VRAM. غير موصى بها.
- RTX 4060 Ti 16GB (جيل أقدم، نحو 450 دولاراً مستعملة): نفس VRAM كـ RTX 5060 Ti بسعر مماثل أو أعلى مع حوسبة أقل — لا سبب لتفضيلها جديدة.
- RTX 5060 Ti 16GB (430 دولاراً، هذا التجميع): أفضل قيمة VRAM مقابل السعر في فئة 16GB اعتباراً من يوليو 2026.
- RTX 3090 24GB مستعملة (نحو 650-750 دولاراً): VRAM أكبر (تستوعب نماذج 30B الصغيرة بارتياح أكبر) لكنها تدفع تكلفة التجميع الإجمالية إلى ما يتجاوز 1,300 دولار وتستهلك طاقة أعلى بكثير.
الأداء المتوقع حسب حجم النموذج
جميع الأرقام لتكميم Q4_K_M، وقيست باستخدام llama.cpp/Ollama على RTX 5060 Ti 16GB. تختلف السرعة الفعلية حسب طول المُدخل (prompt) وطريقة التكميم ومحرك الاستدلال.
| حجم النموذج | VRAM المستخدمة (Q4) | رموز/ثانية | يتناسب بارتياح؟ |
|---|---|---|---|
| 7B-8B | ~4.5-5GB | 55-65 | نعم — هامش سياق كامل |
| 13B-14B | ~8-9GB | 28-35 | نعم — هامش 8GB+ للسياق |
| 20B (MoE، نحو 4B نشطة) | ~12GB | 35-45 | نعم |
| 32B | ~14.5-15.5GB | 12-15 | ضيق — سياق قصير فقط (4K-8K) |
| 70B | ~40GB | غير متاح | لا يتناسب — راجع تجميع الـ 2,000 دولار بثنائي GPU |
ملاحظات التجميع
- مساحة GPU: تأكد من طول بطاقة RTX 5060 Ti (يتراوح بين 210-270mm حسب الشركة المصنعة) مقارنةً بأقصى مساحة GPU في صندوق mATX قبل الطلب.
- سرعة RAM في BIOS: غالباً ما تُشحن أطقم DDR5-6000 بسرعة JEDEC 4800 افتراضياً — فعّل EXPO/XMP في BIOS للحصول على السرعة المقدَّرة 6000، وهو ما يؤثر على توليد الرموز من جهة CPU إذا انسكبت أي طبقات إليه.
- ترتيب تثبيت التعريفات: ثبّت أحدث تعريف NVIDIA ومجموعة أدوات CUDA قبل تثبيت Ollama أو LM Studio، وليس بعده — كلاهما يكتشف قدرة GPU تلقائياً عند التثبيت.
- توصيلات مزود الطاقة: تستخدم RTX 5060 Ti موصّل طاقة PCIe واحد من نوع 8-pin (أو 12VHPWR في بعض الإصدارات) — تحقق من أن طقم الكابلات المعياري لمزود الطاقة يتضمن الموصّل الصحيح قبل التجميع.
مسار الترقية
صُمم هذا التجميع بحيث تكون GPU القطعة الوحيدة التي تستحق الاستبدال لاحقاً. تدعم اللوحة الأم B650 منفذ PCIe ثانٍ (عادةً x4 كهربائياً) لإضافة GPU ثانية لاحقاً، رغم أن استدلال multi-GPU بتقسيم tensor يحتاج إلى x8/x8 على الأقل لتجنّب عنق زجاجة في عرض نطاق PCIe — راجع تجميع الـ 2,000 دولار للوحة أم اختيرت مع مراعاة ذلك.
الترقية المباشرة من هذا التجميع هي استبدال RTX 5060 Ti 16GB بـ RTX 3090 24GB مستعملة عندما تسمح الميزانية، مما يفتح استدلال 32B بارتياح وتفريغاً خفيفاً لنماذج 70B. تمتلك Ryzen 5 7600 وذاكرة 32GB ومزود الطاقة 650W جميعها هامشاً كافياً لدعم هذا الاستبدال دون تغييرات إضافية.
الأخطاء الشائعة عند هذه الميزانية
- شراء إصدار RTX 5060 Ti بذاكرة 8GB لتوفير 100 دولار — سقف VRAM الذي يخلقه هذا لا يمكن إصلاحه بالبرمجيات ويفرض استبدال GPU لاحقاً، بتكلفة إجمالية أعلى.
- الإفراط في الإنفاق على CPU (مثل Ryzen 7 بدلاً من Ryzen 5) مع تشغيل GPU بذاكرة 8GB أو 12GB — اختيار CPU ليس له تأثير يُذكر على tok/s بمجرد أن يتناسب النموذج مع VRAM.
- تخطّي إعداد ملف تعريف EXPO/XMP لذاكرة RAM في BIOS، تاركاً أطقم DDR5-6000 تعمل بسرعة 4800 — خسارة أداء مجانية لا تكلف شيئاً لإصلاحها.
- تقليل حجم مزود الطاقة لتوفير 20-30 دولاراً — يرتفع سحب طاقة GPU بشكل مفاجئ إلى ما يتجاوز TDP المقدَّر تحت الحمل المستمر، ووحدة 550W تترك هامشاً ضئيلاً جداً.
الأسئلة الشائعة
هل يستطيع كمبيوتر بميزانية 1,000 دولار تشغيل نماذج LLM المحلية بشكل جيد؟
نعم، بارتياح لنماذج 7B-14B وبتكميم Q4 ضيق لنماذج 32B. تُعد RTX 5060 Ti 16GB، المكوّن الأساسي لهذا التجميع، العامل الحاسم — سعة VRAM أهم بكثير من الميزانية الخام فيما يتجاوز GPU.
لماذا ينفق هذا التجميع الكثير على GPU مقارنة بـ CPU؟
تعتمد سرعة استدلال نماذج LLM المحلية بشكل شبه كامل على سعة VRAM في GPU وعرض النطاق الترددي للذاكرة. لا يزيد CPU الأسرع من tok/s بمجرد تحميل النموذج في VRAM، لذا يتفوق CPU متوسط المدى مع GPU قوية على CPU قوية مع GPU ضعيفة في هذا العبء المحدد.
هل 16GB من VRAM كافية لنماذج LLM المحلية في 2026؟
تستوعب 16GB بارتياح كل نموذج من 7B إلى 14B عند Q4 مع مساحة لسياق طويل، وتستوعب نماذج 32B عند Q4 مع نافذة سياق قصيرة. لا تستوعب نماذج من فئة 70B، التي تحتاج نحو 40GB عند Q4.
هل يمكنني استخدام GPU بذاكرة 8GB بدلاً من ذلك لتوفير المال؟
يمكنك ذلك، لكنه يحصرك في نماذج 7B بهامش سياق محدود — سقف ثابت لا يمكن رفعه دون استبدال البطاقة. الـ 100 دولار الموفَّرة على RTX 5060 Ti بذاكرة 8GB لا تستحق فقدان الوصول إلى نماذج 13B-14B.
كم من RAM أحتاج فعلياً إلى جانب GPU بذاكرة VRAM سعة 16GB؟
32GB من ذاكرة النظام. يغطي هذا أعباء نظام التشغيل، وتخزين ملفات النموذج مؤقتاً أثناء التحميل، وأي طبقات مُفرَّغة إلى CPU للنماذج التي تتجاوز سعة VRAM قليلاً.
هل يشغّل هذا التجميع نماذج 32B بشكل جيد؟
يستوعب نماذج 32B عند تكميم Q4 بسرعة نحو 12-15 رمزاً في الثانية، لكن طول السياق محدود بنحو 4K-8K رمز إذ لا يتبقى هامش VRAM كبير بعد تحميل النموذج.
ما البرمجيات التي ينبغي تشغيلها على هذا التجميع؟
يُعد Ollama أو LM Studio أبسط نقطة بداية — كلاهما يكتشف RTX 5060 Ti تلقائياً ويتعامل مع تكميم Q4 تلقائياً. يمنح llama.cpp مباشرةً تحكماً أكبر في صيغة التكميم وإعدادات السياق.
هل يمكن ترقية هذا التجميع لتشغيل نماذج 70B لاحقاً؟
ليس بـ GPU واحدة — يحتاج 70B عند Q4 نحو 40GB من VRAM. مسار الترقية الأوضح هو إما استبدالها بـ RTX 3090 24GB مستعملة (لا تزال غير كافية تماماً لـ 70B الكامل) أو إضافة GPU ثانية لتجميع VRAM، وهو ما يغطيه تجميع الـ 2,000 دولار بثنائي GPU مباشرةً.
هل تؤثر شريحة اللوحة الأم (B650 مقابل B850) على استدلال LLM المحلي؟
ليس لتجميع بـ GPU واحدة. توفّر B650 منفذ PCIe 4.0 x16، وهو ما تحتاجه GPU؛ تهم الفروق بين شرائح B650 واللوحات الأحدث أكثر لتوزيع مسارات PCIe في تجميعات multi-GPU منها لاستدلال LLM بـ GPU واحدة.
هل GPU مستعملة قيمة أفضل من RTX 5060 Ti 16GB جديدة عند هذه الميزانية؟
يمكن أن تكون RTX 3060 12GB مستعملة أرخص لكنها تمتلك VRAM أقل وعرض نطاق ذاكرة أضعف، وتستوعب أحجام نماذج أقل. تُعد RTX 3090 24GB مستعملة ترقية حقيقية في VRAM لكنها تدفع التكلفة الإجمالية إلى ما يتجاوز 1,300 دولار شاملة بقية التجميع — تنتمي إلى فئة ميزانية أعلى، وليس هذه.