Key Takeaways
- Apple M5 Pro (64 GB، ~2,399 $): الخيار الأفضل الشامل لمعظم المستخدمين. 40–60 رمز/ث على نماذج 30B، استهلاك طاقة منخفض (~25 واط عند الاستدلال)، دون حد لـ VRAM.
- NVIDIA RTX 5090 (32 GB، 2,000 $): الأسرع لنماذج 7B–14B بسرعة 150–200 رمز/ث. لا يستطيع تشغيل 30B+ دون CPU offloading. الأفضل لأحمال الإنتاج.
- NVIDIA RTX 5070 (12 GB، ~600 $): أفضل GPU من حيث القيمة. 60–80 رمز/ث على نماذج 8B. محدود بـ 7B–8B بالدقة الكاملة.
- Apple M5 Max (64–128 GB، ~3,199 $+): عرض نطاق 460–614 GB/s. يشغّل 30B–70B بشكل أصلي. الأفضل للباحثين ومستخدمي 30B+ المكثفين.
- CPU فقط (Ryzen/Intel حديثة): 10–20 رمز/ث على نماذج 7B مع RAM DDR5 سريعة. قابل للاستخدام أحيانًا، غير عملي للمحادثة الفورية.
- الحكم النهائي: بالنسبة لمعظم المستخدمين، يفوز Apple M5 Pro بـ 64 GB — نماذج أكبر من أي GPU منفردة، تكلفة أقل من بناء GPU مخصص، واستهلاك طاقة أقل بـ 10×. اختر سلسلة RTX 50 فقط لأقصى سرعة على 7B–14B أو أحمال الإنتاج.
للنماذج المحلية: Apple M5 Pro 64 جيجابايت (~2,399 $) الأفضل متعدد الأوجه بـ 40–60 رمز/ث على نماذج 30B؛ RTX 5090 32 جيجابايت (~2,000 $) الأسرع على 7B–14B (150–200 رمز/ث) لكن 30B+ مستحيل؛ RTX 5070 12 جيجابايت (~600 $) أفضل قيمة GPU؛ المعالج فقط: 10–20 رمز/ث على 7B.
GPU أسرع على النماذج الصغيرة (أقل من 14B) بفضل عرض النطاق الحوسبي العالي. Apple Silicon يتفوق على النماذج الكبيرة (30B+) بدمج الذاكرة والحوسبة باستهلاك منخفض للطاقة. المعالج وحده الأبطأ لكنه يعمل على أي حاسوب محمول.
مقارنة الأداء: السرعة وعرض النطاق والتكلفة
*يتطلب CPU offloading — عقوبة سرعة كبيرة وتدهور في الجودة عند bit-widths منخفضة
الجهاز | Qwen3 8B | Qwen3 30B | الاستهلاك | التكلفة |
|---|---|---|---|---|
| RTX 5090 (GPU، 32 GB GDDR7) | 150–200 رمز/ث | غير ممكن* | ~450W | 2,000$ |
| RTX 5080 (GPU، 16 GB GDDR7) | 100–130 رمز/ث | غير ممكن* | ~360W | 1,000$ |
| RTX 5070 Ti (GPU، 16 GB) | 80–100 رمز/ث | غير ممكن* | ~300W | 750$ |
| RTX 5070 (GPU، 12 GB) | 60–80 رمز/ث | غير ممكن* | ~250W | 600$ |
| MacBook Pro M5 Pro (36–64 GB، 307 GB/s) | 40–60 رمز/ث | 20–30 رمز/ث | ~25W | 2,399$+ |
| MacBook Pro M5 Max (64–128 GB، 460–614 GB/s) | 60–80 رمز/ث | 35–50 رمز/ث | ~35W | 3,199$+ |
| Mac mini M5 base (16–32 GB، 200 GB/s) | 25–35 رمز/ث | Offload* | ~15W | 599$+ |
| Intel Core Ultra 9 / AMD Ryzen 9 (CPU، DDR5) | 10–20 رمز/ث | 3–5 رمز/ث | ~65W | مضمّن |
متى تختار GPU (سلسلة RTX 50)
اختر GPU من NVIDIA من سلسلة RTX 50 عندما تحتاج أقصى سرعة على نماذج 7B–14B أو تشغّل أحمال إنتاجية على مدار الساعة.
- RTX 5090 (32 GB GDDR7، 1,792 GB/s): 150–200 رمز/ث على نماذج 8B. 2,000$. الأفضل لمسارات الإنتاج والـ fine-tuning والتطبيقات الحساسة للسرعة.
- RTX 5080 (16 GB GDDR7): 100–130 رمز/ث على 8B. 1,000$. توازن جيد بين السرعة والتكلفة لـ 8B–13B.
- RTX 5070 Ti / 5070 (12–16 GB): 60–100 رمز/ث على 8B. 600$–750$. أفضل قيمة للمحادثة والبرمجة لمستخدم واحد.
- ميزة منظومة CUDA: vLLM و llama.cpp و LM Studio جميعها محسّنة أصليًا. أسرع استدلال بالدقة الأصلية.
- قيد صارم: لا تستطيع أي بطاقة من سلسلة RTX 50 تحميل نماذج 30B بجودة كاملة (تتطلب 20+ GB من VRAM). يخلق الـ offloading إلى RAM النظام عقوبة سرعة 5–10×.
استهلاك الطاقة هو المقايضة الأساسية: تستهلك RTX 5090 450 واط تحت الحمل مقابل 25 واط لـ M5 Pro. عند 0.35$/kWh، تكلف RTX 5090 حوالي 55$ إضافية شهريًا في الكهرباء عند استخدامها 8 ساعات/يوم.
متى تختار Apple Silicon (M5)
اختر Apple Silicon M5 عندما تحتاج تشغيل نماذج 14B–70B، أو تقدّر كفاءة الطاقة، أو تستخدم macOS كنظام أساسي.
- M5 الأساسي (16–32 GB، 200 GB/s): يشغّل 7B–8B بشكل أصلي بسرعة 25–35 رمز/ث. يبدأ من 599$ (Mac mini). نقطة دخول جيدة.
- M5 Pro (36–64 GB، 307 GB/s): يشغّل حتى 30B بشكل أصلي بسرعة 20–30 رمز/ث. ~2,399$ (MacBook Pro). أفضل قيمة شاملة.
- M5 Max (64–128 GB، 460–614 GB/s): يشغّل 30B–70B بشكل أصلي بسرعة 35–50 رمز/ث. ~3,199$+. الأفضل للباحثين وأحمال 70B الثقيلة.
- ميزة الذاكرة الموحدة: دون حد لـ VRAM. يشغّل M5 Pro بـ 64 GB نماذج 30B بشكل أصلي؛ ويشغّل M5 Max بـ 128 GB نماذج 70B بشكل أصلي.
- بيانات Apple: سرعة استدلال أعلى بـ 4× مقارنة بـ M4 في جيل M5.
- إطار عمل MLX: MLX من Apple محسّن لـ Apple Silicon. تعمل نماذج Qwen3 بشكل ممتاز على MLX. ويؤدي DeepSeek-R1 14B أداءً جيدًا.
المقايضة: لا يستطيع مضاهاة السرعة الخام لـ RTX 5090 على 7B. أبطأ للـ fine-tuning. دون أدوات حصرية لـ CUDA.
متى يكفي CPU فقط
الاستدلال بـ CPU فقط قابل للتطبيق إذا كنت تحتاج ردودًا عرضية فقط وتشغّل نماذج صغيرة (7B Q4).
- Intel Core Ultra 9 / AMD Ryzen 9 حديثة مع DDR5-5600: 10–20 رمز/ث على Qwen3 8B أو Llama 3.2 8B. قابل للاستخدام للمهام الدفعية غير التفاعلية.
- CPU قديمة / DDR4: 5–8 رمز/ث. زمن استجابة ملحوظ (5–8 ثوانٍ لكل رد) يجعل المحادثة التفاعلية غير مريحة.
- دون تكلفة أجهزة إضافية: إذا كنت تملك بالفعل جهاز مكتبي قادرًا، يعمل llama.cpp أو Ollama فورًا.
- استهلاك الطاقة: تستهلك وحدات CPU عند كامل حمل الاستدلال 65–125 واط — أقل من GPU وأكثر من Apple Silicon.
يصلح استدلال CPU لـ: تلخيص المستندات دفعيًا، المعالجة الليلية، الأسئلة والأجوبة العرضية. تجنّب CPU فقط للمحادثة الفورية أو مساعدي البرمجة أو النماذج الأكبر من 8B.
عرض نطاق الذاكرة: عنق الزجاجة الحقيقي
استدلال نماذج LLM محدود بالذاكرة لا بالحوسبة. تتحدد سرعة توليد الـ tokens بمدى سرعة تحميل أوزان النموذج من الذاكرة. عرض نطاق ذاكرة أكبر = توليد tokens أسرع.
الصيغة: سرعة الاستدلال ≈ عرض نطاق الذاكرة ÷ أوزان النموذج في الذاكرة
- تمتلك RTX 5090 بعرض 1,792 GB/s أسرع عرض نطاق لبطاقة واحدة متاح في 2026.
- يضاهي M5 Max بعرض 460–614 GB/s أو يتفوق على RTX 5080 في عرض النطاق — مع 128 GB ذاكرة موحدة مقابل 16 GB VRAM.
- يمثّل M5 Pro بعرض 307 GB/s النقطة المثلى: عرض نطاق كافٍ لنماذج 30B، بنصف تكلفة M5 Max.
- تُعد RAM DDR5 بعرض 89 GB/s أبطأ بـ 20× من RTX 5090 لكنها أسرع بـ 4× من DDR4 — تحسّن ملموس لاستدلال CPU.
- ميزة الذاكرة الموحدة: دون عبء نقل CPU↔GPU. يحتفظ M5 Pro بنموذج 30B كاملًا في مجمّعه البالغ 64 GB.
المنصة | عرض نطاق الذاكرة | السرعة الفعلية (8B) |
|---|---|---|
| RTX 5090 (GDDR7) | 1,792 GB/s | 150–200 رمز/ث |
| RTX 5080 (GDDR7) | 960 GB/s | 100–130 رمز/ث |
| RTX 5070 (GDDR7) | 672 GB/s | 60–80 رمز/ث |
| M5 Max (موحدة، 128 GB) | 460–614 GB/s | 60–80 رمز/ث |
| M5 Pro (موحدة، 64 GB) | 307 GB/s | 40–60 رمز/ث |
| M5 base (موحدة، 32 GB) | 200 GB/s | 25–35 رمز/ث |
| RAM DDR5-5600 (CPU فقط) | 89 GB/s | 10–20 رمز/ث |
| RAM DDR4-3200 (CPU فقط) | 51 GB/s | 5–8 رمز/ث |
التكلفة لكل رمز/ث: تحليل القيمة الفعلية
تقارن التكلفة لكل رمز/ث قيمة الجهاز: التكلفة المبدئية مقسومة على سرعة التوكن المستدامة.
تمتلك RTX 5070 أفضل تكلفة لكل رمز/ث في السرعة الخالصة. ويفوز M5 Pro في الطاقة: عند 0.15$/kWh لاستخدام 8 ساعات/يوم، تكلف M5 Pro حوالي 1.10$/شهر مقابل حوالي 16.50$/شهر لـ RTX 5090.
إذا كنت تملك بالفعل Mac بمعالج M5 Pro، فالتكلفة لكل رمز/ث تساوي فعليًا 0$ من ناحية الجهاز.
الجهاز | التكلفة المبدئية | رمز/ث (8B) | التكلفة لكل رمز/ث | الاستهلاك (استدلال) |
|---|---|---|---|---|
| RTX 5090 (32 GB) | 2,000$ | 175 | 11.4$ | 450W |
| RTX 5070 (12 GB) | 600$ | 70 | 8.6$ | 250W |
| M5 Pro MacBook Pro (64 GB) | 2,399$ | 50 | 48$ | 25W |
| M5 Max MacBook Pro (128 GB) | 3,199$ | 70 | 46$ | 35W |
| CPU (جهاز مكتبي حديث بـ DDR5) | مضمّن | 15 | 0$ | 65W |
دليل القرار حسب المنصة
إطار قرار يعتمد على حجم النموذج والميزانية وحالة الاستخدام:
- اختر RTX 5090 / 5080: أقصى سرعة على 7B–14B، مسارات إنتاج، fine-tuning، أحمال خوادم على مدار الساعة.
- اختر RTX 5070 / 5070 Ti: أفضل قيمة GPU للمحادثة والبرمجة لمستخدم واحد على 7B–13B. 600$–750$.
- اختر M5 Pro (64 GB): الخيار الأفضل الشامل لمعظم المستخدمين. يشغّل 30B بشكل أصلي، استهلاك منخفض، سير عمل macOS. ~2,399$.
- اختر M5 Max (128 GB): للاستخدام البحثي، نماذج 70B بشكل أصلي، أقصى أداء لـ Apple Silicon. ~3,199$+.
- CPU فقط: دون استثمار إضافي، استخدام عرضي لـ 7B، معالجة دفعية ليلية.
أخطاء شائعة عند اختيار الأجهزة
- اختيار GPU لنماذج 30B+. لا تستطيع أي بطاقة من سلسلة RTX 50 تحميل 30B في VRAM. يخلق الـ offloading إلى RAM عقوبة سرعة 5–10×. استخدم M5 Pro أو M5 Max بدلًا من ذلك.
- افتراض أن M5 الأساسي (16 GB) كافٍ. يحمّل 7B فقط. لنماذج 14B تحتاج 32 GB؛ ولـ 30B تحتاج 64 GB (M5 Pro).
- تجاهل تكلفة الطاقة لخوادم GPU الدائمة التشغيل. تعادل RTX 5090 عند 8 ساعات/يوم حوالي 200$/سنة كهرباء عند 0.15$/kWh. أما M5 Pro فحوالي 14$/سنة.
- شراء RTX 5090 للمحادثة على 8B. تقدّم RTX 5070 بـ 600$ سرعة 70 رمز/ث على 8B — أي 80% من السرعة بـ 30% من التكلفة.
- توقّع أن تكون CPU قابلة للتطبيق للمحادثة الفورية. حتى 20 رمز/ث تبدو بطيئة. و5–8 رمز/ث على DDR4 غير قابلة للاستخدام تفاعليًا.
الأسئلة الشائعة
هل GPU أفضل أم CPU لتشغيل نماذج LLM المحلية؟
للاستدلال الفوري، GPU من NVIDIA أسرع: تشغّل RTX 5070 نماذج 8B بسرعة 60–80 رمز/ث مقابل 10–20 رمز/ث على CPU حديثة بـ DDR5. لكن Apple M5 Pro بسرعة 40–60 رمز/ث يتفوق أيضًا على CPU ويضيف القدرة على تشغيل نماذج 30B بشكل أصلي.
هل يستطيع Apple Silicon تشغيل نماذج LLM المحلية؟
نعم. تشغّل سلسلة Apple M5 نماذج 7B بسرعة 25–80 رمز/ث حسب فئة الشريحة. يشغّل M5 Pro (64 GB) نماذج 30B بشكل أصلي بسرعة 20–30 رمز/ث — أمر لا تستطيع أي GPU استهلاكية مضاهاته. ويشغّل M5 Max (128 GB) نماذج 70B بشكل أصلي بسرعة 35–50 رمز/ث.
ما الحد الأدنى من VRAM الذي تحتاجه GPU لنماذج LLM المحلية؟
تشغّل 12 GB من VRAM (RTX 5070) نماذج 7B–8B بتكميم Q4–Q8 بسلاسة. وتتعامل 16 GB (RTX 5080) مع نماذج 13B. لا تستطيع أي GPU استهلاكية منفردة تحميل 30B بالكامل — استخدم Apple M5 Pro بـ 64 GB بدلًا من ذلك.
كم تكون GPU أسرع من CPU في استدلال نماذج LLM؟
RTX 5090 أسرع بـ 8–15× من CPU حديثة بـ DDR5 لنماذج 8B (175 رمز/ث مقابل 15 رمز/ث). تأتي الفجوة من عرض نطاق الذاكرة: 1,792 GB/s (GDDR7) مقابل 89 GB/s (DDR5). ويقع Apple M5 Pro بعرض 307 GB/s بينهما بسرعة 40–60 رمز/ث.
هل يستحق شراء GPU من أجل نماذج LLM المحلية فقط؟
تكلف RTX 5070 (600$) مُهلكة على 3 سنوات أقل من رسوم OpenAI API للمستخدمين المكثفين الذين يستخدمونها 2+ ساعة يوميًا. بسرعة 70 رمز/ث تدير المحادثة الفورية ومساعدة البرمجة. إذا احتجت نماذج 30B+، يقدّم M5 Pro قيمة أفضل رغم تكلفته المبدئية الأعلى.
ما عرض نطاق الذاكرة ولماذا يهم لنماذج LLM؟
استدلال نماذج LLM محدود بالذاكرة. سرعة التوكن ≈ عرض نطاق الذاكرة ÷ أوزان النموذج. RTX 5090: 1,792 GB/s. M5 Max: 460–614 GB/s. M5 Pro: 307 GB/s. CPU DDR5: 89 GB/s. لهذا يستطيع Apple Silicon بذاكرته الموحدة تشغيل نماذج كبيرة بكفاءة رغم عرض نطاق خام أقل من GPU الأعلى.
أي شريحة Apple Silicon أفضل لنماذج LLM المحلية في 2026؟
M5 Pro (64 GB، 307 GB/s) هو الخيار الأفضل الشامل لمعظم المستخدمين — يشغّل نماذج 30B بشكل أصلي بسرعة 20–30 رمز/ث بحوالي 2,399$. و M5 Max (128 GB، 460–614 GB/s) لنماذج 70B بسرعة 35–50 رمز/ث (~3,199$+). تجنّب M5 الأساسي (16 GB) لأي شيء أبعد من 7B.
هل يستطيع Apple Silicon تشغيل نماذج 30B و70B؟
يشغّل M5 Pro (64 GB) نماذج 30B بشكل أصلي بسرعة 20–30 رمز/ث. ويشغّل M5 Max (128 GB) نماذج 70B بشكل أصلي بسرعة 35–50 رمز/ث. هذه أرقام أداء حقيقية دون CPU offloading — لا تستطيع أي GPU استهلاكية مضاهاة هذا لـ 30B+.
هل تستحق RTX 5090 مقابل 2,000$ لنماذج LLM المحلية؟
فقط إذا كان سير عملك يتطلب نماذج 7B–14B بأقصى سرعة أو تشغّل مسارات استدلال إنتاجية. لمعظم المستخدمين، تقدّم RTX 5070 (600$) 80% من السرعة بـ 30% من التكلفة. لنماذج 30B+، يُعد M5 Pro الخيار الأفضل بغض النظر عن الميزانية.
كيف يقارن استهلاك الطاقة بين GPU وApple Silicon؟
تستهلك RTX 5090 حوالي 450 واط عند حمل الاستدلال. ويستهلك M5 Pro حوالي 25 واط. عند 8 ساعات/يوم و0.15$/kWh، يعادل ذلك 200$/سنة (RTX 5090) مقابل 14$/سنة (M5 Pro). لمستخدمي المنازل ومن يدفعون تعرفة كهرباء تجارية، تمثّل كفاءة طاقة M5 Pro ميزة تكلفة ملموسة.
ما مدى سرعة استدلال LLM على MacBook Pro بمعالج Intel (i9، 16 GB رام)؟
أبطأ من Apple Silicon وأبطأ من جهاز مكتبي حديث بذاكرة DDR5. أجهزة MacBook Pro من Intel لا تملك مسار GPU بذاكرة موحّدة لـ llama.cpp — يعمل الاستدلال على المعالج فقط (CPU-only) عبر ذاكرة DDR4، التي توفر نطاقًا تردديًا ثنائي القناة يبلغ نحو 38–45 GB/s مقارنةً بـ 89 GB/s لمعالج مكتبي حديث بذاكرة DDR5. باستخدام معادلة النطاق الترددي للذاكرة ÷ حجم النموذج المذكورة أعلاه، يصل نموذج مكمَّم بحجم 7B (نحو 4.5 GB عند Q4) إلى حوالي 8–10 رمز/ث نظريًا، و4–7 رمز/ث واقعيًا بعد احتساب النفقات الحسابية للمعالج. كما تحصرك ذاكرة 16 GB الإجمالية بالقرب من 7B–8B عند Q4 مع هامش لنظام التشغيل — لا تتوقع تشغيل نماذج 13B+ دون تبديل ذاكرة كثيف وعقوبة سرعة كبيرة.
ما الفرق بين pp tok/s وtg tok/s؟
يقيس pp tok/s (معالجة المطالبة) مدى سرعة استيعاب النموذج لمطالبتك المُدخَلة — مرحلة "prefill"، وهي مقيّدة بالحوسبة وتتوسع جيدًا مع الأجهزة المتوازية مثل وحدات معالجة الرسومات. ويقيس tg tok/s (توليد الرموز) مدى سرعة توليد كل رمز إخراج جديد — مرحلة "decode"، وهي مقيّدة بالنطاق الترددي للذاكرة (انظر معادلة النطاق الترددي أعلاه). عادةً ما تُظهر وحدات معالجة الرسومات فجوة كبيرة بين pp/tg (معالجة سريعة، وتوليد مقيّد بالنطاق الترددي)؛ بينما تُبقي الذاكرة الموحّدة في Apple Silicon الرقمين أقرب إلى بعضهما. عند مقارنة نتائج الاختبارات، تحقق دائمًا من الرقم الذي تقرأه — إذ يمكن أن يختلف pp وtg بمقدار 5 إلى 20 ضعفًا على نفس الجهاز.
المصادر
- مواصفات GPU من NVIDIA — مواصفات GPU سلسلة RTX 40/50 و VRAM وعرض نطاق الذاكرة.
- أداء Apple M3 — بنية الذاكرة الموحدة في M5 Max وأداء الاستدلال.
- معايير vLLM — معايير أداء استدلال نماذج LLM في الإنتاج.
- تنتج الأجهزة المختلفة معدلات tokens مختلفة، لكن كل استدلال يستفيد من prompts منظمة. تتطلب طلبات السياق الطويل تقنيات مختلفة عن القصيرة: شرح نوافذ السياق يغطي استراتيجيات لأي جهاز.
