Key Takeaways
- GPU (NVIDIA RTX 5090): 200 token/s لنماذج 8B. أفضل أداء، 2000$.
- GPU (NVIDIA RTX 4090): 150 token/s لنماذج 8B. أفضل قيمة مقابل السعر: RTX 4070 Ti بـ 80 tok/s مقابل 600$.
- Apple Silicon M2 Ultra: 60 token/s لـ 8B، 35 tok/s لـ 70B *بشكل أصلي* (دون offloading). ميزة فريدة: Mac Studio هو الجهاز الاستهلاكي الوحيد الذي يشغّل نماذج 70B دون فقدان الجودة.
- CPU (Intel i9): 5–6 token/s. غير عملي للمحادثة الفورية (زمن استجابة 5–10 ثوانٍ).
- للعمل الجاد: تفوز GPU في السرعة (أسرع بـ 30–40× بفضل عرض نطاق الذاكرة). ويفوز Apple M2 Ultra في النماذج الكبيرة (تشغيل أصلي لـ 70B).
للنماذج المحلية: Apple M5 Pro 64 جيجابايت (~2,399 $) الأفضل متعدد الأوجه بـ 40–60 رمز/ث على نماذج 30B؛ RTX 5090 32 جيجابايت (~2,000 $) الأسرع على 7B–14B (150–200 رمز/ث) لكن 30B+ مستحيل؛ RTX 5070 12 جيجابايت (~600 $) أفضل قيمة GPU؛ المعالج فقط: 10–20 رمز/ث على 7B.
GPU أسرع على النماذج الصغيرة (أقل من 14B) بفضل عرض النطاق الحوسبي العالي. Apple Silicon يتفوق على النماذج الكبيرة (30B+) بدمج الذاكرة والحوسبة باستهلاك منخفض للطاقة. المعالج وحده الأبطأ لكنه يعمل على أي حاسوب محمول.
مقارنة الأداء: السرعة والأداء المستدام
*مع offloading إلى RAM — تدهور كبير في الجودة
| الجهاز | Llama 3.2 8B | Llama 3.3 70B | Qwen3 32B | التكلفة |
|---|---|---|---|---|
| RTX 5090 (GPU, 32 GB) | 200 tok/s | 50 tok/s | 70 tok/s | 2000$ |
| RTX 4090 (GPU, 24 GB) | 150 tok/s | 10 tok/s* | 50 tok/s | 1800$ |
| RTX 4070 Ti (GPU, 12 GB) | 80 tok/s | غير ممكن | 25 tok/s | 600$ |
| Mac Studio M2 Ultra (192 GB) | 60 tok/s | 35 tok/s | 45 tok/s | 4000$ |
| MacBook Pro M4 Max (128 GB) | 35 tok/s | 8 tok/s* | 22 tok/s | 4000$ |
| MacBook Pro M5 Max (96 GB) | 25 tok/s | 5 tok/s* | 15 tok/s | 3500$ |
| Intel i9 14900K (CPU فقط) | 5 tok/s | 1 tok/s | 2 tok/s | 600$ |
| AMD Ryzen 9 7950X (CPU فقط) | 6 tok/s | 1 tok/s | 2 tok/s | 650$ |
GPU من NVIDIA: ملك الأداء
تُعد GPU من NVIDIA (سلسلة RTX 40/50) حاليًا الأفضل لنماذج LLM المحلية في أبريل 2026. ويعود تفوقها إلى:
- منظومة CUDA: أكثر من 20 عامًا من التحسين المخصص للذكاء الاصطناعي. تُحسَّن معظم النماذج لـ CUDA أولًا.
- Tensor cores: أجهزة متخصصة للعمليات المصفوفية (جوهر استدلال نماذج LLM).
- عرض نطاق الذاكرة: تمتلك RTX 5090 عرض 1792 GB/s (GDDR7)؛ و RTX 4090 1008 GB/s؛ ما يتفوق بكثير على أنظمة الذاكرة الموحدة.
- برمجيات ناضجة: vLLM و llama.cpp و LM Studio جميعها محسّنة لـ NVIDIA. أفضل أداء استدلال بالدقة الأصلية.
- RTX 5090 (رائدة 2025): 200 tok/s على Llama 3.2 8B، وتتعامل مع 70B بسرعة 50 tok/s.
المقايضات: تكلفة مبدئية مرتفعة (600$–2000$)، استهلاك طاقة (350–575 واط)، تتطلب تبريدًا جيدًا ومصدر طاقة بقدرة 1200 واط.
CPU فقط: متى ولماذا تتجنبها
تستطيع وحدات CPU تشغيل نماذج LLM لكنها غير عملية للاستدلال الفوري:
- زمن الاستجابة: 5–10 ثوانٍ لكل رد لنماذج 7B. غير قابل للاستخدام في المحادثة.
- استهلاك الطاقة: قد تستهلك وحدات CPU تحت الحمل الكامل 200 واط أو أكثر (غير فعّال للاستدلال).
- السياق: تتوسّع وحدات CPU بشكل سيئ مع السياقات الطويلة (ذاكرة المفتاح-القيمة).
تصلح CPU فقط للمعالجة على دفعات دون اتصال (مثل معالجة المستندات ليلًا دون استجابة فورية).
Apple Silicon: قوة فريدة في النماذج الكبيرة
تتفوق سلسلة Apple M (M2 Ultra, M3/M4 Max) في التشغيل الأصلي للنماذج الكبيرة — ميزة فريدة:
- ذاكرة موحدة: تتشارك CPU و GPU مجمّع الذاكرة نفسه، ما يلغي عبء النقل.
- قدرة على النماذج الكبيرة: يشغّل Mac Studio M2 Ultra (192 GB) نموذج Llama 3.3 70B بسرعة 35 tok/s بشكل أصلي دون offloading. حصري لـ Apple Silicon.
- الكفاءة لكل واط: يتعامل M5 Max مع 7B بسرعة 25 tok/s بـ 25 واط فقط. و M4 Max أسرع (~35 tok/s).
- التكامل: أصلي في macOS، دون مشكلات تعريفات، يعمل من اللحظة الأولى.
- القيد مقابل GPU: تعني الذاكرة المشتركة أنه لا يمكن توسيع VRAM بشكل منفصل. حجم النموذج ≤ RAM النظام.
Mac Studio M2 Ultra (192 GB): 60 tok/s على 8B، 35 tok/s على 70B — الجهاز الاستهلاكي الوحيد بهذه القدرة. وعلى فرق البحث التي تشغّل 70B أو أكبر النظر في Mac Studio.
MacBook Pro: M4 Max (128 GB) بسرعة 35 tok/s لـ 8B متين للتنقل. و M5 Max (96 GB) بسرعة 25 tok/s يعمل للاحتياجات الأخف.
**للاطلاع على معايير محددة لـ M5 Pro و M5 Max لـ LLM المحلي، راجع مقارنتنا المخصصة لـ Apple Silicon M5 ←.**
عرض نطاق الذاكرة: عنق الزجاجة الحقيقي
استدلال نماذج LLM محدود بالذاكرة لا بالحوسبة. تتحدد سرعة توليد الـ tokens بمدى سرعة تحميل أوزان النموذج من الذاكرة. عرض نطاق ذاكرة أكبر = توليد tokens أسرع.
الصيغة: سرعة الاستدلال ≈ عرض نطاق الذاكرة ÷ أوزان النموذج في الذاكرة
- تفسّر فجوة عرض النطاق هذه لماذا تكون GPU أسرع بـ 30–40× من CPU في الاستدلال.
- تمتلك الذاكرة الموحدة في Apple Silicon عرض نطاق أقل لكل بايت من NVIDIA GDDR7/GDDR6X، لكنها تظل أسرع بـ 9× من RAM DDR5.
- ميزة الذاكرة الموحدة: دون عبء نقل CPU↔GPU. يبقى النموذج في مجمّع ذاكرة واحد.
- عيب GPU للنماذج الكبيرة: VRAM محدودة (24 GB كحد أقصى لـ RTX 4090). يخلق الـ offloading إلى RAM النظام (89 GB/s) عقوبة سرعة 10×.
- لماذا Mac Studio M2 Ultra (192 GB موحدة) فريد: يستطيع استيعاب نماذج 70B بشكل أصلي بعرض نطاق 800 GB/s — دون عقوبة offloading ودون انخفاض أداء.
| المنصة | عرض نطاق الذاكرة | السرعة الفعلية (8B) |
|---|---|---|
| RTX 5090 (GDDR7) | 1792 GB/s | 200 tok/s |
| RTX 4090 (GDDR6X) | 1008 GB/s | 150 tok/s |
| RTX 4070 Ti (GDDR6X) | 504 GB/s | 80 tok/s |
| Mac Studio M2 Ultra (موحدة) | 800 GB/s | 60 tok/s |
| MacBook Pro M4 Max (موحدة) | 546 GB/s | 35 tok/s |
| MacBook Pro M5 Max (موحدة) | 400 GB/s | 25 tok/s |
| RAM DDR5-5600 (CPU فقط) | 89 GB/s | 5 tok/s |
| RAM DDR4-3200 (CPU فقط) | 51 GB/s | 3 tok/s |
التكلفة لكل token: تحليل التكلفة الفعلية
ضع في اعتبارك التكلفة الإجمالية للاستدلال (الأجهزة مُهلكة على مدى الزمن):
| الجهاز | التكلفة المبدئية | Tokens/s | Tokens/سنة (24/7) | التكلفة طويلة الأمد |
|---|---|---|---|---|
| RTX 4090 (عمر 3 سنوات) | 1800$ | 150 | 4700 M | 0.0004$ لكل 1 M token |
| RTX 4070 Ti (3 سنوات) | 600$ | 80 | 2500 M | 0.0002$ لكل 1 M token |
| M5 Max Mac (مملوك بالفعل) | 0$ | 25 | 790 M | 0$ لكل 1 M token |
| OpenAI API (0.01$ لكل 1000 token) | دفع حسب الاستخدام | غير محدود | غير محدود | 10$ لكل 1 M token |
متى تختار كل منصة؟
إطار القرار:
- اختر GPU: تحتاج محادثة فورية (<1 ثانية زمن استجابة)، تشغّل النماذج على مدار الساعة أو تعالج مجموعات بيانات كبيرة على دفعات.
- اختر CPU فقط: تعمل دون اتصال، تحتاج معالجة المستندات على دفعات ليلًا أو تريد صفر استثمار في الأجهزة.
- اختر Apple Silicon: تملك Mac، تشغّل نماذج 7B فقط وتقدّر انخفاض استهلاك الطاقة.
أخطاء شائعة عند اختيار الأجهزة
- الاعتقاد بأن CPU صالحة للمحادثة. زمن استجابة 5 ثوانٍ لكل رد غير عملي. تجربة المستخدم غير قابلة للاستخدام.
- شراء GPU من جيل سابق مع توقع أداء مماثل. RTX 2080 أبطأ بـ 10× من RTX 4070 Ti بسبب التحسينات المعمارية.
- افتراض أن M5 Max يستطيع التعامل مع نماذج 70B. لا يستطيع، حتى مع تكميم متطرف. محدود ببنية الذاكرة الموحدة.
- تجاهل متطلبات الطاقة والتبريد. تحتاج RTX 4090 مصدر طاقة بقدرة 1200 واط وتهوية جيدة للهيكل، لا مجرد "فتحة GPU".
الأسئلة الشائعة
هل GPU أفضل أم CPU لتشغيل نماذج LLM المحلية؟
GPU أفضل بكثير للاستدلال الفوري. تشغّل NVIDIA RTX 4090 نماذج 7B بسرعة 150 token/s؛ بينما تشغّل CPU من الفئة العليا مثل Intel i9 النموذج نفسه بسرعة 3–5 token/s. ينتج عن استدلال CPU زمن استجابة 5–10 ثوانٍ، ما يجعله غير عملي للمحادثة التفاعلية.
هل يستطيع Apple Silicon تشغيل نماذج LLM المحلية؟
نعم. تشغّل سلسلة Apple M (M3, M4) نماذج 7B بسرعة 25–30 token/s باستخدام الذاكرة الموحدة — أفضل بكثير من أنظمة x86 بـ CPU فقط، لكن أبطأ من GPU المنفصلة من NVIDIA. ولا يستطيع Apple Silicon تشغيل نماذج 70B بسبب حدود الذاكرة الموحدة (RAM النظام الأقصى هو حد ذاكرة النموذج).
ما الحد الأدنى من VRAM الذي تحتاجه GPU لنماذج LLM المحلية؟
6 GB من VRAM تشغّل نماذج 7B بتكميم Q4 (4.1 GB مستخدمة). 8 GB هي الحد الأدنى العملي لتجربة سلسة مع نماذج 7B بـ Q5. وتلزم 16+ GB من VRAM لنماذج 13B بجودة كاملة. ومع 24 GB تُدار نماذج 30B.
كم تكون GPU أسرع من CPU في استدلال نماذج LLM؟
GPU من NVIDIA أسرع بـ 30–100× من CPU في استدلال نماذج LLM. تولّد RTX 4090 150 token/s لنماذج 7B؛ ويولّد Intel i9 3–5 token/s. تأتي فجوة السرعة من المعالجة المتوازية في CUDA ومن tensor cores المخصصة، لا من تردد الساعة فقط.
هل يستحق شراء GPU من أجل نماذج LLM المحلية فقط؟
تكلف RTX 4070 Ti (12 GB VRAM، ~600$) مُهلكة على 3 سنوات أقل من رسوم OpenAI API للمستخدمين المكثفين الذين يستخدمونها 2+ ساعة يوميًا. بسرعة 80 token/s تدير المحادثة الفورية ومساعدة البرمجة وتلخيص المستندات. أما المستخدمون الخفيفون (أقل من 30 دقيقة/يوم) فالأفضل لهم استخدام API.
هل يمكنني استخدام أنوية CPU متعددة لتسريع استدلال نماذج LLM؟
تساعد أنوية CPU الإضافية بشكل هامشي. يستخدم llama.cpp كل الخيوط المتاحة، لكن عنق الزجاجة هو عرض نطاق الذاكرة (50–100 GB/s لـ RAM النظام مقابل 2000+ GB/s لـ VRAM في GPU). لا تحل الأنوية الإضافية مشكلة عرض النطاق — لا يحلها سوى GPU أو بنية الذاكرة الموحدة في سلسلة Apple M.
ما عرض نطاق الذاكرة ولماذا يهم لنماذج LLM؟
استدلال نماذج LLM محدود بالذاكرة لا بالحوسبة. تعتمد سرعة توليد الـ tokens على مدى سرعة تحميل أوزان النموذج من الذاكرة. تمتلك RTX 5090 1792 GB/s (GDDR7)؛ و RAM DDR5 89 GB/s. تفسّر فجوة عرض النطاق هذه لماذا تكون GPU أسرع بـ 30–40× من CPU في الاستدلال.
أي شريحة Apple Silicon أفضل لنماذج LLM المحلية؟
Mac Studio M2 Ultra (192 GB) لتشغيل نماذج 70B بشكل أصلي بسرعة 35 tok/s — ميزة فريدة لا تستطيع أي GPU استهلاكية مضاهاتها. و MacBook Pro M4 Max (128 GB) للاستخدام المحمول بسرعة 35 tok/s على نماذج 8B. و M5 Max (96 GB) يعمل لنماذج 7–13B. تجنّب M4/M3 الأساسي (8 GB RAM) للعمل الجاد مع نماذج LLM.
هل يستطيع Apple Silicon تشغيل نماذج 70B؟
يشغّل Mac Studio M2 Ultra بـ 192 GB ذاكرة موحدة نموذج Llama 3.3 70B بسرعة 35 tok/s بشكل أصلي دون offloading. هذا فريد — لا تستطيع أي GPU استهلاكية فعله. وتقوم نماذج Mac الأصغر (M5 Max, M4 Max) بـ offloading جزئي إلى RAM، ما يخلق عقوبة سرعة 5–10×. جودة 70B الكاملة على Mac Studio M2 Ultra فقط.
هل تستحق RTX 5090 مقابل 2000$ لنماذج LLM المحلية؟
فقط إذا كنت تشغّل نماذج 70B بشكل متكرر أو لديك أحمال إنتاجية. RTX 5090 (200 tok/s على 8B) أسرع بـ 2.5× من RTX 4090 (1800$). أفضل قيمة مقابل السعر: RTX 4070 Ti (600$، 80 tok/s) لنماذج 8B–32B؛ و Mac Studio M2 Ultra (4000$) إذا احتجت دعمًا أصليًا لـ 70B.
المصادر
- مواصفات GPU من NVIDIA — مواصفات GPU سلسلة RTX 40/50 و VRAM وعرض نطاق الذاكرة.
- أداء Apple M3 — بنية الذاكرة الموحدة في M5 Max وأداء الاستدلال.
- معايير vLLM — معايير أداء استدلال نماذج LLM في الإنتاج.
- تنتج الأجهزة المختلفة معدلات tokens مختلفة، لكن كل استدلال يستفيد من prompts منظمة. تتطلب طلبات السياق الطويل تقنيات مختلفة عن القصيرة: شرح نوافذ السياق يغطي استراتيجيات لأي جهاز.