Key Takeaways
- يزيل Apple Silicon حدود VRAM — كامل الذاكرة الموحدة من 32–128 GB متاح للنماذج. يملك RTX 4090 حدًا أقصى 24GB من VRAM المنفصلة.
- يشغّل M5 Pro (64GB) نماذج 8B بسرعة 45–55 tok/s ونماذج 34B بسرعة 15–20 tok/s. ويشغّل M5 Max (128GB) نماذج 70B بسرعة 12–18 tok/s.
- التكلفة السنوية للكهرباء للاستدلال على مدار الساعة: 35–55 دولارًا على Mac Mini M5 مقابل 300–400 دولار على RTX 4090 المكتبي — خفض 10 أضعاف في التكاليف التشغيلية.
- يعمل تسريع GPU عبر Metal تلقائيًا في Ollama وMLX وllama.cpp. لا حاجة لتهيئة برامج تشغيل.
- عرض نطاق الذاكرة الموحدة (M5 Pro 307 GB/s، M5 Max 460–614 GB/s) هو الاختناق، لا أنوية GPU. يقدّم M5 Pro عند 307 GB/s نحو ثلث سرعة RTX 4090 في عرض النطاق الخالص.
- اشترِ أقصى ذاكرة وقت الشراء — لا يمكن ترقيتها لاحقًا. يُوصى بحد أدنى 36GB؛ و64GB فأكثر صامد للمستقبل في 2027–2028.
- M5 Pro هو النقطة المثلى للأداء مقابل السعر. ولا يبرّر M5 Max السعر الإضافي إلا إذا كنت تحتاج نماذج 70B أو حزمًا متعددة الوسائط (رؤية + LLM + TTS في آن واحد) بشكل متكرر.
- سيتيح M5 Ultra المتوقع في أواخر 2026 (256GB، نحو 1,200 GB/s) نماذج 70B FP16 (جودة بلا فقدان) ونماذج 120B فأكثر.
Apple M5 Pro (64 جيجابايت) يُشغّل نماذج 8B بسرعة 45–55 رمزاً/ثانية و34B بسرعة 15–20 رمزاً/ثانية؛ M5 Max (128 جيجابايت) يُشغّل 70B بسرعة 12–18 رمزاً/ثانية — كل ذلك عند 25–70 واط بدون قيود VRAM بفضل الذاكرة الموحدة.
الذاكرة الموحدة تعني أن وحدة المعالجة المركزية وبطاقة الرسومات ومحرك الذكاء الاصطناعي تشترك في نفس مجموعة الذاكرة. يمكن لجهاز Mac بسعة 128 جيجابايت استخدام الكل للنموذج، على عكس بطاقة الرسومات المحدودة بـ VRAM الخاصة بها (24 جيجابايت كحد أقصى لبطاقة RTX 4090). لهذا يمكن لأجهزة Mac تشغيل نماذج 70B التي لا تسعها أي بطاقة NVIDIA للمستهلكين.
- كل شرائح سلسلة M تستخدم ذاكرة موحدة (يتشارك GPU وCPU مجموعة RAM نفسها).
- M5 Pro وM5 Max هما توصيتا 2026؛ وتبقى M4 وما قبلها قابلة للاستخدام لكن أقل استعدادًا للمستقبل.
- Metal هو إطار برمجة GPU من Apple؛ مدمج في macOS ولا يتطلب مكتبات خارجية.
- اختيار الإطار (Ollama، MLX، llama.cpp) يؤثر في السرعة بنسبة 0–25% لكنه لا يغيّر أي النماذج تتسع في الذاكرة.
- Mac Mini M5 Pro هو نقطة الدخول الأكثر اقتصادًا (800 دولار أساسي؛ 1,200 دولار مع 64GB) وصامت حتى تحت الحمل.
- متوسط التكلفة السنوية للكهرباء: Mac Mini M5 (35 دولارًا) مقابل RTX 4090 المكتبي (400 دولار) — فارق 10 أضعاف.
لماذا Apple Silicon لنماذج LLM المحلية؟
يتفوق Apple Silicon في استدلال LLM المحلي لسبب واحد: الذاكرة الموحدة. عندما تشتري جهاز Mac بذاكرة 64GB، تكون الـ 64GB كاملةً متاحة لنموذج LLM لديك. أما GPU منفصل مثل RTX 4090 فيملك 24GB من VRAM (منفصلة عن ذاكرة النظام) — والنماذج الأكبر من 24GB ببساطة لا تتسع دون تهيئات تعدد كروت رسوميات معقّدة.
هذا الفارق المعماري الوحيد تحويلي:
- ذاكرة موحدة: كل الذاكرة متاحة (32–128GB). RTX 4090: VRAM منفصلة فقط (حد صارم 24GB).
- تسريع Metal: استدلال GPU دون اعتماد على CUDA أو برامج تشغيل مملوكة.
- كفاءة الطاقة: 30–70 واط تحت الحمل مقابل 300 واط فأكثر لكرت رسوميات سطح المكتب. يتيح تشغيلًا بلا مروحة أو شبه صامت.
- الصمت: Mac Mini وMacBook Air بلا مروحة في الخمول وتحت الأحمال الخفيفة. أما أبراج كروت رسوميات سطح المكتب فتتجاوز 70 ديسيبل تحت الحمل.
- بلا إدارة برامج تشغيل: يعمل Metal أصليًا على macOS. لا تعارض إصدارات CUDA، ولا تحديثات برامج تشغيل NVIDIA.
- تكلفة العتاد: Mac Mini M5 Pro (1,200 دولار) بتهيئة 64GB مقابل تهيئة كرتي رسوميات (4,000 دولار فأكثر) لسعة نموذج مكافئة.
شرائح Apple Silicon لنماذج LLM — مقارنة كاملة
| الشريحة | أقصى ذاكرة | عرض النطاق | أنوية GPU | النقطة المثلى لـ LLM | الإطلاق |
|---|---|---|---|---|---|
| M1 | 16 GB | 68 GB/s | 8 | 7B Q4 | نوفمبر 2020 |
| M1 Pro | 32 GB | 200 GB/s | 16 | 13B Q4 | أكتوبر 2021 |
| M1 Max | 64 GB | 400 GB/s | 32 | 34B Q4 | أكتوبر 2021 |
| M1 Ultra | 128 GB | 800 GB/s | 64 | 70B Q4 | مارس 2022 |
| M2 | 24 GB | 100 GB/s | 10 | 7–13B Q4 | يونيو 2022 |
| M2 Pro | 32 GB | 200 GB/s | 19 | 13B Q4 | يناير 2023 |
| M2 Max | 96 GB | 400 GB/s | 38 | 34–70B Q4 | يناير 2023 |
| M2 Ultra | 192 GB | 800 GB/s | 76 | 70B+ Q4 | يونيو 2023 |
| M3 | 24 GB | 100 GB/s | 10 | 7–13B Q4 | أكتوبر 2023 |
| M3 Pro | 36 GB | 150 GB/s | 18 | 13–34B Q4 | أكتوبر 2023 |
| M3 Max | 128 GB | 400 GB/s | 40 | 70B Q4 | أكتوبر 2023 |
| M4 | 32 GB | 120 GB/s | 10 | 13B Q4 | مايو 2024 |
| M4 Pro | 48 GB | 273 GB/s | 20 | 34B Q4 | أكتوبر 2024 |
| M4 Max | 128 GB | 546 GB/s | 40 | 70B Q4 | أكتوبر 2024 |
| M5 (base) | 32 GB | نحو 150 GB/s | 10 | 13B Q4 | أكتوبر 2025 |
| M5 Pro | 64 GB | 307 GB/s | نحو 20 | 34B Q5 | مارس 2026 |
| M5 Max | 128 GB | 460–614 GB/s | نحو 40 | 70B Q5 | مارس 2026 |
لم يُعلن عن M5 Ultra بعد — متوقع في أواخر 2026
M5 Ultra (متوقع في أواخر 2026)
بناءً على نمط Ultra الراسخ لدى Apple (ضعف مواصفات Max)، يُتوقع M5 Ultra في أواخر 2026. المواصفات التالية تقديرات، لا مواصفات مؤكدة.
- 256 GB من الذاكرة الموحدة، نحو 1,200 GB/s عرض نطاق — بناءً على مضاعفة مواصفات M5 Max
- سيتيح: 70B FP16 (جودة بلا فقدان، دون تكميم)، نماذج 120B فأكثر، حزم متعددة بـ 70B
- السعر المتوقع: 4,500–6,500 دولار (تهيئة Mac Studio Ultra). قد تتفاوت الأسعار حسب بلدك.
- سيُحدَّث هذا المقال عندما تؤكد Apple المواصفات
عرض نطاق الذاكرة أهم من حجم الذاكرة
استدلال LLM محدود بعرض نطاق الذاكرة، لا بقدرة الحوسبة. هذا يعني أن سرعة توليد الـ tokens تتناسب خطيًا مع عرض النطاق، لا مع أنوية GPU.
M5 Max عند 614 GB/s مقابل RTX 4090 عند 1,008 GB/s يبدو أن NVIDIA تفوز في عرض النطاق الخام. لكن مستخدمي Apple Silicon يملكون كل الذاكرة متاحة (دون حد VRAM منفصلة)، لذا يمكنهم تحميل نماذج أكبر لا يستطيع NVIDIA استضافتها في 24GB. المقارنة الحقيقية: M5 Max عند 614 GB/s يشغّل نموذج 70B مقابل RTX 4090 العاجز عن تحميل نموذج 70B إطلاقًا.
داخل خط M، تترجم فروق عرض النطاق مباشرةً إلى tok/s:
- M5 الأساسي (150 GB/s) ← نحو 25–30 tok/s على Llama 3.3 8B Q4
- M5 Pro (307 GB/s) ← نحو 45–55 tok/s على Llama 3.3 8B Q4 (ضعف M5 الأساسي بسبب ضعف عرض النطاق)
- M5 Max (614 GB/s) ← نحو 100–120 tok/s على Llama 3.3 8B Q4
- الدرس: M5 Pro أسرع بالضبط بمقدار ضعفين من M5 الأساسي على النموذج نفسه لأن عرض النطاق تضاعف. عند الشراء، رتّب عرض النطاق فوق عدد أنوية GPU.

كفاءة الطاقة والحرارة — الميزة الصامتة
| التهيئة | الاستهلاك (خمول) | الاستهلاك (LLM) | الضوضاء | الحرارة |
|---|---|---|---|---|
| Mac Mini M5 | 5W | 25–35W | صامت (بلا مروحة) | دافئ |
| MacBook Air M5 | 3W | 20–30W | صامت (بلا مروحة) | دافئ |
| MacBook Pro M5 Pro | 5W | 40–60W | صامت (المروحة نادرًا ما تنشط) | بارد |
| Mac Studio M5 Max | 10W | 60–100W | صامت | بارد |
| RTX 4090 مكتبي | 50W | 350–450W | صاخب (3 مراوح) | ساخن |
| RTX 3060 مكتبي | 30W | 170–200W | متوسط | دافئ |
التكلفة السنوية للكهرباء بسعر 0.15 دولار/kWh، خادم ذكاء اصطناعي على مدار الساعة: Mac Mini M5 (نحو 35 دولارًا سنويًا) مقابل RTX 4090 المكتبي (نحو 400 دولار سنويًا). قد تتفاوت الأسعار حسب بلدك.

سيناريوهات مستخدمين واقعية على Apple Silicon
- 1وكيل برمجة
Why it matters: يقدّم Llama 3.3 8B على M5 Pro سرعة 45–55 tok/s، وإكمال كود في 1–2 ثانية. يعمل بصمت في الخلفية على MacBook Pro. - 2خط أنابيب RAG
Why it matters: نموذج تضمين + Llama 3.3 8B + ChromaDB يتسع كاملًا في 36GB من الذاكرة الموحدة لـ M5 Pro. دون قيود GPU. - 3مساعد صوتي
Why it matters: Whisper Metal + Ollama Llama + Piper TTS = زمن استجابة 1.2 ثانية على M5 Pro. Mac Mini بلا مروحة مناسب للتهيئة دائمة التشغيل. - 4متعدد الوسائط
Why it matters: Whisper + LLaVA 7B رؤية + Llama 3.3 8B استدلال = الكل يتسع في 36GB، معالجة متزامنة. - 5كتابة خاصة
Why it matters: Llama 3.3 70B Q5 على M5 Max 128GB = أقصى جودة، دون اتصال بالكامل، بلا تكاليف API، وصفر تسرّب بيانات.
أي جهاز Mac يجب أن تشتري لنماذج LLM المحلية؟
مصفوفة القرار: طابق حالة استخدامك مع تهيئة Mac الصحيحة. قد تتفاوت الأسعار حسب بلدك.
| حاجتك | Mac لشرائه | الذاكرة | السعر التقريبي |
|---|---|---|---|
| تجربة نماذج LLM المحلية فقط | Mac Mini M5 الأساسي | 16GB | 599 دولارًا |
| نماذج 7–13B يوميًا | Mac Mini M5 الأساسي | 32GB | 799 دولارًا |
| نماذج 13–34B، خادم صامت | Mac Mini M5 Pro | 64GB | 1,400 دولار |
| محطة عمل ذكاء اصطناعي محمولة | MacBook Pro M5 Pro | 48GB | 2,500 دولار |
| نماذج 70B، أقصى جودة | Mac Studio M5 Max | 128GB | 4,000 دولار |
| حزم متعددة النماذج (رؤية + LLM + TTS) | Mac Studio M5 Max | 128GB | 4,000 دولار |
| صمود للمستقبل 2027–2028 | انتظر M5 Ultra | 256GB | نحو 5,500 دولار (تقديري) |
حاسم: اشترِ دائمًا أقصى ذاكرة — لا يمكن ترقيتها بعد الشراء. تكلفة الذاكرة وقت البيع 5–10% من الإجمالي؛ بينما استبدال جهاز Mac كاملًا لاحقًا يكلف 100%.
البدء: نظرة عامة على الأطر
ثلاثة أطر جاهزة للإنتاج تشغّل نماذج LLM على GPU Metal في Apple Silicon:
- Ollama: أبسط إعداد (تثبيت بنقرة واحدة)، اكتشاف تلقائي لـ Metal، دون تهيئة. يتضمن REST API. مثالي للمبتدئين.
- MLX: إطار Apple الأصلي، أسرع استدلال (أسرع بنسبة 15–25% من Ollama)، تكامل مع Python، دعم الضبط الدقيق LoRA. منحنى تعلّم أحدّ.
- llama.cpp: C++ متعدد المنصات، أكبر توافق لصيغ النماذج (GGUF)، خلفية Metal متاحة عبر علم تجميع. مثالي للتكامل في تطبيقات أكبر.
الأسئلة الشائعة
هل M5 Pro أم M5 Max أفضل لنماذج LLM المحلية؟
M5 Pro (64GB) هو أفضل قيمة مقابل السعر — يشغّل نماذج 34B جيدًا ويكلف 1,200–1,500 دولار. أما M5 Max (3,000 دولار فأكثر) فضروري فقط إذا كنت تحتاج نماذج 70B أو حزمًا متعددة الوسائط بشكل متكرر. معظم المستخدمين راضون عن M5 Pro. قد تتفاوت الأسعار حسب بلدك.
هل يمكنني ترقية الذاكرة بعد شراء جهاز Mac؟
لا. ذاكرة Apple Silicon ملحومة وغير قابلة للترقية. اشترِ أقصى ذاكرة تستطيع تحمّل تكلفتها وقت الشراء.
كيف يُقارن M5 Pro بـ RTX 4090 لنماذج LLM؟
في النماذج التي تتسع في 24GB من VRAM، يكون RTX 4090 أسرع بنسبة 20–30%. أما في نماذج 70B، فيفوز M5 Pro بشكل حاسم لأن RTX 4090 لا يستطيع تحميلها (حد 24GB). انظر Apple Silicon مقابل GPU من NVIDIA لنماذج LLM.
هل أحتاج Ollama أم MLX أم llama.cpp؟
ابدأ بـ Ollama (الأسهل). إذا احتجت استدلالًا أسرع أو ضبطًا دقيقًا، انتقل إلى MLX. وإذا احتجت توافقًا متعدد المنصات، استخدم llama.cpp. الثلاثة يعملون على Apple Silicon.
هل سيغيّر M5 Ultra بذاكرة 256GB أي شيء؟
نعم. سيشغّل M5 Ultra (متوقع في أواخر 2026) نماذج 70B بـ FP16 (دون فقدان جودة) وسيتيح نماذج 120B فأكثر لأول مرة على عتاد المستهلك. أسعار متوقعة من 4,500 دولار. قد تتفاوت الأسعار حسب بلدك.
هل يستحق Apple Silicon العناء لنماذج LLM المحلية في 2026؟
نعم، خاصةً لنماذج 34B فأكثر. Apple Silicon هو عتاد المستهلك الوحيد الذي يشغّل نماذج 70B دون تهيئات تعدد كروت رسوميات معقّدة. أما لنماذج 8B التي تتسع في VRAM الخاصة بـ NVIDIA، فيكون RTX 4090 أسرع لكنه أغلى في التشغيل. ينتهي معظم مستخدمي نماذج LLM المحلية باختيار M5 Pro 64GB (1,400 دولار) كنقطة مثلى للأداء مقابل السعر.
هل يمكنني تشغيل نماذج LLM على Apple Silicon في MacBook Air؟
نعم، مع قيود. يشغّل MacBook Air M5 (16–32GB) نماذج 7–13B بأريحية. يظهر خنق حراري بعد 10–15 دقيقة من الاستدلال المستمر في التصميم بلا مروحة. للاستخدام العرضي: مثالي. أما للاستدلال دائم التشغيل: فإن Mac Mini M5 Pro أنسب.
منهجية الاختبارات المرجعية والوقت المرجعي
- كل بيانات M5 Pro/Max مبنية على اختبارات مجتمعية مرجعية من مارس–مايو 2026
- آخر تحقق: 2026-05-15
- يتحسّن الأداء مع تحديثات الأطر (Ollama وMLX وllama.cpp تطلق إصدارات شهرية)
- سيُعاد تقييم هذا المقال كل ثلاثة أشهر
