Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/⁨Apple Silicon⁩ لنماذج ⁨LLM⁩ المحلية ⁨2026⁩: دليل كامل من ⁨M1⁩ إلى ⁨M5 Max⁩
Hardware & Performance

⁨Apple Silicon⁩ لنماذج ⁨LLM⁩ المحلية ⁨2026⁩: دليل كامل من ⁨M1⁩ إلى ⁨M5 Max⁩

·15 دقيقة للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

يقدّم Apple Silicon لنماذج LLM المحلية استهلاك طاقة أقل (25–70 واط) واستدلالًا صامتًا مقارنةً بكروت رسوميات سطح المكتب، دون حدود VRAM — كامل الذاكرة الموحدة من 32–128 GB متاح للنموذج. يشغّل M5 Pro (64GB) نماذج 8B بسرعة 45–55 tok/s ونماذج 34B بسرعة 15–20 tok/s؛ ويشغّل M5 Max (128GB) نماذج 70B بسرعة 12–18 tok/s. ميزة الذاكرة الموحدة حاسمة: بينما يملك RTX 4090 حدًا أقصى 24GB من VRAM المنفصلة، يمكن لمستخدمي Apple Silicon تحميل نماذج 70B معامل كاملة، مما يلغي تكلفة وتعقيد كرتي رسوميات. اختيار الإطار (Ollama الأسهل، MLX الأسرع، llama.cpp الأكثر توافقًا) أقل أهمية من امتلاك الشريحة الصحيحة — اختر حجم Mac والذاكرة، ثم اختر نموذج LLM ليناسبها.

دليل كامل لتشغيل نماذج LLM المحلية على Apple Silicon في 2026. يقارن شرائح من M1 حتى M5 Max بمستويات الذاكرة الموحدة، واختبارات تسريع GPU عبر Metal المرجعية، وتحليل استهلاك الطاقة، وتوصيات النماذج حسب تهيئة Mac. يتضمن مخطط قرار بين MacBook Pro وMac Mini وMac Studio، ومقارنة الأطر (Ollama مقابل MLX مقابل llama.cpp) وسيناريوهات واقعية (وكيل برمجة، خط أنابيب RAG، مساعد صوتي، متعدد الوسائط). يغطي لماذا تزيل الذاكرة الموحدة في Apple Silicon اختناقات VRAM التي تؤثر في كروت الرسوميات المنفصلة، مما يتيح نماذج 70B على عتاد المستهلك دون تهيئة برامج تشغيل.

⁨Apple Silicon⁩ لنماذج ⁨LLM⁩ المحلية ⁨2026⁩: دليل كامل من ⁨M1⁩ إلى ⁨M5 Max⁩

Key Takeaways

  • يزيل Apple Silicon حدود VRAM — كامل الذاكرة الموحدة من 32–128 GB متاح للنماذج. يملك RTX 4090 حدًا أقصى 24GB من VRAM المنفصلة.
  • يشغّل M5 Pro (64GB) نماذج 8B بسرعة 45–55 tok/s ونماذج 34B بسرعة 15–20 tok/s. ويشغّل M5 Max (128GB) نماذج 70B بسرعة 12–18 tok/s.
  • التكلفة السنوية للكهرباء للاستدلال على مدار الساعة: 35–55 دولارًا على Mac Mini M5 مقابل 300–400 دولار على RTX 4090 المكتبي — خفض 10 أضعاف في التكاليف التشغيلية.
  • يعمل تسريع GPU عبر Metal تلقائيًا في Ollama وMLX وllama.cpp. لا حاجة لتهيئة برامج تشغيل.
  • عرض نطاق الذاكرة الموحدة (M5 Pro 307 GB/s، M5 Max 460–614 GB/s) هو الاختناق، لا أنوية GPU. يقدّم M5 Pro عند 307 GB/s نحو ثلث سرعة RTX 4090 في عرض النطاق الخالص.
  • اشترِ أقصى ذاكرة وقت الشراء — لا يمكن ترقيتها لاحقًا. يُوصى بحد أدنى 36GB؛ و64GB فأكثر صامد للمستقبل في 2027–2028.
  • M5 Pro هو النقطة المثلى للأداء مقابل السعر. ولا يبرّر M5 Max السعر الإضافي إلا إذا كنت تحتاج نماذج 70B أو حزمًا متعددة الوسائط (رؤية + LLM + TTS في آن واحد) بشكل متكرر.
  • سيتيح M5 Ultra المتوقع في أواخر 2026 (256GB، نحو 1,200 GB/s) نماذج 70B FP16 (جودة بلا فقدان) ونماذج 120B فأكثر.

Apple M5 Pro (64 جيجابايت) يُشغّل نماذج 8B بسرعة 45–55 رمزاً/ثانية و34B بسرعة 15–20 رمزاً/ثانية؛ M5 Max (128 جيجابايت) يُشغّل 70B بسرعة 12–18 رمزاً/ثانية — كل ذلك عند 25–70 واط بدون قيود VRAM بفضل الذاكرة الموحدة.

الذاكرة الموحدة تعني أن وحدة المعالجة المركزية وبطاقة الرسومات ومحرك الذكاء الاصطناعي تشترك في نفس مجموعة الذاكرة. يمكن لجهاز Mac بسعة 128 جيجابايت استخدام الكل للنموذج، على عكس بطاقة الرسومات المحدودة بـ VRAM الخاصة بها (24 جيجابايت كحد أقصى لبطاقة RTX 4090). لهذا يمكن لأجهزة Mac تشغيل نماذج 70B التي لا تسعها أي بطاقة NVIDIA للمستهلكين.

  • كل شرائح سلسلة M تستخدم ذاكرة موحدة (يتشارك GPU وCPU مجموعة RAM نفسها).
  • M5 Pro وM5 Max هما توصيتا 2026؛ وتبقى M4 وما قبلها قابلة للاستخدام لكن أقل استعدادًا للمستقبل.
  • Metal هو إطار برمجة GPU من Apple؛ مدمج في macOS ولا يتطلب مكتبات خارجية.
  • اختيار الإطار (Ollama، MLX، llama.cpp) يؤثر في السرعة بنسبة 0–25% لكنه لا يغيّر أي النماذج تتسع في الذاكرة.
  • Mac Mini M5 Pro هو نقطة الدخول الأكثر اقتصادًا (800 دولار أساسي؛ 1,200 دولار مع 64GB) وصامت حتى تحت الحمل.
  • متوسط التكلفة السنوية للكهرباء: Mac Mini M5 (35 دولارًا) مقابل RTX 4090 المكتبي (400 دولار) — فارق 10 أضعاف.

لماذا Apple Silicon لنماذج LLM المحلية؟

يتفوق Apple Silicon في استدلال LLM المحلي لسبب واحد: الذاكرة الموحدة. عندما تشتري جهاز Mac بذاكرة 64GB، تكون الـ 64GB كاملةً متاحة لنموذج LLM لديك. أما GPU منفصل مثل RTX 4090 فيملك 24GB من VRAM (منفصلة عن ذاكرة النظام) — والنماذج الأكبر من 24GB ببساطة لا تتسع دون تهيئات تعدد كروت رسوميات معقّدة.

هذا الفارق المعماري الوحيد تحويلي:

  • ذاكرة موحدة: كل الذاكرة متاحة (32–128GB). RTX 4090: VRAM منفصلة فقط (حد صارم 24GB).
  • تسريع Metal: استدلال GPU دون اعتماد على CUDA أو برامج تشغيل مملوكة.
  • كفاءة الطاقة: 30–70 واط تحت الحمل مقابل 300 واط فأكثر لكرت رسوميات سطح المكتب. يتيح تشغيلًا بلا مروحة أو شبه صامت.
  • الصمت: Mac Mini وMacBook Air بلا مروحة في الخمول وتحت الأحمال الخفيفة. أما أبراج كروت رسوميات سطح المكتب فتتجاوز 70 ديسيبل تحت الحمل.
  • بلا إدارة برامج تشغيل: يعمل Metal أصليًا على macOS. لا تعارض إصدارات CUDA، ولا تحديثات برامج تشغيل NVIDIA.
  • تكلفة العتاد: Mac Mini M5 Pro (1,200 دولار) بتهيئة 64GB مقابل تهيئة كرتي رسوميات (4,000 دولار فأكثر) لسعة نموذج مكافئة.

شرائح Apple Silicon لنماذج LLM — مقارنة كاملة

الشريحةأقصى ذاكرةعرض النطاقأنوية GPUالنقطة المثلى لـ LLMالإطلاق
M116 GB68 GB/s87B Q4نوفمبر 2020
M1 Pro32 GB200 GB/s1613B Q4أكتوبر 2021
M1 Max64 GB400 GB/s3234B Q4أكتوبر 2021
M1 Ultra128 GB800 GB/s6470B Q4مارس 2022
M224 GB100 GB/s107–13B Q4يونيو 2022
M2 Pro32 GB200 GB/s1913B Q4يناير 2023
M2 Max96 GB400 GB/s3834–70B Q4يناير 2023
M2 Ultra192 GB800 GB/s7670B+ Q4يونيو 2023
M324 GB100 GB/s107–13B Q4أكتوبر 2023
M3 Pro36 GB150 GB/s1813–34B Q4أكتوبر 2023
M3 Max128 GB400 GB/s4070B Q4أكتوبر 2023
M432 GB120 GB/s1013B Q4مايو 2024
M4 Pro48 GB273 GB/s2034B Q4أكتوبر 2024
M4 Max128 GB546 GB/s4070B Q4أكتوبر 2024
M5 (base)32 GBنحو 150 GB/s1013B Q4أكتوبر 2025
M5 Pro64 GB307 GB/sنحو 2034B Q5مارس 2026
M5 Max128 GB460–614 GB/sنحو 4070B Q5مارس 2026

لم يُعلن عن M5 Ultra بعد — متوقع في أواخر 2026

M5 Ultra (متوقع في أواخر 2026)

بناءً على نمط Ultra الراسخ لدى Apple (ضعف مواصفات Max)، يُتوقع M5 Ultra في أواخر 2026. المواصفات التالية تقديرات، لا مواصفات مؤكدة.

  • 256 GB من الذاكرة الموحدة، نحو 1,200 GB/s عرض نطاق — بناءً على مضاعفة مواصفات M5 Max
  • سيتيح: 70B FP16 (جودة بلا فقدان، دون تكميم)، نماذج 120B فأكثر، حزم متعددة بـ 70B
  • السعر المتوقع: 4,500–6,500 دولار (تهيئة Mac Studio Ultra). قد تتفاوت الأسعار حسب بلدك.
  • سيُحدَّث هذا المقال عندما تؤكد Apple المواصفات

عرض نطاق الذاكرة أهم من حجم الذاكرة

استدلال LLM محدود بعرض نطاق الذاكرة، لا بقدرة الحوسبة. هذا يعني أن سرعة توليد الـ tokens تتناسب خطيًا مع عرض النطاق، لا مع أنوية GPU.

M5 Max عند 614 GB/s مقابل RTX 4090 عند 1,008 GB/s يبدو أن NVIDIA تفوز في عرض النطاق الخام. لكن مستخدمي Apple Silicon يملكون كل الذاكرة متاحة (دون حد VRAM منفصلة)، لذا يمكنهم تحميل نماذج أكبر لا يستطيع NVIDIA استضافتها في 24GB. المقارنة الحقيقية: M5 Max عند 614 GB/s يشغّل نموذج 70B مقابل RTX 4090 العاجز عن تحميل نموذج 70B إطلاقًا.

داخل خط M، تترجم فروق عرض النطاق مباشرةً إلى tok/s:

  • M5 الأساسي (150 GB/s) ← نحو 25–30 tok/s على Llama 3.3 8B Q4
  • M5 Pro (307 GB/s) ← نحو 45–55 tok/s على Llama 3.3 8B Q4 (ضعف M5 الأساسي بسبب ضعف عرض النطاق)
  • M5 Max (614 GB/s) ← نحو 100–120 tok/s على Llama 3.3 8B Q4
  • الدرس: M5 Pro أسرع بالضبط بمقدار ضعفين من M5 الأساسي على النموذج نفسه لأن عرض النطاق تضاعف. عند الشراء، رتّب عرض النطاق فوق عدد أنوية GPU.
عند الشراء، أعطِ الأولوية لعرض النطاق الترددي للذاكرة على عدد أنوية GPU — فهو عنق الزجاجة الحقيقي في استدلال LLM.
عند الشراء، أعطِ الأولوية لعرض النطاق الترددي للذاكرة على عدد أنوية GPU — فهو عنق الزجاجة الحقيقي في استدلال LLM.

كفاءة الطاقة والحرارة — الميزة الصامتة

التهيئةالاستهلاك (خمول)الاستهلاك (LLM)الضوضاءالحرارة
Mac Mini M55W25–35Wصامت (بلا مروحة)دافئ
MacBook Air M53W20–30Wصامت (بلا مروحة)دافئ
MacBook Pro M5 Pro5W40–60Wصامت (المروحة نادرًا ما تنشط)بارد
Mac Studio M5 Max10W60–100Wصامتبارد
RTX 4090 مكتبي50W350–450Wصاخب (3 مراوح)ساخن
RTX 3060 مكتبي30W170–200Wمتوسطدافئ

التكلفة السنوية للكهرباء بسعر 0.15 دولار/kWh، خادم ذكاء اصطناعي على مدار الساعة: Mac Mini M5 (نحو 35 دولارًا سنويًا) مقابل RTX 4090 المكتبي (نحو 400 دولار سنويًا). قد تتفاوت الأسعار حسب بلدك.

الاستدلال على مدار الساعة: نحو 35 دولاراً سنوياً لجهاز Mac Mini M5 مقابل نحو 400 دولار سنوياً لبطاقة RTX 4090 لسطح المكتب — فرق 10 أضعاف عند 0.15 دولار/kWh.
الاستدلال على مدار الساعة: نحو 35 دولاراً سنوياً لجهاز Mac Mini M5 مقابل نحو 400 دولار سنوياً لبطاقة RTX 4090 لسطح المكتب — فرق 10 أضعاف عند 0.15 دولار/kWh.

سيناريوهات مستخدمين واقعية على Apple Silicon

  1. 1
    وكيل برمجة
    Why it matters: يقدّم Llama 3.3 8B على M5 Pro سرعة 45–55 tok/s، وإكمال كود في 1–2 ثانية. يعمل بصمت في الخلفية على MacBook Pro.
  2. 2
    خط أنابيب RAG
    Why it matters: نموذج تضمين + Llama 3.3 8B + ChromaDB يتسع كاملًا في 36GB من الذاكرة الموحدة لـ M5 Pro. دون قيود GPU.
  3. 3
    مساعد صوتي
    Why it matters: Whisper Metal + Ollama Llama + Piper TTS = زمن استجابة 1.2 ثانية على M5 Pro. Mac Mini بلا مروحة مناسب للتهيئة دائمة التشغيل.
  4. 4
    متعدد الوسائط
    Why it matters: Whisper + LLaVA 7B رؤية + Llama 3.3 8B استدلال = الكل يتسع في 36GB، معالجة متزامنة.
  5. 5
    كتابة خاصة
    Why it matters: Llama 3.3 70B Q5 على M5 Max 128GB = أقصى جودة، دون اتصال بالكامل، بلا تكاليف API، وصفر تسرّب بيانات.

أي جهاز Mac يجب أن تشتري لنماذج LLM المحلية؟

مصفوفة القرار: طابق حالة استخدامك مع تهيئة Mac الصحيحة. قد تتفاوت الأسعار حسب بلدك.

حاجتكMac لشرائهالذاكرةالسعر التقريبي
تجربة نماذج LLM المحلية فقطMac Mini M5 الأساسي16GB599 دولارًا
نماذج 7–13B يوميًاMac Mini M5 الأساسي32GB799 دولارًا
نماذج 13–34B، خادم صامتMac Mini M5 Pro64GB1,400 دولار
محطة عمل ذكاء اصطناعي محمولةMacBook Pro M5 Pro48GB2,500 دولار
نماذج 70B، أقصى جودةMac Studio M5 Max128GB4,000 دولار
حزم متعددة النماذج (رؤية + LLM + TTS)Mac Studio M5 Max128GB4,000 دولار
صمود للمستقبل 2027–2028انتظر M5 Ultra256GBنحو 5,500 دولار (تقديري)

حاسم: اشترِ دائمًا أقصى ذاكرة — لا يمكن ترقيتها بعد الشراء. تكلفة الذاكرة وقت البيع 5–10% من الإجمالي؛ بينما استبدال جهاز Mac كاملًا لاحقًا يكلف 100%.

البدء: نظرة عامة على الأطر

ثلاثة أطر جاهزة للإنتاج تشغّل نماذج LLM على GPU Metal في Apple Silicon:

  • Ollama: أبسط إعداد (تثبيت بنقرة واحدة)، اكتشاف تلقائي لـ Metal، دون تهيئة. يتضمن REST API. مثالي للمبتدئين.
  • MLX: إطار Apple الأصلي، أسرع استدلال (أسرع بنسبة 15–25% من Ollama)، تكامل مع Python، دعم الضبط الدقيق LoRA. منحنى تعلّم أحدّ.
  • llama.cpp: C++ متعدد المنصات، أكبر توافق لصيغ النماذج (GGUF)، خلفية Metal متاحة عبر علم تجميع. مثالي للتكامل في تطبيقات أكبر.

الأسئلة الشائعة

هل M5 Pro أم M5 Max أفضل لنماذج LLM المحلية؟

M5 Pro (64GB) هو أفضل قيمة مقابل السعر — يشغّل نماذج 34B جيدًا ويكلف 1,200–1,500 دولار. أما M5 Max (3,000 دولار فأكثر) فضروري فقط إذا كنت تحتاج نماذج 70B أو حزمًا متعددة الوسائط بشكل متكرر. معظم المستخدمين راضون عن M5 Pro. قد تتفاوت الأسعار حسب بلدك.

هل يمكنني ترقية الذاكرة بعد شراء جهاز Mac؟

لا. ذاكرة Apple Silicon ملحومة وغير قابلة للترقية. اشترِ أقصى ذاكرة تستطيع تحمّل تكلفتها وقت الشراء.

كيف يُقارن M5 Pro بـ RTX 4090 لنماذج LLM؟

في النماذج التي تتسع في 24GB من VRAM، يكون RTX 4090 أسرع بنسبة 20–30%. أما في نماذج 70B، فيفوز M5 Pro بشكل حاسم لأن RTX 4090 لا يستطيع تحميلها (حد 24GB). انظر Apple Silicon مقابل GPU من NVIDIA لنماذج LLM.

هل أحتاج Ollama أم MLX أم llama.cpp؟

ابدأ بـ Ollama (الأسهل). إذا احتجت استدلالًا أسرع أو ضبطًا دقيقًا، انتقل إلى MLX. وإذا احتجت توافقًا متعدد المنصات، استخدم llama.cpp. الثلاثة يعملون على Apple Silicon.

هل سيغيّر M5 Ultra بذاكرة 256GB أي شيء؟

نعم. سيشغّل M5 Ultra (متوقع في أواخر 2026) نماذج 70B بـ FP16 (دون فقدان جودة) وسيتيح نماذج 120B فأكثر لأول مرة على عتاد المستهلك. أسعار متوقعة من 4,500 دولار. قد تتفاوت الأسعار حسب بلدك.

هل يستحق Apple Silicon العناء لنماذج LLM المحلية في 2026؟

نعم، خاصةً لنماذج 34B فأكثر. Apple Silicon هو عتاد المستهلك الوحيد الذي يشغّل نماذج 70B دون تهيئات تعدد كروت رسوميات معقّدة. أما لنماذج 8B التي تتسع في VRAM الخاصة بـ NVIDIA، فيكون RTX 4090 أسرع لكنه أغلى في التشغيل. ينتهي معظم مستخدمي نماذج LLM المحلية باختيار M5 Pro 64GB (1,400 دولار) كنقطة مثلى للأداء مقابل السعر.

هل يمكنني تشغيل نماذج LLM على Apple Silicon في MacBook Air؟

نعم، مع قيود. يشغّل MacBook Air M5 (16–32GB) نماذج 7–13B بأريحية. يظهر خنق حراري بعد 10–15 دقيقة من الاستدلال المستمر في التصميم بلا مروحة. للاستخدام العرضي: مثالي. أما للاستدلال دائم التشغيل: فإن Mac Mini M5 Pro أنسب.

منهجية الاختبارات المرجعية والوقت المرجعي

  • كل بيانات M5 Pro/Max مبنية على اختبارات مجتمعية مرجعية من مارس–مايو 2026
  • آخر تحقق: 2026-05-15
  • يتحسّن الأداء مع تحديثات الأطر (Ollama وMLX وllama.cpp تطلق إصدارات شهرية)
  • سيُعاد تقييم هذا المقال كل ثلاثة أشهر

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

هل تشغّل نموذج LLM على Apple Silicon؟ قارن مُخرج نموذجك المحلي على M5 مع GPT-4 وClaude وGemini و22 نموذجًا سحابيًا آخر في إرسال واحد عبر PromptQuorum — اكتشف أين تضاهي تهيئتك المحلية جودة السحابة وأين تقصّر.

Join the PromptQuorum Waitlist →

← Back to Local LLMs