Key Takeaways
- macOS (Apple Silicon): صفر تكلفة GPU، Ollama مجاني، يتعامل مع Llama 3.1 8B دون مشاكل. الأفضل للمستخدمين العرضيين أو غير التقنيين.
- Windows (GPU من NVIDIA): معيار الصناعة لتسريع GPU. منظومة CUDA ناضجة. GPU بسعر 150–1,600 دولار حسب حجم النموذج.
- Linux (GPU من NVIDIA أو AMD): عبء أقل (طاقة أقل بنسبة 10–20% من Windows)، الأفضل للخوادم 24/7. نفس تكلفة GPU في Windows.
- سرعة الاستدلال: تنتج الأنظمة الثلاثة نفس سرعة الإخراج مع نفس GPU. صعوبة إعداد البرمجيات تختلف.
- تعقيد الإعداد: macOS الأبسط (Ollama بنقرة واحدة)؛ Windows متوسط (يتطلب تعريفات NVIDIA)؛ Linux يتطلب إلمامًا بسطر الأوامر.
- التكلفة لكل استدلال: Linux < Windows = macOS (متساوية لـ GPU المُسرّع؛ macOS أرخص فقط لـ CPU).
- المنظومة: NVIDIA CUDA متاح على Windows/Linux (غير أصلي على Mac). AMD ROCm على Linux/Windows. Apple Metal على macOS فقط.
- الخيار الأفضل: Mac للحاسوب المحمول/الاستخدام العرضي؛ Windows للألعاب المكتبية + LLM؛ Linux للخوادم.
ما تكلفة العتاد حسب نظام التشغيل؟
macOS (الجيل Apple M5 — الشحن مارس 2026): MacBook Pro M5 Pro 64 GB (2,499–3,199 دولار) يشغّل 70B Q4 بسرعة 15–20 tok/s. MacBook Pro M5 Max 128 GB (3,499–4,999 دولار) يشغّل 70B Q8 بسرعة 25–35 tok/s. MacBook Air M5 32 GB (1,099–1,299 دولار) يتعامل مع 8B دون مشاكل. التكلفة الإضافية الإجمالية عند الترقية: 0 دولار إذا كان لديك Mac بالفعل؛ 1,099 دولارًا+ إذا اشتريت جديدًا.
Windows (GPU من NVIDIA مطلوب — أبريل 2026):** RTX 5060 Ti 16 GB جديدة (450–500 دولار) تشغّل 70B Q4 بسرعة 20–40 tok/s. RTX 5090 32 GB جديدة (2,000 دولار) تشغّل 70B بسرعة 40–50 tok/s (أول GPU استهلاكية فردية تشغّل 70B دون تقسيم). RTX 4070 مستعملة (350 دولارًا)، RTX 4090 (1,000–1,400 دولار) لا تزال متاحة. التكلفة الإضافية: 350–2,000 دولار.
Linux (GPU من NVIDIA أو AMD): خادم bare-metal (300–1,000 دولار) أو إعادة استخدام جهاز قديم + RTX 5060 Ti/5090 (450–2,000 دولار). نفس تكلفة GPU في Windows. التكلفة الإضافية: 150–2,600 دولار.
تحديث أجهزة Mac المكتبية (25 أغسطس 2026): أعلنت Apple عن Mac mini M6 (899 دولارًا، بحد أقصى 32 GB ذاكرة موحدة، عرض نطاق 170 GB/s) وMac mini M5 Pro (1,699 دولارًا، بحد أقصى 64 GB، عرض نطاق 307 GB/s)، ويبدأ شحن الجهازين في 22 سبتمبر 2026. كما حصل Mac Studio على تحديث: M5 Max (2,499 دولارًا، حتى 128 GB) وM5 Ultra (5,499 دولارًا بدءًا من 96 GB، وقابل للتوسيع إلى 256 GB أو 512 GB — يبدأ شحن نسخة 512 GB في أواخر أكتوبر 2026 بسعر يُتوقع أن يتجاوز 10,000 دولار بكثير). أصبح كل من Mac mini M4 (بدءًا من 599 دولارًا) وMac mini M4 Pro (حتى 2,299 دولارًا، بحد أقصى 64 GB) الجيل السابق الآن. تبقى RTX 5090 أول حل GPU استهلاكي فردي لنماذج 70B.

💡نصيحة: 💡 نصيحة احترافية: M5 Max 128 GB مقابل RTX 5090: M5 Max أبطأ بنسبة 1.3–1.5× (25–35 مقابل 40–50 tok/s) لكنه يكلّف 400 دولار أقل، وله ذاكرة 4× أكثر، وصامت (بلا ضجيج مروحة GPU).
ما الإعداد والتعقيد؟
macOS: نزّل Ollama (دقيقة واحدة)، شغّل التطبيق، اختر Llama 3.1 8B (5 دقائق) = 6 دقائق إجمالًا، صفر أوامر طرفية. الأفضل للمستخدمين غير التقنيين.
Windows: ثبّت تعريفات NVIDIA (5–10 دقائق)، نزّل Ollama أو LM Studio (5 دقائق)، اختر النموذج (5 دقائق) = 15–20 دقيقة بواجهة رسومية (دون حاجة للطرفية).
Linux (Ubuntu): SSH، ثبّت CUDA/cuDNN (20–40 دقيقة)، ثبّت Ollama/vLLM (10 دقائق)، هيّئ systemd (10–20 دقيقة) = 40–70 دقيقة. يتطلب راحة مع الطرفية.
الصيانة طويلة الأمد: macOS (تحديثات تلقائية)، Windows (تحديثات تعريفات ربع سنوية)، Linux (ضبط النظام، مشاكل تبعيات عرضية).
إعداد macOS كتوصيل شاحن هاتف (كابل واحد، يعمل). Windows كتجميع أثاث مسطّح (التعليمات مهمة). Linux كبناء حاسوب من قطع (تحتاج لمعرفة ما تفعله).

🛠️ممارسة: 🛠️ ممارسة جيدة: لا تثبّت macOS Sequoia يوم الإطلاق؛ انتظر أسبوعين لإصلاحات تعريفات Metal. ينكسر دعم GPU أحيانًا في الإصدارات الفرعية.
كيف تُقارَن سرعات الاستدلال؟
macOS (الجيل Apple M5 — الشحن مارس 2026): M5 Pro (64 GB) يشغّل Llama 3.3 70B Q4 بسرعة 15–20 tok/s. M5 Max (128 GB، عرض نطاق 614 GB/s) يشغّل 70B Q8 بسرعة 25–35 tok/s — تحسّن 4× مقابل M4 Max (الذي كان غير عملي لـ 70B).
Windows + RTX 5090 (32 GB، أبريل 2026): Llama 3.3 70B = 40–50 tok/s، 8B = 180+ tok/s. RTX 5090 هي أول GPU استهلاكية تتعامل مع 70B دون تكميم أقل من Q4 أو استخدام تقسيم النموذج.
Windows + RTX 5060 Ti (16 GB، أبريل 2026): Llama 3.3 70B لا يتسع (يحتاج 24 GB كحد أدنى). نماذج 13B–24B بسرعة 20–40 tok/s. جيدة للمستخدمين المكافئين لـ RTX 4070 بميزانية ضيقة.
Linux + RTX 5090 أو RTX 5060 Ti: أسرع بنسبة 1–5% من Windows بسبب عبء أقل لنظام التشغيل. RTX 5090 على Linux تبلغ 42–53 tok/s لنموذج 70B.
التوازن بين M5 Max وRTX 5090: RTX 5090 أسرع بنسبة 1.3–1.5× لكنها تكلّف 500 دولار أكثر، وتتطلب جهازًا مكتبيًا، وتستهلك 450 واط. M5 Max صامت وجاهز للاستخدام وله ذاكرة 4× (128 GB مقابل 32 GB).
عتاد GPU يحدّد سرعة الاستدلال (RTX 5090 بسرعة 40–50 tok/s مقابل M5 Max بسرعة 25–35 tok/s)، وليس نظام التشغيل.
🔍رؤية: 🔍 نقلة M5 النوعية: تقدّم بنية Fusion من Apple (شريحتان 3nm متصلتان) سرعة معالجة prompts LLM 4× مقابل M4، ما يقلّص بشكل ملحوظ فجوة السرعة مع RTX 5090.
⚠️تحذير: ⚠️ تحذير: AMD ROCm على Windows غير ناضج. اختر Linux لـ GPU من AMD؛ الدعم على Windows متأخر 3–6 أشهر.
ما الأدوات وأطر العمل المدعومة حسب نظام التشغيل؟
Ollama (محرك الاستدلال): macOS ✓، Windows ✓، Linux ✓. وظائف متطابقة على الثلاثة.
LM Studio (واجهة رسومية): macOS ✓، Windows ✓. Linux عبر Docker فقط (بلا واجهة رسومية أصلية).
vLLM (خادم API): macOS (محدود، Apple Metal فقط)، Windows ✓ (CUDA)، Linux ✓ (CUDA/ROCm). الأفضل على Linux.
NVIDIA CUDA toolkit: Windows ✓، Linux ✓. macOS ✗ (غير مدعوم اعتبارًا من أبريل 2026، Apple Metal فقط).
PyTorch (إطار عمل التعلم العميق): macOS ✓ (خلفية Apple Metal، أبطأ)، Windows ✓ (CUDA)، Linux ✓ (CUDA/ROCm). الأسرع على Linux/Windows مع NVIDIA.
دعم الضبط الدقيق: macOS (بطيء بـ CPU فقط أو عبر السحابة)؛ Windows ✓ (مُسرّع بـ CUDA)؛ Linux ✓✓ (أفضل دعم).
📌ملاحظة: 📌 نقطة رئيسية: CUDA يعمل أصليًا على Windows/Linux فقط. على مستخدمي macOS استخدام واجهة Apple Metal، وهي أحدث ولها مكتبات أقل.
ما التكلفة الإجمالية للملكية على مدى 3 سنوات؟
| التهيئة | السنة 1 | السنة 2–3 | إجمالي 3 سنوات |
|---|---|---|---|
| MacBook Air M5 (32 GB، موجود) | 0 دولار | 20 دولارًا | 20 دولارًا |
| MacBook Pro M5 Pro 64 GB | 2,499 دولارًا | 30 دولارًا | 2,529 دولارًا |
| MacBook Pro M5 Max 128 GB | 3,499 دولارًا | 30 دولارًا | 3,529 دولارًا |
| Mac mini M6 32 GB | 899 دولارًا | 15 دولارًا | 914 دولارًا |
| Mac mini M5 Pro 64 GB | 1,699 دولارًا | 20 دولارًا | 1,719 دولارًا |
| Mac Studio M5 Max 128 GB | 2,499 دولارًا | 30 دولارًا | 2,529 دولارًا |
| Windows + RTX 5060 Ti 16 GB | 1,650 دولارًا | 80 دولارًا | 1,730 دولارًا |
| Windows + RTX 5090 32 GB | 2,500 دولار | 120 دولارًا | 2,620 دولارًا |
| Linux + RTX 5060 Ti 16 GB | 750 دولارًا | 60 دولارًا | 810 دولارات |
| Linux + RTX 5090 32 GB | 1,400 دولار | 100 دولار | 1,500 دولار |
الأسئلة الشائعة
هل يمكنني تشغيل Llama 3.3 70B على macOS؟
نعم — MacBook Pro M5 Pro (64 GB) يشغّل 70B Q4 بسرعة 15–20 tok/s. M5 Max (128 GB) يشغّل 70B Q8 بسرعة 25–35 tok/s. Mac mini M5 Pro (64 GB، متاح ابتداءً من 22 سبتمبر 2026) يستخدم نفس الشريحة ويُفترض أن يعمل بأداء مماثل. Mac Studio M5 Max (حتى 128 GB) وM5 Ultra (حتى 512 GB) يتعاملان مع نماذج أكبر. Mac mini M6 (بحد أقصى 32 GB) لا يمكنه استيعاب 70B؛ ولا أي تهيئة بسعة 32 GB أو أقل.
هل يمكنني استخدام GPU من AMD بدلًا من NVIDIA؟
Windows: محدود (دعم ROCm يتحسّن لكنه متأخر 3–6 أشهر عن CUDA). Linux: دعم ROCm ممتاز لسلسلة RX 7000. AMD أبطأ بنسبة 10–20% من NVIDIA المكافئ لاستدلال LLM اعتبارًا من أبريل 2026. لـ AMD على Linux: اضبط HSA_OVERRIDE_GFX_VERSION قبل بدء Ollama.
هل Linux أصعب في الإعداد للمبتدئين؟
نعم. macOS: Ollama.app يُثبَّت في 6 دقائق، بلا طرفية. Windows: 15–20 دقيقة مع تثبيت تعريفات NVIDIA. Linux: 40–70 دقيقة، يتطلب الطرفية (apt، pip، systemctl). إذا لم تكن مرتاحًا مع سطر الأوامر: ابدأ بـ macOS أو Windows.
هل يمكنني تغيير نظام التشغيل في منتصف مشروع؟
نعم. النماذج قابلة للنقل — ملفات GGUF تعمل على جميع الأنظمة. محوّلات الضبط الدقيق (LoRA) قابلة للنقل أيضًا. قد تحتاج شيفرة إطار العمل لتحديثات مسارات صغيرة. تختلف مواقع تخزين نماذج Ollama حسب النظام لكن أوزان النموذج متطابقة.
هل يستهلك macOS كهرباء أقل؟
Apple Silicon M5 Max تحت استدلال LLM متواصل يستهلك ~30–40 واط. RTX 5090 تحت الحمل تستهلك ~450 واط. على 3 سنوات بمعدل 4 ساعات/يوم من الاستخدام النشط: M5 Max ~15 دولارًا كهرباء مقابل RTX 5090 ~180 دولارًا. macOS يفوز في تكلفة الكهرباء، Linux/Windows يفوزان في سرعة الاستدلال.
أي نظام تشغيل أفضل للضبط الدقيق للنماذج؟
Linux > Windows > macOS. Linux لديه أفضل دعم لـ CUDA وDeepSpeed. macOS M5 يمكنه ضبط 7B دقيقًا عبر MLX (إطار ML من Apple) في ~ساعتين — عملي لمجموعات بيانات صغيرة. للضبط الدقيق في الإنتاج: Linux مع RTX 4090 أو أفضل.
هل MacBook Pro M5 Max أفضل من RTX 5090 لنماذج 70B؟
RTX 5090 أسرع بنسبة 1.3–1.5× (40–50 tok/s مقابل 25–35 tok/s). لكن M5 Max لديه ذاكرة 4× أكثر (128 GB مقابل 32 GB) — ما يتيح 70B بـ Q8 (جودة أعلى) بينما RTX 5090 محدود بـ Q4. M5 Max صامت وجاهز للاستخدام. RTX 5090 تتطلب بناء جهاز مكتبي وتبريدًا. اختر M5 Max للجودة + الراحة. اختر RTX 5090 للسرعة الخام.
هل أشتري Mac mini M6 أو Mac mini M5 Pro الجديدين، أم Mac Studio، لنماذج LLM المحلية؟
أعلنت Apple عن تحديث Mac mini وMac Studio في 25 أغسطس 2026، ويبدأ الشحن في 22 سبتمبر 2026 (نسخة Mac Studio M5 Ultra بسعة 512 GB تُشحن في أواخر أكتوبر 2026). لنماذج 8B–13B: Mac mini M6 (899 دولارًا، بحد أقصى 32 GB) هو الخيار الأرخص. لنماذج 70B: Mac mini M5 Pro (1,699 دولارًا، بحد أقصى 64 GB، عرض نطاق 307 GB/s) هو أرخص جهاز Apple يستوعب 70B — يستخدم نفس شريحة MacBook Pro M5 Pro التي تشغّل 70B Q4 بسرعة 15–20 tok/s. للأحمال بسعة 128 GB فأكثر: Mac Studio M5 Max (2,499 دولارًا) أو M5 Ultra (5,499 دولارًا، حتى 512 GB) يوفّران قدرة أكبر. Mac mini M4 Pro (حتى 2,299 دولارًا، بحد أقصى 64 GB) أصبح الآن الجيل السابق — اشترِه فقط إذا وجدت خصمًا يجعله أرخص من سعر M5 Pro mini الجديد.
ما الأخطاء الشائعة التي يجب تجنبها عند اختيار نظام التشغيل؟
- افتراض أن macOS لا يمكنه تشغيل نماذج كبيرة. M4 Max يمكنه تشغيل 70B، لكن ببطء. للعمل الجاد، يقتصر macOS على نماذج 8B-13B.
- شراء حاسوب Windows خصيصًا لنماذج LLM دون النظر في Mac. إذا كان لديك Mac، استخدمه؛ تكلفة GPU تهيمن على القرار.
- الاعتقاد بأن Linux للخوادم فقط. Linux ممتاز للخوادم المنزلية/الحواسيب الصغيرة وله أقل تكلفة ملكية.
- نسيان هيمنة NVIDIA على السوق. CUDA هو المعيار؛ AMD وApple Metal منظومتان أصغر بدروس/مكتبات أقل.
- الاعتقاد بأن نظام التشغيل يؤثر على سرعة الاستدلال. macOS على Apple Silicon وWindows على RTX 4090 ينتجان سرعات مختلفة بسبب العتاد، لا بسبب نظام التشغيل.
⚠️تحذير: ⚠️ لا تحسّن أولًا لـ "أفضل نظام تشغيل". حسّن للعتاد الذي تملكه بالفعل. Mac مجاني يتفوق على حاسوب Windows بـ 500 دولار + GPU بـ 350 دولارًا.
قراءات ذات صلة
- LLM محلي على الحاسوب المحمول: أفضل النماذج والإعداد — كيفية تشغيل نماذج Llama على MacBook Air بلا GPU.
- GPU مقابل CPU مقابل Apple Silicon لنماذج LLM المحلية — متى تشتري GPU ومتى تستغني عنه.
- أفضل الحواسيب الصغيرة لنماذج LLM المحلية — خوادم Linux مدمجة للاستدلال 24/7.
- دليل العتاد لنماذج LLM المحلية 2026 — تحليل شامل لعتاد RTX وMac وLinux.
- كيفية تثبيت Ollama — دليل إعداد خطوة بخطوة للأنظمة الثلاثة.
- NVIDIA CUDA مقابل AMD ROCm: تعريفات GPU لنماذج LLM المحلية — أي تعريف GPU تختار.
اعتبارات إقليمية
دول الخليج (PDPL السعودي وقانون حماية البيانات الإماراتي): تدعم الأنظمة الثلاثة المعالجة المحلية للبيانات. macOS ممتثل افتراضيًا؛ Windows يتطلب مراجعة خصوصية تعريفات NVIDIA؛ Linux يوفّر شفافية كاملة. تدعم نماذج عربية سيادية مثل Jais وALLaM وFalcon المعالجة المحلية على الأنظمة الثلاثة.
السيادة الرقمية: تعالج أجهزة Mac بشريحة Apple Silicon البيانات الشخصية محليًا (دون الحاجة لمزامنة سحابية). يتطلب Windows وLinux موافقة صريحة من المستخدم قبل النسخ الاحتياطي السحابي.
التكاليف الإقليمية: تختلف تكاليف الكهرباء بشكل كبير. تؤثر التعريفات الخليجية المنخفضة على العائد طويل الأمد لـ GPU مقارنة بالأسواق ذات التعريفات الأعلى.
المصادر
- توثيق Ollama على GitHub — التوثيق الرسمي لـ Ollama (أبريل 2026)
- متطلبات نظام LM Studio — متطلبات العتاد ونظام التشغيل لـ LM Studio (أبريل 2026)
- توثيق NVIDIA CUDA Toolkit — الدليل الرسمي لإعداد CUDA لـ Windows وLinux
- يبقي العمل دون اتصال البيانات آمنة، لكن المدخلات غير الموثوقة قد تسبب مشاكل. تعرّف على مخاطر حقن الأوامر والدفاعات: حقن الأوامر والأمان يغطي أنماط الهجوم والتخفيف.
