Key Takeaways
- macOS (Apple Silicon): صفر تكلفة GPU، Ollama مجاني، يتعامل مع Llama 3.3 8B دون مشاكل. الأفضل للمستخدمين العرضيين أو غير التقنيين.
- Windows (GPU من NVIDIA): معيار الصناعة لتسريع GPU. منظومة CUDA ناضجة. GPU بسعر 150–1,600 دولار حسب حجم النموذج.
- Linux (GPU من NVIDIA أو AMD): عبء أقل (طاقة أقل بنسبة 10–20% من Windows)، الأفضل للخوادم 24/7. نفس تكلفة GPU في Windows.
- سرعة الاستدلال: تنتج الأنظمة الثلاثة نفس سرعة الإخراج مع نفس GPU. صعوبة إعداد البرمجيات تختلف.
- تعقيد الإعداد: macOS الأبسط (Ollama بنقرة واحدة)؛ Windows متوسط (يتطلب تعريفات NVIDIA)؛ Linux يتطلب إلمامًا بسطر الأوامر.
- التكلفة لكل استدلال: Linux < Windows = macOS (متساوية لـ GPU المُسرّع؛ macOS أرخص فقط لـ CPU).
- المنظومة: NVIDIA CUDA متاح على Windows/Linux (غير أصلي على Mac). AMD ROCm على Linux/Windows. Apple Metal على macOS فقط.
- الخيار الأفضل: Mac للحاسوب المحمول/الاستخدام العرضي؛ Windows للألعاب المكتبية + LLM؛ Linux للخوادم.
ما تكلفة العتاد حسب نظام التشغيل؟
macOS (الجيل Apple M5 — الشحن مارس 2026): MacBook Pro M5 Pro 64 GB (2,499–3,199 دولار) يشغّل 70B Q4 بسرعة 15–20 tok/s. MacBook Pro M5 Max 128 GB (3,499–4,999 دولار) يشغّل 70B Q8 بسرعة 25–35 tok/s. MacBook Air M5 32 GB (1,099–1,299 دولار) يتعامل مع 8B دون مشاكل. التكلفة الإضافية الإجمالية عند الترقية: 0 دولار إذا كان لديك Mac بالفعل؛ 1,099 دولارًا+ إذا اشتريت جديدًا.
Windows (GPU من NVIDIA مطلوب — أبريل 2026):** RTX 5060 Ti 16 GB جديدة (450–500 دولار) تشغّل 70B Q4 بسرعة 20–40 tok/s. RTX 5090 32 GB جديدة (2,000 دولار) تشغّل 70B بسرعة 40–50 tok/s (أول GPU استهلاكية فردية تشغّل 70B دون تقسيم). RTX 4070 مستعملة (350 دولارًا)، RTX 4090 (1,000–1,400 دولار) لا تزال متاحة. التكلفة الإضافية: 350–2,000 دولار.
Linux (GPU من NVIDIA أو AMD): خادم bare-metal (300–1,000 دولار) أو إعادة استخدام جهاز قديم + RTX 5060 Ti/5090 (450–2,000 دولار). نفس تكلفة GPU في Windows. التكلفة الإضافية: 150–2,600 دولار.
الجديد في أبريل 2026: RTX 5090 هي أول حل GPU استهلاكي فردي لنماذج 70B. يُتوقع Mac mini M5 Pro في منتصف 2026 (سيتعامل على الأرجح مع 70B بسرعة 15–20 tok/s).

💡Tip: 💡 نصيحة احترافية: M5 Max 128 GB مقابل RTX 5090: M5 Max أبطأ بنسبة 1.3–1.5× (25–35 مقابل 40–50 tok/s) لكنه يكلّف 400 دولار أقل، وله ذاكرة 4× أكثر، وصامت (بلا ضجيج مروحة GPU).
ما الإعداد والتعقيد؟
macOS: نزّل Ollama (دقيقة واحدة)، شغّل التطبيق، اختر Llama 3.3 8B (5 دقائق) = 6 دقائق إجمالًا، صفر أوامر طرفية. الأفضل للمستخدمين غير التقنيين.
Windows: ثبّت تعريفات NVIDIA (5–10 دقائق)، نزّل Ollama أو LM Studio (5 دقائق)، اختر النموذج (5 دقائق) = 15–20 دقيقة بواجهة رسومية (دون حاجة للطرفية).
Linux (Ubuntu): SSH، ثبّت CUDA/cuDNN (20–40 دقيقة)، ثبّت Ollama/vLLM (10 دقائق)، هيّئ systemd (10–20 دقيقة) = 40–70 دقيقة. يتطلب راحة مع الطرفية.
الصيانة طويلة الأمد: macOS (تحديثات تلقائية)، Windows (تحديثات تعريفات ربع سنوية)، Linux (ضبط النظام، مشاكل تبعيات عرضية).
إعداد macOS كتوصيل شاحن هاتف (كابل واحد، يعمل). Windows كتجميع أثاث مسطّح (التعليمات مهمة). Linux كبناء حاسوب من قطع (تحتاج لمعرفة ما تفعله).

🛠️Practice: 🛠️ ممارسة جيدة: لا تثبّت macOS Sequoia يوم الإطلاق؛ انتظر أسبوعين لإصلاحات تعريفات Metal. ينكسر دعم GPU أحيانًا في الإصدارات الفرعية.
كيف تُقارَن سرعات الاستدلال؟
macOS (الجيل Apple M5 — الشحن مارس 2026): M5 Pro (64 GB) يشغّل Llama 3.3 70B Q4 بسرعة 15–20 tok/s. M5 Max (128 GB، عرض نطاق 614 GB/s) يشغّل 70B Q8 بسرعة 25–35 tok/s — تحسّن 4× مقابل M4 Max (الذي كان غير عملي لـ 70B).
Windows + RTX 5090 (32 GB، أبريل 2026): Llama 3.3 70B = 40–50 tok/s، 8B = 180+ tok/s. RTX 5090 هي أول GPU استهلاكية تتعامل مع 70B دون تكميم أقل من Q4 أو استخدام تقسيم النموذج.
Windows + RTX 5060 Ti (16 GB، أبريل 2026): Llama 3.3 70B لا يتسع (يحتاج 24 GB كحد أدنى). نماذج 13B–24B بسرعة 20–40 tok/s. جيدة للمستخدمين المكافئين لـ RTX 4070 بميزانية ضيقة.
Linux + RTX 5090 أو RTX 5060 Ti: أسرع بنسبة 1–5% من Windows بسبب عبء أقل لنظام التشغيل. RTX 5090 على Linux تبلغ 42–53 tok/s لنموذج 70B.
التوازن بين M5 Max وRTX 5090: RTX 5090 أسرع بنسبة 1.3–1.5× لكنها تكلّف 500 دولار أكثر، وتتطلب جهازًا مكتبيًا، وتستهلك 450 واط. M5 Max صامت وجاهز للاستخدام وله ذاكرة 4× (128 GB مقابل 32 GB).
عتاد GPU يحدّد سرعة الاستدلال (RTX 5090 بسرعة 40–50 tok/s مقابل M5 Max بسرعة 25–35 tok/s)، وليس نظام التشغيل.
🔍Insight: 🔍 نقلة M5 النوعية: تقدّم بنية Fusion من Apple (شريحتان 3nm متصلتان) سرعة معالجة prompts LLM 4× مقابل M4، ما يقلّص بشكل ملحوظ فجوة السرعة مع RTX 5090.
⚠️Warning: ⚠️ تحذير: AMD ROCm على Windows غير ناضج. اختر Linux لـ GPU من AMD؛ الدعم على Windows متأخر 3–6 أشهر.
ما الأدوات وأطر العمل المدعومة حسب نظام التشغيل؟
Ollama (محرك الاستدلال): macOS ✓، Windows ✓، Linux ✓. وظائف متطابقة على الثلاثة.
LM Studio (واجهة رسومية): macOS ✓، Windows ✓. Linux عبر Docker فقط (بلا واجهة رسومية أصلية).
vLLM (خادم API): macOS (محدود، Apple Metal فقط)، Windows ✓ (CUDA)، Linux ✓ (CUDA/ROCm). الأفضل على Linux.
NVIDIA CUDA toolkit: Windows ✓، Linux ✓. macOS ✗ (غير مدعوم اعتبارًا من أبريل 2026، Apple Metal فقط).
PyTorch (إطار عمل التعلم العميق): macOS ✓ (خلفية Apple Metal، أبطأ)، Windows ✓ (CUDA)، Linux ✓ (CUDA/ROCm). الأسرع على Linux/Windows مع NVIDIA.
دعم الضبط الدقيق: macOS (بطيء بـ CPU فقط أو عبر السحابة)؛ Windows ✓ (مُسرّع بـ CUDA)؛ Linux ✓✓ (أفضل دعم).
📌Note: 📌 نقطة رئيسية: CUDA يعمل أصليًا على Windows/Linux فقط. على مستخدمي macOS استخدام واجهة Apple Metal، وهي أحدث ولها مكتبات أقل.
ما التكلفة الإجمالية للملكية على مدى 3 سنوات؟
| التهيئة | السنة 1 | السنة 2–3 | إجمالي 3 سنوات |
|---|---|---|---|
| MacBook Air M5 (32 GB، موجود) | 0 دولار | 20 دولارًا | 20 دولارًا |
| MacBook Pro M5 Pro 64 GB | 2,499 دولارًا | 30 دولارًا | 2,529 دولارًا |
| MacBook Pro M5 Max 128 GB | 3,499 دولارًا | 30 دولارًا | 3,529 دولارًا |
| Mac mini M4 Pro 64 GB (متاح حاليًا) | 2,299 دولارًا | 20 دولارًا | 2,319 دولارًا |
| Windows + RTX 5060 Ti 16 GB | 1,650 دولارًا | 80 دولارًا | 1,730 دولارًا |
| Windows + RTX 5090 32 GB | 2,500 دولار | 120 دولارًا | 2,620 دولارًا |
| Linux + RTX 5060 Ti 16 GB | 750 دولارًا | 60 دولارًا | 810 دولارات |
| Linux + RTX 5090 32 GB | 1,400 دولار | 100 دولار | 1,500 دولار |
الأسئلة الشائعة
هل يمكنني تشغيل Llama 3.3 70B على macOS؟
نعم — MacBook Pro M5 Pro (64 GB) يشغّل 70B Q4 بسرعة 15–20 tok/s. M5 Max (128 GB) يشغّل 70B Q8 بسرعة 25–35 tok/s. Mac mini M4 Pro (64 GB، متاح حاليًا) يشغّل 70B بسرعة 10–15 tok/s. التهيئات الأصغر (32 GB أو أقل) لا تتسع لـ 70B.
هل يمكنني استخدام GPU من AMD بدلًا من NVIDIA؟
Windows: محدود (دعم ROCm يتحسّن لكنه متأخر 3–6 أشهر عن CUDA). Linux: دعم ROCm ممتاز لسلسلة RX 7000. AMD أبطأ بنسبة 10–20% من NVIDIA المكافئ لاستدلال LLM اعتبارًا من أبريل 2026. لـ AMD على Linux: اضبط HSA_OVERRIDE_GFX_VERSION قبل بدء Ollama.
هل Linux أصعب في الإعداد للمبتدئين؟
نعم. macOS: Ollama.app يُثبَّت في 6 دقائق، بلا طرفية. Windows: 15–20 دقيقة مع تثبيت تعريفات NVIDIA. Linux: 40–70 دقيقة، يتطلب الطرفية (apt، pip، systemctl). إذا لم تكن مرتاحًا مع سطر الأوامر: ابدأ بـ macOS أو Windows.
هل يمكنني تغيير نظام التشغيل في منتصف مشروع؟
نعم. النماذج قابلة للنقل — ملفات GGUF تعمل على جميع الأنظمة. محوّلات الضبط الدقيق (LoRA) قابلة للنقل أيضًا. قد تحتاج شيفرة إطار العمل لتحديثات مسارات صغيرة. تختلف مواقع تخزين نماذج Ollama حسب النظام لكن أوزان النموذج متطابقة.
هل يستهلك macOS كهرباء أقل؟
Apple Silicon M5 Max تحت استدلال LLM متواصل يستهلك ~30–40 واط. RTX 5090 تحت الحمل تستهلك ~450 واط. على 3 سنوات بمعدل 4 ساعات/يوم من الاستخدام النشط: M5 Max ~15 دولارًا كهرباء مقابل RTX 5090 ~180 دولارًا. macOS يفوز في تكلفة الكهرباء، Linux/Windows يفوزان في سرعة الاستدلال.
أي نظام تشغيل أفضل للضبط الدقيق للنماذج؟
Linux > Windows > macOS. Linux لديه أفضل دعم لـ CUDA وDeepSpeed. macOS M5 يمكنه ضبط 7B دقيقًا عبر MLX (إطار ML من Apple) في ~ساعتين — عملي لمجموعات بيانات صغيرة. للضبط الدقيق في الإنتاج: Linux مع RTX 4090 أو أفضل.
هل MacBook Pro M5 Max أفضل من RTX 5090 لنماذج 70B؟
RTX 5090 أسرع بنسبة 1.3–1.5× (40–50 tok/s مقابل 25–35 tok/s). لكن M5 Max لديه ذاكرة 4× أكثر (128 GB مقابل 32 GB) — ما يتيح 70B بـ Q8 (جودة أعلى) بينما RTX 5090 محدود بـ Q4. M5 Max صامت وجاهز للاستخدام. RTX 5090 تتطلب بناء جهاز مكتبي وتبريدًا. اختر M5 Max للجودة + الراحة. اختر RTX 5090 للسرعة الخام.
هل أنتظر Mac mini M5 أم أشتري Mac mini M4 Pro الآن؟
يُتوقع Mac mini M5 Pro في منتصف 2026 (ربما WWDC في يونيو، وربما يتأخر إلى أكتوبر بسبب نقص عالمي في RAM). إذا احتجت جهاز 70B الآن، Mac mini M4 Pro 64 GB (2,299 دولارًا) يشغّل 70B بسرعة 10–15 tok/s. M5 Pro mini سيبلغ على الأرجح 15–20 tok/s — تحسّن بنسبة 50%. إذا أمكنك الانتظار 3–6 أشهر، انتظر.
ما الأخطاء الشائعة التي يجب تجنبها عند اختيار نظام التشغيل؟
- افتراض أن macOS لا يمكنه تشغيل نماذج كبيرة. M4 Max يمكنه تشغيل 70B، لكن ببطء. للعمل الجاد، يقتصر macOS على نماذج 8B-13B.
- شراء حاسوب Windows خصيصًا لنماذج LLM دون النظر في Mac. إذا كان لديك Mac، استخدمه؛ تكلفة GPU تهيمن على القرار.
- الاعتقاد بأن Linux للخوادم فقط. Linux ممتاز للخوادم المنزلية/الحواسيب الصغيرة وله أقل تكلفة ملكية.
- نسيان هيمنة NVIDIA على السوق. CUDA هو المعيار؛ AMD وApple Metal منظومتان أصغر بدروس/مكتبات أقل.
- الاعتقاد بأن نظام التشغيل يؤثر على سرعة الاستدلال. macOS على Apple Silicon وWindows على RTX 4090 ينتجان سرعات مختلفة بسبب العتاد، لا بسبب نظام التشغيل.
⚠️Warning: ⚠️ لا تحسّن أولًا لـ "أفضل نظام تشغيل". حسّن للعتاد الذي تملكه بالفعل. Mac مجاني يتفوق على حاسوب Windows بـ 500 دولار + GPU بـ 350 دولارًا.
قراءات ذات صلة
- LLM محلي على الحاسوب المحمول: أفضل النماذج والإعداد — كيفية تشغيل نماذج Llama على MacBook Air بلا GPU.
- GPU مقابل CPU مقابل Apple Silicon لنماذج LLM المحلية — متى تشتري GPU ومتى تستغني عنه.
- أفضل الحواسيب الصغيرة لنماذج LLM المحلية — خوادم Linux مدمجة للاستدلال 24/7.
- دليل العتاد لنماذج LLM المحلية 2026 — تحليل شامل لعتاد RTX وMac وLinux.
- كيفية تثبيت Ollama — دليل إعداد خطوة بخطوة للأنظمة الثلاثة.
- NVIDIA CUDA مقابل AMD ROCm: تعريفات GPU لنماذج LLM المحلية — أي تعريف GPU تختار.
اعتبارات إقليمية
دول الخليج (PDPL السعودي وقانون حماية البيانات الإماراتي): تدعم الأنظمة الثلاثة المعالجة المحلية للبيانات. macOS ممتثل افتراضيًا؛ Windows يتطلب مراجعة خصوصية تعريفات NVIDIA؛ Linux يوفّر شفافية كاملة. تدعم نماذج عربية سيادية مثل Jais وALLaM وFalcon المعالجة المحلية على الأنظمة الثلاثة.
السيادة الرقمية: تعالج أجهزة Mac بشريحة Apple Silicon البيانات الشخصية محليًا (دون الحاجة لمزامنة سحابية). يتطلب Windows وLinux موافقة صريحة من المستخدم قبل النسخ الاحتياطي السحابي.
التكاليف الإقليمية: تختلف تكاليف الكهرباء بشكل كبير. تؤثر التعريفات الخليجية المنخفضة على العائد طويل الأمد لـ GPU مقارنة بالأسواق ذات التعريفات الأعلى.
المصادر
- توثيق Ollama على GitHub — التوثيق الرسمي لـ Ollama (أبريل 2026)
- متطلبات نظام LM Studio — متطلبات العتاد ونظام التشغيل لـ LM Studio (أبريل 2026)
- توثيق NVIDIA CUDA Toolkit — الدليل الرسمي لإعداد CUDA لـ Windows وLinux
- يبقي العمل دون اتصال البيانات آمنة، لكن المدخلات غير الموثوقة قد تسبب مشاكل. تعرّف على مخاطر حقن الأوامر والدفاعات: حقن الأوامر والأمان يغطي أنماط الهجوم والتخفيف.
