Key Takeaways
- تكميم Q4_K_M: يتطلب Llama 3.3 70B نحو 40 GB من الذاكرة؛ ويتطلب Qwen3 72B نحو 43 GB من الذاكرة.
- أرخص عتاد جديد: Apple Mac mini M5 Pro (64 GB، 1,699 دولار، متوفر في 22 سبتمبر 2026) هو أرخص خيار جديد بـ GPU كاملة لـ 70B. أما Mac mini M6 الأساسي (899 دولار) فيصل فقط إلى 32 GB ولا يمكنه تشغيل نموذج 70B.
- أبسط عتاد للمستهلك: Apple Mac Studio M2 Ultra (64 GB موحدة) أو MacBook Pro M5 Max (64 GB) -- تسريع كامل عبر GPU، دون الحاجة إلى layer offloading.
- خيار NVIDIA: RTX 4090 (24 GB VRAM) + 32 GB من ذاكرة النظام مع layer offloading في Ollama يعمل مع معظم نماذج 70B، رغم أن 20-30% من الطبقات تُشغَّل على المعالج.
- 70B على المعالج فقط: ممكن مع 64 GB من الذاكرة لكنه ينتج 1-3 token/ثانية -- قابل للاستخدام بالكاد للمهام الدُفعية، لا للمحادثة التفاعلية.
- في أغسطس 2026، لا يزال نموذج 70B محلي يضاهي جودة GPT-4 (2023) وهو المسار الوحيد الميسور للمستهلك نحو هذا المستوى من الجودة دون تكاليف سحابية.
يتطلب تشغيل نموذج بـ 70B معامل محلياً 40-48 GB من الذاكرة مع تكميم Q4_K_M، وهو أمر ممكن على أجهزة Mac بمعالج Apple Silicon مع 64 GB من الذاكرة الموحدة، أو محطات عمل بذاكرة 64 GB DDR5، أو GPU من NVIDIA بسعة 24 GB مع 32 GB من ذاكرة النظام باستخدام layer offloading.
نموذج 70B هو من أكبر الأحجام التي يمكنك تشغيلها فعلياً في المنزل، ويحتاج إلى ذاكرة كبيرة -- نحو 40-48 GB. أسهل طريقة هي استخدام جهاز Mac بذاكرة موحدة كافية، لأنه يشارك الذاكرة بين المعالج وGPU. على حاسوب شخصي، ستحتاج عادةً إلى بطاقة رسومات كبيرة بالإضافة إلى ذاكرة نظام إضافية لتفريغ الأجزاء التي لا تتسع على البطاقة.
ما العتاد القادر فعليًا على تشغيل LLM محلي بـ 70B؟
يتطلب نموذج 70B بتكميم Q4_K_M نحو 40-43 GB من الذاكرة المتاحة لمحرك الاستدلال. يمكن أن تأتي هذه من VRAM الخاصة بكرت الرسوميات، أو الذاكرة الموحدة للنظام (Apple Silicon)، أو ذاكرة النظام، أو مزيج عبر layer offloading.
العتاد | هل يشغّل 70B؟ | السرعة (70B Q4) | ملاحظات |
|---|---|---|---|
| Apple M5 Max MacBook Pro (64 GB) | نعم -- GPU كاملة | 20-30 token/ثانية | أفضل خيار لابتوب للمستهلك |
| Apple Mac Studio M5 Max (64 GB) | نعم -- GPU كاملة | 22-32 token/ثانية | جديد أغسطس 2026، 2,499 دولار |
| Apple Mac mini M5 Pro (64 GB) | نعم -- GPU كاملة | لا توجد اختبارات بعد | جديد، متوفر 22 سبتمبر 2026، 1,699 دولار -- أرخص خيار جديد |
| Apple Mac mini M6 (32 GB كحد أقصى) | لا -- 32 GB كحد أقصى | غير متاح | جديد، متوفر 22 سبتمبر 2026، 899 دولار -- ذاكرة غير كافية لـ 70B |
| Apple M2 Ultra (64 GB موحدة) | نعم -- GPU كاملة | 25-35 token/ثانية | التهيئة الأساسية لـ Mac Studio، مستعمل/مُجدَّد |
| Apple Mac Studio M5 Ultra (256GB+) | نعم -- GPU كاملة | 35-50 token/ثانية | جديد أغسطس 2026، من 5,499 دولار. يشغّل Q8_0/FP16 بهامش. |
| NVIDIA DGX Spark (128 GB موحدة) | نعم -- GPU كاملة | 18-28 token/ثانية | يتسع Q8_0 (70 GB). مثالي لتدفقات CUDA. |
| NVIDIA RTX 4090 (24 GB) + 32 GB RAM | نعم -- مع offloading | 10-18 token/ثانية | نحو 60% طبقات على GPU، نحو 40% على المعالج |
| NVIDIA RTX 4080 (16 GB) + 32 GB RAM | offloading جزئي فقط | 5-10 token/ثانية | نحو 35% فقط من الطبقات على GPU |
| 64 GB RAM، المعالج فقط | نعم -- المعالج فقط | 1-3 token/ثانية | غير عملي للاستخدام التفاعلي |

كم تحتاج ذاكرة لنموذج 70B في كل مستوى تكميم؟
التكميم | الذاكرة المطلوبة | الجودة | عملي؟ |
|---|---|---|---|
| FP16 (دقة كاملة) | نحو 140 GB | جودة مرجعية | لا -- خوادم فقط |
| Q8_0 | نحو 70 GB | بلا فقدان تقريبًا | Mac Ultra 192 GB فقط |
| Q5_K_M | نحو 50 GB | فقدان ضئيل | Mac Ultra 64 GB، بهامش ضيق |
| Q4_K_M | نحو 40-43 GB | فقدان منخفض -- موصى به | نعم -- الخيار الأكثر جدوى |
| Q3_K_S | نحو 30 GB | فقدان معتدل | نعم -- ممكن على أجهزة 32 GB |
| Q2_K | نحو 22 GB | فقدان مرتفع | غير موصى به |

لماذا يُعد Apple Silicon أفضل خيار للمستهلك لنماذج 70B؟
يستخدم Apple Silicon ذاكرة موحدة -- يتشارك المعالج وكرت الرسوميات المجموعة نفسها من الذاكرة الفيزيائية. يمكن لـ MacBook Pro M5 Max بذاكرة موحدة 64 GB تشغيل نموذج 70B بتكميم Q4_K_M بالكامل على GPU، محققًا 20-30 token/ثانية دون عبء layer offloading.
في عتاد NVIDIA، يكون كرت الرسوميات وذاكرة النظام منفصلين. لا يمكن لـ GPU بسعة 24 GB من VRAM استضافة سوى نحو 60% من نموذج 70B بتكميم Q4_K_M؛ وتُشغَّل الطبقات المتبقية على المعالج، مما يخلق عنق زجاجة في عرض نطاق الذاكرة يخفض السرعة إلى 10-18 token/ثانية.
في أغسطس 2026، لا يزال Mac Studio M2 Ultra مستعمل (64 GB، نحو 2,000 دولار مُجدَّد) المسار المستعمل الأكثر اقتصادًا نحو استدلال 70B محلي بسرعة قابلة للاستخدام. أطلقت Apple تشكيلة Mac Studio جديدة بمعالجات M5 Max وM5 Ultra في أغسطس 2026: يُعد Mac Studio M5 Max الجديد (64 GB، 2,499 دولار) خيارًا جديدًا بـ GPU كاملة، بينما يُضاعف Mac Studio M5 Ultra (256 GB أو 512 GB، من 5,499 دولار) عرض نطاق الذاكرة الموحدة إلى 1.2 تيرابايت/ثانية، مشغّلًا نماذج 70B بتكميم Q8_0 أو FP16 دون أي تنازل في الجودة.
جدّدت Apple تشكيلة Mac mini في 25 أغسطس 2026، مع توفّرها في 22 سبتمبر 2026، وهذا يغيّر مرة أخرى أرخص خيار جديد. يصل Mac mini M5 Pro (يبدأ من 1,699 دولار) إلى 64 GB من الذاكرة الموحدة بعرض نطاق 307 GB/ثانية وThunderbolt 5 -- ما يكفي لتشغيل نموذج 70B بتكميم Q4_K_M بالكامل على GPU، وبفارق 800 دولار أرخص من Mac Studio M5 Max. أما Mac mini M6 الأساسي (يبدأ من 899 دولار) فهو جهاز مختلف: يصل فقط إلى 32 GB من الذاكرة الموحدة وعرض نطاق 170 GB/ثانية، أقل بكثير من 40 GB أو أكثر التي يحتاجها نموذج 70B، لذا لا يمكنه تشغيل نموذج 70B عند أي مستوى تكميم. لا توجد اختبارات مرجعية مستقلة بعد لأي من المعالجين -- كلاهما متوفر في 22 سبتمبر 2026.
NVIDIA DGX Spark: 128 GB من الذاكرة الموحدة لنماذج 70B
NVIDIA DGX Spark (4,699 دولار) هو حاسوب مكتبي مدمج للذكاء الاصطناعي صدر في أكتوبر 2025، مبني على GB10 Grace Blackwell Superchip بذاكرة موحدة 128 GB من نوع LPDDR5x. تعني بنية الذاكرة الموحدة أن GPU والمعالج يتشاركان مجموعة 128 GB نفسها -- بشكل مماثل لـ Apple Silicon لكن مع تسريع CUDA.
بذاكرة موحدة 128 GB، يشغّل DGX Spark كلًا من Llama 3.3 70B وQwen3 72B بتكميم Q8_0 (70 GB -- جودة بلا فقدان تقريبًا). وتبلغ سرعة الاستدلال لـ 70B بتكميم Q8_0 نحو 18-28 token/ثانية.
رفعت NVIDIA سعر إصدار DGX Spark Founders Edition من 3,999 دولار إلى 4,699 دولار في فبراير 2026، مشيرةً إلى قيود في إمدادات الذاكرة -- وهي نفس أزمة نقص DRAM التي رفعت أيضًا أسعار كروت RTX من سلسلة 50 إلى ما فوق السعر المعلن بكثير.
المواصفة | القيمة |
|---|---|
| الذاكرة | 128 GB موحدة LPDDR5x |
| 70B بتكميم Q8_0 | نعم -- جودة بلا فقدان تقريبًا |
| سرعة استدلال 70B | 18-28 token/ثانية |
| أقصى حجم للنموذج | نحو 200B معامل بـ FP4 |
| السعر | 4,699 دولار (NVIDIA مباشرة / Amazon) |
| أمر Ollama | ollama run llama3.3:70b |
كيف يعمل GPU من NVIDIA + layer offloading لنماذج 70B؟
يتيح Ollama وllama.cpp تقسيم نموذج بين VRAM الخاصة بكرت الرسوميات وذاكرة النظام. تُشغَّل الطبقات المحمَّلة في VRAM بسرعة GPU؛ بينما تُشغَّل الطبقات في ذاكرة النظام بسرعة المعالج:
# Ollama automatically offloads as many layers as fit in VRAM
# To explicitly control layers:
ollama run llama3.3:70b
# Check how many layers are on GPU:
ollama ps
# Output shows: llama3.3:70b ... 23/80 GPU layers
# For llama.cpp directly:
./llama-cli -m llama-3.3-70b-q4_k_m.gguf \
-ngl 40 # number of layers to offload to GPU
--ctx-size 4096هل الاستدلال بـ 70B على المعالج فقط عملي؟
نموذج 70B بتكميم Q4_K_M على معالج بعدد أنوية عالٍ (AMD Threadripper، Intel Xeon) مع 64 GB من الذاكرة ينتج 1-3 token/ثانية. عند 2 token/ثانية، تستغرق إجابة من 200 كلمة نحو 75 ثانية.
هذا غير عملي للمحادثة التفاعلية، لكنه قابل للاستخدام للمعالجة الدُفعية -- تلخيص المستندات أو توليد التقارير أو معالجة الملفات أثناء الليل. للاستخدام التفاعلي، أدنى عتاد عملي هو جهاز قادر على بلوغ 8 token/ثانية أو أكثر، وهو ما يتطلب Apple Silicon أو layer offloading مع GPU من NVIDIA.
أي نموذج 70B يجب أن تشغّله محليًا؟
النموذج | MMLU | HumanEval | الأنسب لـ |
|---|---|---|---|
| Llama 3.3 70B | 82% | 88% | المهام العامة بالإنجليزية، اتباع التعليمات |
| Qwen3 72B | 84% | 87% | البرمجة، متعدد اللغات (29 لغة) |
| Mistral Large 123B | 84% | 80% | يتطلب 80 GB أو أكثر -- محطات عمل فقط |
تشغيل نماذج 70B محليًا: السياق الإقليمي
الاتحاد الأوروبي / GDPR: يمثّل نموذج 70B محلي الحد العملي لجودة الذكاء الاصطناعي القابلة للتشغيل بخصوصية. للشركات الأوروبية التي تعالج بيانات حساسة -- مستندات قانونية، سجلات طبية، تحليلات مالية -- يقدّم نموذج 70B محلي جودة GPT-4 لعام 2023 مع امتثال كامل لـ GDPR. لا يغادر أي مُدخل أو سياق أو مُخرج بنية المؤسسة التحتية.
لامتثال BSI الألماني وCNIL الفرنسية: كل من Mac Studio M2 Ultra (Apple، الولايات المتحدة) وNVIDIA DGX Spark (NVIDIA، الولايات المتحدة) من مزوّدين غير أوروبيين. للمؤسسات التي تتطلب عتادًا بسلسلة توريد أوروبية، ينتج شركاء OEM التابعون لـ NVIDIA (Dell، HP، Lenovo) أنظمة متوافقة مع DGX Spark وGB10 مع دعم في الاتحاد الأوروبي.
اختيار النماذج للامتثال في الاتحاد الأوروبي: Mistral Large 123B (Mistral AI، فرنسا، Apache 2.0) هو النموذج الوحيد من فئة 70B وأكبر المطوَّر من قبل شركة أوروبية. يتطلب أكثر من 80 GB من الذاكرة (محطات عمل فقط)، لكنه يقدّم أقوى سردية من حيث الملكية الفكرية والامتثال في الاتحاد الأوروبي.
اليابان (METI): للشركات اليابانية، يُعد Qwen3 72B نموذج 70B الموصى به -- إذ إن ترميزه الأصلي للغة اليابانية أكثر كفاءة بنسبة 30-40% من Llama للنص الياباني. على Mac Studio M2 Ultra (64 GB): `ollama run qwen2.5:72b`. تتطلب حوكمة الذكاء الاصطناعي لدى METI توثيق إصدارات العتاد والنموذج. يوفّر مُخرج `ollama ps` التعريف الدقيق للنموذج لسجلات الامتثال.
الصين: يلبّي Qwen3 72B (Alibaba) المُشغَّل محليًا توطين البيانات بموجب قانون أمن البيانات الصيني (数据安全法) مع تقديم 84% من جودة MMLU. تنشر فرق المؤسسات عادةً على خوادم بكرتي رسوميات (2× RTX 4090، 48 GB من VRAM مجتمعة). لامتثال CAC: نموذج Qwen3 72B مُستضاف محليًا يخدم مستخدمين داخليين يقع خارج تعريف المزوّد لدى CAC -- إذ لا يُقدَّم كخدمة عامة.
ما الأخطاء الشائعة عند تشغيل نماذج 70B على عتاد المستهلك؟
شراء GPU بأقل من 24 GB من VRAM مع توقع أداء 70B كامل
لا يمكن لـ RTX 4070 Ti (12 GB من VRAM) استضافة سوى نحو 30% من نموذج 70B بتكميم Q4_K_M في VRAM. وتُشغَّل النسبة المتبقية 70% على المعالج، مما ينتج 3-5 token/ثانية -- بالكاد أسرع من الاستدلال على المعالج فقط. لنماذج 70B، يُعد 24 GB من VRAM (RTX 4090) الحد الأدنى العملي لتسريع GPU مفيد. دون ذلك، فكّر في تشغيل نموذج 34B بدلًا منه.
عدم استخدام layer offloading في Ollama
افتراضيًا، إذا لم يتسع نموذج 70B بالكامل في VRAM، يلجأ Ollama إلى الاستدلال على المعالج فقط. عيّن طبقات GPU صراحةً بـ `OLLAMA_GPU_LAYERS=999` -- وسيقوم Ollama بعمل offloading لأكبر عدد من الطبقات يتسع في VRAM ويشغّل الباقي على المعالج، وهو أسرع كثيرًا من الاستدلال على المعالج فقط.
استخدام Q4_K_M بينما يناسب Q3_K_S العتاد المتاح بشكل أفضل
على الأجهزة بذاكرة 32-40 GB، قد يكون Q4_K_M لنموذج 70B ضيقًا جدًا (تاركًا هامشًا غير كافٍ لنظام التشغيل). يخفض Q3_K_S الذاكرة إلى نحو 30 GB مع فقدان جودة معتدل. شغّل `ollama ps` بعد تحميل النموذج -- إذا رأيت استخدام swap، انزل إلى Q3_K_S.
توقع سرعة Apple Silicon نفسها مع تهيئة NVIDIA بـ offloading
يخلق layer offloading على NVIDIA عنق زجاجة في عرض نطاق الذاكرة بين VRAM وذاكرة النظام. تنتج RTX 4090 مع offloading من 10 إلى 18 token/ثانية مقابل 20-30 token/ثانية على M5 Max. للسرعة المكافئة، يُعد Apple Silicon أفضل خيار للمستهلك. أما لتدفقات عمل CUDA (الضبط الدقيق، الأنوية المخصصة)، فإن NVIDIA ضرورية.
تشغيل Q4_K_M على DGX Spark بدلًا من Q8_0
يملك DGX Spark 128 GB -- كافية لـ Q8_0 (70 GB). يهدر استخدام Q4_K_M الجودة المتاحة. على أي جهاز بأكثر من 80 GB، شغّل Q8_0 لنماذج 70B.
شراء Mac mini M6 الأساسي مع توقع تشغيل نموذج 70B
يصل Mac mini M6 (899 دولار) فقط إلى 32 GB من الذاكرة الموحدة -- أقل بكثير من 40 GB أو أكثر التي يحتاجها نموذج 70B بتكميم Q4_K_M. لا يمكنه تشغيل نموذج 70B عند أي مستوى تكميم. لتشغيل 70B على Mac mini، الفئة المطلوبة هي Mac mini M5 Pro (1,699 دولار، 64 GB من الذاكرة الموحدة) -- تأكّد من "M5 Pro" و64 GB قبل الطلب، وليس M6 الأساسي.
الأسئلة الشائعة حول تشغيل نماذج 70B على عتاد المستهلك
ما أرخص عتاد قادر على تشغيل نموذج 70B بشكل قابل للاستخدام؟
يُتوقّع أن يصبح Mac mini M5 Pro (1,699 دولار، 64 GB من الذاكرة الموحدة، متوفر في 22 سبتمبر 2026) أرخص عتاد جديد قادر على تشغيل نموذج 70B، بفارق 800 دولار أقل من الخيار الجديد الأرخص سابقًا، Mac Studio M5 Max (64 GB، 2,499 دولار). ويبقى Mac Studio M2 Ultra مستعمل (64 GB من الذاكرة الموحدة) بنحو 2,000 دولار المسار المستعمل الأكثر اقتصادًا بأداء مثبت 25 token/ثانية أو أكثر. لا توجد اختبارات مرجعية مستقلة بعد لـ Mac mini M5 Pro. أما حاسوب مكتبي بـ NVIDIA RTX 4090 (24 GB VRAM + 32 GB RAM) فيكلف نحو 3,000-4,000 دولار إجمالًا، لكنه ينتج استدلالًا أبطأ بسبب layer offloading. لا تخلط بين Mac mini M5 Pro وMac mini M6 الأساسي (899 دولار) -- إذ يصل M6 فقط إلى 32 GB من الذاكرة الموحدة ولا يمكنه تشغيل نموذج 70B.
هل يمكن لـ Mac mini M6 تشغيل نموذج 70B؟
لا. يصل Mac mini M6 (يبدأ من 899 دولار) فقط إلى 32 GB من الذاكرة الموحدة وعرض نطاق 170 GB/ثانية -- أقل بكثير من 40 GB أو أكثر التي يتطلبها نموذج 70B بتكميم Q4_K_M. لتشغيل 70B على Mac mini، اطلب Mac mini M5 Pro (يبدأ من 1,699 دولار، 64 GB من الذاكرة الموحدة، عرض نطاق 307 GB/ثانية، Thunderbolt 5) بدلًا من ذلك. كلاهما متوفر في 22 سبتمبر 2026، ولا توجد اختبارات مرجعية مستقلة بعد لأي من المعالجين.
هل يمكنني تشغيل نموذج 70B على كرتي رسوميات؟
نعم -- يدعم llama.cpp وOllama الاستدلال متعدد كروت الرسوميات على عتاد NVIDIA. يتسع كرتا RTX 4090 (48 GB من VRAM إجمالًا) لنموذج 70B بتكميم Q4_K_M بالكامل في VRAM. يدير Ollama تعدد كروت الرسوميات تلقائيًا عند وجود عدة كروت. ويتحكم توازي الموترات في llama.cpp (`--tensor-split`) في كيفية توزيع الطبقات.
كيف تُقارن جودة 70B المحلي بـ GPT-5.5؟
في اختبارات MMLU وHumanEval، يضاهي Llama 3.3 70B (82%، 88%) وQwen3 72B (84%، 87%) درجات GPT-4 (2023) أو يتفوق عليها قليلًا. يسجّل GPT-5.5 (2024) أعلى في المهام كثيفة الاستدلال. أما لاتباع التعليمات العام والتلخيص وتوليد الكود، فإن نماذج 70B المحلية تنافس GPT-5.5 في معظم المهام.
هل يدعم Ollama التشغيل التلقائي لنماذج 70B؟
نعم. تشغيل `ollama run llama3.3:70b` يُنزّل النموذج ويشغّله مع layer offloading تلقائي لـ GPU. يكتشف Ollama VRAM المتاحة وذاكرة النظام، ويقوم بعمل offloading لأكبر عدد ممكن من الطبقات إلى GPU ويشغّل الباقي على المعالج. لا حاجة لتهيئة يدوية للاستخدام الأساسي.
كم كهرباء يستهلك تشغيل نموذج 70B؟
يستهلك Mac Studio M2 Ultra أثناء تشغيل استدلال 70B نحو 30-50 واط. ويستهلك حاسوب مكتبي بـ NVIDIA RTX 4090 تحت الحمل 350-450 واط. بسعر 0.15 دولار لكل kWh، يكلف الاستدلال المستمر بـ 70B على RTX 4090 نحو 0.05-0.07 دولار في الساعة. ويُعد Apple Silicon أكثر كفاءة في الطاقة بـ 7-10 أضعاف لهذا الحمل.
هل تستحق نماذج 70B العناء مقارنة بنماذج 13B للمهام اليومية؟
للاستدلال المعقّد وتحليل المستندات الطويلة والكتابة الدقيقة، نعم -- الفارق في الجودة ملحوظ. أما للتلخيص البسيط والأسئلة والأجوبة والتصنيف، فينتج نموذج 13B أو حتى 7B مُخرجًا متطابقًا عمليًا. شغّل كليهما على حالة استخدامك المحددة عبر PromptQuorum لقياس الفارق في الجودة قبل الاستثمار في عتاد لـ 70B.
ما هو NVIDIA DGX Spark وهل يستحق العناء للاستدلال بـ 70B؟
DGX Spark (4,699 دولار) هو حاسوب الذكاء الاصطناعي المكتبي المدمج من NVIDIA بذاكرة موحدة 128 GB. يشغّل نماذج 70B بتكميم Q8_0 (جودة بلا فقدان تقريبًا) دون قيود تكميم. السرعة: 18-28 token/ثانية. مقارنةً بـ Mac Studio M2 Ultra (نحو 2,000 دولار مُجدَّد، 64 GB): يكلف DGX Spark نحو 2,700 دولار إضافية مقابل استدلال أعلى جودة ودعم CUDA. للاستدلال بـ 70B الخالص، يُعد Mac Studio أكثر اقتصادًا. أما لتدفقات عمل CUDA (الضبط الدقيق، الأنوية المخصصة)، فإن DGX Spark أفضل.
هل يمكنني ضبط نموذج 70B دقيقًا على عتاد المستهلك؟
يتطلب الضبط الدقيق الكامل نحو 3 أضعاف ذاكرة الاستدلال لضبط LoRA (نحو 120-130 GB من VRAM). يتجاوز هذا كل عتاد المستهلك باستثناء DGX Spark (128 GB -- ممكن بالكاد لتشغيلات LoRA صغيرة بتكميم 4 بت). للضبط الدقيق لـ 70B، يكون مزوّدو GPU السحابيون (RunPod، Lambda Labs، Vast.ai) أكثر عملية. يتعامل عتاد المستهلك مع الضبط الدقيق لـ 7B-13B بموثوقية.
ما أفضل تكميم لـ 70B على Apple Silicon؟
على Mac بسعة 64 GB (M5 Max أو M2 Ultra): يترك Q4_K_M (نحو 40 GB) سعة 24 GB لنظام التشغيل -- مريح. يترك Q5_K_M (نحو 50 GB) سعة 14 GB -- ضيق لكنه ممكن. ويتجاوز Q8_0 (نحو 70 GB) سعة 64 GB -- ممكن فقط في تهيئات 96 GB أو 128 GB. على Mac بسعة 128 GB: يُوصى بـ Q8_0 لجودة بلا فقدان تقريبًا دون عقوبة في السرعة.
هل يختار Ollama أفضل تكميم تلقائيًا؟
لا. ينزّل `ollama run llama3.3:70b` تكميم Q4_K_M الافتراضي. حدّد صراحةً لجودة أعلى: `ollama run llama3.3:70b:q5_k_m` أو `ollama run llama3.3:70b:q8_0`. تحقق من الذاكرة المتاحة بـ `ollama ps` بعد التحميل -- إذا اتسع النموذج بأريحية، اصعد إلى مستوى التكميم التالي.
المصادر
- توثيق GPU Offloading لـ llama.cpp -- github.com/ggerganov/llama.cpp/blob/master/docs/backend/CUDA.md
- مكتبة نماذج Ollama -- ollama.com/library/llama3.3
- اختبارات استدلال Apple M5 Max المرجعية -- github.com/ggerganov/llama.cpp/discussions (سلسلة اختبارات المجتمع المرجعية)
- بطاقة نموذج Meta Llama 3.3 -- huggingface.co/meta-llama/Llama-3.3-70B-Instruct
- NVIDIA DGX Spark -- nvidia.com/en-us/products/workstations/dgx-spark/
