Skip to main content
PromptQuorum
Home/Local LLMs/كيفية تشغيل نماذج ⁨70B⁩ على عتاد المستهلك ⁨2026⁩: الذاكرة وكرت الرسوميات
Best Models

كيفية تشغيل نماذج ⁨70B⁩ على عتاد المستهلك ⁨2026⁩: الذاكرة وكرت الرسوميات

·9 دقائق للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

يتطلب تشغيل نموذج بـ 70B معامل محليًا من 40 إلى 48 GB من الذاكرة مع تكميم Q4_K_M. هذا ممكن على: أجهزة Mac بمعالج Apple Silicon مع 64 GB من الذاكرة الموحدة، أو محطات عمل بذاكرة 64 GB DDR5، أو أجهزة تجمع بين GPU من NVIDIA بسعة 24 GB و32 GB من ذاكرة النظام باستخدام layer offloading.

يتطلب تشغيل نموذج بـ 70B معامل محليًا من 40 إلى 48 GB من الذاكرة مع تكميم Q4_K_M. هذا ممكن على: أجهزة Mac بمعالج Apple Silicon مع 64 GB من الذاكرة الموحدة، أو محطات عمل بذاكرة 64 GB DDR5، أو أجهزة تجمع بين GPU من NVIDIA بسعة 24 GB و32 GB من ذاكرة النظام باستخدام layer offloading. لا يزال Llama 3.3 70B وQwen3 72B النموذجين الرئيسيين من فئة 70B المتاحين.

كيفية تشغيل نماذج ⁨70B⁩ على عتاد المستهلك ⁨2026⁩: الذاكرة وكرت الرسوميات

Key Takeaways

  • تكميم Q4_K_M: يتطلب Llama 3.3 70B نحو 40 GB من الذاكرة؛ ويتطلب Qwen3 72B نحو 43 GB من الذاكرة.
  • أرخص عتاد جديد: Apple Mac mini M5 Pro (64 GB، 1,699 دولار، متوفر في 22 سبتمبر 2026) هو أرخص خيار جديد بـ GPU كاملة لـ 70B. أما Mac mini M6 الأساسي (899 دولار) فيصل فقط إلى 32 GB ولا يمكنه تشغيل نموذج 70B.
  • أبسط عتاد للمستهلك: Apple Mac Studio M2 Ultra (64 GB موحدة) أو MacBook Pro M5 Max (64 GB) -- تسريع كامل عبر GPU، دون الحاجة إلى layer offloading.
  • خيار NVIDIA: RTX 4090 (24 GB VRAM) + 32 GB من ذاكرة النظام مع layer offloading في Ollama يعمل مع معظم نماذج 70B، رغم أن 20-30% من الطبقات تُشغَّل على المعالج.
  • 70B على المعالج فقط: ممكن مع 64 GB من الذاكرة لكنه ينتج 1-3 token/ثانية -- قابل للاستخدام بالكاد للمهام الدُفعية، لا للمحادثة التفاعلية.
  • في أغسطس 2026، لا يزال نموذج 70B محلي يضاهي جودة GPT-4 (2023) وهو المسار الوحيد الميسور للمستهلك نحو هذا المستوى من الجودة دون تكاليف سحابية.

يتطلب تشغيل نموذج بـ 70B معامل محلياً 40-48 GB من الذاكرة مع تكميم Q4_K_M، وهو أمر ممكن على أجهزة Mac بمعالج Apple Silicon مع 64 GB من الذاكرة الموحدة، أو محطات عمل بذاكرة 64 GB DDR5، أو GPU من NVIDIA بسعة 24 GB مع 32 GB من ذاكرة النظام باستخدام layer offloading.

نموذج 70B هو من أكبر الأحجام التي يمكنك تشغيلها فعلياً في المنزل، ويحتاج إلى ذاكرة كبيرة -- نحو 40-48 GB. أسهل طريقة هي استخدام جهاز Mac بذاكرة موحدة كافية، لأنه يشارك الذاكرة بين المعالج وGPU. على حاسوب شخصي، ستحتاج عادةً إلى بطاقة رسومات كبيرة بالإضافة إلى ذاكرة نظام إضافية لتفريغ الأجزاء التي لا تتسع على البطاقة.

ما العتاد القادر فعليًا على تشغيل LLM محلي بـ 70B؟

يتطلب نموذج 70B بتكميم Q4_K_M نحو 40-43 GB من الذاكرة المتاحة لمحرك الاستدلال. يمكن أن تأتي هذه من VRAM الخاصة بكرت الرسوميات، أو الذاكرة الموحدة للنظام (Apple Silicon)، أو ذاكرة النظام، أو مزيج عبر layer offloading.

العتاد
هل يشغّل 70B؟
السرعة (70B Q4)
ملاحظات
Apple M5 Max MacBook Pro (64 GB)نعم -- GPU كاملة20-30 token/ثانيةأفضل خيار لابتوب للمستهلك
Apple Mac Studio M5 Max (64 GB)نعم -- GPU كاملة22-32 token/ثانيةجديد أغسطس 2026، 2,499 دولار
Apple Mac mini M5 Pro (64 GB)نعم -- GPU كاملةلا توجد اختبارات بعدجديد، متوفر 22 سبتمبر 2026، 1,699 دولار -- أرخص خيار جديد
Apple Mac mini M6 (32 GB كحد أقصى)لا -- 32 GB كحد أقصىغير متاحجديد، متوفر 22 سبتمبر 2026، 899 دولار -- ذاكرة غير كافية لـ 70B
Apple M2 Ultra (64 GB موحدة)نعم -- GPU كاملة25-35 token/ثانيةالتهيئة الأساسية لـ Mac Studio، مستعمل/مُجدَّد
Apple Mac Studio M5 Ultra (256GB+)نعم -- GPU كاملة35-50 token/ثانيةجديد أغسطس 2026، من 5,499 دولار. يشغّل Q8_0/FP16 بهامش.
NVIDIA DGX Spark (128 GB موحدة)نعم -- GPU كاملة18-28 token/ثانيةيتسع Q8_0 (70 GB). مثالي لتدفقات CUDA.
NVIDIA RTX 4090 (24 GB) + 32 GB RAMنعم -- مع offloading10-18 token/ثانيةنحو 60% طبقات على GPU، نحو 40% على المعالج
NVIDIA RTX 4080 (16 GB) + 32 GB RAMoffloading جزئي فقط5-10 token/ثانيةنحو 35% فقط من الطبقات على GPU
64 GB RAM، المعالج فقطنعم -- المعالج فقط1-3 token/ثانيةغير عملي للاستخدام التفاعلي
مقارنة العتاد: يحقق Apple Silicon M5 Max من 25 إلى 35 token/ثانية دون offloading، بينما يصل NVIDIA RTX 4090 مع layer offloading إلى 10-18 token/ثانية، ولا ينتج الاستدلال بـ 70B على المعالج فقط سوى 1-3 token/ثانية.
مقارنة العتاد: يحقق Apple Silicon M5 Max من 25 إلى 35 token/ثانية دون offloading، بينما يصل NVIDIA RTX 4090 مع layer offloading إلى 10-18 token/ثانية، ولا ينتج الاستدلال بـ 70B على المعالج فقط سوى 1-3 token/ثانية.

كم تحتاج ذاكرة لنموذج 70B في كل مستوى تكميم؟

التكميم
الذاكرة المطلوبة
الجودة
عملي؟
FP16 (دقة كاملة)نحو 140 GBجودة مرجعيةلا -- خوادم فقط
Q8_0نحو 70 GBبلا فقدان تقريبًاMac Ultra 192 GB فقط
Q5_K_Mنحو 50 GBفقدان ضئيلMac Ultra 64 GB، بهامش ضيق
Q4_K_Mنحو 40-43 GBفقدان منخفض -- موصى بهنعم -- الخيار الأكثر جدوى
Q3_K_Sنحو 30 GBفقدان معتدلنعم -- ممكن على أجهزة 32 GB
Q2_Kنحو 22 GBفقدان مرتفعغير موصى به
منحنى مفاضلة التكميم: يتطلب Q4_K_M (موصى به) من 40 إلى 43 GB من الذاكرة بفقدان جودة لا يتجاوز 1-3% مقابل FP16، موازنًا بين العملية والأداء لعتاد المستهلك.
منحنى مفاضلة التكميم: يتطلب Q4_K_M (موصى به) من 40 إلى 43 GB من الذاكرة بفقدان جودة لا يتجاوز 1-3% مقابل FP16، موازنًا بين العملية والأداء لعتاد المستهلك.

لماذا يُعد Apple Silicon أفضل خيار للمستهلك لنماذج 70B؟

يستخدم Apple Silicon ذاكرة موحدة -- يتشارك المعالج وكرت الرسوميات المجموعة نفسها من الذاكرة الفيزيائية. يمكن لـ MacBook Pro M5 Max بذاكرة موحدة 64 GB تشغيل نموذج 70B بتكميم Q4_K_M بالكامل على GPU، محققًا 20-30 token/ثانية دون عبء layer offloading.

في عتاد NVIDIA، يكون كرت الرسوميات وذاكرة النظام منفصلين. لا يمكن لـ GPU بسعة 24 GB من VRAM استضافة سوى نحو 60% من نموذج 70B بتكميم Q4_K_M؛ وتُشغَّل الطبقات المتبقية على المعالج، مما يخلق عنق زجاجة في عرض نطاق الذاكرة يخفض السرعة إلى 10-18 token/ثانية.

في أغسطس 2026، لا يزال Mac Studio M2 Ultra مستعمل (64 GB، نحو 2,000 دولار مُجدَّد) المسار المستعمل الأكثر اقتصادًا نحو استدلال 70B محلي بسرعة قابلة للاستخدام. أطلقت Apple تشكيلة Mac Studio جديدة بمعالجات M5 Max وM5 Ultra في أغسطس 2026: يُعد Mac Studio M5 Max الجديد (64 GB، 2,499 دولار) خيارًا جديدًا بـ GPU كاملة، بينما يُضاعف Mac Studio M5 Ultra (256 GB أو 512 GB، من 5,499 دولار) عرض نطاق الذاكرة الموحدة إلى 1.2 تيرابايت/ثانية، مشغّلًا نماذج 70B بتكميم Q8_0 أو FP16 دون أي تنازل في الجودة.

جدّدت Apple تشكيلة Mac mini في 25 أغسطس 2026، مع توفّرها في 22 سبتمبر 2026، وهذا يغيّر مرة أخرى أرخص خيار جديد. يصل Mac mini M5 Pro (يبدأ من 1,699 دولار) إلى 64 GB من الذاكرة الموحدة بعرض نطاق 307 GB/ثانية وThunderbolt 5 -- ما يكفي لتشغيل نموذج 70B بتكميم Q4_K_M بالكامل على GPU، وبفارق 800 دولار أرخص من Mac Studio M5 Max. أما Mac mini M6 الأساسي (يبدأ من 899 دولار) فهو جهاز مختلف: يصل فقط إلى 32 GB من الذاكرة الموحدة وعرض نطاق 170 GB/ثانية، أقل بكثير من 40 GB أو أكثر التي يحتاجها نموذج 70B، لذا لا يمكنه تشغيل نموذج 70B عند أي مستوى تكميم. لا توجد اختبارات مرجعية مستقلة بعد لأي من المعالجين -- كلاهما متوفر في 22 سبتمبر 2026.

NVIDIA DGX Spark: 128 GB من الذاكرة الموحدة لنماذج 70B

NVIDIA DGX Spark (4,699 دولار) هو حاسوب مكتبي مدمج للذكاء الاصطناعي صدر في أكتوبر 2025، مبني على GB10 Grace Blackwell Superchip بذاكرة موحدة 128 GB من نوع LPDDR5x. تعني بنية الذاكرة الموحدة أن GPU والمعالج يتشاركان مجموعة 128 GB نفسها -- بشكل مماثل لـ Apple Silicon لكن مع تسريع CUDA.

بذاكرة موحدة 128 GB، يشغّل DGX Spark كلًا من Llama 3.3 70B وQwen3 72B بتكميم Q8_0 (70 GB -- جودة بلا فقدان تقريبًا). وتبلغ سرعة الاستدلال لـ 70B بتكميم Q8_0 نحو 18-28 token/ثانية.

رفعت NVIDIA سعر إصدار DGX Spark Founders Edition من 3,999 دولار إلى 4,699 دولار في فبراير 2026، مشيرةً إلى قيود في إمدادات الذاكرة -- وهي نفس أزمة نقص DRAM التي رفعت أيضًا أسعار كروت RTX من سلسلة 50 إلى ما فوق السعر المعلن بكثير.

المواصفة
القيمة
الذاكرة128 GB موحدة LPDDR5x
70B بتكميم Q8_0نعم -- جودة بلا فقدان تقريبًا
سرعة استدلال 70B18-28 token/ثانية
أقصى حجم للنموذجنحو 200B معامل بـ FP4
السعر4,699 دولار (NVIDIA مباشرة / Amazon)
أمر Ollamaollama run llama3.3:70b

كيف يعمل GPU من NVIDIA + layer offloading لنماذج 70B؟

يتيح Ollama وllama.cpp تقسيم نموذج بين VRAM الخاصة بكرت الرسوميات وذاكرة النظام. تُشغَّل الطبقات المحمَّلة في VRAM بسرعة GPU؛ بينما تُشغَّل الطبقات في ذاكرة النظام بسرعة المعالج:

bash
# Ollama automatically offloads as many layers as fit in VRAM
# To explicitly control layers:
ollama run llama3.3:70b

# Check how many layers are on GPU:
ollama ps
# Output shows: llama3.3:70b  ...  23/80 GPU layers

# For llama.cpp directly:
./llama-cli -m llama-3.3-70b-q4_k_m.gguf \
  -ngl 40   # number of layers to offload to GPU
  --ctx-size 4096
بنية layer offloading: يخزّن GPU RTX 4090 (24 GB) نحو 60% من الطبقات (1-48) بسرعة 10-18 token/ثانية، بينما تخزّن ذاكرة النظام (32 GB) الطبقات المتبقية (49-80) المُشغَّلة بسرعة المعالج (2-5 token/ثانية)، محققًا 10-18 token/ثانية إجمالًا.
بنية layer offloading: يخزّن GPU RTX 4090 (24 GB) نحو 60% من الطبقات (1-48) بسرعة 10-18 token/ثانية، بينما تخزّن ذاكرة النظام (32 GB) الطبقات المتبقية (49-80) المُشغَّلة بسرعة المعالج (2-5 token/ثانية)، محققًا 10-18 token/ثانية إجمالًا.

هل الاستدلال بـ 70B على المعالج فقط عملي؟

نموذج 70B بتكميم Q4_K_M على معالج بعدد أنوية عالٍ (AMD Threadripper، Intel Xeon) مع 64 GB من الذاكرة ينتج 1-3 token/ثانية. عند 2 token/ثانية، تستغرق إجابة من 200 كلمة نحو 75 ثانية.

هذا غير عملي للمحادثة التفاعلية، لكنه قابل للاستخدام للمعالجة الدُفعية -- تلخيص المستندات أو توليد التقارير أو معالجة الملفات أثناء الليل. للاستخدام التفاعلي، أدنى عتاد عملي هو جهاز قادر على بلوغ 8 token/ثانية أو أكثر، وهو ما يتطلب Apple Silicon أو layer offloading مع GPU من NVIDIA.

أي نموذج 70B يجب أن تشغّله محليًا؟

النموذج
MMLU
HumanEval
الأنسب لـ
Llama 3.3 70B82%88%المهام العامة بالإنجليزية، اتباع التعليمات
Qwen3 72B84%87%البرمجة، متعدد اللغات (29 لغة)
Mistral Large 123B84%80%يتطلب 80 GB أو أكثر -- محطات عمل فقط

تشغيل نماذج 70B محليًا: السياق الإقليمي

الاتحاد الأوروبي / GDPR: يمثّل نموذج 70B محلي الحد العملي لجودة الذكاء الاصطناعي القابلة للتشغيل بخصوصية. للشركات الأوروبية التي تعالج بيانات حساسة -- مستندات قانونية، سجلات طبية، تحليلات مالية -- يقدّم نموذج 70B محلي جودة GPT-4 لعام 2023 مع امتثال كامل لـ GDPR. لا يغادر أي مُدخل أو سياق أو مُخرج بنية المؤسسة التحتية.

لامتثال BSI الألماني وCNIL الفرنسية: كل من Mac Studio M2 Ultra (Apple، الولايات المتحدة) وNVIDIA DGX Spark (NVIDIA، الولايات المتحدة) من مزوّدين غير أوروبيين. للمؤسسات التي تتطلب عتادًا بسلسلة توريد أوروبية، ينتج شركاء OEM التابعون لـ NVIDIA (Dell، HP، Lenovo) أنظمة متوافقة مع DGX Spark وGB10 مع دعم في الاتحاد الأوروبي.

اختيار النماذج للامتثال في الاتحاد الأوروبي: Mistral Large 123B (Mistral AI، فرنسا، Apache 2.0) هو النموذج الوحيد من فئة 70B وأكبر المطوَّر من قبل شركة أوروبية. يتطلب أكثر من 80 GB من الذاكرة (محطات عمل فقط)، لكنه يقدّم أقوى سردية من حيث الملكية الفكرية والامتثال في الاتحاد الأوروبي.

اليابان (METI): للشركات اليابانية، يُعد Qwen3 72B نموذج 70B الموصى به -- إذ إن ترميزه الأصلي للغة اليابانية أكثر كفاءة بنسبة 30-40% من Llama للنص الياباني. على Mac Studio M2 Ultra (64 GB): `ollama run qwen2.5:72b`. تتطلب حوكمة الذكاء الاصطناعي لدى METI توثيق إصدارات العتاد والنموذج. يوفّر مُخرج `ollama ps` التعريف الدقيق للنموذج لسجلات الامتثال.

الصين: يلبّي Qwen3 72B (Alibaba) المُشغَّل محليًا توطين البيانات بموجب قانون أمن البيانات الصيني (数据安全法) مع تقديم 84% من جودة MMLU. تنشر فرق المؤسسات عادةً على خوادم بكرتي رسوميات (2× RTX 4090، 48 GB من VRAM مجتمعة). لامتثال CAC: نموذج Qwen3 72B مُستضاف محليًا يخدم مستخدمين داخليين يقع خارج تعريف المزوّد لدى CAC -- إذ لا يُقدَّم كخدمة عامة.

ما الأخطاء الشائعة عند تشغيل نماذج 70B على عتاد المستهلك؟

شراء GPU بأقل من 24 GB من VRAM مع توقع أداء 70B كامل

لا يمكن لـ RTX 4070 Ti (12 GB من VRAM) استضافة سوى نحو 30% من نموذج 70B بتكميم Q4_K_M في VRAM. وتُشغَّل النسبة المتبقية 70% على المعالج، مما ينتج 3-5 token/ثانية -- بالكاد أسرع من الاستدلال على المعالج فقط. لنماذج 70B، يُعد 24 GB من VRAM (RTX 4090) الحد الأدنى العملي لتسريع GPU مفيد. دون ذلك، فكّر في تشغيل نموذج 34B بدلًا منه.

عدم استخدام layer offloading في Ollama

افتراضيًا، إذا لم يتسع نموذج 70B بالكامل في VRAM، يلجأ Ollama إلى الاستدلال على المعالج فقط. عيّن طبقات GPU صراحةً بـ `OLLAMA_GPU_LAYERS=999` -- وسيقوم Ollama بعمل offloading لأكبر عدد من الطبقات يتسع في VRAM ويشغّل الباقي على المعالج، وهو أسرع كثيرًا من الاستدلال على المعالج فقط.

استخدام Q4_K_M بينما يناسب Q3_K_S العتاد المتاح بشكل أفضل

على الأجهزة بذاكرة 32-40 GB، قد يكون Q4_K_M لنموذج 70B ضيقًا جدًا (تاركًا هامشًا غير كافٍ لنظام التشغيل). يخفض Q3_K_S الذاكرة إلى نحو 30 GB مع فقدان جودة معتدل. شغّل `ollama ps` بعد تحميل النموذج -- إذا رأيت استخدام swap، انزل إلى Q3_K_S.

توقع سرعة Apple Silicon نفسها مع تهيئة NVIDIA بـ offloading

يخلق layer offloading على NVIDIA عنق زجاجة في عرض نطاق الذاكرة بين VRAM وذاكرة النظام. تنتج RTX 4090 مع offloading من 10 إلى 18 token/ثانية مقابل 20-30 token/ثانية على M5 Max. للسرعة المكافئة، يُعد Apple Silicon أفضل خيار للمستهلك. أما لتدفقات عمل CUDA (الضبط الدقيق، الأنوية المخصصة)، فإن NVIDIA ضرورية.

تشغيل Q4_K_M على DGX Spark بدلًا من Q8_0

يملك DGX Spark 128 GB -- كافية لـ Q8_0 (70 GB). يهدر استخدام Q4_K_M الجودة المتاحة. على أي جهاز بأكثر من 80 GB، شغّل Q8_0 لنماذج 70B.

شراء Mac mini M6 الأساسي مع توقع تشغيل نموذج 70B

يصل Mac mini M6 (899 دولار) فقط إلى 32 GB من الذاكرة الموحدة -- أقل بكثير من 40 GB أو أكثر التي يحتاجها نموذج 70B بتكميم Q4_K_M. لا يمكنه تشغيل نموذج 70B عند أي مستوى تكميم. لتشغيل 70B على Mac mini، الفئة المطلوبة هي Mac mini M5 Pro (1,699 دولار، 64 GB من الذاكرة الموحدة) -- تأكّد من "M5 Pro" و64 GB قبل الطلب، وليس M6 الأساسي.

الأسئلة الشائعة حول تشغيل نماذج 70B على عتاد المستهلك

ما أرخص عتاد قادر على تشغيل نموذج 70B بشكل قابل للاستخدام؟

يُتوقّع أن يصبح Mac mini M5 Pro (1,699 دولار، 64 GB من الذاكرة الموحدة، متوفر في 22 سبتمبر 2026) أرخص عتاد جديد قادر على تشغيل نموذج 70B، بفارق 800 دولار أقل من الخيار الجديد الأرخص سابقًا، Mac Studio M5 Max (64 GB، 2,499 دولار). ويبقى Mac Studio M2 Ultra مستعمل (64 GB من الذاكرة الموحدة) بنحو 2,000 دولار المسار المستعمل الأكثر اقتصادًا بأداء مثبت 25 token/ثانية أو أكثر. لا توجد اختبارات مرجعية مستقلة بعد لـ Mac mini M5 Pro. أما حاسوب مكتبي بـ NVIDIA RTX 4090 (24 GB VRAM + 32 GB RAM) فيكلف نحو 3,000-4,000 دولار إجمالًا، لكنه ينتج استدلالًا أبطأ بسبب layer offloading. لا تخلط بين Mac mini M5 Pro وMac mini M6 الأساسي (899 دولار) -- إذ يصل M6 فقط إلى 32 GB من الذاكرة الموحدة ولا يمكنه تشغيل نموذج 70B.

هل يمكن لـ Mac mini M6 تشغيل نموذج 70B؟

لا. يصل Mac mini M6 (يبدأ من 899 دولار) فقط إلى 32 GB من الذاكرة الموحدة وعرض نطاق 170 GB/ثانية -- أقل بكثير من 40 GB أو أكثر التي يتطلبها نموذج 70B بتكميم Q4_K_M. لتشغيل 70B على Mac mini، اطلب Mac mini M5 Pro (يبدأ من 1,699 دولار، 64 GB من الذاكرة الموحدة، عرض نطاق 307 GB/ثانية، Thunderbolt 5) بدلًا من ذلك. كلاهما متوفر في 22 سبتمبر 2026، ولا توجد اختبارات مرجعية مستقلة بعد لأي من المعالجين.

هل يمكنني تشغيل نموذج 70B على كرتي رسوميات؟

نعم -- يدعم llama.cpp وOllama الاستدلال متعدد كروت الرسوميات على عتاد NVIDIA. يتسع كرتا RTX 4090 (48 GB من VRAM إجمالًا) لنموذج 70B بتكميم Q4_K_M بالكامل في VRAM. يدير Ollama تعدد كروت الرسوميات تلقائيًا عند وجود عدة كروت. ويتحكم توازي الموترات في llama.cpp (`--tensor-split`) في كيفية توزيع الطبقات.

كيف تُقارن جودة 70B المحلي بـ GPT-5.5؟

في اختبارات MMLU وHumanEval، يضاهي Llama 3.3 70B (82%، 88%) وQwen3 72B (84%، 87%) درجات GPT-4 (2023) أو يتفوق عليها قليلًا. يسجّل GPT-5.5 (2024) أعلى في المهام كثيفة الاستدلال. أما لاتباع التعليمات العام والتلخيص وتوليد الكود، فإن نماذج 70B المحلية تنافس GPT-5.5 في معظم المهام.

هل يدعم Ollama التشغيل التلقائي لنماذج 70B؟

نعم. تشغيل `ollama run llama3.3:70b` يُنزّل النموذج ويشغّله مع layer offloading تلقائي لـ GPU. يكتشف Ollama VRAM المتاحة وذاكرة النظام، ويقوم بعمل offloading لأكبر عدد ممكن من الطبقات إلى GPU ويشغّل الباقي على المعالج. لا حاجة لتهيئة يدوية للاستخدام الأساسي.

كم كهرباء يستهلك تشغيل نموذج 70B؟

يستهلك Mac Studio M2 Ultra أثناء تشغيل استدلال 70B نحو 30-50 واط. ويستهلك حاسوب مكتبي بـ NVIDIA RTX 4090 تحت الحمل 350-450 واط. بسعر 0.15 دولار لكل kWh، يكلف الاستدلال المستمر بـ 70B على RTX 4090 نحو 0.05-0.07 دولار في الساعة. ويُعد Apple Silicon أكثر كفاءة في الطاقة بـ 7-10 أضعاف لهذا الحمل.

هل تستحق نماذج 70B العناء مقارنة بنماذج 13B للمهام اليومية؟

للاستدلال المعقّد وتحليل المستندات الطويلة والكتابة الدقيقة، نعم -- الفارق في الجودة ملحوظ. أما للتلخيص البسيط والأسئلة والأجوبة والتصنيف، فينتج نموذج 13B أو حتى 7B مُخرجًا متطابقًا عمليًا. شغّل كليهما على حالة استخدامك المحددة عبر PromptQuorum لقياس الفارق في الجودة قبل الاستثمار في عتاد لـ 70B.

ما هو NVIDIA DGX Spark وهل يستحق العناء للاستدلال بـ 70B؟

DGX Spark (4,699 دولار) هو حاسوب الذكاء الاصطناعي المكتبي المدمج من NVIDIA بذاكرة موحدة 128 GB. يشغّل نماذج 70B بتكميم Q8_0 (جودة بلا فقدان تقريبًا) دون قيود تكميم. السرعة: 18-28 token/ثانية. مقارنةً بـ Mac Studio M2 Ultra (نحو 2,000 دولار مُجدَّد، 64 GB): يكلف DGX Spark نحو 2,700 دولار إضافية مقابل استدلال أعلى جودة ودعم CUDA. للاستدلال بـ 70B الخالص، يُعد Mac Studio أكثر اقتصادًا. أما لتدفقات عمل CUDA (الضبط الدقيق، الأنوية المخصصة)، فإن DGX Spark أفضل.

هل يمكنني ضبط نموذج 70B دقيقًا على عتاد المستهلك؟

يتطلب الضبط الدقيق الكامل نحو 3 أضعاف ذاكرة الاستدلال لضبط LoRA (نحو 120-130 GB من VRAM). يتجاوز هذا كل عتاد المستهلك باستثناء DGX Spark (128 GB -- ممكن بالكاد لتشغيلات LoRA صغيرة بتكميم 4 بت). للضبط الدقيق لـ 70B، يكون مزوّدو GPU السحابيون (RunPod، Lambda Labs، Vast.ai) أكثر عملية. يتعامل عتاد المستهلك مع الضبط الدقيق لـ 7B-13B بموثوقية.

ما أفضل تكميم لـ 70B على Apple Silicon؟

على Mac بسعة 64 GB (M5 Max أو M2 Ultra): يترك Q4_K_M (نحو 40 GB) سعة 24 GB لنظام التشغيل -- مريح. يترك Q5_K_M (نحو 50 GB) سعة 14 GB -- ضيق لكنه ممكن. ويتجاوز Q8_0 (نحو 70 GB) سعة 64 GB -- ممكن فقط في تهيئات 96 GB أو 128 GB. على Mac بسعة 128 GB: يُوصى بـ Q8_0 لجودة بلا فقدان تقريبًا دون عقوبة في السرعة.

هل يختار Ollama أفضل تكميم تلقائيًا؟

لا. ينزّل `ollama run llama3.3:70b` تكميم Q4_K_M الافتراضي. حدّد صراحةً لجودة أعلى: `ollama run llama3.3:70b:q5_k_m` أو `ollama run llama3.3:70b:q8_0`. تحقق من الذاكرة المتاحة بـ `ollama ps` بعد التحميل -- إذا اتسع النموذج بأريحية، اصعد إلى مستوى التكميم التالي.

المصادر

  • توثيق GPU Offloading لـ llama.cpp -- github.com/ggerganov/llama.cpp/blob/master/docs/backend/CUDA.md
  • مكتبة نماذج Ollama -- ollama.com/library/llama3.3
  • اختبارات استدلال Apple M5 Max المرجعية -- github.com/ggerganov/llama.cpp/discussions (سلسلة اختبارات المجتمع المرجعية)
  • بطاقة نموذج Meta Llama 3.3 -- huggingface.co/meta-llama/Llama-3.3-70B-Instruct
  • NVIDIA DGX Spark -- nvidia.com/en-us/products/workstations/dgx-spark/

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs