Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/كيفية تشغيل نماذج ⁨70B⁩ على عتاد المستهلك ⁨2026⁩: الذاكرة وكرت الرسوميات
Best Models

كيفية تشغيل نماذج ⁨70B⁩ على عتاد المستهلك ⁨2026⁩: الذاكرة وكرت الرسوميات

·9 دقائق للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

يتطلب تشغيل نموذج بـ 70B معامل محليًا من 40 إلى 48 GB من الذاكرة مع تكميم Q4_K_M. هذا ممكن على: أجهزة Mac بمعالج Apple Silicon مع 64 GB من الذاكرة الموحدة، أو محطات عمل بذاكرة 64 GB DDR5، أو أجهزة تجمع بين GPU من NVIDIA بسعة 24 GB و32 GB من ذاكرة النظام باستخدام layer offloading.

يتطلب تشغيل نموذج بـ 70B معامل محليًا من 40 إلى 48 GB من الذاكرة مع تكميم Q4_K_M. هذا ممكن على: أجهزة Mac بمعالج Apple Silicon مع 64 GB من الذاكرة الموحدة، أو محطات عمل بذاكرة 64 GB DDR5، أو أجهزة تجمع بين GPU من NVIDIA بسعة 24 GB و32 GB من ذاكرة النظام باستخدام layer offloading. في أبريل 2026، يُعد Llama 3.3 70B وQwen3 72B النموذجين الرئيسيين من فئة 70B المتاحين.

كيفية تشغيل نماذج ⁨70B⁩ على عتاد المستهلك ⁨2026⁩: الذاكرة وكرت الرسوميات

Key Takeaways

  • تكميم Q4_K_M: يتطلب Llama 3.3 70B نحو 40 GB من الذاكرة؛ ويتطلب Qwen3 72B نحو 43 GB من الذاكرة.
  • أبسط عتاد للمستهلك: Apple Mac Studio M2 Ultra (64 GB موحدة) أو MacBook Pro M5 Max (64 GB) -- تسريع كامل عبر GPU، دون الحاجة إلى layer offloading.
  • خيار NVIDIA: RTX 4090 (24 GB VRAM) + 32 GB من ذاكرة النظام مع layer offloading في Ollama يعمل مع معظم نماذج 70B، رغم أن 20-30% من الطبقات تُشغَّل على المعالج.
  • 70B على المعالج فقط: ممكن مع 64 GB من الذاكرة لكنه ينتج 1-3 token/ثانية -- قابل للاستخدام بالكاد للمهام الدُفعية، لا للمحادثة التفاعلية.
  • في أبريل 2026، يضاهي نموذج 70B محلي جودة GPT-4 (2023) وهو المسار الوحيد الميسور للمستهلك نحو هذا المستوى من الجودة دون تكاليف سحابية.

ما العتاد القادر فعليًا على تشغيل LLM محلي بـ 70B؟

يتطلب نموذج 70B بتكميم Q4_K_M نحو 40-43 GB من الذاكرة المتاحة لمحرك الاستدلال. يمكن أن تأتي هذه من VRAM الخاصة بكرت الرسوميات، أو الذاكرة الموحدة للنظام (Apple Silicon)، أو ذاكرة النظام، أو مزيج عبر layer offloading.

Hardware¿Puede ejecutar 70B?Velocidad (70B Q4)Notas
Apple M5 Max (64 GB موحدة)نعم -- GPU كاملة20-30 token/ثانيةأفضل خيار لابتوب للمستهلك
Apple M2 Ultra (64 GB موحدة)نعم -- GPU كاملة25-35 token/ثانيةالتهيئة الأساسية لـ Mac Studio
Apple M2 Ultra (192 GB موحدة)نعم -- GPU كاملة30-40 token/ثانيةيشغّل Q8_0 بهامش واسع
NVIDIA DGX Spark (128 GB موحدة)نعم -- GPU كاملة18-28 token/ثانيةيتسع Q8_0 (70 GB). مثالي لتدفقات CUDA.
NVIDIA RTX 4090 (24 GB) + 32 GB RAMنعم -- مع offloading10-18 token/ثانيةنحو 60% طبقات على GPU، نحو 40% على المعالج
NVIDIA RTX 4080 (16 GB) + 32 GB RAMoffloading جزئي فقط5-10 token/ثانيةنحو 35% فقط من الطبقات على GPU
64 GB RAM، المعالج فقطنعم -- المعالج فقط1-3 token/ثانيةغير عملي للاستخدام التفاعلي
مقارنة العتاد: يحقق Apple Silicon M5 Max من 25 إلى 35 token/ثانية دون offloading، بينما يصل NVIDIA RTX 4090 مع layer offloading إلى 10-18 token/ثانية، ولا ينتج الاستدلال بـ 70B على المعالج فقط سوى 1-3 token/ثانية.
مقارنة العتاد: يحقق Apple Silicon M5 Max من 25 إلى 35 token/ثانية دون offloading، بينما يصل NVIDIA RTX 4090 مع layer offloading إلى 10-18 token/ثانية، ولا ينتج الاستدلال بـ 70B على المعالج فقط سوى 1-3 token/ثانية.

كم تحتاج ذاكرة لنموذج 70B في كل مستوى تكميم؟

CuantizaciónRAM requeridaCalidad¿Práctico?
FP16 (دقة كاملة)نحو 140 GBجودة مرجعيةلا -- خوادم فقط
Q8_0نحو 70 GBبلا فقدان تقريبًاMac Ultra 192 GB فقط
Q5_K_Mنحو 50 GBفقدان ضئيلMac Ultra 64 GB، بهامش ضيق
Q4_K_Mنحو 40-43 GBفقدان منخفض -- موصى بهنعم -- الخيار الأكثر جدوى
Q3_K_Sنحو 30 GBفقدان معتدلنعم -- ممكن على أجهزة 32 GB
Q2_Kنحو 22 GBفقدان مرتفعغير موصى به
منحنى مفاضلة التكميم: يتطلب Q4_K_M (موصى به) من 40 إلى 43 GB من الذاكرة بفقدان جودة لا يتجاوز 1-3% مقابل FP16، موازنًا بين العملية والأداء لعتاد المستهلك.
منحنى مفاضلة التكميم: يتطلب Q4_K_M (موصى به) من 40 إلى 43 GB من الذاكرة بفقدان جودة لا يتجاوز 1-3% مقابل FP16، موازنًا بين العملية والأداء لعتاد المستهلك.

لماذا يُعد Apple Silicon أفضل خيار للمستهلك لنماذج 70B؟

يستخدم Apple Silicon ذاكرة موحدة -- يتشارك المعالج وكرت الرسوميات المجموعة نفسها من الذاكرة الفيزيائية. يمكن لـ MacBook Pro M5 Max بذاكرة موحدة 64 GB تشغيل نموذج 70B بتكميم Q4_K_M بالكامل على GPU، محققًا 20-30 token/ثانية دون عبء layer offloading.

في عتاد NVIDIA، يكون كرت الرسوميات وذاكرة النظام منفصلين. لا يمكن لـ GPU بسعة 24 GB من VRAM استضافة سوى نحو 60% من نموذج 70B بتكميم Q4_K_M؛ وتُشغَّل الطبقات المتبقية على المعالج، مما يخلق عنق زجاجة في عرض نطاق الذاكرة يخفض السرعة إلى 10-18 token/ثانية.

في أبريل 2026، يُعد Mac Studio M2 Ultra (64 GB، نحو 2,000 دولار مُجدَّد) المسار الأكثر جدوى من حيث التكلفة نحو استدلال 70B محلي بسرعة قابلة للاستخدام. ويكلف MacBook Pro M5 Max جديد بسعة 64 GB نحو 3,500 دولار.

NVIDIA DGX Spark: 128 GB من الذاكرة الموحدة لنماذج 70B

NVIDIA DGX Spark (3,999 دولار) هو حاسوب مكتبي مدمج للذكاء الاصطناعي صدر في أكتوبر 2025، مبني على GB10 Grace Blackwell Superchip بذاكرة موحدة 128 GB من نوع LPDDR5x. تعني بنية الذاكرة الموحدة أن GPU والمعالج يتشاركان مجموعة 128 GB نفسها -- بشكل مماثل لـ Apple Silicon لكن مع تسريع CUDA.

بذاكرة موحدة 128 GB، يشغّل DGX Spark كلًا من Llama 3.3 70B وQwen3 72B بتكميم Q8_0 (70 GB -- جودة بلا فقدان تقريبًا). وتبلغ سرعة الاستدلال لـ 70B بتكميم Q8_0 نحو 18-28 token/ثانية.

EspecificaciónValor
الذاكرة128 GB موحدة LPDDR5x
70B بتكميم Q8_0نعم -- جودة بلا فقدان تقريبًا
سرعة استدلال 70B18-28 token/ثانية
أقصى حجم للنموذجنحو 200B معامل بـ FP4
السعر3,999 دولار (NVIDIA مباشرة / Amazon)
أمر Ollamaollama run llama3.3:70b

كيف يعمل GPU من NVIDIA + layer offloading لنماذج 70B؟

يتيح Ollama وllama.cpp تقسيم نموذج بين VRAM الخاصة بكرت الرسوميات وذاكرة النظام. تُشغَّل الطبقات المحمَّلة في VRAM بسرعة GPU؛ بينما تُشغَّل الطبقات في ذاكرة النظام بسرعة المعالج:

bash
# Ollama automatically offloads as many layers as fit in VRAM
# To explicitly control layers:
ollama run llama3.3:70b

# Check how many layers are on GPU:
ollama ps
# Output shows: llama3.3:70b  ...  23/80 GPU layers

# For llama.cpp directly:
./llama-cli -m llama-3.3-70b-q4_k_m.gguf \
  -ngl 40   # number of layers to offload to GPU
  --ctx-size 4096
بنية layer offloading: يخزّن GPU RTX 4090 (24 GB) نحو 60% من الطبقات (1-48) بسرعة 10-18 token/ثانية، بينما تخزّن ذاكرة النظام (32 GB) الطبقات المتبقية (49-80) المُشغَّلة بسرعة المعالج (2-5 token/ثانية)، محققًا 10-18 token/ثانية إجمالًا.
بنية layer offloading: يخزّن GPU RTX 4090 (24 GB) نحو 60% من الطبقات (1-48) بسرعة 10-18 token/ثانية، بينما تخزّن ذاكرة النظام (32 GB) الطبقات المتبقية (49-80) المُشغَّلة بسرعة المعالج (2-5 token/ثانية)، محققًا 10-18 token/ثانية إجمالًا.

هل الاستدلال بـ 70B على المعالج فقط عملي؟

نموذج 70B بتكميم Q4_K_M على معالج بعدد أنوية عالٍ (AMD Threadripper، Intel Xeon) مع 64 GB من الذاكرة ينتج 1-3 token/ثانية. عند 2 token/ثانية، تستغرق إجابة من 200 كلمة نحو 75 ثانية.

هذا غير عملي للمحادثة التفاعلية، لكنه قابل للاستخدام للمعالجة الدُفعية -- تلخيص المستندات أو توليد التقارير أو معالجة الملفات أثناء الليل. للاستخدام التفاعلي، أدنى عتاد عملي هو جهاز قادر على بلوغ 8 token/ثانية أو أكثر، وهو ما يتطلب Apple Silicon أو layer offloading مع GPU من NVIDIA.

أي نموذج 70B يجب أن تشغّله محليًا؟

ModeloMMLUHumanEvalIdeal para
Llama 3.3 70B82%88%المهام العامة بالإنجليزية، اتباع التعليمات
Qwen3 72B84%87%البرمجة، متعدد اللغات (29 لغة)
Mistral Large 123B84%80%يتطلب 80 GB أو أكثر -- محطات عمل فقط

تشغيل نماذج 70B محليًا: السياق الإقليمي

الاتحاد الأوروبي / GDPR: يمثّل نموذج 70B محلي الحد العملي لجودة الذكاء الاصطناعي القابلة للتشغيل بخصوصية. للشركات الأوروبية التي تعالج بيانات حساسة -- مستندات قانونية، سجلات طبية، تحليلات مالية -- يقدّم نموذج 70B محلي جودة GPT-4 لعام 2023 مع امتثال كامل لـ GDPR. لا يغادر أي مُدخل أو سياق أو مُخرج بنية المؤسسة التحتية.

لامتثال BSI الألماني وCNIL الفرنسية: كل من Mac Studio M2 Ultra (Apple، الولايات المتحدة) وNVIDIA DGX Spark (NVIDIA، الولايات المتحدة) من مزوّدين غير أوروبيين. للمؤسسات التي تتطلب عتادًا بسلسلة توريد أوروبية، ينتج شركاء OEM التابعون لـ NVIDIA (Dell، HP، Lenovo) أنظمة متوافقة مع DGX Spark وGB10 مع دعم في الاتحاد الأوروبي.

اختيار النماذج للامتثال في الاتحاد الأوروبي: Mistral Large 123B (Mistral AI، فرنسا، Apache 2.0) هو النموذج الوحيد من فئة 70B وأكبر المطوَّر من قبل شركة أوروبية. يتطلب أكثر من 80 GB من الذاكرة (محطات عمل فقط)، لكنه يقدّم أقوى سردية من حيث الملكية الفكرية والامتثال في الاتحاد الأوروبي.

اليابان (METI): للشركات اليابانية، يُعد Qwen3 72B نموذج 70B الموصى به -- إذ إن ترميزه الأصلي للغة اليابانية أكثر كفاءة بنسبة 30-40% من Llama للنص الياباني. على Mac Studio M2 Ultra (64 GB): `ollama run qwen2.5:72b`. تتطلب حوكمة الذكاء الاصطناعي لدى METI توثيق إصدارات العتاد والنموذج. يوفّر مُخرج `ollama ps` التعريف الدقيق للنموذج لسجلات الامتثال.

الصين: يلبّي Qwen3 72B (Alibaba) المُشغَّل محليًا توطين البيانات بموجب قانون أمن البيانات الصيني (数据安全法) مع تقديم 84% من جودة MMLU. تنشر فرق المؤسسات عادةً على خوادم بكرتي رسوميات (2× RTX 4090، 48 GB من VRAM مجتمعة). لامتثال CAC: نموذج Qwen3 72B مُستضاف محليًا يخدم مستخدمين داخليين يقع خارج تعريف المزوّد لدى CAC -- إذ لا يُقدَّم كخدمة عامة.

ما الأخطاء الشائعة عند تشغيل نماذج 70B على عتاد المستهلك؟

شراء GPU بأقل من 24 GB من VRAM مع توقع أداء 70B كامل

لا يمكن لـ RTX 4070 Ti (12 GB من VRAM) استضافة سوى نحو 30% من نموذج 70B بتكميم Q4_K_M في VRAM. وتُشغَّل النسبة المتبقية 70% على المعالج، مما ينتج 3-5 token/ثانية -- بالكاد أسرع من الاستدلال على المعالج فقط. لنماذج 70B، يُعد 24 GB من VRAM (RTX 4090) الحد الأدنى العملي لتسريع GPU مفيد. دون ذلك، فكّر في تشغيل نموذج 34B بدلًا منه.

عدم استخدام layer offloading في Ollama

افتراضيًا، إذا لم يتسع نموذج 70B بالكامل في VRAM، يلجأ Ollama إلى الاستدلال على المعالج فقط. عيّن طبقات GPU صراحةً بـ `OLLAMA_GPU_LAYERS=999` -- وسيقوم Ollama بعمل offloading لأكبر عدد من الطبقات يتسع في VRAM ويشغّل الباقي على المعالج، وهو أسرع كثيرًا من الاستدلال على المعالج فقط.

استخدام Q4_K_M بينما يناسب Q3_K_S العتاد المتاح بشكل أفضل

على الأجهزة بذاكرة 32-40 GB، قد يكون Q4_K_M لنموذج 70B ضيقًا جدًا (تاركًا هامشًا غير كافٍ لنظام التشغيل). يخفض Q3_K_S الذاكرة إلى نحو 30 GB مع فقدان جودة معتدل. شغّل `ollama ps` بعد تحميل النموذج -- إذا رأيت استخدام swap، انزل إلى Q3_K_S.

توقع سرعة Apple Silicon نفسها مع تهيئة NVIDIA بـ offloading

يخلق layer offloading على NVIDIA عنق زجاجة في عرض نطاق الذاكرة بين VRAM وذاكرة النظام. تنتج RTX 4090 مع offloading من 10 إلى 18 token/ثانية مقابل 20-30 token/ثانية على M5 Max. للسرعة المكافئة، يُعد Apple Silicon أفضل خيار للمستهلك. أما لتدفقات عمل CUDA (الضبط الدقيق، الأنوية المخصصة)، فإن NVIDIA ضرورية.

تشغيل Q4_K_M على DGX Spark بدلًا من Q8_0

يملك DGX Spark 128 GB -- كافية لـ Q8_0 (70 GB). يهدر استخدام Q4_K_M الجودة المتاحة. على أي جهاز بأكثر من 80 GB، شغّل Q8_0 لنماذج 70B.

الأسئلة الشائعة حول تشغيل نماذج 70B على عتاد المستهلك

ما أرخص عتاد قادر على تشغيل نموذج 70B بشكل قابل للاستخدام؟

في أبريل 2026، يُعد Mac Studio M2 Ultra مستعمل (64 GB من الذاكرة الموحدة) بنحو 2,000 دولار المسار الأكثر اقتصادًا نحو استدلال 70B بسرعة 25 token/ثانية أو أكثر. الجهاز الجديد المكافئ هو MacBook Pro M5 Max بسعة 64 GB (نحو 3,500 دولار). أما حاسوب مكتبي بـ NVIDIA RTX 4090 (24 GB VRAM + 32 GB RAM) فيكلف نحو 3,000-4,000 دولار إجمالًا، لكنه ينتج استدلالًا أبطأ بسبب layer offloading.

هل يمكنني تشغيل نموذج 70B على كرتي رسوميات؟

نعم -- يدعم llama.cpp وOllama الاستدلال متعدد كروت الرسوميات على عتاد NVIDIA. يتسع كرتا RTX 4090 (48 GB من VRAM إجمالًا) لنموذج 70B بتكميم Q4_K_M بالكامل في VRAM. يدير Ollama تعدد كروت الرسوميات تلقائيًا عند وجود عدة كروت. ويتحكم توازي الموترات في llama.cpp (`--tensor-split`) في كيفية توزيع الطبقات.

كيف تُقارن جودة 70B المحلي بـ GPT-5.5؟

في اختبارات MMLU وHumanEval، يضاهي Llama 3.3 70B (82%، 88%) وQwen3 72B (84%، 87%) درجات GPT-4 (2023) أو يتفوق عليها قليلًا. يسجّل GPT-5.5 (2024) أعلى في المهام كثيفة الاستدلال. أما لاتباع التعليمات العام والتلخيص وتوليد الكود، فإن نماذج 70B المحلية تنافس GPT-5.5 في معظم المهام.

هل يدعم Ollama التشغيل التلقائي لنماذج 70B؟

نعم. تشغيل `ollama run llama3.3:70b` يُنزّل النموذج ويشغّله مع layer offloading تلقائي لـ GPU. يكتشف Ollama VRAM المتاحة وذاكرة النظام، ويقوم بعمل offloading لأكبر عدد ممكن من الطبقات إلى GPU ويشغّل الباقي على المعالج. لا حاجة لتهيئة يدوية للاستخدام الأساسي.

كم كهرباء يستهلك تشغيل نموذج 70B؟

يستهلك Mac Studio M2 Ultra أثناء تشغيل استدلال 70B نحو 30-50 واط. ويستهلك حاسوب مكتبي بـ NVIDIA RTX 4090 تحت الحمل 350-450 واط. بسعر 0.15 دولار لكل kWh، يكلف الاستدلال المستمر بـ 70B على RTX 4090 نحو 0.05-0.07 دولار في الساعة. ويُعد Apple Silicon أكثر كفاءة في الطاقة بـ 7-10 أضعاف لهذا الحمل.

هل تستحق نماذج 70B العناء مقارنة بنماذج 13B للمهام اليومية؟

للاستدلال المعقّد وتحليل المستندات الطويلة والكتابة الدقيقة، نعم -- الفارق في الجودة ملحوظ. أما للتلخيص البسيط والأسئلة والأجوبة والتصنيف، فينتج نموذج 13B أو حتى 7B مُخرجًا متطابقًا عمليًا. شغّل كليهما على حالة استخدامك المحددة عبر PromptQuorum لقياس الفارق في الجودة قبل الاستثمار في عتاد لـ 70B.

ما هو NVIDIA DGX Spark وهل يستحق العناء للاستدلال بـ 70B؟

DGX Spark (3,999 دولار) هو حاسوب الذكاء الاصطناعي المكتبي المدمج من NVIDIA بذاكرة موحدة 128 GB. يشغّل نماذج 70B بتكميم Q8_0 (جودة بلا فقدان تقريبًا) دون قيود تكميم. السرعة: 18-28 token/ثانية. مقارنةً بـ Mac Studio M2 Ultra (نحو 2,000 دولار مُجدَّد، 64 GB): يكلف DGX Spark نحو 2,000 دولار إضافية مقابل استدلال أعلى جودة ودعم CUDA. للاستدلال بـ 70B الخالص، يُعد Mac Studio أكثر اقتصادًا. أما لتدفقات عمل CUDA (الضبط الدقيق، الأنوية المخصصة)، فإن DGX Spark أفضل.

هل يمكنني ضبط نموذج 70B دقيقًا على عتاد المستهلك؟

يتطلب الضبط الدقيق الكامل نحو 3 أضعاف ذاكرة الاستدلال لضبط LoRA (نحو 120-130 GB من VRAM). يتجاوز هذا كل عتاد المستهلك باستثناء DGX Spark (128 GB -- ممكن بالكاد لتشغيلات LoRA صغيرة بتكميم 4 بت). للضبط الدقيق لـ 70B، يكون مزوّدو GPU السحابيون (RunPod، Lambda Labs، Vast.ai) أكثر عملية. يتعامل عتاد المستهلك مع الضبط الدقيق لـ 7B-13B بموثوقية.

ما أفضل تكميم لـ 70B على Apple Silicon؟

على Mac بسعة 64 GB (M5 Max أو M2 Ultra): يترك Q4_K_M (نحو 40 GB) سعة 24 GB لنظام التشغيل -- مريح. يترك Q5_K_M (نحو 50 GB) سعة 14 GB -- ضيق لكنه ممكن. ويتجاوز Q8_0 (نحو 70 GB) سعة 64 GB -- ممكن فقط في تهيئات 96 GB أو 128 GB. على Mac بسعة 128 GB: يُوصى بـ Q8_0 لجودة بلا فقدان تقريبًا دون عقوبة في السرعة.

هل يختار Ollama أفضل تكميم تلقائيًا؟

لا. ينزّل `ollama run llama3.3:70b` تكميم Q4_K_M الافتراضي. حدّد صراحةً لجودة أعلى: `ollama run llama3.3:70b:q5_k_m` أو `ollama run llama3.3:70b:q8_0`. تحقق من الذاكرة المتاحة بـ `ollama ps` بعد التحميل -- إذا اتسع النموذج بأريحية، اصعد إلى مستوى التكميم التالي.

المصادر

  • توثيق GPU Offloading لـ llama.cpp -- github.com/ggerganov/llama.cpp/blob/master/docs/backend/CUDA.md
  • مكتبة نماذج Ollama -- ollama.com/library/llama3.3
  • اختبارات استدلال Apple M5 Max المرجعية -- github.com/ggerganov/llama.cpp/discussions (سلسلة اختبارات المجتمع المرجعية)
  • بطاقة نموذج Meta Llama 3.3 -- huggingface.co/meta-llama/Llama-3.3-70B-Instruct
  • NVIDIA DGX Spark -- nvidia.com/en-us/products/workstations/dgx-spark/

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs