Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/كيفية تشغيل نماذج ⁨70B⁩ على ⁨24 GB⁩ من ⁨VRAM⁩: تقنيات متقدمة
Hardware & Performance

كيفية تشغيل نماذج ⁨70B⁩ على ⁨24 GB⁩ من ⁨VRAM⁩: تقنيات متقدمة

·10 دقائق قراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

تشغيل نموذج 70B (يتطلب عادةً أكثر من 40 GB) على 24 GB من VRAM ممكن بتكميم قوي (Q2-Q3) وتفريغ الطبقات، لكن النتيجة بطيئة (~3-5 token/ثانية).

تشغيل نموذج 70B (يتطلب عادةً أكثر من 40 GB) على 24 GB من VRAM ممكن بتكميم قوي (Q2-Q3) وتفريغ الطبقات، لكن النتيجة بطيئة (~3-5 token/ثانية). اعتبارًا من أبريل 2026، هذا غير عملي للدردشة الفورية، لكنه قابل للتطبيق للمعالجة بالدُفعات أو التجريب.

Key Takeaways

  • Llama 3.3 70B بـ Q4 = 35 GB (أكبر من أن يتسع في 24 GB). بـ Q3 = 26 GB (لا يزال كبيرًا جدًا). بـ Q2 = 17 GB (يتسع!).
  • المفاضلة: لـ Q2 فقدان جودة ملحوظ. ~70% من جودة FP16.
  • السرعة: 3-5 token/ثانية مع تفريغ 20 GB إلى RAM النظام (بطيء جدًا).
  • الخيار الأفضل: استخدام نموذج 13B بـ Q5، أو شراء بطاقة رسوم ثانية لتقسيم الطبقات.
  • اعتبارًا من أبريل 2026، هذا حل لقيد، لا نهج موصى به.

الحسابات النظرية لـ VRAM

Llama 3.3 70B بمستويات تكميم مختلفة:

CuantizaciónTamaño del modelo¿Cabe en 24 GB?
FP16 (الأساس)لا
Q8 (8 بت)لا
Q5 (5 بت)لا
Q4 (4 بت)لا (مع التفريغ: ربما)
Q3 (3 بت)لا (بفارق ضئيل)
Q2 (2 بت)نعم
حجم VRAM لنموذج Llama 3.3 70B حسب التكميم مقابل حد 24 GB: FP16 (140 GB)، Q8 (70 GB)، Q5 (43.75 GB) وQ4 (35 GB) جميعها تتجاوز 24 GB؛ Q3 (26 GB) يحتاج تفريغ 2 GB؛ فقط Q2 بحجم 17.5 GB يتسع بالكامل.
حجم VRAM لنموذج Llama 3.3 70B حسب التكميم مقابل حد 24 GB: FP16 (140 GB)، Q8 (70 GB)، Q5 (43.75 GB) وQ4 (35 GB) جميعها تتجاوز 24 GB؛ Q3 (26 GB) يحتاج تفريغ 2 GB؛ فقط Q2 بحجم 17.5 GB يتسع بالكامل.

التكميم القوي: الأداة الرئيسية

لكي يتسع 70B في 24 GB، يجب استخدام تكميم Q2 أو Q3.

  • Q3: 26 GB (لا يزال 2 GB زائدة). يمكن تفريغ 2 GB إلى RAM. جودة أفضل قليلًا من Q2.
  • Q2: 17.5 GB (يتسع!). 70% من الجودة مقابل FP16. تدهور ملحوظ لكنه قابل للاستخدام.

نزّل النموذج المُكمَّم: `ollama pull llama3.1:70b-q2` (إن توفّر) أو استخدم أدوات تحويل مثل llama.cpp.

التفريغ إلى RAM النظام

إذا استخدمت Q4 (35 GB) على بطاقة رسوم بسعة 24 GB، يمكنك تفريغ الـ 11 GB المتبقية إلى RAM النظام. عقوبة السرعة شديدة (أبطأ بـ 10×).

عملي فقط للمعالجة بالدُفعات حيث يمكنك انتظار النتائج ساعات.

الإعداد العملي: تشغيل 70B على 24 GB

خطوة بخطوة:

  1. 1
    استخدم تكميم Q2: `ollama pull llama3.1:70b-q2` (إن توفّر؛ وإلا حوّل بـ llama.cpp)
  2. 2
    تحقق من VRAM: ينبغي أن يعرض `nvidia-smi` نحو 18 GB قيد الاستخدام
  3. 3
    شغّل النموذج: `ollama run llama3.1:70b-q2`
  4. 4
    توقّع 3-5 token/ثانية (بطيء جدًا)
  5. 5
    استخدمه فقط للمعالجة بالدُفعات/دون اتصال، لا للدردشة التفاعلية

توقعات الأداء الواقعية

تشغيل 70B على 24 GB من VRAM بطيء:

CuantizaciónVelocidadLatenciaCaso de uso
Q2 (24 GB VRAM)5-8 token/ثانية2-4 ثانية لكل tokenمعالجة بالدُفعات فقط
Q3 + تفريغ (24 GB)3-5 token/ثانية3-5 ثوانٍ لكل tokenمحدود للغاية
Q4 + تفريغ (24 GB)1-3 token/ثانية5-10 ثوانٍ لكل tokenدُفعات ليلية فقط
مقارنة سرعة الاستدلال: نموذج 13B بتكميم Q5 يعمل بـ 80-100 token/ثانية، بينما يصل 70B على 24 GB من VRAM إلى 5-8 token/ثانية فقط بتكميم Q2، وـ 3-5 بتكميم Q3، وـ 1-3 بتكميم Q4 مع التفريغ.
مقارنة سرعة الاستدلال: نموذج 13B بتكميم Q5 يعمل بـ 80-100 token/ثانية، بينما يصل 70B على 24 GB من VRAM إلى 5-8 token/ثانية فقط بتكميم Q2، وـ 3-5 بتكميم Q3، وـ 1-3 بتكميم Q4 مع التفريغ.

بدائل أفضل من 70B المقيّد

بدلًا من الصراع مع 70B بـ VRAM محدود، فكّر في:

  • استخدام نموذج 13B (Llama 3.3 13B بـ Q5 = 8 GB، سريع جدًا)
  • شراء RTX 4090 ثانية لتقسيم الطبقات (2× 24 GB = 48 GB، أكثر من 100 token/ثانية)
  • استخدام API سحابي (GPT-5.5 للمهام المهمة، محلي للتجريب)
  • انتظار نماذج أكفأ (أصغر، بالجودة نفسها)

الأخطاء الشائعة مع 70B المقيّد

  • توقّع أن يكون Q2 قابلًا للاستخدام في الدردشة. ليس كذلك. تدهور الجودة شديد جدًا للتفاعل الفوري.
  • عدم قياس السرعة الفعلية قبل الالتزام. اختبر بأمر صغير (10 tokens) وتحقق من السرعة قبل تشغيل أعمال دُفعات كبيرة.
  • افتراض أن التفريغ "مجاني". RAM النظام أبطأ بـ 100× من VRAM بطاقة الرسوم. التفريغ يجعل الاستدلال غير عملي.
  • عدم مراعاة البدائل. نموذج 13B أسرع بشكل كبير وغالبًا ما يكون كافيًا في الجودة.

الأسئلة الشائعة

هل يمكنني فعلًا تشغيل نموذج 70B على RTX 4090 واحدة؟

نعم، لكن بتحذيرات مهمة. بتكميم Q2 (17.5 GB)، يتسع النموذج في 24 GB من VRAM لكنه يعمل بـ 5-8 token/ثانية وبـ ~70% من جودة FP16. بـ Q4 (35 GB)، تحتاج إلى تفريغ 11 GB إلى RAM النظام، مما يقلّل السرعة إلى 1-3 token/ثانية. لا يصلح أي خيار للدردشة الفورية — فقط للمعالجة بالدُفعات دون اتصال.

أي تكميم مطلوب لكي يتسع 70B في 24 GB من VRAM؟

تكميم Q2 يتسع في 24 GB (17.5 GB حجم النموذج). Q3 (26 GB) يتطلب تفريغ 2 GB من RAM. Q4 (35 GB) يتطلب تفريغ 11 GB ويجعل الاستدلال بطيئًا جدًا. Q5 وما فوق (44-70 GB) لا يمكن أن يتسع حتى مع التفريغ على بطاقة رسوم بسعة 24 GB. Q2 هو الخيار الوحيد الذي يعمل بالكامل في VRAM.

كم يكون نموذج 70B بطيئًا على 24 GB من VRAM؟

بـ Q2 (بالكامل في VRAM): 5-8 token/ثانية. بـ Q3 وتفريغ 2 GB من RAM: 3-5 token/ثانية. بـ Q4 وتفريغ 11 GB من RAM: 1-3 token/ثانية. قارن بنموذج 13B بـ Q5 على بطاقة الرسوم نفسها: 80-100 token/ثانية. إعداد 70B المقيّد أبطأ بـ 10-20× من نموذج أصغر بالحجم الملائم.

هل استخدام نموذج 13B أفضل من 70B مقيّد؟

لمعظم المهام، نعم. نموذج 13B بتكميم Q5 يعمل بـ 80-100 token/ثانية على RTX 4090 ويقدّم جودة عالية. نموذج 70B بـ Q2 يعمل بـ 5-8 token/ثانية بجودة متدهورة. يفوز 13B في السرعة وغالبًا في الجودة العملية بسبب تدهور Q2. استخدم 70B-على-24GB فقط إذا كنت تحتاج إلى قدرات خاصة بـ 70B ويمكنك تحمّل استخدام بالدُفعات حصرًا.

ما أفضل حالة استخدام لـ 70B على 24 GB من VRAM؟

المعالجة بالدُفعات الليلية — مهام ترسل فيها 100+ أمرًا وتسترجع النتائج بعد ساعات. أمثلة: تحليل المستندات، مراجعات الكود بالدُفعات، وسم مجموعات البيانات. الدردشة الفورية غير عملية بـ 1-8 token/ثانية. للاستخدام التفاعلي، RTX 4090 ثانية ($1,800) بتقسيم الطبقات تبلغ ~100 token/ثانية — استثمار أفضل بكثير.

كيف أنزّل نماذج 70B مُكمَّمة بـ Q2؟

عبر Ollama: `ollama pull llama3.1:70b-instruct-q2_K` (يتفاوت التوفر). عبر llama.cpp: نزّل ملفات GGUF Q2_K من Hugging Face (ابحث عن "llama-3.1-70b GGUF"). ينشر TheBloke وbartowski إصدارات مُكمَّمة. تحقق من النموذج بـ `nvidia-smi` بعد التحميل — ينبغي أن يكون استخدام VRAM ~18-20 GB لـ Q2.

المصادر

  • تكميم llama.cpp -- github.com/ggerganov/llama.cpp/blob/master/gguf-py/gguf/quants.py
  • بطاقة النموذج: Llama 3.3 70B -- huggingface.co/meta-llama/Llama-3.1-70B

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs