Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/حاسبة ⁨VRAM 2026⁩: متطلبات ⁨GPU⁩ لنماذج ⁨LLM 7B/13B/70B⁩ (⁨Q4⁩، ⁨Q5⁩، ⁨Q8⁩)
Hardware & Performance

حاسبة ⁨VRAM 2026⁩: متطلبات ⁨GPU⁩ لنماذج ⁨LLM 7B/13B/70B⁩ (⁨Q4⁩، ⁨Q5⁩، ⁨Q8⁩)

·10 دقائق قراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

يشرح هذا الدليل كيفية حساب متطلبات VRAM الدقيقة لأي مجموعة نموذج وعتاد. الصيغة بسيطة: (حجم النموذج بـ GB × بتات التكميم) ÷ 8 = VRAM المطلوبة.

حاسبة VRAM تفاعلية لنماذج LLM المحلية. أدخل حجم النموذج، والتكميم، وطول السياق، وحجم الدفعة لحساب مقدار VRAM GPU الذي تحتاجه بالضبط. تدعم النماذج من 1B إلى 405B بـ FP16 وQ8 وQ5 وQ4. مُحدّثة في أبريل 2026 بتحليل توافق لـ RTX 4090 و4080 و3060 وحسابات الحمل الإضافي.

العرض التقديمي: حاسبة ⁨VRAM 2026⁩: متطلبات ⁨GPU⁩ لنماذج ⁨LLM 7B/13B/70B⁩ (⁨Q4⁩، ⁨Q5⁩، ⁨Q8⁩)

يغطي العرض التقديمي أدناه: صيغة VRAM (مليارات النموذج × بتات التكميم) ÷ 8، ومستويات التكميم Q2–FP16 بمقايضات الجودة، وجدول مرجعي سريع (نماذج 3B–70B)، وسيناريوهات GPU من العالم الحقيقي (RTX 4090، 4080، M5 Max)، والامتثال الإقليمي (GDPR للاتحاد الأوروبي، وAPPI لليابان، وقانون أمن البيانات الصيني). نزّل ملف PDF كبطاقة مرجعية لحاسبة VRAM.

تصفّح الشرائح أدناه أو نزّلها بصيغة PDF للرجوع إليها دون اتصال. تنزيل البطاقة المرجعية (PDF)

Key Takeaways

  • VRAM = (حجم النموذج × بتات التكميم) ÷ 8
  • FP16 = 16 بت، Q8 = 8، Q5 = 5، Q4 = 4 بتات
  • مثال: نموذج 13B بـ Q4 = (13 × 4) ÷ 8 = 6.5 GB
  • أضف دائمًا هامش 25% للسياق، وحمل النظام، والأمان
  • اعتبارًا من أبريل 2026، هذه الصيغة دقيقة ضمن ±10%

حقائق سريعة: متطلبات VRAM لكل GPU

  • RTX 4090 (24 GB): Llama 3.3 7B بـ Q4 (3.5 GB)، 13B بـ Q5 (8.1 GB)، 70B بـ Q4 مع تفريغ
  • RTX 4080 (16 GB): Llama 3.3 7B بـ Q4 (3.5 GB)، 13B بـ Q5 (8.1 GB)، 32B بـ Q4 (16 GB)
  • RTX 4070 Ti (12 GB): Llama 3.3 7B بـ Q4 (3.5 GB)، 13B بـ Q5 (8.1 GB بهامش ضيق)
  • M5 Max Mac (36 GB موحّدة): Llama 3.3 13B بـ FP16 (26 GB)، 70B غير ممكن دون تكميم متطرف
  • قاعدة عامة: خصّص دائمًا 25–40% إضافية من VRAM للسياق، والمعالجة بالدُفعات، وحمل النظام بما يتجاوز نتيجة الصيغة

في جملة واحدة

تساوي VRAM المطلوبة (GB) معاملات النموذج بالمليارات مضروبة في بتات التكميم (16 لـ FP16، و8 لـ Q8، و4 لـ Q4، إلخ)، مقسومة على 8.

بعبارات بسيطة

تخيّل VRAM كمساحة على رف. الكتب الأكبر (النماذج بمعاملات أكثر مثل 70B) تحتاج مساحة أكبر. الكتب الأصغر (تكميم Q4) تشغل مساحة أقل من الكبيرة (FP16). تخبرك الصيغة بعدد "الأرفف" (GB) التي تحتاجها بالضبط. اترك دائمًا مساحة فارغة إضافية للمحادثات، وعدة طلبات متزامنة، وبرمجيات النظام.

ما هي صيغة VRAM؟

صيغة متطلب VRAM بسيطة بشكل خادع:

💡 نصيحة احترافية: تحسب هذه الصيغة أوزان النموذج فقط. الاستخدام الفعلي لـ VRAM أعلى بنسبة 25–40% بسبب السياق، والمعالجة بالدُفعات، وحمل النظام. أضف دائمًا هامش أمان.

bash
VRAM (GB) = (Model Size in Billions × Quantization Bits) ÷ 8

Example:
- 7B model at 4-bit quantization
- (7 × 4) ÷ 8 = 3.5 GB

- 13B model at 5-bit quantization
- (13 × 5) ÷ 8 = 8.125 GB

- 70B model at 8-bit quantization
- (70 × 8) ÷ 8 = 70 GB
صيغة VRAM مع 3 أمثلة حساب: نموذج 7B بـ Q4 = 3.5 GB، 13B بـ Q5 = 8.1 GB، 70B بـ Q8 = 70 GB. أضف دائمًا هامش 25–40% للسياق، والمعالجة بالدُفعات، وحمل النظام.
صيغة VRAM مع 3 أمثلة حساب: نموذج 7B بـ Q4 = 3.5 GB، 13B بـ Q5 = 8.1 GB، 70B بـ Q8 = 70 GB. أضف دائمًا هامش 25–40% للسياق، والمعالجة بالدُفعات، وحمل النظام.

حاسبة VRAM التفاعلية

استخدم هذه الحاسبة لحساب متطلبات VRAM الدقيقة لأي مجموعة نموذج، وتكميم، وسياق، وحجم دفعة. اختر تكوينك وتحقق من وحدات GPU المتوافقة.

Popular Models

Base Model

6.50 GB

Context OH

1.50 GB

Batch OH

0.00 GB

System OH

1.00 GB

Total Minimum

9.00 GB

Recommended (with 25% safety margin)

11.25 GB

👉 Look for a GPU with at least 11.25 GB VRAM

Compatible GPUs

RTX 3060 (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4070 (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4070 Ti (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4080 (16 GB)

4.8 GB headroom

✅ Fits

RTX 4090 (24 GB)

12.8 GB headroom

✅ Fits

Mac mini M5 (16 GB) (16 GB)

4.8 GB headroom

✅ Fits

Mac mini M4 (16 GB) (16 GB)

4.8 GB headroom

✅ Fits

MacBook Pro (24 GB) (24 GB)

12.8 GB headroom

✅ Fits

M3 Max (36 GB) (36 GB)

24.8 GB headroom

✅ Fits

💡 Pro Tips:

  • Always use the "with safety margin" figure when buying a GPU
  • Q4 gives 90-95% quality with 25% size reduction. Q5 is better if you have room
  • Context overhead grows with conversation length. Budget 1-3 GB for typical usage
  • Batch size matters for multi-user APIs. Single-user chat can ignore batch overhead

📋 Share this configuration:

Loading...

ماذا تعني مستويات التكميم؟

🔍 فكرة رئيسية: يقايض التكميم حجم الملف بالجودة. Q5 هو النقطة المثلى (95% جودة، أصغر بـ 68%). Q4 مقبول لمعظم المستخدمين. Q3 وما دونه فقط لأجهزة الحافة أو عندما يكون VRAM محدودًا بشدة.

التكميمتقليل الحجمالجودةالسرعةحالة الاستخدام
مقارنة مستويات التكميم: FP16 (100% جودة)، Q8 (99%)، Q5 (95%، موصى به)، Q4 (90–95%)، Q3 (80–85%)، Q2 (70%). يقلّص Q5 نموذج 7B من 14 GB إلى 4.4 GB بفقدان جودة 5% فقط.
مقارنة مستويات التكميم: FP16 (100% جودة)، Q8 (99%)، Q5 (95%، موصى به)، Q4 (90–95%)، Q3 (80–85%)، Q2 (70%). يقلّص Q5 نموذج 7B من 14 GB إلى 4.4 GB بفقدان جودة 5% فقط.

جدول مرجعي سريع: VRAM حسب النموذج والتكميم

النموذجFP16Q8Q5Q4
6 GB3 GB1.9 GB1.5 GB
14 GB7 GB4.4 GB3.5 GB
26 GB13 GB8.1 GB6.5 GB
64 GB32 GB20 GB16 GB
140 GB70 GB43.75 GB35 GB
مصفوفة مرجعية سريعة لـ VRAM: نماذج من 3B إلى 70B بـ FP16 وQ8 وQ5 وQ4. أخضر = يتسع في GPU بسعة 12 GB. كهرماني = يتطلب 16–24 GB. أحمر = يتطلب 40+ GB أو عدة وحدات GPU.
مصفوفة مرجعية سريعة لـ VRAM: نماذج من 3B إلى 70B بـ FP16 وQ8 وQ5 وQ4. أخضر = يتسع في GPU بسعة 12 GB. كهرماني = يتطلب 16–24 GB. أحمر = يتطلب 40+ GB أو عدة وحدات GPU.

أمثلة من العالم الحقيقي

حسابات VRAM عملية لسيناريوهات شائعة:

⚠️ تحذير: هذه الحسابات لأوزان النموذج فقط. أضف 25–40% للسياق، والمعالجة بالدُفعات، وحمل النظام. مثال: 13B Q5 = 8.1 GB نموذج + 2–3 GB حمل إضافي = 10–11 GB فعلية.

  • RTX 4070 Ti (12 GB): Llama 3.3 7B بـ Q4 = 3.5 GB ✓ (هامش كبير). Llama 3.3 13B بـ Q5 = 8.1 GB ✓ (ضيق، لكنه يعمل دون سياق أو معالجة بالدُفعات).
  • RTX 4090 (24 GB): Llama 3.3 70B بـ Q5 = 43.75 GB ✗ (كبير جدًا). Llama 3.3 70B بـ Q4 = 35 GB ✗ (لا يزال كبيرًا جدًا). Llama 3.3 70B بـ Q4 مع تفريغ = يعمل (بطيء، 3–5 tok/ثانية).
  • M5 Max Mac (36 GB): Llama 3.3 13B بـ FP16 = 26 GB ✓ (يعمل). Llama 3.3 70B = مستحيل (حتى بـ Q2، ~70% فقدان جودة).
سيناريوهات GPU من العالم الحقيقي: RTX 4090 (24 GB)، RTX 4080 (16 GB)، RTX 4070 Ti (12 GB)، M5 Max Mac (36 GB)، RTX 3060 (12 GB): أي نماذج Llama 3.3 يمكن لكلٍّ تشغيلها على مستويات تكميم مختلفة.
سيناريوهات GPU من العالم الحقيقي: RTX 4090 (24 GB)، RTX 4080 (16 GB)، RTX 4070 Ti (12 GB)، M5 Max Mac (36 GB)، RTX 3060 (12 GB): أي نماذج Llama 3.3 يمكن لكلٍّ تشغيلها على مستويات تكميم مختلفة.

ما حمل VRAM المخفي الذي يجب أن تحتسبه؟

تحسب الصيغة أوزان النموذج فقط. سيكون الاستخدام الفعلي لـ VRAM أعلى بسبب عدة عوامل. خصّص 25–40% إضافية فوق المقدار المحسوب.

تخزّن نافذة السياق (ذاكرة المفتاح-القيمة) سجل المحادثة أثناء الاستدلال. سياق 4k token يستخدم نحو 2–3 GB لنموذج 7B.

📌 نقطة رئيسية: تزيد المعالجة بالدُفعات استخدام VRAM خطيًا. كل طلب متزامن إضافي (عند معالجة عدة طلبات معًا) يستهلك بين 500 MB و2 GB ذاكرة إضافية. مع batch=4، اضرب VRAM الطلب الواحد في 4 وأضف الحمل الإضافي.

يحجز حمل نظام التشغيل وإطار الاستدلال (Ollama، vLLM، llama.cpp) بين 500 MB و1 GB. حافظ دائمًا على هامش أمان عند اختيار GPU.

تفصيل حمل VRAM المخفي: نافذة السياق (2–3 GB لـ 4k token)، والمعالجة بالدُفعات (×4 لـ batch=4)، وحمل النظام (500 MB–1 GB)، وهامش أمان إجمالي 25–40%.
تفصيل حمل VRAM المخفي: نافذة السياق (2–3 GB لـ 4k token)، والمعالجة بالدُفعات (×4 لـ batch=4)، وحمل النظام (500 MB–1 GB)، وهامش أمان إجمالي 25–40%.

أي نموذج LLM محلي يناسب وحدة GPU لديك؟ دليل 2026

استخدم الحاسبة التفاعلية أعلاه لإيجاد ملاءمتك الدقيقة. فيما يلي سيناريوهات GPU شائعة ونماذج موصى بها.

  • RTX 3060 (12 GB): أفضل نموذج: Qwen3 7B Q5 (4.4 GB) ✓. بديل: Llama 3.2 8B Q4 (4 GB) ✓. غير ممكن: نماذج 32B+.
  • RTX 4070 (12 GB): أفضل نموذج: Qwen3 13B Q4 (6.5 GB) ✓. بهامش: Llama 3.2 8B Q5 (5 GB) ✓. غير ممكن: نماذج 32B.
  • RTX 4070 Ti (12 GB): أفضل نموذج: Qwen3 13B Q5 (8.1 GB) ✓. ضيق: Llama 3.3 13B Q4 (6.5 GB) ✓. غير مثالي: المعالجة بالدُفعات.
  • RTX 4080 (16 GB): أفضل نموذج: Qwen3 32B Q4 (16 GB) ✓ ضيق. مريح: Mistral 3.1 24B Q5 (15 GB) ✓. موصى به: Llama 3.3 13B Q8 (13 GB) ✓.
  • RTX 4090 (24 GB): أفضل نموذج: Qwen3 32B Q5 (20 GB) ✓. مع تفريغ: Llama 3.3 70B Q4 (35 GB – يحتاج تفريغًا). مريح: أي 32B بـ Q5/Q8.
  • RTX 5090 (32 GB، إن توفّرت): أفضل نموذج: Llama 3.3 70B Q4 (35 GB – ضيق). أفضل: Qwen3 72B Q3 (27 GB) ✓. مريح: 70B بـ Q5+ مع معالجة بالدُفعات.

ما مدى دقة الصيغة؟

الصيغة دقيقة ضمن ±10% لمعظم الحالات. يتفاوت الاستخدام الفعلي لـ VRAM حسب التنفيذ، وبنية النموذج، وتحسينات محرك الاستدلال.

تشمل مصادر التباين: صيغ تكميم مختلفة (GGUF مقابل safetensors مقابل AWQ)، وبنية النموذج (Transformer مقابل غير Transformer)، وتحسينات خاصة بمحرك الاستدلال (vLLM، llama.cpp، Ollama).

اعتبارًا من أبريل 2026، عامِل الصيغة كتقدير متحفظ. أضف دائمًا هامش 25% عند شراء GPU لمراعاة حمل السياق، والمعالجة بالدُفعات، وعمليات النظام.

دقة صيغة VRAM ±10%: التباين ناتج عن صيغة التكميم (GGUF مقابل GPTQ مقابل AWQ)، وبنية النموذج (Transformer مقابل MoE)، ومحرك الاستدلال (vLLM مقابل llama.cpp مقابل Ollama).
دقة صيغة VRAM ±10%: التباين ناتج عن صيغة التكميم (GGUF مقابل GPTQ مقابل AWQ)، وبنية النموذج (Transformer مقابل MoE)، ومحرك الاستدلال (vLLM مقابل llama.cpp مقابل Ollama).

أخطاء شائعة في حساب VRAM

  • نسيان حمل السياق. نموذج 7B بـ Q4 يشغل 3.5 GB، لكن مع سياق 4k يحتاج 5–6 GB إجمالًا.
  • استخدام حجم نموذج HuggingFace دون مراعاة التكميم. 70B تعني 70 مليار معامل، وليس 70 GB من VRAM.
  • عدم احتساب حمل النظام. لا تحصل النماذج أبدًا على كل VRAM في GPU. احجز 1–2 GB لنظام التشغيل ومحرك الاستدلال.
  • شراء GPU بحجم محسوب بالضبط. اشترِ دائمًا 25% أكثر. إذا حسبت 18 GB، فاقتنِ GPU بسعة 24 GB.
4 أخطاء VRAM شائعة: نسيان حمل السياق (يضيف 1.5–3 GB)، والخلط بين 70B معاملًا و70 GB من VRAM، وتجاهل 1–2 GB حمل نظام، وشراء GPU بحجم محسوب بالضبط دون هامش 25%.
4 أخطاء VRAM شائعة: نسيان حمل السياق (يضيف 1.5–3 GB)، والخلط بين 70B معاملًا و70 GB من VRAM، وتجاهل 1–2 GB حمل نظام، وشراء GPU بحجم محسوب بالضبط دون هامش 25%.

اعتبارات النشر الإقليمي

الاتحاد الأوروبي (GDPR): يضمن الاستدلال المحلي (داخل المنشأة) الامتثال لإقامة البيانات بموجب GDPR. تشغيل النماذج على وحدة GPU الخاصة بك يُبقي بيانات المستخدمين داخل البلد. تساعدك حاسبة VRAM هذه على تحديد حجم العتاد لعمليات النشر التي تعطي الأولوية للخصوصية.

منطقة الخليج / السعودية (PDPL): يتطلب نظام حماية البيانات الشخصية (PDPL) في السعودية وأطر السيادة على الذكاء الاصطناعي في الإمارات معالجة دقيقة للبيانات الشخصية. يقلّل الاستدلال المحلي لنماذج LLM نقل البيانات إلى خوادم خارجية. استخدم هذه الحاسبة لتحديد حجم الأنظمة لعمليات النشر المؤسسية على عتاد سيادي مع نماذج عربية المنشأ مثل Jais وALLaM وFalcon.

اليابان (APPI): يتطلب قانون حماية المعلومات الشخصية (APPI) معالجة دقيقة للبيانات. يقلّل استدلال LLM على الجهاز نقل ومعالجة البيانات خارج اليابان. استخدم هذه الحاسبة لتحديد حجم الأنظمة لعمليات النشر المؤسسية اليابانية.

الصين (قانون أمن البيانات): يتطلب قانون أمن البيانات الصيني لعام 2021 إقامة البيانات داخل الحدود الصينية. يتوافق الاستدلال المحلي لـ LLM على خوادم وطنية (Alibaba Cloud، Tencent Cloud) مع اللوائح. تنطبق هذه الصيغة على تحديد حجم تلك العمليات بنماذج محسّنة للصين مثل Qwen3.

في جميع المناطق، يوفّر الاستدلال المحلي ضمانات أقوى لخصوصية البيانات من واجهات API السحابية. حاسبة VRAM هذه أساسية لتصميم أنظمة ذكاء اصطناعي متوافقة وتحافظ على الخصوصية.

الأسئلة الشائعة: VRAM ومتطلبات GPU

هل تعمل الصيغة لجميع أنواع النماذج؟

نعم. تنطبق الصيغة (مليارات النموذج × بتات التكميم) ÷ 8 على جميع النماذج القائمة على Transformer (Llama، Qwen، Mistral، Claude، إلخ). البنى غير القائمة على Transformer (RNN، إلخ) نادرة وقد تتطلب تعديلات.

أي تكميم يجب أن أستخدم؟

لمعظم الحالات: يقدّم Q5 أفضل توازن (95% جودة، 68% تقليل حجم). لوحدات GPU الاستهلاكية: Q4 هو المعيار (90–95% جودة، 75% تقليل). للإنتاج: Q8 إذا سمح VRAM (99% جودة). تجنّب Q3 وما دونه إلا إذا لم يكن لديك خيار آخر.

كم RAM النظام التي أحتاجها؟

الحد الأدنى 16 GB للتفريغ (offloading). إذا استخدمت تفريغ VRAM (الفائض إلى CPU)، تعمل RAM النظام كاحتياطي. للمعالجة بالدُفعات، أضف 8–16 GB من RAM النظام بما يتجاوز متطلبات تفريغ النموذج. لدردشة مستخدم واحد، 16 GB كافية.

هل يؤثر حجم الدفعة في حساب VRAM؟

نعم. تحسب الصيغة VRAM لطلب واحد. يضيف حجم الدفعة VRAM خطيًا: كل طلب متزامن يضيف بين 500 MB و2 GB حسب طول السياق. مع batch=4، أضف بين 2 و8 GB إلى المقدار المحسوب.

هل يمكنني تشغيل نموذج 70B على GPU بسعة 12 GB؟

فقط بتكميم متطرف (Q2، ~70% فقدان جودة) وتفريغ إلى CPU (بطيء جدًا، 1–3 token/ثانية). غير عملي. خيار أفضل: استخدم نموذج 13B بـ Q4 (نفس VRAM، أسرع بكثير وجودة أفضل).

ماذا لو كان استخدام VRAM الفعلي أقل من المحسوب؟

الصيغة متحفظة وتشمل الحمل الإضافي. الاستخدام الفعلي الأقل يعني هامشًا أكبر للمعالجة بالدُفعات، أو سياقات أطول، أو هامش أمان. استخدم nvidia-smi لقياس الاستخدام الفعلي ثم قِس أداء نموذجك للتأكيد.

المصادر

  • مواصفة GGUF -- وثائق ggerganov/ggml حول صيغة الملف المكمَّم.
  • وثائق تكميم Transformers -- الدليل الرسمي لـ Hugging Face حول طرق التكميم.
  • وثائق Ollama -- الأدلة الرسمية لـ Ollama لإدارة النماذج.
  • دليل أداء vLLM -- وثائق تحسين إطار vLLM.
  • تحدّ VRAM لديك حجم النموذج، لكن حجم النموذج ليس الحد الوحيد لجودة المخرجات. نوافذ السياق الأكبر تتيح استجابات أفضل: شرح نوافذ السياق يغطي كيفية العمل ضمن القيود.

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs