Key Takeaways
- VRAM = (حجم النموذج × بتات التكميم) ÷ 8
- FP16 = 16 بت، Q8 = 8، Q5 = 5، Q4 = 4 بتات
- مثال: نموذج 13B بـ Q4 = (13 × 4) ÷ 8 = 6.5 GB
- أضف دائمًا هامش 25% للسياق، وحمل النظام، والأمان
- اعتبارًا من أبريل 2026، هذه الصيغة دقيقة ضمن ±10%
حقائق سريعة: متطلبات VRAM لكل GPU
- RTX 4090 (24 GB): Llama 3.3 7B بـ Q4 (3.5 GB)، 13B بـ Q5 (8.1 GB)، 70B بـ Q4 مع تفريغ
- RTX 4080 (16 GB): Llama 3.3 7B بـ Q4 (3.5 GB)، 13B بـ Q5 (8.1 GB)، 32B بـ Q4 (16 GB)
- RTX 4070 Ti (12 GB): Llama 3.3 7B بـ Q4 (3.5 GB)، 13B بـ Q5 (8.1 GB بهامش ضيق)
- M5 Max Mac (36 GB موحّدة): Llama 3.3 13B بـ FP16 (26 GB)، 70B غير ممكن دون تكميم متطرف
- قاعدة عامة: خصّص دائمًا 25–40% إضافية من VRAM للسياق، والمعالجة بالدُفعات، وحمل النظام بما يتجاوز نتيجة الصيغة
في جملة واحدة
تساوي VRAM المطلوبة (GB) معاملات النموذج بالمليارات مضروبة في بتات التكميم (16 لـ FP16، و8 لـ Q8، و4 لـ Q4، إلخ)، مقسومة على 8.
بعبارات بسيطة
تخيّل VRAM كمساحة على رف. الكتب الأكبر (النماذج بمعاملات أكثر مثل 70B) تحتاج مساحة أكبر. الكتب الأصغر (تكميم Q4) تشغل مساحة أقل من الكبيرة (FP16). تخبرك الصيغة بعدد "الأرفف" (GB) التي تحتاجها بالضبط. اترك دائمًا مساحة فارغة إضافية للمحادثات، وعدة طلبات متزامنة، وبرمجيات النظام.
ما هي صيغة VRAM؟
صيغة متطلب VRAM بسيطة بشكل خادع:
💡 نصيحة احترافية: تحسب هذه الصيغة أوزان النموذج فقط. الاستخدام الفعلي لـ VRAM أعلى بنسبة 25–40% بسبب السياق، والمعالجة بالدُفعات، وحمل النظام. أضف دائمًا هامش أمان.
VRAM (GB) = (Model Size in Billions × Quantization Bits) ÷ 8
Example:
- 7B model at 4-bit quantization
- (7 × 4) ÷ 8 = 3.5 GB
- 13B model at 5-bit quantization
- (13 × 5) ÷ 8 = 8.125 GB
- 70B model at 8-bit quantization
- (70 × 8) ÷ 8 = 70 GBحاسبة VRAM التفاعلية
استخدم هذه الحاسبة لحساب متطلبات VRAM الدقيقة لأي مجموعة نموذج، وتكميم، وسياق، وحجم دفعة. اختر تكوينك وتحقق من وحدات GPU المتوافقة.
Popular Models
Base Model
6.50 GB
Context OH
1.50 GB
Batch OH
0.00 GB
System OH
1.00 GB
Total Minimum
9.00 GB
Recommended (with 25% safety margin)
11.25 GB
👉 Look for a GPU with at least 11.25 GB VRAM
Compatible GPUs
RTX 3060 (12 GB)
0.8 GB headroom
RTX 4070 (12 GB)
0.8 GB headroom
RTX 4070 Ti (12 GB)
0.8 GB headroom
RTX 4080 (16 GB)
4.8 GB headroom
RTX 4090 (24 GB)
12.8 GB headroom
Mac mini M5 (16 GB) (16 GB)
4.8 GB headroom
Mac mini M4 (16 GB) (16 GB)
4.8 GB headroom
MacBook Pro (24 GB) (24 GB)
12.8 GB headroom
M3 Max (36 GB) (36 GB)
24.8 GB headroom
💡 Pro Tips:
- Always use the "with safety margin" figure when buying a GPU
- Q4 gives 90-95% quality with 25% size reduction. Q5 is better if you have room
- Context overhead grows with conversation length. Budget 1-3 GB for typical usage
- Batch size matters for multi-user APIs. Single-user chat can ignore batch overhead
📋 Share this configuration:
ماذا تعني مستويات التكميم؟
🔍 فكرة رئيسية: يقايض التكميم حجم الملف بالجودة. Q5 هو النقطة المثلى (95% جودة، أصغر بـ 68%). Q4 مقبول لمعظم المستخدمين. Q3 وما دونه فقط لأجهزة الحافة أو عندما يكون VRAM محدودًا بشدة.
| التكميم | تقليل الحجم | الجودة | السرعة | حالة الاستخدام |
|---|---|---|---|---|
| — | — | — | — | — |
| — | — | — | — | — |
| — | — | — | — | — |
| — | — | — | — | — |
| — | — | — | — | — |
| — | — | — | — | — |
| — | — | — | — | — |
جدول مرجعي سريع: VRAM حسب النموذج والتكميم
| النموذج | FP16 | Q8 | Q5 | Q4 |
|---|---|---|---|---|
| — | 6 GB | 3 GB | 1.9 GB | 1.5 GB |
| — | 14 GB | 7 GB | 4.4 GB | 3.5 GB |
| — | 26 GB | 13 GB | 8.1 GB | 6.5 GB |
| — | 64 GB | 32 GB | 20 GB | 16 GB |
| — | 140 GB | 70 GB | 43.75 GB | 35 GB |
أمثلة من العالم الحقيقي
حسابات VRAM عملية لسيناريوهات شائعة:
⚠️ تحذير: هذه الحسابات لأوزان النموذج فقط. أضف 25–40% للسياق، والمعالجة بالدُفعات، وحمل النظام. مثال: 13B Q5 = 8.1 GB نموذج + 2–3 GB حمل إضافي = 10–11 GB فعلية.
- RTX 4070 Ti (12 GB): Llama 3.3 7B بـ Q4 = 3.5 GB ✓ (هامش كبير). Llama 3.3 13B بـ Q5 = 8.1 GB ✓ (ضيق، لكنه يعمل دون سياق أو معالجة بالدُفعات).
- RTX 4090 (24 GB): Llama 3.3 70B بـ Q5 = 43.75 GB ✗ (كبير جدًا). Llama 3.3 70B بـ Q4 = 35 GB ✗ (لا يزال كبيرًا جدًا). Llama 3.3 70B بـ Q4 مع تفريغ = يعمل (بطيء، 3–5 tok/ثانية).
- M5 Max Mac (36 GB): Llama 3.3 13B بـ FP16 = 26 GB ✓ (يعمل). Llama 3.3 70B = مستحيل (حتى بـ Q2، ~70% فقدان جودة).
أي نموذج LLM محلي يناسب وحدة GPU لديك؟ دليل 2026
استخدم الحاسبة التفاعلية أعلاه لإيجاد ملاءمتك الدقيقة. فيما يلي سيناريوهات GPU شائعة ونماذج موصى بها.
- RTX 3060 (12 GB): أفضل نموذج: Qwen3 7B Q5 (4.4 GB) ✓. بديل: Llama 3.2 8B Q4 (4 GB) ✓. غير ممكن: نماذج 32B+.
- RTX 4070 (12 GB): أفضل نموذج: Qwen3 13B Q4 (6.5 GB) ✓. بهامش: Llama 3.2 8B Q5 (5 GB) ✓. غير ممكن: نماذج 32B.
- RTX 4070 Ti (12 GB): أفضل نموذج: Qwen3 13B Q5 (8.1 GB) ✓. ضيق: Llama 3.3 13B Q4 (6.5 GB) ✓. غير مثالي: المعالجة بالدُفعات.
- RTX 4080 (16 GB): أفضل نموذج: Qwen3 32B Q4 (16 GB) ✓ ضيق. مريح: Mistral 3.1 24B Q5 (15 GB) ✓. موصى به: Llama 3.3 13B Q8 (13 GB) ✓.
- RTX 4090 (24 GB): أفضل نموذج: Qwen3 32B Q5 (20 GB) ✓. مع تفريغ: Llama 3.3 70B Q4 (35 GB – يحتاج تفريغًا). مريح: أي 32B بـ Q5/Q8.
- RTX 5090 (32 GB، إن توفّرت): أفضل نموذج: Llama 3.3 70B Q4 (35 GB – ضيق). أفضل: Qwen3 72B Q3 (27 GB) ✓. مريح: 70B بـ Q5+ مع معالجة بالدُفعات.
ما مدى دقة الصيغة؟
الصيغة دقيقة ضمن ±10% لمعظم الحالات. يتفاوت الاستخدام الفعلي لـ VRAM حسب التنفيذ، وبنية النموذج، وتحسينات محرك الاستدلال.
تشمل مصادر التباين: صيغ تكميم مختلفة (GGUF مقابل safetensors مقابل AWQ)، وبنية النموذج (Transformer مقابل غير Transformer)، وتحسينات خاصة بمحرك الاستدلال (vLLM، llama.cpp، Ollama).
اعتبارًا من أبريل 2026، عامِل الصيغة كتقدير متحفظ. أضف دائمًا هامش 25% عند شراء GPU لمراعاة حمل السياق، والمعالجة بالدُفعات، وعمليات النظام.
أخطاء شائعة في حساب VRAM
- نسيان حمل السياق. نموذج 7B بـ Q4 يشغل 3.5 GB، لكن مع سياق 4k يحتاج 5–6 GB إجمالًا.
- استخدام حجم نموذج HuggingFace دون مراعاة التكميم. 70B تعني 70 مليار معامل، وليس 70 GB من VRAM.
- عدم احتساب حمل النظام. لا تحصل النماذج أبدًا على كل VRAM في GPU. احجز 1–2 GB لنظام التشغيل ومحرك الاستدلال.
- شراء GPU بحجم محسوب بالضبط. اشترِ دائمًا 25% أكثر. إذا حسبت 18 GB، فاقتنِ GPU بسعة 24 GB.
اعتبارات النشر الإقليمي
الاتحاد الأوروبي (GDPR): يضمن الاستدلال المحلي (داخل المنشأة) الامتثال لإقامة البيانات بموجب GDPR. تشغيل النماذج على وحدة GPU الخاصة بك يُبقي بيانات المستخدمين داخل البلد. تساعدك حاسبة VRAM هذه على تحديد حجم العتاد لعمليات النشر التي تعطي الأولوية للخصوصية.
منطقة الخليج / السعودية (PDPL): يتطلب نظام حماية البيانات الشخصية (PDPL) في السعودية وأطر السيادة على الذكاء الاصطناعي في الإمارات معالجة دقيقة للبيانات الشخصية. يقلّل الاستدلال المحلي لنماذج LLM نقل البيانات إلى خوادم خارجية. استخدم هذه الحاسبة لتحديد حجم الأنظمة لعمليات النشر المؤسسية على عتاد سيادي مع نماذج عربية المنشأ مثل Jais وALLaM وFalcon.
اليابان (APPI): يتطلب قانون حماية المعلومات الشخصية (APPI) معالجة دقيقة للبيانات. يقلّل استدلال LLM على الجهاز نقل ومعالجة البيانات خارج اليابان. استخدم هذه الحاسبة لتحديد حجم الأنظمة لعمليات النشر المؤسسية اليابانية.
الصين (قانون أمن البيانات): يتطلب قانون أمن البيانات الصيني لعام 2021 إقامة البيانات داخل الحدود الصينية. يتوافق الاستدلال المحلي لـ LLM على خوادم وطنية (Alibaba Cloud، Tencent Cloud) مع اللوائح. تنطبق هذه الصيغة على تحديد حجم تلك العمليات بنماذج محسّنة للصين مثل Qwen3.
في جميع المناطق، يوفّر الاستدلال المحلي ضمانات أقوى لخصوصية البيانات من واجهات API السحابية. حاسبة VRAM هذه أساسية لتصميم أنظمة ذكاء اصطناعي متوافقة وتحافظ على الخصوصية.
الأسئلة الشائعة: VRAM ومتطلبات GPU
هل تعمل الصيغة لجميع أنواع النماذج؟
نعم. تنطبق الصيغة (مليارات النموذج × بتات التكميم) ÷ 8 على جميع النماذج القائمة على Transformer (Llama، Qwen، Mistral، Claude، إلخ). البنى غير القائمة على Transformer (RNN، إلخ) نادرة وقد تتطلب تعديلات.
أي تكميم يجب أن أستخدم؟
لمعظم الحالات: يقدّم Q5 أفضل توازن (95% جودة، 68% تقليل حجم). لوحدات GPU الاستهلاكية: Q4 هو المعيار (90–95% جودة، 75% تقليل). للإنتاج: Q8 إذا سمح VRAM (99% جودة). تجنّب Q3 وما دونه إلا إذا لم يكن لديك خيار آخر.
كم RAM النظام التي أحتاجها؟
الحد الأدنى 16 GB للتفريغ (offloading). إذا استخدمت تفريغ VRAM (الفائض إلى CPU)، تعمل RAM النظام كاحتياطي. للمعالجة بالدُفعات، أضف 8–16 GB من RAM النظام بما يتجاوز متطلبات تفريغ النموذج. لدردشة مستخدم واحد، 16 GB كافية.
هل يؤثر حجم الدفعة في حساب VRAM؟
نعم. تحسب الصيغة VRAM لطلب واحد. يضيف حجم الدفعة VRAM خطيًا: كل طلب متزامن يضيف بين 500 MB و2 GB حسب طول السياق. مع batch=4، أضف بين 2 و8 GB إلى المقدار المحسوب.
هل يمكنني تشغيل نموذج 70B على GPU بسعة 12 GB؟
فقط بتكميم متطرف (Q2، ~70% فقدان جودة) وتفريغ إلى CPU (بطيء جدًا، 1–3 token/ثانية). غير عملي. خيار أفضل: استخدم نموذج 13B بـ Q4 (نفس VRAM، أسرع بكثير وجودة أفضل).
ماذا لو كان استخدام VRAM الفعلي أقل من المحسوب؟
الصيغة متحفظة وتشمل الحمل الإضافي. الاستخدام الفعلي الأقل يعني هامشًا أكبر للمعالجة بالدُفعات، أو سياقات أطول، أو هامش أمان. استخدم nvidia-smi لقياس الاستخدام الفعلي ثم قِس أداء نموذجك للتأكيد.
المصادر
- مواصفة GGUF -- وثائق ggerganov/ggml حول صيغة الملف المكمَّم.
- وثائق تكميم Transformers -- الدليل الرسمي لـ Hugging Face حول طرق التكميم.
- وثائق Ollama -- الأدلة الرسمية لـ Ollama لإدارة النماذج.
- دليل أداء vLLM -- وثائق تحسين إطار vLLM.
- تحدّ VRAM لديك حجم النموذج، لكن حجم النموذج ليس الحد الوحيد لجودة المخرجات. نوافذ السياق الأكبر تتيح استجابات أفضل: شرح نوافذ السياق يغطي كيفية العمل ضمن القيود.