ما هو تكميم نماذج LLM؟
يقلّل تكميم LLM حجم النموذج عبر ضغط الأوزان من 16 بت إلى تنسيقات أقل دقة مثل Q4 أو Q8.
- Q2–Q3 ← أسرع، جودة أقل
- Q4 ← أفضل توازن (موصى به)
- Q5–Q6 ← جودة أعلى، RAM أكثر
- Q8 ← دقة شبه كاملة، أبطأ
Key Takeaways
- Q4 (4 بت): توفير 87.5% من VRAM، فقدان جودة ~1%. استخدمه لكل شيء.
- Q5 (5 بت): توفير 84% من VRAM، فقدان جودة ~0.5%. غير ضروري أبدًا؛ Q4 وQ8 يحيطان بـ Q5.
- Q8 (8 بت): توفير 50% من VRAM، فقدان جودة <0.1%. للمثاليين الذين يملكون فائضًا من VRAM.
- FP32 (32 بت): دقة كاملة، فقدان 0%، توفير 0%. غير عملي؛ تجاهله.
- السرعة: جميع مستويات التكميم تعمل بـ tokens/ثانية متطابقة (محدودة بالذاكرة، لا بالحوسبة).
- استخدام VRAM (نموذج Llama 70B): FP32=280 GB، Q8=140 GB، Q5=88 GB، Q4=70 GB.
- التوصية: استخدم Q4 لـ 7B–70B. استخدم Q8 فقط إذا كان لديك 32 GB+ من VRAM وتحتاج إلى جودة لا تشوبها شائبة.
- لا أحد يستخدم Q5 لأن Q4 + تحسين صغير = أفضل من Q5 + نفس الجهاز.
حقائق سريعة
- توفير VRAM مع Q4: 87.5% مقابل FP32 (70 GB لـ Llama 3 70B)
- فقدان جودة Q4: <1.2% في معيار MMLU
- توفير VRAM مع Q8: 50% مقابل FP32 (140 GB لـ Llama 3 70B)
- فرق السرعة: 0% — جميع مستويات التكميم تعمل بـ tokens/ثانية متطابقة
- حكم Q5: منطقة ميتة — Q4 + نموذج أكبر = نتيجة أفضل بنفس VRAM
مقارنة مستويات التكميم: من Q2 إلى Q8
| Cuantización | Uso de RAM | Velocidad | Calidad | Ideal para |
|---|---|---|---|---|
| Q2 | منخفض جدًا | سريع جدًا | ضعيفة | التجارب |
| Q3 | منخفض | سريع | منخفضة | الأجهزة الصغيرة |
| Q4 | متوسط | سريع | جيدة | معظم المستخدمين |
| Q5 | متوسط+ | متوسط | جيدة جدًا | البرمجة |
| Q6 | مرتفع | أبطأ | ممتازة | التركيز على الدقة |
| Q8 | مرتفع جدًا | بطيء | شبه FP16 | قياس الأداء |

أفضل مستوى تكميم حسب حالة الاستخدام
- 8 GB من RAM: Q3 أو Q4 (نماذج صغيرة بحجم 7B فقط)
- 16 GB من RAM: Q4_K_M (موصى به لمعظم الحواسيب المحمولة)
- 32 GB من RAM: Q5 أو Q6 أو Q8 (نماذج أكبر، جودة أعلى)
- أقصى دقة: Q8 (عندما لا تكون VRAM قيدًا)
كيف يؤثر التكميم في VRAM والسرعة؟
حساب VRAM: حجم النموذج (GB) × عامل التكميم.
Llama 3 70B:
- FP32: 70B × 4 بايت = 280 GB (غير عملي)
- Q8: 70B × 1 بايت = 140 GB (يتطلب 140 GB من VRAM)
- Q4: 70B × 0.5 بايت = 70 GB (يتسع في RTX 4090 + بعض الحمل الزائد)
السرعة: جميع مستويات التكميم محدودة بالذاكرة (في انتظار DRAM)، لا بالحوسبة.
الـ tokens/ثانية متطابقة بين Q2 وFP32 على نفس الجهاز.
عرض نطاق VRAM، لا الحوسبة، هو عنق الزجاجة. يوفّر التكميم VRAM، لا الوقت.
فقدان الجودة حسب المستوى: نتائج معيار MMLU
مُقاس على معيار MMLU (المعرفة العامة، 57 مهمة):
- Llama 3 70B FP32 مرجعي: دقة 85.2%.
- Llama 3 70B Q8: دقة 85.1% (فقدان -0.1%).
- Llama 3 70B Q5: دقة 84.7% (فقدان -0.5%).
- Llama 3 70B Q4: دقة 84.0% (فقدان -1.2%).
- Llama 3 70B Q3: دقة 81.5% (فقدان -3.7%).
- الأثر الفعلي: Q4 مقابل Q8 = 1–2 إجابة صحيحة أقل من كل 100 سؤال.
- للدردشة/الكتابة: فرق غير محسوس. لمسائل STEM: Q8 أكثر أمانًا.

متى تستخدم كل مستوى؟
Q4: الافتراضي. استخدمه لجميع النماذج. أفضل توازن بين الضغط والجودة.
Q5: أبدًا. إنه إهدار. إذا كنت تحتاج إلى جودة Q5، استخدم Q4 مع نموذج أكبر قليلًا. إذا كان لديك VRAM لـ Q5 (88 GB)، استخدم Q4 على 70B بدلًا من ذلك.
Q8: فقط إذا كان لديك 32 GB+ من VRAM وكان النموذج <70B وكنت تحتاج إلى دقة مثالية (بحث، استخدام طبي).
Q3: ضبط الميزانية. هل فقدان جودة بنسبة 3% مقبول؟ استخدم Q3. وإلا، رقِّ بطاقة الرسوم أو استخدم نموذجًا أصغر.
Q2: اليأس. فقدان الجودة مرتفع جدًا لمعظم الحالات. استخدمه فقط إذا سبّب Q3 أخطاء نفاد الذاكرة.
لماذا Q4 هو معيار الصناعة؟
Q4 هو الأمثل لأنه:
1. توفير 87.5% من VRAM (أفضل نسبة).
2. فقدان جودة <1.2% (غير محسوس للمستخدمين).
3. بلا عقوبة سرعة (محدود بالذاكرة، لا بالحوسبة).
4. يتسع في الأجهزة الاستهلاكية (70B على RTX 4090 24 GB).
5. معيار الصناعة (HuggingFace وOllama يستخدمان Q4 افتراضيًا).
كل نموذج صدر بعد 2024 يتضمن متغير Q4 للاستخدام الإنتاجي.
إذا كان لنموذج FP32/Q8/Q5 فقط، فالمشروع غير جاهز للإنتاج.
مفاهيم خاطئة شائعة
- يبدو Q4 وكأنه "جودة منخفضة" لأن 4 بت يبدو قليلًا. خطأ. فقدان جودة بنسبة 1% غير محسوس.
- التكميم يبطّئ الاستدلال. خطأ. السرعة متطابقة (محدودة بالذاكرة، لا بالحوسبة).
- ينبغي أن أستخدم Q8 للأمان. خطأ. Q4 مُجرّب وآمن وهو المعيار. Q8 إهدار.
- أحتاج إلى FP32 للدقة. خطأ. غير صحيح أبدًا. Q8 يكفي حتى للبحث.
الأسئلة الشائعة
ما هو تكميم نماذج LLM؟
يضغط التكميم النموذج عبر تقليل الدقة العددية، مما يخفض استخدام الذاكرة ويزيد السرعة.
ما أفضل مستوى تكميم؟
Q4_K_M هو أفضل قيمة افتراضية لمعظم المستخدمين، إذ يوازن بين الأداء والجودة.
هل يقلل التكميم الدقة؟
نعم، لكن Q4–Q5 يحتفظان بمعظم جودة النموذج مع تقليل متطلبات الذاكرة بشكل كبير.
هل يستحق Q8 العناء؟
فقط إذا كنت تحتاج إلى أقصى دقة ولديك RAM كافية. لن يستفيد معظم المستخدمين من Q8.
هل أستخدم Q4 أم Q8 لتوليد الكود؟
Q4. السرعة متطابقة، وفرق الجودة 1%، غير محسوس لتوليد الكود.
هل يمكنني استخدام Q3 إذا كانت VRAM لدي قليلة؟
نعم. فقدان جودة بنسبة 3% مقبول للدردشة/الكتابة الإبداعية. غير مقبول للاستدلال/الرياضيات.
هل يوجد Q6 أو Q7؟
Q6 مستوى GGUF قياسي. Q6_K (~6.6 بت) شبه عديم الفقدان: Q6 مقابل Q8 يكاد يكون تعادلًا في الجودة وQ6 يشغل مساحة أقل، وQ4 مقابل Q6 يميل لصالح Q6 في الجودة (Q4 يفوز في الحجم وVRAM). Q7 غير قياسي. السلّم النموذجي: Q4_K_M (أفضل توازن)، Q5_K_M، Q6_K (قريب من Q8)، Q8_0 (شبه عديم الفقدان).
أي تكميم أسرع؟
جميعها بسرعة متطابقة (محدودة بالذاكرة). Q2 أسرع قليلًا بسبب نقل ذاكرة أقل، لكن الفرق <5%.
هل يمكنني إلغاء تكميم Q4 إلى FP32؟
لا، تُفقد البيانات. استيفاء Q4 ← FP32 لا يستعيد الأصل. التكميم لا رجعة فيه.
هل أُكمّم نموذجي المضبوط؟
نعم، بعد التدريب. كمّم الأوزان المدربة إلى Q4 للنشر.
ماذا يعني GGUF Q4_K_M؟
Q4_K_M هو متغير محسّن من Q4 يستخدم K-quants (دقة مختلطة). تحفظ خوارزمية K مزيدًا من الدقة في طبقات الانتباه. Q4_K_M هو التنزيل الموصى به على HuggingFace لمعظم النماذج: فعليًا Q4 بدقة أعلى بنحو 0.3% بنفس تكلفة VRAM.
هل يؤثر التكميم في طول السياق؟
لا. يضغط التكميم أوزان النموذج، لا نافذة السياق. نموذج Q4 له نفس أقصى طول سياق (مثلًا 128k token) لإصدار FP32 منه. ذاكرة السياق (ذاكرة KV المؤقتة) مسألة منفصلة عن التكميم.
قراءات ذات صلة
- تكميم نماذج LLM موضّحًا
- كم من VRAM تحتاج؟
- أفضل بطاقات الرسوم الاقتصادية لنماذج LLM المحلية
- أسرع نماذج LLM المحلية للحواسيب منخفضة المواصفات
- دليل أجهزة نموذج LLM المحلي 2026 — اختيار بطاقة الرسوم ومستويات VRAM ومعايير الاستدلال على CPU
- أفضل نماذج LLM المحلية للبرمجة 2026 — معايير نماذج محددة للبرمجة ومقارنة دعم FIM
المصادر
- معيار MMLU — OpenAI Evals — قياس الدقة بين مستويات التكميم Q4/Q8/FP32 عبر 57 مهمة استدلال
- بطاقة نموذج Llama 3 — Meta AI — مواصفات الدقة الرسمية بين مستويات التكميم
- Towards Quantization-Aware Deep Neural Networks (arXiv 2024) — بحث حول حدود خطأ التكميم ومنهجية K-quant
- يقلّل التكميم حجم النموذج لكنه لا يلغي تباين المخرجات. ضبط المعاملات يمكن أن يعوّض فقدان الدقة: temperature وtop-p يشرح استراتيجيات أخذ العينات.
