Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/⁨Q4⁩ مقابل ⁨Q5⁩ مقابل ⁨Q8⁩: أي مستوى تكميم ينبغي أن تستخدم؟
Models by Use Case

⁨Q4⁩ مقابل ⁨Q5⁩ مقابل ⁨Q8⁩: أي مستوى تكميم ينبغي أن تستخدم؟

·8 دقائق قراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

Q4 (4 بت) هو النقطة المثلى: توفير 87% من VRAM مع فقدان جودة غير محسوس. اعتبارًا من يونيو 2026، يُعد Q5 غير ضروري (5% فقط من الجودة الإضافية، بنفس تكلفة VRAM لـ Q4)، وQ8 مخصص للمثاليين الذين يملكون فائضًا من VRAM.

Q4 (4 بت) هو النقطة المثلى: توفير 87% من VRAM مع فقدان جودة غير محسوس. اعتبارًا من يونيو 2026، يُعد Q5 غير ضروري (5% فقط من الجودة الإضافية، بنفس تكلفة VRAM لـ Q4)، وQ8 مخصص للمثاليين الذين يملكون فائضًا من VRAM. لا تُعد FP32 (الدقة الكاملة) ضرورية أبدًا للاستدلال على الأجهزة الاستهلاكية.

العرض التقديمي: ⁨Q4⁩ مقابل ⁨Q5⁩ مقابل ⁨Q8⁩: أي مستوى تكميم ينبغي أن تستخدم؟

يغطي العرض التقديمي أدناه: لماذا يضغط تكميم LLM النماذج (تقليل الدقة من 16 بت إلى Q4/Q8)، وتوفير VRAM بين مستويات Q2–Q8 (70 GB لـ Q4 مقابل 280 GB لـ FP32)، ومعايير فقدان الجودة (يحتفظ Q4 بدقة 99%، فقدان 1.2%)، ومتى تستخدم كل مستوى حسب الأجهزة (8 GB ← Q3/Q4، 16 GB ← Q4_K_M، 32 GB+ ← Q5/Q8). نزّل ملف PDF كبطاقة مرجعية لمستويات التكميم.

تصفّح الشرائح أدناه أو نزّلها بصيغة PDF للرجوع إليها دون اتصال. تنزيل البطاقة المرجعية (PDF)

⁨Q4⁩ مقابل ⁨Q5⁩ مقابل ⁨Q8⁩: أي مستوى تكميم ينبغي أن تستخدم؟

Key Takeaways

  • Q4 (4 بت): توفير 87.5% من VRAM، فقدان جودة ~1%. استخدمه لكل شيء.
  • Q5 (5 بت): توفير 84% من VRAM، فقدان جودة ~0.5%. غير ضروري أبدًا؛ Q4 وQ8 يحيطان بـ Q5.
  • Q8 (8 بت): توفير 50% من VRAM، فقدان جودة <0.1%. للمثاليين الذين يملكون فائضًا من VRAM.
  • FP32 (32 بت): دقة كاملة، فقدان 0%، توفير 0%. غير عملي؛ تجاهله.
  • السرعة: جميع مستويات التكميم تعمل بـ tokens/ثانية متطابقة (محدودة بالذاكرة، لا بالحوسبة).
  • استخدام VRAM (نموذج Llama 70B): FP32=280 GB، Q8=140 GB، Q5=88 GB، Q4=70 GB.
  • التوصية: استخدم Q4 لـ 7B–70B. استخدم Q8 فقط إذا كان لديك 32 GB+ من VRAM وتحتاج إلى جودة لا تشوبها شائبة.
  • لا أحد يستخدم Q5 لأن Q4 + تحسين صغير = أفضل من Q5 + نفس الجهاز.

حقائق سريعة

  • توفير VRAM مع Q4: 87.5% مقابل FP32 (70 GB لـ Llama 3 70B)
  • فقدان جودة Q4: <1.2% في معيار MMLU
  • توفير VRAM مع Q8: 50% مقابل FP32 (140 GB لـ Llama 3 70B)
  • فرق السرعة: 0% — جميع مستويات التكميم تعمل بـ tokens/ثانية متطابقة
  • حكم Q5: منطقة ميتة — Q4 + نموذج أكبر = نتيجة أفضل بنفس VRAM

مقارنة مستويات التكميم: من Q2 إلى Q8

CuantizaciónUso de RAMVelocidadCalidadIdeal para
Q2منخفض جدًاسريع جدًاضعيفةالتجارب
Q3منخفضسريعمنخفضةالأجهزة الصغيرة
Q4متوسطسريعجيدةمعظم المستخدمين
Q5متوسط+متوسطجيدة جدًاالبرمجة
Q6مرتفعأبطأممتازةالتركيز على الدقة
Q8مرتفع جدًابطيءشبه FP16قياس الأداء
توفير VRAM حسب مستوى التكميم: FP32 = 280 GB، Q8 = 140 GB (توفير 50%)، Q4 = 70 GB (توفير 75%)، Q3 = 53 GB (توفير 81%). Q4 هو النقطة المثلى لمعظم المستخدمين.
توفير VRAM حسب مستوى التكميم: FP32 = 280 GB، Q8 = 140 GB (توفير 50%)، Q4 = 70 GB (توفير 75%)، Q3 = 53 GB (توفير 81%). Q4 هو النقطة المثلى لمعظم المستخدمين.

أفضل مستوى تكميم حسب حالة الاستخدام

  • 8 GB من RAM: Q3 أو Q4 (نماذج صغيرة بحجم 7B فقط)
  • 16 GB من RAM: Q4_K_M (موصى به لمعظم الحواسيب المحمولة)
  • 32 GB من RAM: Q5 أو Q6 أو Q8 (نماذج أكبر، جودة أعلى)
  • أقصى دقة: Q8 (عندما لا تكون VRAM قيدًا)
دليل اختيار الأجهزة: 8 GB من RAM ← Q3/Q4 (نماذج 7B)، 16 GB ← Q4_K_M (موصى به)، 32 GB+ ← Q5/Q6/Q8 (نماذج أكبر، جودة أعلى)، 64 GB+ ← Q8 أو FP32 (بحث/طبي).
دليل اختيار الأجهزة: 8 GB من RAM ← Q3/Q4 (نماذج 7B)، 16 GB ← Q4_K_M (موصى به)، 32 GB+ ← Q5/Q6/Q8 (نماذج أكبر، جودة أعلى)، 64 GB+ ← Q8 أو FP32 (بحث/طبي).

كيف يؤثر التكميم في VRAM والسرعة؟

حساب VRAM: حجم النموذج (GB) × عامل التكميم.

Llama 3 70B:

  • FP32: 70B × 4 بايت = 280 GB (غير عملي)
  • Q8: 70B × 1 بايت = 140 GB (يتطلب 140 GB من VRAM)
  • Q4: 70B × 0.5 بايت = 70 GB (يتسع في RTX 4090 + بعض الحمل الزائد)

السرعة: جميع مستويات التكميم محدودة بالذاكرة (في انتظار DRAM)، لا بالحوسبة.

الـ tokens/ثانية متطابقة بين Q2 وFP32 على نفس الجهاز.

عرض نطاق VRAM، لا الحوسبة، هو عنق الزجاجة. يوفّر التكميم VRAM، لا الوقت.

فقدان الجودة حسب المستوى: نتائج معيار MMLU

مُقاس على معيار MMLU (المعرفة العامة، 57 مهمة):

  • Llama 3 70B FP32 مرجعي: دقة 85.2%.
  • Llama 3 70B Q8: دقة 85.1% (فقدان -0.1%).
  • Llama 3 70B Q5: دقة 84.7% (فقدان -0.5%).
  • Llama 3 70B Q4: دقة 84.0% (فقدان -1.2%).
  • Llama 3 70B Q3: دقة 81.5% (فقدان -3.7%).
  • الأثر الفعلي: Q4 مقابل Q8 = 1–2 إجابة صحيحة أقل من كل 100 سؤال.
  • للدردشة/الكتابة: فرق غير محسوس. لمسائل STEM: Q8 أكثر أمانًا.
معايير فقدان الجودة: Q8 = فقدان -0.1%، Q5 = فقدان -0.5%، Q4 = فقدان -1.2%، Q3 = فقدان -3.7% في MMLU. فقدان جودة Q4 غير محسوس لمعظم المهام.
معايير فقدان الجودة: Q8 = فقدان -0.1%، Q5 = فقدان -0.5%، Q4 = فقدان -1.2%، Q3 = فقدان -3.7% في MMLU. فقدان جودة Q4 غير محسوس لمعظم المهام.

متى تستخدم كل مستوى؟

Q4: الافتراضي. استخدمه لجميع النماذج. أفضل توازن بين الضغط والجودة.

Q5: أبدًا. إنه إهدار. إذا كنت تحتاج إلى جودة Q5، استخدم Q4 مع نموذج أكبر قليلًا. إذا كان لديك VRAM لـ Q5 (88 GB)، استخدم Q4 على 70B بدلًا من ذلك.

Q8: فقط إذا كان لديك 32 GB+ من VRAM وكان النموذج <70B وكنت تحتاج إلى دقة مثالية (بحث، استخدام طبي).

Q3: ضبط الميزانية. هل فقدان جودة بنسبة 3% مقبول؟ استخدم Q3. وإلا، رقِّ بطاقة الرسوم أو استخدم نموذجًا أصغر.

Q2: اليأس. فقدان الجودة مرتفع جدًا لمعظم الحالات. استخدمه فقط إذا سبّب Q3 أخطاء نفاد الذاكرة.

لماذا Q4 هو معيار الصناعة؟

Q4 هو الأمثل لأنه:

1. توفير 87.5% من VRAM (أفضل نسبة).

2. فقدان جودة <1.2% (غير محسوس للمستخدمين).

3. بلا عقوبة سرعة (محدود بالذاكرة، لا بالحوسبة).

4. يتسع في الأجهزة الاستهلاكية (70B على RTX 4090 24 GB).

5. معيار الصناعة (HuggingFace وOllama يستخدمان Q4 افتراضيًا).

كل نموذج صدر بعد 2024 يتضمن متغير Q4 للاستخدام الإنتاجي.

إذا كان لنموذج FP32/Q8/Q5 فقط، فالمشروع غير جاهز للإنتاج.

مفاهيم خاطئة شائعة

  • يبدو Q4 وكأنه "جودة منخفضة" لأن 4 بت يبدو قليلًا. خطأ. فقدان جودة بنسبة 1% غير محسوس.
  • التكميم يبطّئ الاستدلال. خطأ. السرعة متطابقة (محدودة بالذاكرة، لا بالحوسبة).
  • ينبغي أن أستخدم Q8 للأمان. خطأ. Q4 مُجرّب وآمن وهو المعيار. Q8 إهدار.
  • أحتاج إلى FP32 للدقة. خطأ. غير صحيح أبدًا. Q8 يكفي حتى للبحث.

الأسئلة الشائعة

ما هو تكميم نماذج LLM؟

يضغط التكميم النموذج عبر تقليل الدقة العددية، مما يخفض استخدام الذاكرة ويزيد السرعة.

ما أفضل مستوى تكميم؟

Q4_K_M هو أفضل قيمة افتراضية لمعظم المستخدمين، إذ يوازن بين الأداء والجودة.

هل يقلل التكميم الدقة؟

نعم، لكن Q4–Q5 يحتفظان بمعظم جودة النموذج مع تقليل متطلبات الذاكرة بشكل كبير.

هل يستحق Q8 العناء؟

فقط إذا كنت تحتاج إلى أقصى دقة ولديك RAM كافية. لن يستفيد معظم المستخدمين من Q8.

هل أستخدم Q4 أم Q8 لتوليد الكود؟

Q4. السرعة متطابقة، وفرق الجودة 1%، غير محسوس لتوليد الكود.

هل يمكنني استخدام Q3 إذا كانت VRAM لدي قليلة؟

نعم. فقدان جودة بنسبة 3% مقبول للدردشة/الكتابة الإبداعية. غير مقبول للاستدلال/الرياضيات.

هل يوجد Q6 أو Q7؟

Q6 مستوى GGUF قياسي. Q6_K (~6.6 بت) شبه عديم الفقدان: Q6 مقابل Q8 يكاد يكون تعادلًا في الجودة وQ6 يشغل مساحة أقل، وQ4 مقابل Q6 يميل لصالح Q6 في الجودة (Q4 يفوز في الحجم وVRAM). Q7 غير قياسي. السلّم النموذجي: Q4_K_M (أفضل توازن)، Q5_K_M، Q6_K (قريب من Q8)، Q8_0 (شبه عديم الفقدان).

أي تكميم أسرع؟

جميعها بسرعة متطابقة (محدودة بالذاكرة). Q2 أسرع قليلًا بسبب نقل ذاكرة أقل، لكن الفرق <5%.

هل يمكنني إلغاء تكميم Q4 إلى FP32؟

لا، تُفقد البيانات. استيفاء Q4 ← FP32 لا يستعيد الأصل. التكميم لا رجعة فيه.

هل أُكمّم نموذجي المضبوط؟

نعم، بعد التدريب. كمّم الأوزان المدربة إلى Q4 للنشر.

ماذا يعني GGUF Q4_K_M؟

Q4_K_M هو متغير محسّن من Q4 يستخدم K-quants (دقة مختلطة). تحفظ خوارزمية K مزيدًا من الدقة في طبقات الانتباه. Q4_K_M هو التنزيل الموصى به على HuggingFace لمعظم النماذج: فعليًا Q4 بدقة أعلى بنحو 0.3% بنفس تكلفة VRAM.

هل يؤثر التكميم في طول السياق؟

لا. يضغط التكميم أوزان النموذج، لا نافذة السياق. نموذج Q4 له نفس أقصى طول سياق (مثلًا 128k token) لإصدار FP32 منه. ذاكرة السياق (ذاكرة KV المؤقتة) مسألة منفصلة عن التكميم.

المصادر

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs