النقاط الرئيسية
- رخصة MIT، من إنشاء مطور يُعرف باسم turboderp
- حوالي 4,600 نجمة على GitHub؛ المستودع على github.com/turboderp-org/exllamav2 معلَّم كمؤرشف
- صيغة تكميم EXL2: تمزج دقة 2 و3 و4 و5 و6 و8 بت لكل طبقة للوصول إلى معدل بت متوسط مستهدف، مثال: تشغيل نموذج 70B في 24 جيجابايت VRAM بحوالي 2.55 بت لكل وزن
- المشروع الخلف ExLlamaV3 (حوالي 1,300 نجمة على GitHub) يقدّم صيغة EXL3، نسخة مبسّطة من نهج تكميم QTIP من Cornell RelaxML
- TabbyAPI، خادم قائم على FastAPI، هو طبقة API الموصى بها المتوافقة مع OpenAI لكلا الإصدارين
- مدمج أيضًا في text-generation-webui وlollms-webui وواجهة ExUI المستقلة على الويب
📍 في جملة واحدة
ExLlamaV2 مكتبة استدلال مجانية برخصة MIT من turboderp لاستدلال سريع للنماذج اللغوية على معالجات NVIDIA الاستهلاكية، معروفة بصيغة تكميم EXL2 المرنة، لكن مستودعها أصبح الآن مؤرشفًا لصالح الخلف قيد التطوير الفعلي، ExLlamaV3.
💬 بعبارات بسيطة
بُني ExLlamaV2 خصيصًا لاستخراج أقصى سرعة من معالج رسومي استهلاكي واحد باستخدام مخطط تكميم مرن بشكل غير معتاد؛ ومنذ ذلك الحين انتقل مطوره نفسه بالتطوير إلى مشروع جديد، ExLlamaV3، بدلاً من الاستمرار في تحديث V2.
📌ملاحظة: ينص ملف README الخاص بـ ExLlamaV2 على GitHub نفسه على أن المشروع مؤرشف وأن التطوير مستمر في ExLlamaV3 — أي شخص يبدأ مشروعًا جديدًا اليوم يجب أن يقيّم ExLlamaV3 بدلًا من البناء على كود V2 المؤرشف.
ما كان ExLlamaV2؟
كان ExLlamaV2 مكتبة استدلال مجانية ومفتوحة المصدر، صدرت برخصة MIT من مطور يُعرف باسم turboderp، مصممة خصيصًا لتعظيم سرعة الاستدلال على معالجات NVIDIA الرسومية الاستهلاكية. جاء بعد مشروع سابق، ExLlama، وكان بحد ذاته إعادة كتابة أكثر كفاءة في استخدام الذاكرة، تركز على تشغيل نماذج مكممة بسرعة على معالج رسومي واحد.
المستودع، github.com/turboderp-org/exllamav2، وصل إلى حوالي 4,600 نجمة على GitHub قبل أن يُعلَّم كمؤرشف، مع إشارة ملف README إلى ExLlamaV3 كالمشروع الذي يستمر فيه التطوير الآن.
- ركّز بشكل ضيق على معالجات NVIDIA الاستهلاكية بدلًا من التغطية الواسعة لموردي العتاد كما في محركات مثل llama.cpp
- قدّم صيغة تكميم EXL2 كإسهامه التقني الرئيسي، مما يسمح بتكميم مختلط الدقة داخل نموذج واحد
- دعم نفس نماذج GPTQ ذات 4 بت التي دعمها ExLlama الأصلي، إضافة إلى صيغته الخاصة EXL2
- قابل للتثبيت عبر pip (
pip install exllamav2)، أو ملفات wheel جاهزة، أو البناء من المصدر باستخدام CUDA Toolkit
ما هو تكميم EXL2؟
EXL2 هو صيغة التكميم الخاصة بـ ExLlamaV2، تسمح لطبقات خطية مختلفة داخل النموذج نفسه باستخدام عرض بت مختلف — من 2 إلى 8 بت — يُختار تلقائيًا من بيانات المعايرة للوصول إلى معدل بت متوسط مستهدف. هذا أكثر مرونة من عرض بت ثابت واحد يُطبَّق بشكل موحد على النموذج بأكمله.
- يدعم مستويات تكميم 2 و3 و4 و5 و6 و8 بت، ممزوجة لكل طبقة داخل نموذج واحد
- يمكن تكميم أعمدة الأوزان الأكثر أهمية بدقة أعلى بينما تستخدم الأقل أهمية بتات أقل، بشكل مشابه من حيث الروح للتكميم المتناثر
- يتيح ضغطًا شديدًا للنماذج الكبيرة على ذاكرة VRAM محدودة — أظهر اختبار موثّق تشغيل نموذج بـ 70 مليار معامل في 24 جيجابايت VRAM بحوالي 2.55 بت لكل وزن بسياق 2048 رمزًا
- تُختار معاملات التكميم تلقائيًا بناءً على بيانات المعايرة بدلًا من طلب إعداد يدوي لكل طبقة
لماذا أصبح ExLlamaV2 مؤرشفًا، وماذا يغيّر ExLlamaV3؟
مستودع turboderp-org/exllamav2 معلَّم كمؤرشف، مع نص ملف README الخاص به على أن التطوير مستمر في ExLlamaV3. هذه هي الحقيقة الأهم على الإطلاق التي يجب معرفتها قبل تقييم ExLlamaV2 لمشروع جديد.
يقدّم ExLlamaV3 صيغته الخاصة، EXL3، الموصوفة بأنها نسخة مبسّطة من نهج تكميم QTIP من Cornell RelaxML. على عكس EXL2، تحافظ EXL3 على بنى المصفوفات الأصلية بدلًا من إعادة تسميتها، بهدف تسهيل الدعم المستقبلي من أطر عمل أخرى. يوثّق ExLlamaV3 الحاجة إلى CUDA 12.4 أو أحدث، ويُشار إليه صراحة من قِبل القائمين عليه بأنه لا يزال في طور النضج — توقع بعض الجوانب غير المكتملة.
- ExLlamaV2: مؤرشف، رخصة MIT، صيغة EXL2، لا يزال قابلًا للتثبيت لكنه لا يتلقى تطويرًا إضافيًا
- ExLlamaV3: نشط، رخصة MIT، صيغة EXL3 (مبنية على بحث QTIP)، استقرار في مرحلة بيتا وفق توثيقه الخاص
- كلاهما يصونه المطور نفسه، turboderp، ضمن منظمة turboderp-org على GitHub
📌ملاحظة: لأي عملية نشر جديدة، قيّم ExLlamaV3 أولًا — فهو حيث تحدث الصيانة والتحسينات النشطة. يظل ExLlamaV2 ذا صلة بشكل أساسي للإعدادات الحالية المبنية عليه بالفعل، أو لملفات نماذج EXL2 المكممة المتداولة بالفعل.
كيف تُثبّت وتشغّل ExLlamaV2 (أو V3)؟
يُثبَّت ExLlamaV2 عبر pip أو ملفات wheel جاهزة أو من المصدر باستخدام CUDA Toolkit؛ يتبع ExLlamaV3 نمطًا مشابهًا. TabbyAPI هي الطريقة الموصى بها لتشغيل خادم متوافق مع OpenAI فوق أي منهما.
- 1لـ ExLlamaV2: التثبيت عبر
pip install exllamav2، أو تحميل ملف wheel جاهز يطابق إصدار Python وCUDA لديك من صفحة GitHub Releases، أو الاستنساخ والبناء من المصدر مع تثبيت CUDA Toolkit. - 2لـ ExLlamaV3 (موصى به للإعدادات الجديدة): اتبع مسارات التثبيت المكافئة الموثقة على github.com/turboderp-org/exllamav3، مع ملاحظة أن CUDA 12.4 أو أحدث مطلوب.
- 3تحميل نموذج EXL2 (أو EXL3) مكمّم مسبقًا، يُنشر عادة على Hugging Face من قِبل جهات تكميم في المجتمع.
- 4تثبيت وتشغيل TabbyAPI، الخادم الموصى به القائم على FastAPI، لعرض نقطة نهاية API متوافقة مع OpenAI مع دعم تحميل نماذج Hugging Face وقوالب محادثة Jinja2.
- 5بدلًا من ذلك، استخدم ExLlamaV2/V3 عبر تكامل موجود — text-generation-webui أو lollms-webui أو واجهة ExUI المستقلة على الويب — بدلًا من تشغيل TabbyAPI مباشرة.
هل يمكنني استخدام ExLlamaV2 اليوم؟
نعم، لا يزال قابلًا للتثبيت والعمل، لكن المستودع مؤرشف ولن يتلقى تحديثات أو إصلاحات أخطاء أو ميزات جديدة أخرى.
هل تعمل ملفات نموذج EXL2 مع ExLlamaV3؟
لا، ليس مباشرة — يستخدم ExLlamaV3 صيغة تكميم خاصة به EXL3. ملفات نموذج EXL2 الحالية مُعدة لإعدادات ExLlamaV2/TabbyAPI، وليس V3.
ما العتاد الذي يتطلبه ExLlamaV2؟
يستهدف ExLlamaV2 معالجات NVIDIA الرسومية الاستهلاكية تحديدًا — لا يوجد مسار دعم لـ AMD أو Intel أو المعالج المركزي فقط. هذا التركيز الضيق على العتاد جزء مما سمح له بالتحسين بشدة لسرعة معالج رسومي واحد.
- معالجات NVIDIA الرسومية فقط، مع الحاجة إلى CUDA — لا يوجد دعم موثّق لـ AMD أو Intel أو Apple Silicon
- مصمم حول البطاقات من الفئة الاستهلاكية بدلًا من معالجات مراكز البيانات، رغم أنه يعمل عليها أيضًا
- متطلبات VRAM تتناسب مع حجم النموذج ومعدل بت EXL2 المختار — التكميم المرن هو تحديدًا ما يتيح للنماذج الكبيرة أن تتسع في VRAM أقل نسبيًا
- يوثّق ExLlamaV3 الحاجة إلى CUDA 12.4 أو أحدث، وهو أساس أحدث مما افترضه ExLlamaV2
لمن يناسب ExLlamaV2 (أو ExLlamaV3)؟
استخدم ExLlamaV3 لمشروع جديد إذا كان استخراج أقصى سرعة وكفاءة VRAM من معالج رسومي استهلاكي واحد من NVIDIA أهم من دعم عتاد واسع أو ضمانات استقرار طويلة الأمد؛ لا يوجد سبب وجيه لبدء مشروع جديد تمامًا على ExLlamaV2 المؤرشف اليوم.
كيف يقارَن ExLlamaV2 بالبدائل؟
أقرب مقارنات ExLlamaV2 هي خلفه ومحركات أخرى ذات تركيز قوي على التكميم أو سرعة معالج رسومي واحد.
أخطاء شائعة عند تقييم ExLlamaV2
معظم اللبس ينشأ من عدم إدراك أن المشروع مؤرشف، أو توقع توافق متبادل بين ملفات نماذج EXL2 وEXL3.
الأسئلة الشائعة
هل ما زال ExLlamaV2 يُصان؟
لا. مستودع turboderp-org/exllamav2 على GitHub معلَّم كمؤرشف، مع نص ملف README الخاص به على أن التطوير مستمر بدلًا من ذلك في ExLlamaV3.
ما هو EXL2؟
EXL2 هو صيغة تكميم ExLlamaV2، تدعم دقة مختلطة من 2 إلى 8 بت لكل طبقة داخل نموذج واحد للوصول إلى معدل بت متوسط مستهدف، مما يتيح للنماذج الكبيرة أن تتسع في VRAM أقل.
ما هو ExLlamaV3، وكيف يختلف؟
ExLlamaV3 هو الخلف قيد التطوير الفعلي لـ ExLlamaV2، يستخدم صيغة تكميم جديدة EXL3 مبنية على نهج QTIP من Cornell RelaxML. يُوثَّق كبرمجية في مرحلة بيتا من قِبل القائمين عليه.
من أنشأ ExLlamaV2 وExLlamaV3؟
كلاهما من إنشاء مطور يُعرف باسم turboderp، ضمن منظمة turboderp-org على GitHub.
هل ExLlamaV2 مجاني للاستخدام؟
نعم. كل من ExLlamaV2 وExLlamaV3 صادران برخصة MIT، مجانيان للاستخدام الشخصي والتجاري.
هل يدعم ExLlamaV2 معالجات AMD الرسومية؟
لا. يتطلب كل من ExLlamaV2 وExLlamaV3 معالج NVIDIA رسوميًا مع CUDA — لا يوجد دعم لـ AMD أو Intel أو Apple Silicon.
ما هو TabbyAPI؟
TabbyAPI خادم قائم على FastAPI والطريقة الموصى بها لعرض API متوافق مع OpenAI فوق ExLlamaV2 أو ExLlamaV3، مع ميزات إضافية مثل تحميل نماذج Hugging Face ودعم قوالب محادثة Jinja2.
هل يمكن استخدام ملفات نموذج EXL2 وEXL3 بالتبادل؟
لا. ملفات EXL2 مكممة لـ ExLlamaV2 وغير متوافقة مباشرة مع ExLlamaV3، الذي يستخدم صيغة EXL3 المنفصلة.
هل يجب أن أستخدم ExLlamaV2 أو ExLlamaV3 لمشروع جديد؟
ExLlamaV3، لأن ExLlamaV2 مؤرشف ولا يتلقى تطويرًا إضافيًا. لا يزال ExLlamaV3 في مرحلة بيتا، فتوقع بعض الجوانب غير المكتملة مقارنة بمشروع ناضج ومستقر بشكل نشط.
كيف يقارَن ExLlamaV2 بـ llama.cpp؟
يدعم llama.cpp مجموعة أوسع بكثير من العتاد (NVIDIA وAMD وApple Silicon وIntel والمعالج المركزي فقط) ويُصان بنشاط؛ بينما ركّز ExLlamaV2 بشكل ضيق على معالجات NVIDIA الاستهلاكية وأصبح الآن مؤرشفًا، مع ExLlamaV3 كخلفه النشط.
