Skip to main content
PromptQuorum
الرئيسية/LLM المحلية المتقدمة/مراجعة LoRAX: تقديم آلاف محولات LoRA على GPU واحد
Overview & Reference

مراجعة LoRAX: تقديم آلاف محولات LoRA على GPU واحد

·10 دقائق قراءة·بقلم Hans Kuepper · مؤسس PromptQuorum، أداة إرسال الذكاء الاصطناعي متعددة النماذج · PromptQuorum

LoRAX خادم استدلال مجاني ومفتوح المصدر وقابل للاستضافة الذاتية، يقدم خدمة العديد من محولات LoRA المُدرَّبة بدقة فوق نموذج أساسي مشترك واحد، على GPU واحد، بدلاً من الحاجة إلى GPU مخصص لكل نموذج مُدرَّب بدقة. طوَّرته Predibase (استحوذت عليها Rubrik في 2025) وهو مرخَّص بموجب Apache 2.0، وهو نسخة متفرعة من text-generation-inference من Hugging Face، ويضيف تحميلاً ديناميكياً للمحولات، ومعالجة دفعية مستمرة وغير متجانسة عبر المحولات، وواجهة برمجة تطبيقات متوافقة مع OpenAI، بحيث يمكن لنشر واحد، وفقاً لموقعه الخاص، تقديم آلاف المحولات "بسعر واحد".

LoRAX ("LoRA eXchange"، github.com/predibase/lorax) هو خادم استدلال مجاني ومفتوح المصدر وقابل للاستضافة الذاتية، صُمِّم خصيصاً لتقديم خدمة العديد من محولات LoRA المُدرَّبة بدقة فوق نموذج أساسي مشترك واحد، دون الحاجة إلى GPU منفصل لكل محول. أنشأته Predibase، وهي شركة منصات تعلم آلة تأسست عام 2021 واستحوذت عليها في 2025 شركة أمن البيانات Rubrik. تتناول هذه المراجعة ما تفعله LoRAX فعلياً، وكيف تختلف عن محرك استدلال عام الغرض، وكيفية تثبيتها، ومن يناسبها استخدامها.

النقاط الرئيسية

  • LoRAX (github.com/predibase/lorax) هو خادم استدلال متعدد LoRA مجاني ومفتوح المصدر وقابل للاستضافة الذاتية
  • أنشأته Predibase، شركة منصات تعلم آلة أسسها خريجو Google وUber عام 2021؛ أعلنت Rubrik عن استحواذها على Predibase في 25 يونيو 2025
  • مرخَّص بموجب Apache 2.0، ويصفه المشروع بأنه مجاني للاستخدام التجاري
  • نسخة متفرعة من text-generation-inference من Hugging Face (اعتباراً من الإصدار v0.9.4)، ثم توسَّع لاحقاً بإضافة تحميل ديناميكي لعدة محولات LoRA
  • يتطلب GPU من NVIDIA، جيل Ampere أو أحدث، CUDA 11.8 أو أعلى، على Linux
  • يدعم المحولات المُدرَّبة باستخدام PEFT أو Ludwig؛ ويحمّلها من HuggingFace Hub أو Predibase أو مسار في نظام الملفات المحلي
  • أكثر من 3,800 نجمة على GitHub وأكثر من 324 نسخة متفرعة (forks) وقت إعداد هذه المراجعة

📍 في جملة واحدة

LoRAX خادم استدلال مجاني ومفتوح المصدر (Apache 2.0) وقابل للاستضافة الذاتية، وهو نسخة متفرعة من text-generation-inference من Hugging Face، طوَّرته Predibase (استحوذت عليها Rubrik في 2025)، ويقدم خدمة آلاف محولات LoRA المُدرَّبة بدقة فوق نموذج أساسي مشترك واحد على GPU واحد، بأكثر من 3,800 نجمة على GitHub.

💬 بعبارات بسيطة

بدلاً من تشغيل نموذج مُستضاف على GPU منفصل لكل نسخة مُدرَّبة بدقة من نموذج LLM الأساسي الخاص بك، تُحمِّل LoRAX نسخة مشتركة واحدة من النموذج الأساسي وتستبدل ديناميكياً أوزان محولات LoRA الصغيرة حسب كل طلب — بحيث يمكن لـ GPU واحد تقديم خدمة العديد من "الشخصيات" المُدرَّبة بدقة والمختلفة لنفس النموذج في آن واحد، بجزء بسيط من تكلفة استخدام GPU واحد لكل نموذج.

📌ملاحظة: تستند هذه المراجعة إلى مستودع LoRAX الخاص على GitHub وملف README وملاحظات الإصدار. لا تدّعي هذه المراجعة أن PromptQuorum قد قارنت إنتاجيتها أو زمن استجابتها بشكل مستقل مقابل خوادم استدلال أخرى — راجع وثائق المشروع نفسه للاطلاع على أرقام الأداء الحالية قبل اتخاذ أي قرار متعلق بسعة بيئة الإنتاج.

ما هي LoRAX؟

LoRAX ("LoRA eXchange") هي خادم استدلال قابل للاستضافة الذاتية، صُمِّم خصيصاً لتقديم خدمة العديد من محولات LoRA المُدرَّبة بدقة فوق نموذج أساسي مشترك واحد، بدلاً من الحاجة إلى نشر نموذج مخصص لكل تدريب دقيق. وفقاً لموقعها الخاص، فهي "الإطار مفتوح المصدر لتقديم خدمة مئات نماذج LLM المُدرَّبة بدقة في بيئة الإنتاج بسعر واحد".

  • نوع المنتج: خادم استدلال قابل للاستضافة الذاتية (واجهة سطر أوامر + مكتبة)، وليس واجهة برمجة تطبيقات مُستضافة أو تطبيق سطح مكتب
  • الجهة المطوِّرة: Predibase، تأسست عام 2021 على يد خريجي Google وUber كشركة منصات تعلم آلة
  • الوضع المؤسسي: أعلنت Rubrik، وهي شركة أمن بيانات، عن اتفاقها للاستحواذ على Predibase في 25 يونيو 2025؛ أصبحت المنصة التجارية الخاصة بـ Predibase الآن تحت مظلة Rubrik، بينما يظل مشروع LoRAX مفتوح المصدر منشوراً على GitHub تحت منظمة Predibase
  • الأساس: نسخة متفرعة من text-generation-inference من Hugging Face (اعتباراً من الإصدار v0.9.4)، ثم توسَّعت لاحقاً خصيصاً لتقديم خدمة عدة محولات بشكل ديناميكي
  • الترخيص: Apache 2.0، مؤكَّد عبر مستودع GitHub
  • الحجم: أكثر من 3,800 نجمة على GitHub وأكثر من 324 نسخة متفرعة (forks) وقت إعداد هذه المراجعة

تاريخ المشروع ومحطات الإصدارات

تطوَّرت LoRAX بشكل مستمر منذ إصداراتها الأولى في مطلع 2024، مضيفة مع كل إصدار دعماً أوسع للنماذج وخيارات تكميم وميزات تقديم خدمة جديدة. أرقام الإصدارات والتواريخ أدناه مأخوذة من ملاحظات إصدار المشروع الخاصة على GitHub؛ راجع صفحة الإصدارات مباشرةً للاطلاع على أي شيء صدر بعد تاريخ نشر هذه المراجعة.

  1. 1
    v0.6.0 — 10 يناير 2024: واجهة برمجة تطبيقات متوافقة مع OpenAI
    Why it matters: أضاف نقاط نهاية completions وchat-completions المتوافقة مع OpenAI، مما يتيح لكود عميل OpenAI الحالي الاتصال بخادم LoRAX قابل للاستضافة الذاتية.
  2. 2
    v0.7.0 — 1 فبراير 2024: دمج عدة محولات، تكميم EETQ/HQQ
    Why it matters: أتاح دمج عدة محولات LoRA لكل طلب باستخدام طرق linear وTIES وDARE، وأضاف تنسيقَي تكميم إضافيَين.
  3. 3
    v0.8.0–v0.8.1 — فبراير 2024: مخرجات منظَّمة ودعم Gemma
    Why it matters: أضاف مخرجات منظَّمة موجَّهة بمخطط JSON عبر مكتبة Outlines، إضافة إلى دعم عائلة نماذج Gemma من Google.
  4. 4
    v0.9.0 — 23 مارس 2024: ذاكرة مخصصة للمحولات، دعم Qwen2
    Why it matters: وفقاً لملاحظات الإصدار، خصَّص ذاكرة GPU مخصصة للمحولات وأضاف دعم نماذج Qwen2.
  5. 5
    v0.10.0 — 23 مايو 2024: فك ترميز تخميني Medusa
    Why it matters: أضاف محولات فك الترميز التخميني Medusa ودعم نماذج Phi-3 وCommand-R وDBRX، بهدف تسريع التوليد.
  6. 6
    v0.11.0 — 18 سبتمبر 2024: تخزين مؤقت للبادئات، دعم الرؤية واللغة
    Why it matters: أضاف تخزيناً مؤقتاً للبادئات للطلبات المتكررة، ودعم نموذج الرؤية واللغة Llava-Next، وتكميم FP8 لنموذجَي Mistral وLlama.
  7. 7
    v0.12.0 — 6 نوفمبر 2024: تخزين مؤقت متعدد LoRA للبادئات، استدعاء الدوال
    Why it matters: وفقاً لسجل التغييرات، وسَّع التخزين المؤقت للبادئات ليعمل عبر عدة محولات في آن واحد، وأضاف دعم ذاكرة تخزين مؤقت KV بصيغة FP8، واستدعاء دوال مع فرض المخطط — وهي أحدث محطة استطاعت هذه المراجعة تأكيدها من ملاحظات الإصدار العامة.

ماذا تفعل LoRAX فعلياً؟

تُحمِّل LoRAX نموذجاً أساسياً مشتركاً واحداً في ذاكرة GPU، ثم تُحمِّل وتستبدل ديناميكياً أوزان محولات LoRA الصغيرة مع كل طلب وارد، بحيث يمكن تقديم خدمة العديد من نسخ النماذج المُدرَّبة بدقة من نشر واحد.

  • تحميل ديناميكي للمحولات — تُحمَّل محولات LoRA عند الطلب حسب كل طلب بدلاً من اشتراط تحميل كل محول مسبقاً، مع جلب استباقي غير متزامن ونقل بين ذاكرة GPU وCPU لإدارة أي المحولات تبقى "نشطة"
  • معالجة دفعية مستمرة وغير متجانسة — تجمع، وفقاً لوصفها المعماري الخاص، الطلبات الموجَّهة لمحولات مختلفة في نفس الدفعة، بدلاً من اشتراط دفعة منفصلة لكل محول
  • دعم النماذج الأساسية — متوافقة مع Llama وCodeLlama وMistral وZephyr وQwen وGemma وPhi-3 وCommand-R وDBRX، ونماذج الرؤية واللغة Mllama/Llava-Next، وفقاً لملاحظات الإصدار
  • خيارات التكميم — fp16، أو مُكمَّم باستخدام bitsandbytes أو GPT-Q أو AWQ أو EETQ أو HQQ، إضافة إلى دعم ذاكرة تخزين مؤقت KV بصيغة FP8 المُضاف في إصدارات لاحقة
  • توافق المحولات — تعمل مع محولات مُدرَّبة عبر PEFT أو Ludwig، ويتم تحميلها من HuggingFace Hub أو Predibase أو مسار في نظام الملفات المحلي
  • واجهة برمجة تطبيقات متوافقة مع OpenAI — تعرض نقاط نهاية chat-completions وcompletions بتنسيق طلب/استجابة OpenAI، مما يتيح لكود عميل OpenAI الحالي الاتصال بخادم LoRAX قابل للاستضافة الذاتية
  • ميزات بنية تحتية لتقديم الخدمة — وفقاً لوثائقها، تدعم التوازي الموتري وflash-attention وpaged attention وبث الرموز (token streaming) ومقاييس Prometheus وتتبع OpenTelemetry
  • مخرجات منظَّمة — توليد موجَّه بمخطط JSON عبر مكتبة Outlines، إضافة إلى استدعاء الدوال مع فرض المخطط في الإصدارات اللاحقة

أمثلة على الاستخدام: ثلاث طرق لاستخدام LoRAX

هذه سير عمل ملموسة مبنية على ميزات LoRAX الموثَّقة الخاصة، وليست حالات استخدام افتراضية.

المنصة والتسعير والترخيص

المنصة

ما تذكره LoRAX:
قابلة للاستضافة الذاتية، Linux فقط؛ تتطلب GPU من NVIDIA، جيل Ampere أو أحدث، مع CUDA 11.8 أو أعلى.

التكلفة

ما تذكره LoRAX:
مجانية ومفتوحة المصدر، ويصفها المشروع بأنها مجانية للاستخدام التجاري. تدفع فقط مقابل بنية GPU التحتية الخاصة بك — لا توجد فئة مدفوعة منفصلة لـ LoRAX.

الترخيص

ما تذكره LoRAX:
Apache 2.0، مؤكَّد عبر مستودع GitHub.

طريقة التثبيت

ما تذكره LoRAX:
صورة Docker (ghcr.io/predibase/lorax:main)، إضافة إلى مسارات نشر موثَّقة عبر Kubernetes وSkyPilot؛ يُثبَّت عميل Python بشكل منفصل عبر pip.

تبيع Predibase (الجهة المطوِّرة لـ LoRAX، والتي أصبحت الآن تحت مظلة Rubrik بعد استحواذها في 2025) أيضاً منصة تجارية مُدارة منفصلة مبنية على تقنية ذات صلة — تحقق من الأسعار التجارية الحالية مباشرةً لدى Predibase/Rubrik إذا كنت بحاجة إلى عرض مُدار بدلاً من الاستضافة الذاتية.

LoRAX مقابل محرك استدلال عام الغرض

تقدم كل من LoRAX ومحرك استدلال عام الغرض مثل LMDeploy أو NVIDIA Dynamo خدمة نماذج LLM على نطاق واسع، لكن LoRAX مصمَّمة خصيصاً حول مشكلة محددة: تقديم خدمة العديد من محولات LoRA على نموذج أساسي واحد بتكلفة منخفضة.

الجانب
LoRAX
محرك استدلال عام الغرض
المهمة الأساسيةتقديم خدمة العديد من محولات LoRA على نموذج أساسي واحدتقديم خدمة نموذج كامل واحد أو أكثر بإنتاجية عالية
معالجة دفعية متعددة المحولاتمعالجة دفعية مستمرة وغير متجانسة مدمجةعادةً ليست محور تركيز أساسي
الأساسنسخة متفرعة من text-generation-inference من Hugging Faceيختلف حسب المشروع
واجهة برمجة تطبيقات متوافقة مع OpenAIنعمغالباً نعم
الاستخدام الأمثلالعديد من النسخ المُدرَّبة بدقة لنموذج أساسي واحدعدد أقل من النماذج، أقصى إنتاجية خام

إذا كان عبء العمل لديك هو تقديم خدمة العديد من النسخ المُدرَّبة بدقة لنفس النموذج الأساسي (محولات لكل عميل أو لكل مهمة)، فإن المعالجة الدفعية المرتكزة على المحولات في LoRAX مصمَّمة خصيصاً لذلك. أما إذا كنت تقدم خدمة عدد صغير من النماذج الكاملة المختلفة بأقصى إنتاجية خام دون الحاجة إلى تبديل المحولات، فقد يكون محرك عام الغرض أنسب — تحقق من المعايير الحالية على مواقع كلا المشروعين قبل الاختيار، حيث يُصدر كلاهما تحسينات أداء بشكل متكرر.

لمن تناسب LoRAX؟

تناسب LoRAX الفرق التي لديها، أو تخطط أن يكون لديها، العديد من محولات LoRA المُدرَّبة بدقة من نفس النموذج الأساسي وتريد تقديم خدمتها بكفاءة من حيث التكلفة من سعة GPU مشتركة.

ما لا تناسبه LoRAX

لا تُعد LoRAX خياراً جيداً إذا كنت بحاجة إلى نشر يعتمد على CPU فقط أو خارج Linux، أو تدريب المحولات بدلاً من تقديم خدمتها، أو منصة مُستضافة مُدارة بالكامل.

  • ليست CPU فقط — تتطلب GPU من NVIDIA، جيل Ampere أو أحدث، مع CUDA 11.8 أو أعلى؛ لا يوجد وضع احتياطي على CPU
  • ليست متعددة المنصات بالنسبة للخادم نفسه — يعمل خادم LoRAX على Linux فقط، وفقاً لوثائقها الخاصة
  • ليست أداة تدريب — تقدم LoRAX خدمة محولات LoRA المُدرَّبة بالفعل في مكان آخر (عبر PEFT أو Ludwig أو ما شابه)؛ ولا تقوم بتدريب النماذج بدقة بنفسها
  • ليست خدمة مُستضافة مُدارة بمفردها — إنها برمجية مفتوحة المصدر قابلة للاستضافة الذاتية؛ منصة Predibase التجارية المنفصلة (الآن تحت مظلة Rubrik بعد استحواذها في 2025) هي الخيار المُدار إذا رغبت في ذلك
  • لم تختبرها PromptQuorum بشكل مستقل من حيث الإنتاجية أو زمن الاستجابة — تستند هذه المراجعة إلى وثائق LoRAX وملاحظات إصدارها الخاصة، وليس إلى اختبار عملي

أخطاء شائعة عند تقييم LoRAX

يأتي معظم الالتباس حول LoRAX من توقع أن تُدرِّب المحولات، أو أن تعمل دون GPU، أو افتراض أن دعمها المؤسسي لم يتغير بعد استحواذ Predibase.

المنافسون والبدائل

تُقارَن LoRAX غالباً بأدوات استدلال وضبط دقيق أخرى قابلة للاستضافة الذاتية، نظراً لأنها تقع عند تقاطع مجالَي تقديم خدمة الاستدلال والضبط الدقيق بـ LoRA. مكمِّلة لمدخل LoRAX الخاص في دليل برمجيات LLM المحلية.

Tool
Best known for
Link
LMDeployمحرك استدلال مفتوح المصدر مع مجموعة أدوات للتكميم وتقديم الخدمةمراجعة LMDeploy
NVIDIA Dynamoإطار تقديم استدلال عالي الإنتاجية مع ميزات خادم APIمراجعة NVIDIA Dynamo
Unslothمكتبة ضبط دقيق LoRA/QLoRA سريعة وفعالة من حيث الذاكرةمراجعة Unsloth
LLaMA-Factoryإطار ضبط دقيق موحَّد يدعم LoRA وطرق PEFT الأخرىمراجعة LLaMA-Factory

تعكس هذه القائمة أدوات في نفس مجال تقديم خدمة الاستدلال والضبط الدقيق بـ LoRA مثل LoRAX، وليست تصنيفاً مستقلاً من PromptQuorum — تحقق من مجموعة الميزات الحالية لكل أداة قبل الاختيار، نظراً لأن تركيز LoRAX على تقديم خدمة عدة محولات ليس مطابقاً لمحرك استدلال عام الغرض أو أداة مخصصة للتدريب فقط.

الأسئلة الشائعة

ما هي LoRAX؟

LoRAX ("LoRA eXchange"، github.com/predibase/lorax) هي خادم استدلال مجاني ومفتوح المصدر وقابل للاستضافة الذاتية، يقدم خدمة العديد من محولات LoRA المُدرَّبة بدقة فوق نموذج أساسي مشترك واحد على GPU واحد.

هل LoRAX مجانية؟

نعم، LoRAX نفسها مجانية ومفتوحة المصدر (Apache 2.0)، ويصفها المشروع بأنها مجانية للاستخدام التجاري. تدفع فقط مقابل بنية GPU التحتية الخاصة بك لتشغيلها.

من أنشأ LoRAX؟

أنشأت LoRAX شركة Predibase، وهي شركة منصات تعلم آلة أسسها خريجو Google وUber عام 2021. أعلنت Rubrik، وهي شركة أمن بيانات، عن اتفاقها للاستحواذ على Predibase في 25 يونيو 2025.

ما GPU الذي تتطلبه LoRAX؟

GPU من NVIDIA، جيل Ampere أو أحدث، مع CUDA 11.8 أو أعلى، على Linux. لا يوجد وضع CPU فقط ولا نشر أصلي للخادم على macOS/Windows.

كيف أثبِّت LoRAX؟

كخادم قابل للاستضافة الذاتية عبر صورة Docker (ghcr.io/predibase/lorax:main)، مع توثيق مسارات نشر عبر Kubernetes وSkyPilot أيضاً. يُثبَّت عميل Python بشكل منفصل عبر pip install lorax-client.

ما النماذج الأساسية التي تدعمها LoRAX؟

وفقاً لملاحظات الإصدار: Llama وCodeLlama وMistral وZephyr وQwen وGemma وPhi-3 وCommand-R وDBRX، ونماذج الرؤية واللغة Mllama/Llava-Next، من بين نماذج أخرى — راجع الوثائق الحالية للاطلاع على القائمة الكاملة والمحدَّثة.

هل تُدرِّب LoRAX محولات LoRA؟

لا. LoRAX خادم استدلال يقدم خدمة محولات تم تدريبها بالفعل في مكان آخر عبر PEFT أو Ludwig أو أدوات مماثلة. اجمعها مع أداة ضبط دقيق مخصصة مثل Unsloth أو LLaMA-Factory إذا كنت بحاجة إلى إنتاج المحولات أولاً.

هل لدى LoRAX واجهة برمجة تطبيقات متوافقة مع OpenAI؟

نعم. تعرض LoRAX نقاط نهاية chat-completions وcompletions بتنسيق طلب/استجابة OpenAI، مما يتيح لكود عميل OpenAI الحالي الاتصال بخادم LoRAX قابل للاستضافة الذاتية.

ما تنسيقات التكميم التي تدعمها LoRAX؟

fp16، إضافة إلى التكميم عبر bitsandbytes أو GPT-Q أو AWQ أو EETQ أو HQQ، ودعم ذاكرة تخزين مؤقت KV بصيغة FP8 المُضاف في إصدارات لاحقة، وفقاً لملاحظات الإصدار.

هل اختبرت PromptQuorum بشكل مستقل ادعاءات أداء LoRAX؟

تستند هذه المراجعة إلى مستودع LoRAX الخاص على GitHub وملف README وملاحظات الإصدار، وليس إلى اختبار أداء عملي أجرته PromptQuorum. تحقق من أرقام الإنتاجية وزمن الاستجابة الحالية مباشرةً في وثائق المشروع نفسه قبل اتخاذ أي قرار متعلق بسعة بيئة الإنتاج.

المصادر

← العودة إلى LLM المحلية المتقدمة