النقاط الرئيسية
- LoRAX (github.com/predibase/lorax) هو خادم استدلال متعدد LoRA مجاني ومفتوح المصدر وقابل للاستضافة الذاتية
- أنشأته Predibase، شركة منصات تعلم آلة أسسها خريجو Google وUber عام 2021؛ أعلنت Rubrik عن استحواذها على Predibase في 25 يونيو 2025
- مرخَّص بموجب Apache 2.0، ويصفه المشروع بأنه مجاني للاستخدام التجاري
- نسخة متفرعة من text-generation-inference من Hugging Face (اعتباراً من الإصدار v0.9.4)، ثم توسَّع لاحقاً بإضافة تحميل ديناميكي لعدة محولات LoRA
- يتطلب GPU من NVIDIA، جيل Ampere أو أحدث، CUDA 11.8 أو أعلى، على Linux
- يدعم المحولات المُدرَّبة باستخدام PEFT أو Ludwig؛ ويحمّلها من HuggingFace Hub أو Predibase أو مسار في نظام الملفات المحلي
- أكثر من 3,800 نجمة على GitHub وأكثر من 324 نسخة متفرعة (forks) وقت إعداد هذه المراجعة
📍 في جملة واحدة
LoRAX خادم استدلال مجاني ومفتوح المصدر (Apache 2.0) وقابل للاستضافة الذاتية، وهو نسخة متفرعة من text-generation-inference من Hugging Face، طوَّرته Predibase (استحوذت عليها Rubrik في 2025)، ويقدم خدمة آلاف محولات LoRA المُدرَّبة بدقة فوق نموذج أساسي مشترك واحد على GPU واحد، بأكثر من 3,800 نجمة على GitHub.
💬 بعبارات بسيطة
بدلاً من تشغيل نموذج مُستضاف على GPU منفصل لكل نسخة مُدرَّبة بدقة من نموذج LLM الأساسي الخاص بك، تُحمِّل LoRAX نسخة مشتركة واحدة من النموذج الأساسي وتستبدل ديناميكياً أوزان محولات LoRA الصغيرة حسب كل طلب — بحيث يمكن لـ GPU واحد تقديم خدمة العديد من "الشخصيات" المُدرَّبة بدقة والمختلفة لنفس النموذج في آن واحد، بجزء بسيط من تكلفة استخدام GPU واحد لكل نموذج.
📌ملاحظة: تستند هذه المراجعة إلى مستودع LoRAX الخاص على GitHub وملف README وملاحظات الإصدار. لا تدّعي هذه المراجعة أن PromptQuorum قد قارنت إنتاجيتها أو زمن استجابتها بشكل مستقل مقابل خوادم استدلال أخرى — راجع وثائق المشروع نفسه للاطلاع على أرقام الأداء الحالية قبل اتخاذ أي قرار متعلق بسعة بيئة الإنتاج.
ما هي LoRAX؟
LoRAX ("LoRA eXchange") هي خادم استدلال قابل للاستضافة الذاتية، صُمِّم خصيصاً لتقديم خدمة العديد من محولات LoRA المُدرَّبة بدقة فوق نموذج أساسي مشترك واحد، بدلاً من الحاجة إلى نشر نموذج مخصص لكل تدريب دقيق. وفقاً لموقعها الخاص، فهي "الإطار مفتوح المصدر لتقديم خدمة مئات نماذج LLM المُدرَّبة بدقة في بيئة الإنتاج بسعر واحد".
- نوع المنتج: خادم استدلال قابل للاستضافة الذاتية (واجهة سطر أوامر + مكتبة)، وليس واجهة برمجة تطبيقات مُستضافة أو تطبيق سطح مكتب
- الجهة المطوِّرة: Predibase، تأسست عام 2021 على يد خريجي Google وUber كشركة منصات تعلم آلة
- الوضع المؤسسي: أعلنت Rubrik، وهي شركة أمن بيانات، عن اتفاقها للاستحواذ على Predibase في 25 يونيو 2025؛ أصبحت المنصة التجارية الخاصة بـ Predibase الآن تحت مظلة Rubrik، بينما يظل مشروع LoRAX مفتوح المصدر منشوراً على GitHub تحت منظمة Predibase
- الأساس: نسخة متفرعة من text-generation-inference من Hugging Face (اعتباراً من الإصدار v0.9.4)، ثم توسَّعت لاحقاً خصيصاً لتقديم خدمة عدة محولات بشكل ديناميكي
- الترخيص: Apache 2.0، مؤكَّد عبر مستودع GitHub
- الحجم: أكثر من 3,800 نجمة على GitHub وأكثر من 324 نسخة متفرعة (forks) وقت إعداد هذه المراجعة
تاريخ المشروع ومحطات الإصدارات
تطوَّرت LoRAX بشكل مستمر منذ إصداراتها الأولى في مطلع 2024، مضيفة مع كل إصدار دعماً أوسع للنماذج وخيارات تكميم وميزات تقديم خدمة جديدة. أرقام الإصدارات والتواريخ أدناه مأخوذة من ملاحظات إصدار المشروع الخاصة على GitHub؛ راجع صفحة الإصدارات مباشرةً للاطلاع على أي شيء صدر بعد تاريخ نشر هذه المراجعة.
- 1v0.6.0 — 10 يناير 2024: واجهة برمجة تطبيقات متوافقة مع OpenAI
Why it matters: أضاف نقاط نهاية completions وchat-completions المتوافقة مع OpenAI، مما يتيح لكود عميل OpenAI الحالي الاتصال بخادم LoRAX قابل للاستضافة الذاتية. - 2v0.7.0 — 1 فبراير 2024: دمج عدة محولات، تكميم EETQ/HQQ
Why it matters: أتاح دمج عدة محولات LoRA لكل طلب باستخدام طرق linear وTIES وDARE، وأضاف تنسيقَي تكميم إضافيَين. - 3v0.8.0–v0.8.1 — فبراير 2024: مخرجات منظَّمة ودعم Gemma
Why it matters: أضاف مخرجات منظَّمة موجَّهة بمخطط JSON عبر مكتبة Outlines، إضافة إلى دعم عائلة نماذج Gemma من Google. - 4v0.9.0 — 23 مارس 2024: ذاكرة مخصصة للمحولات، دعم Qwen2
Why it matters: وفقاً لملاحظات الإصدار، خصَّص ذاكرة GPU مخصصة للمحولات وأضاف دعم نماذج Qwen2. - 5v0.10.0 — 23 مايو 2024: فك ترميز تخميني Medusa
Why it matters: أضاف محولات فك الترميز التخميني Medusa ودعم نماذج Phi-3 وCommand-R وDBRX، بهدف تسريع التوليد. - 6v0.11.0 — 18 سبتمبر 2024: تخزين مؤقت للبادئات، دعم الرؤية واللغة
Why it matters: أضاف تخزيناً مؤقتاً للبادئات للطلبات المتكررة، ودعم نموذج الرؤية واللغة Llava-Next، وتكميم FP8 لنموذجَي Mistral وLlama. - 7v0.12.0 — 6 نوفمبر 2024: تخزين مؤقت متعدد LoRA للبادئات، استدعاء الدوال
Why it matters: وفقاً لسجل التغييرات، وسَّع التخزين المؤقت للبادئات ليعمل عبر عدة محولات في آن واحد، وأضاف دعم ذاكرة تخزين مؤقت KV بصيغة FP8، واستدعاء دوال مع فرض المخطط — وهي أحدث محطة استطاعت هذه المراجعة تأكيدها من ملاحظات الإصدار العامة.
ماذا تفعل LoRAX فعلياً؟
تُحمِّل LoRAX نموذجاً أساسياً مشتركاً واحداً في ذاكرة GPU، ثم تُحمِّل وتستبدل ديناميكياً أوزان محولات LoRA الصغيرة مع كل طلب وارد، بحيث يمكن تقديم خدمة العديد من نسخ النماذج المُدرَّبة بدقة من نشر واحد.
- تحميل ديناميكي للمحولات — تُحمَّل محولات LoRA عند الطلب حسب كل طلب بدلاً من اشتراط تحميل كل محول مسبقاً، مع جلب استباقي غير متزامن ونقل بين ذاكرة GPU وCPU لإدارة أي المحولات تبقى "نشطة"
- معالجة دفعية مستمرة وغير متجانسة — تجمع، وفقاً لوصفها المعماري الخاص، الطلبات الموجَّهة لمحولات مختلفة في نفس الدفعة، بدلاً من اشتراط دفعة منفصلة لكل محول
- دعم النماذج الأساسية — متوافقة مع Llama وCodeLlama وMistral وZephyr وQwen وGemma وPhi-3 وCommand-R وDBRX، ونماذج الرؤية واللغة Mllama/Llava-Next، وفقاً لملاحظات الإصدار
- خيارات التكميم — fp16، أو مُكمَّم باستخدام bitsandbytes أو GPT-Q أو AWQ أو EETQ أو HQQ، إضافة إلى دعم ذاكرة تخزين مؤقت KV بصيغة FP8 المُضاف في إصدارات لاحقة
- توافق المحولات — تعمل مع محولات مُدرَّبة عبر PEFT أو Ludwig، ويتم تحميلها من HuggingFace Hub أو Predibase أو مسار في نظام الملفات المحلي
- واجهة برمجة تطبيقات متوافقة مع OpenAI — تعرض نقاط نهاية chat-completions وcompletions بتنسيق طلب/استجابة OpenAI، مما يتيح لكود عميل OpenAI الحالي الاتصال بخادم LoRAX قابل للاستضافة الذاتية
- ميزات بنية تحتية لتقديم الخدمة — وفقاً لوثائقها، تدعم التوازي الموتري وflash-attention وpaged attention وبث الرموز (token streaming) ومقاييس Prometheus وتتبع OpenTelemetry
- مخرجات منظَّمة — توليد موجَّه بمخطط JSON عبر مكتبة Outlines، إضافة إلى استدعاء الدوال مع فرض المخطط في الإصدارات اللاحقة
أمثلة على الاستخدام: ثلاث طرق لاستخدام LoRAX
هذه سير عمل ملموسة مبنية على ميزات LoRAX الموثَّقة الخاصة، وليست حالات استخدام افتراضية.
المنصة والتسعير والترخيص
المنصة
- ما تذكره LoRAX:
- قابلة للاستضافة الذاتية، Linux فقط؛ تتطلب GPU من NVIDIA، جيل Ampere أو أحدث، مع CUDA 11.8 أو أعلى.
التكلفة
- ما تذكره LoRAX:
- مجانية ومفتوحة المصدر، ويصفها المشروع بأنها مجانية للاستخدام التجاري. تدفع فقط مقابل بنية GPU التحتية الخاصة بك — لا توجد فئة مدفوعة منفصلة لـ LoRAX.
الترخيص
- ما تذكره LoRAX:
- Apache 2.0، مؤكَّد عبر مستودع GitHub.
طريقة التثبيت
- ما تذكره LoRAX:
- صورة Docker (
ghcr.io/predibase/lorax:main)، إضافة إلى مسارات نشر موثَّقة عبر Kubernetes وSkyPilot؛ يُثبَّت عميل Python بشكل منفصل عبر pip.
تبيع Predibase (الجهة المطوِّرة لـ LoRAX، والتي أصبحت الآن تحت مظلة Rubrik بعد استحواذها في 2025) أيضاً منصة تجارية مُدارة منفصلة مبنية على تقنية ذات صلة — تحقق من الأسعار التجارية الحالية مباشرةً لدى Predibase/Rubrik إذا كنت بحاجة إلى عرض مُدار بدلاً من الاستضافة الذاتية.
تثبيت LoRAX
تعمل LoRAX كخادم قابل للاستضافة الذاتية عبر Docker أو Kubernetes أو SkyPilot، مع عميل Python منفصل قابل للتثبيت عبر pip.
Source | Link |
|---|---|
| مستودع GitHub (الكود المصدري، Apache 2.0) | github.com/predibase/lorax |
| صورة Docker | docker pull ghcr.io/predibase/lorax:main |
| عميل Python | pip install lorax-client |
| الوثائق | loraexchange.ai |
تتطلب LoRAX GPU من NVIDIA (جيل Ampere أو أحدث) مع CUDA 11.8 أو أعلى على Linux — لا يوجد وضع CPU فقط ولا مسار تثبيت أصلي لـ macOS/Windows. راجع دائماً ملف README على GitHub لمعرفة طريقة النشر الموصى بها حالياً قبل تشغيل أي أمر.
LoRAX مقابل محرك استدلال عام الغرض
تقدم كل من LoRAX ومحرك استدلال عام الغرض مثل LMDeploy أو NVIDIA Dynamo خدمة نماذج LLM على نطاق واسع، لكن LoRAX مصمَّمة خصيصاً حول مشكلة محددة: تقديم خدمة العديد من محولات LoRA على نموذج أساسي واحد بتكلفة منخفضة.
الجانب | LoRAX | محرك استدلال عام الغرض |
|---|---|---|
| المهمة الأساسية | تقديم خدمة العديد من محولات LoRA على نموذج أساسي واحد | تقديم خدمة نموذج كامل واحد أو أكثر بإنتاجية عالية |
| معالجة دفعية متعددة المحولات | معالجة دفعية مستمرة وغير متجانسة مدمجة | عادةً ليست محور تركيز أساسي |
| الأساس | نسخة متفرعة من text-generation-inference من Hugging Face | يختلف حسب المشروع |
| واجهة برمجة تطبيقات متوافقة مع OpenAI | نعم | غالباً نعم |
| الاستخدام الأمثل | العديد من النسخ المُدرَّبة بدقة لنموذج أساسي واحد | عدد أقل من النماذج، أقصى إنتاجية خام |
إذا كان عبء العمل لديك هو تقديم خدمة العديد من النسخ المُدرَّبة بدقة لنفس النموذج الأساسي (محولات لكل عميل أو لكل مهمة)، فإن المعالجة الدفعية المرتكزة على المحولات في LoRAX مصمَّمة خصيصاً لذلك. أما إذا كنت تقدم خدمة عدد صغير من النماذج الكاملة المختلفة بأقصى إنتاجية خام دون الحاجة إلى تبديل المحولات، فقد يكون محرك عام الغرض أنسب — تحقق من المعايير الحالية على مواقع كلا المشروعين قبل الاختيار، حيث يُصدر كلاهما تحسينات أداء بشكل متكرر.
لمن تناسب LoRAX؟
تناسب LoRAX الفرق التي لديها، أو تخطط أن يكون لديها، العديد من محولات LoRA المُدرَّبة بدقة من نفس النموذج الأساسي وتريد تقديم خدمتها بكفاءة من حيث التكلفة من سعة GPU مشتركة.
ما لا تناسبه LoRAX
لا تُعد LoRAX خياراً جيداً إذا كنت بحاجة إلى نشر يعتمد على CPU فقط أو خارج Linux، أو تدريب المحولات بدلاً من تقديم خدمتها، أو منصة مُستضافة مُدارة بالكامل.
- ليست CPU فقط — تتطلب GPU من NVIDIA، جيل Ampere أو أحدث، مع CUDA 11.8 أو أعلى؛ لا يوجد وضع احتياطي على CPU
- ليست متعددة المنصات بالنسبة للخادم نفسه — يعمل خادم LoRAX على Linux فقط، وفقاً لوثائقها الخاصة
- ليست أداة تدريب — تقدم LoRAX خدمة محولات LoRA المُدرَّبة بالفعل في مكان آخر (عبر PEFT أو Ludwig أو ما شابه)؛ ولا تقوم بتدريب النماذج بدقة بنفسها
- ليست خدمة مُستضافة مُدارة بمفردها — إنها برمجية مفتوحة المصدر قابلة للاستضافة الذاتية؛ منصة Predibase التجارية المنفصلة (الآن تحت مظلة Rubrik بعد استحواذها في 2025) هي الخيار المُدار إذا رغبت في ذلك
- لم تختبرها PromptQuorum بشكل مستقل من حيث الإنتاجية أو زمن الاستجابة — تستند هذه المراجعة إلى وثائق LoRAX وملاحظات إصدارها الخاصة، وليس إلى اختبار عملي
أخطاء شائعة عند تقييم LoRAX
يأتي معظم الالتباس حول LoRAX من توقع أن تُدرِّب المحولات، أو أن تعمل دون GPU، أو افتراض أن دعمها المؤسسي لم يتغير بعد استحواذ Predibase.
المنافسون والبدائل
تُقارَن LoRAX غالباً بأدوات استدلال وضبط دقيق أخرى قابلة للاستضافة الذاتية، نظراً لأنها تقع عند تقاطع مجالَي تقديم خدمة الاستدلال والضبط الدقيق بـ LoRA. مكمِّلة لمدخل LoRAX الخاص في دليل برمجيات LLM المحلية.
Tool | Best known for | Link |
|---|---|---|
| LMDeploy | محرك استدلال مفتوح المصدر مع مجموعة أدوات للتكميم وتقديم الخدمة | مراجعة LMDeploy |
| NVIDIA Dynamo | إطار تقديم استدلال عالي الإنتاجية مع ميزات خادم API | مراجعة NVIDIA Dynamo |
| Unsloth | مكتبة ضبط دقيق LoRA/QLoRA سريعة وفعالة من حيث الذاكرة | مراجعة Unsloth |
| LLaMA-Factory | إطار ضبط دقيق موحَّد يدعم LoRA وطرق PEFT الأخرى | مراجعة LLaMA-Factory |
تعكس هذه القائمة أدوات في نفس مجال تقديم خدمة الاستدلال والضبط الدقيق بـ LoRA مثل LoRAX، وليست تصنيفاً مستقلاً من PromptQuorum — تحقق من مجموعة الميزات الحالية لكل أداة قبل الاختيار، نظراً لأن تركيز LoRAX على تقديم خدمة عدة محولات ليس مطابقاً لمحرك استدلال عام الغرض أو أداة مخصصة للتدريب فقط.
الأسئلة الشائعة
ما هي LoRAX؟
LoRAX ("LoRA eXchange"، github.com/predibase/lorax) هي خادم استدلال مجاني ومفتوح المصدر وقابل للاستضافة الذاتية، يقدم خدمة العديد من محولات LoRA المُدرَّبة بدقة فوق نموذج أساسي مشترك واحد على GPU واحد.
هل LoRAX مجانية؟
نعم، LoRAX نفسها مجانية ومفتوحة المصدر (Apache 2.0)، ويصفها المشروع بأنها مجانية للاستخدام التجاري. تدفع فقط مقابل بنية GPU التحتية الخاصة بك لتشغيلها.
من أنشأ LoRAX؟
أنشأت LoRAX شركة Predibase، وهي شركة منصات تعلم آلة أسسها خريجو Google وUber عام 2021. أعلنت Rubrik، وهي شركة أمن بيانات، عن اتفاقها للاستحواذ على Predibase في 25 يونيو 2025.
ما GPU الذي تتطلبه LoRAX؟
GPU من NVIDIA، جيل Ampere أو أحدث، مع CUDA 11.8 أو أعلى، على Linux. لا يوجد وضع CPU فقط ولا نشر أصلي للخادم على macOS/Windows.
كيف أثبِّت LoRAX؟
كخادم قابل للاستضافة الذاتية عبر صورة Docker (ghcr.io/predibase/lorax:main)، مع توثيق مسارات نشر عبر Kubernetes وSkyPilot أيضاً. يُثبَّت عميل Python بشكل منفصل عبر pip install lorax-client.
ما النماذج الأساسية التي تدعمها LoRAX؟
وفقاً لملاحظات الإصدار: Llama وCodeLlama وMistral وZephyr وQwen وGemma وPhi-3 وCommand-R وDBRX، ونماذج الرؤية واللغة Mllama/Llava-Next، من بين نماذج أخرى — راجع الوثائق الحالية للاطلاع على القائمة الكاملة والمحدَّثة.
هل تُدرِّب LoRAX محولات LoRA؟
لا. LoRAX خادم استدلال يقدم خدمة محولات تم تدريبها بالفعل في مكان آخر عبر PEFT أو Ludwig أو أدوات مماثلة. اجمعها مع أداة ضبط دقيق مخصصة مثل Unsloth أو LLaMA-Factory إذا كنت بحاجة إلى إنتاج المحولات أولاً.
هل لدى LoRAX واجهة برمجة تطبيقات متوافقة مع OpenAI؟
نعم. تعرض LoRAX نقاط نهاية chat-completions وcompletions بتنسيق طلب/استجابة OpenAI، مما يتيح لكود عميل OpenAI الحالي الاتصال بخادم LoRAX قابل للاستضافة الذاتية.
ما تنسيقات التكميم التي تدعمها LoRAX؟
fp16، إضافة إلى التكميم عبر bitsandbytes أو GPT-Q أو AWQ أو EETQ أو HQQ، ودعم ذاكرة تخزين مؤقت KV بصيغة FP8 المُضاف في إصدارات لاحقة، وفقاً لملاحظات الإصدار.
هل اختبرت PromptQuorum بشكل مستقل ادعاءات أداء LoRAX؟
تستند هذه المراجعة إلى مستودع LoRAX الخاص على GitHub وملف README وملاحظات الإصدار، وليس إلى اختبار أداء عملي أجرته PromptQuorum. تحقق من أرقام الإنتاجية وزمن الاستجابة الحالية مباشرةً في وثائق المشروع نفسه قبل اتخاذ أي قرار متعلق بسعة بيئة الإنتاج.