Skip to main content
PromptQuorum
الرئيسية/LLM المحلية المتقدمة/مراجعة LMDeploy: خدمة نماذج اللغة الكبيرة بإنتاجية عالية والتكميم
Overview & Reference

مراجعة LMDeploy: خدمة نماذج اللغة الكبيرة بإنتاجية عالية والتكميم

·وقت القراءة 10 دقائق·بقلم Hans Kuepper · مؤسس PromptQuorum، أداة إرسال الذكاء الاصطناعي متعددة النماذج · PromptQuorum

LMDeploy مجموعة أدوات ومكتبة Python مجانية ومفتوحة المصدر (رخصة Apache 2.0) تعمل عبر سطر الأوامر لضغط وتكميم وخدمة نماذج اللغة الكبيرة على معالجات NVIDIA الرسومية، وتُثبَّت عبر pip install lmdeploy. طوّرها فريقا MMRazor وMMDeploy ضمن منظومة InternLM/OpenMMLab، وتأتي بمحركَي استدلال — TurboMind (محرك C++/CUDA مُحسَّن للإنتاجية) ومحرك PyTorch مكتوب بلغة Python خالصة — إضافة إلى تكميم AWQ وذاكرة KV المؤقتة، وخادم API متوافق مع OpenAI، ودعم لأكثر بكثير من 50 عائلة من نماذج اللغة الكبيرة ونماذج الرؤية واللغة المفتوحة الأوزان.

LMDeploy (github.com/InternLM/lmdeploy) هي مجموعة أدوات مجانية ومفتوحة المصدر (رخصة Apache 2.0) لضغط وتكميم وخدمة نماذج اللغة الكبيرة، طوّرها فريقا MMRazor وMMDeploy ضمن منظومة InternLM/OpenMMLab. تُثبَّت عبر pip install lmdeploy وتأتي بمحركَي استدلال — TurboMind ومحرك PyTorch مكتوب بلغة Python خالصة — إضافةً إلى خادم API متوافق مع OpenAI، وتتجاوز نجومها على GitHub 8,000 نجمة. هذه المراجعة مكمّلة لإدراج LMDeploy في دليل برمجيات نماذج اللغة الكبيرة المحلية، وتوضح ما تفعله فعليًا، وكيفية تثبيتها، ولمن تناسب.

النقاط الرئيسية

  • LMDeploy (github.com/InternLM/lmdeploy) مجموعة أدوات مجانية ومفتوحة المصدر وقابلة للتثبيت عبر pip للاستدلال والتكميم — واجهة سطر أوامر/مكتبة، وليست تطبيقًا رسوميًا
  • طوّرها فريقا MMRazor وMMDeploy ضمن منظومة InternLM/OpenMMLab (مختبر شنغهاي للذكاء الاصطناعي)؛ أُنشئ المستودع في 15 يونيو 2023
  • مرخّصة بموجب Apache 2.0، وهو ما يؤكده ملف LICENSE في مستودع GitHub
  • تأتي بمحركَي استدلال: TurboMind (‏C++/CUDA، مُحسَّن للإنتاجية) ومحرك PyTorch مكتوب بلغة Python خالصة
  • تدعم تكميم AWQ بـ4 بت للأوزان فقط وتكميم ذاكرة KV المؤقتة بـint8/int4
  • أكثر من 8,000 نجمة على GitHub و750 نسخة متفرعة وقت إعداد هذه المراجعة؛ آخر إصدار موسوم هو v0.17.0، صدر في 1 سبتمبر 2026

📍 في جملة واحدة

LMDeploy مجموعة أدوات مجانية ومفتوحة المصدر (رخصة Apache 2.0) لضغط وتكميم وخدمة نماذج اللغة الكبيرة على معالجات NVIDIA الرسومية، طوّرها فريقا MMRazor وMMDeploy ضمن منظومة InternLM/OpenMMLab، وتُثبَّت عبر pip install lmdeploy، وتتجاوز نجومها على GitHub 8,000 نجمة.

💬 بعبارات بسيطة

LMDeploy أداة سطر أوامر ومكتبة Python تُثبَّت عبر pip، وتأخذ نموذج لغة كبيرًا تملكه بالفعل (من HuggingFace مثلًا) وتشغّله بسرعة على معالجك الرسومي الخاص، مع إمكانية تصغيره أولًا عبر تكميم 4 بت لاستهلاك ذاكرة أقل. إنها ليست تطبيق محادثة بنافذة تنقر عليها، بل بنية تحتية تشغّلها على خادم، وتتحدث معها التطبيقات الأخرى عبر واجهة برمجية متوافقة مع OpenAI.

📌ملاحظة: تستند هذه المراجعة إلى مستودع LMDeploy على GitHub وملف README الخاص به وتوثيقه وصفحته على PyPI. أرقام الإنتاجية وسرعة التكميم (مثل «أسرع بـ1.8 ضعف من vLLM») هي معايير أداء نشرها المشروع نفسه، وليست قياسات مستقلة أجرتها PromptQuorum — تحقق من معايير الأداء المنشورة الحالية قبل الاعتماد على رقم محدد في قرار شراء أو تصميم بنية.

ما هي LMDeploy؟

LMDeploy مجموعة أدوات لضغط ونشر وخدمة نماذج اللغة الكبيرة، مصممة لتشغيل الاستدلال على معالجات NVIDIA الرسومية بإنتاجية عالية. يذكر وصفها على GitHub أنها طُوّرت من قبل فريقَي MMRazor وMMDeploy — وكلاهما مشروعان تابعان لـOpenMMLab، وهي المنظومة مفتوحة المصدر للرؤية الحاسوبية ونشر النماذج التي يديرها مختبر شنغهاي للذكاء الاصطناعي، نفس الجهة التي تقف خلف عائلة نماذج InternLM.

  • نوع المنتج: أداة سطر أوامر ومكتبة Python — لا واجهة رسومية؛ تُستخدم من طرفية أو نص برمجي بلغة Python أو حاوية Docker
  • المطوِّر: فريقا MMRazor وMMDeploy، جزء من منظومة InternLM/OpenMMLab التابعة لمختبر شنغهاي للذكاء الاصطناعي
  • المستودع: InternLM/lmdeploy على GitHub، أُنشئ في 15 يونيو 2023
  • الترخيص: Apache 2.0، وهو ما يؤكده ملف LICENSE في المستودع
  • الحجم: أكثر من 8,000 نجمة على GitHub و750 نسخة متفرعة و596 مسألة مفتوحة وقت إعداد هذه المراجعة
  • التوزيع: منشورة على PyPI كحزمة lmdeploy، إضافة إلى صور Docker رسمية حسب توثيق المشروع

تاريخ المشروع ومحطات الإصدارات

أُنشئ مستودع LMDeploy على GitHub في يونيو 2023، ويصدر المشروع تحديثات باستمرار منذ ذلك الحين، متوسعًا من محرك استدلال TurboMind واحد إلى مجموعة أدوات بمحركين تشمل التكميم ودعم النماذج متعددة الوسائط (VLM) والخدمة الموزّعة.

  1. 1
    2023/08 — تكميم AWQ بـ4 بت وإطلاق على HuggingFace Hub
    Why it matters: أضافت تكميم الأوزان بـ4 بت المستند إلى AWQ ونشرت نماذج جاهزة بـ4 بت على HuggingFace، حسب سجل التغييرات الرسمي.
  2. 2
    2024/01 — إدخال محرك استدلال PyTorch
    Why it matters: أضافت محرك استدلال ثانيًا، مكتوبًا بلغة Python خالصة، إلى جانب TurboMind، ما خفّض الحاجز أمام المطورين لتوسيع مكدّس الخدمة أو تصحيح أخطائه.
  3. 3
    2024/06–2024/07 — دعم النماذج متعددة الوسائط واستدعاء الدوال
    Why it matters: أضافت خطوط أنابيب استدلال متعددة الوسائط (نماذج الرؤية واللغة) وخدمتها، إضافة إلى استدعاء الأدوات/الدوال لنموذجَي Llama 3.1 وInternLM2.5.
  4. 4
    2025/01 — دعم DeepSeek V3 وR1
    Why it matters: أضافت دعمًا قريبًا من اليوم الأول لعائلتَي نماذج DeepSeek V3 وR1، وهي سلسلة نماذج استدلال منطقي واسعة الاستخدام.
  5. 5
    2025/06 — فصل مرحلتَي prefill وdecode في DeepSeek
    Why it matters: دمجت فصل مرحلتَي prefill/decode لنماذج DeepSeek عبر DLSlime وMooncake، وهي تقنية إنتاجية لتوسيع نطاق خدمة نماذج MoE الكبيرة عبر عدة أجهزة.
  6. 6
    2025/09 — دعم MXFP4 على معالجات NVIDIA الرسومية (V100 وأحدث)
    Why it matters: أضافت استدلالًا مكمَّمًا بصيغة MXFP4، وحسب سجل التغييرات الخاص بـLMDeploy يحقق إنتاجية تبلغ 1.5 ضعف vLLM على معالجات H800 لنماذج gpt-oss الخاصة بـOpenAI.
  7. 7
    2026/02 — دعم Qwen3.5 والتكامل مع llm-compressor
    Why it matters: أضافت دعمًا لمجموعة نماذج Qwen3.5، ودمجت vllm-project/llm-compressor لتكميم متماثل/غير متماثل بـ4 بت.
  8. 8
    v0.17.0 — 1 سبتمبر 2026
    Why it matters: آخر إصدار موسوم على GitHub وقت إعداد هذه المراجعة — راجع [صفحة الإصدارات على GitHub](https://github.com/InternLM/lmdeploy/releases) مباشرة لمعرفة أي شيء صدر بعد تاريخ نشر هذه المراجعة.

ماذا يمكنك أن تفعل بواسطة LMDeploy؟

تتمحور مجموعة ميزات LMDeploy حول ثلاث مهام: تصغير النموذج عبر التكميم، وتشغيله بكفاءة، وإتاحته كخدمة شبكية. إليك ما تفعله كل جزئية فعليًا، حسب ملف README والتوثيق الخاصَّين بـLMDeploy.

  • محركا استدلال — TurboMind، وهو محرك C++/CUDA تقدّمه LMDeploy باعتباره خيارها الأعلى إنتاجية، ومحرك PyTorch مكتوب بلغة Python خالصة أسهل في التوسعة وإضافة معماريات نماذج جديدة إليه؛ اختر حسب النموذج بالرجوع إلى جدول النماذج المدعومة الخاص بـLMDeploy
  • التجميع الدفعي المستمر والانتباه المُرقّم بصفحات — تجميع دفعي مستمر ودائم، وذاكرة KV مؤقتة مجزّأة/مُرقّمة بصفحات، ودمج ديناميكي للتقسيم، وهي نفس فئة التقنيات التي تستخدمها محركات استدلال إنتاجية أخرى لرفع استغلال المعالج الرسومي تحت وطأة طلبات متزامنة
  • التكميم — تكميم AWQ بـ4 بت للأوزان فقط، إضافة إلى تكميم ذاكرة KV المؤقتة بـint8/int4 القابل للجمع مع AWQ في آن واحد، و(منذ 2026/02) تكميم متماثل/غير متماثل بـ4 بت عبر تكامل مع llm-compressor
  • دعم واسع للنماذج — عشرات عائلات نماذج اللغة الكبيرة، بما فيها Llama وLlama2/3/3.1/3.2 وInternLM2/3 وQwen1.5/2/2.5/3 وQwen3-MoE وQwen3-Next وDeepSeek-MoE/V2/V3/R1 وMistral وMixtral وChatGLM2 وGLM-4 وYi وBaichuan2 وCode Llama، حسب توثيق النماذج المدعومة الخاص بـLMDeploy
  • دعم نماذج الرؤية واللغة (VLM) — خطوط أنابيب استدلال دون اتصال وخدمة API لنماذج متعددة الوسائط مثل InternVL وLLaVA وMiniGemini وCogVLM2
  • خادم API متوافق مع OpenAI — يشغّل lmdeploy serve api_server خادمًا يحاكي صيغة طلب/استجابة إكمال المحادثات الخاصة بـOpenAI، موثّق بشكل منفصل لنماذج اللغة الكبيرة ونماذج الرؤية واللغة
  • خط أنابيب استدلال دفعي دون اتصال — واجهة برمجية بلغة Python باسم lmdeploy.pipeline() لتشغيل الاستدلال مباشرة داخل نص برمجي، دون الحاجة لإنشاء خادم
  • خادم وكيل متعدد النماذج ومتعدد الأجهزة — خدمة توزيع طلبات لتشغيل عدة نماذج عبر عدة أجهزة ومعالجات رسومية خلف نقطة دخول واحدة
  • دعم أجهزة يتجاوز معالجات NVIDIA CUDA الرسومية — دعم لوحدات Huawei Ascend NPU عبر محرك PyTorch، ودعم لنظام Windows (بدرجة توازي موتّرات 1) عبر TurboMind

أمثلة على الاستخدام: ثلاث طرق لاستخدام LMDeploy

هذه سير عمل ملموسة مبنية على أوامر LMDeploy الموثقة أعلاه — وليست حالات استخدام افتراضية.

التسعير والترخيص

LMDeploy مجانية ومفتوحة المصدر، دون أي خطة مدفوعة. يطبّق ملف LICENSE في مستودع GitHub رخصة Apache، الإصدار 2.0، دون تعديل، ولا توجد صفحة تسعير على الإطلاق في توثيق المشروع.

  • لا اشتراك، لا خطة مدفوعة، ولا حدود استخدام تفرضها LMDeploy نفسها
  • لا حاجة لحساب أو تسجيل لتثبيت مجموعة الأدوات أو استخدامها
  • تكلفتك الفعلية هي تكلفة معدات GPU أو نسخة GPU السحابية التي تشغّل عليها LMDeploy — ولا تضيف LMDeploy نفسها أي رسوم إضافية
  • رخصة Apache 2.0 رخصة متساهلة: لا التزام copyleft بإصدار شيفرتك الخاصة، والاستخدام التجاري/الإنتاجي مسموح صراحة

LMDeploy مقابل vLLM

تُعد LMDeploy وvLLM من أكثر محركات استدلال نماذج اللغة الكبيرة مفتوحة المصدر استخدامًا، ويقارن تسويق LMDeploy نفسها نفسها صراحة بـvLLM. كلاهما مجاني، وقريب من رخصة Apache 2.0 (‏vLLM مرخّصة أيضًا بـApache 2.0)، وقابل للتثبيت عبر Python، ويدعم خادم API متوافقًا مع OpenAI — وتكمن الاختلافات أساسًا في معمارية المحرك وحجم المنظومة والتركيز على عائلات نماذج معينة.

المحركات الأساسية

LMDeploy:
TurboMind (‏C++/CUDA) إضافة إلى محرك PyTorch
vLLM:
محرك واحد قائم على PagedAttention

ادعاء الإنتاجية

LMDeploy:
حتى 1.8 ضعف vLLM (تصريح ذاتي)
vLLM:
يُستشهد به على نطاق واسع كخط أساس معياري في الصناعة

التكميم

LMDeploy:
AWQ، وذاكرة KV مؤقتة بـint8/int4، وMXFP4
vLLM:
AWQ وGPTQ وFP8 وصيغ أخرى

حجم المنظومة

LMDeploy:
نحو 8,000 نجمة على GitHub
vLLM:
مجتمع أكبر ونطاق تكامل أوسع مع أطراف ثالثة

قوة عائلة النماذج

LMDeploy:
دعم قوي من الدرجة الأولى لـInternLM وQwen
vLLM:
واسع جدًا، وغالبًا أول من يدعم إصدارات جديدة من مختبرات عديدة

المطوِّر

LMDeploy:
فريقا MMRazor/MMDeploy (مختبر شنغهاي للذكاء الاصطناعي)
vLLM:
نشأت في جامعة كاليفورنيا بيركلي، وهي الآن مشروع مفتوح المصدر واسع يضم عدة شركات

ادعاءات الإنتاجية لدى LMDeploy هي أرقام نشرتها بنفسها، وليست معيار أداء مستقلًا أجرته PromptQuorum — أجرِ مقارنتك الخاصة على نموذجك المستهدف ومعالجك الرسومي ونمط حركة مرورك قبل اختيار أحدهما للإنتاج. راجع شرح vLLM لمزيد من التفاصيل عن vLLM تحديدًا.

لمن تناسب LMDeploy؟

تناسب LMDeploy الفرق التي تنشر نماذج اللغة الكبيرة على بنيتها التحتية الخاصة من معالجات NVIDIA الرسومية، وتريد مكدّس خدمة مراعيًا للتكميم وعالي الإنتاجية بدلًا من تطبيق محادثة لسطح المكتب.

المنافسون والبدائل

تقع LMDeploy ضمن قطاع محركات خدمة نماذج اللغة الكبيرة الإنتاجية إلى جانب vLLM وTensorRT-LLM وSGLang وExLlamaV2 — وهي أدوات صُممت لتشغيل النماذج على نطاق واسع على معدات GPU مخصصة، وتختلف عن تطبيقات سطح المكتب الموجهة للمستهلكين.

vLLM

تشتهر بـ:
محرك الاستدلال مفتوح المصدر الأكثر اعتمادًا، PagedAttention، ودعم واسع منذ اليوم الأول للنماذج الجديدة
مقالات حول vLLM (10)

+81 أخرى غير معروضة

TensorRT-LLM

تشتهر بـ:
مكتبة الاستدلال الخاصة بـNVIDIA القائمة على مترجم برمجي، مُحسَّنة بعمق لمعداتها
مقالات حول TensorRT-LLM (7)

مذكور أيضًا في:

SGLang

تشتهر بـ:
محرك استدلال ولغة توليد منظّم مبنيان حول تخزين RadixAttention المؤقت
مقالات حول SGLang (5)

مذكور أيضًا في:

ExLlamaV2

تشتهر بـ:
محرك يركّز على التكميم، ويحظى بشعبية لتشغيل نماذج GPTQ/EXL2 على معالجات رسومية استهلاكية
مقالات حول ExLlamaV2 (2)

مذكور أيضًا في:

تعكس هذه القائمة أدوات تُقارَن عادة بـLMDeploy في قطاع الخدمة الإنتاجية، وليست تصنيفًا مستقلًا من PromptQuorum — تحقق من مجموعة الميزات الحالية ومتطلبات المعدات لكل أداة قبل الاختيار.

أخطاء شائعة عند تقييم LMDeploy

ينشأ معظم اللبس حول LMDeploy من التعامل معها كتطبيق محادثة لسطح المكتب، أو من الاستشهاد بأرقام معايير الأداء التي أعلنها المشروع نفسه على أنها موثّقة بشكل مستقل.

الأسئلة الشائعة

ما هي LMDeploy؟

LMDeploy (github.com/InternLM/lmdeploy) هي مجموعة أدوات مجانية ومفتوحة المصدر (رخصة Apache 2.0) لضغط وتكميم وخدمة نماذج اللغة الكبيرة على معالجات NVIDIA الرسومية، طوّرها فريقا MMRazor وMMDeploy ضمن منظومة InternLM/OpenMMLab.

هل LMDeploy مجانية؟

نعم. LMDeploy مرخّصة بموجب Apache 2.0، دون صفحة تسعير أو خطة مدفوعة. تكلفتك الفعلية هي تكلفة معدات GPU أو النسخة السحابية التي تشغّلها عليها.

كيف أثبّت LMDeploy؟

نفّذ pip install lmdeploy داخل بيئة Python 3.10–3.13 (يُنصح ببيئة conda). منذ الإصدار v0.13.0، تستهدف حزم PyPI الافتراضية CUDA 12.8، لذا يكفي ذلك عادة دون تثبيت CUDA منفصل في إعدادات معالجات NVIDIA الرسومية النمطية.

هل لدى LMDeploy واجهة رسومية؟

لا. LMDeploy مجموعة أدوات سطر أوامر ومكتبة Python. لا تملك نافذة محادثة — تتفاعل معها عبر الطرفية أو نص برمجي بلغة Python أو خادم API المتوافق مع OpenAI.

هل LMDeploy أسرع من vLLM؟

يذكر ملف README الخاص بـLMDeploy إنتاجية طلبات أعلى بما يصل إلى 1.8 ضعف من vLLM، استنادًا إلى معايير أداء نشرتها بنفسها. هذا ليس رقمًا موثّقًا بشكل مستقل — أجرِ معيار أداء خاصًا بك على نموذجك ومعداتك المستهدفة قبل الاعتماد عليه.

ما نوع التكميم الذي تدعمه LMDeploy؟

تكميم AWQ بـ4 بت للأوزان فقط، وتكميم ذاكرة KV المؤقتة بـint8/int4 (قابل للجمع مع AWQ)، وMXFP4 على معالجات NVIDIA الرسومية المدعومة، ومنذ 2026/02، تكميم متماثل/غير متماثل بـ4 بت عبر تكامل مع vllm-project/llm-compressor.

ما النماذج التي تدعمها LMDeploy؟

عشرات عائلات نماذج اللغة الكبيرة — بما فيها Llama وInternLM2/3 وQwen1.5 حتى Qwen3 وDeepSeek-MoE/V2/V3/R1 وMistral وChatGLM2 وGLM-4 وCode Llama — إضافة إلى نماذج الرؤية واللغة مثل InternVL وLLaVA وCogVLM2. راجع توثيق النماذج المدعومة الخاص بـLMDeploy نفسه للقائمة الكاملة والمحدّثة.

هل تدعم LMDeploy معالجات رسومية غير NVIDIA؟

يستهدف محركها الأساسي TurboMind معالجات NVIDIA CUDA الرسومية. يضيف محرك PyTorch دعمًا لوحدات Huawei Ascend NPU. لم تجد هذه المراجعة مسار دعم للمعالج المركزي فقط أو لشرائح Apple Silicon.

من يطوّر LMDeploy؟

فريقا MMRazor وMMDeploy، وهما جزء من منظومة InternLM/OpenMMLab مفتوحة المصدر التي يديرها مختبر شنغهاي للذكاء الاصطناعي.

هل تملك LMDeploy خادم API متوافقًا مع OpenAI؟

نعم. يشغّل تنفيذ lmdeploy serve api_server خادمًا محليًا يحاكي صيغة طلب/استجابة إكمال المحادثات الخاصة بـOpenAI، ما يتيح لكود عميل OpenAI الموجود مسبقًا التوجه إليه بدلًا من نقطة نهاية سحابية.

المصادر

← العودة إلى LLM المحلية المتقدمة