النقاط الرئيسية
- LMDeploy (github.com/InternLM/lmdeploy) مجموعة أدوات مجانية ومفتوحة المصدر وقابلة للتثبيت عبر pip للاستدلال والتكميم — واجهة سطر أوامر/مكتبة، وليست تطبيقًا رسوميًا
- طوّرها فريقا MMRazor وMMDeploy ضمن منظومة InternLM/OpenMMLab (مختبر شنغهاي للذكاء الاصطناعي)؛ أُنشئ المستودع في 15 يونيو 2023
- مرخّصة بموجب Apache 2.0، وهو ما يؤكده ملف LICENSE في مستودع GitHub
- تأتي بمحركَي استدلال: TurboMind (C++/CUDA، مُحسَّن للإنتاجية) ومحرك PyTorch مكتوب بلغة Python خالصة
- تدعم تكميم AWQ بـ4 بت للأوزان فقط وتكميم ذاكرة KV المؤقتة بـint8/int4
- أكثر من 8,000 نجمة على GitHub و750 نسخة متفرعة وقت إعداد هذه المراجعة؛ آخر إصدار موسوم هو v0.17.0، صدر في 1 سبتمبر 2026
📍 في جملة واحدة
LMDeploy مجموعة أدوات مجانية ومفتوحة المصدر (رخصة Apache 2.0) لضغط وتكميم وخدمة نماذج اللغة الكبيرة على معالجات NVIDIA الرسومية، طوّرها فريقا MMRazor وMMDeploy ضمن منظومة InternLM/OpenMMLab، وتُثبَّت عبر pip install lmdeploy، وتتجاوز نجومها على GitHub 8,000 نجمة.
💬 بعبارات بسيطة
LMDeploy أداة سطر أوامر ومكتبة Python تُثبَّت عبر pip، وتأخذ نموذج لغة كبيرًا تملكه بالفعل (من HuggingFace مثلًا) وتشغّله بسرعة على معالجك الرسومي الخاص، مع إمكانية تصغيره أولًا عبر تكميم 4 بت لاستهلاك ذاكرة أقل. إنها ليست تطبيق محادثة بنافذة تنقر عليها، بل بنية تحتية تشغّلها على خادم، وتتحدث معها التطبيقات الأخرى عبر واجهة برمجية متوافقة مع OpenAI.
📌ملاحظة: تستند هذه المراجعة إلى مستودع LMDeploy على GitHub وملف README الخاص به وتوثيقه وصفحته على PyPI. أرقام الإنتاجية وسرعة التكميم (مثل «أسرع بـ1.8 ضعف من vLLM») هي معايير أداء نشرها المشروع نفسه، وليست قياسات مستقلة أجرتها PromptQuorum — تحقق من معايير الأداء المنشورة الحالية قبل الاعتماد على رقم محدد في قرار شراء أو تصميم بنية.
ما هي LMDeploy؟
LMDeploy مجموعة أدوات لضغط ونشر وخدمة نماذج اللغة الكبيرة، مصممة لتشغيل الاستدلال على معالجات NVIDIA الرسومية بإنتاجية عالية. يذكر وصفها على GitHub أنها طُوّرت من قبل فريقَي MMRazor وMMDeploy — وكلاهما مشروعان تابعان لـOpenMMLab، وهي المنظومة مفتوحة المصدر للرؤية الحاسوبية ونشر النماذج التي يديرها مختبر شنغهاي للذكاء الاصطناعي، نفس الجهة التي تقف خلف عائلة نماذج InternLM.
- نوع المنتج: أداة سطر أوامر ومكتبة Python — لا واجهة رسومية؛ تُستخدم من طرفية أو نص برمجي بلغة Python أو حاوية Docker
- المطوِّر: فريقا MMRazor وMMDeploy، جزء من منظومة InternLM/OpenMMLab التابعة لمختبر شنغهاي للذكاء الاصطناعي
- المستودع: InternLM/lmdeploy على GitHub، أُنشئ في 15 يونيو 2023
- الترخيص: Apache 2.0، وهو ما يؤكده ملف LICENSE في المستودع
- الحجم: أكثر من 8,000 نجمة على GitHub و750 نسخة متفرعة و596 مسألة مفتوحة وقت إعداد هذه المراجعة
- التوزيع: منشورة على PyPI كحزمة
lmdeploy، إضافة إلى صور Docker رسمية حسب توثيق المشروع
تاريخ المشروع ومحطات الإصدارات
أُنشئ مستودع LMDeploy على GitHub في يونيو 2023، ويصدر المشروع تحديثات باستمرار منذ ذلك الحين، متوسعًا من محرك استدلال TurboMind واحد إلى مجموعة أدوات بمحركين تشمل التكميم ودعم النماذج متعددة الوسائط (VLM) والخدمة الموزّعة.
- 12023/08 — تكميم AWQ بـ4 بت وإطلاق على HuggingFace Hub
Why it matters: أضافت تكميم الأوزان بـ4 بت المستند إلى AWQ ونشرت نماذج جاهزة بـ4 بت على HuggingFace، حسب سجل التغييرات الرسمي. - 22024/01 — إدخال محرك استدلال PyTorch
Why it matters: أضافت محرك استدلال ثانيًا، مكتوبًا بلغة Python خالصة، إلى جانب TurboMind، ما خفّض الحاجز أمام المطورين لتوسيع مكدّس الخدمة أو تصحيح أخطائه. - 32024/06–2024/07 — دعم النماذج متعددة الوسائط واستدعاء الدوال
Why it matters: أضافت خطوط أنابيب استدلال متعددة الوسائط (نماذج الرؤية واللغة) وخدمتها، إضافة إلى استدعاء الأدوات/الدوال لنموذجَي Llama 3.1 وInternLM2.5. - 42025/01 — دعم DeepSeek V3 وR1
Why it matters: أضافت دعمًا قريبًا من اليوم الأول لعائلتَي نماذج DeepSeek V3 وR1، وهي سلسلة نماذج استدلال منطقي واسعة الاستخدام. - 52025/06 — فصل مرحلتَي prefill وdecode في DeepSeek
Why it matters: دمجت فصل مرحلتَي prefill/decode لنماذج DeepSeek عبر DLSlime وMooncake، وهي تقنية إنتاجية لتوسيع نطاق خدمة نماذج MoE الكبيرة عبر عدة أجهزة. - 62025/09 — دعم MXFP4 على معالجات NVIDIA الرسومية (V100 وأحدث)
Why it matters: أضافت استدلالًا مكمَّمًا بصيغة MXFP4، وحسب سجل التغييرات الخاص بـLMDeploy يحقق إنتاجية تبلغ 1.5 ضعف vLLM على معالجات H800 لنماذج gpt-oss الخاصة بـOpenAI. - 72026/02 — دعم Qwen3.5 والتكامل مع llm-compressor
Why it matters: أضافت دعمًا لمجموعة نماذج Qwen3.5، ودمجت vllm-project/llm-compressor لتكميم متماثل/غير متماثل بـ4 بت. - 8v0.17.0 — 1 سبتمبر 2026
Why it matters: آخر إصدار موسوم على GitHub وقت إعداد هذه المراجعة — راجع [صفحة الإصدارات على GitHub](https://github.com/InternLM/lmdeploy/releases) مباشرة لمعرفة أي شيء صدر بعد تاريخ نشر هذه المراجعة.
ماذا يمكنك أن تفعل بواسطة LMDeploy؟
تتمحور مجموعة ميزات LMDeploy حول ثلاث مهام: تصغير النموذج عبر التكميم، وتشغيله بكفاءة، وإتاحته كخدمة شبكية. إليك ما تفعله كل جزئية فعليًا، حسب ملف README والتوثيق الخاصَّين بـLMDeploy.
- محركا استدلال — TurboMind، وهو محرك C++/CUDA تقدّمه LMDeploy باعتباره خيارها الأعلى إنتاجية، ومحرك PyTorch مكتوب بلغة Python خالصة أسهل في التوسعة وإضافة معماريات نماذج جديدة إليه؛ اختر حسب النموذج بالرجوع إلى جدول النماذج المدعومة الخاص بـLMDeploy
- التجميع الدفعي المستمر والانتباه المُرقّم بصفحات — تجميع دفعي مستمر ودائم، وذاكرة KV مؤقتة مجزّأة/مُرقّمة بصفحات، ودمج ديناميكي للتقسيم، وهي نفس فئة التقنيات التي تستخدمها محركات استدلال إنتاجية أخرى لرفع استغلال المعالج الرسومي تحت وطأة طلبات متزامنة
- التكميم — تكميم AWQ بـ4 بت للأوزان فقط، إضافة إلى تكميم ذاكرة KV المؤقتة بـint8/int4 القابل للجمع مع AWQ في آن واحد، و(منذ 2026/02) تكميم متماثل/غير متماثل بـ4 بت عبر تكامل مع llm-compressor
- دعم واسع للنماذج — عشرات عائلات نماذج اللغة الكبيرة، بما فيها Llama وLlama2/3/3.1/3.2 وInternLM2/3 وQwen1.5/2/2.5/3 وQwen3-MoE وQwen3-Next وDeepSeek-MoE/V2/V3/R1 وMistral وMixtral وChatGLM2 وGLM-4 وYi وBaichuan2 وCode Llama، حسب توثيق النماذج المدعومة الخاص بـLMDeploy
- دعم نماذج الرؤية واللغة (VLM) — خطوط أنابيب استدلال دون اتصال وخدمة API لنماذج متعددة الوسائط مثل InternVL وLLaVA وMiniGemini وCogVLM2
- خادم API متوافق مع OpenAI — يشغّل
lmdeploy serve api_serverخادمًا يحاكي صيغة طلب/استجابة إكمال المحادثات الخاصة بـOpenAI، موثّق بشكل منفصل لنماذج اللغة الكبيرة ونماذج الرؤية واللغة - خط أنابيب استدلال دفعي دون اتصال — واجهة برمجية بلغة Python باسم
lmdeploy.pipeline()لتشغيل الاستدلال مباشرة داخل نص برمجي، دون الحاجة لإنشاء خادم - خادم وكيل متعدد النماذج ومتعدد الأجهزة — خدمة توزيع طلبات لتشغيل عدة نماذج عبر عدة أجهزة ومعالجات رسومية خلف نقطة دخول واحدة
- دعم أجهزة يتجاوز معالجات NVIDIA CUDA الرسومية — دعم لوحدات Huawei Ascend NPU عبر محرك PyTorch، ودعم لنظام Windows (بدرجة توازي موتّرات 1) عبر TurboMind
أمثلة على الاستخدام: ثلاث طرق لاستخدام LMDeploy
هذه سير عمل ملموسة مبنية على أوامر LMDeploy الموثقة أعلاه — وليست حالات استخدام افتراضية.
تثبيت LMDeploy
تُثبَّت LMDeploy مجانًا عبر pip داخل بيئة Python 3.10–3.13، وشيفرتها المصدرية موجودة على GitHub. تتطلب معالج NVIDIA CUDA رسوميًا لمحرك TurboMind؛ ويوسّع محرك PyTorch ودعم Huawei Ascend خيارات المعدات لحالات استخدام محددة.
المصدر | Link |
|---|---|
| مستودع GitHub (الشيفرة المصدرية، رخصة Apache 2.0) | github.com/InternLM/lmdeploy |
| حزمة PyPI | pypi.org/project/lmdeploy |
| التوثيق | lmdeploy.readthedocs.io |
| أمر التثبيت | conda create -n lmdeploy python=3.12 -y && conda activate lmdeploy && pip install lmdeploy |
منذ الإصدار v0.13.0، تُبنى حزم PyPI الافتراضية استنادًا إلى CUDA 12.8، لذا يكفي تنفيذ pip install lmdeploy البسيط في إعدادات معالجات NVIDIA الرسومية النمطية، بما فيها سلسلة GeForce RTX 50، حسب ملف README الخاص بالمشروع. لا يوجد مثبِّت رسومي — تحقق من طريقة التثبيت الموصى بها حاليًا على GitHub قبل تنفيذ أي أمر، لأن التعليمات قد تتغير بين الإصدارات.
التسعير والترخيص
LMDeploy مجانية ومفتوحة المصدر، دون أي خطة مدفوعة. يطبّق ملف LICENSE في مستودع GitHub رخصة Apache، الإصدار 2.0، دون تعديل، ولا توجد صفحة تسعير على الإطلاق في توثيق المشروع.
- لا اشتراك، لا خطة مدفوعة، ولا حدود استخدام تفرضها LMDeploy نفسها
- لا حاجة لحساب أو تسجيل لتثبيت مجموعة الأدوات أو استخدامها
- تكلفتك الفعلية هي تكلفة معدات GPU أو نسخة GPU السحابية التي تشغّل عليها LMDeploy — ولا تضيف LMDeploy نفسها أي رسوم إضافية
- رخصة Apache 2.0 رخصة متساهلة: لا التزام copyleft بإصدار شيفرتك الخاصة، والاستخدام التجاري/الإنتاجي مسموح صراحة
LMDeploy مقابل vLLM
تُعد LMDeploy وvLLM من أكثر محركات استدلال نماذج اللغة الكبيرة مفتوحة المصدر استخدامًا، ويقارن تسويق LMDeploy نفسها نفسها صراحة بـvLLM. كلاهما مجاني، وقريب من رخصة Apache 2.0 (vLLM مرخّصة أيضًا بـApache 2.0)، وقابل للتثبيت عبر Python، ويدعم خادم API متوافقًا مع OpenAI — وتكمن الاختلافات أساسًا في معمارية المحرك وحجم المنظومة والتركيز على عائلات نماذج معينة.
المحركات الأساسية
- LMDeploy:
- TurboMind (C++/CUDA) إضافة إلى محرك PyTorch
- vLLM:
- محرك واحد قائم على PagedAttention
ادعاء الإنتاجية
- LMDeploy:
- حتى 1.8 ضعف vLLM (تصريح ذاتي)
- vLLM:
- يُستشهد به على نطاق واسع كخط أساس معياري في الصناعة
التكميم
- LMDeploy:
- AWQ، وذاكرة KV مؤقتة بـint8/int4، وMXFP4
- vLLM:
- AWQ وGPTQ وFP8 وصيغ أخرى
حجم المنظومة
- LMDeploy:
- نحو 8,000 نجمة على GitHub
- vLLM:
- مجتمع أكبر ونطاق تكامل أوسع مع أطراف ثالثة
قوة عائلة النماذج
- LMDeploy:
- دعم قوي من الدرجة الأولى لـInternLM وQwen
- vLLM:
- واسع جدًا، وغالبًا أول من يدعم إصدارات جديدة من مختبرات عديدة
المطوِّر
- LMDeploy:
- فريقا MMRazor/MMDeploy (مختبر شنغهاي للذكاء الاصطناعي)
- vLLM:
- نشأت في جامعة كاليفورنيا بيركلي، وهي الآن مشروع مفتوح المصدر واسع يضم عدة شركات
ادعاءات الإنتاجية لدى LMDeploy هي أرقام نشرتها بنفسها، وليست معيار أداء مستقلًا أجرته PromptQuorum — أجرِ مقارنتك الخاصة على نموذجك المستهدف ومعالجك الرسومي ونمط حركة مرورك قبل اختيار أحدهما للإنتاج. راجع شرح vLLM لمزيد من التفاصيل عن vLLM تحديدًا.
لمن تناسب LMDeploy؟
تناسب LMDeploy الفرق التي تنشر نماذج اللغة الكبيرة على بنيتها التحتية الخاصة من معالجات NVIDIA الرسومية، وتريد مكدّس خدمة مراعيًا للتكميم وعالي الإنتاجية بدلًا من تطبيق محادثة لسطح المكتب.
المنافسون والبدائل
تقع LMDeploy ضمن قطاع محركات خدمة نماذج اللغة الكبيرة الإنتاجية إلى جانب vLLM وTensorRT-LLM وSGLang وExLlamaV2 — وهي أدوات صُممت لتشغيل النماذج على نطاق واسع على معدات GPU مخصصة، وتختلف عن تطبيقات سطح المكتب الموجهة للمستهلكين.
vLLM
- تشتهر بـ:
- محرك الاستدلال مفتوح المصدر الأكثر اعتمادًا، PagedAttention، ودعم واسع منذ اليوم الأول للنماذج الجديدة
- Link:
- شرح vLLM
مقالات حول vLLM (10)
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)محدَّث ٦ سبتمبر ٢٠٢٦
- llama.cpp Explained: The Engine Powering Ollama (2026)محدَّث ٢٠ سبتمبر ٢٠٢٦
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026محدَّث ٢٠ سبتمبر ٢٠٢٦
- candle-vllm Review: Rust-Native LLM Serving on CUDA and Metalمحدَّث ١٩ سبتمبر ٢٠٢٦
- NVIDIA Dynamo Review: Datacenter-Scale Inference Servingمحدَّث ١٩ سبتمبر ٢٠٢٦
- KServe Review: Kubernetes-Native Model Serving at Scaleمحدَّث ١٩ سبتمبر ٢٠٢٦
- LMDeploy Review: High-Throughput LLM Serving and Quantizationمحدَّث ١٩ سبتمبر ٢٠٢٦
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API Serverمحدَّث ١٩ سبتمبر ٢٠٢٦
- TranslateBooksWithLLMs Review: Translate Full Books With a Local or Cloud LLMمحدَّث ١٩ سبتمبر ٢٠٢٦
- vllm-mlx Review: vLLM-Style Serving for Apple Siliconمحدَّث ١٩ سبتمبر ٢٠٢٦
+81 أخرى غير معروضة
TensorRT-LLM
- تشتهر بـ:
- مكتبة الاستدلال الخاصة بـNVIDIA القائمة على مترجم برمجي، مُحسَّنة بعمق لمعداتها
- Link:
- شرح TensorRT-LLM
مقالات حول TensorRT-LLM (7)
- TensorRT-LLM Explained: NVIDIA's GPU-Optimized Inference Engine (2026)محدَّث ٦ سبتمبر ٢٠٢٦
- NVIDIA Dynamo Review: Datacenter-Scale Inference Servingمحدَّث ١٩ سبتمبر ٢٠٢٦
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIمحدَّث ١٢ سبتمبر ٢٠٢٦
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)محدَّث ٦ سبتمبر ٢٠٢٦
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)محدَّث ٦ سبتمبر ٢٠٢٦
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"محدَّث ٥ سبتمبر ٢٠٢٦
- Enterprise LLM Inference Servers 2026: vLLM vs TGI vs NVIDIA NIM vs Ollamaمحدَّث ٢ سبتمبر ٢٠٢٦
مذكور أيضًا في:
- LMDeploy Review: High-Throughput LLM Serving and Quantizationمحدَّث ١٩ سبتمبر ٢٠٢٦
- Running LLMs and VLA Models On-Robot 2026: What Fits, What Doesn'tمحدَّث ٢ سبتمبر ٢٠٢٦
- Apple MLX vs NVIDIA CUDA for Local LLMs: Which System Should You Choose in 2026?محدَّث ٢٩ أغسطس ٢٠٢٦
SGLang
- تشتهر بـ:
- محرك استدلال ولغة توليد منظّم مبنيان حول تخزين RadixAttention المؤقت
- Link:
- شرح SGLang
مقالات حول SGLang (5)
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)محدَّث ٦ سبتمبر ٢٠٢٦
- NVIDIA Dynamo Review: Datacenter-Scale Inference Servingمحدَّث ١٩ سبتمبر ٢٠٢٦
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIمحدَّث ١٢ سبتمبر ٢٠٢٦
- Kilo Code Review: The Open-Source Coding Agent Now Owned by Anacondaمحدَّث ١٢ سبتمبر ٢٠٢٦
- Text-Generation-WebUI vs vLLM vs llama.cpp in 2026: Inference Engine Comparisonمحدَّث ٢٩ أغسطس ٢٠٢٦
مذكور أيضًا في:
- AIClient2API Review: One Local Proxy for Every AI Protocolمحدَّث ١٩ سبتمبر ٢٠٢٦
- LMDeploy Review: High-Throughput LLM Serving and Quantizationمحدَّث ١٩ سبتمبر ٢٠٢٦
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API Serverمحدَّث ١٩ سبتمبر ٢٠٢٦
- Locally Uncensored Review 2026: Local Chat, Image, and Video in One Appمحدَّث ١٢ سبتمبر ٢٠٢٦
ExLlamaV2
- تشتهر بـ:
- محرك يركّز على التكميم، ويحظى بشعبية لتشغيل نماذج GPTQ/EXL2 على معالجات رسومية استهلاكية
- Link:
- شرح ExLlamaV2
مقالات حول ExLlamaV2 (2)
- ExLlamaV2 Explained 2026: Archived, Succeeded by ExLlamaV3محدَّث ٦ سبتمبر ٢٠٢٦
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"محدَّث ٥ سبتمبر ٢٠٢٦
مذكور أيضًا في:
- LMDeploy Review: High-Throughput LLM Serving and Quantizationمحدَّث ١٩ سبتمبر ٢٠٢٦
- How to Double Local LLM Speed: Optimization Techniquesمحدَّث ٢٨ أغسطس ٢٠٢٦
تعكس هذه القائمة أدوات تُقارَن عادة بـLMDeploy في قطاع الخدمة الإنتاجية، وليست تصنيفًا مستقلًا من PromptQuorum — تحقق من مجموعة الميزات الحالية ومتطلبات المعدات لكل أداة قبل الاختيار.
أخطاء شائعة عند تقييم LMDeploy
ينشأ معظم اللبس حول LMDeploy من التعامل معها كتطبيق محادثة لسطح المكتب، أو من الاستشهاد بأرقام معايير الأداء التي أعلنها المشروع نفسه على أنها موثّقة بشكل مستقل.
الأسئلة الشائعة
ما هي LMDeploy؟
LMDeploy (github.com/InternLM/lmdeploy) هي مجموعة أدوات مجانية ومفتوحة المصدر (رخصة Apache 2.0) لضغط وتكميم وخدمة نماذج اللغة الكبيرة على معالجات NVIDIA الرسومية، طوّرها فريقا MMRazor وMMDeploy ضمن منظومة InternLM/OpenMMLab.
هل LMDeploy مجانية؟
نعم. LMDeploy مرخّصة بموجب Apache 2.0، دون صفحة تسعير أو خطة مدفوعة. تكلفتك الفعلية هي تكلفة معدات GPU أو النسخة السحابية التي تشغّلها عليها.
كيف أثبّت LMDeploy؟
نفّذ pip install lmdeploy داخل بيئة Python 3.10–3.13 (يُنصح ببيئة conda). منذ الإصدار v0.13.0، تستهدف حزم PyPI الافتراضية CUDA 12.8، لذا يكفي ذلك عادة دون تثبيت CUDA منفصل في إعدادات معالجات NVIDIA الرسومية النمطية.
هل لدى LMDeploy واجهة رسومية؟
لا. LMDeploy مجموعة أدوات سطر أوامر ومكتبة Python. لا تملك نافذة محادثة — تتفاعل معها عبر الطرفية أو نص برمجي بلغة Python أو خادم API المتوافق مع OpenAI.
هل LMDeploy أسرع من vLLM؟
يذكر ملف README الخاص بـLMDeploy إنتاجية طلبات أعلى بما يصل إلى 1.8 ضعف من vLLM، استنادًا إلى معايير أداء نشرتها بنفسها. هذا ليس رقمًا موثّقًا بشكل مستقل — أجرِ معيار أداء خاصًا بك على نموذجك ومعداتك المستهدفة قبل الاعتماد عليه.
ما نوع التكميم الذي تدعمه LMDeploy؟
تكميم AWQ بـ4 بت للأوزان فقط، وتكميم ذاكرة KV المؤقتة بـint8/int4 (قابل للجمع مع AWQ)، وMXFP4 على معالجات NVIDIA الرسومية المدعومة، ومنذ 2026/02، تكميم متماثل/غير متماثل بـ4 بت عبر تكامل مع vllm-project/llm-compressor.
ما النماذج التي تدعمها LMDeploy؟
عشرات عائلات نماذج اللغة الكبيرة — بما فيها Llama وInternLM2/3 وQwen1.5 حتى Qwen3 وDeepSeek-MoE/V2/V3/R1 وMistral وChatGLM2 وGLM-4 وCode Llama — إضافة إلى نماذج الرؤية واللغة مثل InternVL وLLaVA وCogVLM2. راجع توثيق النماذج المدعومة الخاص بـLMDeploy نفسه للقائمة الكاملة والمحدّثة.
هل تدعم LMDeploy معالجات رسومية غير NVIDIA؟
يستهدف محركها الأساسي TurboMind معالجات NVIDIA CUDA الرسومية. يضيف محرك PyTorch دعمًا لوحدات Huawei Ascend NPU. لم تجد هذه المراجعة مسار دعم للمعالج المركزي فقط أو لشرائح Apple Silicon.
من يطوّر LMDeploy؟
فريقا MMRazor وMMDeploy، وهما جزء من منظومة InternLM/OpenMMLab مفتوحة المصدر التي يديرها مختبر شنغهاي للذكاء الاصطناعي.
هل تملك LMDeploy خادم API متوافقًا مع OpenAI؟
نعم. يشغّل تنفيذ lmdeploy serve api_server خادمًا محليًا يحاكي صيغة طلب/استجابة إكمال المحادثات الخاصة بـOpenAI، ما يتيح لكود عميل OpenAI الموجود مسبقًا التوجه إليه بدلًا من نقطة نهاية سحابية.