Skip to main content
PromptQuorum
الرئيسية/LLM المحلية المتقدمة/مراجعة vllm-mlx: serving على طراز vLLM لمعالجات Apple Silicon
Overview & Reference

مراجعة vllm-mlx: serving على طراز vLLM لمعالجات Apple Silicon

·11 دقائق للقراءة·بقلم Hans Kuepper · مؤسس PromptQuorum، أداة إرسال الذكاء الاصطناعي متعددة النماذج · PromptQuorum

**vllm-mlx هو خادم استدلال مجاني ومفتوح المصدر (ترخيص Apache 2.0) يشغّل نماذج اللغة الكبيرة محليًا على أجهزة Mac المزوّدة بمعالج Apple Silicon، ويعرض نقاط وصول متوافقة مع OpenAI (/v1/*) ومع Anthropic (/v1/messages) من عملية واحدة فقط.** طوّره المطور المستقل Way Barrios، ونُشر على PyPI باسم vllm-mlx، وهو ليس مشروع vLLM الرسمي — بل نسخة غير رسمية أصلية لـMLX تُكيّف تقنيات serving الخاصة بـvLLM (continuous batching، وpaged KV cache، وprefix caching) مع بنية الذاكرة الموحدة القائمة على Metal من Apple، وتعمل على شرائح Apple Silicon من M1 حتى M5.

vllm-mlx (github.com/waybarrios/vllm-mlx) هو خادم استدلال مجاني ومفتوح المصدر مبني على Python، يجلب تقنيات continuous batching وpaged KV caching وprefix caching على طراز vLLM إلى أجهزة Mac المزوّدة بمعالج Apple Silicon، عبر إطار عمل MLX الأصلي من Apple. وهو مشروع مستقل بُني بجهود المجتمع من قِبل المطور Way Barrios — وليس مشروع vLLM الرسمي، وليس تابعًا لفريق vLLM، رغم أن تصميم واجهته البرمجية وبعض تقنيات serving مستوحاة صراحةً من vLLM. تستعرض هذه المراجعة ما يقدمه هذا المشروع فعليًا، وكيفية تثبيته، ولمن هو مناسب.

النقاط الرئيسية

  • vllm-mlx (github.com/waybarrios/vllm-mlx) خادم استدلال مجاني ومفتوح المصدر، يُثبَّت عبر pip install vllm-mlx
  • طوّره المطور المستقل Way Barrios؛ وليس مشروع vLLM الرسمي (github.com/vllm-project/vllm)، وغير تابع لفريق vLLM
  • مرخّص بموجب Apache 2.0، وتم التأكد من ذلك عبر ملف LICENSE في مستودع GitHub
  • يعرض نقاط وصول متوافقة مع OpenAI (/v1/chat/completions، /v1/embeddings، /v1/rerank، /v1/responses) ومع Anthropic (/v1/messages) من عملية خادم واحدة
  • ميزات serving مُكيَّفة من vLLM: continuous batching، وpaged KV cache، وprefix caching، وذاكرة تخزين مؤقت اختيارية مُدرَّجة على SSD لأحمال العمل ذات السياق الطويل
  • يتعامل مع نماذج النصوص، والرؤية (صور/فيديو)، والصوت (TTS/STT)، والتضمين/إعادة الترتيب، وكل ذلك عبر MLX الأصلي على Apple Silicon
  • يتطلب جهاز Mac مزوّدًا بمعالج Apple Silicon (من M1 إلى M5) — لا يوجد دعم لـWindows أو Linux أو أجهزة Mac القائمة على معالجات Intel
  • أكثر من 1,580 نجمة على GitHub حتى وقت كتابة هذه المراجعة

📍 في جملة واحدة

vllm-mlx هو خادم استدلال Python مجاني ومفتوح المصدر (ترخيص Apache 2.0) يجلب تقنيتَي continuous batching وpaged KV caching على طراز vLLM إلى أجهزة Mac المزوّدة بمعالج Apple Silicon عبر MLX الأصلي، ويعرض نقاط وصول برمجية متوافقة مع OpenAI وAnthropic.

💬 بعبارات بسيطة

يتيح لك vllm-mlx تشغيل نماذج الذكاء الاصطناعي على جهاز Mac الخاص بك والتواصل معها بنفس الطريقة التي تتواصل بها مع واجهة OpenAI أو Anthropic السحابية — فقط وجّه الكود الحالي لديك إلى localhost بدلًا من السحابة. صُمم للتعامل بكفاءة مع عدة طلبات في وقت واحد، وهذا هو الجزء "على طراز vLLM" من اسمه، لكنه مشروع منفصل وغير رسمي، وليس vLLM نفسه يعمل على جهاز Mac.

📌ملاحظة: تستند هذه المراجعة إلى مستودع vllm-mlx على GitHub وملف README الخاص به وموقعه التوثيقي وصفحته على PyPI. ولا تُقدَّم فيها معايير الأداء المنشورة من قِبل vllm-mlx نفسه على أنها حقائق تم التحقق منها بشكل مستقل — فهذه الأرقام مأخوذة من ملف README الخاص بالمشروع، ويجب التعامل معها كأرقام أبلغ عنها المطور، وليست نتائج اختبرتها PromptQuorum. تُعد هذه المراجعة المكمّل المعمّق لإدخال vllm-mlx في دليل برمجيات LLM المحلية.

ما هو vllm-mlx؟

vllm-mlx هو خادم استدلال يعمل عبر سطر الأوامر لأجهزة Mac المزوّدة بمعالج Apple Silicon، يعرض نماذج ذكاء اصطناعي تعمل محليًا عبر نفس صيغ واجهة API التي تستخدمها خدمات OpenAI وAnthropic السحابية. يصف ملف README الخاص به على GitHub المشروع بأنه يجمع بين "continuous batching + واجهتي OpenAI وAnthropic في خادم واحد" مع "استدلال أصلي على Apple Silicon". وهو ليس تطبيق سطح مكتب رسوميًا — بل حزمة Python تُشغَّل من الطرفية، ثم تستمع بعد ذلك على منفذ محلي لطلبات API.

  • نوع المنتج: خادم استدلال عبر سطر الأوامر (CLI) مبني على Python، يُثبَّت كحزمة pip/uv، وليس تطبيق واجهة رسومية قابلًا للتنزيل
  • المنشئ: المطور المستقل Way Barrios (اسم المستخدم على GitHub هو waybarrios)؛ لم تجد هذه المراجعة أي دليل على وجود شركة أو جولة تمويل أو كيان تجاري خلف المشروع
  • المستودع: github.com/waybarrios/vllm-mlx، وهو الأقدم والأكثر حصولًا على النجوم من بين عدة مستودعات تحمل الاسم نفسه على GitHub — إذ تصف المستودعات الأخرى التي تحمل الاسم نفسه (مثلاً تحت أسماء مستخدمين مختلفة) هذا المستودع بأنه المشروع الذي تعكسه
  • الترخيص: Apache 2.0، وتم التأكد منه عبر ملف LICENSE في المستودع
  • التسمية: يشير اسم "vllm-mlx" إلى أن المشروع يتبع تصميم واجهة serving الخاصة بـvLLM ومصطلحاته (continuous batching، وpaged KV cache)، بينما يعمل على MLX بدلاً من محرك vLLM القائم على CUDA/ROCm — وهو لا يحتوي على الكود المصدري الأصلي لـvLLM

تاريخ المشروع

vllm-mlx مشروع حديث نسبيًا. تُظهر صفحة الحزمة على PyPI ومستودع GitHub تطويرًا نشطًا ومستمرًا بدلًا من تاريخ إصدارات طويل يمتد لسنوات، وقد وثّق ملف README الخاص به مجموعة واسعة من الميزات بالفعل — التوافق مع واجهتي OpenAI وAnthropic، وcontinuous batching، ودعم الوسائط المتعددة، واستدعاء أدوات MCP — كحالة راهنة وليس كطرح تدريجي.

  • يُوزَّع على PyPI كحزمة باسم vllm-mlx، مع علامات إصدار منشورة يمكن الاطلاع عليها عبر pip index versions vllm-mlx أو صفحة المشروع على PyPI
  • يُصان بنشاط: يُظهر مستودع GitHub التزامات (commits) مستمرة، وموقعًا توثيقيًا على vllm-mlx.is-a.dev
  • تُرجم ملف README إلى عدة لغات (الإنجليزية والإسبانية والفرنسية والصينية) من قِبل المشروع نفسه، وهو أمر غير معتاد لمشروع بهذا الحجم، ويُعد مؤشرًا على قاعدة مستخدمين موزعة دوليًا
  • تشمل مجموعة الميزات بالفعل، حتى وقت كتابة هذه المراجعة، دعم نماذج الاستدلال (استخراج الاستدلال على طراز Qwen3 وDeepSeek-R1)، وفك التشفير التخميني (speculative decoding)، وتحسينات Mixture-of-Experts

ماذا يمكنك فعله باستخدام vllm-mlx؟

تتمحور مجموعة ميزات vllm-mlx حول خدمة عدة طلبات متزامنة بكفاءة على جهاز Mac واحد، مع تغطية ما هو أبعد من توليد النصوص البسيط. وفيما يلي ما تفعله كل ميزة فعليًا، وفقًا لملف README الخاص بالمشروع وموقعه التوثيقي.

  • توافق مزدوج مع واجهتي API — يقدّم نقاط وصول على طراز OpenAI (/v1/chat/completions، /v1/completions، /v1/embeddings، /v1/rerank، /v1/responses) وعلى طراز Anthropic (/v1/messages، مع البث المباشر واستخدام الأدوات وتعليمات النظام) من خادم واحد قيد التشغيل
  • Continuous batching — يعالج عدة طلبات متزامنة معًا بدلاً من طلب تلو الآخر، وهي نفس التقنية التي روّج لها vLLM في خدمة معالجات GPU، مُكيَّفة هنا لـMLX/Metal
  • ذاكرة تخزين مؤقت KV مُقسّمة إلى صفحات وحسب البادئة — ذاكرة تخزين مؤقت موفّرة للذاكرة قائمة على بنية trie، تشارك بادئات المطالبات المتكررة بين الطلبات، مع علامة اختيارية --ssd-cache-dir لنقل ذاكرة التخزين المؤقت إلى القرص لأحمال عمل الوكلاء ذات السياق الطويل
  • دعم الوسائط المتعددة — إدخال نصوص وصور وفيديو وصوت من خادم واحد؛ وتشمل عائلات نماذج الرؤية المتوافقة الموثّقة Gemma وQwen3-VL وPixtral ونماذج Llama الخاصة بالرؤية
  • دعم صوتي مدمج — تحويل النص إلى كلام (عدة أصوات ولغات وفقًا لملف README) وتحويل الكلام إلى نص عبر نماذج عائلة Whisper، ويعمل كلاهما ضمن نفس عملية الخادم
  • استدعاء أدوات MCP — دعم لبروتوكول Model Context Protocol مع محللات لعدة عائلات نماذج (يذكر ملف README من بينها صيغ استدعاء الأدوات على طراز OpenAI وAnthropic وGemini وQwen وDeepSeek وGemma)، إضافة إلى توافق صريح مع Claude Code عبر نقطة الوصول المتوافقة مع Anthropic
  • ميزات الاستدلال وMoE — استخراج رموز الاستدلال لنماذج مثل Qwen3 وDeepSeek-R1، إضافة إلى خيارات توجيه Mixture-of-Experts وفك التشفير التخميني للعائلات المدعومة من النماذج
  • المراقبة والقياس المرجعي — نقطة وصول Prometheus اختيارية /metrics، وأمر مدمج هو vllm-mlx bench-serve لتشغيل وتسجيل قياسات الإنتاجية

أمثلة على الاستخدام: ثلاث طرق لاستخدام vllm-mlx

هذه سير عمل واقعية مبنية على ميزات vllm-mlx الموثّقة أعلاه، باستخدام أوامر من ملف README الخاص بالمشروع نفسه.

أسعار vllm-mlx: هل vllm-mlx مجاني فعلًا؟

نعم — لا توجد أي خطة مدفوعة في vllm-mlx. يُوزَّع كحزمة PyPI مجانية مرخّصة بموجب Apache 2.0، دون حساب أو مفتاح ترخيص أو حد أقصى للاستخدام. لا تحتوي صفحة مستودع GitHub على صفحة أسعار، ولا يصف أي جزء من README أو التوثيق نسخة تجارية أو نسخة مؤسسات.

  • لا توجد أي تكلفة لتثبيت أو تشغيل vllm-mlx نفسه — يُختصر الأمر بأكمله في pip install vllm-mlx
  • يسمح ترخيص Apache 2.0 بالاستخدام التجاري والتعديل وإعادة التوزيع، وفقًا للشروط القياسية للترخيص (نسب العمل والحفاظ على إشعار الترخيص)
  • التكلفة الحقيقية الوحيدة هي عتاد جهاز Mac المزوّد بمعالج Apple Silicon اللازم لتشغيله، ومساحة القرص لأي نماذج تُنزَّل بشكل منفصل من Hugging Face أو من منظمة mlx-community
  • لم تجد هذه المراجعة أي نسخة سحابية مستضافة من قِبل المطور، أو واجهة API مستضافة، أو عرضًا مُدارًا — فـvllm-mlx يعمل فقط على عتاد تتحكم فيه بنفسك

vllm-mlx مقابل mlx-lm

يشغّل كل من vllm-mlx وmlx-lm النماذج عبر إطار عمل MLX من Apple، لكنهما يحلّان مشكلتين مختلفتين. mlx-lm هي مكتبة وواجهة سطر أوامر (CLI) من Apple نفسها أكثر انخفاضًا في المستوى، لتشغيل وضبط نماذج MLX دقيقًا طلبًا واحدًا في كل مرة؛ أما vllm-mlx فهو خادم أعلى مستوى، مبني فوق مكتبات مثل mlx-lm وmlx-vlm وmlx-audio (وفقًا لمخطط بنيته الخاص)، ويضيف ميزات serving الطلبات المتزامنة التي اشتهر بها vLLM.

الجهة المسؤولة عن الصيانة

vllm-mlx:
مطور مستقل (Way Barrios)
mlx-lm:
فريق MLX من Apple

حالة الاستخدام الأساسية

vllm-mlx:
خادم API للطلبات المتزامنة
mlx-lm:
مكتبة توليد وضبط دقيق لطلب واحد

المعالجة الدفعية المتزامنة

vllm-mlx:
Continuous batching، وpaged KV cache
mlx-lm:
ليست محور تركيز أساسي؛ عادةً طلب واحد في كل مرة

نطاق واجهة API

vllm-mlx:
نقاط وصول متوافقة مع OpenAI + Anthropic
mlx-lm:
واجهة API وCLI بلغة Python، دون خادم مدمج بصيغة Anthropic

العلاقة

vllm-mlx:
يُبنى داخليًا فوق mlx-lm وmlx-vlm وmlx-audio
mlx-lm:
اعتمادية أساسية تُبنى عليها أدوات MLX أخرى

هذه مقارنة واقعية للميزات مبنية على توثيق كل مشروع الخاص به، وليست معيارًا مرجعيًا أجرته PromptQuorum. الأداتان ليستا منافستين بالمعنى الدقيق — إذ يعتمد vllm-mlx على mlx-lm بدلاً من أن يحل محله.

لمن يناسب vllm-mlx؟

يناسب vllm-mlx المطورين على Apple Silicon الذين يريدون serving متزامنًا على طراز الإنتاج بدلًا من تطبيق دردشة لمستخدم واحد.

أخطاء شائعة عند تقييم vllm-mlx

يأتي معظم اللبس حول vllm-mlx من اسمه، الذي يدفع إلى افتراضات لا يتبناها المشروع نفسه.

المنافسون والبدائل

يقع vllm-mlx ضمن نفس قطاع خوادم الاستدلال على Apple Silicon الذي تنتمي إليه oMLX وRapid-MLX وmlxcel — وكلها مشاريع مستقلة تشغّل نماذج محلية عبر MLX بواجهة API متوافقة مع OpenAI أو مشابهة، وتختلف بشكل رئيسي في اللغة البرمجية (Python مقابل Rust)، والتركيز على ميزات معينة، واستراتيجية التخزين المؤقت.

الأداة
أشهر ما يميزها
الرابط
oMLXخادم استدلال على Apple Silicon مع تخزين مؤقت للمطالبات مدعوم بـSSDمراجعة oMLX
Rapid-MLXخادم استدلال MLX أصلي يركّز على سرعة servingمراجعة Rapid-MLX
mlxcelبيئة تشغيل MLX أصلية بلغة Rust لنماذج LLM وVLM والتضمينات والصوتمراجعة mlxcel
LoRAXخدمة آلاف محوّلات LoRA من نموذج أساسي واحد على معالج رسومي واحدمراجعة LoRAX

تعكس هذه القائمة أدوات تُقارَن عادةً في مجال محركات الاستدلال على Apple Silicon وserving المحوّلات، وليست تصنيفًا مستقلًا من PromptQuorum — تحقق من مجموعة الميزات الحالية لكل أداة قبل الاختيار.

الأسئلة الشائعة

ما هو vllm-mlx؟

vllm-mlx (github.com/waybarrios/vllm-mlx) هو خادم استدلال مجاني ومفتوح المصدر (ترخيص Apache 2.0) يشغّل نماذج الذكاء الاصطناعي على أجهزة Mac المزوّدة بمعالج Apple Silicon عبر MLX الأصلي، ويعرض نقاط وصول برمجية متوافقة مع OpenAI وAnthropic.

هل vllm-mlx هو نفسه vLLM؟

لا. vllm-mlx مشروع مستقل وغير رسمي يكيّف مفاهيم serving الخاصة بـvLLM (continuous batching، وpaged KV cache) لتعمل مع إطار عمل MLX من Apple. وهو غير تابع لمشروع أو فريق vLLM الرسمي، ولا يحتوي على الكود المصدري الأصلي لـvLLM.

هل vllm-mlx مجاني؟

نعم. يُثبَّت مجانًا عبر pip install vllm-mlx، وهو مرخّص بموجب Apache 2.0، ولا توجد فيه خطة مدفوعة، أو حساب، أو حد أقصى للاستخدام.

كيف أثبّت vllm-mlx؟

شغّل الأمر pip install vllm-mlx أو uv tool install vllm-mlx، وفقًا لملف README الخاص بالمشروع نفسه. يتطلب جهاز Mac مزوّدًا بمعالج Apple Silicon؛ ولا يوجد دعم لـWindows أو Linux أو أجهزة Mac القائمة على معالجات Intel.

هل يعمل vllm-mlx مع Claude Code؟

نعم. يوثّق المشروع دعمًا صريحًا لـClaude Code من خلال ضبط ANTHROPIC_BASE_URL للإشارة إلى نقطة وصول vllm-mlx المُقدَّمة محليًا، بما أنه يعرض نقطة وصول متوافقة مع Anthropic هي /v1/messages.

ما العتاد الذي يتطلبه vllm-mlx؟

جهاز Mac مزوّد بمعالج Apple Silicon (M1 أو M2 أو M3 أو M4 أو M5). يستخدم نوى Metal عبر MLX، ولا يملك مسارًا احتياطيًا يعتمد على المعالج المركزي فقط ولا دعمًا لمعالجات رسومية من غير Apple.

من أنشأ vllm-mlx؟

المطور المستقل Way Barrios، واسم المستخدم على GitHub هو waybarrios. لم تجد هذه المراجعة أي دليل على وجود شركة أو جولة تمويل خلف المشروع.

هل يدعم vllm-mlx نماذج الرؤية والصوت، أم النصوص فقط؟

يدعم نماذج النصوص والرؤية (صور/فيديو) والصوت (تحويل النص إلى كلام وتحويل الكلام إلى نص)، إضافة إلى التضمينات وإعادة الترتيب، وكل ذلك يُقدَّم من العملية نفسها، وفقًا لملف README الخاص بالمشروع.

ما هو continuous batching؟

تقنية serving روّج لها vLLM، تعالج عدة طلبات متزامنة معًا بدلاً من طلب تلو الآخر، مما يحسّن الإنتاجية عندما يتعامل الخادم مع عدة طلبات في وقت واحد. يكيّف vllm-mlx هذا المفهوم ليعمل مع MLX على Apple Silicon.

هل اختبرت PromptQuorum بشكل مستقل ادعاءات معايير الأداء الخاصة بـvllm-mlx؟

لا. تستند هذه المراجعة إلى مستودع vllm-mlx على GitHub وملف README وموقعه التوثيقي، وليس إلى اختبار عملي أجرته PromptQuorum. أرقام الإنتاجية في ملف README الخاص بالمشروع مُبلَّغ عنها ذاتيًا.

المصادر

← العودة إلى LLM المحلية المتقدمة