النقاط الرئيسية
- ترخيص MIT، طوّرته Apple Machine Learning Research
- تجاوز MLX (إطار العمل الأساسي) نحو 27300 نجمة على GitHub؛ ويحصل mlx-lm تحديدًا على نحو 6900+
- صدر لأول مرة في 5 ديسمبر 2023؛ وفي يناير 2026 نشرت Apple بحثًا حول Neural Accelerators في كل نواة GPU من شريحة M5، مع قياسات أداء (benchmarks) خاصة باستخدام MLX
- حصري لشرائح Apple Silicon (سلسلة M) — لا يدعم Windows أو Linux أو أجهزة Mac بمعالجات Intel أو وحدات معالجة رسومات غير تابعة لـ Apple
- مبني حول الذاكرة الموحدة: تتشارك الأوزان وذاكرة التخزين المؤقت KV والتنشيطات تجمع ذاكرة واحدًا بين CPU وGPU، دون أي عبء نسخ
- يدعم الوصول إلى نماذج Hugging Face Hub، والتكميم مع الرفع إلى Hub، وكلًا من الضبط الدقيق بطريقة LoRA والضبط الدقيق الكامل، بما في ذلك للنماذج المكممة
📍 في جملة واحدة
MLX-LM هي حزمة Python مجانية ومرخصة بموجب MIT من فريق Apple Machine Learning Research لتشغيل النماذج اللغوية الكبيرة وضبطها الدقيق على شرائح Apple Silicon، وهي مبنية على إطار عمل MLX القائم على الذاكرة الموحدة، لكنها مقتصرة حصريًا على أجهزة Mac المزودة بشريحة من سلسلة M.
💬 بعبارات بسيطة
في جهاز كمبيوتر يعمل بنظام Windows أو Linux، تمتلك كل من CPU وGPU ذاكرتها المنفصلة الخاصة بها، لذا يجب نسخ البيانات بينهما؛ بينما يعتمد MLX على أن CPU وGPU في جهاز Mac بشريحة Apple Silicon يتشاركان بالفعل الذاكرة الفيزيائية نفسها، ما يتيح لـ MLX-LM تخطي خطوة النسخ هذه بالكامل.
📌ملاحظة: MLX-LM هي أداة Apple الخاصة، وهي حصرية لشرائح Apple Silicon بحكم التصميم — إنها ليست بديلًا متعدد المنصات لـ llama.cpp، بل حل خاص بأجهزة Mac.
ما هو MLX-LM؟
MLX-LM هي حزمة Python مجانية ومفتوحة المصدر من فريق Apple Machine Learning Research لتوليد النصوص وضبط النماذج اللغوية الكبيرة دقيقًا تحديدًا على شرائح Apple Silicon، وهي مبنية على MLX، إطار العمل الخاص بشركة Apple نفسها. صدر MLX نفسه لأول مرة في 5 ديسمبر 2023، وجاءت حزمة mlx-lm كحزمة مرافقة تركز تحديدًا على مسارات عمل النماذج اللغوية.
يُستضاف المشروع على github.com/ml-explore/mlx-lm بموجب ترخيص MIT. تجاوز MLX، إطار العمل الأوسع، نحو 27300 نجمة على GitHub، بينما يحصل mlx-lm تحديدًا على نحو 6900+.
- يتكامل مع Hugging Face Hub للوصول إلى النماذج، بما في ذلك دعم تكميم النماذج ورفع النتائج مجددًا إلى Hub
- يدعم كلًا من الضبط الدقيق منخفض الرتبة (LoRA) والضبط الدقيق الكامل، بما في ذلك ضبط النماذج المكممة مسبقًا
- يتضمن تخزينًا مؤقتًا للمطالبات (prompt caching) وذاكرة تخزين مؤقت دوّارة للمفتاح والقيمة لتحسين الكفاءة أثناء التوليد
- يدعم الاستدلال والضبط الدقيق الموزّعين عبر أجهزة متعددة من خلال
mx.distributed - يوفر إخراج توليد بأسلوب البث (streaming) وأمر
mlx_lm.serverلتقديم النماذج
ما هي الذاكرة الموحدة، ولماذا يعتمد عليها MLX؟
تعني الذاكرة الموحدة أن وحدة المعالجة المركزية (CPU) ووحدة معالجة الرسومات (GPU) في شرائح Apple Silicon تتشاركان تجمعًا فيزيائيًا واحدًا من الذاكرة، بدلًا من أن يكون لكل منهما ذاكرة مخصصة منفصلة تتطلب نسخ البيانات بينهما. صُمم MLX تحديدًا حول هذه البنية، التي تختلف جذريًا عن إعداد ذاكرة CPU RAM منفصلة بالإضافة إلى ذاكرة GPU VRAM منفصلة الموجود في أنظمة Windows وLinux المزودة بوحدة معالجة رسومات مخصصة من NVIDIA أو AMD.
- تقيم أوزان النموذج وذاكرة التخزين المؤقت KV والتنشيطات جميعها في تجمع الذاكرة نفسه، ويمكن لكل من CPU وGPU الوصول إليها دون خطوة نسخ
- يمكن توزيع العمليات بين CPU وGPU حسب الحاجة دون عبء نقل البيانات الذي يتطلبه نظام يعتمد على وحدة معالجة رسومات منفصلة
- هذه خاصية على مستوى الأجهزة خاصة بشرائح Apple Silicon (شرائح سلسلة M) صُمم MLX خصيصًا للاستفادة منها، وليست حيلة برمجية يمكن استنساخها بشكل مطابق على أجهزة غير تابعة لـ Apple
- في يناير 2026، نشرت Apple بحثًا يقيس تحديدًا أداء وحدات Neural Accelerators المخصصة المدمجة في كل نواة GPU من شريحة M5 عند تشغيل MLX
كيف تثبت وتستخدم MLX-LM؟
يُثبَّت MLX-LM عبر pip أو conda، ويوفر واجهة سطر أوامر وواجهة برمجة تطبيقات (API) بلغة Python للتوليد والضبط الدقيق والتقديم. يتطلب نظام macOS على شريحة Apple Silicon؛ وتتطلب بعض الميزات نظام macOS 15.0 أو أحدث.
- 1التثبيت عبر pip:
pip install mlx-lm، أو عبر conda:conda install -c conda-forge mlx-lm. - 2توليد نص مباشرة من نموذج على Hugging Face Hub، مثل
mlx_lm.generate --model <hf-model-id> --prompt "..."، وهو ما يقوم بتنزيل النموذج وتشغيله. - 3للضبط الدقيق، استخدم أوامر LoRA أو الضبط الدقيق الكامل الموثقة في ملف README على GitHub الخاص بالمشروع، والتي تدعم النماذج الأساسية كاملة الدقة والمكممة مسبقًا على حد سواء.
- 4لتكميم نموذج ورفعه اختياريًا مجددًا إلى Hugging Face Hub، استخدم أدوات التحويل والتكميم الخاصة بالمشروع.
- 5لتقديم نموذج عبر واجهة برمجة تطبيقات (API)، شغّل
mlx_lm.server، الذي يبدأ تشغيل خادم محلي للوصول البرمجي. - 6للاستدلال أو الضبط الدقيق الموزّعين عبر أجهزة متعددة، اضبط
mx.distributedوفق ما هو موثق في أدلة الاستخدام المتقدم الخاصة بالمشروع.
هل يعمل MLX-LM على أجهزة Mac بمعالجات Intel؟
لا. يتطلب MLX-LM شريحة Apple Silicon (شريحة من سلسلة M) — أجهزة Mac القائمة على معالجات Intel غير مدعومة.
هل يتطلب MLX-LM اتصالًا بالإنترنت؟
فقط لتنزيل النماذج في البداية، غالبًا من Hugging Face Hub. وبمجرد تنزيل النموذج، يعمل التوليد والاستدلال محليًا بالكامل.
ما الأجهزة التي يتطلبها MLX-LM؟
يتطلب MLX-LM جهاز Mac بشريحة Apple Silicon — ولا يوجد دعم لأجهزة Mac بمعالجات Intel أو Windows أو Linux أو أي وحدة معالجة رسومات غير تابعة لـ Apple من أي نوع. هذه هي المفاضلة المحورية مقابل المحركات متعددة المنصات مثل llama.cpp.
- يلزم وجود شريحة Apple Silicon (من سلسلة M) — تُدعم الشرائح من M1 حتى الجيل الحالي، مع استفادة الشرائح الأحدث من تحسينات MLX المستمرة
- لا يوجد دعم لأجهزة Mac بمعالجات Intel، رغم أنها تعمل أيضًا بنظام macOS
- لا يوجد أي دعم لنظامي Windows أو Linux
- لا يوجد دعم لوحدات معالجة الرسومات غير التابعة لـ Apple — لا يعمل MLX على أجهزة NVIDIA أو AMD
- تتطلب بعض الميزات تحديدًا نظام macOS 15.0 أو أحدث، بما في ذلك تحسين موثّق لما يُعرف بـ wired memory
من يجب أن يستخدم MLX-LM؟
استخدم MLX-LM إذا كان الجهاز المستهدف مؤكدًا أنه يعمل بشريحة Apple Silicon وكان استغلال أقصى إمكانات الذاكرة الموحدة في هذا الجهاز تحديدًا أمرًا مهمًا؛ واستخدم محركًا متعدد المنصات إذا احتجت إلى مرونة في الأجهزة أو إلى أجهزة غير تابعة لـ Mac.
كيف يقارن MLX-LM بـ llama.cpp والمحركات الأخرى؟
أقرب مقارنة لـ MLX-LM هي مع الواجهة الخلفية Metal الخاصة بـ llama.cpp نفسه، إذ يعمل كلاهما على شرائح Apple Silicon — والفارق هو أن MLX-LM هو إطار عمل Apple الخاص، حصري لأجهزة Mac، بينما يغطي llama.cpp إضافة إلى ذلك أجهزة NVIDIA وAMD وIntel.
الأخطاء الشائعة عند تقييم MLX-LM
ينشأ معظم الالتباس عن توقع أن يعمل MLX-LM خارج شرائح Apple Silicon، أو عن سوء فهم ما تغيره الذاكرة الموحدة فعليًا.
الأسئلة الشائعة
ما هو MLX-LM؟
MLX-LM هي حزمة Python مجانية ومرخصة بموجب MIT من فريق Apple Machine Learning Research لتوليد النصوص وضبط النماذج اللغوية الكبيرة دقيقًا على شرائح Apple Silicon، وهي مبنية على إطار عمل MLX الخاص بشركة Apple.
هل يعمل MLX-LM على Windows أو Linux؟
لا. يتطلب MLX-LM شريحة Apple Silicon ويعمل فقط على نظام macOS على أجهزة Mac من سلسلة M.
هل MLX-LM مجاني للاستخدام التجاري؟
نعم. MLX-LM مرخص بموجب MIT، ومجاني للاستخدام الشخصي والتجاري.
ما هي الذاكرة الموحدة في MLX؟
تعني الذاكرة الموحدة أن CPU وGPU في شرائح Apple Silicon تتشاركان تجمعًا فيزيائيًا واحدًا من الذاكرة، بحيث يمكن الوصول إلى أوزان النموذج وذاكرة التخزين المؤقت KV والتنشيطات من كليهما دون خطوة نسخ — وهي خاصية أجهزة مختلفة عن إعداد ذاكرة CPU RAM وذاكرة GPU VRAM المنفصلتين في معظم أنظمة Windows/Linux.
هل يمكن لـ MLX-LM ضبط النماذج دقيقًا؟
نعم. فهو يدعم كلًا من الضبط الدقيق بطريقة LoRA (منخفض الرتبة) والضبط الدقيق الكامل، بما في ذلك ضبط النماذج المكممة مسبقًا.
هل يعمل MLX-LM مع نماذج Hugging Face؟
نعم. يتكامل MLX-LM مع Hugging Face Hub لتنزيل النماذج، ويمكنه رفع النماذج المكممة مجددًا إلى Hub.
من يطور MLX-LM؟
يطور فريق Apple Machine Learning Research ويصون MLX-LM، إلى جانب إطار عمل MLX الأوسع الذي بُني عليه. صدر MLX لأول مرة في 5 ديسمبر 2023.
كيف يختلف MLX-LM عن llama.cpp على جهاز Mac؟
يمكن لكليهما تشغيل النماذج على شرائح Apple Silicon، لكن MLX-LM هو إطار عمل Apple الخاص، مبني تحديدًا حول الذاكرة الموحدة وحصري لشرائح Apple Silicon، بينما llama.cpp مشروع منفصل ومتعدد المنصات يدعم أيضًا أجهزة NVIDIA وAMD وIntel عبر واجهته الخلفية Metal على Mac.
هل يمكن لـ MLX-LM تقديم النماذج عبر واجهة برمجة تطبيقات (API)؟
نعم. يبدأ أمر mlx_lm.server تشغيل خادم محلي للوصول البرمجي إلى نموذج محمّل.
هل MLX-LM مناسب للتقديم الإنتاجي عالي الإنتاجية؟
ليس هذا هدف تصميمه الأساسي. بالنسبة للتقديم الإنتاجي عالي الإنتاجية لعدة مستخدمين، يُعد vLLM أو SGLang الأداتين الأكثر تخصصًا؛ إذ يركز MLX-LM على الاستدلال والضبط الدقيق على جهاز واحد بشريحة Apple Silicon.
