Skip to main content
PromptQuorum
الرئيسية/LLM المحلية المتقدمة/شرح llamafile 2026: ملف واحد، ستة أنظمة تشغيل
Overview & Reference

شرح llamafile 2026: ملف واحد، ستة أنظمة تشغيل

·وقت قراءة يقارب 8 دقائق·بقلم Hans Kuepper · مؤسس PromptQuorum، أداة إرسال الذكاء الاصطناعي متعددة النماذج · PromptQuorum

llamafile مشروع مجاني برخصة Apache 2.0، أصدرته في البداية مجموعة الابتكار في Mozilla وأنشأته Justine Tunney، يحزم نموذجاً لغوياً كبيراً ومحرك الاستدلال llama.cpp في ملف تنفيذي واحد قادر على العمل، دون تعديل، على macOS وLinux وWindows وBSD. يتحقق ذلك باستخدام Cosmopolitan Libc، وهي مكتبة قياسية للغة C تُترجم ملفاً ثنائياً واحداً ليعمل بشكل أصلي على عدة أنظمة تشغيل ومعماريات معالج، وتدعم تسريع وحدة معالجة الرسوميات عبر Metal (لأجهزة Apple Silicon) وCUDA (لـ NVIDIA) وROCm (لـ AMD) وVulkan.

يحزم llamafile ملف نموذج ومحرك llama.cpp في ملف تنفيذي واحد يعمل، دون تعديل، على macOS وLinux وWindows وBSD — مبني على Cosmopolitan Libc، التقنية التي تتيح لملف ثنائي واحد العمل بشكل أصلي على عدة أنظمة تشغيل ومعماريات معالج في آن واحد.

شرح llamafile 2026: ملف واحد، ستة أنظمة تشغيل

النقاط الرئيسية

  • رخصة Apache 2.0؛ تبقى تعديلات المشروع نفسه على llama.cpp وwhisper.cpp برخصة MIT لتظل قابلة للدمج مع المشروع الأصلي
  • نحو 25,900+ نجمة على GitHub حتى سبتمبر 2026، والمستودع على github.com/mozilla-ai/llamafile
  • أنشأتها Justine Tunney، مبتكرة Cosmopolitan Libc، وأُصدرت لأول مرة من قِبل مجموعة الابتكار في Mozilla في نوفمبر 2023
  • ملف تنفيذي واحد يعمل على macOS وLinux وBSD وWindows — يحدد Windows تحديداً الملفات التنفيذية بـ 4 جيجابايت
  • تسريع وحدة معالجة الرسوميات متاح عبر Metal (لأجهزة Apple Silicon) وCUDA (لـ NVIDIA) وROCm (لـ AMD) وVulkan
  • مبني مباشرة على llama.cpp لعملية استدلال النموذج نفسها، بينما يحل Cosmopolitan Libc مشكلة التغليف متعدد المنصات

📍 في جملة واحدة

llamafile مشروع مجاني برخصة Apache 2.0، أنشأته Justine Tunney وأصدرته Mozilla في البداية، يحزم نموذجاً ومحرك llama.cpp في ملف تنفيذي واحد يعمل دون تعديل على macOS وLinux وWindows وBSD بفضل Cosmopolitan Libc.

💬 بعبارات بسيطة

حمّل ملفاً واحداً وانقر عليه نقراً مزدوجاً — بلا برنامج تثبيت، وبلا اختيار إصدار بناء خاص بمنصة معينة — لأن الملف نفسه صالح على عدة أنظمة تشغيل في آن واحد، وهي حيلة يتيحها Cosmopolitan Libc وليس تجميع llamafile لعدة إصدارات بناء منفصلة معاً.

📌ملاحظة: قدم الإصدار 0.10.0 نظام بناء مُعاد هيكلته لإبقاء llamafile متوافقاً مع إصدارات llama.cpp الحالية، وأُعيد دعم CUDA لنظام Linux في فبراير 2026 بعد فترة من عدم التزامن — راجع ملاحظات الإصدار لمعرفة مجموعة الميزات الدقيقة للإصدار الذي يتم تحميله.

ما هو llamafile؟

llamafile مشروع مجاني ومفتوح المصدر يحزم نموذجاً لغوياً مع محرك الاستدلال llama.cpp في ملف تنفيذي واحد، قابل للتوزيع والتشغيل دون تثبيت على عدة أنظمة تشغيل. أنشأته Justine Tunney وأصدرته لأول مرة مجموعة الابتكار في Mozilla في نوفمبر 2023.

يُستضاف المشروع على github.com/mozilla-ai/llamafile (سابقاً تحت منظمة Mozilla-Ocho) وقد تجاوز نحو 25,900 نجمة على GitHub. يُصدر برخصة Apache 2.0، بينما تبقى تعديلات المشروع نفسه على llama.cpp وwhisper.cpp برخصة MIT لتظل متوافقة وقابلة للدمج مع تلك المشاريع.

  • يجمع ملف نموذج ومحرك llama.cpp في ملف تنفيذي واحد قابل للتوزيع، بدلاً من الحاجة إلى تثبيت محرك منفصل مع تحميل نموذج منفصل
  • يعتمد على llama.cpp لعمل الاستدلال الفعلي — مساهمة llamafile الخاصة هي طبقة التغليف والتنفيذ متعدد المنصات
  • يشغّل بشكل افتراضي واجهة دردشة عبر الويب عند التشغيل، إلى جانب وضع خادم متوافق مع واجهة برمجة تطبيقات OpenAI
  • ينشر المشروع وأعضاء المجتمع نماذج llamafile جاهزة مسبقة البناء لنماذج مفتوحة الأوزان شائعة على Hugging Face

ما هو Cosmopolitan Libc، وكيف يجعل هذا ممكناً؟

Cosmopolitan Libc مكتبة قياسية للغة C، أنشأتها أيضاً Justine Tunney، صُممت لترجمة ملفات ثنائية "سمينة" تكون في آن واحد ملفات تنفيذية صالحة على عدة أنظمة تشغيل ومعماريات معالج. هذه هي التقنية الأساسية التي تجعل توزيع llamafile بملف واحد متعدد المنصات ممكناً.

  • يمكن لملف ثنائي مبني بـ Cosmopolitan Libc أن يعمل، دون تعديل، على macOS وLinux وBSD وWindows، بدلاً من الحاجة إلى إصدار بناء مُترجم منفصل لكل نظام تشغيل
  • يختلف هذا عن تجميع عدة ملفات ثنائية خاصة بمنصات معينة في أرشيف واحد — إنه فعلياً ملف ثنائي واحد صالح عبر الأنظمة
  • يفرض Windows حداً أقصى لحجم الملف التنفيذي يبلغ 4 جيجابايت، وهو ما يحدد تحديداً على هذه المنصة أقصى حجم يمكن أن يبلغه ملف llamafile واحد
  • Cosmopolitan Libc مشروع منفصل عام الغرض؛ llamafile هو أحد تطبيقاته البارزة، وليس التطبيق الوحيد

كيف تحمّل ملف llamafile وتشغّله؟

حمّل ملف llamafile جاهزاً مسبقاً للنموذج المطلوب، اجعله قابلاً للتنفيذ، وشغّله مباشرة — لا توجد خطوة تثبيت منفصلة. يدعم المشروع أيضاً بناء ملف llamafile مخصص من ملف نموذج GGUF خاص بك.

  1. 1
    حمّل ملف llamafile جاهزاً مسبقاً (نموذج مُجمَّع مع المحرك) من صفحة المشروع على Hugging Face أو صفحة إصدارات GitHub.
  2. 2
    على macOS وLinux، اجعل الملف قابلاً للتنفيذ (chmod +x yourmodel.llamafile) إن لم يكن كذلك بالفعل، ثم شغّله مباشرة (./yourmodel.llamafile).
  3. 3
    على Windows، أعد تسمية الملف بإضافة امتداد .exe إن لم يكن يحمله بالفعل، بسبب طريقة تعرّف Windows على الملفات التنفيذية.
  4. 4
    بشكل افتراضي، يؤدي تشغيل الملف إلى فتح واجهة دردشة محلية عبر الويب في المتصفح، إلى جانب نقطة نهاية خادم متوافقة مع واجهة برمجة تطبيقات OpenAI.
  5. 5
    لتفعيل تسريع وحدة معالجة الرسوميات، مرر -ngl 999 لنقل أكبر عدد ممكن من الطبقات إلى وحدة معالجة الرسوميات المكتشفة (Metal أو CUDA أو ROCm أو Vulkan).
  6. 6
    لبناء ملف llamafile مخصص من نموذج GGUF خاص بك، استخدم أدوات التغليف الخاصة بالمشروع لدمج النموذج مع الملف الثنائي لمحرك llamafile.

هل يتطلب llamafile تثبيتاً؟

لا. حمّل الملف، اجعله قابلاً للتنفيذ إن لزم الأمر، وشغّله مباشرة — لا حاجة إلى برنامج تثبيت منفصل.

هل يمكن تشغيل llamafile دون وحدة معالجة رسوميات؟

نعم. يعمل التشغيل بالمعالج فقط مباشرة؛ تسريع وحدة معالجة الرسوميات (Metal وCUDA وROCm وVulkan) تحسين اختياري للأداء وليس شرطاً.

ما العتاد وتسريع وحدة معالجة الرسوميات الذي يدعمه llamafile؟

يدعم llamafile التشغيل بالمعالج فقط مباشرة، مع تسريع اختياري لوحدة معالجة الرسوميات عبر معظم الشركات المصنعة الكبرى. تطور دعم وحدة معالجة الرسوميات مع الوقت، لذا تعتمد القدرة الدقيقة على الإصدار الذي يتم تحميله.

  • Apple Silicon — تسريع Metal، مفعّل افتراضياً عند اكتشاف وحدة معالجة رسوميات Metal (نُفِّذ في ديسمبر 2025)
  • NVIDIA — تسريع CUDA على Linux، أُعيد تقديمه في فبراير 2026 بعد فترة من عدم التزامن مع llama.cpp الأصلي
  • AMD — تسريع ROCm
  • عبر الشركات المصنعة — دعم واجهة Vulkan الخلفية
  • تُحمَّل مكتبات وحدة معالجة الرسوميات (CUDA وROCm وVulkan) ديناميكياً من ملفات مبنية مسبقاً بجانب الملف التنفيذي بدلاً من ترجمتها بشكل دائم داخله

لمن يناسب llamafile؟

استخدم llamafile إذا كان توزيع أو تشغيل نموذج كملف واحد متعدد المنصات بلا اعتماديات أهم من الحصول فوراً على أحدث ميزات llama.cpp؛ استخدم llama.cpp مباشرة أو تطبيق غلاف إذا لم تكن قابلية النقل بملف واحد هي الأولوية.

كيف يقارن llamafile بـ KoboldCpp وأدوات أخرى لا تتطلب تثبيتاً؟

أقرب مقارنة لـ llamafile هي KoboldCpp — كلاهما يُوزَّع كملف واحد مبني على llama.cpp — لكنهما يحلان مشكلتين مختلفتين: قابلية النقل عبر المنصات مقابل واجهة مدمجة موجهة لتقمص الأدوار.

الأداة
الرخصة
الأفضل لـ
llamafileApache 2.0ملف واحد يعمل دون تعديل على 4 أنظمة تشغيل
KoboldCppAGPL 3.0بلا تثبيت، واجهة تقمص أدوار/سرد قصصي مدمجة
llama.cppMITأوسع دعم للعتاد، تحكم مباشر
OllamaMITواجهة سطر أوامر/API سهلة، إدارة النماذج
LM Studioمملوكة (مجانية)واجهة رسومية مكتبية بلا طرفية

أخطاء شائعة عند تقييم llamafile

ينشأ معظم الالتباس من سوء فهم آلية عمل حيلة الملف الواحد متعدد المنصات، أو من توقع الحصول فوراً على أحدث ميزات llama.cpp.

الأسئلة الشائعة

ما هو llamafile؟

llamafile مشروع مجاني برخصة Apache 2.0 يحزم نموذجاً ومحرك llama.cpp في ملف تنفيذي واحد يعمل دون تعديل على macOS وLinux وWindows وBSD، باستخدام Cosmopolitan Libc.

من أنشأ llamafile؟

أنشأت Justine Tunney، مبتكرة Cosmopolitan Libc، مشروع llamafile، الذي أصدرته لأول مرة مجموعة الابتكار في Mozilla في نوفمبر 2023. يُصان المشروع حالياً على github.com/mozilla-ai/llamafile.

كيف يمكن لملف واحد أن يعمل على macOS وLinux وWindows؟

يُبنى llamafile باستخدام Cosmopolitan Libc، وهي مكتبة قياسية للغة C مصممة لإنتاج ملف ثنائي واحد صالح في آن واحد على عدة أنظمة تشغيل ومعماريات معالج، بدلاً من الحاجة إلى إصدارات بناء منفصلة لكل منصة.

هل llamafile مجاني للاستخدام التجاري؟

نعم. llamafile برخصة Apache 2.0، مجاني للاستخدام الشخصي والتجاري. تبقى تعديلاته الخاصة على llama.cpp وwhisper.cpp برخصة MIT.

هل يحتاج llamafile إلى وحدة معالجة رسوميات؟

لا. يعمل التشغيل بالمعالج فقط افتراضياً؛ تسريع وحدة معالجة الرسوميات عبر Metal أو CUDA أو ROCm أو Vulkan اختياري ويحسّن السرعة.

هل هناك حد لحجم الملف بالنسبة لـ llamafile؟

نعم، على Windows تحديداً — يحدد Windows الملفات التنفيذية بـ 4 جيجابايت، وهو ما قد يحد من حجم النموذج الذي يمكن تغليفه كملف llamafile واحد لمستخدمي Windows.

هل يواكب llamafile إصدارات llama.cpp باستمرار؟

يتزامن دورياً وليس باستمرار — قدم الإصدار 0.10.0 نظام بناء مُعاد هيكلته خصيصاً لمواكبة إصدارات llama.cpp الحالية، وأُعيد تقديم دعم CUDA لنظام Linux في فبراير 2026 بعد فترة من التأخر.

ما الفرق بين llamafile وKoboldCpp؟

يُوزَّع كلاهما كملف واحد مبني على llama.cpp دون برنامج تثبيت منفصل، لكن ميزة llamafile المميزة هي قابلية النقل الحقيقية عبر المنصات (ملف واحد يعمل على 4 أنظمة تشغيل مختلفة)، بينما ميزة KoboldCpp المميزة هي واجهة ويب مدمجة موجهة لتقمص الأدوار وكتابة القصص.

هل يمكنني إنشاء llamafile من نموذجي الخاص؟

نعم. يوفر المشروع أدوات تغليف لدمج ملف نموذج GGUF مع الملف الثنائي لمحرك llamafile في ملف تنفيذي واحد مخصص.

هل llamafile مناسب لخدمة الإنتاج متعددة المستخدمين؟

ليس هذا محور تركيزه. صُمم llamafile للتوزيع البسيط والقابل للنقل بملف واحد، وللاستخدام من قِبل مستخدم واحد أو على نطاق صغير؛ أما خدمة الإنتاج عالية الإنتاجية لمستخدمين متعددين، فإن vLLM أو SGLang هما الأداتان الأنسب.

المصادر

← العودة إلى LLM المحلية المتقدمة