النقاط الرئيسية
- Shimmy (github.com/Michael-A-Kuykendall/shimmy) هو خادم استدلال مجاني ومفتوح المصدر بملف تنفيذي واحد، وليس بيئة تطوير متكاملة (IDE) ولا تطبيق محادثة
- طوّره وصانه Michael A. Kuykendall كمشروع يُدار بشكل مستقل — يذكر ملف README الخاص به "مجاني للأبد" دون أي دليل على وجود شركة أو جولة تمويل خلفه
- مرخّص بموجب Apache-2.0، وفقًا لملف LICENSE الخاص بالمستودع نفسه
- يعمل على Airframe، محركه الخاص المبني بالكامل بلغة Rust ويستخدم WebGPU (WGSL)، متجنبًا بذلك سلسلة أدوات C++ أو اعتمادية llama.cpp تمامًا
- يقدّم نماذج GGUF وSafeTensors عبر واجهة برمجة تطبيقات متوافقة مع OpenAI؛ وأضاف إصدار v2.6.2 مسارات متوافقة مع Ollama وAnthropic
- 5,890 نجمة على GitHub وقت إعداد هذه المراجعة (github.com/Michael-A-Kuykendall/shimmy، تم التحقق عبر واجهة برمجة تطبيقات GitHub)
📍 في جملة واحدة
Shimmy هو خادم استدلال محلي مجاني ومفتوح المصدر بملف تنفيذي واحد، مكتوب بالكامل بلغة Rust — بديل خفيف وخالٍ من الاعتماديات لـ Ollama — يقدّم نماذج GGUF وSafeTensors عبر واجهة برمجة تطبيقات متوافقة مع OpenAI، دون الحاجة إلى بيئة تشغيل Python أو سلسلة أدوات C++ أو اعتمادية على llama.cpp، بحسب ملف README الخاص بالمشروع.
💬 بعبارات بسيطة
بدلًا من تثبيت حزمة Ollama التي تصل إلى مئات الميغابايتات، يُعد Shimmy ملفًا تنفيذيًا واحدًا صغيرًا (بضعة ميغابايتات) تُنزّله أو تبنيه باستخدام Cargo، ثم تُشير به إلى ملف نموذج GGUF على قرصك وتُشغّله. يمكن لأي أداة تتحدث بالفعل صيغة واجهة برمجة تطبيقات OpenAI أن تتواصل مع Shimmy بدلًا من ذلك، دون أي تغيير في الكود.
📌ملاحظة: هذه المراجعة هي المرافق المعمّق لمدخل Shimmy في دليل برامج LLM المحلية — راجع تلك الصفحة لمقارنة سريعة بين Shimmy وعشرات أدوات الذكاء الاصطناعي المحلية الأخرى. تستند هذه المراجعة إلى ملف README الخاص بـ Shimmy وسجل التغييرات وملاحظات الإصدارات، وليس إلى اختبارات أداء عملية أجرتها PromptQuorum.
ما هو Shimmy؟
Shimmy هو خادم استدلال يعمل عبر سطر الأوامر: ملف تنفيذي واحد يُحمّل ملف نموذج GGUF أو SafeTensors محليًا ويعرضه عبر واجهة برمجة تطبيقات HTTP متوافقة مع OpenAI. يصفه وصف GitHub الخاص به بأنه "pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary."
- نوع المنتج: خادم يعمل عبر سطر الأوامر بملف تنفيذي واحد — وليس تطبيقًا برسومات (GUI) ولا امتدادًا لبيئة تطوير متكاملة
- المُنشئ: Michael A. Kuykendall، مطور مستقل؛ لم تجد هذه المراجعة أي دليل على وجود شركة أو مستثمر أو جولة تمويل خلف المشروع
- المستودع: github.com/Michael-A-Kuykendall/shimmy
- الترخيص: Apache-2.0، مؤكد عبر ملف LICENSE الخاص بالمستودع نفسه
- الحجم: 5,890 نجمة على GitHub وقت إعداد هذه المراجعة، بحسب واجهة برمجة تطبيقات GitHub
- المحرك: Airframe، محرك محوّلات (transformer) مبني بالكامل بلغة Rust ويستخدم WebGPU (WGSL)، وينسب إليه ملف README الخاص بـ Shimmy الفضل في تجنب سلسلة أدوات C++ تمامًا
تاريخ مشروع Shimmy ومحطات الإصدارات
أصدر Shimmy إصدارات متكررة وتدريجية، ويوثّق سجل التغييرات الخاص به ما يقارب 200 عملية إيداع (commit) ووتيرة منتظمة من الإصدارات الفرعية طوال عام 2026، تتمحور حول خط أنابيب المصادقة الذاتية للنماذج ومحرك الاستدلال Airframe.
- 1v2.5.0 — 6 أغسطس 2026: تحديث محرك Airframe إلى 0.3.0
Why it matters: حدّث محرك المحوّلات (transformer) الأساسي المبني بالكامل بلغة Rust والذي يعمل عليه Shimmy. - 2v2.6.0 — 27 أغسطس 2026: توحيد خط أنابيب المصادقة
Why it matters: وحّد المصادقة الذاتية لنماذج Shimmy في نظام "3-box" يضم MATH + INFERENCE + DETERMINISM، مصادقًا على 26 توليفة من النموذج والتكميم عبر 12 عائلة نماذج، وأزال نحو 1,600 سطر من كود المحرك القديم. - 3v2.6.1 — 28 أغسطس 2026: توحيد قوالب المحادثة
Why it matters: وحّد كل تنسيقات الأوامر (prompts) عبر وحدة مشتركة واحدة باسم prompt_render تستخدم قوالب محادثة GGUF حقيقية عبر Jinja، وأوقف مسار كود خادم GPU قديمًا (بإزالة نحو 1,847 سطرًا). - 4v2.6.2 — 28 أغسطس 2026: توثيق OpenAPI ومسارات متوافقة إضافية
Why it matters: أضاف عقد واجهة برمجة تطبيقات قابلًا للقراءة الآلية (`GET /openapi.json`) وواجهة Swagger تفاعلية (`GET /docs`)، إضافة إلى مسارات متوافقة مع Ollama وAnthropic بجانب واجهة برمجة التطبيقات المتوافقة مع OpenAI الموجودة مسبقًا. - 5v2.6.3 — 29 أغسطس 2026: إصلاح تحميل النماذج على وحدات معالجة الرسومات المدمجة
Why it matters: أصلح تحميل النماذج على وحدات معالجة الرسومات المدمجة، بما في ذلك إصلاح خاص بوحدات Intel Arc، من خلال تحديث اعتمادية محرك Airframe إلى 0.4.2. - 6v2.6.4 — 30 أغسطس 2026: أحدث إصدار فرعي وقت إعداد هذه المراجعة
Why it matters: أحدث إصدار موسوم عُثر عليه في صفحة إصدارات GitHub الخاصة بالمشروع وقت إعداد هذه المراجعة — راجع مباشرة [github.com/Michael-A-Kuykendall/shimmy/releases](https://github.com/Michael-A-Kuykendall/shimmy/releases) لأي إصدار صدر بعد تاريخ نشر هذه المراجعة.
ماذا يفعل Shimmy فعليًا؟
تتمحور مجموعة ميزات Shimmy حول تقديم النماذج المحلية عبر سطح واجهة برمجة تطبيقات مألوف، مع إبقاء الملف التنفيذي نفسه بسيطًا وخاليًا من الاعتماديات، بحسب ملف README الخاص بـ Shimmy.
- تحميل نماذج GGUF أصليًا — يُحمّل ملفات نماذج GGUF مباشرة، دون إعادة تجميع (recompiling) أو ترميز ثوابت خاصة بكل نموذج، بحسب توثيق المشروع نفسه؛ كما يدعم صيغة SafeTensors
- واجهة برمجة تطبيقات متوافقة مع OpenAI — إكمال المحادثات، وإكمال النصوص، والاستجابات المتدفقة (streaming)، ونقاط نهاية سرد النماذج، وكلها تطابق صيغة واجهة برمجة تطبيقات OpenAI، بحيث يمكن لكود عميل OpenAI الحالي وأدواته الإشارة إلى Shimmy دون تعديل
- مسارات متوافقة إضافية — اعتبارًا من v2.6.2، يعرض Shimmy أيضًا مسارات متوافقة مع Ollama وAnthropic بجانب واجهة برمجة تطبيقاته المتوافقة مع OpenAI
- مصادقة ذاتية للنماذج — نظام اختبار "3-box" (MATH وINFERENCE وDETERMINISM) يُجريه Shimmy على النماذج المدعومة؛ ويذكر المشروع أن 26 توليفة من النموذج والتكميم عبر 12 عائلة نماذج تجتاز هذا النظام وقت إعداد هذه المراجعة
- ضغط ذاكرة التخزين المؤقت للمفاتيح والقيم TurboShimmy INT4 — يصف توثيق Shimmy الخاص به انخفاضًا في استخدام ذاكرة التخزين المؤقت للمفاتيح والقيم (KV) بنحو 7 أضعاف في التهيئات المُختبرة، بهدف تمكين نوافذ سياق أكبر أو وحدات معالجة رسومات أصغر لنموذج معين
- سياق موسّع عبر توسيع YaRN RoPE — قابل للتهيئة عبر متغيرات البيئة، بحسب توثيق المشروع
- لا اعتمادية استدلال خارجية — يعمل Shimmy على Airframe، محركه الخاص المبني بالكامل بلغة Rust ويستخدم WebGPU، بدلًا من تغليف llama.cpp أو الحاجة إلى سلسلة أدوات Python/CUDA
أمثلة على الاستخدام: ثلاث طرق لاستخدام Shimmy
هذه سير عمل ملموسة مبنية على ميزات Shimmy الموثّقة أعلاه — وليست حالات استخدام افتراضية.
تثبيت Shimmy
يُثبَّت Shimmy كملف Rust تنفيذي — عبر Cargo، أو تنزيل إصدار جاهز، أو Docker.
المصدر | الرابط |
|---|---|
| أمر التثبيت عبر Cargo | cargo install shimmy |
| مستودع GitHub (الكود المصدري، Apache-2.0) | github.com/Michael-A-Kuykendall/shimmy |
| ملفات إصدارات تنفيذية جاهزة | github.com/Michael-A-Kuykendall/shimmy/releases |
| صفحة الحزمة على crates.io | lib.rs/crates/shimmy |
بعد التثبيت، شغّل (بحسب ملف README الخاص بالمشروع) shimmy serve --model-path /absolute/path/to/model.gguf --bind 127.0.0.1:11435 لبدء تقديم نموذج محلي. يتوفر أيضًا Dockerfile وتهيئة Docker Compose في المستودع للنشر القائم على الحاويات. تحقق من تعليمات التثبيت الحالية على مستودع GitHub قبل تشغيل أي أمر، إذ يمكن أن تتغير خطوات التثبيت بين الإصدارات.
المنصة والتسعير والترخيص
المنصة
- ما يذكره Shimmy:
- خادم يعمل عبر سطر الأوامر بملف تنفيذي واحد — يعمل على macOS وWindows وLinux؛ بلا مثبّت رسومي.
التكلفة
- ما يذكره Shimmy:
- مجاني ومفتوح المصدر. يذكر ملف README الخاص بالمشروع "Shimmy will be free forever" (سيبقى Shimmy مجانيًا للأبد). لا توجد باقة مدفوعة.
الترخيص
- ما يذكره Shimmy:
- Apache-2.0، مؤكد عبر ملف LICENSE الخاص بالمستودع نفسه.
التمويل
- ما يذكره Shimmy:
- يصونه Michael A. Kuykendall بشكل مستقل؛ يُدرج المستودع برنامج رعاية طوعي (من باقة 5 دولارات شهريًا وصولًا إلى باقة شريك بنية تحتية بـ 500 دولار شهريًا)، وليس جولة تمويل أو شركة.
تحقق من حالة الترخيص والتمويل الحالية مباشرة على github.com/Michael-A-Kuykendall/shimmy قبل الاعتماد على هذا الجدول في قرار امتثال أو تقييم مخاطر مورّد.
Shimmy مقابل Ollama
يُوضَع Shimmy مباشرة في مواجهة Ollama، إذ يصف ملف README الخاص به نفسه بأنه "the 5MB alternative to Ollama". يُقدّم كلاهما نماذج محلية عبر واجهات برمجة تطبيقات HTTP متشابهة؛ ويكمن الفرق أساسًا في حجم الملف التنفيذي وبصمة الاعتماديات ومحرك الاستدلال لكل مشروع.
حجم الملف التنفيذي
- Shimmy:
- بضعة ميغابايتات، بحسب ادعاء ملف README الخاص بـ Shimmy
- Ollama:
- مئات الميغابايتات، بحسب مقارنات من جهات خارجية
محرك الاستدلال
- Shimmy:
- Airframe — محركه الخاص المبني بالكامل بلغة Rust ويستخدم WebGPU (WGSL)
- Ollama:
- مبني على llama.cpp
اعتماديات وقت التشغيل
- Shimmy:
- لا شيء — لا Python ولا سلسلة أدوات C++، بحسب ملف README الخاص به
- Ollama:
- يضم بيئة تشغيله الخاصة؛ ولا يحتاج هو أيضًا إلى Python منفصلة
توافق واجهة برمجة التطبيقات
- Shimmy:
- متوافق مع OpenAI، إضافة إلى مسارات متوافقة مع Ollama وAnthropic (v2.6.2 فما فوق)
- Ollama:
- يمتلك واجهة برمجة تطبيقات أصلية خاصة به إضافة إلى طبقة متوافقة مع OpenAI
صيغة النموذج
- Shimmy:
- GGUF وSafeTensors
- Ollama:
- قائم على GGUF، عبر مكتبة نماذجه الخاصة وصيغة Modelfile
الجهة الصائنة
- Shimmy:
- مطور مستقل يعمل بمفرده
- Ollama:
- شركة Ollama Inc.، وهي شركة ممولة
إذا كان حجم الملف التنفيذي، أو وقت بدء التشغيل البارد، أو تجنب llama.cpp تحديدًا هو العامل الحاسم، فإن Shimmy مبني للفوز في هذه المحاور تحديدًا، بحسب موضعه الخاص. أما إذا أردت أكبر مكتبة نماذج موجودة، وأدوات مجتمعية، وشركة ممولة تدعم الصيانة طويلة الأمد، فإن سجل Ollama أكثر رسوخًا — راجع مراجعة Ollama لتفصيل كامل. تحقق بنفسك من المعايير الحالية بدلًا من الاعتماد على تسويق أي من المشروعين.
لمن يناسب Shimmy؟
يناسب Shimmy المطورين الذين يريدون تحديدًا خادم استدلال ببصمة أدنى وخاليًا من الاعتماديات، ولا يمانعون التعامل مع مشروع لا يزال حديثًا ويديره شخص واحد.
المنافسون والبدائل
ضمن خوادم الاستدلال المحلية الخفيفة، يُقارَن Shimmy مباشرة بـ Ollama وllama.cpp — المحرك الذي تُبنى عليه معظم الأدوات المحلية، بما فيها Ollama — إضافة إلى LMDeploy للفرق التي تقيّم خيارات تقديم بإنتاجية أعلى.
Ollama
- الأكثر شهرة بـ:
- بيئة تشغيل LLM المحلية الأكثر اعتمادًا بأمر واحد، تدعمها شركة ممولة
- الرابط:
- مراجعة Ollama
مقالات حول Ollama (10)
- Ollama Review 2026: The One-Command Local LLM Runtimeمحدَّث ١٢ سبتمبر ٢٠٢٦
- Cherry Studio 2.0 in 2026: The Free Agent-Based AI Desktop Appمحدَّث ٢٠ سبتمبر ٢٠٢٦
- AutoGPT Review 2026: Classic Agent vs. Hosted Platformمحدَّث ٢٠ سبتمبر ٢٠٢٦
- KoboldCpp Review 2026: One File, No Install, Built for Roleplayمحدَّث ٢٠ سبتمبر ٢٠٢٦
- llama.cpp Explained: The Engine Powering Ollama (2026)محدَّث ٢٠ سبتمبر ٢٠٢٦
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026محدَّث ٢٠ سبتمبر ٢٠٢٦
- Baserow Review 2026: A No-Code Database With a Local-AI Fieldمحدَّث ١٩ سبتمبر ٢٠٢٦
- Farfalle Review: A Self-Hosted, Open-Source AI Search Engineمحدَّث ١٩ سبتمبر ٢٠٢٦
- little-coder Review: A Coding Agent CLI Built for Small Local Modelsمحدَّث ١٩ سبتمبر ٢٠٢٦
- Local Deep Research Review 2026: Self-Hosted, Cited AI Research Agentمحدَّث ١٩ سبتمبر ٢٠٢٦
+273 أخرى غير معروضة
llama.cpp
- الأكثر شهرة بـ:
- محرك الاستدلال بلغتي C وC++ الذي بُني عليه Ollama والعديد من الأدوات الأخرى
- الرابط:
- شرح llama.cpp
مقالات حول llama.cpp (10)
- llama.cpp Explained: The Engine Powering Ollama (2026)محدَّث ٢٠ سبتمبر ٢٠٢٦
- KoboldCpp Review 2026: One File, No Install, Built for Roleplayمحدَّث ٢٠ سبتمبر ٢٠٢٦
- little-coder Review: A Coding Agent CLI Built for Small Local Modelsمحدَّث ١٩ سبتمبر ٢٠٢٦
- Local Deep Research Review 2026: Self-Hosted, Cited AI Research Agentمحدَّث ١٩ سبتمبر ٢٠٢٦
- mlx-serve Review 2026: Native Zig Inference Server for Apple Siliconمحدَّث ١٩ سبتمبر ٢٠٢٦
- mlxcel Review: Rust-Native MLX Inference Runtimeمحدَّث ١٩ سبتمبر ٢٠٢٦
- Parlor Review: On-Device Real-Time Voice and Vision AIمحدَّث ١٩ سبتمبر ٢٠٢٦
- Rapid-MLX Review: Native MLX Inference Server for Apple Siliconمحدَّث ١٩ سبتمبر ٢٠٢٦
- Shimmy Review 2026: A 5MB Rust Alternative to Ollamaمحدَّث ١٩ سبتمبر ٢٠٢٦
- Sidekick Review 2026: A Free, Native macOS Local AI Chat Appمحدَّث ١٩ سبتمبر ٢٠٢٦
+140 أخرى غير معروضة
LMDeploy
- الأكثر شهرة بـ:
- تقديم LLM بإنتاجية عالية وتكميم، موجّه لأحمال عمل الإنتاج
- الرابط:
- مراجعة LMDeploy
مقالات حول LMDeploy (1)
- LMDeploy Review: High-Throughput LLM Serving and Quantizationمحدَّث ١٩ سبتمبر ٢٠٢٦
مذكور أيضًا في:
- NVIDIA Dynamo Review: Datacenter-Scale Inference Servingمحدَّث ١٩ سبتمبر ٢٠٢٦
- LoRAX Review: Serving Thousands of LoRA Adapters on One GPUمحدَّث ١٩ سبتمبر ٢٠٢٦
- Shimmy Review 2026: A 5MB Rust Alternative to Ollamaمحدَّث ١٩ سبتمبر ٢٠٢٦
- TurboFieldfare Review: Running Gemma 4 26B-A4B in 2 GB of RAMمحدَّث ١٩ سبتمبر ٢٠٢٦
هذه ليست قائمة شاملة لخوادم الاستدلال المحلية — راجع دليل برامج LLM المحلية للكتالوج الكامل المُحدَّث بانتظام، بما في ذلك مدخل Shimmy نفسه في الدليل.
الأخطاء الشائعة عند تقييم Shimmy
ينشأ معظم اللبس حول Shimmy من الخلط بينه وبين مشاريع غير مرتبطة تحمل الاسم نفسه، أو افتراض أن لديه نطاق مكتبة نماذج بحجم Ollama.
الأسئلة الشائعة
ما هو Shimmy؟
Shimmy (github.com/Michael-A-Kuykendall/shimmy) هو خادم استدلال مجاني ومفتوح المصدر بملف تنفيذي واحد، مكتوب بالكامل بلغة Rust، يقدّم نماذج GGUF وSafeTensors المحلية عبر واجهة برمجة تطبيقات متوافقة مع OpenAI.
هل Shimmy مجاني؟
نعم. Shimmy مجاني ومفتوح المصدر بموجب ترخيص Apache-2.0. يذكر ملف README الخاص به "Shimmy will be free forever" (سيبقى مجانيًا للأبد)، دون أي باقة مدفوعة.
كيف أثبّت Shimmy؟
أبسط طريقة، بحسب ملف README الخاص بالمشروع، هي cargo install shimmy. تتوفر أيضًا ملفات إصدارات تنفيذية جاهزة وتهيئة Docker على مستودع GitHub.
كيف يختلف Shimmy عن Ollama؟
يصف ملف README الخاص بـ Shimmy نفسه بأنه "the 5MB alternative to Ollama" — ملف تنفيذي أصغر بكثير دون بيئة تشغيل Python أو سلسلة أدوات C++، ويعمل على محركه الخاص Airframe بدلًا من llama.cpp. يمتلك Ollama مكتبة نماذج أكبر وأكثر رسوخًا وتدعمه شركة ممولة؛ بينما يصون Shimmy مطور مستقل واحد.
هل يستخدم Shimmy llama.cpp؟
لا. يعمل Shimmy على Airframe، محركه الخاص المبني بالكامل بلغة Rust ويستخدم WebGPU (WGSL)، وهو ما يذكر المشروع أنه يتيح له تجنب اعتمادية llama.cpp أو سلسلة أدوات C++ تمامًا.
ما صيغ النماذج التي يدعمها Shimmy؟
GGUF وSafeTensors، بحسب توثيق المشروع نفسه. يُحمّل Shimmy ملفات GGUF مباشرة دون إعادة تجميع أو ترميز ثوابت خاصة بكل نموذج.
هل واجهة برمجة تطبيقات Shimmy متوافقة مع أدوات OpenAI؟
نعم. يعرض Shimmy واجهة برمجة تطبيقات متوافقة مع OpenAI (إكمال المحادثات، إكمال النصوص، البث المباشر، سرد النماذج). واعتبارًا من إصدار v2.6.2، أُضيفت أيضًا مسارات متوافقة مع Ollama وAnthropic.
من أنشأ Shimmy؟
أنشأ Michael A. Kuykendall مشروع Shimmy ويصونه كمشروع مفتوح المصدر مستقل يديره بمفرده. لم تجد هذه المراجعة أي دليل على وجود شركة أو جولة تمويل خلفه.
كم عدد النماذج التي يدعمها Shimmy؟
وقت إعداد هذه المراجعة، يصادق Shimmy على 26 توليفة محددة من النموذج والتكميم عبر 12 عائلة نماذج من خلال نظام اختباره الخاص "MATH + INFERENCE + DETERMINISM" — راجع مستودع GitHub الخاص بالمشروع للاطلاع على القائمة الحالية المُحدَّثة.
هل اختبرت PromptQuorum ادعاءات أداء Shimmy بشكل مستقل؟
تستند هذه المراجعة إلى ملف README وسجل التغييرات وملاحظات الإصدارات الخاصة بـ Shimmy نفسها، وليس إلى اختبارات أداء عملية لوقت بدء التشغيل أو بصمة الذاكرة أو ضغط ذاكرة التخزين المؤقت للمفاتيح والقيم أجرتها PromptQuorum.