الـstacks الشائعة في الإنتاج
للقراء الذين لا يريدون قراءة الفئات التسع، اختر الـstack الأقرب وانسخه. كل صف يُقارن هدفاً حقيقياً بمجموعة مُختبَرة والحد الأدنى من الأجهزة التي تعمل عليها فعلاً.
الهدف | الـstack | الحد الأدنى من الأجهزة |
|---|---|---|
| دردشة عادية | LM Studio standalone | 16 GB RAM، بدون GPU |
| أفضل توازن للمستخدمين المتقدمين | Ollama + Open WebUI | 16 GB RAM، GPU اختياري |
| دردشة مستندات | Ollama + AnythingLLM | 16 GB RAM، GPU اختياري |
| كود | Ollama + Continue.dev | 16 GB RAM + GPU موصى به |
| لعب أدوار / إبداعي | KoboldCpp + SillyTavern | 16 GB RAM، GPU موصى به |
| مؤسسي مع الخصوصية أولاً | Ollama + Open WebUI + PrivateGPT | 32 GB RAM + 12 GB VRAM |
| محمول / في التنقل | MLC Chat أو PocketPal AI | iPhone 13+ / Pixel 7+ |
| Apple Silicon | Ollama (backend MLX) أو LM Studio | M2/M3/M4/M5 مع 16+ GB موحدة |
| فريق متعدد المستخدمين | vLLM + Open WebUI | 32+ GB RAM + multi-GPU |
النقاط الرئيسية
- عشر طبقات و160+ مشروعاً وخريطة واحدة. رuntimes وتطبيقات سطح المكتب وواجهات الويب وتكاملات IDE وأدوات الطرفية وأنظمة RAG وأطر العملاء الذكيين والصوت/الوسائط الصوتية/الرؤية والعملاء المحمولة والإضافات الإنتاجية المتخصصة وتوليد الصور — تقريباً جميع المشاريع الشائعة في 2026 تقع بدقة في طبقة واحدة.
- اختر runtime أولاً. Ollama هو الخيار الافتراضي المناسب لـ~95% من القراء؛ llama.cpp هو المحرك الأساسي وراء معظم الأدوات الأخرى؛ vLLM هو الخيار الإنتاجي لنشر متعدد المستخدمين على GPU حقيقي.
- معظم الطبقات فوق runtime اختيارية. تطبيق سطح مكتب أو واجهة ويب واحدة كافية للدردشة. أضف تكامل IDE فقط عند الحاجة لمساعدة في الكود؛ أضف أدوات طرفية فقط عند الرغبة في سير عمل CLI؛ أضف نظام RAG فقط عند الرغبة في الدردشة مع مستنداتك؛ أضف إطار عملاء ذكيين فقط حين لا تعود استدعاءات الخطوة الواحدة كافية؛ أضف توليد الصور فقط عند الحاجة لمخرجات بصرية.
- الترخيص مهم للاستخدام التجاري. MIT وApache 2.0 يسيطران على المنظومة. AGPL يظهر في بعض الواجهات (text-generation-webui وKoboldCpp وJan وSillyTavern) — مثالي للاستخدام الشخصي، يتطلب تأملاً أكثر للنشر التجاري.
- الـstacks متعددة الأدوات هي القاعدة. Ollama + Open WebUI + AnythingLLM + Continue.dev + Stable Diffusion هو إعداد جهاز واحد يغطي الدردشة وRAG والكود وتوليد الصور بدون تنازلات.
كيف يظل هذا الدليل محدَّثاً
يُراجَع هذا الدليل كل ستة أشهر ويُحدَّث بتصحيحات بين المراجعات — آخر تحديث في أغسطس 2026، المراجعة المجدولة القادمة في نوفمبر 2026. أضافت توسعة أغسطس 2026 أكثر من 72 أداة جديدة عبر جميع الطبقات، وقسَّمت الصوت/الوسائط المتعددة إلى ثلاث طبقات مركَّزة (STT وTTS والرؤية)، وقسَّمت مساعدي الكود إلى تكاملات IDE (4a) وأدوات طرفية (4b)، وأضافت طبقة جديدة كلياً لتوليد الصور. أُعيد التحقق من جميع الروابط والتراخيص؛ وتم التحقق من الصيانة النشطة للإدخالات الجديدة (PearAI وWindsurf وSourcegraph Cody وSuperAGI وLeon AI وDraw Things وFooocus وStableSwarmUI وغيرها). معايير الإدراج: المشروع في صيانة نشطة (commits في آخر 90 يوماً)، لديه ترخيص مفتوح المصدر قابل للتحقق أو بيان استخدام تجاري واضح، وله إما حصة مستخدمين ذات معنى في 2026 أو يملأ طبقة كانت ستبقى فارغة بدونه. المشاريع التي تصبح خاملة لأكثر من دورتي إصدار تُحذف؛ المشاركون الجدد الذين يستوفون المعايير يُضافون في المراجعة التالية. لاقتراح مشروع للإدراج، افتح issue أو PR على مستودع PromptQuorum — مع رابط المشروع والترخيص ووصف من جملة واحدة بالتنسيق أعلاه.
المصادر
- ggml-org/llama.cpp GitHub — المصدر الرئيسي لمعمارية runtime والنماذج المدعومة.
- Ollama Library — كتالوج النماذج الرسمي وتوثيق runtime.
- LM Studio Documentation — مرجع الميزات لواجهة سطح المكتب المهيمنة.
- Open WebUI Documentation — مرجع الميزات للواجهة الويب المستضافة ذاتياً المهيمنة.
- Hugging Face Hub — الموقع الرئيسي لتنزيل أوزان النماذج التي تستهلكها كل runtime مدرجة أعلاه.
- awesome-local-llm GitHub list — مخزون يحتفظ به المجتمع يُستخدم كتحقق من إدراج المشاريع.
الأسئلة الشائعة
ما الفرق بين runtime نماذج لغوية محلية وتطبيق سطح مكتب؟
الـruntime (Ollama وllama.cpp وvLLM) هو المحرك الذي يحمِّل أوزان النموذج ويُخدم API — عادةً متوافق مع OpenAI. تطبيق سطح المكتب (LM Studio وJan وGPT4All) هو واجهة دردشة تستدعي runtime في الخلفية. بعض التطبيقات تتضمن runtime خاصاً بها (LM Studio يتضمن llama.cpp)، وأخرى تتطلب تثبيت runtime منفصل (Open WebUI تستدعي Ollama). الـruntime يُحدد ما هو ممكن؛ التطبيق يُحدد ما هو مريح.
هل يمكنني استخدام عدة أدوات من هذه القائمة في نفس الوقت؟
نعم — معظم الـstacks تجمع 2-4 أدوات. إعداد شائع: Ollama كـruntime وOpen WebUI للدردشة وAnythingLLM لدردشة المستندات وContinue.dev للكود — الأربعة تعمل مع نفس نسخة Ollama على جهاز واحد.
ما الأدوات التي تعمل بالكامل بدون اتصال بدون قياس عن بُعد؟
Ollama وllama.cpp وvLLM وJan وGPT4All وOpen WebUI وAnythingLLM وPrivateGPT وContinue.dev وAider وKoboldCpp وLlamafile وMLX-LM ومعظم التطبيقات برخصة AGPL/MIT في هذا الدليل تعمل بالكامل بدون اتصال بعد تنزيل النموذج.
هل أي من هذه الأدوات مرخصة تجارياً (غير مجانية للاستخدام التجاري)؟
بعضها: LM Studio وMsty وBackyard AI وLayla وCursor هي مغلقة المصدر — مجانية للاستخدام عموماً لكن غير قابلة لإعادة التوزيع. Private LLM مدفوعة. الأدوات برخصة AGPL (Jan وKoboldCpp وtext-generation-webui وSillyTavern وKhoj وCopilot for Obsidian) مجانية لأي استخدام بما فيه التجاري، لكن شروط AGPL تتطلب الكشف عن الكود المصدري إذا عدَّلتها واستضفتها علناً.
ما الأدوات التي تدعم Apple Silicon (رقائق سلسلة M) بشكل أصلي؟
Ollama وllama.cpp وMLX-LM وLM Studio وJan وEnchanted وGPT4All وMLC Chat وAnythingLLM ومعظم تطبيقات Electron/Tauri تعمل بشكل أصلي على Apple Silicon وتستخدم backend Metal. MLX-LM خاص بـApple والأسرع للنماذج الكبيرة على رقائق M-series. vLLM وTensorRT-LLM وExLlamaV2 متمحورة حول NVIDIA.
هل تدعم كل هذه الأدوات تنسيق نموذج GGUF؟
GGUF هو التنسيق الأصلي لـllama.cpp وأي أداة تُغلِّفه (Ollama وLM Studio وJan وGPT4All وKoboldCpp وLlamafile). vLLM وTensorRT-LLM يستخدمان تنسيقات محسَّنة خاصة بهما. ExLlamaV2 يستخدم تكميم EXL2. MLX-LM يستخدم أوزاناً محوَّلة إلى MLX.
ما الأدوات الأفضل للمستخدمين بدون خبرة في الكود؟
GPT4All لديه أسهل تثبيت (نقرة واحدة، يعمل بـ8 GB RAM). LM Studio هو الأكثر اكتمالاً في الميزات بدون حاجة للطرفية. Jan هو الخيار بدون كود الأكثر تركيزاً على الخصوصية. لدردشة المستندات بدون عمل في سطر الأوامر، AnythingLLM هو الأسهل.
هل يمكنني تشغيل هذه الأدوات على خادم والوصول إليها عن بُعد؟
معظم الأدوات ذات قدرة خادم (Ollama وvLLM وLocalAI وOpen WebUI وLibreChat وPrivateGPT وAnythingLLM) تكشف API HTTP وترتبط بواجهة شبكة قابلة للتكوين. النمط القياسي: تشغيل Ollama على خادم منزلي أو VPS، تشغيل واجهة على كمبيوترك أو هاتفك موجَّهة لـIP الخادم.
ما الأدوات التي تدعم إعدادات متعددة المستخدمين / الفريق؟
Open WebUI وLibreChat وh2oGPT وAnythingLLM (مع تمكين ميزات المسؤول) وDify مُصمَّمة للاستخدام متعدد المستخدمين مع التحكم في الوصول القائم على الأدوار وسجل المحادثات لكل مستخدم. vLLM هو طبقة الخدمة الصحيحة في الأسفل حين يهم الاستدلال المتزامن.
كم مرة يُحدَّث هذا الدليل؟
كل ستة أشهر — آخر مراجعة في يوليو 2026، التحديث القادم المجدول في نوفمبر 2026. التغييرات الوسيطة (مشروع يصبح خاملاً، أداة جديدة تكتسب حصة كبيرة، ترخيص يتغير) تُطبَّق كتصحيحات على الإدخال القائم.
هل يمكنني توليد الصور محلياً دون أي استدعاءات سحابية؟
نعم — Stable Diffusion وComfyUI وInvoke AI وAUTOMATIC1111 WebUI وغيرها في الطبقة 10 تعمل بالكامل على الأجهزة المحلية. يحتاج Stable Diffusion إلى 6+ GB VRAM (RTX 3060 أو RTX 4060 أو ما يعادلها)؛ يمكن لـFooocus وواجهات محسَّنة أخرى العمل على بطاقات بـ4-6 GB. يُكبِّر Real-ESRGAN الصور المولَّدة؛ يضيف ControlNet تحكماً مكانياً (حواف، أوضاع، خرائط عمق)؛ يولِّد AnimateDiff فيديو من نص. تعمل جميعها دون إرسال بيانات إلى خوادم خارجية.