Key Takeaways
- يعمل نموذج LLM المحلي على CPU أو GPU الخاص بك: بلا إنترنت، وبلا تكاليف API، وبلا بيانات تُرسل إلى خوادم طرف ثالث.
- تلزم ثلاثة مكونات: ملف النموذج (صيغة GGUF أو safetensors)، ومحرك استدلال (Ollama، أو LM Studio، أو llama.cpp)، واختياريًا واجهة دردشة.
- الحد الأدنى من العتاد: 8 GB من RAM لنموذج 7B معاملات بتكميم 4 بت. مع 16 GB من RAM، تُدار معظم النماذج اليومية بأريحية.
- النماذج المحلية أبطأ من واجهات API السحابية على العتاد الاستهلاكي: نموذج 7B على حاسوب محمول حديث ينتج 15-40 token/ثانية مقابل ~100 token/ثانية لـ GPT-5.6 Luna عبر API.
- أفضل حالات الاستخدام: معالجة البيانات الخاصة، والعمل دون اتصال، وتكلفة متكررة صفرية، وتعلّم كيفية عمل نماذج LLM.
ما هو نموذج LLM المحلي؟
نموذج LLM المحلي (نموذج لغة كبير) هو نموذج ذكاء اصطناعي يعمل على عتاد تحت سيطرتك: حاسوبك المحمول، أو المكتبي، أو خادم محلي. تُخزّن أوزان النموذج كملف على قرصك، وتحدث كل المعالجة على CPU أو GPU الخاص بك. لا يُنقل أي نص من الموجّهات أو بيانات استجابة إلى أي خادم خارجي.
يميّز مصطلح "محلي" هذه النماذج عن الخدمات المستضافة في السحابة، مثل OpenAI GPT-5.6، أو Anthropic Claude Sonnet 5، أو Google Gemini 3.1 Pro، التي تعالج موجّهاتك على خوادم بعيدة وتعيد النتائج عبر الإنترنت.
تتراوح نماذج LLM المحلية من نماذج صغيرة 1B معاملات تعمل على هاتف إلى نماذج 70B معاملات تتطلب محطة عمل بذاكرة VRAM سعة 48 GB. أكثر النماذج استخدامًا للمبتدئين -- Meta Llama 3.2 3B، وMicrosoft Phi-3 Mini، وGoogle Gemma 2 2B -- تعمل على أي حاسوب محمول بذاكرة 8 GB من RAM.
كيف يعمل نموذج LLM المحلي؟
يتضمن تشغيل نموذج LLM محلي ثلاث طبقات تعمل معًا: ملف النموذج، ومحرك الاستدلال، والواجهة.
يحتوي ملف النموذج على أوزان الشبكة العصبية: القيم العددية المُتعلَّمة التي تحدد كيف يعالج النموذج النص ويولّده. للاستخدام المحلي، تُخزّن هذه الأوزان غالبًا بصيغة GGUF (صيغة مضغوطة طوّرها مشروع llama.cpp) أو بصيغة safetensors. نموذج 7B معاملات مكمَّم إلى دقة 4 بت يشغل نحو 4.5 GB على القرص.
يقرأ محرك الاستدلال ملف النموذج وينفّذ الحسابات المصفوفية اللازمة لتوليد token. أشهر المحركات هي Ollama (يعمل كخدمة في الخلفية بواجهة API متوافقة مع OpenAI)، وLM Studio (تطبيق سطح مكتب بواجهة دردشة مدمجة)، وllama.cpp (مكتبة C++ الأساسية التي تُبنى عليها معظم الأدوات).
الواجهة هي حيث تتفاعل مع النموذج: طرفية، أو واجهة ويب، أو نقطة نهاية API. تعرض أدوات كثيرة مثل Ollama واجهة REST API على `http://localhost:11434` لتتمكن من توصيل أي تطبيق متوافق مع OpenAI بنموذجك المحلي.
أي عتاد تحتاج لتشغيل نموذج LLM محلي؟
يعتمد متطلب العتاد كليًا على النموذج الذي تريد تشغيله وسرعة الاستجابة التي تحتاجها.
| حجم النموذج | RAM المطلوبة | السرعة (CPU) | نماذج مثال |
|---|---|---|---|
| — | — | — | — |
| — | — | — | — |
| — | — | — | — |
| — | — | — | — |
| — | — | — | — |
هل تجعل وحدة GPU نموذج LLM المحلي أسرع؟
يحسّن التسريع بوحدة GPU السرعة بشكل كبير. تشغّل NVIDIA RTX 4070 Ti (12 GB من VRAM) نموذج 7B بـ 80-120 token/ثانية: أسرع بـ 4 إلى 8 مرات من وضع CPU فقط. تستخدم أجهزة Mac بمعالج Apple Silicon (M1، M2، M3، M4) ذاكرة موحّدة وتبلغ 40-80 token/ثانية على نماذج 7B دون GPU مخصصة. لمستخدمي الحواسيب المحمولة، راجع كيفية تشغيل نماذج LLM المحلية على حاسوب محمول للحصول على نصائح خاصة بالعتاد.
LLM محلي مقابل API سحابية: ما الفرق؟
المقايضة الأساسية هي الخصوصية والتكلفة مقابل القدرة والسرعة. راجع المقارنة الكاملة في نماذج LLM المحلية مقابل واجهات API السحابية.
| العامل | LLM محلي | API سحابية |
|---|---|---|
| — | — | — |
| — | — | — |
| — | — | — |
| — | — | — |
| — | — | — |
| — | — | — |
أي صيغ نماذج تُستخدم لنماذج LLM المحلية؟
GGUF (GPT-Generated Unified Format) هي الصيغة المهيمنة للاستدلال المحلي. طوّرها مشروع llama.cpp، وتدمج ملفات GGUF كل بيانات النموذج الوصفية وتدعم مستويات تكميم متعددة في ملف واحد. عندما تشغّل `ollama pull llama3.2`، ينزّل Ollama داخليًا ملف GGUF.
Safetensors صيغة من Hugging Face تُستخدم أساسًا مع أدوات الاستدلال القائمة على PyTorch، مثل transformers وvLLM. وهي أكثر شيوعًا في البحث وعمليات النشر على الخوادم.
يقلّل التكميم دقة النموذج لخفض متطلبات الذاكرة. نموذج 7B بدقة FP16 كاملة يتطلب ~14 GB من RAM. بتكميم Q4_K_M (4 بت)، يحتاج النموذج نفسه ~4.5 GB بفقدان جودة ضئيل. تستخدم معظم أدلة المبتدئين Q4_K_M أو Q5_K_M.
متى يجب أن تستخدم نموذج LLM محليًا بدلًا من API سحابية؟
- معالجة البيانات الحساسة -- السجلات الطبية، والمستندات القانونية، والبيانات المالية، أو أي معلومات تعريف شخصية (PII) لا يمكن أن تغادر بنيتك التحتية.
- إلغاء تكاليف API -- المعالجة بالدُفعات عالية الحجم حيث تتراكم تكاليف token السحابية بسرعة. نموذج 7B يعمل محليًا يكلّف $0 لكل استعلام بعد استهلاك العتاد.
- بيئات دون اتصال أو معزولة -- العمل الميداني، والمنشآت الآمنة، أو التطبيقات التي يجب أن تعمل دون اتصال بالإنترنت.
- التعلّم والتجريب -- فهم كيفية عمل نماذج LLM داخليًا، وتجربة الموجّهات دون قلق بشأن التكلفة، أو بناء أدوات محلية مدعومة بالذكاء الاصطناعي.
- التطبيقات منخفضة زمن الاستجابة -- عندما يكون زمن الذهاب والإياب عبر الشبكة غير مقبول ويكون نموذج محلي أصغر سريعًا بما يكفي للمهمة.
أسئلة شائعة حول نماذج LLM المحلية
هل يمكن لنموذج LLM محلي مضاهاة جودة GPT-5.6؟
لا، ليس على العتاد الاستهلاكي الحالي. يتفوق GPT-5.6 وClaude Sonnet 5 على أي نموذج قابل للتشغيل محليًا في الاستدلال المعقد، وتوليد الشيفرة، ومعايير اتباع التعليمات. مع ذلك، لمهام التلخيص، والترجمة، والكتابة اليومية، ينتج نموذج 13B-34B مكمَّم جيدًا نتائج يصعب تمييزها عن النماذج الرائدة.
هل أحتاج إلى GPU لتشغيل نموذج LLM محلي؟
لا. تعمل جميع محركات الاستدلال الرئيسية (Ollama، LM Studio، llama.cpp) على CPU فقط. تسرّع GPU الأداء بشكل كبير: تشغّل NVIDIA RTX 4060 (8 GB من VRAM) نموذج 7B بـ 60-90 token/ثانية مقابل 10-20 token/ثانية على CPU فقط. تستخدم أجهزة Mac بمعالج Apple Silicon ذاكرة موحّدة مسرّعة بـ GPU افتراضيًا وهي مثالية لنماذج LLM المحلية دون GPU مخصصة.
من أين أنزّل نماذج LLM المحلية؟
المصادر الثلاثة الرئيسية هي: مكتبة نماذج Ollama (ollama.com/library) للتنزيلات بأمر واحد؛ وHugging Face (huggingface.co) لمجموعة كاملة من نماذج GGUF وsafetensors؛ ومتصفح النماذج المدمج في LM Studio الذي يبحث في Hugging Face مباشرة. راجع كيفية تثبيت Ollama وكيفية تثبيت LM Studio لأدلة الإعداد.
هل تشغيل نموذج LLM محلي خاص؟
نعم، مع تفاصيل دقيقة. استدلال النموذج نفسه محلي بالكامل. مع ذلك، قد ترسل بعض التطبيقات المبنية على نماذج LLM المحلية بيانات إلى خوادم خارجية. تحقق دائمًا مما إذا كانت الواجهة أو طبقة الإضافات التي تستخدمها قد فعّلت القياس عن بُعد أو المزامنة السحابية. راجع قائمة تحقق أمان وخصوصية نماذج LLM المحلية للحصول على دليل تدقيق كامل.
كيف تبدأ مع نماذج LLM المحلية؟
أسرع طريقة لتشغيل أول نموذج LLM محلي هي كيفية تثبيت Ollama: أمر واحد يثبّت المحرك وينزّل نموذجًا في أقل من 5 دقائق على macOS أو Windows أو Linux. إذا فضّلت واجهة رسومية، فإن كيفية تثبيت LM Studio ترشدك خطوة بخطوة في إعداد تطبيق سطح المكتب. لاختيار نموذج للبدء، راجع أفضل نماذج LLM المحلية للمبتدئين.
المصادر
- llama.cpp -- GitHub -- مكتبة C++ الأساسية لتشغيل النماذج المكمَّمة محليًا
- Hugging Face -- Model Hub -- مستودع لأكثر من 100,000 نموذج بصيغة GGUF وsafetensors وغيرها
- Ollama Model Library -- قائمة منسّقة من النماذج المكمَّمة مسبقًا المتاحة للتنزيل بنقرة واحدة
أخطاء شائعة عند البدء
- افتراض أن جميع النماذج المحلية خاصة بالقدر نفسه: قد تظل بعض الواجهات أو التكميمات تسجّل البيانات.
- تشغيل نماذج أكبر من RAM المتاحة، مما يسبب تباطؤًا حادًا بسبب التبديل على القرص.
- عدم إدراك أن جودة النماذج تتفاوت بشكل كبير: ليست كل النماذج المحلية تضاهي GPT-5.6 في المهام المعقدة.