Key Takeaways
- أفضل استدلال على نطاق صغير: Phi-4 Mini 3.8B -- 68% MMLU، 70% HumanEval، يعمل بذاكرة 4 GB.
- الأسرع على CPU: Gemma 2 2B -- 40-60 tok/ثانية على أي حاسوب محمول حديث، 1.7 GB من RAM.
- أفضل نموذج صغير للبرمجة: Qwen3 3B -- 65% HumanEval بـ ~2 GB من RAM.
- أفضل نموذج 3B للاستخدام العام: Llama 3.2 3B -- أكبر دعم مجتمعي، سياق 128K، 2.5 GB من RAM.
- اعتبارًا من أبريل 2026، لا ينتج أي نموذج أقل من 2B جودة مخرجات مناسبة للمهام الاحترافية. استخدم 3B أو أكبر للعمل الحقيقي.
ما هو نموذج LLM المحلي "الصغير" ومتى يجب أن تستخدم واحدًا؟
يُعرّف نموذج LLM المحلي الصغير عادةً بأنه نموذج بأقل من 4 مليارات معامل. بتكميم Q4_K_M، تتطلب هذه النماذج 1.5-3 GB من RAM -- ضمن قيود الحواسيب المحمولة الأساسية بذاكرة إجمالية 4-8 GB تمامًا.
اعتبارًا من أبريل 2026، النماذج الصغيرة مناسبة لـ: التلخيص السريع، والأسئلة والأجوبة البسيطة، وشرح مقتطفات الشيفرة، وترجمة النصوص القصيرة، ومهام التصنيف. ليست مناسبة للاستدلال متعدد الخطوات، وتوليد الشيفرة المعقد، ولا كتابة مستندات طويلة ومتماسكة.
فجوة الجودة بين نموذج 3B ونموذج 7B كبيرة -- تعادل تقريبًا الفجوة بين GPT-4o mini وGPT-5.5. للمستخدمين بذاكرة 8 GB، يكاد يكون نموذج 7B بـ Q4_K_M الخيار الأفضل دائمًا إذا توفّر للجهاز هامش. راجع أفضل نماذج LLM المحلية للمبتدئين للتوصيات بشأن 7B.
أي نموذج يجب أن تستخدم؟ دليل قرار سريع
Phi-4 Mini 3.8B -- أفضل أداء استدلال في فئة أقل من 4B
يحقق Microsoft Phi-4 Mini 68% في MMLU و70% في HumanEval -- درجات تتفوق على كثير من نماذج 7B الصادرة قبل 2025. هذا ممكن لأن Phi-4 Mini دُرّب على مجموعة بيانات اصطناعية منسّقة، تركز على الاستدلال وحل المشكلات، بدلًا من نص ويب عام.
اعتبارًا من أبريل 2026، Phi-4 Mini هو الخيار الموصى به للمستخدمين الذين يحتاجون أساسًا إلى الاستدلال (الرياضيات، والمنطق، والشروحات خطوة بخطوة) أو المساعدة في البرمجة على عتاد بذاكرة 4-6 GB.
| المواصفة | القيمة |
|---|---|
| — | — |
| — | — |
| — | — |
| — | — |
| — | — |
| — | — |
Gemma 2 2B -- أسرع نموذج LLM محلي صغير على CPU
يولّد Google Gemma 2 2B 40-60 token/ثانية على CPU حاسوب محمول حديث -- الأسرع بين أي نموذج في مستوى الجودة هذا. بصمة RAM البالغة 1.7 GB تترك ذاكرة وافرة لنظام التشغيل والتطبيقات الأخرى على جهاز بذاكرة 4 GB.
الجودة أدنى من Phi-4 Mini أو Llama 3.2 3B في مهام الاستدلال. نافذة السياق البالغة 8K (مقابل 128K في Phi-4 Mini وLlama 3.2) قيد عملي للمستندات الأطول. Gemma 2 2B هو الخيار الصحيح عندما تكون سرعة الاستجابة أهم من عمق المخرجات.
| المواصفة | القيمة |
|---|---|
| — | — |
| — | — |
| — | — |
| — | — |
| — | — |
Qwen3 3B -- أفضل نموذج صغير لمهام البرمجة
يحصل Qwen3 3B على 65% في HumanEval -- بفارق 5 نقاط مئوية فوق Llama 3.2 3B -- مما يجعله الخيار الأفضل لمهام البرمجة على نطاق 3B. يتضمن وضع JSON ودعم استدعاء الدوال، ويتعامل أصليًا مع 29 لغة.
للمهام غير البرمجية بالإنجليزية، ينتج Llama 3.2 3B وPhi-4 Mini نثرًا أكثر طبيعية. اختر Qwen3 3B تحديدًا عندما تكون البرمجة أو المخرجات متعددة اللغات حالة الاستخدام الأساسية.
| المواصفة | القيمة |
|---|---|
| — | — |
| — | — |
| — | — |
| — | — |
| — | — |
| — | — |
Llama 3.2 3B -- أفضل نموذج صغير للاستخدام العام
يُعد Meta Llama 3.2 3B أكثر نماذج 3B توثيقًا ودعمًا مجتمعيًا. يحصل على 58% في MMLU و60% في HumanEval -- أقل قليلًا من Phi-4 Mini في كليهما -- لكنه يملك أوسع دعم للأدوات، ومزيدًا من عمليات الضبط الدقيق المتاحة، وأكبر مجموعة من الأدلة المجتمعية.
نافذة السياق البالغة 128K هي نفسها في نماذج Llama 3.x الأكبر، مما يجعله مناسبًا لتلخيص المستندات متوسطة الطول. لأول نموذج صغير، يبقى Llama 3.2 3B الخيار الأكثر أمانًا بسبب سلوكه المتوقع وتوثيقه الواسع.
| المواصفة | القيمة |
|---|---|
| — | — |
| — | — |
| — | — |
| — | — |
| — | — |
Llama 3.2 1B -- الحد الأدنى المطلق لأي مخرجات مفيدة
يتطلب Llama 3.2 1B 1.3 GB فقط من RAM ويولّد 60-90 tok/ثانية على CPU -- أسرع نموذج قابل للتشغيل محليًا. جودة المخرجات هامشية: يتعامل مع تصنيفات بسيطة جدًا واستخراج الكلمات المفتاحية، لكنه يواجه صعوبة مع الاستجابات المتماسكة متعددة الجمل. اعتبارًا من أبريل 2026، استخدم Llama 3.2 1B فقط عندما تكون RAM فعليًا هي القيد الأساسي (أقل من 3 GB متاحة) أو لاختبار تكاملات الأدوات.
مقارنة كاملة: أفضل نماذج LLM المحلية الصغيرة أقل من 4B معاملات
| النموذج | MMLU | HumanEval | RAM | السياق | الأفضل لـ |
|---|---|---|---|---|---|
| — | 68% | 70% | 2.5 GB | — | — |
| — | 62% | 65% | 2 GB | — | — |
| — | 58% | 60% | 2.5 GB | — | — |
| — | 52% | 38% | 1.7 GB | — | — |
| — | 32% | 28% | 1.3 GB | — | — |

فهم التكميم: الموازنة بين RAM والجودة

نماذج LLM المحلية الصغيرة حسب المنطقة
الاتحاد الأوروبي / GDPR: للمهنيين في الاتحاد الأوروبي الذين يعملون بعتاد محدود -- العمل الميداني، والبيئات المعزولة، والحواسيب المحمولة المؤسسية الأقدم -- توفّر النماذج المحلية الصغيرة استدلالًا متوافقًا مع GDPR دون خروج البيانات. يحافظ Phi-4 Mini 3.8B يعمل على حاسوب محمول مؤسسي قياسي (8 GB من RAM) على كل النص المعالج داخل الجهاز بموجب المادة 5 من GDPR (تقليل البيانات). لتوثيق امتثال BSI الألماني: يوفّر Phi-4 Mini (Microsoft، ترخيص MIT) وLlama 3.2 3B (Meta، ترخيص مجتمع Llama) معرّفات نماذج مرقّمة عبر وسوم Ollama، بما يلبي متطلبات توثيق أدوات الذكاء الاصطناعي. لا تقدّم Mistral حاليًا نموذجًا أقل من 4B. لمؤسسات الاتحاد الأوروبي التي تفضّل نموذجًا أوروبي المنشأ في فئة الحجم هذه، الخيارات محدودة حتى تطلق Mistral نسخة أقل من 4B.
منطقة الخليج / السعودية (PDPL): للجهات في السعودية والإمارات العاملة بموجب نظام حماية البيانات الشخصية (PDPL) وأطر السيادة على الذكاء الاصطناعي، توفّر النماذج المحلية الصغيرة معالجة على الجهاز دون إرسال البيانات إلى خوادم سحابية خارجية. للمهام العربية على نطاق النموذج الصغير، يدعم Qwen3 3B العربية أصليًا. للجهات التي تفضّل نموذجًا عربي المنشأ، يُعد Jais (G42) وALLaM وFalcon (TII، الإمارات) خيارات سيادية، وإن كانت غالبًا أكبر من فئة أقل من 4B. لمعالجة العربية على عتاد محدود: `ollama run qwen2.5:3b` يعمل على أي جهاز Linux بذاكرة 4 GB ويعالج كل النص على الجهاز دون استدعاءات API خارجية.
الصين: Qwen3 3B (Alibaba، Apache 2.0) هو الخيار الطبيعي لنشر النماذج الصغيرة بالصينية. تعالج التجزئة الأصلية للصينية النص بالماندرين بكفاءة أعلى بنسبة 30-40% من Llama بعدد المعاملات نفسه. لعمليات نشر إنترنت الأشياء والحافة بموجب قانون أمن البيانات الصيني (数据安全法): `ollama run qwen2.5:3b` يعمل على أي جهاز Linux بذاكرة 4 GB ويعالج كل النص على الجهاز دون استدعاءات API خارجية.
ما هي الأخطاء الشائعة عند تشغيل نماذج LLM المحلية الصغيرة؟
- استخدام تكميم Q8_0 بدلًا من Q4_K_M: يتطلب Q8_0 ضعف RAM تقريبًا مقارنة بـ Q4_K_M مع تحسّن جودة ضئيل على النطاق الصغير. نموذج Llama 3.2 3B بـ Q8_0 يحتاج ~3.8 GB من RAM مقابل ~2.5 GB بـ Q4_K_M. على جهاز بذاكرة 4 GB، قد يُفعّل Q8_0 استخدام swap ويجعل الاستدلال أبطأ بـ 3-5 مرات. استخدم دائمًا Q4_K_M كقيمة افتراضية للنماذج أقل من 4B.
- تشغيل نموذج أساسي بدلًا من نسخة instruct: النماذج الأساسية (مثل `llama3.2:3b-text`) هي نقاط تحقق قبل الضبط الدقيق، مدرّبة للتنبؤ بالـ token التالي في النص. لا تتبع التعليمات. عندما تسأل نموذجًا أساسيًا "كم 2+2؟"، قد يكمل الجملة كاختبار بدلًا من الإجابة بـ "4". استخدم دائمًا نسخة instruct: `llama3.2:3b` (يستخدم Ollama instruct افتراضيًا للنماذج المسمّاة).
- توقّع جودة نموذج 7B من نموذج 3B: نموذج 3B بنسبة 68% في MMLU (Phi-4 Mini) يؤدي بشكل مماثل لـ GPT-4o mini لعام 2023 في المهام العامة. سلاسل الاستدلال المعقدة والكتابة المطوّلة وتوليد الشيفرة الدقيق ستنتج جودة أدنى بوضوح من نموذج 7B. إذا كانت جودة المخرجات غير كافية، فرقِّ إلى نموذج 7B -- فرق RAM ~2 GB (2.5 GB ← 4.5 GB).
أسئلة شائعة حول نماذج LLM المحلية الصغيرة
ما أصغر نموذج LLM محلي ينتج نتائج مفيدة؟
اعتبارًا من أبريل 2026، الحد الأدنى العملي لنتائج مفيدة هو نموذج 3B بتكميم Q4_K_M. النماذج أقل من 2B معاملات (Llama 3.2 1B، Gemma 2 2B) تنتج جملًا متماسكة لكنها تواجه صعوبة مع التعليمات متعددة الخطوات، والاستجابات الأطول، والاستدلال المعقد. لمهام مثل التلخيص والأسئلة والأجوبة البسيطة، Gemma 2 2B قابل للاستخدام. لأي شيء أكثر تعقيدًا، ابدأ بنموذج 3B.
هل يمكن لنموذج 3B العمل على هاتف؟
نعم -- صُمم Llama 3.2 1B و3B تحديدًا للنشر المحمول على الجهاز. توفّر Meta بناءات محسّنة لـ iOS (عبر MLC LLM) وAndroid. ينتج الاستدلال على هاتف حديث (Snapdragon 8 Gen 3 أو Apple A17 Pro) 15-30 tok/ثانية لنماذج 1B. لا يعمل LM Studio وOllama حاليًا على iOS أو Android -- يتطلب المحمول أطر عمل منفصلة.
هل النماذج الصغيرة جيدة للتلخيص؟
نعم -- التلخيص أحد أقوى حالات استخدام النماذج الصغيرة. ينتج Gemma 2 2B وLlama 3.2 3B ملخصات دقيقة لنصوص تصل إلى ~4000 كلمة (حد سياقها العملي لمخرجات جيدة) بشكل موثوق. للمستندات الأطول، استخدم نموذجًا بنافذة سياق كبيرة مثل Phi-4 Mini أو Llama 3.2 3B (كلاهما بـ 128K token).
كم أسرع نموذج 2B من نموذج 7B على العتاد نفسه؟
أسرع بنحو 2-3 مرات على CPU. يولّد Gemma 2 2B 40-60 tok/ثانية مقابل 10-20 tok/ثانية لـ Mistral Small على CPU الحاسوب المحمول نفسه. على GPU، يتقلّص فارق السرعة لأن أداء GPU أقل تقييدًا بحجم النموذج. فرق السرعة أكثر وضوحًا على الأجهزة التي تعتمد CPU فقط.
هل تدعم النماذج الصغيرة استدعاء الدوال؟
بعضها نعم. يدعم Qwen3 3B استدعاء الدوال ووضع JSON. يملك Llama 3.2 3B دعمًا أساسيًا لاستخدام الأدوات. لا يدعم Gemma 2 2B استدعاء الدوال. راجع وثائق النموذج قبل بناء مسار يعتمد على مخرجات منظّمة.
أي نموذج صغير أفضل للغات غير الإنجليزية؟
يدعم Qwen3 3B 29 لغة بشكل أصلي، بما في ذلك الصينية واليابانية والكورية والعربية. Gemma 2 2B وPhi-4 Mini محسّنان أساسًا للإنجليزية. لمهام اللغات الأخرى على نطاق النموذج الصغير، Qwen3 3B هو الخيار الواضح. راجع مقارنة Qwen vs Llama vs Mistral متعددة اللغات لمقارنة كاملة للغات.
ما الفرق بين Phi-4 Mini وLlama 3.2 3B للمهام اليومية؟
يتفوق Phi-4 Mini على Llama 3.2 3B في الاستدلال والرياضيات والبرمجة (68% مقابل 58% في MMLU، 70% مقابل 60% في HumanEval) بذاكرة RAM متطابقة تقريبًا (2.5 GB لكل منهما). للمهام اليومية -- الأسئلة والأجوبة، والتلخيص، والشروحات البسيطة -- فجوة الجودة ملحوظة لكنها غير جذرية. يملك Llama 3.2 3B دعمًا مجتمعيًا أكبر ومزيدًا من عمليات الضبط الدقيق المتاحة. اختر Phi-4 Mini للاستدلال المنظّم؛ وLlama 3.2 3B للدردشة العامة والتوافق الأكبر.
هل يمكنني تشغيل نموذجين صغيرين في الوقت نفسه؟
نعم، إذا سمحت RAM الإجمالية. نموذجان 3B بـ Q4_K_M يستخدمان ~5 GB مجتمعين -- ممكن على جهاز بذاكرة 8 GB بنظام تشغيل خفيف. يحمّل Ollama نموذجًا واحدًا في كل مرة لكل عملية افتراضيًا. شغّل نسختين من Ollama على منفذين مختلفين (OLLAMA_HOST=:11434 وOLLAMA_HOST=:11435) لتقديم نموذجين بالتوازي. هذا مفيد لاختبار A/B للمخرجات.
هل تصلح النماذج الصغيرة لـ RAG (التوليد المعزّز بالاسترجاع)؟
نعم لـ RAG البسيط. يستطيع Llama 3.2 3B وPhi-4 Mini الإجابة عن أسئلة حول مقاطع مستندات مُسترجعة بشكل موثوق. لـ RAG على قواعد معرفة كبيرة تتطلب استدلالًا متعدد القفزات، تؤدي نماذج 7B أو أكبر بثبات أعلى. تستخدم ميزة LocalDocs في GPT4All نموذج 3B للأسئلة والأجوبة عن المستندات وتعمل جيدًا لمجموعات المستندات الشخصية.
هل Phi-4 Mini أفضل من Llama 3.2 3B للبرمجة؟
نعم. يحصل Phi-4 Mini على 70% في HumanEval مقابل 60% لـ Llama 3.2 3B -- فجوة كبيرة قدرها 10 نقاط على هذا النطاق. للمساعدة في البرمجة على أجهزة بذاكرة 4-6 GB، Phi-4 Mini هو الخيار الموصى به. للبرمجة بلغات متعددة (غير Python)، Qwen3 3B بنسبة 65% في HumanEval منافس لـ Phi-4 Mini ويدعم أيضًا استدعاء الدوال.
المصادر
- Hugging Face Open LLM Leaderboard -- open-llm-leaderboard.hf.space (درجات MMLU وHumanEval)
- Microsoft Phi-4 Technical Report -- microsoft.com/en-us/research/publication/phi-4-technical-report/
- Meta Llama 3.2 Model Card -- huggingface.co/meta-llama/Llama-3.2-3B-Instruct
- Google Gemma 2 Technical Report -- storage.googleapis.com/deepmind-media/gemma/gemma-2-report.pdf
