Skip to main content
PromptQuorum
Home/Local LLMs/نماذج ⁨LLM⁩ المحلية الصغيرة: أفضل نماذج أقل من ⁨4B⁩ للأجهزة منخفضة الذاكرة في ⁨2026⁩
Best Models

نماذج ⁨LLM⁩ المحلية الصغيرة: أفضل نماذج أقل من ⁨4B⁩ للأجهزة منخفضة الذاكرة في ⁨2026⁩

·8 دقائق قراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

تعمل نماذج LLM المحلية الصغيرة (1B-4B معاملات) على أجهزة بذاكرة RAM سعة 4-8 GB وتنتج 30-70 token/ثانية على CPU -- سريعة بما يكفي للدردشة الفورية.

تعمل نماذج LLM المحلية الصغيرة (1B-4B معاملات) على أجهزة بذاكرة RAM سعة 4-8 GB وتنتج 30-70 token/ثانية على CPU -- سريعة بما يكفي للدردشة الفورية. أفضل النماذج الصغيرة في 2026 هي Microsoft Phi-4 Mini 3.8B (أفضل استدلال)، وGoogle Gemma 4 E2B (الأسرع)، وQwen2.5 3B (الأفضل للبرمجة)، وMeta Llama 3.2 3B (الأفضل للاستخدام العام).

نماذج ⁨LLM⁩ المحلية الصغيرة: أفضل نماذج أقل من ⁨4B⁩ للأجهزة منخفضة الذاكرة في ⁨2026⁩

Key Takeaways

  • أفضل استدلال على نطاق صغير: Phi-4 Mini 3.8B -- 68% MMLU، 70% HumanEval، يعمل بذاكرة 4 GB.
  • أفضل نموذج صغير/للأجهزة الطرفية: Gemma 4 E2B -- MMLU Pro 60%، سياق 128K، ~2 GB RAM، ترخيص Apache 2.0. يحل محل Gemma 2 2B القديم.
  • أفضل نموذج صغير للبرمجة: Qwen2.5 3B -- 65% HumanEval بـ ~2 GB من RAM.
  • أفضل نموذج 3B للاستخدام العام: Llama 3.2 3B -- أكبر دعم مجتمعي، سياق 128K، 2.5 GB من RAM.
  • لا ينتج أي نموذج أقل من 2B جودة مخرجات مناسبة للمهام الاحترافية. استخدم 3B أو أكبر للعمل الحقيقي.

تعمل نماذج LLM المحلية الصغيرة (1B-4B معلمة) على أجهزة بذاكرة 4-8 GB بسرعة 30-70 token/ثانية، مع تصدّر Phi-4 Mini 3.8B للاستدلال، وGemma 4 E2B الأفضل للأجهزة الصغيرة/الطرفية بسياق 128K، وQwen2.5 3B الأفضل للبرمجة، وLlama 3.2 3B الأفضل للاستخدام العام.

إذا كان حاسوبك المحمول يمتلك فقط 4-8 GB من الذاكرة، لا يزال بإمكانك تشغيل نماذج الذكاء الاصطناعي -- لكن الأصغر منها فقط. هذه النماذج دون 4B سريعة بما يكفي للدردشة الفورية وتتعامل جيداً مع المهام البسيطة مثل التلخيص، والأسئلة والأجوبة الأساسية، وترجمة النصوص القصيرة، لكنها تواجه صعوبة في الاستدلال متعدد الخطوات أو كتابة مستندات طويلة ومتماسكة. مع ذلك، فهي مناسبة تماماً لمعظم المهام على الأجهزة منخفضة المواصفات.

ما هو نموذج LLM المحلي "الصغير" ومتى يجب أن تستخدم واحدًا؟

يُعرّف نموذج LLM المحلي الصغير عادةً بأنه نموذج بأقل من 4 مليارات معامل. بتكميم Q4_K_M، تتطلب هذه النماذج 1.5-3 GB من RAM -- ضمن قيود الحواسيب المحمولة الأساسية بذاكرة إجمالية 4-8 GB تمامًا.

النماذج الصغيرة مناسبة لـ: التلخيص السريع، والأسئلة والأجوبة البسيطة، وشرح مقتطفات الشيفرة، وترجمة النصوص القصيرة، ومهام التصنيف. ليست مناسبة للاستدلال متعدد الخطوات، وتوليد الشيفرة المعقد، ولا كتابة مستندات طويلة ومتماسكة.

فجوة الجودة بين نموذج 3B ونموذج 7B كبيرة -- تعادل تقريبًا الفجوة بين GPT-4o mini وGPT-5.5. للمستخدمين بذاكرة 8 GB، يكاد يكون نموذج 7B بـ Q4_K_M الخيار الأفضل دائمًا إذا توفّر للجهاز هامش. راجع أفضل نماذج LLM المحلية للمبتدئين للتوصيات بشأن 7B.

أي نموذج يجب أن تستخدم؟ دليل قرار سريع

شجرة القرار: اختر حسب الأولوية (الاستدلال، أو السرعة، أو البرمجة). افتراضيًا، Llama 3.2 3B إذا لم تكن متأكدًا.
شجرة القرار: اختر حسب الأولوية (الاستدلال، أو السرعة، أو البرمجة). افتراضيًا، Llama 3.2 3B إذا لم تكن متأكدًا.

Phi-4 Mini 3.8B -- أفضل أداء استدلال في فئة أقل من 4B

يحقق Microsoft Phi-4 Mini 68% في MMLU و70% في HumanEval -- درجات تتفوق على كثير من نماذج 7B الصادرة قبل 2025. هذا ممكن لأن Phi-4 Mini دُرّب على مجموعة بيانات اصطناعية منسّقة، تركز على الاستدلال وحل المشكلات، بدلًا من نص ويب عام.

Phi-4 Mini هو الخيار الموصى به للمستخدمين الذين يحتاجون أساسًا إلى الاستدلال (الرياضيات، والمنطق، والشروحات خطوة بخطوة) أو المساعدة في البرمجة على عتاد بذاكرة 4-6 GB.

المواصفة
القيمة
MMLU68%
HumanEval70%
RAM (Q4_K_M)~2.5 GB
السياق128K token
السرعة على CPU30-50 tok/ثانية
أمر Ollamaollama run phi4-mini

Gemma 4 E2B -- أفضل نموذج صغير/للأجهزة الطرفية

Google Gemma 4 E2B هو الجيل الحالي من النماذج الصغيرة، ويحل محل Gemma 2 2B القديم. يحقق 60% في MMLU Pro (معيار أصعب من MMLU الأصلي)، و44% في LiveCodeBench v6، و43.4% في GPQA Diamond، وفقاً لبطاقة نموذج Google الرسمية. يمتلك 2.3B من المعاملات الفعالة (5.1B شاملةً التضمينات) ويناسب ~2 GB من RAM.

نافذة السياق البالغة 128K تحسّن كبير مقارنة بـ8K في Gemma 2 2B القديم -- الآن تضاهي Phi-4 Mini وLlama 3.2 3B. تختلف سرعة CPU حسب العتاد والتكميم (تقرّر Google نحو 7.6 tok/ثانية على Raspberry Pi 5؛ تقارير مستقلة على معالجات x86 تتراوح بين 8 و48 tok/ثانية) -- تحقق من الأرقام الحالية لجهازك. ترخيص Apache 2.0.

المواصفة
القيمة
MMLU Pro60%
LiveCodeBench v644%
GPQA Diamond43.4%
RAM (Q4_K_M)~2 GB
السياق128K token
أمر Ollamaollama pull gemma4:e2b

Qwen2.5 3B -- أفضل نموذج صغير لمهام البرمجة

يحصل Qwen2.5 3B على 65% في HumanEval -- بفارق 5 نقاط مئوية فوق Llama 3.2 3B -- مما يجعله الخيار الأفضل لمهام البرمجة على نطاق 3B. يتضمن وضع JSON ودعم استدعاء الدوال، ويتعامل أصليًا مع 29 لغة.

للمهام غير البرمجية بالإنجليزية، ينتج Llama 3.2 3B وPhi-4 Mini نثرًا أكثر طبيعية. اختر Qwen2.5 3B تحديدًا عندما تكون البرمجة أو المخرجات متعددة اللغات حالة الاستخدام الأساسية.

المواصفة
القيمة
MMLU62%
HumanEval65%
RAM (Q4_K_M)~2 GB
السياق128K token
السرعة على CPU25-40 tok/ثانية
أمر Ollamaollama run qwen2.5:3b

Llama 3.2 3B -- أفضل نموذج صغير للاستخدام العام

يُعد Meta Llama 3.2 3B أكثر نماذج 3B توثيقًا ودعمًا مجتمعيًا. يحصل على 58% في MMLU و60% في HumanEval -- أقل قليلًا من Phi-4 Mini في كليهما -- لكنه يملك أوسع دعم للأدوات، ومزيدًا من عمليات الضبط الدقيق المتاحة، وأكبر مجموعة من الأدلة المجتمعية.

نافذة السياق البالغة 128K هي نفسها في نماذج Llama 3.x الأكبر، مما يجعله مناسبًا لتلخيص المستندات متوسطة الطول. لأول نموذج صغير، يبقى Llama 3.2 3B الخيار الأكثر أمانًا بسبب سلوكه المتوقع وتوثيقه الواسع.

المواصفة
القيمة
MMLU58%
RAM (Q4_K_M)~2.5 GB
السياق128K token
السرعة على CPU25-45 tok/ثانية
أمر Ollamaollama run llama3.2:3b

Llama 3.2 1B -- الحد الأدنى المطلق لأي مخرجات مفيدة

Llama 3.2 1B هو أصغر نموذج Llama تصدره Meta، إذ يتطلب 1.3 GB فقط من RAM ويولّد 60-90 tok/ثانية على CPU -- أسرع نموذج قابل للتشغيل محليًا في هذه الصفحة. جودة المخرجات هامشية: يتعامل مع تصنيفات بسيطة جدًا واستخراج الكلمات المفتاحية، لكنه يواجه صعوبة مع الاستجابات المتماسكة متعددة الجمل. استخدم Llama 3.2 1B فقط عندما تكون RAM فعليًا هي القيد الأساسي (أقل من 3 GB متاحة) أو لاختبار تكاملات الأدوات.

مقارنة كاملة: أفضل نماذج LLM المحلية الصغيرة أقل من 4B معاملات

النموذج
MMLU
HumanEval
RAM
السياق
الأفضل لـ
Phi-4 Mini 3.8B68%70%2.5 GB128Kالاستدلال، البرمجة
Qwen2.5 3B62%65%2 GB128Kالبرمجة، متعدد اللغات
Llama 3.2 3B58%60%2.5 GB128Kاستخدام عام، أول نموذج
Gemma 4 E2B2 GB128Kالأجهزة الطرفية (MMLU Pro 60%)
Llama 3.2 1B32%28%1.3 GB128Kأدنى RAM مطلق
مستويات الأداء: يتصدّر Phi-4 Mini الاستدلال والبرمجة، ويتصدّر Gemma 4 E2B طول السياق (128K) بأصغر بصمة RAM، ويتفوق Qwen2.5 في البرمجة.
مستويات الأداء: يتصدّر Phi-4 Mini الاستدلال والبرمجة، ويتصدّر Gemma 4 E2B طول السياق (128K) بأصغر بصمة RAM، ويتفوق Qwen2.5 في البرمجة.

فهم التكميم: الموازنة بين RAM والجودة

موازنة التكميم: Q4_K_M (2.5 GB، -0.5% جودة) هو الافتراضي الموصى به. يستخدم Q8_0 3.8 GB دون مكسب في الجودة. Q3_K_M (1.8 GB، -1.8% فقدان) لقيود RAM القصوى.
موازنة التكميم: Q4_K_M (2.5 GB، -0.5% جودة) هو الافتراضي الموصى به. يستخدم Q8_0 3.8 GB دون مكسب في الجودة. Q3_K_M (1.8 GB، -1.8% فقدان) لقيود RAM القصوى.

نماذج LLM المحلية الصغيرة حسب المنطقة

الاتحاد الأوروبي / GDPR: للمهنيين في الاتحاد الأوروبي الذين يعملون بعتاد محدود -- العمل الميداني، والبيئات المعزولة، والحواسيب المحمولة المؤسسية الأقدم -- توفّر النماذج المحلية الصغيرة استدلالًا متوافقًا مع GDPR دون خروج البيانات. يحافظ Phi-4 Mini 3.8B يعمل على حاسوب محمول مؤسسي قياسي (8 GB من RAM) على كل النص المعالج داخل الجهاز بموجب المادة 5 من GDPR (تقليل البيانات). لتوثيق امتثال BSI الألماني: يوفّر Phi-4 Mini (Microsoft، ترخيص MIT) وLlama 3.2 3B (Meta، ترخيص مجتمع Llama) معرّفات نماذج مرقّمة عبر وسوم Ollama، بما يلبي متطلبات توثيق أدوات الذكاء الاصطناعي. لا تقدّم Mistral حاليًا نموذجًا أقل من 4B. لمؤسسات الاتحاد الأوروبي التي تفضّل نموذجًا أوروبي المنشأ في فئة الحجم هذه، الخيارات محدودة حتى تطلق Mistral نسخة أقل من 4B.

منطقة الخليج / السعودية (PDPL): للجهات في السعودية والإمارات العاملة بموجب نظام حماية البيانات الشخصية (PDPL) وأطر السيادة على الذكاء الاصطناعي، توفّر النماذج المحلية الصغيرة معالجة على الجهاز دون إرسال البيانات إلى خوادم سحابية خارجية. للمهام العربية على نطاق النموذج الصغير، يدعم Qwen2.5 3B العربية أصليًا. للجهات التي تفضّل نموذجًا عربي المنشأ، يُعد Jais (G42) وALLaM وFalcon (TII، الإمارات) خيارات سيادية، وإن كانت غالبًا أكبر من فئة أقل من 4B. لمعالجة العربية على عتاد محدود: `ollama run qwen2.5:3b` يعمل على أي جهاز Linux بذاكرة 4 GB ويعالج كل النص على الجهاز دون استدعاءات API خارجية.

الصين: Qwen2.5 3B (Alibaba، Apache 2.0) هو الخيار الطبيعي لنشر النماذج الصغيرة بالصينية. تعالج التجزئة الأصلية للصينية النص بالماندرين بكفاءة أعلى بنسبة 30-40% من Llama بعدد المعاملات نفسه. لعمليات نشر إنترنت الأشياء والحافة بموجب قانون أمن البيانات الصيني (数据安全法): `ollama run qwen2.5:3b` يعمل على أي جهاز Linux بذاكرة 4 GB ويعالج كل النص على الجهاز دون استدعاءات API خارجية.

ما هي الأخطاء الشائعة عند تشغيل نماذج LLM المحلية الصغيرة؟

  • استخدام تكميم Q8_0 بدلًا من Q4_K_M: يتطلب Q8_0 ضعف RAM تقريبًا مقارنة بـ Q4_K_M مع تحسّن جودة ضئيل على النطاق الصغير. نموذج Llama 3.2 3B بـ Q8_0 يحتاج ~3.8 GB من RAM مقابل ~2.5 GB بـ Q4_K_M. على جهاز بذاكرة 4 GB، قد يُفعّل Q8_0 استخدام swap ويجعل الاستدلال أبطأ بـ 3-5 مرات. استخدم دائمًا Q4_K_M كقيمة افتراضية للنماذج أقل من 4B.
  • تشغيل نموذج أساسي بدلًا من نسخة instruct: النماذج الأساسية (مثل `llama3.2:3b-text`) هي نقاط تحقق قبل الضبط الدقيق، مدرّبة للتنبؤ بالـ token التالي في النص. لا تتبع التعليمات. عندما تسأل نموذجًا أساسيًا "كم 2+2؟"، قد يكمل الجملة كاختبار بدلًا من الإجابة بـ "4". استخدم دائمًا نسخة instruct: `llama3.2:3b` (يستخدم Ollama instruct افتراضيًا للنماذج المسمّاة).
  • توقّع جودة نموذج 7B من نموذج 3B: نموذج 3B بنسبة 68% في MMLU (Phi-4 Mini) يؤدي بشكل مماثل لـ GPT-4o mini لعام 2023 في المهام العامة. سلاسل الاستدلال المعقدة والكتابة المطوّلة وتوليد الشيفرة الدقيق ستنتج جودة أدنى بوضوح من نموذج 7B. إذا كانت جودة المخرجات غير كافية، فرقِّ إلى نموذج 7B -- فرق RAM ~2 GB (2.5 GB ← 4.5 GB).

أسئلة شائعة حول نماذج LLM المحلية الصغيرة

ما أصغر نموذج LLM محلي ينتج نتائج مفيدة؟

الحد الأدنى العملي لنتائج مفيدة هو نموذج 3B بتكميم Q4_K_M. النماذج أقل من 2B معاملات (Llama 3.2 1B، Gemma 4 E2B) تنتج جملًا متماسكة لكنها تواجه صعوبة مع التعليمات متعددة الخطوات، والاستجابات الأطول، والاستدلال المعقد. لمهام مثل التلخيص والأسئلة والأجوبة البسيطة، Gemma 4 E2B قابل للاستخدام. لأي شيء أكثر تعقيدًا، ابدأ بنموذج 3B.

هل يمكن لنموذج 3B العمل على هاتف؟

نعم -- صُمم Llama 3.2 1B و3B تحديدًا للنشر المحمول على الجهاز. توفّر Meta بناءات محسّنة لـ iOS (عبر MLC LLM) وAndroid. ينتج الاستدلال على هاتف حديث (Snapdragon 8 Gen 3 أو Apple A17 Pro) 15-30 tok/ثانية لنماذج 1B. لا يعمل LM Studio وOllama حاليًا على iOS أو Android -- يتطلب المحمول أطر عمل منفصلة.

هل النماذج الصغيرة جيدة للتلخيص؟

نعم -- التلخيص أحد أقوى حالات استخدام النماذج الصغيرة. ينتج Gemma 4 E2B وLlama 3.2 3B ملخصات دقيقة لنصوص تصل إلى ~4000 كلمة (حد سياقها العملي لمخرجات جيدة) بشكل موثوق. للمستندات الأطول، استخدم نموذجًا بنافذة سياق كبيرة مثل Phi-4 Mini أو Llama 3.2 3B (كلاهما بـ 128K token).

كم أسرع نموذج 2B من نموذج 7B على العتاد نفسه؟

يعتمد ذلك بشدة على العتاد والتكميم -- تقرّر Google نحو 7.6 tok/ثانية (فك الترميز) لـ Gemma 4 E2B على Raspberry Pi 5، بينما تتراوح اختبارات مستقلة على معالجات x86 بين 8 و48 tok/ثانية. على GPU، يتقلّص فارق السرعة لأن أداء GPU أقل تقييدًا بحجم النموذج. فرق السرعة أكثر وضوحًا على الأجهزة التي تعتمد CPU فقط.

هل تدعم النماذج الصغيرة استدعاء الدوال؟

بعضها نعم. يدعم Qwen2.5 3B استدعاء الدوال ووضع JSON. يملك Llama 3.2 3B دعمًا أساسيًا لاستخدام الأدوات. لا يدعم Gemma 4 E2B استدعاء الدوال. راجع وثائق النموذج قبل بناء مسار يعتمد على مخرجات منظّمة.

أي نموذج صغير أفضل للغات غير الإنجليزية؟

يدعم Qwen2.5 3B 29 لغة بشكل أصلي، بما في ذلك الصينية واليابانية والكورية والعربية. Gemma 4 E2B وPhi-4 Mini محسّنان أساسًا للإنجليزية. لمهام اللغات الأخرى على نطاق النموذج الصغير، Qwen2.5 3B هو الخيار الواضح. راجع مقارنة Qwen vs Llama vs Mistral متعددة اللغات لمقارنة كاملة للغات.

ما الفرق بين Phi-4 Mini وLlama 3.2 3B للمهام اليومية؟

يتفوق Phi-4 Mini على Llama 3.2 3B في الاستدلال والرياضيات والبرمجة (68% مقابل 58% في MMLU، 70% مقابل 60% في HumanEval) بذاكرة RAM متطابقة تقريبًا (2.5 GB لكل منهما). للمهام اليومية -- الأسئلة والأجوبة، والتلخيص، والشروحات البسيطة -- فجوة الجودة ملحوظة لكنها غير جذرية. يملك Llama 3.2 3B دعمًا مجتمعيًا أكبر ومزيدًا من عمليات الضبط الدقيق المتاحة. اختر Phi-4 Mini للاستدلال المنظّم؛ وLlama 3.2 3B للدردشة العامة والتوافق الأكبر.

هل يمكنني تشغيل نموذجين صغيرين في الوقت نفسه؟

نعم، إذا سمحت RAM الإجمالية. نموذجان 3B بـ Q4_K_M يستخدمان ~5 GB مجتمعين -- ممكن على جهاز بذاكرة 8 GB بنظام تشغيل خفيف. يحمّل Ollama نموذجًا واحدًا في كل مرة لكل عملية افتراضيًا. شغّل نسختين من Ollama على منفذين مختلفين (OLLAMA_HOST=:11434 وOLLAMA_HOST=:11435) لتقديم نموذجين بالتوازي. هذا مفيد لاختبار A/B للمخرجات.

هل تصلح النماذج الصغيرة لـ RAG (التوليد المعزّز بالاسترجاع)؟

نعم لـ RAG البسيط. يستطيع Llama 3.2 3B وPhi-4 Mini الإجابة عن أسئلة حول مقاطع مستندات مُسترجعة بشكل موثوق. لـ RAG على قواعد معرفة كبيرة تتطلب استدلالًا متعدد القفزات، تؤدي نماذج 7B أو أكبر بثبات أعلى. تستخدم ميزة LocalDocs في GPT4All نموذج 3B للأسئلة والأجوبة عن المستندات وتعمل جيدًا لمجموعات المستندات الشخصية.

هل Phi-4 Mini أفضل من Llama 3.2 3B للبرمجة؟

نعم. يحصل Phi-4 Mini على 70% في HumanEval مقابل 60% لـ Llama 3.2 3B -- فجوة كبيرة قدرها 10 نقاط على هذا النطاق. للمساعدة في البرمجة على أجهزة بذاكرة 4-6 GB، Phi-4 Mini هو الخيار الموصى به. للبرمجة بلغات متعددة (غير Python)، Qwen2.5 3B بنسبة 65% في HumanEval منافس لـ Phi-4 Mini ويدعم أيضًا استدعاء الدوال.

استخدام تكميم Q8_0 بدلًا من Q4_K_M

يتطلب Q8_0 ضعف RAM تقريبًا مقارنة بـ Q4_K_M مع تحسّن جودة ضئيل على النطاق الصغير. نموذج Llama 3.2 3B بـ Q8_0 يحتاج ~3.8 GB من RAM مقابل ~2.5 GB بـ Q4_K_M. على جهاز بذاكرة 4 GB، قد يُفعّل Q8_0 استخدام swap ويجعل الاستدلال أبطأ بـ 3-5 مرات. استخدم دائمًا Q4_K_M كقيمة افتراضية للنماذج أقل من 4B.

تشغيل نموذج أساسي بدلًا من نسخة instruct

النماذج الأساسية (مثل llama3.2:3b-text) هي نقاط تحقق قبل الضبط الدقيق، مدرّبة للتنبؤ بالـ token التالي في النص. لا تتبع التعليمات. عندما تسأل نموذجًا أساسيًا "كم 2+2؟"، قد يكمل الجملة كاختبار بدلًا من الإجابة بـ "4". استخدم دائمًا نسخة instruct: llama3.2:3b (يستخدم Ollama instruct افتراضيًا للنماذج المسمّاة).

توقّع جودة نموذج 7B من نموذج 3B

نموذج 3B بنسبة 68% في MMLU (Phi-4 Mini) يؤدي بشكل مماثل لـ GPT-4o mini لعام 2023 في المهام العامة. سلاسل الاستدلال المعقدة والكتابة المطوّلة وتوليد الشيفرة الدقيق ستنتج جودة أدنى بوضوح من نموذج 7B. إذا كانت جودة المخرجات غير كافية، فرقِّ إلى نموذج 7B -- فرق RAM ~2 GB (2.5 GB ← 4.5 GB).

ما أصغر نموذج LLM محلي قابل للاستخدام فعليًا؟

الحد الأدنى لإنتاج نص متماسك هو نحو 1B من المعاملات، وLlama 3.2 1B هو أصغر نموذج في هذه القائمة يستحق التشغيل لعمل حقيقي. أما النماذج الأصغر من ذلك فتُحمَّل وتولّد نصًا على أي عتاد تقريبًا، لكن النص يفقد تماسكه بعد بضع جمل، لذا يُفضَّل التعامل معها كإكمال تلقائي لا كمساعد. إذا كان القيد هو مساحة التخزين وRAM لا الجودة، فأصغر نموذج LLM محلي قابل للاستخدام بحجم صغير هو نموذج أقل من 2B بتكميم Q4؛ وإذا توفّر لديك 4GB أو أكثر، فإن نموذج 4B يمثل قفزة كبيرة في التماسك مقابل زيادة طفيفة جدًا في RAM.

ما أصغر نموذج LLM يمكنك تشغيله محليًا؟

Llama 3.2 1B هو أصغر نموذج Llama والخيار الأكثر عملية في هذه المقارنة -- يحتاج فقط إلى 1.3 GB من RAM ويعمل بسرعة 60-90 tok/ثانية على CPU، وهو أسرع نموذج في هذه الصفحة. يتعامل مع مهام تصنيف قصيرة واستخراج كلمات مفتاحية، لكنه يتعثر مع مخرجات أطول ومتعددة الخطوات. إذا كنت تريد نموذجًا صغيرًا (يُعرف أحيانًا بـ mini LLM) قابلًا للاستخدام فعليًا يوميًا، فاعتبر Llama 3.2 1B الحد الأدنى للعتاد لا للجودة -- انتقل إلى Gemma 4 E2B أو نموذج 3B مثل Qwen2.5 3B أو Llama 3.2 3B للعمل الحقيقي.

المصادر

  • Hugging Face Open LLM Leaderboard -- open-llm-leaderboard.hf.space (درجات MMLU وHumanEval)
  • Microsoft Phi-4 Technical Report -- microsoft.com/en-us/research/publication/phi-4-technical-report/
  • Meta Llama 3.2 Model Card -- huggingface.co/meta-llama/Llama-3.2-3B-Instruct
  • Google Gemma 4 Model Card -- huggingface.co/google/gemma-4-e2b-it

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs