Key Takeaways
- أفضل نموذج للمبتدئين عموماً: Llama 3.2 3B -- تنزيل 2 GB، يعمل بذاكرة 4 GB من RAM، اتباع ممتاز للتعليمات بالنسبة لحجمه.
- الأفضل للذاكرة المنخفضة (4 GB أو أقل): Phi-4 Mini 3.8B -- يتفوق النموذج المدمج من Microsoft في الاستدلال والبرمجة (68% MMLU، 70% HumanEval بذاكرة 2.5 GB فقط من RAM).
- أسرع نموذج 2B: Gemma 3 2B -- يحقق النموذج المحدّث من Google سرعة 40-60 tok/s على CPU بسياق 128K (موسّع من 8K في Gemma 2).
- أفضل نموذج 7B/8B متعدد الاستخدامات: Llama 3.3 8B -- 72% HumanEval، ~5.5 GB من RAM، النموذج المرجعي الحالي بهذا الحجم (يحل محل توصية Mistral Small v0.3 التي أصبحت قديمة من 2023-2024).
- الأفضل لتعدد اللغات والبرمجة: Qwen3 8B -- 57.3% HumanEval، أداء MMLU مساوٍ لـ Llama 3.1 8B أو أفضل منه، ودعم أصلي لأكثر من 29 لغة.
- قاعدة عامة لـ 7B بتكميم Q4: يحتاج نموذج بحجم 8B بصيغة Q4_K_M إلى نحو 5-5.5 GB من RAM -- أي ما يقارب 0.6-0.7 GB لكل مليار معامل بتكميم 4 بت.
- الأفضل بذاكرة 2 GB من RAM أو أقل: Llama 3.2 1B -- تنزيل ~1.3 GB، أصغر خيار قابل للاستخدام؛ الجودة أقل بشكل ملحوظ من نماذج 3B فما فوق لكنه يعمل على عتاد قديم جداً.
- 👉 لا تعرف إن كان التشغيل المحلي مناسباً لك؟ اقرأ مقارنة LLM المحلي مقابل السحابة قبل أن تقرر -- تغطي فروق السرعة والجودة والتكلفة.
أفضل نماذج LLM المحلية للمبتدئين في 2026 هي Llama 3.2 3B (4 جيجابايت رام، الأفضل شمولاً)، وPhi-4 Mini 3.8B (2.5 جيجابايت رام، أفضل استدلال مع رام قليل)، وGemma 3 2B (الأسرع بـ 40–60 رمزاً/ثانية على CPU) — جميعها تُثبَّت بأمر Ollama واحد، دون GPU.
تعمل هذه النماذج كلياً على جهاز الكمبيوتر المحمول أو المكتبي باستخدام الذاكرة العشوائية العادية — دون اشتراك سحابي أو GPU. "1B" أو "7B" تعني مليارات المعاملات (حجم النموذج). أصغر = أسرع ويستخدم ذاكرة أقل. أكبر = أذكى لكن يحتاج ذاكرة أكثر. ابدأ بـ Llama 3.2 3B: تنزيل 2 جيجابايت، يعمل بذاكرة 4 جيجابايت.
البدء السريع: شغّل أول نموذج LLM محلي لديك في 3 دقائق
1. ثبّت Ollama (دقيقة واحدة)
نزّله من ollama.com وشغّل المثبّت. دون أي إعداد.
2. شغّل Llama 3.2 3B (دقيقتان)
افتح الطرفية وشغّل: `ollama run llama3.2:3b`
ينزّل Ollama النموذج (~2 GB) في المرة الأولى. هذا هو النموذج الموصى به كنموذج أول لمعظم المستخدمين.
3. ابدأ المحادثة (فوراً)
بمجرد تحميل النموذج، اكتب سؤالك أو موجّهك واضغط Enter. سترى استجابات بسرعة 25-45 رمزاً/ثانية على لابتوب نموذجي.
هذا كل شيء. دون إعداد يدوي، دون حاجة إلى GPU. إذا كان لديك 8 GB+ من RAM، فأنت جاهز. إذا كان لديك 4-6 GB، استخدم `ollama run gemma3:2b` بدلاً من ذلك (أسرع، يستخدم 1.7 GB من RAM).
قائمة تحقق للمبتدئين: هل التشغيل المحلي مناسب لك؟
قبل تنزيل أول نموذج لك، أجب عن هذه الأسئلة الثلاثة:
1. هل لديك 8 GB أو أكثر من RAM؟ (إن لم يكن، فإن واجهات السحابة أسرع للبدء.)
2. هل تحتاج إلى أن تبقى بياناتك خاصة؟ (إن لم يكن، فإن واجهات السحابة توفر جودة أفضل.)
3. هل يمكنك تحمّل 20-40 دقيقة من الإعداد؟ (إن لم يكن، فإن واجهات السحابة جاهزة خلال 5 دقائق.)
إذا أجبت بـ "لا" على سؤالين أو أكثر، **اقرأ المقارنة الكاملة بين المحلي والسحابة** لمعرفة إن كانت واجهة سحابية تناسب عتادك وجدولك الزمني بشكل أفضل. يفترض المبتدئون غالباً أن نماذج LLM المحلية أفضل دائماً -- وهذا ليس صحيحاً. يعتمد الخيار الصحيح على قيودك المحددة.
كيف تختار نموذج LLM محلياً للمبتدئين؟
يعتمد اختيار النماذج لنماذج LLM المحلية على ثلاثة قيود: RAM المتاحة، وسرعة الاستدلال، ونوع المهمة -- بهذا الترتيب من الأولوية.
عدد المعاملات (3B، 7B، 13B) هو المحدّد الأساسي لمتطلبات RAM. مع التكميم بـ 4 بت -- المعيار لمعظم أدوات الاستدلال المحلي -- اضرب عدد المعاملات في ~0.5 لتقدير عدد GB من RAM المطلوبة. يتطلب نموذج 7B بصيغة Q4_K_M نحو 4.5 GB من RAM.
لمعظم المبتدئين، توفر نماذج 7B بتكميم Q4_K_M أفضل توازن بين الجودة والسرعة واستخدام RAM على الأجهزة ذات 8 GB أو أكثر. على الأجهزة ذات 4-6 GB من RAM، تمثّل نماذج 3B السقف العملي.

#1 Meta Llama 3.2 3B -- أفضل نموذج للمبتدئين عموماً
Meta Llama 3.2 3B هو أفضل نقطة انطلاق لمعظم المستخدمين. يُنزَّل في أقل من 5 دقائق، ويعمل على أي جهاز بذاكرة 4 GB من RAM، وينتج اتباعاً للتعليمات أفضل بشكل ملحوظ من نماذج 3B السابقة. يستخدم نافذة سياق 128K -- أكبر بكثير من النماذج بأحجام مماثلة.
في اختباراتنا على CPU لابتوب بـ 8 أنوية، يولّد Llama 3.2 3B سرعة 25-45 رمزاً/ثانية. على Apple M3 Pro يصل إلى 70-90 رمزاً/ثانية. الجودة مناسبة للتلخيص والأسئلة والأجوبة ومهام البرمجة البسيطة، لكنها تتأخر عن نماذج 7B في الاستدلال متعدد الخطوات.
| المواصفة | القيمة |
|---|---|
| المعاملات | 3B |
| RAM المطلوبة | ~2.5 GB (Q4_K_M) |
| حجم التنزيل | ~2 GB |
| نافذة السياق | 128K رمز |
| سرعة CPU (لابتوب بـ 8 أنوية) | 25-45 tok/s |
| أمر Ollama | ollama run llama3.2:3b |
#2 Microsoft Phi-4 Mini 3.8B -- الأفضل للذاكرة المنخفضة
Phi-4 Mini هو النموذج المدمج من Microsoft المُحسَّن لمهام الاستدلال والبرمجة على نطاق صغير. يحقق 68% MMLU و70% HumanEval -- نتائج تتفوق على كثير من نماذج 7B لعام 2024 -- بفضل التدريب على بيانات اصطناعية عالية الجودة تركز على حل المشكلات.
هو النموذج الموصى به للأجهزة ذات 4-6 GB من RAM حيث تكون الجودة مهمة. يستخدم Phi-4 Mini ذاكرة 2.5 GB من RAM (مقابل 3 GB في Phi-3.5 Mini)، مما يجعله أكثر إتاحة على الأجهزة ذات 4 GB.
| المواصفة | القيمة |
|---|---|
| المعاملات | 3.8B |
| RAM المطلوبة | ~2.5 GB (Q4_K_M) |
| حجم التنزيل | ~2.3 GB |
| نتيجة MMLU | 68% |
| نافذة السياق | 128K رمز |
| سرعة CPU (لابتوب بـ 8 أنوية) | 30-50 tok/s |
| أمر Ollama | ollama run phi4-mini |
#3 Google Gemma 3 2B -- أسرع نموذج 2B
Gemma 3 2B هو نموذج 2B المحدّث من Google والخيار الأسرع للاستدلال على CPU فقط. يولّد سرعة 40-60 رمزاً/ثانية على CPU لابتوب متوسط الفئة -- أي ضعف سرعة Llama 3.2 3B تقريباً على نفس العتاد. يحسّن Gemma 3 سلفه بشكل كبير: تتوسع نافذة السياق من 8K (Gemma 2) إلى 128K رمز، مما يزيل قيداً مهماً لمهام المستندات.
Gemma 3 2B خيار جيد عندما تكون سرعة الاستجابة هي الأهم، على الأجهزة ذات ≤4 GB من RAM، أو كنموذج اختبار للتحقق من إعداد LLM المحلي لديك قبل تنزيل نماذج أكبر.
| المواصفة | القيمة |
|---|---|
| المعاملات | 2B |
| RAM المطلوبة | ~1.7 GB (Q4_K_M) |
| حجم التنزيل | ~1.6 GB |
| نافذة السياق | 128K رمز |
| سرعة CPU (لابتوب بـ 8 أنوية) | 40-60 tok/s |
| أمر Ollama | ollama run gemma3:2b |
#4 Meta Llama 3.3 8B -- أفضل نموذج 7B/8B متعدد الاستخدامات
Meta Llama 3.3 8B هو النموذج المرجعي الحالي متعدد الاستخدامات بهذا الحجم، إذ يحقق 72% في HumanEval ويوفر استدلالاً إنجليزياً قوياً. يحل محل Mistral Small v0.3 كخيار 7B/8B في هذه القائمة -- كان Mistral Small v0.3 معيار المجتمع في 2023-2024، لكنه أصبح متأخراً الآن ضمن نفس مستوى RAM، ومن الأفضل التعامل معه كخيار قديم (راجع الأخطاء الشائعة أدناه لمعرفة سبب عدم توصيتنا به كخيار افتراضي بعد الآن).
للأجهزة ذات 8 GB من RAM، يمثّل Llama 3.3 8B قفزة طبيعية من نماذج 3B. يتعامل مع نصوص أطول وتعليمات أكثر تعقيداً ومحادثات متعددة الأدوار بموثوقية أكبر من أي نموذج 3B، بنافذة سياق 128K.
| المواصفة | القيمة |
|---|---|
| المعاملات | 8B |
| RAM المطلوبة | ~5.5 GB (Q4_K_M) |
| حجم التنزيل | ~5 GB |
| نافذة السياق | 128K رمز |
| نتيجة HumanEval | 72% |
| سرعة CPU (لابتوب بـ 8 أنوية) | 10-18 tok/s |
| أمر Ollama | ollama run llama3.3:8b-instruct |
#5 Qwen3 8B -- الأفضل لتعدد اللغات والبرمجة
يحقق Qwen3 8B (8.2 مليار معامل) 57.3% في HumanEval، ويساوي أو يتفوق على Llama 3.1 8B في MMLU، ويدعم بشكل أصلي أكثر من 29 لغة تشمل الصينية واليابانية والكورية والعربية وجميع اللغات الأوروبية الرئيسية. هو الخيار الموصى به لسير العمل بلغات غير الإنجليزية أو حالات الاستخدام كثيفة البرمجة، ويحل محل Qwen2.5 7B السابق كخيار تعدد اللغات في هذه القائمة.
يستخدم Qwen3 8B نافذة سياق 32K (قابلة للتوسيع إلى 131K عبر YaRN) ويدعم المخرجات المنظمة بوضع JSON، إضافة إلى "وضع تفكير" اختياري للمهام الاستدلالية الأصعب (أبطأ لكن أدق). النموذج متوفر بصيغتي instruct وbase -- للاستخدام في المحادثة، استخدم دائماً نسخة instruct. راجع مقارنة اختبارات Qwen مقابل Llama مقابل Mistral للحصول على بيانات اختبار تفصيلية.
| المواصفة | القيمة |
|---|---|
| المعاملات | 8.2B |
| RAM المطلوبة | ~5.2 GB (Q4_K_M) |
| حجم التنزيل | ~5.2 GB |
| نافذة السياق | 32K رمز (131K مع YaRN) |
| نتيجة HumanEval | 57.3% |
| سرعة CPU (لابتوب بـ 8 أنوية) | 10-18 tok/s (وضع غير التفكير) |
| أمر Ollama | ollama run qwen3:8b |
أي نموذج يفوز في RAM والسرعة ونافذة السياق؟
| النموذج | RAM | السرعة (CPU) | السياق | الأفضل لـ |
|---|---|---|---|---|
| Llama 3.2 3B | 2.5 GB | 25-45 tok/s | 128K | الاستخدام العام، النموذج الأول |
| Phi-4 Mini 3.8B | 2.5 GB | 30-50 tok/s | 128K | الاستدلال، البرمجة، الذاكرة المنخفضة |
| Gemma 3 2B | 1.7 GB | 40-60 tok/s | 128K | السرعة، الذاكرة المنخفضة جداً |
| Llama 3.3 8B | 5.5 GB | 10-18 tok/s | 128K | الاستخدام العام، 72% HumanEval |
| Qwen3 8B | 5.2 GB | 10-18 tok/s | 32K (131K مع YaRN) | تعدد اللغات، البرمجة |

بأي نموذج يجب أن تبدأ؟
- 2 GB من RAM (حد أدنى متطرف): `ollama run llama3.2:1b` -- أصغر خيار قابل للاستخدام، تنزيل ~1.3 GB. الجودة أقل بشكل ملحوظ من نماذج 3B فما فوق لكنه يعمل على عتاد قديم جداً أو محدود.
- 4 GB من RAM أو أقل: `ollama run gemma3:2b` -- أسرع تنزيل، أقل استخدام للذاكرة، سياق 128K. جودة مقبولة للمهام الأساسية.
- 8 GB من RAM، النموذج الأول: `ollama run llama3.2:3b` -- أفضل توازن بين الجودة وRAM لتجربة أولى.
- 4-6 GB من RAM، استدلال/برمجة: `ollama run phi4-mini` -- 68% MMLU، 70% HumanEval بذاكرة 2.5 GB فقط من RAM. أفضل من Llama 3.2 3B في المهام المنظمة.
- 8 GB من RAM، استخدام جدي: `ollama run llama3.3:8b-instruct` أو `ollama run qwen3:8b` -- خطوة إلى الأمام للمستندات الطويلة والتعليمات المعقدة.
- مهام البرمجة أساساً: `ollama run qwen3:8b` -- أفضل نتيجة HumanEval في هذه القائمة؛ ممتاز في Python وJavaScript وSQL.
- لغة غير الإنجليزية: `ollama run qwen3:8b` -- دعم أصلي لأكثر من 29 لغة، دون عبء ترجمة.
أي نموذج تختار حسب منطقتك؟
الاتحاد الأوروبي / GDPR: للمؤسسات الأوروبية التي تعالج بيانات شخصية محلياً، يهم مصدر النموذج لتوثيق الامتثال. تتطلب إرشادات BSI الألمانية توثيق مصدر النموذج ونوع الرخصة لأنظمة الذكاء الاصطناعي المستخدمة في سياقات مهنية. Llama (Meta/الولايات المتحدة) وGemma (Google/الولايات المتحدة) وQwen (Alibaba/الصين) قابلة للاستخدام تقنياً بموجب GDPR للاستدلال المحلي -- وللحصول على أوضح سردية منشأ أوروبي، توفّر Mistral AI (فرنسا) نماذج برخصة Apache 2.0، رغم أن إصدارات Mistral Small الحالية (24B فما فوق) تتجاوز نطاق RAM الخاص بالمبتدئين في هذه الصفحة (4-8 GB)؛ راجع دليل العتاد لمعرفة فئة GPU اللازمة لتشغيلها.
اليابان (METI): لسير العمل باللغة اليابانية، Qwen3 8B هو النموذج الأول الصحيح -- ينتج الترميز الياباني الأصلي كفاءة رموز أفضل بنسبة 30-40% في النصوص اليابانية من Llama أو Mistral. شغّل: `ollama run qwen3:8b`. تتطلب إرشادات حوكمة الذكاء الاصطناعي من METI توثيق اسم النموذج وإصداره -- تملك النماذج الخمسة هنا وسوم Ollama مُصدَّرة تلبّي هذا المتطلب.
الصين: Qwen3 8B (Alibaba) هو النموذج الأول الطبيعي لسير العمل باللغة الصينية. يجعله الترميز الأصلي بالصينية ودعم أكثر من 29 لغة المعيار لسير العمل باللغة الماندرين. للنشر المؤسسي في الصين بموجب قانون أمن البيانات الصيني (数据安全法)، يلبّي تشغيل Qwen3 محلياً عبر Ollama متطلبات توطين البيانات.
كوريا: من بين الخيارات الخمسة للمبتدئين هنا، يتميّز Qwen3 8B بأقوى ترميز أصلي للغة الكورية. للنماذج المحلية المخصصة للغة الكورية بما يتجاوز مستوى المبتدئين هذا، راجع أفضل نماذج اللغة الكورية للاستخدام المحلي.
كيف تنزّل هذه النماذج وتشغّلها؟
تُثبَّت النماذج الخمسة بأمر Ollama واحد -- دون حاجة إلى إعداد يدوي. راجع كيفية تثبيت Ollama للإعداد، ثم شغّل أول نموذج LLM محلي لديك لخطوات التشغيل الأول. إذا كنت تشغّل على لابتوب بذاكرة RAM منخفضة، فإن كيفية تشغيل نماذج LLM محلية على لابتوب تغطي التكميم وضبط الأداء للعتاد المحدود.
بمجرد تشغيل نموذجك الأول، الخطوة التالية هي تعلّم كتابة الموجّهات بفعالية. ابدأ بـ أساسيات هندسة الموجّهات -- 16 دليلاً تغطي اللبنات الأساسية التي يحتاجها كل موجّه، من ضبط درجة الحرارة إلى تنسيق المخرجات.
ما الأخطاء التي يرتكبها المبتدئون عند اختيار LLM محلي؟
- اختيار حجم النموذج بناءً على عدد المعاملات وحده -- نموذج 7B بتكميم 4 بت قد يتفوق على نموذج 13B مُكمَّم بشكل سيئ.
- إغفال عبء تكميم VRAM -- قد يحتاج نموذج إلى 10-15% من VRAM أكثر من حجم الملف.
- استخدام تكميمات قديمة (Q3_K_S) بينما توفر الجديدة (Q4_K_M) جودة أفضل بنفس الحجم.
- اختيار Mistral Small v0.3 كنموذج 7B افتراضي: كان معيار المجتمع في 2023-2024 (7B، تنزيل ~4.1 GB، `ollama run mistral`) لكن يتفوق عليه الآن Qwen3 8B في البرمجة ويتفوق عليه Llama 3.3 8B في الاستدلال بالإنجليزية بنفس متطلب RAM. إذا كان دليل أو أداة يستخدم `ollama run mistral` افتراضياً، فبدّل إلى `ollama run qwen3:8b` أو `ollama run llama3.3:8b-instruct` لنتائج أفضل دون زيادة RAM. ملاحظة: هذا نموذج مختلف وغير مرتبط بسلسلة "Mistral Small 3.x" الحالية بحجم 24B فما فوق، والتي تحتاج إلى RAM أكبر بكثير من أي نموذج في هذه الصفحة.
- تنزيل نموذج دون التحقق من RAM المتاحة أولاً: إذا نزّلت نموذجاً يتجاوز RAM المتاحة، يلجأ Ollama إلى استدلال بطيء على CPU مع تبديل جزئي للقرص -- أحياناً أقل من 1 tok/s. شغّل دائماً `free -h` (Linux/macOS) أو تحقق من مدير المهام (Windows) قبل تنزيل نماذج أكبر من 7B.
الأسئلة الشائعة
ما أفضل نموذج LLM محلي للمبتدئين في 2026؟
Llama 3.2 3B لمعظم المستخدمين -- يعمل على أي جهاز بذاكرة 4 GB من RAM، ويُنزَّل في أقل من 5 دقائق، وينتج مخرجات باتباع جيد للتعليمات. بذاكرة 8 GB من RAM، يوفر Qwen3 8B أداءً أفضل في البرمجة وتعدد اللغات. لأقل RAM ممكنة، يعمل Gemma 3 2B بذاكرة 1.7 GB بسرعة 40-60 tok/s على CPU، أو Llama 3.2 1B بذاكرة 2 GB أو أقل.
ما الحد الأدنى من RAM لتشغيل LLM محلي؟
الحد الأدنى العملي لمخرجات مفيدة هو 4 GB من RAM مع نموذج 3B بتكميم Q4_K_M. بذاكرة 2 GB أو أقل، يُعد Llama 3.2 1B أصغر خيار قابل للاستخدام، رغم أن جودته تنخفض بشكل ملحوظ. بذاكرة 8 GB من RAM يمكنك الوصول إلى نماذج 7-8B التي تنتج نتائج أفضل بشكل ملحوظ في المهام المعقدة.
ما أفضل نموذج LLM محلي بمليار معامل واحد (1B)؟
Llama 3.2 1B هو النموذج الموصى به بحجم 1B -- تنزيل ~1.3 GB، يعمل بذاكرة 2 GB من RAM أو أقل عبر `ollama run llama3.2:1b`. يصلح للتلخيص الأساسي والأسئلة والأجوبة القصيرة، لكنه أضعف بشكل ملحوظ من نماذج 3B فما فوق في الاستدلال متعدد الخطوات. استخدمه فقط عندما لا يستطيع العتاد فعلياً دعم نموذج 3B.
هل Mistral Small 3.2 نموذج LLM محلي جيد للمبتدئين؟
لا -- Mistral Small 3.2 نموذج بحجم 24 مليار معامل يحتاج إلى نحو 14 GB أو أكثر من RAM/VRAM، وهو أعلى بكثير من نطاق 4-8 GB الخاص بالمبتدئين في هذه الصفحة. إنه نموذج مختلف وأكبر من "Mistral Small v0.3" بحجم 7B الذي كان يُوصى به هنا سابقاً. إذا كان لديك 8 GB من RAM، ابدأ بـ Llama 3.3 8B أو Qwen3 8B بدلاً من ذلك. راجع دليل العتاد لمعرفة فئة GPU بذاكرة 16GB+ اللازمة لتشغيل Mistral Small 3.2.
كيف أشغّل هذه النماذج عبر Ollama؟
ثبّت Ollama من ollama.com، ثم شغّل: `ollama run llama3.2:3b` للنموذج الموصى به للمبتدئين. ينزّل Ollama النموذج في التشغيل الأول. النماذج الخمسة المدرجة هنا موجودة في مكتبة Ollama.
هل Llama 3.2 3B جيد بما يكفي للمهام اليومية؟
نعم لـ: التلخيص والأسئلة والأجوبة البسيطة وشرح الكود الأساسي والمحادثة. لا لـ: الاستدلال متعدد الخطوات والبرمجة المعقدة والكتابة المنظمة الطويلة. لتلك المهام، رقِّ إلى Llama 3.3 8B أو Qwen3 8B بذاكرة 8 GB من RAM.
ما الفرق بين نماذج 3B و7B؟
ينتج نموذج 7B مخرجات أفضل بشكل ملحوظ في التعليمات المعقدة والاستدلال. يستخدم نموذج 3B نحو نصف RAM ويعمل أسرع بـ 2-3 مرات. يحدّد الخيار دائماً تقريباً RAM المتاحة -- استخدم 3B على الأجهزة ذات 4-6 GB، و7B على الأجهزة ذات 8 GB.
أي نموذج أفضل لمهام البرمجة؟
يتصدّر Qwen3 8B في HumanEval بين النماذج الخمسة. لبرمجة أفضل، استخدم النسخة المخصصة للبرمجة: `ollama run qwen2.5-coder:7b`. Phi-4 Mini 3.8B هو أفضل نموذج برمجة إذا كنت محدوداً بـ 4-6 GB من RAM (70% HumanEval بذاكرة 2.5 GB من RAM).
أي نموذج يجب أن أستخدم للغات غير الإنجليزية؟
يدعم Qwen3 8B أكثر من 29 لغة بشكل أصلي، تشمل الصينية واليابانية والكورية والعربية وجميع اللغات الأوروبية الرئيسية. يعالج النصوص بلغات غير الإنجليزية بكفاءة أكبر من Llama.
هل هذه النماذج آمنة للاستخدام مع بيانات خاصة؟
نعم -- تعمل النماذج الخمسة بالكامل على عتادك. لا يُرسَل أي نص موجّه أو سياق أو مخرجات إلى خوادم خارجية. الاستدلال المحلي أكثر خصوصية بطبيعته من واجهات السحابة للبيانات الحساسة.
كم يستغرق تنزيل هذه النماذج؟
باتصال 100 Mbps: Llama 3.2 1B (1.3 GB) ~دقيقتان. Gemma 3 2B (1.6 GB) ~دقيقتان. Llama 3.2 3B (2 GB) ~3 دقائق. Phi-4 Mini (2.3 GB) ~3 دقائق. Llama 3.3 8B (~5 GB) وQwen3 8B (~5.2 GB) ~6-7 دقائق لكل منهما. تُخزَّن النماذج مؤقتاً بعد التنزيل الأول -- تبدأ عمليات التشغيل اللاحقة خلال ثوانٍ.
هل يمكنني تشغيل عدة نماذج على نفس الجهاز؟
نعم -- يمكن للنماذج الخمسة التعايش على القرص في آن واحد. خطّط لـ 15-20 GB إذا ثبّت الخمسة جميعاً. يحمّل Ollama نموذجاً واحداً في كل مرة ويفرّغه بعد 5 دقائق من الخمول.
المصادر
- Meta AI. (2024). "Llama 3.2 Model Card." https://llama.meta.com/ -- المواصفات والاختبارات الرسمية لنماذج Llama 3.2 3B و1B.
- Microsoft. (2025). "Phi-4 Mini Technical Report." https://huggingface.co/microsoft/Phi-4-mini-instruct -- بيانات اختبار لـ Phi-4 Mini (68% MMLU، 70% HumanEval).
- Google DeepMind. (2025). "Gemma 3 Model Card." https://ai.google.dev/gemma/docs/core -- مواصفات وأداء Gemma 3 2B، بما في ذلك الترقية إلى نافذة سياق 128K.
- Ollama. (2026). "Ollama Model Library." https://ollama.com/library -- المصدر القياسي لوسوم نماذج Ollama وأحجامها وأوامر pull.
- Hugging Face. (2026). "Open LLM Leaderboard." https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard -- نتائج اختبارات MMLU وHumanEval وMATH لجميع النماذج المفتوحة.
- Mistral AI. (2024). "Mistral Small v0.3 Release Notes." https://mistral.ai/news/announcing-mistral-7b/ -- المواصفات التقنية وتفاصيل رخصة Apache 2.0 للنموذج القديم بحجم 7B المذكور في قسم الأخطاء الشائعة.
- Alibaba DAMO Academy. (2025). "Qwen3 Technical Report." arXiv:2505.09388. https://arxiv.org/abs/2505.09388 -- بيانات اختبار متعددة اللغات وتفاصيل البنية لـ Qwen3 8B.
- Meta AI. (2025). "Llama 3.3 Model Card." https://llama.meta.com/ -- المواصفات والاختبارات الرسمية لـ Llama 3.3 8B.
