Key Takeaways
- الأفضل عموماً: Qwen3.8-27B -- يحقق 89.2% في GPQA Diamond و61.7% في SWE-bench Pro، ونافذة سياق 262K، ويتطلب ~24 GB من RAM بتكميم Q4_K_M.
- الأفضل للاستدلال: Gemma 4 26B-A4B -- بنية MoE (26B إجمالي، ~4B نشط)، 89% في AIME 2026، يتطلب ~15 GB من RAM.
- الأفضل للبرمجة: Qwen2.5-Coder 7B -- 88% في HumanEval و78% في EvalPlus، يعمل بـ ~5 GB من RAM.
- الأفضل لوحدة المعالجة المركزية فقط: Phi-4-mini -- 68% في MMLU و70% في HumanEval، يعمل بـ ~2.5 GB من RAM.
- أفضل نموذج صغير: Gemma 4 E2B -- 2.3B معامل فعّال، نافذة سياق 128K، يعمل بـ ~2 GB من RAM على Raspberry Pi 5.
يُعد Qwen3.8-27B أفضل نموذج LLM محلي بشكل عام (89.2% GPQA Diamond، رؤية ولغة أصلية، ~24 GB RAM)، ويتصدر Gemma 4 26B-A4B الاستدلال (89% AIME 2026، ~15 GB RAM)، ويتصدر Qwen2.5-Coder 7B البرمجة (88% HumanEval، ~5 GB RAM)، بينما Phi-4-mini هو الخيار الأفضل لتشغيل CPU فقط (~2.5 GB RAM).
إذا لم تكن متأكداً من نموذج الذكاء الاصطناعي المحلي الذي يجب اختياره: Qwen3.8-27B هو الأقوى شمولاً إذا كان لديك 24 GB من الذاكرة، وGemma 4 26B-A4B هو الأفضل لمسائل الرياضيات والمنطق، وQwen2.5-Coder 7B مصمم خصيصاً لكتابة الشيفرة، وPhi-4-mini يعمل جيداً حتى بدون بطاقة رسومات. نموذج صغير مثل Gemma 4 E2B يعمل على أي جهاز تقريباً، بما في ذلك Raspberry Pi.
كيف صُنّفت هذه النماذج؟
تستند التصنيفات إلى قياسات نشرتها المختبرات نفسها وقياسات مجتمعية مستقلة: MMLU (معرفة عامة)، وHumanEval وSWE-bench Verified (قدرة برمجية)، وAIME (رياضيات تنافسية)، وGPQA Diamond (استدلال بمستوى دراسات عليا). الدرجات مأخوذة من بطاقات النماذج الرسمية ومن أدوات تتبّع القياسات المجتمعية اعتباراً من الربع الثالث من 2026.
تُحسب متطلبات العتاد لتكميم Q4_K_M -- الإعداد القياسي للمبتدئين الذي يوازن الجودة واستخدام RAM. لمقدمة عن التكميم، راجع شرح تكميم نماذج LLM.
جميع النماذج متاحة عبر Ollama. للتثبيت، راجع كيفية تثبيت Ollama.

#1 Qwen3.8-27B -- أفضل نموذج LLM محلي عموماً في 2026
Qwen3.8-27B هو أفضل نموذج LLM محلي لمعظم المستخدمين في 2026. يحقق 89.2% في GPQA Diamond و61.7% في SWE-bench Pro بينما يناسب ~24 GB من RAM بتكميم Q4_K_M. بخلاف Qwen3.6 27B السابق، فهو نموذج رؤية-لغة أصلي -- يفهم الصور والفيديو مباشرة، وليس النص فقط. نافذة سياق أصلية 262K (قابلة للتمديد إلى 1M).
تحلّ هذه البنية الكثيفة 27B محل جيل Qwen3 السابق (المتقادم الآن). تتطلب RAM أكبر بكثير من سابقتها، لذا فإن الأجهزة بـ 16 GB ستحتاج إلى نسخة MoE من Qwen3.6-35B-A3B أو نموذج أصغر -- راجع قسم "أي نموذج يجب أن تستخدم" أدناه. للمستخدمين بـ 24 GB+ من VRAM، يوفّر Qwen3.8-27B أفضل نسبة جودة لكل غيغابايت بين النماذج الكثيفة في 2026.
المواصفة | القيمة |
|---|---|
| GPQA Diamond | 89.2% |
| SWE-bench Pro | 61.7% |
| RAM المطلوب (Q4_K_M) | ~24 GB |
| نافذة السياق | 262K token (حتى 1M ممتد) |
| أمر Ollama | ollama pull qwen3.8:27b |
#2 Gemma 4 26B-A4B -- الأفضل لمهام الاستدلال
Gemma 4 26B-A4B هو أفضل نموذج محلي للمهام كثيفة الاستدلال في 2026. يحقق 89% في AIME 2026 -- قياس رياضيات تنافسي -- باستخدام تصميم Mixture-of-Experts الذي يُفعّل ~4B معامل فقط لكل رمز، فيولّد النص بسرعة قريبة من نموذج 4B رغم تحميل 26B معامل كاملة في الذاكرة.
يتطلب ~15 GB من RAM بتكميم Q4_K_M، يناسب RTX 4090 واحدة أو Mac بذاكرة موحدة 24 GB+. بما أنه نموذج MoE، يحمّل Ollama كل الخبراء في الذاكرة قبل الاستدلال، لذا يطابق متطلب RAM نموذجاً كثيفاً بحجم 26B رغم أن ~4B معامل فقط تُحسب لكل رمز. راجع مقارنة DeepSeek مقابل Qwen للبرمجة لمقارنات مع خيارات أخرى مُركّزة على الاستدلال.
المواصفة | القيمة |
|---|---|
| درجة AIME 2026 | 89% |
| المعاملات النشطة | ~4B من 26B (MoE) |
| RAM المطلوب (Q4_K_M) | ~15 GB |
| نافذة السياق | 128K token |
| أمر Ollama | ollama pull gemma4:26b |
#3 Qwen2.5-Coder 7B -- الأفضل لتوليد الكود
Qwen2.5-Coder 7B هو أفضل نموذج برمجة محلي في 2026. 88% في HumanEval (84% في HumanEval+ الأصعب)، و~5 GB من RAM بتكميم Q4_K_M، مُدرَّب على أكثر من 80 لغة برمجة.
لـ 24+ GB من RAM، يحقق Qwen2.5-Coder 32B درجة 92% في HumanEval. النسخة 7B موصى بها لمعظم المستخدمين. راجع أفضل نماذج LLM المحلية للبرمجة.
المواصفة | القيمة |
|---|---|
| درجة HumanEval | 88% |
| درجة EvalPlus | 78% |
| RAM المطلوب (Q4_K_M) | ~5 GB |
| نافذة السياق | 128K token |
| أمر Ollama | ollama run qwen2.5-coder:7b |
#4 Phi-4-mini -- أفضل نموذج لوحدة المعالجة المركزية فقط
Microsoft Phi-4-mini يحقق 68% في MMLU و70% في HumanEval بفضل بيانات استدلال اصطناعية عالية الجودة. ~2.5 GB من RAM بتكميم Q4_K_M، و30-50 tok/ثانية على أي CPU لابتوب حديث.
موصى به للأجهزة بـ 4-8 GB من RAM، وRaspberry Pi/SBC. اتباع التعليمات يتفوق على Gemma 4 E2B عند مستوى RAM مماثل.
المواصفة | القيمة |
|---|---|
| درجة MMLU | 68% |
| درجة HumanEval | 70% |
| RAM المطلوب (Q4_K_M) | ~2.5 GB |
| نافذة السياق | 128K token |
| أمر Ollama | ollama run phi4-mini |
#5 Gemma 4 E2B -- أفضل نموذج صغير
Google Gemma 4 E2B هو أفضل نموذج في فئة أقل من 3B معامل فعّال. يمتلك 2.3B معامل فعّال (5.1B مع التضمينات) ويحتاج فقط ~2 GB من VRAM أو ~4 GB من RAM النظام. نافذة سياق 128K كبيرة بشكل غير معتاد لنموذج بهذا الحجم.
موصى به للحافة، والحواسيب أحادية اللوحة (يعمل على Raspberry Pi 5)، وألواح NVIDIA Jetson، والهواتف. لمعظم مستخدمي سطح المكتب/اللابتوب، يوفّر Phi-4-mini جودة أعلى عند RAM مماثل. للتنزيل: `ollama pull gemma4:e2b`.
المواصفة | القيمة |
|---|---|
| المعاملات الفعّالة | 2.3B (5.1B مع التضمينات) |
| VRAM المطلوب (Q4_K_M) | ~2 GB |
| RAM النظام (CPU فقط) | ~4 GB |
| نافذة السياق | 128K token |
| أمر Ollama | ollama pull gemma4:e2b |
مقارنة قياسات كاملة: أفضل 5 نماذج LLM محلية 2026
النموذج | MMLU | HumanEval | RAM | الأفضل لـ |
|---|---|---|---|---|
| Qwen3.8-27B | — | — | ~24 GB | عام (SWE-bench Pro 61.7%) |
| Gemma 4 26B-A4B | — | — | ~15 GB | الاستدلال، AIME (89%) |
| Qwen2.5-Coder 7B | — | 88% | ~5 GB | توليد الكود |
| Phi-4-mini 3.8B | 68% | 70% | ~2.5 GB | وحدة المعالجة المركزية فقط، الحافة |
| Gemma 4 E2B | — | — | ~2 GB | صغير / SBC |
أي نموذج LLM محلي يجب أن تستخدم في 2026؟
- أقل من 4 GB، وحدة المعالجة المركزية فقط: Phi-4-mini (`ollama run phi4-mini`) -- ~2.5 GB من RAM، 30-50 tok/ثانية على CPU.
- 2-4 GB، نموذج صغير: Gemma 4 E2B (`ollama pull gemma4:e2b`) -- ~2 GB من RAM، نافذة سياق 128K.
- 8-16 GB من RAM: Phi-4-mini أو نسخة MoE من Qwen3.6-35B-A3B -- لم يعد Qwen3.8-27B (~24 GB) يناسب هذه الفئة بشكل مريح.
- 24 GB+ من VRAM/RAM (أفضل جودة عامة): Qwen3.8-27B (`ollama pull qwen3.8:27b`) -- أفضل جودة عامة.
- مهام البرمجة: Qwen2.5-Coder 7B (`ollama run qwen2.5-coder:7b`)؛ أو النسخة 32B مع 24+ GB من RAM -- راجع أفضل نماذج LLM المحلية للبرمجة.
- الاستدلال/الرياضيات: Gemma 4 26B-A4B (`ollama pull gemma4:26b`) -- ~15 GB من RAM، 89% في AIME 2026.
- لغات غير الإنجليزية: Qwen3.8-27B -- راجع Qwen مقابل Llama مقابل Mistral.

أفضل نماذج LLM المحلية حسب المنطقة
الخليج (PDPL): تُعد سيادة البيانات المحرّك الرئيسي لتبنّي الاستدلال المحلي في منطقة الخليج. بموجب نظام حماية البيانات الشخصية السعودي (PDPL) وقانون حماية البيانات الإماراتي، يجب على المؤسسات التي تعالج بيانات شخصية (سجلات الموظفين، معلومات العملاء، البيانات الصحية) مراعاة أن Qwen3.8-27B وGemma 4 26B-A4B يعملان بالكامل على عتاد محلي دون نقل بيانات إلى خدمات سحابية، ما يبقي البيانات داخل الحدود الوطنية. للمنظومة العربية السيادية، توفّر نماذج مثل Jais وALLaM وFalcon قدرة عربية أصلية قوية لتحليل المشاعر، وتصنيف NLP، ومعالجة المستندات العربية مع إلغاء مخاوف إقامة البيانات.
اليابان (إرشادات METI): نشرت وزارة الاقتصاد والتجارة والصناعة (METI) اليابانية إرشادات حوكمة الذكاء الاصطناعي 2024، التي توصي بالنشر المحلي لحالات الاستخدام المؤسسية الحساسة (المؤسسات المالية، الصحة، الاتصالات). القدرة متعددة اللغات لـ Qwen3.8-27B (بما في ذلك الدعم الأصلي لليابانية) تجعله الخيار الموصى به للمؤسسات اليابانية التي تعالج بيانات العملاء. Gemma 4 26B-A4B مناسب أيضاً لمهام الاستدلال؛ تأكد من أن طريقة التكميم لديك تحافظ على الفروق اللغوية (يُوصى بـ Q6_K أو Q5_K_M للنص الياباني).
الصين (قانون أمن البيانات): يفرض قانون أمن البيانات الصيني (DSL) لعام 2021 توطين البيانات وضوابط حوكمة للفئات الحساسة (المالية، الاتصالات، التعليم). Qwen3.8-27B مطوَّر من Alibaba (شركة صينية) ومُحسَّن للصينية الفصحى، ما يجعله الخيار الأصلي. Gemma 4 26B-A4B (من تطوير Google) يتفوق في الاستدلال لكنه يتطلب ضبطاً دقيقاً للصينية للمستندات القانونية أو المالية أو الطبية. يمكن تشغيل كلا النموذجين بالكامل على عتاد محلي (NVIDIA A100، أو Huawei Ascend، أو خوادم x86 محلية)، بما يتوافق مع DSL.
أخطاء شائعة عند اختيار النماذج في 2026
- الاختيار استناداً إلى القياسات وحدها -- قد يختلف الأداء الفعلي في مهمتك اختلافاً كبيراً.
- عدم اختبار مخرجات النموذج في حالة استخدامك المحددة قبل نشره.
- نسيان التحقق من قيود الترخيص للاستخدام التجاري.
- مقارنة نماذج بأحجام مختلفة على مستويات عتاد مختلفة -- درجة 89.2% GPQA Diamond لـ Qwen3.8-27B لا "تنافس" مباشرة درجة 88% HumanEval لـ Qwen2.5-Coder 7B عندما تتطلب RAM مختلفاً جوهرياً (~24 GB مقابل ~5 GB). اختر النموذج الذي يناسب قيد عتادك ثم تحقق من أدائه في مهمتك.
- تنزيل نموذج كبير دون التحقق من RAM المتاح -- تنزيل بحجم ~24 GB يستغرق 30-60 دقيقة باتصال منزلي نموذجي. شغّل `free -h` (Linux) أو تحقق من مراقب النشاط (macOS) قبل تنزيل النماذج الكبيرة. إذا لم يتوفر RAM كافٍ، سيبدأ Ollama بتفريغ الطبقات إلى CPU، مخفّضاً السرعة إلى 2-5 tok/ثانية.
- افتراض أن "المعاملات النشطة" في نموذج MoE هي ما يحدد استخدام RAM -- بالنسبة لـ Gemma 4 26B-A4B ونماذج MoE المماثلة، يجب تحميل كل خبير في الذاكرة قبل الاستدلال، لذا خطّط لـ RAM بناءً على إجمالي المعاملات، لا العدد النشط.
لست متأكداً مما إذا كان التشغيل المحلي هو الخيار الصحيح؟
قبل الاختيار بين Qwen3.8-27B أو Gemma 4 أو Qwen2.5-Coder، تأكد من أن الاستدلال المحلي يناسب احتياجاتك فعلاً. **قارن نماذج LLM المحلية مقابل واجهات API السحابية لفهم المقايضة الكاملة** -- قد تكتشف أن API سحابي أرخص أو أسرع أو أكثر عملية لحالة استخدامك المحددة، خاصة إذا احتجت إلى الوصول إلى معلومات في الوقت الفعلي أو أداء استدلال بمستوى الحدود المتقدمة.
تقايض أفضل النماذج المحلية السرعة وتعقيد التهيئة بالخصوصية والتحكم في التكلفة. إذا كان لديك عتاد محدود (< 16 GB من RAM)، أو إنترنت غير موثوق للتنزيلات، أو مهام تتطلب معرفة بالعالم الحالي، فقد تكون واجهات API السحابية الخيار الأفضل.
بمجرد اختيار نموذج، الخطوة التالية لمعظم القرّاء هي ربطه بجهازك. راجع وكلاء الذكاء الاصطناعي المحليون مع MCP للبروتوكول الذي يحوّل أياً من النماذج أعلاه إلى وكيل يقرأ الملفات، ويستعلم قواعد البيانات، ويتحكم في متصفح.
الأسئلة الشائعة
ما هو أفضل نموذج LLM محلي في 2026؟
Qwen3.8-27B هو أفضل نموذج LLM محلي عموماً في 2026، بـ 89.2% في GPQA Diamond و61.7% في SWE-bench Pro، ويتطلب ~24 GB من RAM، ونافذة سياق 262K. لحالات استخدام محددة: Gemma 4 26B-A4B للاستدلال (89% AIME 2026، ~15 GB من RAM)، وQwen2.5-Coder 7B للبرمجة (~5 GB من RAM)، وPhi-4-mini لوحدة المعالجة المركزية فقط (~2.5 GB من RAM)، وGemma 4 E2B كأفضل نموذج صغير (~2 GB من RAM).
كم من RAM أحتاج لـ Qwen3.8-27B؟
يتطلب Qwen3.8-27B نحو 24 GB من RAM بتكميم Q4_K_M؛ بطاقة بـ 24 GB من VRAM (RTX 4090، RTX 3090) أو Mac بذاكرة موحدة 24 GB+ مريحة؛ ضيقة على بطاقات 16 GB. متوفر بالفعل في مكتبة Ollama الرسمية: `ollama pull qwen3.8:27b`. إذا كان لديك أقل من 16 GB، استخدم نسخة MoE من Qwen3.6-35B-A3B أو نموذجاً أصغر.
هل Gemma 4 26B-A4B أفضل من Qwen3.8-27B؟
للمهام كثيفة الاستدلال والرياضيات، نعم -- يحقق Gemma 4 26B-A4B 89% في AIME 2026 ويولّد النص بسرعة قريبة من نموذج 4B بفضل تصميم Mixture-of-Experts. للاستخدام العام (الكتابة، التحليل، تعدد اللغات)، يوفّر Qwen3.8-27B قدرة أوسع ونافذة سياق أكبر (262K). يتطلب Gemma 4 26B-A4B ~15 GB من RAM مقابل ~24 GB لـ Qwen3.8-27B -- كلاهما يحمّل كامل المعاملات في الذاكرة بغض النظر عن العدد النشط.
ما هو أفضل نموذج LLM محلي لـ 8 GB من RAM؟
Phi-4-mini (~2.5-3.5 GB بتكميم Q4_K_M) هو الخيار الموصى به لأجهزة 8 GB، إذ يترك هامشاً واسعاً لعمليات النظام مع الحفاظ على جودة استدلال جيدة. لا يناسب Qwen3.8-27B (~24 GB) ولا Gemma 4 26B-A4B (~15 GB) جهازاً بـ 8 GB؛ تلك تحتاج فئات 16-24 GB أو أكثر.
ما هو أفضل نموذج LLM محلي للبرمجة في 2026؟
Qwen2.5-Coder 7B هو الأفضل للبرمجة، بـ 88% في HumanEval و~5 GB من RAM بتكميم Q4_K_M، مُدرَّب على أكثر من 80 لغة برمجة. لـ 24+ GB من RAM، يحقق Qwen2.5-Coder 32B درجة 92% في HumanEval. راجع أفضل نماذج LLM المحلية للبرمجة لمزيد من الخيارات.
هل هذه النماذج مجانية للاستخدام التجاري؟
نعم، النماذج الخمسة مفتوحة الأوزان وتسمح بالاستخدام التجاري: Qwen3.8-27B وQwen2.5-Coder تحت Qwen License، وGemma 4 (نسختا 26B-A4B وE2B) تحت ترخيص Gemma من Google (يسمح بالاستخدام التجاري بقيود استخدام مقبول)، وPhi-4-mini تحت ترخيص MIT. تحقق دائماً من شروط الترخيص لنطاقك القضائي قبل النشر.
ماذا يعني تكميم Q4_K_M؟
Q4_K_M هو مخطط تكميم بـ 4 بت (طريقة لضغط أوزان النموذج) يوفّره llama.cpp وOllama. يقلّص Qwen3.8-27B من ~56 GB (دقة BF16 كاملة) إلى ~24 GB (مُكمَّم) مع فقدان جودة ضئيل. "Q4" = 4 بت دقة لكل وزن؛ "K_M" = نسخة تكميم محددة تحافظ على أنماط الأوزان المهمة (K-quants). للمبتدئين، Q4_K_M هو الافتراضي الموصى به. يطبّق Ollama هذا التكميم تلقائياً.
هل يمكنني تشغيل هذه النماذج بالكامل دون اتصال؟
نعم. النماذج الخمسة تعمل بالكامل دون اتصال بمجرد تنزيلها عبر Ollama على جهازك. حمّلها محلياً، ويحدث الاستدلال بنسبة 100% على عتادك دون استدعاءات شبكة. هذه ميزة رئيسية مقابل واجهات API السحابية: مثالية للمستندات السرية، والشبكات المعزولة، والامتثال لإقامة البيانات / حماية البيانات.
لماذا لا يعرض جدول المقارنات نتيجة MMLU أو HumanEval أو AIME لـ Qwen3.8-27B؟
بطاقة نموذج Qwen3.8-27B الرسمية الصادرة عن Alibaba لا تُعلن نتائج MMLU أو HumanEval أو AIME لهذا النموذج -- هذه البيانات غير معلنة فعلياً وليست إغفالاً من هذه الصفحة. المعايير التي أعلنتها Alibaba هي GPQA Diamond (89.2%)، وSWE-bench Pro (61.7%)، وLiveCodeBench v6 (90.3%)، وTerminal-Bench 2.1 (73.0%)، وجميعها معروضة أعلاه. إذا كنت بحاجة إلى نموذج بحجم مماثل بنتيجة MMLU/HumanEval معلنة، فإن Qwen2.5-Coder 7B (88% HumanEval) وPhi-4-mini (68% MMLU، 70% HumanEval) يعلنان هذه الأرقام. لمعرفة أحجام Qwen3 الأخرى (8B وَ14B وَ32B) وكيف تقارن العائلة بـ DeepSeek وLlama، راجع Qwen مقابل Llama مقابل Mistral.
ما هي نتائج HumanEval وGSM8K وAIME لعائلة Qwen3، وما ترتيبها في Hugging Face Open LLM Leaderboard؟
النتائج الرسمية المعلنة من فريق Qwen (التقرير التقني) هي: Qwen3-8B يحقق 72.0% في HumanEval و84.2% في GSM8K؛ وQwen3-32B (بعد التدريب) يحقق 81.4% في AIME 2024 و72.9% في AIME 2025. هذه الأرقام مختلفة عن اختيار Qwen3.8-27B أعلاه -- بطاقة نموذج Qwen3.8-27B من Alibaba لا تعلن نتائج HumanEval أو GSM8K أو MMLU لهذا النموذج تحديداً (انظر السؤال السابق)، لذا عند مقارنة أحجام Qwen3 بـ DeepSeek أو Llama على هذه المعايير بالذات استخدم أرقام Qwen3-8B/32B أعلاه، وليس الحقول غير المعلنة لـ Qwen3.8-27B. للحصول على تصنيفات محدّثة باستمرار للنماذج مفتوحة الوزن بين Qwen وDeepSeek وLlama على MMLU وHumanEval وMATH، راجع Hugging Face Open LLM Leaderboard المباشر -- الترتيب يتغير مع تقديم نقاط تفتيش جديدة، لذا تعرض هذه الصفحة ما تعلنه بطاقة كل نموذج رسمياً وليس لقطة من لوحة صدارة مباشرة قد تصبح قديمة خلال أيام.
كيف تُقارَن هذه النماذج بنماذج الحدود السحابية الحالية؟
يقترب Qwen3.8-27B وGemma 4 26B-A4B من نماذج حدود سحابية سابقة في المهام النصية، لكن نماذج الحدود السحابية الحالية لا تزال متقدمة في الاستدلال المعقد ومهام الرؤية. اختر النماذج المحلية للخصوصية، والسرعة (دون كمون API)، والتكلفة؛ واختر نموذج حدود سحابياً لأقصى قدرة والمهام متعددة الوسائط.
المصادر
- Hugging Face. (2026). "Open LLM Leaderboard." huggingface.co/spaces/open-llm-leaderboard -- تصنيفات في الوقت الفعلي لقياسات MMLU وHumanEval وMATH لجميع النماذج مفتوحة الأوزان.
- Ollama. (2026). "Ollama Model Library." ollama.com/library -- النماذج المتاحة مع أحجام التنزيل، وخيارات التكميم، وأوامر Ollama.
- Alibaba Qwen Team. (2026). "Qwen3.8-27B Model Card." huggingface.co/Qwen/Qwen3.8-27B -- درجات القياس الرسمية (GPQA Diamond وSWE-bench Pro وLiveCodeBench v6) وبيانات الترخيص والقدرة على الرؤية واللغة لنموذج Qwen3.8-27B.
- Qwen Team. "Qwen3 Technical Report." arxiv.org/abs/2505.09388 -- درجات HumanEval وGSM8K وAIME الرسمية للنموذجين الأساسيين Qwen3-8B وQwen3-32B.
