Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/أفضل نماذج ⁨LLM⁩ المحلية بسياق ⁨128K 2026⁩: مقارنة شاملة
Best Models

أفضل نماذج ⁨LLM⁩ المحلية بسياق ⁨128K 2026⁩: مقارنة شاملة

·8 دقائق للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

أفضل نموذج LLM محلي بسياق طويل في يونيو 2026 هو Qwen3 14B بكمية Q4_K_M — يعالج 128K رمز في ~12 GB RAM بسرعة 15-25 رمز/ث على Apple M5 Pro. لأجهزة 8 GB، يعمل Qwen3 4B (128K) بسلاسة. جميع النماذج الرئيسية لعام 2026 — Qwen3 وGemma 3 وLlama 3.1 وMistral Small 3.1 — تدعم 128K رمز أصليًا؛ السياق الطويل أصبح الآن معيارًا أساسيًا.

في يونيو 2026، أصبح السياق الطويل معيارًا أساسيًا. تدعم نماذج Qwen3 وGemma 3 وLlama 3.1 وMistral Small 3.1 جميعها 128K رمز أصليًا. يعالج Qwen3 14B بكمية Q4_K_M سياق 128K رمز في ~12 GB من RAM بسرعة 15-25 رمز/ث على Apple M5 Pro -- الخيار الأمثل لمعظم الإعدادات. على أجهزة 8 GB، يغطي Qwen3 4B نافذة 128K ذاتها بجودة أقل. يستخدم Ollama 2048 رمزًا افتراضيًا؛ يوضح هذا الدليل النماذج التي تناسب VRAM لديك والسرعة التي تعمل بها في السياق الكامل.

العرض التقديمي: أفضل نماذج ⁨LLM⁩ المحلية بسياق ⁨128K 2026⁩: مقارنة شاملة

يغطي عرض الشرائح: مقارنة النماذج بنافذة سياق 128K (Llama 3.3، Qwen3، Mistral Small 3.1)، استخدام RAM في أطوال السياق 4K/32K/128K، تأثير "lost in the middle" والحدود العملية الموثوقة (~32K لنماذج 7B)، وكيفية ضبط num_ctx في Ollama. نزّل ملف PDF كبطاقة مرجعية لـLLM المحلي بالسياق الطويل.

تصفّح الشرائح أدناه أو نزّلها بصيغة PDF للرجوع إليها دون اتصال. تنزيل البطاقة المرجعية (PDF)

أفضل نماذج ⁨LLM⁩ المحلية بسياق ⁨128K 2026⁩: مقارنة شاملة

Key Takeaways

  • تدعم جميع نماذج 2026 الرئيسية — Qwen3 وGemma 3 وLlama 3.1 وMistral Small 3.1 — سياق 128K رمز أصليًا. السياق الطويل أصبح معيارًا أساسيًا، لا ميزة تنافسية.
  • الفائز للمستخدم العادي: Qwen3 14B بكمية Q4_K_M. يعالج 128K رمز في ~12 GB من RAM بسرعة 15-25 رمز/ث على Apple M5 Pro. على أجهزة 8 GB، استخدم Qwen3 4B — نفس نافذة 128K بجودة أقل.
  • تتوسّع RAM مع طول السياق وحجم النموذج معًا. نموذج 7B Q4_K_M يحتاج ~6 GB عند 4K و~14 GB عند 128K. Qwen3 14B Q4_K_M يستخدم ~12 GB عند 128K على Apple Silicon (يستفيد من الذاكرة الموحّدة).
  • مشكلة "Lost in the Middle" لا تزال قائمة: تفقد نماذج LLM تفاصيل الأقسام الوسطى من السياق. التخفيف: أبقِ المعلومات الحرجة في بداية المطالبة، استخدم RAG للبحث، أو عالج في أجزاء متداخلة.
  • يتفوّق السياق الطويل في التحليل الشمولي للمستندات الكاملة (قواعد الشيفرة، العقود، الكتب). يتفوّق RAG في مهام البحث المكثّف في مستندات كثيرة. اختر حسب نوع المهمة، لا حجم السياق فقط.
  • يستخدم Ollama 2048 رمزًا افتراضيًا -- ليس 128K. اضبط num_ctx صراحةً في Modelfile للوصول إلى السياق الكامل. Apple M5 (16-32 GB، 200 GB/s) وM5 Pro (36-64 GB، 307 GB/s) يتعاملان مع استدلال 128K بكفاءة.

جميع نماذج LLM المحلية الكبرى في 2026 تدعم 128K رمز بشكل أصلي؛ Qwen3 14B Q4_K_M يعالج 128K في ~12 جيجابايت رام بسرعة 15–25 رمزاً/ثانية — لكن Ollama افتراضياً 2048 رمزاً فقط، لذا اضبط num_ctx دائماً في Modelfile.

طول السياق هو كمية النص التي يمكن للذكاء الاصطناعي "رؤيته" دفعة واحدة. 128K رمز ≈ 96,000 كلمة — ما يكفي لرواية كاملة. المشكلة: تنخفض دقة النماذج للمعلومات المدفونة في منتصف المدخلات الطويلة جداً (ظاهرة "Lost in the Middle"). ضع أهم معلوماتك في بداية المطالبة.

ما طول السياق ولماذا يهم لنماذج LLM المحلية؟

طول السياق هو الحد الأقصى لعدد الرموز التي يستطيع النموذج معالجتها في استدعاء استدلال واحد -- الحجم المجمّع للمدخلات (مستندك، سجل المحادثة، مطالبة النظام) والمخرجات (استجابة النموذج). رمز ≈ 0.75 كلمة بالعربية؛ 128K رمز ≈ 96,000 كلمة.

لحالات استخدام نماذج LLM المحلية، يتيح السياق الطويل: تلخيص كتب كاملة أو تقارير طويلة، تحليل قواعد شيفرة كاملة في مطالبة واحدة، معالجة ساعات من نصوص الاجتماعات، والحفاظ على سجلات محادثة طويلة دون فقدان السياق السابق.

التمييز الرئيسي هو بين طول السياق المُعلَن (ما تدعمه معمارية النموذج) وطول السياق العملي (حيث تبقى الجودة موثوقة). قد يدعم نموذج تقنيًا 128K رمز، لكنه يُظهر جودة متدهورة للمعلومات المقدّمة عند الرمز رقم 100K.

أي نماذج LLM المحلية تدعم سياق 128K رمز في 2026؟

النموذجنافذة السياقالحد العمليأمر Ollama
Qwen3 14B Q4_K_M128K~32-64K موثوقollama run qwen3:14b
Qwen3 4B Q4_K_M128K~16-32K موثوقollama run qwen3:4b
Gemma 3 12B Q4_K_M128K~32K موثوقollama run gemma3:12b
Llama 3.1 8B Q4_K_M128K~32K موثوقollama run llama3.1:8b
Llama 3.2 3B128K~16K موثوقollama run llama3.2:3b
Mistral Small 3.1 24B128K~32K موثوقollama run mistral-small3.1
Qwen3 8B Q4_K_M128K~32K موثوقollama run qwen3:8b
DeepSeek-R1 14B Q4_K_M128K~32K موثوقollama run deepseek-r1:14b
8 نماذج LLM محلية بدعم سياق 128K في 2026 -- Qwen3 14B هو الخيار الأمثل لأجهزة 16 GB، وQwen3 4B لأجهزة 8 GB.
8 نماذج LLM محلية بدعم سياق 128K في 2026 -- Qwen3 14B هو الخيار الأمثل لأجهزة 16 GB، وQwen3 4B لأجهزة 8 GB.

كم من RAM تحتاج معالجة السياق الطويل؟

يتوسّع استخدام RAM مع حجم النموذج وطول السياق معًا. تخزّن ذاكرة KV المؤقتة (ذاكرة المفتاح-القيمة) حالات الانتباه لجميع الرموز المعالَجة -- وتنمو خطيًا مع طول السياق.

اعتبارًا من أبريل 2026، يستخدم نموذج 7B في Q4_K_M بسياق 4K ~6 GB من RAM. النموذج نفسه بسياق 32K يستخدم ~8-9 GB من RAM. بسياق 128K: ~12-16 GB من RAM.

ModeloContexto 4KContexto 32KContexto 128K
Llama 3.3 8B Q4_K_M~6 GB~9 GB~14 GB
Qwen3 14B Q4_K_M~9 GB~12 GB~18 GB
Mistral Small 3.1 24B Q4_K_M~14 GB~17 GB~24 GB
Llama 3.3 70B Q4_K_M~40 GB~45 GB~55 GB
تتوسّع RAM لذاكرة KV المؤقتة مع طول السياق -- نموذج 7B في Q4_K_M يحتاج ~6 GB بسياق 4K، لكن ~14 GB بسياق 128K.
تتوسّع RAM لذاكرة KV المؤقتة مع طول السياق -- نموذج 7B في Q4_K_M يحتاج ~6 GB بسياق 4K، لكن ~14 GB بسياق 128K.

لماذا السياق العملي أقصر من الحد الأقصى المُعلَن؟

نماذج LLM المدرَّبة بترميزات موضعية RoPE (المستخدمة من Llama وQwen وMistral) تستطيع تقنيًا معالجة رموز حتى أقصى طول سياق لها، لكن الجودة تتدهور بنمط معروف يُسمى تأثير "lost in the middle".

تُظهر الأبحاث أن نماذج اللغة تستفيد بأفضل شكل من المعلومات في بداية ونهاية نافذة السياق. المعلومات الموضوعة في منتصف سياق طويل جدًا تُسترجَع بموثوقية أقل. عمليًا، نموذج بنافذة سياق 128K يستطيع الإجابة عن أسئلة حول محتوى أول 32K رمز وآخر 16K رمز بموثوقية، لكنه يفقد تفاصيل النطاق 40K-80K رمز.

للنماذج المحلية خصوصًا، يتوسّع الحد العملي الموثوق مع حجم النموذج: نماذج 3B ≈ 8K-16K موثوق؛ نماذج 7B-8B ≈ 16K-32K موثوق؛ نماذج 70B ≈ 64K موثوق. هذه تقديرات -- يعتمد الحد الفعلي على المهمة المحددة ومدى "أهمية" المعلومات المسترجَعة.

تتيح نوافذ السياق الطويل مدخلات أكثر، لكن بنية المطالبة تحدّد ما إذا كان النموذج يستخدم ذلك السياق بفعالية. تُغطّى تقنيات مثل RAG وتسلسل المطالبات واستراتيجيات إدارة نوافذ السياق في دليل هندسة المطالبات.

تأثير "lost in the middle": تسترجع نماذج LLM المحتوى في بداية ونهاية نافذة السياق بموثوقية، لكنها تفقد النطاق 40K-80K رمز.
تأثير "lost in the middle": تسترجع نماذج LLM المحتوى في بداية ونهاية نافذة السياق بموثوقية، لكنها تفقد النطاق 40K-80K رمز.

كيف يُضبَط طول السياق في Ollama؟

يستخدم Ollama 2048 رمز سياق افتراضيًا، ما لم يُضبَط بطريقة أخرى. لاستخدام نافذة السياق الكاملة للنموذج:

يحدّد حجم نافذة السياق مقدار النص الذي يستطيع النموذج معالجته، لكن بنية المطالبة تحدّد مدى فعالية استخدامه لذلك السياق. للتعمّق في سبب فقدان النماذج تتبّع المدخلات السابقة واستراتيجيات التخفيف، راجع نوافذ السياق مشروحة: لماذا ينسى الذكاء الاصطناعي.

bash
# Set context length at runtime
ollama run llama3.2 --ctx 32768

# Or create a custom model with a Modelfile
cat << EOF > Modelfile
FROM llama3.1:8b
PARAMETER num_ctx 32768
EOF
ollama create llama3.1-32k -f Modelfile
ollama run llama3.1-32k
ضبط num_ctx 32768 في Modelfile يفتح سياق 32K في Ollama -- مُتحقق منه بـ`ollama ps` الذي يعرض عمود CTX.
ضبط num_ctx 32768 في Modelfile يفتح سياق 32K في Ollama -- مُتحقق منه بـ`ollama ps` الذي يعرض عمود CTX.

نماذج LLM المحلية بالسياق الطويل: السياق الإقليمي

دول الخليج / السعودية PDPL: يصنّف نظام حماية البيانات الشخصية السعودي ولوائح الإمارات معالجة البيانات الشخصية على نطاق واسع كأمر يتطلب ضوابط. الاستدلال المحلي بالسياق الطويل لتحليل المستندات القانونية أو تلخيص السجلات الطبية أو معالجة مستندات الموارد البشرية يقع في هذا المستوى. التشغيل محليًا يلغي خطر معالج البيانات الطرف الثالث -- لا تغادر أي بيانات المؤسسة. تُتيح النماذج العربية السيادية مثل Jais وALLaM وFalcon معالجة مستندات عربية محلية بالكامل.

للإعداد الموصى به في المنطقة: نموذج 7B في Q4_K_M بسياق 32K (يتسع في 9-10 GB من RAM على محطة عمل قياسية) يوفّر جودة موثوقة لمستندات حتى 50 صفحة مع إبقاء جميع البيانات داخل المؤسسة. تُتيح النماذج العربية السيادية معالجة المستندات الحساسة باللغة العربية دون نقل بيانات عبر الحدود.

للمستندات الحكومية والمالية الحساسة في المنطقة: الاستدلال المحلي عبر Ollama دون مكالمات API خارجية يلبّي متطلب عدم معالجة البيانات الشخصية من قبل مزودي ذكاء اصطناعي خارجيين دون أساس قانوني صالح.

اليابان (METI): تتطلب المستندات اليابانية 1.5-2 ضعف الرموز مقارنة بالمستندات المكافئة بالإنجليزية بسبب اختلافات أداة الترميز. تقرير ياباني من 50 صفحة قد يستهلك 25K-35K رمز -- ضمن النطاق الموثوق لـQwen3 7B (الحد العملي 32K) لكنه يتطلب إعداد سياق صريحًا في Ollama: PARAMETER num_ctx 32768. للمستندات القانونية والمالية باليابانية، Qwen3 14B في Q4_K_M بسياق 32K (~12 GB من RAM) يقدّم أفضل نسبة جودة/RAM لمعالجة السياق الطويل باليابانية. تعالج أداة الترميز الأصلية لليابانية في Qwen3 النص الياباني بكفاءة أعلى بنسبة 30-40% من Llama.

الصين: بموجب قانون أمن البيانات الصيني (数据安全法)، تتطلب معالجة المستندات الحساسة عبر واجهات API السحابية امتثالًا تنظيميًا إضافيًا. الاستدلال المحلي بالسياق الطويل عبر Qwen3 (Alibaba) يُبقي كل محتوى المستندات داخل المؤسسة. لمعالجة المستندات المؤسسية بالصينية، Qwen3 72B بسياق 32K على محطة عمل محلية (~45 GB من RAM) يقدّم جودة شبه مكافئة للسحابة مع سيادة بيانات كاملة. تجعله أداة الترميز الأصلية للصينية في Qwen3 أكفأ بنسبة 30-40% من Llama للمستندات الصينية.

أخطاء شائعة مع نماذج LLM المحلية بالسياق الطويل

  • افتراض أن سياق 128K يعمل بنفس جودة 4K: تأثير "lost in the middle" يعني أن المعلومات المقدّمة قبل 30K-80K رمز تُسترجَع بموثوقية أقل من المعلومات في البداية أو النهاية. لتحليل المستندات الحرجة، قسّم المستندات الطويلة إلى أقسام من 16K-32K وعالج كلًّا منها بشكل منفصل بدلًا من تغذية مستند 100K كامل دفعة واحدة.
  • عدم زيادة حجم السياق الافتراضي لـOllama: يستخدم Ollama 2048 رمز سياق افتراضيًا بغض النظر عن الحد الأقصى للنموذج. محادثة تتجاوز 2048 رمزًا ستقتطع الرسائل السابقة. اضبط دائمًا num_ctx صراحةً: أضف PARAMETER num_ctx 32768 إلى Modelfile أو استخدم --ctx في وقت التشغيل.
  • تشغيل السياق الطويل بـRAM غير كافية: نموذج 7B بسياق 128K على 8 GB من RAM إجمالًا يسبب استخدام swap شديدًا. أوزان النموذج (~4.5 GB) زائد ذاكرة KV المؤقتة لـ128K (~8+ GB) تتجاوز 8 GB. قلّل السياق إلى 32K (يتسع في ~9 GB) أو استخدم 16+ GB من RAM لاستدلال بسياق 128K.
  • نسيان أن سرعة التوليد ليست عامل زمن الاستجابة الوحيد مع السياق الطويل: بسياق 32K، الوقت حتى الرمز الأول (TTFT) قد يكون 5-15 ثانية على عتاد استهلاكي -- يجب على النموذج معالجة 32K رمز إدخال قبل توليد رمز مخرج واحد. تتوسّع مرحلة prefill هذه خطيًا مع طول السياق. للاستخدام التفاعلي، حدّد السياق بـ8K-16K. احتفظ بسياقات 32K+ للمعالجة بالدفعات حيث يكون TTFT مقبولًا.
  • استخدام RAG حيث السياق الطويل هو الأداة الصحيحة (والعكس): RAG أفضل للبحث في مستندات كثيرة. السياق الطويل أفضل عندما تحتاج للنموذج أن يستدل حول مستند كامل ومتماسك -- عقد، قاعدة شيفرة، فصل كتاب -- حيث يكسر فقدان أي جزء التحليل. تقسيم عقد قانوني من 10 صفحات إلى أجزاء لـRAG قد يسبب أخطاء إحالات متقاطعة يتجنّبها السياق الطويل. اختر حسب نوع المهمة، لا التفضيل الافتراضي.

الأسئلة الشائعة

هل يمكنني تلخيص كتاب كامل بنموذج LLM محلي؟

كتاب نموذجي من 300 صفحة يضم 90,000-120,000 كلمة -- قرابة 120K-160K رمز. يتجاوز هذا السياق العملي الموثوق لمعظم نماذج 7B ويتطلب نموذج 70B (64K موثوق) أو معالجة بالأجزاء. لنماذج 7B، قسّم الكتاب إلى فصول من 20 ألف كلمة، ولخّص كلًّا منها، ثم لخّص ملخصات الفصول.

كم صفحة نص تتسع في 32K رمز؟

قرابة 50-70 صفحة من نص قياسي (250 كلمة لكل صفحة). يستطيع سياق 32K رمز احتواء رواية قصيرة أو ورقة بحثية كاملة مع ملاحق أو مستند مواصفات تقني كامل.

هل زيادة طول السياق تُبطئ الاستدلال؟

نعم -- معالجة سياق 32K تستغرق قرابة 3-4 أضعاف معالجة سياق 4K على العتاد نفسه، بسبب التوسّع التربيعي لحساب الانتباه. سرعة التوليد (الرموز في الثانية) لا تتأثر بشكل كبير، لكن الوقت حتى الرمز الأول (TTFT) يتوسّع مع طول المدخلات.

أي نموذج LLM محلي يتعامل مع RAG أفضل من السياق الطويل؟

لمهام البحث واسترجاع المستندات، عادةً ما يكون RAG (التوليد المعزَّز بالاسترجاع) أكثر فعالية من تغذية المستندات الكاملة كسياق. يسترجع RAG أكثر 3-5 أجزاء صلة من مجموعة مستندات كبيرة ويقدّم تلك فقط للنموذج. يستخدم هذا 4K-8K رمز سياق ويتجنّب مشكلة "lost in the middle". أدوات مثل GPT4All LocalDocs وLlamaIndex تنفّذ RAG محلي.

ما هي ذاكرة KV المؤقتة ولماذا تنمو مع طول السياق؟

تخزّن ذاكرة KV المؤقتة (ذاكرة المفتاح-القيمة) حالات الانتباه لكل رمز معالَج في نافذة السياق. يتطلب كل رمز مقدارًا ثابتًا من الذاكرة لمتجهات المفتاح والقيمة الخاصة به -- لذلك يتطلب سياق 32K ذاكرة KV مؤقتة أكبر بـ8 مرات من سياق 4K. لهذا يحتاج نموذج 7B في Q4_K_M ~6 GB لسياق 4K، لكن ~9 GB لسياق 32K. أوزان النموذج لا تتغير -- تنمو ذاكرة KV المؤقتة فقط.

هل تستطيع النماذج المحلية التعامل مع سياقات مليون رمز مثل Gemini 3.1 Pro؟

النماذج المحلية الرئيسية في يونيو 2026 — Qwen3 وGemma 3 وLlama 3.1 وMistral Small 3.1 — تصل جميعها إلى 128K رمز كحد أقصى، وهو ما يكفي للغالبية العظمى من مهام المستندات الطويلة. يتطلب الاستدلال المحلي بـ1M رمز عتادًا متخصصًا (150+ GB من VRAM). للمستخدم العادي، Qwen3 14B مع سياق 128K هو الحل العملي.

ما مشكلة "lost in the middle" وكيف أتجنّبها؟

تُظهر الأبحاث أن نماذج LLM تسترجع بموثوقية المعلومات من بداية ونهاية نافذة السياق، لكنها تفقد تفاصيل المنتصف. لسياق 128K، المحتوى الموضوع في الرموز 40K-80K هو الأكثر عرضة للتجاهل. لتجنّبه: أبقِ المعلومات المهمة في بداية المطالبة، استخدم RAG لاسترجاع الأجزاء ذات الصلة فقط، أو عالج المستندات الطويلة في أقسام متداخلة من 16K-32K.

كيف أتحقق من طول السياق الذي يستخدمه Ollama؟

شغّل `ollama show <النموذج>` -- تسرد المخرجات المعاملات بما في ذلك num_ctx. إذا عرض 2048، فإن Ollama يستخدم القيمة الافتراضية، لا نافذة السياق الكاملة للنموذج. لتغييره بشكل دائم، أنشئ Modelfile بـPARAMETER num_ctx 32768 وشغّل ollama create <الاسم> -f Modelfile. تحقق من الجلسات النشطة بـollama ps.

أيهما أفضل للأسئلة والأجوبة حول المستندات: السياق الطويل أم RAG؟

عادةً ما يكون RAG أكثر فعالية وكفاءة في RAM من السياق الطويل للأسئلة والأجوبة حول المستندات. يسترجع RAG 3-5 أجزاء ذات صلة (4K-8K رمز إجمالًا) من مجموعة كبيرة ويتجنّب مشكلة "lost in the middle". السياق الطويل أفضل عندما يحتاج النموذج لفهم بنية المستند الكاملة أو عندما يكون الترتيب الدقيق والعلاقات بين الأقسام مهمة. لمعظم الأسئلة والأجوبة العملية حول المستندات، ابدأ بـRAG.

المصادر

هل تحتاج العتاد لتشغيل نماذج بسياق 128K+؟ ابدأ بدليل العتاد.

دليل عتاد LLM المحلي 2026 →

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs