Key Takeaways
- تدعم جميع نماذج 2026 الرئيسية — Qwen3 وGemma 3 وLlama 3.1 وMistral Small 3.1 — سياق 128K رمز أصليًا. السياق الطويل أصبح معيارًا أساسيًا، لا ميزة تنافسية.
- الفائز للمستخدم العادي: Qwen3 14B بكمية Q4_K_M. يعالج 128K رمز في ~12 GB من RAM بسرعة 15-25 رمز/ث على Apple M5 Pro. على أجهزة 8 GB، استخدم Qwen3 4B — نفس نافذة 128K بجودة أقل.
- تتوسّع RAM مع طول السياق وحجم النموذج معًا. نموذج 7B Q4_K_M يحتاج ~6 GB عند 4K و~14 GB عند 128K. Qwen3 14B Q4_K_M يستخدم ~12 GB عند 128K على Apple Silicon (يستفيد من الذاكرة الموحّدة).
- مشكلة "Lost in the Middle" لا تزال قائمة: تفقد نماذج LLM تفاصيل الأقسام الوسطى من السياق. التخفيف: أبقِ المعلومات الحرجة في بداية المطالبة، استخدم RAG للبحث، أو عالج في أجزاء متداخلة.
- يتفوّق السياق الطويل في التحليل الشمولي للمستندات الكاملة (قواعد الشيفرة، العقود، الكتب). يتفوّق RAG في مهام البحث المكثّف في مستندات كثيرة. اختر حسب نوع المهمة، لا حجم السياق فقط.
- يستخدم Ollama 2048 رمزًا افتراضيًا -- ليس 128K. اضبط num_ctx صراحةً في Modelfile للوصول إلى السياق الكامل. Apple M5 (16-32 GB، 200 GB/s) وM5 Pro (36-64 GB، 307 GB/s) يتعاملان مع استدلال 128K بكفاءة.
جميع نماذج LLM المحلية الكبرى في 2026 تدعم 128K رمز بشكل أصلي؛ Qwen3 14B Q4_K_M يعالج 128K في ~12 جيجابايت رام بسرعة 15–25 رمزاً/ثانية — لكن Ollama افتراضياً 2048 رمزاً فقط، لذا اضبط num_ctx دائماً في Modelfile.
طول السياق هو كمية النص التي يمكن للذكاء الاصطناعي "رؤيته" دفعة واحدة. 128K رمز ≈ 96,000 كلمة — ما يكفي لرواية كاملة. المشكلة: تنخفض دقة النماذج للمعلومات المدفونة في منتصف المدخلات الطويلة جداً (ظاهرة "Lost in the Middle"). ضع أهم معلوماتك في بداية المطالبة.
ما طول السياق ولماذا يهم لنماذج LLM المحلية؟
طول السياق هو الحد الأقصى لعدد الرموز التي يستطيع النموذج معالجتها في استدعاء استدلال واحد -- الحجم المجمّع للمدخلات (مستندك، سجل المحادثة، مطالبة النظام) والمخرجات (استجابة النموذج). رمز ≈ 0.75 كلمة بالعربية؛ 128K رمز ≈ 96,000 كلمة.
لحالات استخدام نماذج LLM المحلية، يتيح السياق الطويل: تلخيص كتب كاملة أو تقارير طويلة، تحليل قواعد شيفرة كاملة في مطالبة واحدة، معالجة ساعات من نصوص الاجتماعات، والحفاظ على سجلات محادثة طويلة دون فقدان السياق السابق.
التمييز الرئيسي هو بين طول السياق المُعلَن (ما تدعمه معمارية النموذج) وطول السياق العملي (حيث تبقى الجودة موثوقة). قد يدعم نموذج تقنيًا 128K رمز، لكنه يُظهر جودة متدهورة للمعلومات المقدّمة عند الرمز رقم 100K.
أي نماذج LLM المحلية تدعم سياق 128K رمز في 2026؟
| النموذج | نافذة السياق | الحد العملي | أمر Ollama |
|---|---|---|---|
| Qwen3 14B Q4_K_M | 128K | ~32-64K موثوق | ollama run qwen3:14b |
| Qwen3 4B Q4_K_M | 128K | ~16-32K موثوق | ollama run qwen3:4b |
| Gemma 3 12B Q4_K_M | 128K | ~32K موثوق | ollama run gemma3:12b |
| Llama 3.1 8B Q4_K_M | 128K | ~32K موثوق | ollama run llama3.1:8b |
| Llama 3.2 3B | 128K | ~16K موثوق | ollama run llama3.2:3b |
| Mistral Small 3.1 24B | 128K | ~32K موثوق | ollama run mistral-small3.1 |
| Qwen3 8B Q4_K_M | 128K | ~32K موثوق | ollama run qwen3:8b |
| DeepSeek-R1 14B Q4_K_M | 128K | ~32K موثوق | ollama run deepseek-r1:14b |

كم من RAM تحتاج معالجة السياق الطويل؟
يتوسّع استخدام RAM مع حجم النموذج وطول السياق معًا. تخزّن ذاكرة KV المؤقتة (ذاكرة المفتاح-القيمة) حالات الانتباه لجميع الرموز المعالَجة -- وتنمو خطيًا مع طول السياق.
اعتبارًا من أبريل 2026، يستخدم نموذج 7B في Q4_K_M بسياق 4K ~6 GB من RAM. النموذج نفسه بسياق 32K يستخدم ~8-9 GB من RAM. بسياق 128K: ~12-16 GB من RAM.
| Modelo | Contexto 4K | Contexto 32K | Contexto 128K |
|---|---|---|---|
| Llama 3.3 8B Q4_K_M | ~6 GB | ~9 GB | ~14 GB |
| Qwen3 14B Q4_K_M | ~9 GB | ~12 GB | ~18 GB |
| Mistral Small 3.1 24B Q4_K_M | ~14 GB | ~17 GB | ~24 GB |
| Llama 3.3 70B Q4_K_M | ~40 GB | ~45 GB | ~55 GB |

لماذا السياق العملي أقصر من الحد الأقصى المُعلَن؟
نماذج LLM المدرَّبة بترميزات موضعية RoPE (المستخدمة من Llama وQwen وMistral) تستطيع تقنيًا معالجة رموز حتى أقصى طول سياق لها، لكن الجودة تتدهور بنمط معروف يُسمى تأثير "lost in the middle".
تُظهر الأبحاث أن نماذج اللغة تستفيد بأفضل شكل من المعلومات في بداية ونهاية نافذة السياق. المعلومات الموضوعة في منتصف سياق طويل جدًا تُسترجَع بموثوقية أقل. عمليًا، نموذج بنافذة سياق 128K يستطيع الإجابة عن أسئلة حول محتوى أول 32K رمز وآخر 16K رمز بموثوقية، لكنه يفقد تفاصيل النطاق 40K-80K رمز.
للنماذج المحلية خصوصًا، يتوسّع الحد العملي الموثوق مع حجم النموذج: نماذج 3B ≈ 8K-16K موثوق؛ نماذج 7B-8B ≈ 16K-32K موثوق؛ نماذج 70B ≈ 64K موثوق. هذه تقديرات -- يعتمد الحد الفعلي على المهمة المحددة ومدى "أهمية" المعلومات المسترجَعة.
تتيح نوافذ السياق الطويل مدخلات أكثر، لكن بنية المطالبة تحدّد ما إذا كان النموذج يستخدم ذلك السياق بفعالية. تُغطّى تقنيات مثل RAG وتسلسل المطالبات واستراتيجيات إدارة نوافذ السياق في دليل هندسة المطالبات.
كيف يُضبَط طول السياق في Ollama؟
يستخدم Ollama 2048 رمز سياق افتراضيًا، ما لم يُضبَط بطريقة أخرى. لاستخدام نافذة السياق الكاملة للنموذج:
يحدّد حجم نافذة السياق مقدار النص الذي يستطيع النموذج معالجته، لكن بنية المطالبة تحدّد مدى فعالية استخدامه لذلك السياق. للتعمّق في سبب فقدان النماذج تتبّع المدخلات السابقة واستراتيجيات التخفيف، راجع نوافذ السياق مشروحة: لماذا ينسى الذكاء الاصطناعي.
# Set context length at runtime
ollama run llama3.2 --ctx 32768
# Or create a custom model with a Modelfile
cat << EOF > Modelfile
FROM llama3.1:8b
PARAMETER num_ctx 32768
EOF
ollama create llama3.1-32k -f Modelfile
ollama run llama3.1-32kنماذج LLM المحلية بالسياق الطويل: السياق الإقليمي
دول الخليج / السعودية PDPL: يصنّف نظام حماية البيانات الشخصية السعودي ولوائح الإمارات معالجة البيانات الشخصية على نطاق واسع كأمر يتطلب ضوابط. الاستدلال المحلي بالسياق الطويل لتحليل المستندات القانونية أو تلخيص السجلات الطبية أو معالجة مستندات الموارد البشرية يقع في هذا المستوى. التشغيل محليًا يلغي خطر معالج البيانات الطرف الثالث -- لا تغادر أي بيانات المؤسسة. تُتيح النماذج العربية السيادية مثل Jais وALLaM وFalcon معالجة مستندات عربية محلية بالكامل.
للإعداد الموصى به في المنطقة: نموذج 7B في Q4_K_M بسياق 32K (يتسع في 9-10 GB من RAM على محطة عمل قياسية) يوفّر جودة موثوقة لمستندات حتى 50 صفحة مع إبقاء جميع البيانات داخل المؤسسة. تُتيح النماذج العربية السيادية معالجة المستندات الحساسة باللغة العربية دون نقل بيانات عبر الحدود.
للمستندات الحكومية والمالية الحساسة في المنطقة: الاستدلال المحلي عبر Ollama دون مكالمات API خارجية يلبّي متطلب عدم معالجة البيانات الشخصية من قبل مزودي ذكاء اصطناعي خارجيين دون أساس قانوني صالح.
اليابان (METI): تتطلب المستندات اليابانية 1.5-2 ضعف الرموز مقارنة بالمستندات المكافئة بالإنجليزية بسبب اختلافات أداة الترميز. تقرير ياباني من 50 صفحة قد يستهلك 25K-35K رمز -- ضمن النطاق الموثوق لـQwen3 7B (الحد العملي 32K) لكنه يتطلب إعداد سياق صريحًا في Ollama: PARAMETER num_ctx 32768. للمستندات القانونية والمالية باليابانية، Qwen3 14B في Q4_K_M بسياق 32K (~12 GB من RAM) يقدّم أفضل نسبة جودة/RAM لمعالجة السياق الطويل باليابانية. تعالج أداة الترميز الأصلية لليابانية في Qwen3 النص الياباني بكفاءة أعلى بنسبة 30-40% من Llama.
الصين: بموجب قانون أمن البيانات الصيني (数据安全法)، تتطلب معالجة المستندات الحساسة عبر واجهات API السحابية امتثالًا تنظيميًا إضافيًا. الاستدلال المحلي بالسياق الطويل عبر Qwen3 (Alibaba) يُبقي كل محتوى المستندات داخل المؤسسة. لمعالجة المستندات المؤسسية بالصينية، Qwen3 72B بسياق 32K على محطة عمل محلية (~45 GB من RAM) يقدّم جودة شبه مكافئة للسحابة مع سيادة بيانات كاملة. تجعله أداة الترميز الأصلية للصينية في Qwen3 أكفأ بنسبة 30-40% من Llama للمستندات الصينية.
أخطاء شائعة مع نماذج LLM المحلية بالسياق الطويل
- افتراض أن سياق 128K يعمل بنفس جودة 4K: تأثير "lost in the middle" يعني أن المعلومات المقدّمة قبل 30K-80K رمز تُسترجَع بموثوقية أقل من المعلومات في البداية أو النهاية. لتحليل المستندات الحرجة، قسّم المستندات الطويلة إلى أقسام من 16K-32K وعالج كلًّا منها بشكل منفصل بدلًا من تغذية مستند 100K كامل دفعة واحدة.
- عدم زيادة حجم السياق الافتراضي لـOllama: يستخدم Ollama 2048 رمز سياق افتراضيًا بغض النظر عن الحد الأقصى للنموذج. محادثة تتجاوز 2048 رمزًا ستقتطع الرسائل السابقة. اضبط دائمًا num_ctx صراحةً: أضف PARAMETER num_ctx 32768 إلى Modelfile أو استخدم --ctx في وقت التشغيل.
- تشغيل السياق الطويل بـRAM غير كافية: نموذج 7B بسياق 128K على 8 GB من RAM إجمالًا يسبب استخدام swap شديدًا. أوزان النموذج (~4.5 GB) زائد ذاكرة KV المؤقتة لـ128K (~8+ GB) تتجاوز 8 GB. قلّل السياق إلى 32K (يتسع في ~9 GB) أو استخدم 16+ GB من RAM لاستدلال بسياق 128K.
- نسيان أن سرعة التوليد ليست عامل زمن الاستجابة الوحيد مع السياق الطويل: بسياق 32K، الوقت حتى الرمز الأول (TTFT) قد يكون 5-15 ثانية على عتاد استهلاكي -- يجب على النموذج معالجة 32K رمز إدخال قبل توليد رمز مخرج واحد. تتوسّع مرحلة prefill هذه خطيًا مع طول السياق. للاستخدام التفاعلي، حدّد السياق بـ8K-16K. احتفظ بسياقات 32K+ للمعالجة بالدفعات حيث يكون TTFT مقبولًا.
- استخدام RAG حيث السياق الطويل هو الأداة الصحيحة (والعكس): RAG أفضل للبحث في مستندات كثيرة. السياق الطويل أفضل عندما تحتاج للنموذج أن يستدل حول مستند كامل ومتماسك -- عقد، قاعدة شيفرة، فصل كتاب -- حيث يكسر فقدان أي جزء التحليل. تقسيم عقد قانوني من 10 صفحات إلى أجزاء لـRAG قد يسبب أخطاء إحالات متقاطعة يتجنّبها السياق الطويل. اختر حسب نوع المهمة، لا التفضيل الافتراضي.
الأسئلة الشائعة
هل يمكنني تلخيص كتاب كامل بنموذج LLM محلي؟
كتاب نموذجي من 300 صفحة يضم 90,000-120,000 كلمة -- قرابة 120K-160K رمز. يتجاوز هذا السياق العملي الموثوق لمعظم نماذج 7B ويتطلب نموذج 70B (64K موثوق) أو معالجة بالأجزاء. لنماذج 7B، قسّم الكتاب إلى فصول من 20 ألف كلمة، ولخّص كلًّا منها، ثم لخّص ملخصات الفصول.
كم صفحة نص تتسع في 32K رمز؟
قرابة 50-70 صفحة من نص قياسي (250 كلمة لكل صفحة). يستطيع سياق 32K رمز احتواء رواية قصيرة أو ورقة بحثية كاملة مع ملاحق أو مستند مواصفات تقني كامل.
هل زيادة طول السياق تُبطئ الاستدلال؟
نعم -- معالجة سياق 32K تستغرق قرابة 3-4 أضعاف معالجة سياق 4K على العتاد نفسه، بسبب التوسّع التربيعي لحساب الانتباه. سرعة التوليد (الرموز في الثانية) لا تتأثر بشكل كبير، لكن الوقت حتى الرمز الأول (TTFT) يتوسّع مع طول المدخلات.
أي نموذج LLM محلي يتعامل مع RAG أفضل من السياق الطويل؟
لمهام البحث واسترجاع المستندات، عادةً ما يكون RAG (التوليد المعزَّز بالاسترجاع) أكثر فعالية من تغذية المستندات الكاملة كسياق. يسترجع RAG أكثر 3-5 أجزاء صلة من مجموعة مستندات كبيرة ويقدّم تلك فقط للنموذج. يستخدم هذا 4K-8K رمز سياق ويتجنّب مشكلة "lost in the middle". أدوات مثل GPT4All LocalDocs وLlamaIndex تنفّذ RAG محلي.
ما هي ذاكرة KV المؤقتة ولماذا تنمو مع طول السياق؟
تخزّن ذاكرة KV المؤقتة (ذاكرة المفتاح-القيمة) حالات الانتباه لكل رمز معالَج في نافذة السياق. يتطلب كل رمز مقدارًا ثابتًا من الذاكرة لمتجهات المفتاح والقيمة الخاصة به -- لذلك يتطلب سياق 32K ذاكرة KV مؤقتة أكبر بـ8 مرات من سياق 4K. لهذا يحتاج نموذج 7B في Q4_K_M ~6 GB لسياق 4K، لكن ~9 GB لسياق 32K. أوزان النموذج لا تتغير -- تنمو ذاكرة KV المؤقتة فقط.
هل تستطيع النماذج المحلية التعامل مع سياقات مليون رمز مثل Gemini 3.1 Pro؟
النماذج المحلية الرئيسية في يونيو 2026 — Qwen3 وGemma 3 وLlama 3.1 وMistral Small 3.1 — تصل جميعها إلى 128K رمز كحد أقصى، وهو ما يكفي للغالبية العظمى من مهام المستندات الطويلة. يتطلب الاستدلال المحلي بـ1M رمز عتادًا متخصصًا (150+ GB من VRAM). للمستخدم العادي، Qwen3 14B مع سياق 128K هو الحل العملي.
ما مشكلة "lost in the middle" وكيف أتجنّبها؟
تُظهر الأبحاث أن نماذج LLM تسترجع بموثوقية المعلومات من بداية ونهاية نافذة السياق، لكنها تفقد تفاصيل المنتصف. لسياق 128K، المحتوى الموضوع في الرموز 40K-80K هو الأكثر عرضة للتجاهل. لتجنّبه: أبقِ المعلومات المهمة في بداية المطالبة، استخدم RAG لاسترجاع الأجزاء ذات الصلة فقط، أو عالج المستندات الطويلة في أقسام متداخلة من 16K-32K.
كيف أتحقق من طول السياق الذي يستخدمه Ollama؟
شغّل `ollama show <النموذج>` -- تسرد المخرجات المعاملات بما في ذلك num_ctx. إذا عرض 2048، فإن Ollama يستخدم القيمة الافتراضية، لا نافذة السياق الكاملة للنموذج. لتغييره بشكل دائم، أنشئ Modelfile بـPARAMETER num_ctx 32768 وشغّل ollama create <الاسم> -f Modelfile. تحقق من الجلسات النشطة بـollama ps.
أيهما أفضل للأسئلة والأجوبة حول المستندات: السياق الطويل أم RAG؟
عادةً ما يكون RAG أكثر فعالية وكفاءة في RAM من السياق الطويل للأسئلة والأجوبة حول المستندات. يسترجع RAG 3-5 أجزاء ذات صلة (4K-8K رمز إجمالًا) من مجموعة كبيرة ويتجنّب مشكلة "lost in the middle". السياق الطويل أفضل عندما يحتاج النموذج لفهم بنية المستند الكاملة أو عندما يكون الترتيب الدقيق والعلاقات بين الأقسام مهمة. لمعظم الأسئلة والأجوبة العملية حول المستندات، ابدأ بـRAG.
المصادر
- Lost in the Middle: How Language Models Use Long Contexts -- Liu et al., 2023
- Ollama Context Length Configuration -- توثيق Ollama
- Llama 3.3 Technical Report -- Meta AI, 2024
- EU AI Act Official Text -- البرلمان الأوروبي، 2024
