Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/هندسة الأوامر لنماذج ⁨LLM⁩ المحلية ⁨2026⁩: ⁨CoT⁩ و⁨Few-Shot⁩
Advanced Techniques

هندسة الأوامر لنماذج ⁨LLM⁩ المحلية ⁨2026⁩: ⁨CoT⁩ و⁨Few-Shot⁩

·11 دقيقة قراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

تستجيب نماذج LLM المحلية (النماذج بحجم 7B-13B) للأوامر بشكل مختلف عن واجهات API السحابية. فهي تحتاج إلى بنية صريحة وتعليمات أوضح واعتماد أقل على التعلّم في السياق.

تستجيب النماذج المحلية بحجم 7B–13B للأوامر بشكل مختلف عن GPT-5.2 أو Claude. فهي تحتاج إلى بنية صريحة وتعليمات أوضح و3–5 أمثلة few-shot حيث تكتفي النماذج السحابية بمثال أو مثالين. في أبريل 2026، تشمل التقنيات المثبتة أمر سلسلة التفكير (Chain-of-Thought) (+10–20% دقة)، وتعريف الأدوار، وتنسيق المخرجات المنظم (JSON)، وإعداد أمر النظام في Ollama وLM Studio.

Key Takeaways

  • تحتاج النماذج المحلية بحجم 7B إلى توجيه أكثر صراحة من GPT-5.5. أوامر أطول وتعليمات أوضح.
  • أمر سلسلة التفكير ("دعني أفكر خطوة بخطوة") يحسّن دقة الاستدلال بنسبة 10–20%.
  • حدّد دائمًا تنسيق المخرجات (JSON أو Markdown أو نص عادي). المخرجات بلا بنية غير متوقعة.
  • أمثلة few-shot (1–3) تعمل بشكل أفضل من zero-shot في النماذج المحلية. مزيد من الأمثلة = اتساق أعلى.
  • تعريف الأدوار ("أنت خبير في Python") يحسّن الإجابات الخاصة بالمجال.

حقائق سريعة

  • تحسّن الدقة مع CoT: تحسّن بنسبة 10–20% في مهام الاستدلال
  • متطلب few-shot: تحتاج النماذج المحلية بحجم 7B إلى 3–5 أمثلة مقابل 1–2 في واجهات API السحابية
  • استهلاك السياق: كل مثال يستخدم 50–200 token
  • تأثير Temperature: خفضها من 0.8 إلى 0.3 يحسّن الدقة الواقعية بنسبة 15–25%
  • فرق حجم النموذج: تحتاج النماذج بحجم 7B إلى توجيه أكثر صراحة من النماذج بحجم 70B
  • اتساق تنسيق المخرجات: مواصفات JSON تحسّن الموثوقية بنسبة 30–40%

بماذا تختلف النماذج المحلية؟

AspectoGPT-5.2 (ChatGPT Plus)Local 7B (Llama 3.3 8B)Local 70B (Llama 3.3)
نافذة السياق128K token4K–128K token128K token
اتباع التعليماتممتازجيد مع الأوامر الصريحةجيد جدًا
التعلّم few-shotمثال أو مثالان3–5 أمثلة مطلوبة2–3 أمثلة
الاستدلالضمني متعدد الخطواتخطوة بخطوة صريح مطلوبضمني معتدل
أمر النظاممُدار عبر APIيُضبط حسب الأداةيُضبط حسب الأداة
Temperature الافتراضية1.0 (API)0.8 (افتراضي Ollama)0.8 (افتراضي Ollama)

كيف يحسّن أمر سلسلة التفكير الدقة؟

أمر سلسلة التفكير (CoT) يطلب من نموذج LLM إظهار استدلاله خطوة بخطوة قبل الإجابة. هذه التقنية فعّالة بشكل خاص للنماذج المحلية بحجم 7B–13B لأنها تفتقر إلى قدرة الاستدلال الضمني لدى النماذج السحابية الأكبر. لمسألة حسابية مثل "17 × 24"، غالبًا ما تجيب النماذج المحلية دون CoT بشكل خاطئ. مع الاستدلال الصريح خطوة بخطوة، تُجزّئ المسألة إلى أجزاء وتبلغ دقة أعلى بنسبة 10–20%.

بدون CoT: "كم يساوي 17 × 24؟" ← يجيب النموذج مباشرة، وغالبًا بشكل خاطئ.

مع CoT: "حلّ هذا خطوة بخطوة: 17 × 24" ← يُظهر النموذج: 17 × 20 = 340، 17 × 4 = 68، الإجمالي = 408. أكثر دقة.

تعرّف على كيفية امتداد هذه التقنية إلى وكلاء الذكاء الاصطناعي المحليين الذين يستخدمون الاستدلال داخليًا لاختيار الأدوات.

يوجّه أمر سلسلة التفكير النموذج لتجزئة الاستدلال إلى خطوات صريحة قبل الإجابة، مما يحسّن الدقة بنسبة 10–20% في المهام المعقدة.

python
# Prompt con CoT
prompt = """
You will answer a question by thinking step-by-step.
Let me think about this:

Question: Why do local LLMs require more explicit prompting than cloud APIs?

Thinking:
1. First, consider the differences in model size...
2. Then, think about training data and fine-tuning...
3. Finally, consider the architecture and inference optimization...

Answer:
"""

# This guides the model to reason through the problem

💡: نصيحة محترف: يعمل CoT بشكل أفضل عندما تبدأ المخرجات باستدلال جزئي. مثال: "دعني أُجزّئ هذا خطوة بخطوة: أولًا، ألاحظ..."

لماذا يُعد تحديد تنسيق المخرجات حاسمًا في النماذج المحلية؟

تحديد تنسيق المخرجات الدقيق (JSON أو Markdown أو نص عادي) حاسم للنماذج المحلية لأنها تنتج مخرجات غير متوقعة بدون تعليمات صريحة. يمكن للنماذج السحابية مثل GPT-5.5 استنتاج النية من طلبات غامضة؛ أما النماذج المحلية بحجم 7B–13B فلا تستطيع. بالنسبة إلى أنظمة RAG المحلية التي تحتاج إلى استخراج منظم للمستندات، تمنع مواصفات تنسيق JSON أخطاء التحليل وترفع دقة الاستخراج بنسبة 30–40%.

مثال: "استخرج الكيانات من النص" قد يعيد نصًا سرديًا بدلًا من قائمة.

أفضل: "استخرج الكيانات بصيغة JSON بمفاتيح: شخص، مكان، منظمة".

python
# Bad: ambiguous output
prompt = "Summarize this text"

# Good: explicit format
prompt = """
Summarize the text in EXACTLY 3 bullet points.
Format as a JSON list:
{
  "summary": [
    "- Point 1",
    "- Point 2",
    "- Point 3"
  ]
}
"""

⚠️: مشكلة شائعة: ترفض النماذج المحلية أحيانًا توليد JSON خالص. أضف "أخرج JSON فقط، بدون كتل markdown" إلى الأمر لتجنّب ذلك.

كيف يحسّن تعيين الأدوار إجابات النماذج المحلية؟

تعيين دور محدد ("أنت خبير في Python بخبرة 10 سنوات") يحسّن بشكل كبير الإجابات الخاصة بالمجال مقارنةً بالأوامر العامة. هذه التقنية، المسماة أمر الشخصية (persona prompting)، تعمل عبر تثبيت توليد إجابات النموذج على مجال خبرة محدد. تستجيب النماذج المحلية لتعريف الأدوار بنسبة 15–25% أفضل من النماذج السحابية، لأنها تفتقر إلى محاذاة RLHF القوية التي تتيح للأوامر العامة أن تعمل. أمثلة:

  • "أنت خبير في Python" ← شروحات كود أفضل
  • "أنت باحث طبي" ← إجابات حيوية طبية أكثر تفصيلًا
  • "أنت محلل متشكّك" ← تفكير أكثر نقدًا

اجمع تعريف الأدوار مع fine-tuning لمحاذاة مجال أعلى إذا نشرت في حالات استخدام متعددة.

بعبارة بسيطة، يُخبر أمر الشخصية النموذج بأي "قبعة" يرتديها عند الإجابة. قبعة خبير Python تنتج كودًا مختلفًا (وأفضل) من قبعة مساعد عام.

🎯: ممارسة جيدة: التحديد مهم. "أنت خبير" ضعيف؛ "أنت خبير في Python بخبرة 10 سنوات في الواجهة الخلفية، متخصص في أنماط async/await" قوي.

كيف يُضبط أمر النظام في Ollama وLM Studio وllama.cpp؟

يحدد أمر النظام دور النموذج وقيوده قبل رسالة المستخدم، وكل أداة (Ollama وLM Studio وllama.cpp) تتطلب تنسيقًا مختلفًا لضبطه.

bash
# Ollama (Modelfile)
FROM llama3.1:8b
SYSTEM """You are a Python expert with 10 years experience. Answer only Python questions. Provide code examples. Use type hints."""
PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER repeat_penalty 1.1

# Ollama (API / OpenAI SDK)
response = client.chat.completions.create(
  model="llama3.1:8b",
  messages=[
    {"role": "system", "content": "You are a Python expert..."},
    {"role": "user", "content": "Write a FastAPI endpoint"}
  ],
  temperature=0.7
)

# LM Studio (GUI)
# Settings → System Prompt field (paste your prompt)
# Or via API at localhost:1234 — identical format to Ollama

# llama.cpp (CLI)
./main -m llama-3.1-8b.gguf \
  --system-prompt "You are a Python expert..." \
  --temp 0.7 --top-p 0.9 --repeat-penalty 1.1 \
  -p "Write a FastAPI endpoint"

كيف تؤثر Temperature ومعاملات أخذ العينات في جودة المخرجات؟

ضبط Temperature وtop_p وrepeat_penalty له تأثير على جودة مخرجات النماذج المحلية بحجم 7B أكبر من صياغة الأمر، وتتطلب النماذج المحلية قيمًا افتراضية مختلفة عن واجهات API السحابية.

المفتاح للنماذج المحلية: قيمة Temperature الافتراضية في Ollama (0.8) أعلى من القيمة الافتراضية في API الخاص بـ OpenAI (1.0 مع أخذ عينات nucleus). خفض Temperature إلى 0.3–0.5 يحسّن بشكل كبير الدقة الواقعية في النماذج المحلية بحجم 7B. لمهام البرمجة، اضبط Temperature على 0.1–0.2 وrepeat_penalty على 1.0 (يحتاج الكود إلى أنماط متكررة مثل الاستيرادات واستدعاءات الدوال).

ParámetroQué controlaPor defecto (Ollama)Recomendado
temperatureالعشوائية0.80.3–0.5 للواقعية، 0.7–0.9 للإبداع
top_pتنوع المفردات0.90.8 للاتساق، 0.95 للتنوع
repeat_penaltyتجنّب التكرار1.11.1–1.2 للدردشة، 1.0 للكود

📌: نقطة رئيسية: Temperature مُضاعِف على logits. عند 0.0، يُختار دائمًا الـ token الأعلى احتمالًا. فوق 1.0، تزداد العشوائية. تتشبّع النماذج المحلية فوق قيمة Temperature 1.5.

لماذا تحتاج النماذج المحلية إلى أمثلة few-shot أكثر من واجهات API السحابية؟

تقديم 3–5 أمثلة (التعلّم few-shot) للنماذج المحلية يحسّن اتساق المخرجات بنسبة 15–25% أكثر من zero-shot، بينما تحتاج النماذج السحابية إلى مثال أو مثالين فقط.

تستفيد النماذج المحلية من مزيد من الأمثلة لأن لديها معاملات أقل وبيانات تدريب أقل تنوعًا. التعلّم few-shot تقنية تعلّم في السياق تُظهر للنموذج نمط الإدخال/الإخراج المتوقع قبل أن تطلب منه حل المهمة الفعلية.

python
# Few-shot prompt
prompt = """
Classify sentiment. Examples:

"I love this product!" → positive
"Worst experience ever" → negative
"It's okay, nothing special" → neutral

Now classify: "This is amazing!"
Answer: """

# Model learns format and style from examples

🛠️: نصيحة تنفيذ: تنويع الأمثلة (1 سهل، 1 متوسط، 1 صعب) يعمل بشكل أفضل من استخدام 3 متشابهة. التنوع يحسّن التعميم ويتجنّب الإفراط في الملاءمة لأنماط محددة.

الأخطاء الشائعة في هندسة الأوامر

  • أوامر طويلة بلا بنية. التعليمات المبعثرة تُربك النماذج المحلية. كن موجزًا وصريحًا.
  • عدم استخدام سلسلة التفكير. يحسّن CoT الدقة بنسبة 10–20%. استخدمه دائمًا في مهام الاستدلال.
  • افتراض أن أمرًا واحدًا يصلح للكل. كرّر واختبر. تغييرات الصياغة الصغيرة تُسبب تباينات كبيرة في المخرجات.
  • تجاهل تنسيق المخرجات. بدون تحديد صريح للتنسيق، تكون المخرجات غير متوقعة.
  • استخدام تعريفات أدوار غامضة. "أنت خبير" غامض. "أنت خبير في Python بخبرة 10 سنوات" أفضل.

📍: هل تعلم؟ أكثر الأوامر فاعلية تمر بـ 3–5 إصدارات. أمر النماذج المحلية ليس "اضبط وانسَ": التحسينات الصغيرة تتراكم لتحقق مكاسب دقة كبيرة.

اعتبارات إقليمية لهندسة الأوامر

الاتحاد الأوروبي (GDPR): عند نشر هندسة الأوامر للنماذج المحلية على بنية تحتية في الاتحاد الأوروبي، تأكد من أن جميع بيانات التدريب المستخدمة لتكرار الأوامر تمتثل لمبادئ تقليل البيانات في GDPR. لا تُصدّر استعلامات المستخدمين إلى واجهات API خارجية للاختبار؛ كرّر محليًا.

الخليج (PDPL السعودي وحماية البيانات الإماراتية): يجب على الشركات التي تستخدم نماذج LLM محلية لبيانات العملاء تطبيق تسجيل تدقيق صريح لجميع الأوامر والإجابات. جودة الأمر تؤثر مباشرة في أمان البيانات: الأوامر سيئة التصميم قد تكشف معلومات حساسة في المخرجات. تُفضَّل النماذج العربية السيادية مثل Jais وALLaM وFalcon لمحاذاة المجال الإقليمي.

الصين (قانون أمن البيانات 2021): يجب أن تُبقي عمليات نشر نماذج LLM المحلية في الصين القارية كل الاستدلال والأوامر وضبط النماذج داخل المؤسسة. يُفضَّل Qwen وغيره من النماذج المحلية لضمان الامتثال لإقامة البيانات.

الأسئلة الشائعة حول أمر نماذج LLM المحلية

لماذا تحتاج نماذج LLM المحلية إلى أوامر أكثر صراحة من GPT-5.5؟

تمتلك النماذج المحلية بحجم 7B–13B معاملات أقل وبيانات تدريب أقل تنوعًا من GPT-5.5 (يُقدّر بـ 1.8T معامل). لا تستطيع استنتاج النية الغامضة بنفس الكفاءة. التعليمات الصريحة — التنسيق والدور والاستدلال خطوة بخطوة — تعوّض هذا الفرق. أمر سلسلة التفكير يحسّن دقة النماذج المحلية بنسبة 10–20% في مهام الاستدلال.

كم عدد أمثلة few-shot التي يجب تضمينها في أوامر نماذج LLM المحلية؟

3–5 أمثلة هي الأمثل للنماذج المحلية بحجم 7B. عادةً ما يكتفي GPT-5.5 بمثال أو مثالين. مزيد من الأمثلة يحسّن الاتساق لكنه يستهلك tokens من نافذة السياق (4K–32K token حسب النموذج). بالنسبة إلى Llama 3.2 8B بنافذة سياق 4K، اقتصر على 3 أمثلة بالإضافة إلى مهمتك. للنماذج بسياق 32K+، 5 أمثلة آمنة.

هل يعمل أمر سلسلة التفكير مع جميع النماذج المحلية؟

تعمل سلسلة التفكير مع أي نموذج مضبوط بالتعليمات (Llama 3.x وQwen 3 وMistral Small). النماذج الأساسية (بدون ضبط بالتعليمات) لا تتبع تعليمات "فكّر خطوة بخطوة" بشكل موثوق. للنماذج المحلية، تعمل عبارات CoT مثل "حلّ هذا خطوة بخطوة:" أو "الاستدلال:" في بداية المخرجات المتوقعة بشكل أفضل.

ما تنسيق المخرجات الأكثر موثوقية لنماذج LLM المحلية؟

JSON هو تنسيق المخرجات المنظم الأكثر موثوقية لنماذج LLM المحلية. حدّد مخطط JSON الدقيق في الأمر: "أجب بكائن JSON فقط بمفاتيح: الاسم، الدرجة، الاستدلال." عناوين Markdown (##) موثوقة للأقسام. تجنّب طلب XML أو تنسيقات مخصصة: تتعامل معها النماذج المحلية بشكل غير متسق.

كيف أمنع نموذج LLM محليًا من الخروج عن الموضوع؟

أضف قيدًا صريحًا إلى أمر النظام أو أمر التعليمات: "أجب فقط حول [الموضوع]. إذا سُئلت عن شيء آخر، قل: لا أستطيع المساعدة إلا في [الموضوع]." بالنسبة إلى Ollama، استخدم حقل أمر النظام. بالنسبة إلى llama.cpp، ضعه كرسالة نظام في البداية. هذا التحديد يعمل بشكل أفضل بكثير في النماذج المحلية بحجم 7B منه في النماذج السحابية ذات محاذاة RLHF الأقوى.

ما الفرق بين أمر zero-shot وfew-shot للنماذج المحلية؟

zero-shot لا يقدّم أي مثال: "صنّف هذا البريد كرسالة مزعجة أو غير مزعجة." few-shot يقدّم 2–5 أمثلة موسومة قبل المهمة. بالنسبة إلى النماذج المحلية بحجم 7B، يتفوق few-shot باستمرار على zero-shot في مهام التصنيف والاستخراج بدقة أعلى 15–25%. يعمل zero-shot جيدًا في مهام التوليد (التلخيص والترجمة) حيث يكون التنسيق أقل أهمية.

كيف أختبر الأوامر وأكرّرها للنماذج المحلية؟

اختبر بـ 5–10 أمثلة متنوعة. غيّر متغيرًا واحدًا في كل مرة (الدور أو التنسيق أو تعليمة CoT). قِس الدقة أو الاتساق قبل/بعد. استخدم مجموعة اختبار بسيطة: 2–3 أمثلة سهلة، 2–3 أمثلة صعبة. سجّل أي إصدارات الأوامر تعمل بشكل أفضل. كرّر في دورات من 3–5 تنويعات للأمر. وثّق الأوامر الناجحة في مكتبة أوامر لإعادة استخدامها.

هل ينبغي اللجوء إلى هندسة الأوامر أم fine-tuning لمهمة محددة؟

ابدأ بهندسة الأوامر أولًا (سريعة ومجانية وتكرارية). إذا توقفت الدقة عن التحسّن بعد 20+ تنويعًا للأمر، فعندئذٍ استخدم fine-tuning. يتطلب fine-tuning 500+ مثالًا خاصًا بالمهمة و1–4 ساعات من وقت التدريب، لكنه يحقق مكاسب دقة بنسبة 10–20%. للمهام العامة، تكفي هندسة الأوامر غالبًا. للمهام الخاصة بالمجال (الطبي والقانوني والبرمجة)، يقدّم fine-tuning تحسينات دائمة.

بماذا تختلف أوامر النظام عن تعليمات المستخدم في نماذج LLM المحلية؟

تحدد أوامر النظام دور النموذج وقيوده قبل رسالة المستخدم وتشكّل جزءًا من بنية الطلب (في Ollama أو LM Studio أو عبر API). تعليمات المستخدم جزء من المحادثة. تُرسي أوامر النظام السلوك الأساسي وهي أكثر موثوقية من تضمين التعليمات في رسائل المستخدم. للنماذج المحلية، أمر نظام جيد الصياغة يحسّن الاتساق بنسبة 15–25% لأن النموذج يُعطي الأولوية للقيود على مستوى النظام على النص على مستوى المستخدم.

هل يمكنني استخدام الأمر نفسه عبر نماذج محلية مختلفة؟

جزئيًا. تنتقل بنية CoT الأساسية وتعريفات الأدوار بين النماذج (Llama وQwen وMistral). ومع ذلك، يتطلب كل نموذج ضبط الأمر لنتائج مثلى. تستجيب نماذج Llama لـ "دعني أفكر خطوة بخطوة"، بينما تفضّل نماذج Qwen "أولًا، أحتاج إلى...". اختبر أمرك على النموذج الدقيق الذي ستنشره. النماذج الأكبر (70B) أكثر تسامحًا مع تنويعات الأمر من النماذج الأصغر (7B).

المصادر

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs