Key Takeaways
- تحتاج النماذج المحلية بحجم 7B إلى توجيه أكثر صراحة من GPT-5.5. أوامر أطول وتعليمات أوضح.
- أمر سلسلة التفكير ("دعني أفكر خطوة بخطوة") يحسّن دقة الاستدلال بنسبة 10–20%.
- حدّد دائمًا تنسيق المخرجات (JSON أو Markdown أو نص عادي). المخرجات بلا بنية غير متوقعة.
- أمثلة few-shot (1–3) تعمل بشكل أفضل من zero-shot في النماذج المحلية. مزيد من الأمثلة = اتساق أعلى.
- تعريف الأدوار ("أنت خبير في Python") يحسّن الإجابات الخاصة بالمجال.
حقائق سريعة
- تحسّن الدقة مع CoT: تحسّن بنسبة 10–20% في مهام الاستدلال
- متطلب few-shot: تحتاج النماذج المحلية بحجم 7B إلى 3–5 أمثلة مقابل 1–2 في واجهات API السحابية
- استهلاك السياق: كل مثال يستخدم 50–200 token
- تأثير Temperature: خفضها من 0.8 إلى 0.3 يحسّن الدقة الواقعية بنسبة 15–25%
- فرق حجم النموذج: تحتاج النماذج بحجم 7B إلى توجيه أكثر صراحة من النماذج بحجم 70B
- اتساق تنسيق المخرجات: مواصفات JSON تحسّن الموثوقية بنسبة 30–40%
بماذا تختلف النماذج المحلية؟
| Aspecto | GPT-5.2 (ChatGPT Plus) | Local 7B (Llama 3.3 8B) | Local 70B (Llama 3.3) |
|---|---|---|---|
| نافذة السياق | 128K token | 4K–128K token | 128K token |
| اتباع التعليمات | ممتاز | جيد مع الأوامر الصريحة | جيد جدًا |
| التعلّم few-shot | مثال أو مثالان | 3–5 أمثلة مطلوبة | 2–3 أمثلة |
| الاستدلال | ضمني متعدد الخطوات | خطوة بخطوة صريح مطلوب | ضمني معتدل |
| أمر النظام | مُدار عبر API | يُضبط حسب الأداة | يُضبط حسب الأداة |
| Temperature الافتراضية | 1.0 (API) | 0.8 (افتراضي Ollama) | 0.8 (افتراضي Ollama) |
كيف يحسّن أمر سلسلة التفكير الدقة؟
أمر سلسلة التفكير (CoT) يطلب من نموذج LLM إظهار استدلاله خطوة بخطوة قبل الإجابة. هذه التقنية فعّالة بشكل خاص للنماذج المحلية بحجم 7B–13B لأنها تفتقر إلى قدرة الاستدلال الضمني لدى النماذج السحابية الأكبر. لمسألة حسابية مثل "17 × 24"، غالبًا ما تجيب النماذج المحلية دون CoT بشكل خاطئ. مع الاستدلال الصريح خطوة بخطوة، تُجزّئ المسألة إلى أجزاء وتبلغ دقة أعلى بنسبة 10–20%.
بدون CoT: "كم يساوي 17 × 24؟" ← يجيب النموذج مباشرة، وغالبًا بشكل خاطئ.
مع CoT: "حلّ هذا خطوة بخطوة: 17 × 24" ← يُظهر النموذج: 17 × 20 = 340، 17 × 4 = 68، الإجمالي = 408. أكثر دقة.
تعرّف على كيفية امتداد هذه التقنية إلى وكلاء الذكاء الاصطناعي المحليين الذين يستخدمون الاستدلال داخليًا لاختيار الأدوات.
يوجّه أمر سلسلة التفكير النموذج لتجزئة الاستدلال إلى خطوات صريحة قبل الإجابة، مما يحسّن الدقة بنسبة 10–20% في المهام المعقدة.
# Prompt con CoT
prompt = """
You will answer a question by thinking step-by-step.
Let me think about this:
Question: Why do local LLMs require more explicit prompting than cloud APIs?
Thinking:
1. First, consider the differences in model size...
2. Then, think about training data and fine-tuning...
3. Finally, consider the architecture and inference optimization...
Answer:
"""
# This guides the model to reason through the problem•💡: نصيحة محترف: يعمل CoT بشكل أفضل عندما تبدأ المخرجات باستدلال جزئي. مثال: "دعني أُجزّئ هذا خطوة بخطوة: أولًا، ألاحظ..."
لماذا يُعد تحديد تنسيق المخرجات حاسمًا في النماذج المحلية؟
تحديد تنسيق المخرجات الدقيق (JSON أو Markdown أو نص عادي) حاسم للنماذج المحلية لأنها تنتج مخرجات غير متوقعة بدون تعليمات صريحة. يمكن للنماذج السحابية مثل GPT-5.5 استنتاج النية من طلبات غامضة؛ أما النماذج المحلية بحجم 7B–13B فلا تستطيع. بالنسبة إلى أنظمة RAG المحلية التي تحتاج إلى استخراج منظم للمستندات، تمنع مواصفات تنسيق JSON أخطاء التحليل وترفع دقة الاستخراج بنسبة 30–40%.
مثال: "استخرج الكيانات من النص" قد يعيد نصًا سرديًا بدلًا من قائمة.
أفضل: "استخرج الكيانات بصيغة JSON بمفاتيح: شخص، مكان، منظمة".
# Bad: ambiguous output
prompt = "Summarize this text"
# Good: explicit format
prompt = """
Summarize the text in EXACTLY 3 bullet points.
Format as a JSON list:
{
"summary": [
"- Point 1",
"- Point 2",
"- Point 3"
]
}
"""•⚠️: مشكلة شائعة: ترفض النماذج المحلية أحيانًا توليد JSON خالص. أضف "أخرج JSON فقط، بدون كتل markdown" إلى الأمر لتجنّب ذلك.
كيف يحسّن تعيين الأدوار إجابات النماذج المحلية؟
تعيين دور محدد ("أنت خبير في Python بخبرة 10 سنوات") يحسّن بشكل كبير الإجابات الخاصة بالمجال مقارنةً بالأوامر العامة. هذه التقنية، المسماة أمر الشخصية (persona prompting)، تعمل عبر تثبيت توليد إجابات النموذج على مجال خبرة محدد. تستجيب النماذج المحلية لتعريف الأدوار بنسبة 15–25% أفضل من النماذج السحابية، لأنها تفتقر إلى محاذاة RLHF القوية التي تتيح للأوامر العامة أن تعمل. أمثلة:
- "أنت خبير في Python" ← شروحات كود أفضل
- "أنت باحث طبي" ← إجابات حيوية طبية أكثر تفصيلًا
- "أنت محلل متشكّك" ← تفكير أكثر نقدًا
اجمع تعريف الأدوار مع fine-tuning لمحاذاة مجال أعلى إذا نشرت في حالات استخدام متعددة.
بعبارة بسيطة، يُخبر أمر الشخصية النموذج بأي "قبعة" يرتديها عند الإجابة. قبعة خبير Python تنتج كودًا مختلفًا (وأفضل) من قبعة مساعد عام.
•🎯: ممارسة جيدة: التحديد مهم. "أنت خبير" ضعيف؛ "أنت خبير في Python بخبرة 10 سنوات في الواجهة الخلفية، متخصص في أنماط async/await" قوي.
كيف يُضبط أمر النظام في Ollama وLM Studio وllama.cpp؟
يحدد أمر النظام دور النموذج وقيوده قبل رسالة المستخدم، وكل أداة (Ollama وLM Studio وllama.cpp) تتطلب تنسيقًا مختلفًا لضبطه.
# Ollama (Modelfile)
FROM llama3.1:8b
SYSTEM """You are a Python expert with 10 years experience. Answer only Python questions. Provide code examples. Use type hints."""
PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER repeat_penalty 1.1
# Ollama (API / OpenAI SDK)
response = client.chat.completions.create(
model="llama3.1:8b",
messages=[
{"role": "system", "content": "You are a Python expert..."},
{"role": "user", "content": "Write a FastAPI endpoint"}
],
temperature=0.7
)
# LM Studio (GUI)
# Settings → System Prompt field (paste your prompt)
# Or via API at localhost:1234 — identical format to Ollama
# llama.cpp (CLI)
./main -m llama-3.1-8b.gguf \
--system-prompt "You are a Python expert..." \
--temp 0.7 --top-p 0.9 --repeat-penalty 1.1 \
-p "Write a FastAPI endpoint"كيف تؤثر Temperature ومعاملات أخذ العينات في جودة المخرجات؟
ضبط Temperature وtop_p وrepeat_penalty له تأثير على جودة مخرجات النماذج المحلية بحجم 7B أكبر من صياغة الأمر، وتتطلب النماذج المحلية قيمًا افتراضية مختلفة عن واجهات API السحابية.
المفتاح للنماذج المحلية: قيمة Temperature الافتراضية في Ollama (0.8) أعلى من القيمة الافتراضية في API الخاص بـ OpenAI (1.0 مع أخذ عينات nucleus). خفض Temperature إلى 0.3–0.5 يحسّن بشكل كبير الدقة الواقعية في النماذج المحلية بحجم 7B. لمهام البرمجة، اضبط Temperature على 0.1–0.2 وrepeat_penalty على 1.0 (يحتاج الكود إلى أنماط متكررة مثل الاستيرادات واستدعاءات الدوال).
| Parámetro | Qué controla | Por defecto (Ollama) | Recomendado |
|---|---|---|---|
| temperature | العشوائية | 0.8 | 0.3–0.5 للواقعية، 0.7–0.9 للإبداع |
| top_p | تنوع المفردات | 0.9 | 0.8 للاتساق، 0.95 للتنوع |
| repeat_penalty | تجنّب التكرار | 1.1 | 1.1–1.2 للدردشة، 1.0 للكود |
•📌: نقطة رئيسية: Temperature مُضاعِف على logits. عند 0.0، يُختار دائمًا الـ token الأعلى احتمالًا. فوق 1.0، تزداد العشوائية. تتشبّع النماذج المحلية فوق قيمة Temperature 1.5.
لماذا تحتاج النماذج المحلية إلى أمثلة few-shot أكثر من واجهات API السحابية؟
تقديم 3–5 أمثلة (التعلّم few-shot) للنماذج المحلية يحسّن اتساق المخرجات بنسبة 15–25% أكثر من zero-shot، بينما تحتاج النماذج السحابية إلى مثال أو مثالين فقط.
تستفيد النماذج المحلية من مزيد من الأمثلة لأن لديها معاملات أقل وبيانات تدريب أقل تنوعًا. التعلّم few-shot تقنية تعلّم في السياق تُظهر للنموذج نمط الإدخال/الإخراج المتوقع قبل أن تطلب منه حل المهمة الفعلية.
# Few-shot prompt
prompt = """
Classify sentiment. Examples:
"I love this product!" → positive
"Worst experience ever" → negative
"It's okay, nothing special" → neutral
Now classify: "This is amazing!"
Answer: """
# Model learns format and style from examples•🛠️: نصيحة تنفيذ: تنويع الأمثلة (1 سهل، 1 متوسط، 1 صعب) يعمل بشكل أفضل من استخدام 3 متشابهة. التنوع يحسّن التعميم ويتجنّب الإفراط في الملاءمة لأنماط محددة.
الأخطاء الشائعة في هندسة الأوامر
- أوامر طويلة بلا بنية. التعليمات المبعثرة تُربك النماذج المحلية. كن موجزًا وصريحًا.
- عدم استخدام سلسلة التفكير. يحسّن CoT الدقة بنسبة 10–20%. استخدمه دائمًا في مهام الاستدلال.
- افتراض أن أمرًا واحدًا يصلح للكل. كرّر واختبر. تغييرات الصياغة الصغيرة تُسبب تباينات كبيرة في المخرجات.
- تجاهل تنسيق المخرجات. بدون تحديد صريح للتنسيق، تكون المخرجات غير متوقعة.
- استخدام تعريفات أدوار غامضة. "أنت خبير" غامض. "أنت خبير في Python بخبرة 10 سنوات" أفضل.
•📍: هل تعلم؟ أكثر الأوامر فاعلية تمر بـ 3–5 إصدارات. أمر النماذج المحلية ليس "اضبط وانسَ": التحسينات الصغيرة تتراكم لتحقق مكاسب دقة كبيرة.
اعتبارات إقليمية لهندسة الأوامر
الاتحاد الأوروبي (GDPR): عند نشر هندسة الأوامر للنماذج المحلية على بنية تحتية في الاتحاد الأوروبي، تأكد من أن جميع بيانات التدريب المستخدمة لتكرار الأوامر تمتثل لمبادئ تقليل البيانات في GDPR. لا تُصدّر استعلامات المستخدمين إلى واجهات API خارجية للاختبار؛ كرّر محليًا.
الخليج (PDPL السعودي وحماية البيانات الإماراتية): يجب على الشركات التي تستخدم نماذج LLM محلية لبيانات العملاء تطبيق تسجيل تدقيق صريح لجميع الأوامر والإجابات. جودة الأمر تؤثر مباشرة في أمان البيانات: الأوامر سيئة التصميم قد تكشف معلومات حساسة في المخرجات. تُفضَّل النماذج العربية السيادية مثل Jais وALLaM وFalcon لمحاذاة المجال الإقليمي.
الصين (قانون أمن البيانات 2021): يجب أن تُبقي عمليات نشر نماذج LLM المحلية في الصين القارية كل الاستدلال والأوامر وضبط النماذج داخل المؤسسة. يُفضَّل Qwen وغيره من النماذج المحلية لضمان الامتثال لإقامة البيانات.
الأسئلة الشائعة حول أمر نماذج LLM المحلية
لماذا تحتاج نماذج LLM المحلية إلى أوامر أكثر صراحة من GPT-5.5؟
تمتلك النماذج المحلية بحجم 7B–13B معاملات أقل وبيانات تدريب أقل تنوعًا من GPT-5.5 (يُقدّر بـ 1.8T معامل). لا تستطيع استنتاج النية الغامضة بنفس الكفاءة. التعليمات الصريحة — التنسيق والدور والاستدلال خطوة بخطوة — تعوّض هذا الفرق. أمر سلسلة التفكير يحسّن دقة النماذج المحلية بنسبة 10–20% في مهام الاستدلال.
كم عدد أمثلة few-shot التي يجب تضمينها في أوامر نماذج LLM المحلية؟
3–5 أمثلة هي الأمثل للنماذج المحلية بحجم 7B. عادةً ما يكتفي GPT-5.5 بمثال أو مثالين. مزيد من الأمثلة يحسّن الاتساق لكنه يستهلك tokens من نافذة السياق (4K–32K token حسب النموذج). بالنسبة إلى Llama 3.2 8B بنافذة سياق 4K، اقتصر على 3 أمثلة بالإضافة إلى مهمتك. للنماذج بسياق 32K+، 5 أمثلة آمنة.
هل يعمل أمر سلسلة التفكير مع جميع النماذج المحلية؟
تعمل سلسلة التفكير مع أي نموذج مضبوط بالتعليمات (Llama 3.x وQwen 3 وMistral Small). النماذج الأساسية (بدون ضبط بالتعليمات) لا تتبع تعليمات "فكّر خطوة بخطوة" بشكل موثوق. للنماذج المحلية، تعمل عبارات CoT مثل "حلّ هذا خطوة بخطوة:" أو "الاستدلال:" في بداية المخرجات المتوقعة بشكل أفضل.
ما تنسيق المخرجات الأكثر موثوقية لنماذج LLM المحلية؟
JSON هو تنسيق المخرجات المنظم الأكثر موثوقية لنماذج LLM المحلية. حدّد مخطط JSON الدقيق في الأمر: "أجب بكائن JSON فقط بمفاتيح: الاسم، الدرجة، الاستدلال." عناوين Markdown (##) موثوقة للأقسام. تجنّب طلب XML أو تنسيقات مخصصة: تتعامل معها النماذج المحلية بشكل غير متسق.
كيف أمنع نموذج LLM محليًا من الخروج عن الموضوع؟
أضف قيدًا صريحًا إلى أمر النظام أو أمر التعليمات: "أجب فقط حول [الموضوع]. إذا سُئلت عن شيء آخر، قل: لا أستطيع المساعدة إلا في [الموضوع]." بالنسبة إلى Ollama، استخدم حقل أمر النظام. بالنسبة إلى llama.cpp، ضعه كرسالة نظام في البداية. هذا التحديد يعمل بشكل أفضل بكثير في النماذج المحلية بحجم 7B منه في النماذج السحابية ذات محاذاة RLHF الأقوى.
ما الفرق بين أمر zero-shot وfew-shot للنماذج المحلية؟
zero-shot لا يقدّم أي مثال: "صنّف هذا البريد كرسالة مزعجة أو غير مزعجة." few-shot يقدّم 2–5 أمثلة موسومة قبل المهمة. بالنسبة إلى النماذج المحلية بحجم 7B، يتفوق few-shot باستمرار على zero-shot في مهام التصنيف والاستخراج بدقة أعلى 15–25%. يعمل zero-shot جيدًا في مهام التوليد (التلخيص والترجمة) حيث يكون التنسيق أقل أهمية.
كيف أختبر الأوامر وأكرّرها للنماذج المحلية؟
اختبر بـ 5–10 أمثلة متنوعة. غيّر متغيرًا واحدًا في كل مرة (الدور أو التنسيق أو تعليمة CoT). قِس الدقة أو الاتساق قبل/بعد. استخدم مجموعة اختبار بسيطة: 2–3 أمثلة سهلة، 2–3 أمثلة صعبة. سجّل أي إصدارات الأوامر تعمل بشكل أفضل. كرّر في دورات من 3–5 تنويعات للأمر. وثّق الأوامر الناجحة في مكتبة أوامر لإعادة استخدامها.
هل ينبغي اللجوء إلى هندسة الأوامر أم fine-tuning لمهمة محددة؟
ابدأ بهندسة الأوامر أولًا (سريعة ومجانية وتكرارية). إذا توقفت الدقة عن التحسّن بعد 20+ تنويعًا للأمر، فعندئذٍ استخدم fine-tuning. يتطلب fine-tuning 500+ مثالًا خاصًا بالمهمة و1–4 ساعات من وقت التدريب، لكنه يحقق مكاسب دقة بنسبة 10–20%. للمهام العامة، تكفي هندسة الأوامر غالبًا. للمهام الخاصة بالمجال (الطبي والقانوني والبرمجة)، يقدّم fine-tuning تحسينات دائمة.
بماذا تختلف أوامر النظام عن تعليمات المستخدم في نماذج LLM المحلية؟
تحدد أوامر النظام دور النموذج وقيوده قبل رسالة المستخدم وتشكّل جزءًا من بنية الطلب (في Ollama أو LM Studio أو عبر API). تعليمات المستخدم جزء من المحادثة. تُرسي أوامر النظام السلوك الأساسي وهي أكثر موثوقية من تضمين التعليمات في رسائل المستخدم. للنماذج المحلية، أمر نظام جيد الصياغة يحسّن الاتساق بنسبة 15–25% لأن النموذج يُعطي الأولوية للقيود على مستوى النظام على النص على مستوى المستخدم.
هل يمكنني استخدام الأمر نفسه عبر نماذج محلية مختلفة؟
جزئيًا. تنتقل بنية CoT الأساسية وتعريفات الأدوار بين النماذج (Llama وQwen وMistral). ومع ذلك، يتطلب كل نموذج ضبط الأمر لنتائج مثلى. تستجيب نماذج Llama لـ "دعني أفكر خطوة بخطوة"، بينما تفضّل نماذج Qwen "أولًا، أحتاج إلى...". اختبر أمرك على النموذج الدقيق الذي ستنشره. النماذج الأكبر (70B) أكثر تسامحًا مع تنويعات الأمر من النماذج الأصغر (7B).
المصادر
- Chain-of-Thought Prompting Paper (Wei et al.) — بحث أساسي حول الاستدلال عبر تعليمات خطوة بخطوة.
- Prompt Engineering Guide (DAIR-AI) — مجموعة شاملة من تقنيات الأوامر وأفضل الممارسات.
- Ollama Modelfile Reference — التوثيق الرسمي لأوامر النظام والمعاملات (temperature وtop_p وrepeat_penalty) وإنشاء نماذج مخصصة.