Key Takeaways
- نفاد الذاكرة: بدّل إلى تكميم أصغر (Q4_K_M ← Q3_K_S) أو نموذج أصغر.
- عدم اكتشاف GPU على NVIDIA: حدّث البرنامج المشغّل إلى 525+ على Linux، و452+ على Windows. شغّل `nvidia-smi` للتأكيد.
- استدلال بطيء للغاية: أنت تشغّل على CPU فقط. فعّل التفريغ على GPU في Ollama بمتغير البيئة `OLLAMA_GPU_LAYERS`.
- رفض الاتصال: Ollama غير قيد التشغيل. ابدأه بـ `ollama serve` أو أعد تشغيل الخدمة.
- مخرجات تالفة: قالب موجّه خاطئ. استخدم نسخة Instruct من النموذج، وليس النسخة الأساسية.
الخطأ 1: "نفاد الذاكرة" / تعليق بسبب نقص الذاكرة
أخطاء نفاد الذاكرة تعني أن النموذج يحتاج ذاكرة RAM أكثر من المتاح -- وليست عطلًا في العتاد. هذا أكثر الأخطاء شيوعًا للمستخدمين الجدد. راجع شرح تكميم LLM لفهم كيف يقلل التكميم متطلبات RAM.
- تحقق من RAM المتاحة: شغّل `free -h` على macOS/Linux، أو افتح إدارة المهام ← الأداء ← الذاكرة على Windows.
- بدّل إلى تكميم أصغر: استبدل `Q8_0` أو `Q5_K_M` بـ `Q4_K_M`. لـ Ollama: `ollama run llama3.2-instruct-q4_K_M`.
- أغلق التطبيقات في الخلفية قبل تحميل النموذج -- المتصفحات والتطبيقات الأخرى تستهلك RAM التي يحتاجها النموذج.
- بدّل إلى نموذج أصغر: إذا فشل 8B بذاكرة 8 GB من RAM، جرّب `llama3.2:3b` (يتطلب ~2.5 GB فقط).
التحقق من RAM المتاحة على Linux / macOS
# Linux
free -h
# macOS
vm_stat | grep "Pages free"
# Más legible en macOS
top -l 1 | grep "PhysMem"الخطأ 2: عدم استخدام GPU (التشغيل على CPU فقط)
عدم استخدام GPU يعني أن LLM يعمل أبطأ بـ 5–10 مرات من المتوقع -- تحقق من تثبيت البرنامج المشغّل قبل أي شيء آخر. تأكد من أن GPU مرئية للنظام:
# NVIDIA — debe mostrar el nombre de la GPU y la versión del driver
nvidia-smi
# AMD en Linux
rocm-smi
# macOS — verificar si Metal está disponible
system_profiler SPDisplaysDataType | grep "Metal"كيف تفعّل GPU في Ollama؟
- NVIDIA على Linux: ثبّت البرنامج المشغّل NVIDIA 525+ وCUDA Toolkit 11.3+. يكتشف Ollama CUDA تلقائيًا عند إعادة التشغيل.
- NVIDIA على Windows: تأكد من أن إصدار البرنامج المشغّل 452.39 أو أعلى. يثبّت Ollama دعم CUDA تلقائيًا عبر مثبّت Windows.
- AMD على Linux: ثبّت ROCm 5.7+. إذا فشل الاكتشاف، اضبط `HSA_OVERRIDE_GFX_VERSION=11.0.0` لبطاقات سلسلة RX 6000.
- Apple Silicon: يستخدم Ollama Metal افتراضيًا -- لا حاجة لتكوين. تأكد بـ `ollama ps` بعد تحميل نموذج؛ تظهر طبقات GPU في المخرجات.
الخطأ 3: استدلال بطيء للغاية (أقل من 5 token في الثانية)
أقل من 5 token في الثانية يعني أن النموذج يعمل على CPU فقط أو أن النموذج أكبر من VRAM المتاحة. نموذج 7B على GPU يولّد 30–80 tok/ثانية؛ والنموذج نفسه على CPU يولّد 3–10 tok/ثانية.
- تأكد إن كانت GPU نشطة: شغّل `ollama ps` أثناء تحميل نموذج. تُظهر المخرجات عدد الطبقات على GPU مقابل CPU.
- قلّل حجم النموذج: نموذج 13B على CPU يولّد 3–6 tok/ثانية. التبديل إلى 7B يضاعف السرعة؛ والتبديل إلى 3B يربّعها.
- زِد طبقات GPU في Ollama: اضبط `OLLAMA_GPU_LAYERS=999` لنقل كل الطبقات إلى GPU (سيقتصر Ollama على الحد الأقصى الذي يتسع في VRAM).
- استخدم تكميمًا أسرع: Q4_K_M هو أسرع تكميم يحافظ على جودة مقبولة. Q8_0 ذو جودة أعلى لكنه أبطأ بـ ~30%.
ضبط طبقات GPU في Ollama
# Establecer la variable de entorno antes de iniciar Ollama
export OLLAMA_GPU_LAYERS=999
ollama serve
# O en un Modelfile
FROM llama3.1:8b
PARAMETER num_gpu 999الخطأ 4: "رفض الاتصال" عند استدعاء API
رفض الاتصال يعني أن Ollama غير قيد التشغيل -- لا تستجيب API على `localhost:11434` إلا عندما تكون الخدمة نشطة. ابدأها قبل إجراء استدعاءات API.
# Iniciar Ollama manualmente
ollama serve
# En Linux — reiniciar el servicio systemd
systemctl restart ollama
# Verificar que está en ejecución
curl http://localhost:11434
# Esperado: "Ollama is running"الخطأ 5: خطأ "النموذج غير موجود"
"النموذج غير موجود" يعني أن اسم النموذج في أمرك لا يطابق أي نموذج تم تنزيله. أسماء النماذج في Ollama حساسة لحالة الأحرف وتتضمن وسوم الإصدار.
# Listar todos los modelos descargados
ollama list
# Descargar un modelo si falta
ollama pull llama3.2
# Verifica el nombre exacto del modelo — las etiquetas importan
# "llama3.2" y "llama3.2:3b" son entradas diferentesالخطأ 6: ملف نموذج تالف
ملفات النماذج التالفة تنتج عن عمليات تنزيل مقطوعة -- احذف وأعد التنزيل للإصلاح. لا يكتشف Ollama دائمًا عمليات التنزيل الجزئية تلقائيًا.
# Eliminar el modelo corrupto
ollama rm llama3.2
# Volver a descargarlo
ollama pull llama3.2
# Para LM Studio: eliminar archivos de modelo manualmente
# Ubicación predeterminada: ~/.cache/lm-studio/models/الخطأ 6b: "فشل في حل النموذج" في LM Studio
"Failed to resolve model lmstudio-community/..." يعني أن LM Studio لا يستطيع العثور على النموذج في سجله. يحدث هذا عادةً عندما يُنزَّل نموذج من `lmstudio-community` على Hugging Face لكن مرجع السجل تغيّر. يستخدم LM Studio إدخال سجل مخزّنًا مؤقتًا لم يعد يطابق ملفات النماذج المتاحة.
- افتح LM Studio ← علامة التبويب My Models ← انقر قائمة النقاط الثلاث للنموذج الفاشل ← اختر "Delete model" (يحتفظ بالملف، ويحذف السجل)
- ابحث عن النموذج نفسه في مستكشف النماذج وأعد تنزيله -- سيعيد LM Studio تسجيله
- بديل: أغلق LM Studio، وانتقل إلى `~/.cache/lm-studio/models/`، واحذف مجلد النموذج المحدد وأعد تنزيله
# Limpiar manualmente la caché de modelos de LM Studio (macOS/Linux)
rm -rf ~/.cache/lm-studio/models/lmstudio-community/<model-name>الخطأ 6c: "لا توجد خيارات متوافقة متاحة لهذا التنسيق"
يعني هذا الخطأ أن ملف النموذج الذي نزّلته ليس تنسيقًا يستطيع الواجهة الخلفية المثبّتة تشغيله -- وليس تنزيلًا تالفًا. يظهر عند تحميل ملف `.safetensors` أو ملف حصري لـ MLX في واجهة خلفية قائمة على llama.cpp، أو عندما يحتاج ملف GGUF إلى بيئة تشغيل أحدث من المثبّتة.
- تحقق من تنسيق الملف: يشغّل Ollama والواجهة الخلفية القياسية لـ LM Studio ملفات GGUF. تعمل إصدارات MLX فقط على Apple Silicon مع تفعيل واجهة MLX الخلفية في إعدادات LM Studio.
- أعد تنزيل التنسيق الصحيح: في صفحة النموذج، اختر تكميم GGUF (مثل Q4_K_M) بدلًا من مستودع `.safetensors`.
- حدّث LM Studio: تتطلب مخططات تكميم GGUF الأحدث أحيانًا تحديث بيئة التشغيل. راجع الإعدادات ← Runtime لمعرفة التحديثات المتاحة قبل إعادة تنزيل النموذج.
الخطأ 7: أخطاء تهيئة CUDA / ROCm
أخطاء CUDA وROCm تشير إلى عدم توافق إصدار البرنامج المشغّل/المكتبة -- حدّث برنامجك المشغّل إلى الإصدار الأدنى المطلوب.
- "إصدار برنامج تشغيل CUDA غير كافٍ": حدّث البرنامج المشغّل NVIDIA. الحد الأدنى لـ llama.cpp هو CUDA 11.3 / البرنامج المشغّل 450.80.
- "لا توجد صورة kernel متاحة للتنفيذ": بنية GPU لديك غير مدعومة. سلسلة GTX 900 (Maxwell) وما قبلها غير مدعومة في إصدارات CUDA الحديثة.
- AMD ROCm "HSA_STATUS_ERROR_INVALID_ISA": اضبط `HSA_OVERRIDE_GFX_VERSION=10.3.0` (لـ RX 6000) أو `11.0.0` (لـ RX 7000) قبل بدء Ollama.
- تحقق من إصدار CUDA: شغّل `nvcc --version` أو `nvidia-smi | grep CUDA`.
الخطأ 8: مخرجات تالفة أو متكررة أو بلا معنى
المخرجات التالفة تعني دائمًا تقريبًا أنك تستخدم نموذجًا أساسيًا بدلًا من نسخة instruct/chat. تولّد النماذج الأساسية إكمالات نص خام، وليس إجابات عن الأسئلة.
النماذج الأساسية (مثل `llama3.1:8b`) ليست مضبوطة للمحادثة، وعند طرح سؤال عليها، تولّد إكمالات خام تبدو غير متماسكة. استخدم دائمًا نسخة instruct: `llama3.1:8b-instruct`. راجع كيفية تثبيت LM Studio لطريقة قائمة على الواجهة الرسومية لتبديل نسخ النماذج.
في Ollama، يشير الوسم الافتراضي لمعظم النماذج إلى نسخة instruct بالفعل. إذا نزّلت يدويًا من Hugging Face، فتأكد من أن اسم الملف يتضمن "Instruct" أو "chat".
الخطأ 9: "العنوان قيد الاستخدام بالفعل" -- تعارض المنفذ
"العنوان قيد الاستخدام بالفعل" يعني أن عملية أخرى تشغل المنفذ 11434 (Ollama) أو 1234 (LM Studio). اعثر على العملية المتعارضة وأنهِها.
# Encontrar qué usa el puerto 11434 (Ollama)
lsof -i :11434
# Terminar por PID
kill -9 <PID>
# O cambiar el puerto de Ollama
export OLLAMA_HOST=0.0.0.0:11435
ollama serveالخطأ 10: يتوقف النموذج في منتصف الاستجابة
التوقف في منتصف الاستجابة سببه بلوغ حدود طول السياق أو ضبط `num_predict` منخفضًا جدًا. قيمة `num_predict` الافتراضية في كثير من الإعدادات هي 128 token -- تكفي لجملة أو جملتين فقط.
- زِد num_predict: يحدد هذا المعامل أقصى عدد token للتوليد. القيمة الافتراضية غالبًا 128. زِدها: في Ollama، أضف `PARAMETER num_predict 2048` إلى الـ Modelfile.
- تحقق من نافذة السياق: إذا كانت محادثتك طويلة جدًا، فقد يكون النموذج قد بلغ حد سياقه. ابدأ جلسة جديدة أو استخدم نموذجًا بنافذة سياق أكبر (يدعم Llama 3.2 3B سياق 128K).
- تحقق من token التوقف: تتضمن بعض ملفات Modelfile تسلسلات توقف تنهي التوليد مبكرًا. راجع موجّه النظام والقالب بحثًا عن أنماط توقف غير متوقعة.
الخطأ 11: "فشل تحميل عميل LLM" -- مضيف بعيد غير متوقع
**خطأ "failed to load LLM client: [host]:443" يعني أن التطبيق يحاول الوصول إلى خادم خارجي عبر HTTPS -- وليس تثبيت Ollama أو LM Studio المحلي لديك.** لا يتصل Ollama وLM Studio بخادم بعيد للاستدلال افتراضيًا؛ فإذا أظهر عميل هذا الخطأ تجاه نطاق غير مألوف، فإن ذلك التطبيق عبارة عن حزمة أو نسخة معدّلة من طرف ثالث تحتوي نقطة نهاية بعيدة مضمّنة في الكود، وتلك النقطة غير متاحة حاليًا.
- حدّد التطبيق الذي يُصدر الخطأ: هذه الرسالة لا تأتي من Ollama أو LM Studio مباشرة. راجع إعدادات التطبيق أو ملف README أو الكود المصدري بحثًا عن نقطة نهاية API أو خادم تحقق ترخيص مضمّن في الكود.
- تحقق من شبكتك أولًا: إذا كان التطبيق يحتاج فعلًا للاتصال بخدمة سحابية، تأكد من أن جدار الحماية أو VPN أو برنامج مكافحة الفيروسات لا يحجب اتصال HTTPS الصادر عبر المنفذ 443 إلى ذلك المضيف.
- بدّل إلى عميل محلي بالكامل إذا أردت استدلالًا دون اتصال: استخدم Ollama (`localhost:11434`) أو LM Studio (`localhost:1234`) مباشرة -- لا يجري أي منهما اتصالات صادرة إلى أي خادم للنماذج المحلية.
- لا تُدخل مفاتيح API أو بيانات اعتماد في عميل غير مألوف حتى تتأكد من هوية نقطة النهاية البعيدة وسبب حاجة التطبيق إليها. أزل التطبيق إذا لم تستطع التحقق من مصدره.
قراءات ذات صلة
- شرح تكميم LLM -- لماذا Q4_K_M هو الافتراضي وكيف يؤثر التكميم في RAM
- دليل عتاد LLM المحلي 2026 -- متطلبات العتاد لتشغيل نماذج 7B–70B
- كيفية تثبيت Ollama -- دليل التثبيت والإعداد
- Ollama مقابل LM Studio -- مقارنة أشهر أداتين لـ LLM المحلي
- كيفية تشغيل نماذج LLM المحلية على حاسوب محمول -- تحسين حراري وبطارية خاص بالحواسيب المحمولة
- أفضل نماذج LLM المحلية للمبتدئين -- توصيات نماذج لذاكرة 8 GB من RAM
- أفضل نماذج LLM المحلية للبرمجة 2026 -- مقارنة Qwen3-Coder مقابل DeepSeek
أين تجد مزيدًا من المساعدة
للمشكلات الخاصة بعتاد الحواسيب المحمولة (الخنق الحراري، واستهلاك البطارية)، راجع كيفية تشغيل نماذج LLM المحلية على حاسوب محمول. لأسئلة إعداد الأمان والخصوصية، راجع قائمة تحقق أمان وخصوصية LLM المحلي. صفحة مشكلات Ollama على GitHub (github.com/ollama/ollama/issues) ومنتدى r/LocalLLaMA الفرعي هما أكثر موارد المجتمع نشاطًا للأخطاء الخاصة بالنماذج.
أخطاء شائعة في استكشاف أخطاء LLM المحلي وإصلاحها
- الخلط بين أخطاء OOM وأعطال العتاد -- الخطأ يعني أن RAM أصغر من أن تستوعب النموذج، وليس أن العتاد معطّل. الحل: استخدم تكميم Q4_K_M أو نموذجًا أصغر.
- عدم التحقق من حمل النظام -- تتدهور سرعة الاستدلال بشكل كبير عندما تستهلك تطبيقات أخرى CPU/GPU. أغلق المتصفح، ومشغّل الفيديو، والعمليات في الخلفية قبل قياس الأداء.
- تجاهل عدم توافق إصدار البرنامج المشغّل -- يتطلب NVIDIA CUDA إصدارات برنامج مشغّل محددة لكل إصدار CUDA. تحقق من مخرجات `nvidia-smi`؛ يجب أن يكون إصدار البرنامج المشغّل ≥450.80 لـ CUDA 11.x.
- استخدام اسم نموذج خاطئ في Ollama -- `llama3.2` و`llama3.2:3b` وسمان مختلفان في Ollama. شغّل `ollama list` لرؤية الأسماء الدقيقة للنماذج المنزّلة.
- عدم إعادة تشغيل Ollama بعد تحديث البرنامج المشغّل -- يكتشف Ollama GPU عند الإقلاع. بعد تحديث برامج تشغيل NVIDIA أو ROCm، أعد تشغيل Ollama بالكامل (`ollama serve`) لإعادة اكتشاف GPU.
المصادر
- NVIDIA. (2024). "CUDA Toolkit Release Notes." https://docs.nvidia.com/cuda/cuda-toolkit-release-notes/ -- المتطلبات الرسمية لإصدار برنامج تشغيل CUDA لكل إصدار.
- Ollama. (2026). "Ollama Troubleshooting." https://github.com/ollama/ollama/blob/main/docs/troubleshooting.md -- التوثيق الرسمي لـ Ollama للأخطاء الشائعة.
- AMD. (2024). "ROCm Installation Guide." https://rocm.docs.amd.com/projects/install-on-linux/en/latest/ -- التثبيت الرسمي لـ AMD ROCm ودعم GPU لـ Linux.