Key Takeaways
- الاستدلال باستخدام CPU فقط يعمل جيداً لنماذج 3–13B على المعالجات الحديثة المزودة بذاكرة RAM بسعة 8–32 GB.
- أفضل نماذج CPU: Phi-4 Mini (3.8B، 2.3 GB، 12 token/ثانية)، وGemma 3 2B (1.5 GB، 15 token/ثانية)، وLlama 3.2 3B (2 GB، 10 token/ثانية).
- الاستدلال على CPU أبطأ بمقدار 10–30× من GPU لكنه يستخدم صفر VRAM مخصصة.
- فعّل وضع CPU فقط في Ollama أو llama.cpp عبر خيار بسيط في سطر الأوامر.
- الاستدلال على CPU مثالي لواجهات API الإنتاجية (بدون عبء GPU)، وأجهزة الحافة، والبيئات محدودة الميزانية.
هل يمكن لوحدات CPU تشغيل نماذج LLM؟
نعم، يمكن لوحدات CPU الحديثة (Intel i7 الجيل العاشر+، وAMD Ryzen 5000+، وApple M-series) تشغيل نماذج 3–13B بسرعة 8–15 token في الثانية. هذا أبطأ بمقدار 10–30× من GPU لكنه لا يتطلب VRAM مخصصة. يمكن لوحدة CPU مع ذاكرة RAM نظام كافية (8–32 GB) تشغيل نماذج كانت ستتطلب GPU بقيمة $300 أو أكثر.
الاستدلال على CPU يقايض السرعة بسهولة الوصول: صفر عبء GPU، واستقرار تام، وبدون مشاكل تعريفات. لحالات الاستخدام العرضية (روبوتات الدردشة التي تجيب عن طلبات قليلة في الثانية، ومعالجة المستندات دون اتصال)، وضع CPU فقط عملي.
تحتوي وحدات CPU الحديثة على تعليمات متجهية AVX-512 أو NEON/SVE تسرّع عمليات المصفوفات. أدوات مثل llama.cpp وOllama تستخدمها تلقائياً، مما يجعل الاستدلال على CPU أسرع بكثير من التطبيقات البدائية.
أفضل نماذج CPU فقط 2026
يصنّف الجدول التالي النماذج حسب الأداء على Intel i7-12700 (12 نواة، AVX-512) مع وضع CPU فقط:
| Modelo | Parámetros | Tamaño GGUF | RAM necesaria | Velocidad CPU | Mejor para |
|---|---|---|---|---|---|
| Phi-4 Mini | 3.8B | ~2.3 GB | 4 GB | 12 tok/ثانية | دردشة عامة، مساعدة برمجية |
| Gemma 3 2B | 2B | ~1.5 GB | 3 GB | 15 tok/ثانية | ردود سريعة، VRAM منخفض |
| Llama 3.2 3B | 3B | ~2 GB | 3.5 GB | 10 tok/ثانية | توازن الجودة/السرعة |
| Mistral Small Q4 | 7B | ~4.5 GB | 6 GB | 5 tok/ثانية | أفضل جودة، 16+ GB RAM |
| Llama 3.3 8B Q4 | 8B | ~5 GB | 7 GB | 4 tok/ثانية | البرمجة، المهام المنطقية |

مقارنة السرعة: CPU مقابل GPU
تتفاوت السرعة حسب العتاد. أُجريت هذه القياسات على عتاد قياسي لعام 2026 يشغّل Ollama أو llama.cpp:
| Hardware | Modelo | Velocidad | Notas |
|---|---|---|---|
| Intel i7-12700 (CPU) | Phi-4 Mini 3.8B | 12 token/ثانية | AVX-512 مُفعّل |
| AMD Ryzen 7 5700X (CPU) | Phi-4 Mini 3.8B | 9 token/ثانية | AVX2 أقدم فقط |
| Apple M3 (CPU) | Phi-4 Mini 3.8B | 14 token/ثانية | ميزة الذاكرة الموحدة |
| RTX 3060 (GPU, 12 GB) | Phi-4 Mini 3.8B | 80 token/ثانية | GPU أسرع بمقدار 6.7× |
| RTX 4090 (GPU, 24 GB) | Llama 3.3 8B Q4 | 120 token/ثانية | GPU أسرع بمقدار 30× من CPU |

متطلبات RAM لكل نموذج
القاعدة العامة: حجم GGUF + 500 MB عبء = الحد الأدنى من RAM المطلوب. نموذج GGUF بحجم 2 GB يحتاج إلى 2.5–3 GB من RAM النظام الحرة:
| Modelo | Tamaño GGUF | RAM mínima | Cómodo | Longitud de contexto |
|---|---|---|---|---|
| Gemma 3 2B | ~1.5 GB | 2–2.5 GB | 4 GB | 8K |
| Phi-4 Mini 3.8B | ~2.3 GB | 3 GB | 6 GB | 4K |
| Llama 3.2 3B | ~2 GB | 2.5–3 GB | 6 GB | 8K |
| Mistral Small Q4 | ~4.5 GB | 5 GB | 8 GB | 32K |
| Llama 3.3 8B Q4 | ~5 GB | 6 GB | 12 GB | 128K |
كيفية تشغيل وضع CPU فقط
Ollama (الأبسط): ببساطة شغّل `ollama run phi:mini`. يكتشف Ollama تلقائياً الأنظمة الخالية من GPU من NVIDIA/AMD ويستخدم RAM النظام. LM Studio: افتح الإعدادات ← اختر "None" في GPU لفرض وضع CPU. Llama.cpp: استخدم العَلَم `--n-gpu-layers 0` لتعطيل تفريغ الحمل إلى GPU.
ollama run phi:mini
# Ollama auto-detects CPU-only systemsنصائح تحسين الاستدلال على CPU
لاستخراج أقصى أداء من الاستدلال على CPU:
- استخدم تكميم Q4_K_M — يقلل حجم GGUF بنحو 70%، مع فقدان جودة ضئيل وزيادة سرعة بنسبة 10–20% بفضل سلوك ذاكرة التخزين المؤقت الأفضل.
- قلّص نافذة السياق — السياقات الأطول = استدلال أبطأ. استخدم `--context 2048` لتحديد السياق بـ 2K token.
- فعّل تعدد الخيوط — يكتشف Ollama وllama.cpp عدد أنوية CPU تلقائياً. تحقق عبر `nproc` من تطابقه.
- استخدم AVX-512 أو ARM NEON — تحتوي وحدات CPU الحديثة من Intel/AMD/ARM على تعليمات متجهية. تحقق من أعلام CPU: `cat /proc/cpuinfo | grep avx512` (Linux) أو Apple حول ← تقرير النظام (Mac).
- حجم الدفعة = 1 — يتعامل CPU بشكل أفضل مع استدلال التسلسل الواحد. لا تحاول دفعات متعددة على CPU.
- ثبّت الخيوط على الأنوية — على Linux، استخدم `numactl --cpunodebind=0 ollama run phi:mini` لتجنب عبء التبديل بين الأنوية.
متى تستخدم CPU مقابل GPU
| Caso de uso | CPU | GPU |
|---|---|---|
| دردشة في الوقت الفعلي (زمن استجابة < 1 ثانية) | ❌ بطيء جداً (12 tok/ثانية = 5 ثوانٍ لـ 60 token) | ✅ 80+ tok/ثانية |
| معالجة بالدفعات (مستندات، سجلات) | ✅ جيد (السرعة لا تهم) | ⚠️ مبالغ فيه |
| API إنتاجية (ميزانية محدودة) | ✅ $0 تكلفة عتاد | ⚠️ $200+ GPU + كهرباء |
| جهاز حافة (Raspberry Pi) | ✅ لا بديل | ❌ خيارات GPU محدودة |
| تطوير / اختبار محلي | ✅ استهلاك أقل، أهدأ | ⚠️ مبالغ فيه |
| fine-tuning لنماذج LLM | ❌ بطيء جداً (ساعات → أيام) | ✅ تسريع 10–30× |
الأسئلة الشائعة
ما مدى سرعة الاستدلال على CPU فقط مقارنة بـ GPU؟
CPU: 8–15 token/ثانية على المعالجات الحديثة. GPU (RTX 3060): 80 token/ثانية. GPU (RTX 4090): 120+ token/ثانية. CPU أبطأ بمقدار 10–30× لكنه يتطلب استثمار $0 في GPU.
ما هو أصغر نموذج يُنتج مخرجات متماسكة على CPU؟
Gemma 3 2B (1.5 GB) يُنتج ردوداً معقولة. أقل من 2B، تنخفض الجودة. لأفضل جودة مع 8 GB من RAM، استخدم Phi-4 Mini (3.8B) أو Llama 3.2 3B (2 GB).
هل يمكنني تشغيل نموذج 13B على CPU؟
نعم، مع تكميم Q4_K_M يشغل نموذج 13B نحو 6.5 GB. يحتاج إلى 8–12 GB من RAM النظام. السرعة: ~2–3 token/ثانية. غير مريح للاستخدام التفاعلي لكنه يعمل للمعالجة بالدفعات.
هل يستخدم الاستدلال على CPU وحدة GPU في أي لحظة؟
لا. وضع CPU فقط في Ollama/llama.cpp يعطّل صراحةً استخدام GPU ويعتمد حصرياً على RAM النظام.
هل الاستدلال على CPU فقط مستقر؟
نعم، أكثر استقراراً من GPU. لا توجد أعطال تعريفات، ولا أخطاء ذاكرة GPU. الخطر الوحيد هو إشباع RAM النظام، وهو ما تتحكم به باختيار النموذج المناسب.
هل أحتاج إلى ضبط إعدادات لمعالجات Apple Silicon؟
لا. يكتشف Ollama تلقائياً M1/M2/M3/M4 ويستخدم الذاكرة الموحدة بكفاءة. Apple Silicon أسرع بنحو 10–20% من معالجات Intel المكافئة بفضل بنية ذاكرته.
الخطوات التالية
- أسرع نماذج LLM المحلية للأجهزة منخفضة المواصفات — جهاز قديم أو محدود؟ نماذج مُحسَّنة للسرعة →
- شرح تحديد دقة LLM — لماذا يُهم Q4_K_M لسرعة المعالج →
- أفضل نماذج LLM المحلية للبرمجة — أفضل نماذج برمجة خفيفة تعمل على المعالج →
