Key Takeaways
- الاستدلال باستخدام CPU فقط يعمل جيداً لنماذج 3–13B على المعالجات الحديثة المزودة بذاكرة RAM بسعة 8–32 GB.
- أفضل نماذج CPU: Phi-4 Mini (3.8B، 2.3 GB، 12 token/ثانية)، وGemma 4 E2B (1.5 GB، 15 token/ثانية)، وLlama 3.2 3B (2 GB، 10 token/ثانية).
- الاستدلال على CPU أبطأ بمقدار 10–30× من GPU لكنه يستخدم صفر VRAM مخصصة.
- فعّل وضع CPU فقط في Ollama أو llama.cpp عبر خيار بسيط في سطر الأوامر.
- الاستدلال على CPU مثالي لواجهات API الإنتاجية (بدون عبء GPU)، وأجهزة الحافة، والبيئات محدودة الميزانية.
يعمل Phi-4 Mini (3.8B) بنحو 12 رمزًا في الثانية على معالج حديث مع 2.3 غيغابايت من الذاكرة، وهو أفضل خيار يعتمد على المعالج وحده للدردشة العامة.
لا حاجة إلى بطاقة رسومات: هذه النماذج تعمل من ذاكرة النظام. أبطأ من وحدة معالجة الرسومات بنحو 10 إلى 30 مرة، لكنها لا تستهلك ذاكرة VRAM إطلاقًا. للدردشة العامة اختر Phi-4 Mini، وللسرعة Gemma 4 E2B بحجم 1.5 غيغابايت، وللجودة Llama 3.2 3B — جميعها عبر Ollama أو llama.cpp في وضع المعالج.
هل يمكن لوحدات CPU تشغيل نماذج LLM؟
نعم، يمكن لوحدات CPU الحديثة (Intel i7 الجيل العاشر+، وAMD Ryzen 5000+، وApple M-series) تشغيل نماذج 3–13B بسرعة 8–15 token في الثانية. هذا أبطأ بمقدار 10–30× من GPU لكنه لا يتطلب VRAM مخصصة. يمكن لوحدة CPU مع ذاكرة RAM نظام كافية (8–32 GB) تشغيل نماذج كانت ستتطلب GPU بقيمة $300 أو أكثر.
الاستدلال على CPU يقايض السرعة بسهولة الوصول: صفر عبء GPU، واستقرار تام، وبدون مشاكل تعريفات. لحالات الاستخدام العرضية (روبوتات الدردشة التي تجيب عن طلبات قليلة في الثانية، ومعالجة المستندات دون اتصال)، وضع CPU فقط عملي.
تحتوي وحدات CPU الحديثة على تعليمات متجهية AVX-512 أو NEON/SVE تسرّع عمليات المصفوفات. أدوات مثل llama.cpp وOllama تستخدمها تلقائياً، مما يجعل الاستدلال على CPU أسرع بكثير من التطبيقات البدائية.
أفضل نماذج CPU فقط 2026
يصنّف الجدول التالي النماذج حسب الأداء على Intel i7-12700 (12 نواة، AVX-512) مع وضع CPU فقط:
النموذج | المعاملات | حجم GGUF | RAM المطلوبة | سرعة CPU | الأفضل لـ |
|---|---|---|---|---|---|
| Phi-4 Mini | 3.8B | ~2.3 GB | 4 GB | 12 tok/ثانية | دردشة عامة، مساعدة برمجية |
| Gemma 4 E2B | 2B | ~1.5 GB | 3 GB | 15 tok/ثانية | ردود سريعة، VRAM منخفض |
| Llama 3.2 3B | 3B | ~2 GB | 3.5 GB | 10 tok/ثانية | توازن الجودة/السرعة |
| Qwen3 8B | 8B | ~5 GB | 6 GB | 4-5 tok/ثانية | أفضل برمجة على CPU، 76% HumanEval |
| DeepSeek-R1 7B | 7B | ~5 GB | 7 GB | 4 tok/ثانية | الاستدلال، الرياضيات (سلسلة الأفكار) |

مقارنة السرعة: CPU مقابل GPU
تتفاوت السرعة حسب العتاد. أُجريت هذه القياسات على عتاد قياسي لعام 2026 يشغّل Ollama أو llama.cpp:
العتاد | النموذج | السرعة | ملاحظات |
|---|---|---|---|
| Intel i7-12700 (CPU) | Phi-4 Mini 3.8B | 12 token/ثانية | AVX-512 مُفعّل |
| AMD Ryzen 7 5700X (CPU) | Phi-4 Mini 3.8B | 9 token/ثانية | AVX2 أقدم فقط |
| Apple M3 (CPU) | Phi-4 Mini 3.8B | 14 token/ثانية | ميزة الذاكرة الموحدة |
| RTX 3060 (GPU, 12 GB) | Phi-4 Mini 3.8B | 80 token/ثانية | GPU أسرع بمقدار 6.7× |
| RTX 4090 (GPU, 24 GB) | DeepSeek-R1 7B | 120 token/ثانية | GPU أسرع بمقدار 30× من CPU |

متطلبات RAM لكل نموذج
القاعدة العامة: حجم GGUF + 500 MB عبء = الحد الأدنى من RAM المطلوب. نموذج GGUF بحجم 2 GB يحتاج إلى 2.5–3 GB من RAM النظام الحرة:
النموذج | حجم GGUF | أدنى RAM | مريح | طول السياق |
|---|---|---|---|---|
| Gemma 4 E2B | ~1.5 GB | 2–2.5 GB | 4 GB | 128K |
| Phi-4 Mini 3.8B | ~2.3 GB | 3 GB | 6 GB | 4K |
| Llama 3.2 3B | ~2 GB | 2.5–3 GB | 6 GB | 8K |
| Qwen3 8B | ~5 GB | 5 GB | 8 GB | 32K |
| DeepSeek-R1 7B | ~5 GB | 6 GB | 12 GB | 128K |
كيفية تشغيل وضع CPU فقط
Ollama (الأبسط): ببساطة شغّل `ollama run phi:mini`. يكتشف Ollama تلقائياً الأنظمة الخالية من GPU من NVIDIA/AMD ويستخدم RAM النظام. LM Studio: افتح الإعدادات ← اختر "None" في GPU لفرض وضع CPU. Llama.cpp: استخدم العَلَم `--n-gpu-layers 0` لتعطيل تفريغ الحمل إلى GPU.
ollama run phi:mini
# Ollama auto-detects CPU-only systemsنصائح تحسين الاستدلال على CPU
لاستخراج أقصى أداء من الاستدلال على CPU:
- استخدم تكميم Q4_K_M — يقلل حجم GGUF بنحو 70%، مع فقدان جودة ضئيل وزيادة سرعة بنسبة 10–20% بفضل سلوك ذاكرة التخزين المؤقت الأفضل.
- قلّص نافذة السياق — السياقات الأطول = استدلال أبطأ. استخدم `--context 2048` لتحديد السياق بـ 2K token.
- فعّل تعدد الخيوط — يكتشف Ollama وllama.cpp عدد أنوية CPU تلقائياً. تحقق عبر `nproc` من تطابقه.
- استخدم AVX-512 أو ARM NEON — تحتوي وحدات CPU الحديثة من Intel/AMD/ARM على تعليمات متجهية. تحقق من أعلام CPU: `cat /proc/cpuinfo | grep avx512` (Linux) أو Apple حول ← تقرير النظام (Mac).
- حجم الدفعة = 1 — يتعامل CPU بشكل أفضل مع استدلال التسلسل الواحد. لا تحاول دفعات متعددة على CPU.
- ثبّت الخيوط على الأنوية — على Linux، استخدم `numactl --cpunodebind=0 ollama run phi:mini` لتجنب عبء التبديل بين الأنوية.
متى تستخدم CPU مقابل GPU
Caso de uso | CPU | GPU |
|---|---|---|
| دردشة في الوقت الفعلي (زمن استجابة < 1 ثانية) | ❌ بطيء جداً (12 tok/ثانية = 5 ثوانٍ لـ 60 token) | ✅ 80+ tok/ثانية |
| معالجة بالدفعات (مستندات، سجلات) | ✅ جيد (السرعة لا تهم) | ⚠️ مبالغ فيه |
| API إنتاجية (ميزانية محدودة) | ✅ $0 تكلفة عتاد | ⚠️ $200+ GPU + كهرباء |
| جهاز حافة (Raspberry Pi) | ✅ لا بديل | ❌ خيارات GPU محدودة |
| تطوير / اختبار محلي | ✅ استهلاك أقل، أهدأ | ⚠️ مبالغ فيه |
| fine-tuning لنماذج LLM | ❌ بطيء جداً (ساعات → أيام) | ✅ تسريع 10–30× |
الأسئلة الشائعة
ما مدى سرعة الاستدلال على CPU فقط مقارنة بـ GPU؟
CPU: 8–15 token/ثانية على المعالجات الحديثة. GPU (RTX 3060): 80 token/ثانية. GPU (RTX 4090): 120+ token/ثانية. CPU أبطأ بمقدار 10–30× لكنه يتطلب استثمار $0 في GPU.
ما هو أصغر نموذج يُنتج مخرجات متماسكة على CPU؟
Gemma 4 E2B (1.5 GB) يُنتج ردوداً معقولة. أقل من 2B، تنخفض الجودة. لأفضل جودة مع 8 GB من RAM، استخدم Phi-4 Mini (3.8B) أو Llama 3.2 3B (2 GB).
هل يمكنني تشغيل نموذج 13B على CPU؟
نعم، مع تكميم Q4_K_M يشغل نموذج 13B نحو 6.5 GB. يحتاج إلى 8–12 GB من RAM النظام. السرعة: ~2–3 token/ثانية. غير مريح للاستخدام التفاعلي لكنه يعمل للمعالجة بالدفعات.
هل يستخدم الاستدلال على CPU وحدة GPU في أي لحظة؟
لا. وضع CPU فقط في Ollama/llama.cpp يعطّل صراحةً استخدام GPU ويعتمد حصرياً على RAM النظام.
هل الاستدلال على CPU فقط مستقر؟
نعم، أكثر استقراراً من GPU. لا توجد أعطال تعريفات، ولا أخطاء ذاكرة GPU. الخطر الوحيد هو إشباع RAM النظام، وهو ما تتحكم به باختيار النموذج المناسب.
هل أحتاج إلى ضبط إعدادات لمعالجات Apple Silicon؟
لا. يكتشف Ollama تلقائياً M1/M2/M3/M4 ويستخدم الذاكرة الموحدة بكفاءة. Apple Silicon أسرع بنحو 10–20% من معالجات Intel المكافئة بفضل بنية ذاكرته.
كم من VRAM يحتاج نموذج 7B في وضع CPU فقط؟
صفر VRAM مخصصة. نموذج 7B بتكميم Q4_K_M (~4.5 GB) يحتاج إلى 5–6 GB من RAM النظام ليعمل بارتياح. هذه هي الميزة الأساسية للاستدلال على CPU فقط — لا حاجة إلى GPU أو VRAM على الإطلاق.
هل يمكنني إجراء fine-tuning لنموذج LLM على CPU؟
من الناحية التقنية نعم، لكنه غير عملي. الـ fine-tuning على CPU أبطأ بمقدار 10–30× من GPU. استخدم وضع CPU فقط للاستدلال فقط؛ وانتقل إلى GPU لأي مهمة fine-tuning أو تدريب.
هل يمكنني تشغيل عدة نماذج في وقت واحد على CPU؟
ممكن تقنياً إذا سمحت RAM بذلك، لكنه غير عملي. تشغيل عدة نماذج في وقت واحد يسبب تنافساً على الذاكرة، ويصبح كلا النموذجين أبطأ. شغّل نموذجاً واحداً في كل مرة للحصول على أفضل أداء.
ما هي المخاطر الأمنية للاستدلال على CPU فقط؟
الاستدلال على CPU فقط أكثر أماناً من الاستدلال السحابي، لأن البيانات لا تغادر الجهاز ولا يوجد خطر نقل. المخاطر المتبقية هي نفسها في أي برنامج محلي: حافظ على تحديث نظام التشغيل وأمّن الجهاز الفعلي، لأن البيانات الحساسة غير المشفّرة يمكن أن تبقى على القرص.
هل هناك فرق في السرعة بين Ollama وllama.cpp للاستدلال على CPU؟
الفرق ضئيل جداً. يستخدم كلاهما نفس تحسينات CPU الأساسية (AVX-512). أي تفاوت بنسبة 2–5% تقريباً يأتي من اختلافات في إدارة الخيوط (threads). ابدأ بالإعدادات الافتراضية لـ Ollama ما لم تحتج إلى الأعلام الأكثر تفصيلاً في llama.cpp.
هل الاستدلال على CPU فقط عملي على حاسوب محمول قديم بذاكرة 8–10 GB؟
نعم. يعمل Gemma 4 E2B (1.5 GB) أو Phi-4 Mini (2.3 GB) بكفاءة ضمن 8–10 GB من RAM. توقع 3–5 token في الثانية — مناسب للمعالجة بالدفعات أو روبوت دردشة خفيف، لكنه بطيء جداً للدردشة الفورية.
هل يمكن لوحدات CPU تشغيل نماذج LLM؟
نعم. يمكن لوحدات CPU الحديثة (Intel i7 الجيل العاشر+، وAMD Ryzen 5000+، وApple M-series) تشغيل نماذج 3–13B بسرعة 8–15 token في الثانية. هذا أبطأ بمقدار 10–30× من GPU لكنه لا يتطلب VRAM مخصصة.
ما هو أفضل نموذج LLM على CPU فقط؟
Phi-4 Mini (3.8B، 2.3 GB، 12 token/ثانية) هو الأفضل عموماً. للسرعة: Gemma 4 E2B (1.5 GB، 15 token/ثانية). للتوازن: Llama 3.2 3B (2 GB، 10 token/ثانية).
كم من RAM أحتاج للاستدلال على CPU فقط؟
استخدم القاعدة: حجم ملف GGUF + 500 MB عبء. Phi-4 Mini (2.3 GB) يحتاج إلى 3 GB من RAM. Gemma 4 E2B (1.5 GB) يحتاج إلى 2 GB من RAM. Qwen3 8B (5 GB) يحتاج إلى 5 GB من RAM.
كيف أفعّل وضع CPU فقط؟
في Ollama، ببساطة شغّل: ollama run phi:mini. يكتشف Ollama تلقائياً الأنظمة على CPU فقط. في llama.cpp، استخدم --n-gpu-layers 0. في LM Studio، اضبط GPU على None في الإعدادات.
الخطوات التالية
- أسرع نماذج LLM المحلية للأجهزة منخفضة المواصفات — جهاز قديم أو محدود؟ نماذج مُحسَّنة للسرعة →
- شرح تحديد دقة LLM — لماذا يُهم Q4_K_M لسرعة المعالج →
- أفضل نماذج LLM المحلية للبرمجة — أفضل نماذج برمجة خفيفة تعمل على المعالج →
