Skip to main content
PromptQuorum
Home/Local LLMs/أفضل نماذج ⁨LLM⁩ على ⁨CPU⁩ فقط ⁨2026⁩: بدون ⁨GPU⁩ (⁨5⁩ نماذج مُختبرة)
Best Models

أفضل نماذج ⁨LLM⁩ على ⁨CPU⁩ فقط ⁨2026⁩: بدون ⁨GPU⁩ (⁨5⁩ نماذج مُختبرة)

·8 دقائق للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

الاستدلال باستخدام CPU فقط يعمل جيداً لنماذج 3–13B على المعالجات الحديثة. أفضل الخيارات: Phi-4 Mini (3.8B، 2.3 GB، 12 token/ثانية على CPU) للدردشة العامة، وGemma 4 E2B (1.5 GB، الأسرع) للمهام الحساسة للسرعة، وLlama 3.2 3B (2 GB، متوازن) للجودة. استخدم Ollama أو llama.cpp مع وضع CPU. الاستدلال على CPU أبطأ بمقدار 10–30× من GPU لكنه لا يستخدم VRAM مخصصة — فقط ذاكرة RAM النظام.

الاستدلال باستخدام CPU فقط عملي لنماذج 3–13B على المعالجات الحديثة المزودة بذاكرة RAM بسعة 8–32 GB. أفضل نماذج CPU فقط في يوليو 2026 هي Phi-4 Mini (3.8B، ~2.3 GB، 12 token/ثانية على CPU)، وGemma 4 E2B (1.5 GB، 15 token/ثانية)، وLlama 3.2 3B (2 GB، 10 token/ثانية). شغّلها عبر Ollama أو LM Studio أو llama.cpp مع تفعيل وضع CPU فقط.

أفضل نماذج ⁨LLM⁩ على ⁨CPU⁩ فقط ⁨2026⁩: بدون ⁨GPU⁩ (⁨5⁩ نماذج مُختبرة)

Key Takeaways

  • الاستدلال باستخدام CPU فقط يعمل جيداً لنماذج 3–13B على المعالجات الحديثة المزودة بذاكرة RAM بسعة 8–32 GB.
  • أفضل نماذج CPU: Phi-4 Mini (3.8B، 2.3 GB، 12 token/ثانية)، وGemma 4 E2B (1.5 GB، 15 token/ثانية)، وLlama 3.2 3B (2 GB، 10 token/ثانية).
  • الاستدلال على CPU أبطأ بمقدار 10–30× من GPU لكنه يستخدم صفر VRAM مخصصة.
  • فعّل وضع CPU فقط في Ollama أو llama.cpp عبر خيار بسيط في سطر الأوامر.
  • الاستدلال على CPU مثالي لواجهات API الإنتاجية (بدون عبء GPU)، وأجهزة الحافة، والبيئات محدودة الميزانية.

يعمل Phi-4 Mini (3.8B) بنحو 12 رمزًا في الثانية على معالج حديث مع 2.3 غيغابايت من الذاكرة، وهو أفضل خيار يعتمد على المعالج وحده للدردشة العامة.

لا حاجة إلى بطاقة رسومات: هذه النماذج تعمل من ذاكرة النظام. أبطأ من وحدة معالجة الرسومات بنحو 10 إلى 30 مرة، لكنها لا تستهلك ذاكرة VRAM إطلاقًا. للدردشة العامة اختر Phi-4 Mini، وللسرعة Gemma 4 E2B بحجم 1.5 غيغابايت، وللجودة Llama 3.2 3B — جميعها عبر Ollama أو llama.cpp في وضع المعالج.

هل يمكن لوحدات CPU تشغيل نماذج LLM؟

نعم، يمكن لوحدات CPU الحديثة (Intel i7 الجيل العاشر+، وAMD Ryzen 5000+، وApple M-series) تشغيل نماذج 3–13B بسرعة 8–15 token في الثانية. هذا أبطأ بمقدار 10–30× من GPU لكنه لا يتطلب VRAM مخصصة. يمكن لوحدة CPU مع ذاكرة RAM نظام كافية (8–32 GB) تشغيل نماذج كانت ستتطلب GPU بقيمة $300 أو أكثر.

الاستدلال على CPU يقايض السرعة بسهولة الوصول: صفر عبء GPU، واستقرار تام، وبدون مشاكل تعريفات. لحالات الاستخدام العرضية (روبوتات الدردشة التي تجيب عن طلبات قليلة في الثانية، ومعالجة المستندات دون اتصال)، وضع CPU فقط عملي.

تحتوي وحدات CPU الحديثة على تعليمات متجهية AVX-512 أو NEON/SVE تسرّع عمليات المصفوفات. أدوات مثل llama.cpp وOllama تستخدمها تلقائياً، مما يجعل الاستدلال على CPU أسرع بكثير من التطبيقات البدائية.

أفضل نماذج CPU فقط 2026

يصنّف الجدول التالي النماذج حسب الأداء على Intel i7-12700 (12 نواة، AVX-512) مع وضع CPU فقط:

النموذج
المعاملات
حجم GGUF
RAM المطلوبة
سرعة CPU
الأفضل لـ
Phi-4 Mini3.8B~2.3 GB4 GB12 tok/ثانيةدردشة عامة، مساعدة برمجية
Gemma 4 E2B2B~1.5 GB3 GB15 tok/ثانيةردود سريعة، VRAM منخفض
Llama 3.2 3B3B~2 GB3.5 GB10 tok/ثانيةتوازن الجودة/السرعة
Qwen3 8B8B~5 GB6 GB4-5 tok/ثانيةأفضل برمجة على CPU، 76% HumanEval
DeepSeek-R1 7B7B~5 GB7 GB4 tok/ثانيةالاستدلال، الرياضيات (سلسلة الأفكار)
يوازن Phi-4 Mini بين السرعة والجودة بأفضل شكل — بينما يُعد Gemma 4 E2B أسرع لكن أقل قدرة بمعدل 15 مقابل 12 رمزاً/ثانية.
يوازن Phi-4 Mini بين السرعة والجودة بأفضل شكل — بينما يُعد Gemma 4 E2B أسرع لكن أقل قدرة بمعدل 15 مقابل 12 رمزاً/ثانية.

مقارنة السرعة: CPU مقابل GPU

تتفاوت السرعة حسب العتاد. أُجريت هذه القياسات على عتاد قياسي لعام 2026 يشغّل Ollama أو llama.cpp:

العتاد
النموذج
السرعة
ملاحظات
Intel i7-12700 (CPU)Phi-4 Mini 3.8B12 token/ثانيةAVX-512 مُفعّل
AMD Ryzen 7 5700X (CPU)Phi-4 Mini 3.8B9 token/ثانيةAVX2 أقدم فقط
Apple M3 (CPU)Phi-4 Mini 3.8B14 token/ثانيةميزة الذاكرة الموحدة
RTX 3060 (GPU, 12 GB)Phi-4 Mini 3.8B80 token/ثانيةGPU أسرع بمقدار 6.7×
RTX 4090 (GPU, 24 GB)DeepSeek-R1 7B120 token/ثانيةGPU أسرع بمقدار 30× من CPU
يكون CPU أبطأ من GPU بمقدار 6 إلى 30 مرة — لكنه لا يُكلّف شيئاً من عتاد مخصص ويعمل على أي جهاز.
يكون CPU أبطأ من GPU بمقدار 6 إلى 30 مرة — لكنه لا يُكلّف شيئاً من عتاد مخصص ويعمل على أي جهاز.

متطلبات RAM لكل نموذج

القاعدة العامة: حجم GGUF + 500 MB عبء = الحد الأدنى من RAM المطلوب. نموذج GGUF بحجم 2 GB يحتاج إلى 2.5–3 GB من RAM النظام الحرة:

النموذج
حجم GGUF
أدنى RAM
مريح
طول السياق
Gemma 4 E2B~1.5 GB2–2.5 GB4 GB128K
Phi-4 Mini 3.8B~2.3 GB3 GB6 GB4K
Llama 3.2 3B~2 GB2.5–3 GB6 GB8K
Qwen3 8B~5 GB5 GB8 GB32K
DeepSeek-R1 7B~5 GB6 GB12 GB128K

كيفية تشغيل وضع CPU فقط

Ollama (الأبسط): ببساطة شغّل `ollama run phi:mini`. يكتشف Ollama تلقائياً الأنظمة الخالية من GPU من NVIDIA/AMD ويستخدم RAM النظام. LM Studio: افتح الإعدادات ← اختر "None" في GPU لفرض وضع CPU. Llama.cpp: استخدم العَلَم `--n-gpu-layers 0` لتعطيل تفريغ الحمل إلى GPU.

bash
ollama run phi:mini
# Ollama auto-detects CPU-only systems

نصائح تحسين الاستدلال على CPU

لاستخراج أقصى أداء من الاستدلال على CPU:

  • استخدم تكميم Q4_K_M — يقلل حجم GGUF بنحو 70%، مع فقدان جودة ضئيل وزيادة سرعة بنسبة 10–20% بفضل سلوك ذاكرة التخزين المؤقت الأفضل.
  • قلّص نافذة السياق — السياقات الأطول = استدلال أبطأ. استخدم `--context 2048` لتحديد السياق بـ 2K token.
  • فعّل تعدد الخيوط — يكتشف Ollama وllama.cpp عدد أنوية CPU تلقائياً. تحقق عبر `nproc` من تطابقه.
  • استخدم AVX-512 أو ARM NEON — تحتوي وحدات CPU الحديثة من Intel/AMD/ARM على تعليمات متجهية. تحقق من أعلام CPU: `cat /proc/cpuinfo | grep avx512` (Linux) أو Apple حول ← تقرير النظام (Mac).
  • حجم الدفعة = 1 — يتعامل CPU بشكل أفضل مع استدلال التسلسل الواحد. لا تحاول دفعات متعددة على CPU.
  • ثبّت الخيوط على الأنوية — على Linux، استخدم `numactl --cpunodebind=0 ollama run phi:mini` لتجنب عبء التبديل بين الأنوية.

متى تستخدم CPU مقابل GPU

Caso de uso
CPU
GPU
دردشة في الوقت الفعلي (زمن استجابة < 1 ثانية)❌ بطيء جداً (12 tok/ثانية = 5 ثوانٍ لـ 60 token)✅ 80+ tok/ثانية
معالجة بالدفعات (مستندات، سجلات)✅ جيد (السرعة لا تهم)⚠️ مبالغ فيه
API إنتاجية (ميزانية محدودة)✅ $0 تكلفة عتاد⚠️ $200+ GPU + كهرباء
جهاز حافة (Raspberry Pi)✅ لا بديل❌ خيارات GPU محدودة
تطوير / اختبار محلي✅ استهلاك أقل، أهدأ⚠️ مبالغ فيه
fine-tuning لنماذج LLM❌ بطيء جداً (ساعات → أيام)✅ تسريع 10–30×

الأسئلة الشائعة

ما مدى سرعة الاستدلال على CPU فقط مقارنة بـ GPU؟

CPU: 8–15 token/ثانية على المعالجات الحديثة. GPU (RTX 3060): 80 token/ثانية. GPU (RTX 4090): 120+ token/ثانية. CPU أبطأ بمقدار 10–30× لكنه يتطلب استثمار $0 في GPU.

ما هو أصغر نموذج يُنتج مخرجات متماسكة على CPU؟

Gemma 4 E2B (1.5 GB) يُنتج ردوداً معقولة. أقل من 2B، تنخفض الجودة. لأفضل جودة مع 8 GB من RAM، استخدم Phi-4 Mini (3.8B) أو Llama 3.2 3B (2 GB).

هل يمكنني تشغيل نموذج 13B على CPU؟

نعم، مع تكميم Q4_K_M يشغل نموذج 13B نحو 6.5 GB. يحتاج إلى 8–12 GB من RAM النظام. السرعة: ~2–3 token/ثانية. غير مريح للاستخدام التفاعلي لكنه يعمل للمعالجة بالدفعات.

هل يستخدم الاستدلال على CPU وحدة GPU في أي لحظة؟

لا. وضع CPU فقط في Ollama/llama.cpp يعطّل صراحةً استخدام GPU ويعتمد حصرياً على RAM النظام.

هل الاستدلال على CPU فقط مستقر؟

نعم، أكثر استقراراً من GPU. لا توجد أعطال تعريفات، ولا أخطاء ذاكرة GPU. الخطر الوحيد هو إشباع RAM النظام، وهو ما تتحكم به باختيار النموذج المناسب.

هل أحتاج إلى ضبط إعدادات لمعالجات Apple Silicon؟

لا. يكتشف Ollama تلقائياً M1/M2/M3/M4 ويستخدم الذاكرة الموحدة بكفاءة. Apple Silicon أسرع بنحو 10–20% من معالجات Intel المكافئة بفضل بنية ذاكرته.

كم من VRAM يحتاج نموذج 7B في وضع CPU فقط؟

صفر VRAM مخصصة. نموذج 7B بتكميم Q4_K_M (~4.5 GB) يحتاج إلى 5–6 GB من RAM النظام ليعمل بارتياح. هذه هي الميزة الأساسية للاستدلال على CPU فقط — لا حاجة إلى GPU أو VRAM على الإطلاق.

هل يمكنني إجراء fine-tuning لنموذج LLM على CPU؟

من الناحية التقنية نعم، لكنه غير عملي. الـ fine-tuning على CPU أبطأ بمقدار 10–30× من GPU. استخدم وضع CPU فقط للاستدلال فقط؛ وانتقل إلى GPU لأي مهمة fine-tuning أو تدريب.

هل يمكنني تشغيل عدة نماذج في وقت واحد على CPU؟

ممكن تقنياً إذا سمحت RAM بذلك، لكنه غير عملي. تشغيل عدة نماذج في وقت واحد يسبب تنافساً على الذاكرة، ويصبح كلا النموذجين أبطأ. شغّل نموذجاً واحداً في كل مرة للحصول على أفضل أداء.

ما هي المخاطر الأمنية للاستدلال على CPU فقط؟

الاستدلال على CPU فقط أكثر أماناً من الاستدلال السحابي، لأن البيانات لا تغادر الجهاز ولا يوجد خطر نقل. المخاطر المتبقية هي نفسها في أي برنامج محلي: حافظ على تحديث نظام التشغيل وأمّن الجهاز الفعلي، لأن البيانات الحساسة غير المشفّرة يمكن أن تبقى على القرص.

هل هناك فرق في السرعة بين Ollama وllama.cpp للاستدلال على CPU؟

الفرق ضئيل جداً. يستخدم كلاهما نفس تحسينات CPU الأساسية (AVX-512). أي تفاوت بنسبة 2–5% تقريباً يأتي من اختلافات في إدارة الخيوط (threads). ابدأ بالإعدادات الافتراضية لـ Ollama ما لم تحتج إلى الأعلام الأكثر تفصيلاً في llama.cpp.

هل الاستدلال على CPU فقط عملي على حاسوب محمول قديم بذاكرة 8–10 GB؟

نعم. يعمل Gemma 4 E2B (1.5 GB) أو Phi-4 Mini (2.3 GB) بكفاءة ضمن 8–10 GB من RAM. توقع 3–5 token في الثانية — مناسب للمعالجة بالدفعات أو روبوت دردشة خفيف، لكنه بطيء جداً للدردشة الفورية.

هل يمكن لوحدات CPU تشغيل نماذج LLM؟

نعم. يمكن لوحدات CPU الحديثة (Intel i7 الجيل العاشر+، وAMD Ryzen 5000+، وApple M-series) تشغيل نماذج 3–13B بسرعة 8–15 token في الثانية. هذا أبطأ بمقدار 10–30× من GPU لكنه لا يتطلب VRAM مخصصة.

ما هو أفضل نموذج LLM على CPU فقط؟

Phi-4 Mini (3.8B، 2.3 GB، 12 token/ثانية) هو الأفضل عموماً. للسرعة: Gemma 4 E2B (1.5 GB، 15 token/ثانية). للتوازن: Llama 3.2 3B (2 GB، 10 token/ثانية).

كم من RAM أحتاج للاستدلال على CPU فقط؟

استخدم القاعدة: حجم ملف GGUF + 500 MB عبء. Phi-4 Mini (2.3 GB) يحتاج إلى 3 GB من RAM. Gemma 4 E2B (1.5 GB) يحتاج إلى 2 GB من RAM. Qwen3 8B (5 GB) يحتاج إلى 5 GB من RAM.

كيف أفعّل وضع CPU فقط؟

في Ollama، ببساطة شغّل: ollama run phi:mini. يكتشف Ollama تلقائياً الأنظمة على CPU فقط. في llama.cpp، استخدم --n-gpu-layers 0. في LM Studio، اضبط GPU على None في الإعدادات.

الخطوات التالية

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs