Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/أفضل نماذج ⁨LLM⁩ على ⁨CPU⁩ فقط ⁨2026⁩: بدون ⁨GPU⁩ (⁨5⁩ نماذج مُختبرة)
Best Models

أفضل نماذج ⁨LLM⁩ على ⁨CPU⁩ فقط ⁨2026⁩: بدون ⁨GPU⁩ (⁨5⁩ نماذج مُختبرة)

·8 دقائق للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

الاستدلال باستخدام CPU فقط يعمل جيداً لنماذج 3–13B على المعالجات الحديثة. أفضل الخيارات: Phi-4 Mini (3.8B، 2.3 GB، 12 token/ثانية على CPU) للدردشة العامة، وGemma 3 2B (1.5 GB، الأسرع) للمهام الحساسة للسرعة، وLlama 3.2 3B (2 GB، متوازن) للجودة. استخدم Ollama أو llama.cpp مع وضع CPU. الاستدلال على CPU أبطأ بمقدار 10–30× من GPU لكنه لا يستخدم VRAM مخصصة — فقط ذاكرة RAM النظام.

الاستدلال باستخدام CPU فقط عملي لنماذج 3–13B على المعالجات الحديثة المزودة بذاكرة RAM بسعة 8–32 GB. أفضل نماذج CPU فقط في مايو 2026 هي Phi-4 Mini (3.8B، ~2.3 GB، 12 token/ثانية على CPU)، وGemma 3 2B (1.5 GB، 15 token/ثانية)، وLlama 3.2 3B (2 GB، 10 token/ثانية). شغّلها عبر Ollama أو LM Studio أو llama.cpp مع تفعيل وضع CPU فقط.

أفضل نماذج ⁨LLM⁩ على ⁨CPU⁩ فقط ⁨2026⁩: بدون ⁨GPU⁩ (⁨5⁩ نماذج مُختبرة)

Key Takeaways

  • الاستدلال باستخدام CPU فقط يعمل جيداً لنماذج 3–13B على المعالجات الحديثة المزودة بذاكرة RAM بسعة 8–32 GB.
  • أفضل نماذج CPU: Phi-4 Mini (3.8B، 2.3 GB، 12 token/ثانية)، وGemma 3 2B (1.5 GB، 15 token/ثانية)، وLlama 3.2 3B (2 GB، 10 token/ثانية).
  • الاستدلال على CPU أبطأ بمقدار 10–30× من GPU لكنه يستخدم صفر VRAM مخصصة.
  • فعّل وضع CPU فقط في Ollama أو llama.cpp عبر خيار بسيط في سطر الأوامر.
  • الاستدلال على CPU مثالي لواجهات API الإنتاجية (بدون عبء GPU)، وأجهزة الحافة، والبيئات محدودة الميزانية.

هل يمكن لوحدات CPU تشغيل نماذج LLM؟

نعم، يمكن لوحدات CPU الحديثة (Intel i7 الجيل العاشر+، وAMD Ryzen 5000+، وApple M-series) تشغيل نماذج 3–13B بسرعة 8–15 token في الثانية. هذا أبطأ بمقدار 10–30× من GPU لكنه لا يتطلب VRAM مخصصة. يمكن لوحدة CPU مع ذاكرة RAM نظام كافية (8–32 GB) تشغيل نماذج كانت ستتطلب GPU بقيمة $300 أو أكثر.

الاستدلال على CPU يقايض السرعة بسهولة الوصول: صفر عبء GPU، واستقرار تام، وبدون مشاكل تعريفات. لحالات الاستخدام العرضية (روبوتات الدردشة التي تجيب عن طلبات قليلة في الثانية، ومعالجة المستندات دون اتصال)، وضع CPU فقط عملي.

تحتوي وحدات CPU الحديثة على تعليمات متجهية AVX-512 أو NEON/SVE تسرّع عمليات المصفوفات. أدوات مثل llama.cpp وOllama تستخدمها تلقائياً، مما يجعل الاستدلال على CPU أسرع بكثير من التطبيقات البدائية.

أفضل نماذج CPU فقط 2026

يصنّف الجدول التالي النماذج حسب الأداء على Intel i7-12700 (12 نواة، AVX-512) مع وضع CPU فقط:

ModeloParámetrosTamaño GGUFRAM necesariaVelocidad CPUMejor para
Phi-4 Mini3.8B~2.3 GB4 GB12 tok/ثانيةدردشة عامة، مساعدة برمجية
Gemma 3 2B2B~1.5 GB3 GB15 tok/ثانيةردود سريعة، VRAM منخفض
Llama 3.2 3B3B~2 GB3.5 GB10 tok/ثانيةتوازن الجودة/السرعة
Mistral Small Q47B~4.5 GB6 GB5 tok/ثانيةأفضل جودة، 16+ GB RAM
Llama 3.3 8B Q48B~5 GB7 GB4 tok/ثانيةالبرمجة، المهام المنطقية
يوازن Phi-4 Mini بين السرعة والجودة بأفضل شكل — بينما يُعد Gemma 3 2B أسرع لكن أقل قدرة بمعدل 15 مقابل 12 رمزاً/ثانية.
يوازن Phi-4 Mini بين السرعة والجودة بأفضل شكل — بينما يُعد Gemma 3 2B أسرع لكن أقل قدرة بمعدل 15 مقابل 12 رمزاً/ثانية.

مقارنة السرعة: CPU مقابل GPU

تتفاوت السرعة حسب العتاد. أُجريت هذه القياسات على عتاد قياسي لعام 2026 يشغّل Ollama أو llama.cpp:

HardwareModeloVelocidadNotas
Intel i7-12700 (CPU)Phi-4 Mini 3.8B12 token/ثانيةAVX-512 مُفعّل
AMD Ryzen 7 5700X (CPU)Phi-4 Mini 3.8B9 token/ثانيةAVX2 أقدم فقط
Apple M3 (CPU)Phi-4 Mini 3.8B14 token/ثانيةميزة الذاكرة الموحدة
RTX 3060 (GPU, 12 GB)Phi-4 Mini 3.8B80 token/ثانيةGPU أسرع بمقدار 6.7×
RTX 4090 (GPU, 24 GB)Llama 3.3 8B Q4120 token/ثانيةGPU أسرع بمقدار 30× من CPU
يكون CPU أبطأ من GPU بمقدار 6 إلى 30 مرة — لكنه لا يُكلّف شيئاً من عتاد مخصص ويعمل على أي جهاز.
يكون CPU أبطأ من GPU بمقدار 6 إلى 30 مرة — لكنه لا يُكلّف شيئاً من عتاد مخصص ويعمل على أي جهاز.

متطلبات RAM لكل نموذج

القاعدة العامة: حجم GGUF + 500 MB عبء = الحد الأدنى من RAM المطلوب. نموذج GGUF بحجم 2 GB يحتاج إلى 2.5–3 GB من RAM النظام الحرة:

ModeloTamaño GGUFRAM mínimaCómodoLongitud de contexto
Gemma 3 2B~1.5 GB2–2.5 GB4 GB8K
Phi-4 Mini 3.8B~2.3 GB3 GB6 GB4K
Llama 3.2 3B~2 GB2.5–3 GB6 GB8K
Mistral Small Q4~4.5 GB5 GB8 GB32K
Llama 3.3 8B Q4~5 GB6 GB12 GB128K

كيفية تشغيل وضع CPU فقط

Ollama (الأبسط): ببساطة شغّل `ollama run phi:mini`. يكتشف Ollama تلقائياً الأنظمة الخالية من GPU من NVIDIA/AMD ويستخدم RAM النظام. LM Studio: افتح الإعدادات ← اختر "None" في GPU لفرض وضع CPU. Llama.cpp: استخدم العَلَم `--n-gpu-layers 0` لتعطيل تفريغ الحمل إلى GPU.

bash
ollama run phi:mini
# Ollama auto-detects CPU-only systems

نصائح تحسين الاستدلال على CPU

لاستخراج أقصى أداء من الاستدلال على CPU:

  • استخدم تكميم Q4_K_M — يقلل حجم GGUF بنحو 70%، مع فقدان جودة ضئيل وزيادة سرعة بنسبة 10–20% بفضل سلوك ذاكرة التخزين المؤقت الأفضل.
  • قلّص نافذة السياق — السياقات الأطول = استدلال أبطأ. استخدم `--context 2048` لتحديد السياق بـ 2K token.
  • فعّل تعدد الخيوط — يكتشف Ollama وllama.cpp عدد أنوية CPU تلقائياً. تحقق عبر `nproc` من تطابقه.
  • استخدم AVX-512 أو ARM NEON — تحتوي وحدات CPU الحديثة من Intel/AMD/ARM على تعليمات متجهية. تحقق من أعلام CPU: `cat /proc/cpuinfo | grep avx512` (Linux) أو Apple حول ← تقرير النظام (Mac).
  • حجم الدفعة = 1 — يتعامل CPU بشكل أفضل مع استدلال التسلسل الواحد. لا تحاول دفعات متعددة على CPU.
  • ثبّت الخيوط على الأنوية — على Linux، استخدم `numactl --cpunodebind=0 ollama run phi:mini` لتجنب عبء التبديل بين الأنوية.

متى تستخدم CPU مقابل GPU

Caso de usoCPUGPU
دردشة في الوقت الفعلي (زمن استجابة < 1 ثانية)❌ بطيء جداً (12 tok/ثانية = 5 ثوانٍ لـ 60 token)✅ 80+ tok/ثانية
معالجة بالدفعات (مستندات، سجلات)✅ جيد (السرعة لا تهم)⚠️ مبالغ فيه
API إنتاجية (ميزانية محدودة)✅ $0 تكلفة عتاد⚠️ $200+ GPU + كهرباء
جهاز حافة (Raspberry Pi)✅ لا بديل❌ خيارات GPU محدودة
تطوير / اختبار محلي✅ استهلاك أقل، أهدأ⚠️ مبالغ فيه
fine-tuning لنماذج LLM❌ بطيء جداً (ساعات → أيام)✅ تسريع 10–30×

الأسئلة الشائعة

ما مدى سرعة الاستدلال على CPU فقط مقارنة بـ GPU؟

CPU: 8–15 token/ثانية على المعالجات الحديثة. GPU (RTX 3060): 80 token/ثانية. GPU (RTX 4090): 120+ token/ثانية. CPU أبطأ بمقدار 10–30× لكنه يتطلب استثمار $0 في GPU.

ما هو أصغر نموذج يُنتج مخرجات متماسكة على CPU؟

Gemma 3 2B (1.5 GB) يُنتج ردوداً معقولة. أقل من 2B، تنخفض الجودة. لأفضل جودة مع 8 GB من RAM، استخدم Phi-4 Mini (3.8B) أو Llama 3.2 3B (2 GB).

هل يمكنني تشغيل نموذج 13B على CPU؟

نعم، مع تكميم Q4_K_M يشغل نموذج 13B نحو 6.5 GB. يحتاج إلى 8–12 GB من RAM النظام. السرعة: ~2–3 token/ثانية. غير مريح للاستخدام التفاعلي لكنه يعمل للمعالجة بالدفعات.

هل يستخدم الاستدلال على CPU وحدة GPU في أي لحظة؟

لا. وضع CPU فقط في Ollama/llama.cpp يعطّل صراحةً استخدام GPU ويعتمد حصرياً على RAM النظام.

هل الاستدلال على CPU فقط مستقر؟

نعم، أكثر استقراراً من GPU. لا توجد أعطال تعريفات، ولا أخطاء ذاكرة GPU. الخطر الوحيد هو إشباع RAM النظام، وهو ما تتحكم به باختيار النموذج المناسب.

هل أحتاج إلى ضبط إعدادات لمعالجات Apple Silicon؟

لا. يكتشف Ollama تلقائياً M1/M2/M3/M4 ويستخدم الذاكرة الموحدة بكفاءة. Apple Silicon أسرع بنحو 10–20% من معالجات Intel المكافئة بفضل بنية ذاكرته.

الخطوات التالية

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs