Skip to main content
PromptQuorum
Home/Local LLMs/أسرع نماذج LLM المحلية لأجهزة الكمبيوتر منخفضة المواصفات 2026: دليل CPU فقط
Models by Use Case

أسرع نماذج LLM المحلية لأجهزة الكمبيوتر منخفضة المواصفات 2026: دليل CPU فقط

·8 دقائق للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

أسرع LLM محلي على كمبيوتر منخفض المواصفات (CPU فقط، 8 جيجابايت رام) هو Qwen3 1.7B بصيغة Q4_K_M — بسرعة 25–40 رمزاً/ثانية على i5/Ryzen 5 حديث. لجودة جيدة مع 8 جيجابايت، يعمل Phi-4-mini (3.8B) بسرعة 15–25 رمزاً/ثانية ويدعم البرمجة والاستدلال جيداً. لا يحتاج أي نموذج في هذا الدليل إلى GPU.

CPU فقط، 8 جيجابايت رام: Qwen3 1.7B Q4_K_M يبلغ 25–40 رمزاً/ثانية على i5/Ryzen 5 حديث. Phi-4-mini (3.8B) يعمل بسرعة 15–25 رمزاً/ثانية ويدعم البرمجة والاستدلال. لا يحتاج أي نموذج في هذا الدليل إلى GPU. اعتباراً من يوليو 2026، يمكنك تشغيل LLM محلي فعّال على حاسوب محمول قديم دون GPU منفصلة. يغطي هذا الدليل مستويات العتاد من 4 جيجابايت CPU فقط حتى 16 جيجابايت مع iGPU من نوع Intel Iris — مع أوامر Ollama لكل مستوى.

أسرع نماذج LLM المحلية لأجهزة الكمبيوتر منخفضة المواصفات (2026)

تعتمد السرعة على مستوى عتادك. اربط CPU/RAM لديك بالنموذج الصحيح — الاختيار الخاطئ يترك 4–10× من السرعة دون استغلال.

  • 4 جيجابايت رام، CPU فقط: Qwen3 1.7B Q4_K_M — 25–40 tok/s على i5/Ryzen 5 حديث. `ollama run qwen3:1.7b`
  • 8 جيجابايت رام، CPU فقط: Phi-4-mini (3.8B) — 15–25 tok/s، يدعم البرمجة والاستدلال. `ollama run phi4-mini`
  • 8 جيجابايت رام + iGPU من Intel Iris: Qwen3 4B — 12–20 tok/s مع تفويض جزئي. `ollama run qwen3:4b`
  • 16 جيجابايت رام، CPU فقط: Qwen3 8B Q4_K_M — 8–15 tok/s، جودة قوية. `ollama run qwen3:8b`

بالنسبة لمعظم الحواسيب منخفضة المواصفات، Phi-4-mini (3.8B) بصيغة Q4_K_M هو النقطة المثلى — يتناسب مع 8 جيجابايت رام، 15–25 tok/s على CPU. انتقل إلى Qwen3 1.7B لأسرع استجابة ممكنة.

العرض التقديمي: أسرع نماذج LLM المحلية لأجهزة الكمبيوتر منخفضة المواصفات 2026: دليل CPU فقط

عرض تفاعلي من 14 شريحة حول أسرع نماذج LLM المحلية لأجهزة الكمبيوتر منخفضة المواصفات: 4 جيجابايت رام CPU فقط (Qwen3 1.7B، 25–40 tok/s)، النقطة المثلى 8 جيجابايت رام CPU فقط (Phi-4-mini، 15–25 tok/s)، 16 جيجابايت رام CPU فقط (Qwen3 8B، 8–15 tok/s)، ومستويات مدعومة بـ iGPU. تشمل الشرائح جدول قرار العتاد-النموذج، وتوصية واحدة لكل مستوى بأرقام رام دقيقة، ودليل التكميم (Q4/Q3/Q2)، وعتبات إدراك السرعة، والأخطاء الشائعة. نزّل ملف PDF كبطاقة مرجعية لعتاد نماذج LLM المحلية.

تصفّح الشرائح أدناه أو نزّلها بصيغة PDF للرجوع إليها دون اتصال. تنزيل البطاقة المرجعية (PDF)

أسرع نماذج LLM المحلية لأجهزة الكمبيوتر منخفضة المواصفات 2026: دليل CPU فقط

Key Takeaways

  • 4 جيجابايت رام، CPU فقط: Qwen3 1.7B Q4_K_M — 25–40 tok/s. أسرع استجابة على أقل عتاد.
  • 8 جيجابايت رام، CPU فقط (النقطة المثلى): Phi-4-mini 3.8B Q4_K_M — 15–25 tok/s. برمجة واستدلال على حواسيب محمولة قديمة.
  • 8 جيجابايت رام + iGPU من Intel Iris: Qwen3 4B — 12–20 tok/s مع تفويض جزئي لـ GPU.
  • 16 جيجابايت رام، CPU فقط: Qwen3 8B Q4_K_M — 8–15 tok/s. جودة قوية، دون حاجة لـ GPU.
  • 16 جيجابايت رام + iGPU: Llama 3.2 3B أو Qwen3 4B — 20–35 tok/s مع تفويض الطبقات.
  • الحكم الفائز: بالنسبة لمعظم الحواسيب منخفضة المواصفات، Phi-4-mini (3.8B) بصيغة Q4_K_M هو النقطة المثلى — يتناسب مع 8 جيجابايت رام، 15–25 tok/s على CPU. انتقل إلى Qwen3 1.7B لأسرع استجابة.
  • التكلفة: جميعها مجانية (مفتوحة المصدر) مقابل API لـ ChatGPT (~0.002 دولار لكل 1K رمز).

على جهاز يعمل بالمعالج CPU فقط مع 8 جيجابايت رام، يعمل Phi-4-mini 3.8B Q4_K_M بسرعة 15–25 رمزاً/ثانية للبرمجة والاستدلال؛ مع 4 جيجابايت، يصل Qwen3 1.7B Q4_K_M إلى 25–40 رمزاً/ثانية.

لا تحتاج إلى GPU للألعاب لتشغيل الذكاء الاصطناعي محلياً. هذه النماذج تعمل كلياً على المعالج والذاكرة العادية. النماذج الصغيرة (1–4B معامل) قادرة بشكل مدهش على المهام اليومية وسريعة بما يكفي لمحادثة حقيقية.

ما النموذج الأسرع لعتادك؟

اربط عتادك بالنموذج الصحيح — الاختيار الخاطئ يترك 4–10× من السرعة دون استغلال. جميع المستويات أدناه CPU فقط ما لم يُذكر خلاف ذلك.

عتادك
النموذج الموصى به
أمر Ollama
السرعة المتوقَّعة
4 جيجابايت رام، CPU فقطQwen3 1.7B Q4_K_Mollama run qwen3:1.7b25–40 tok/s
8 جيجابايت رام، CPU فقطPhi-4-mini 3.8B Q4_K_Mollama run phi4-mini15–25 tok/s
8 جيجابايت رام + iGPU من Intel IrisQwen3 4B Q4_K_Mollama run qwen3:4b12–20 tok/s
16 جيجابايت رام، CPU فقطQwen3 8B Q4_K_Mollama run qwen3:8b8–15 tok/s
16 جيجابايت رام + iGPULlama 3.2 3B Q4_K_Mollama run llama3.2:3b20–35 tok/s

أي نموذج ينبغي أن تستخدم؟

اربط وضعك بالنموذج الصحيح — هذا أهم قرار:

  • حاسوب محمول بـ 8 جيجابايت رام (دون GPU منفصلة): Phi-4-mini (3.8B) بصيغة Q4_K_M — 15–25 tok/s، يدعم البرمجة والاستدلال. `ollama run phi4-mini`
  • 4 جيجابايت رام، كمبيوتر قديم جداً: Qwen3 1.7B Q4_K_M — 25–40 tok/s، أسرع استجابة بأقل رام. `ollama run qwen3:1.7b`
  • 16 جيجابايت رام، دون GPU: Qwen3 8B Q4_K_M — 8–15 tok/s، جودة قوية. `ollama run qwen3:8b`
  • 8 جيجابايت رام + iGPU من Intel Iris: Qwen3 4B — استخدم `OLLAMA_NUM_GPU=1` لتفويض جزئي، 12–20 tok/s. `ollama run qwen3:4b`
  • تريد دعماً متعدد اللغات (سياق 128K): Qwen3 4B أو Llama 3.2 3B — كلاهما يدعم سياق 128K على Ollama.
  • يستحق التجربة أيضاً على 4–8 جيجابايت رام: Gemma 4 E2B (~1.5–2 جيجابايت، صدر في يونيو 2026) — أصغر نموذج من الجيل الحالي لجوجل. `ollama run gemma4:e2b`. لم يُختبر بعد على أجهزة هذا الدليل؛ راجع دليل النماذج بمعالج فقط للسرعات المقاسة على معالجات أخرى.
  • لتوصيات حسب مستوى الرام والتبريد، راجع كيفية تشغيل LLM محلي على حاسوب محمول.

أي LLM محلي ينبغي أن تشغّل على عتادك؟

جميع المستويات أدناه CPU فقط أو iGPU. اختر أكبر نموذج يتناسب مع الرام لديك بصيغة Q4_K_M — يقلّل التكميم الجودة أقل من خفض حجم النموذج.

Hardware
Model
Quant
Speed
Experience
4 جيجابايت رام، CPU فقطQwen3 1.7BQ4_K_M25–40 t/sسريع، جودة قابلة للاستخدام
8 جيجابايت رام، CPU فقطPhi-4-mini 3.8BQ4_K_M15–25 t/sبرمجة + استدلال
8 جيجابايت رام + iGPU IrisQwen3 4BQ4_K_M12–20 t/sتفويض جزئي لـ GPU
16 جيجابايت رام، CPU فقطQwen3 8BQ4_K_M8–15 t/sجودة قوية
16 جيجابايت رام + iGPULlama 3.2 3BQ4_K_M20–35 t/sسلس مع iGPU
سرعة LLM المحلي حسب مستوى العتاد (CPU فقط وiGPU): 4 جيجابايت رام (25–40 tok/s، Qwen3 1.7B)، 8 جيجابايت رام CPU (15–25 tok/s، Phi-4-mini)، 8 جيجابايت + iGPU Iris (12–20 tok/s)، 16 جيجابايت CPU (8–15 tok/s)، 16 جيجابايت + iGPU (20–35 tok/s). معايير يوليو 2026.
سرعة LLM المحلي حسب مستوى العتاد (CPU فقط وiGPU): 4 جيجابايت رام (25–40 tok/s، Qwen3 1.7B)، 8 جيجابايت رام CPU (15–25 tok/s، Phi-4-mini)، 8 جيجابايت + iGPU Iris (12–20 tok/s)، 16 جيجابايت CPU (8–15 tok/s)، 16 جيجابايت + iGPU (20–35 tok/s). معايير يوليو 2026.

GPU مقابل CPU لنماذج LLM المحلية: أيهما أسرع على العتاد منخفض المواصفات؟

استدلال GPU: 15–20 tok/s على RTX 3060. يتطلب إعداد CUDA. سريع، جودة أفضل. راجع دليل وحدات GPU الاقتصادية للخيارات المجدية.

iGPU (مدمجة): 5–8 tok/s على Intel Iris. دون إعداد إضافي. أبطأ من GPU المنفصلة.

استدلال CPU: 1–5 tok/s على متعدد الأنوية الحديث. يعمل في أي مكان. الأبطأ.

القاعدة: إن كان لديك أي GPU (حتى مدمجة)، استخدمها. CPU هو الملاذ الأخير.

مقارنة سرعة CPU مقابل GPU لنماذج LLM المحلية: CPU فقط يبلغ 10–25 tok/s (نماذج 3B) و15–40 tok/s. GPU (RTX 3060، 8 GB) يصل إلى 25–60 tok/s — أسرع بين 4 و10 أضعاف من الاستدلال على CPU فقط.
مقارنة سرعة CPU مقابل GPU لنماذج LLM المحلية: CPU فقط يبلغ 10–25 tok/s (نماذج 3B) و15–40 tok/s. GPU (RTX 3060، 8 GB) يصل إلى 25–60 tok/s — أسرع بين 4 و10 أضعاف من الاستدلال على CPU فقط.

لماذا النماذج الأصغر أسرع على أجهزة الكمبيوتر منخفضة المواصفات

يحدّد حجم النموذج السرعة مباشرة. يتناسب نموذج 1B–3B بالكامل مع RAM النظام، مما يتيح لـ CPU أو GPU بث البيانات باستمرار. تتطلب النماذج الأكبر تبادل الذاكرة — نقل البيانات بين RAM والقرص — مما يبطئ التوليد بين 10 و100 مرة (الاختناق هو دخل/خرج القرص، لا الحوسبة).

يعكس جدول قرار العتاد أعلاه هذا المبدأ: يبلغ TinyLlama 1.1B (1B معامل) سرعة 5–10 tok/s على وحدات CPU القديمة، بينما تكون نماذج 13B+ غير عملية على العتاد منخفض المواصفات لأن التبادل يهيمن.

  • نماذج 1B–3B: تتناسب مع 4–8 GB RAM ← توليد أسرع ← جودة مقبولة
  • نماذج 7B: ضيقة على أنظمة 8 GB ← أبطأ بسبب ضغط الذاكرة ← جودة عالية
  • نماذج 13B+: تتطلب 16+ GB VRAM أو تبادلاً ضخماً ← بطيئة جداً للاستخدام التفاعلي

ما مدى سرعة نماذج LLM المحلية على أجهزة الكمبيوتر منخفضة المواصفات؟

على أنظمة CPU فقط، توقّع:

  • نماذج 3B ← 15–40 رمز/ثانية (وحدات CPU قديمة: 10–15، وحدات CPU جديدة بتحسين: 30–40)
  • نماذج 7B ← 10–25 رمز/ثانية (يعتمد على أنوية CPU والتكميم؛ بتحسين عدواني يبلغ بعضها 30+)
  • هذا أبطأ من واجهات API السحابية (ChatGPT 4o: 80–150 tok/s) لكنه كافٍ للاستخدام التفاعلي. ينتج نموذج 3B بسرعة 25 tok/s رداً من 500 رمز في 20 ثانية — مقبول للمهام غير العاجلة كمراجعة الكود والتلخيصات والكتابة الإبداعية.

كيف يؤثر التكميم على السرعة على أجهزة الكمبيوتر منخفضة المواصفات؟

Q4 (4 بت): ~1% فقدان جودة، 50% توفير في VRAM. الخيار القياسي. لتفاصيل جميع مستويات التكميم وكيف تعمل، راجع الدليل الكامل.

Q3 (3 بت): ~3% فقدان جودة، 62% توفير في VRAM. مقبول للدردشة.

Q2 (2 بت): ~10% فقدان جودة، 75% توفير في VRAM. محفوف بالمخاطر؛ استخدمه فقط عند نفاد الذاكرة.

تأثير السرعة: Q2 أسرع بـ ~30% من Q4 بسبب استخدام أقل لعرض نطاق الذاكرة، لا بسبب الحوسبة.

الاستراتيجية: كمّم النماذج الكبيرة (Mistral Small Q2) بدلاً من استخدام نماذج صغيرة جداً (TinyLlama).

يتفوق Mistral Small Q2 على TinyLlama 1.1B Q4 في السرعة والجودة معاً.

تضحّي النماذج الأسرع بالجودة مقابل السرعة — لكن ضبط temperature وtop-p يستعيد جزءاً كبيراً من تلك الجودة. ينتج temperature منخفض (0.1–0.3) في النماذج السريعة نتائج أكثر اتساقاً من الإعداد الافتراضي. راجع شرح temperature وtop-p للإعدادات الدقيقة.

مفاضلات التكميم لنماذج LLM المحلية: Q4 (1% فقدان جودة، 50% توفير في VRAM، 4.5 GB لـ Mistral Small) هو المعيار. Q2 أسرع بـ 30% لكن بهبوط جودة 10%. تجنّب Q8 — تكلفة VRAM مضاعفة بمكسب ضئيل.
مفاضلات التكميم لنماذج LLM المحلية: Q4 (1% فقدان جودة، 50% توفير في VRAM، 4.5 GB لـ Mistral Small) هو المعيار. Q2 أسرع بـ 30% لكن بهبوط جودة 10%. تجنّب Q8 — تكلفة VRAM مضاعفة بمكسب ضئيل.

كيف تسرّع الاستدلال على CPU فقط؟

  • تفعيل AVX-512: إن دعمه CPU، استخدم `LLAMACPP_AVX512=1 ollama run phi`. ~20% تحسّن سرعة.
  • تقليل نافذة السياق: سياق أقصر = أسرع. استخدم `--ctx-size 1024` بدلاً من 4096.
  • **استخدام llama.cpp بدلاً من Ollama:** أسرع قليلاً على CPU (~10% مكسب) بحمل أقل.
  • تعطيل تعدد الخيوط: على عكس الحدس، لكن على وحدات CPU الضعيفة يكون وضع الخيط الواحد أسرع (دون حمل خيوط).
  • التفويض إلى iGPU: حتى GPU مدمجة ضعيفة تتفوق على CPU. تحقق من التوافر بـ `lspci`.

ما مدى سرعة هذه النماذج؟ معايير حقيقية

قياسات حقيقية حسب مستوى العتاد، يوليو 2026. الجميع يشغّل Ollama بالإعداد الافتراضي، دون ضبط. جميعها CPU فقط أو iGPU — دون GPU منفصلة:

  • 4 جيجابايت رام، CPU فقط (مini PC من Intel N100) + Qwen3 1.7B Q4_K_M: 25–35 tok/s. `ollama run qwen3:1.7b`
  • 8 جيجابايت رام، CPU فقط (Core i5-1235U) + Phi-4-mini Q4_K_M: 15–22 tok/s. `ollama run phi4-mini`
  • 8 جيجابايت رام، CPU فقط (Ryzen 5 5600G مع iGPU من Radeon) + Qwen3 4B Q4_K_M: 18–25 tok/s مع تفويض الطبقات.
  • 8 جيجابايت رام + Intel Iris Xe (i5 من الجيل الثاني عشر) + Qwen3 4B Q4_K_M: 12–18 tok/s. `ollama run qwen3:4b`
  • 16 جيجابايت رام، CPU فقط (Ryzen 7 7700X) + Qwen3 8B Q4_K_M: 8–13 tok/s. `ollama run qwen3:8b`
  • 16 جيجابايت رام + iGPU من Iris Xe + Llama 3.2 3B Q4_K_M: 20–30 tok/s. `ollama run llama3.2:3b`

ما "السريع" فعلاً لنماذج LLM المحلية؟

تُدرَك السرعة بشكل مختلف حسب المهمة — استخدم هذا كمرجع:

إن كان نموذجك يعمل دون 15 tok/s، اخفض حجم النموذج (7B ← 3B) أو اخفض مستوى تكميم (Q5 ← Q4) قبل شراء عتاد جديد.

  • دون 10 tok/s ← يبدو معطّلاً. تظهر الكلمات واحدة تلو الأخرى بفواصل ملحوظة. غير قابل للاستخدام للدردشة التفاعلية.
  • 15–25 tok/s ← مقبول. سرعة قابلة للقراءة لمعظم المستخدمين. جيد للأسئلة والأجوبة والتلخيصات والمساعدة في الكود.
  • 30+ tok/s ← سلس. يبدو كمساعد حقيقي. مريح لجميع المهام التفاعلية.
  • 60+ tok/s ← فوري. أسرع من القراءة. مثالي للإكمال التلقائي في الوقت الفعلي والتكرار السريع.
عتبات إدراك السرعة لنماذج LLM المحلية: دون 10 tok/s يبدو معطّلاً، 15–25 tok/s مقبول للأسئلة والأجوبة، 30+ tok/s سلس لجميع المهام، 60+ tok/s يتيح الإكمال التلقائي في الوقت الفعلي.
عتبات إدراك السرعة لنماذج LLM المحلية: دون 10 tok/s يبدو معطّلاً، 15–25 tok/s مقبول للأسئلة والأجوبة، 30+ tok/s سلس لجميع المهام، 60+ tok/s يتيح الإكمال التلقائي في الوقت الفعلي.

ما يجب تجنّبه على أجهزة الكمبيوتر منخفضة المواصفات

  • لا تشغّل نماذج 13B+ — تتجاوز حدود RAM. يتطلب نموذج 13B بصيغة Q4 سعة 8–10 GB VRAM، متجاوزاً السعة العملية لكمبيوتر منخفض المواصفات. حتى مع تكميم Q2 العدواني، تتطلب نماذج 13B سعة 5–6 GB، تاركةً هامشاً غير كافٍ لنظام التشغيل وحمل جدولة GPU. استخدم 7B أو أقل.
  • تجنّب تكميم Q8 — أبطأ بمكسب جودة ضئيل. يستخدم Q8 نحو 2× من VRAM في Q4 (8 GB مقابل 5.5 GB لـ Mistral Small) بتحسّن جودة ~2% فقط. على أنظمة 4 GB، Q8 غير عملي؛ على أنظمة 8 GB، يبقى Q4 الأمثل. Q3 هي المفاضلة الوحيدة التي تستحق النظر عندما يسبّب Q4 نفاد الذاكرة.
  • لا تتوقع أداء إكمال تلقائي في الوقت الفعلي. بسرعة 3 tok/s على CPU، يستغرق توليد 50 رمزاً 16 ثانية. يتطلب الإكمال التلقائي التفاعلي ≥20 tok/s. تخدم نماذج LLM المحلية على وحدات CPU منخفضة المواصفات الدردشة الدفعية والمسودات والمراجعة — لا الإكمال التلقائي الحي أو الكود أثناء الكتابة.
  • لا تستخدم الاستدلال على CPU فقط لروبوتات الدردشة الإنتاجية. مقبول للأدوات الداخلية والنماذج الأولية والعمل الدفعي دون اتصال. تتفوق واجهات API السحابية (زمن استجابة 15–20 ms) على وحدات CPU منخفضة المواصفات (زمن استجابة 300+ ms) للخدمات الموجهة للمستخدم. استخدم الاستدلال المحلي للسيناريوهات الحرجة للخصوصية أو دون اتصال، لا الحرجة للسرعة.

الأخطاء الشائعة

  • خطأ: استخدام TinyLlama على CPU لسرعة أعلى. المشكلة: TinyLlama يخص 4 GB VRAM، لا CPU — Phi-4-mini 3.8B أسرع وأفضل بكثير على عتاد CPU فقط. الحل: شغّل Phi-4-mini 3.8B على CPU؛ احتفظ بـ TinyLlama Q5 لـ 4 GB VRAM.
  • خطأ: عدم تفعيل أعلام تسريع CPU. المشكلة: عدم تفعيل AVX/NEON يهدر 20% من السرعة دون تكلفة. الحل: اضبط `LLAMACPP_AVX512=1` أو `LLAMACPP_NEON=1` قبل تشغيل Ollama.
  • خطأ: التكميم إلى Q2 لإجبار 7B في 4 GB. المشكلة: كثيراً ما يسبّب تكميم Q2 تعليقاً بسبب نفاد الذاكرة بسبب حمل ذاكرة KV المؤقتة أثناء الاستدلال. الحل: استخدم نموذج 3B بصيغة Q4.
  • خطأ: افتراض أن العتاد الأحدث يعني دائماً استدلالاً أسرع. المشكلة: Ryzen المكتبي ليس أسرع لكل رمز من ARM المحمول لأن برمجيات سطح المكتب تفتقر إلى تحسين الذاكرة. الحل: أجرِ معايير على عتادك الحقيقي.
  • خطأ: استخدام slug خاطئ في Ollama لنموذجك. المشكلة: `ollama run phi` يحمّل Phi-2، لا Phi-4-mini. الحل: استخدم `ollama run phi4-mini` لأحدث نموذج Phi. راجع دائماً ollama.com/library للوسوم الدقيقة للنماذج.

نماذج LLM المحلية على أجهزة الكمبيوتر منخفضة المواصفات: السياق الإقليمي

الاتحاد الأوروبي / GDPR: محلياً على أجهزة منخفضة التكلفة: لا تغادر بيانات الاستنتاج الجهاز — وهذه طريقة تقنية بسيطة لكثير من الشركات الصغيرة والمتوسطة والعاملين لحسابهم الخاص لتجنب مخاطر النقل وفق المادة 44 من اللائحة العامة لحماية البيانات. لا يفرض قانون الذكاء الاصطناعي للاتحاد الأوروبي (ساري منذ فبراير 2025) متطلبات توثيق للاستدلال للاستخدام الشخصي. للشركات الألمانية الصغيرة والمتوسطة التي تستخدم نماذج LLM المحلية لمهام العمل الداخلية، يوصي BSI-Grundschutz بالاستدلال المحلي لمعالجة المستندات الحساسة. غير أن الامتثال الشامل لحماية البيانات يعتمد على التشغيل الكامل، وليس على بنية الاستنتاج وحدها.

اليابان: تشجّع إرشادات METI لحوكمة الذكاء الاصطناعي على تقليل البيانات. يلبّي الاستدلال على CPU لعتاد منخفض المواصفات، رغم بطئه، أشد متطلبات سيادة البيانات — دون استدعاءات API، دون تسجيل، ودون وصول طرف ثالث للبيانات. بالنسبة للمستخدمين اليابانيين الذين يشغّلون Qwen3 على CPU لمهام باللغة اليابانية، تعتبر إنتاجية 1–3 رمز/ثانية مقبولة لتلخيص المستندات غير العاجل.

الصين: الاستدلال المحلي على العتاد الاستهلاكي شائع لعمليات نشر Qwen3 وDeepSeek-R1 في الصين، حيث يكون الوصول إلى واجهات API السحابية للنماذج غير الصينية مقيّداً. يعمل Qwen3 1.7B و4B على عتاد CPU فقط، موفّراً بديلاً عملياً لواجهات API السحابية للمستخدمين ذوي العتاد المحدود.

الأسئلة الشائعة حول كيفية تشغيل نماذج LLM المحلية على أجهزة الكمبيوتر منخفضة المواصفات

ما الذي يُعَد كمبيوتراً منخفض المواصفات لتشغيل نماذج LLM المحلية؟

الكمبيوتر منخفض المواصفات لنماذج LLM المحلية هو أي جهاز CPU فقط (دون GPU منفصلة) بذاكرة نظام من 4 إلى 16 جيجابايت. يشمل معظم الحواسيب المحمولة بمعالجات رسوم مدمجة Intel Iris أو AMD Radeon، وأجهزة سطح المكتب القديمة دون GPU مخصصة، وأجهزة mini PC مثل Intel N100. القيد الرئيسي هو ذاكرة النظام لاستيعاب أوزان النموذج، لا سرعة ساعة CPU.

هل يمكنني تشغيل نموذج من فئة 7B دون أي GPU على الإطلاق؟

نعم — يعمل Qwen3 8B بصيغة Q4_K_M بسرعة 8–15 tok/s مع 16 جيجابايت رام، CPU فقط (مُختبَر على Ryzen 7 7700X). إنه أبطأ من الخيارات الأصغر لكنه يقدّم جودة أفضل بشكل ملحوظ. مع 8 جيجابايت رام، التزم بـ Phi-4-mini (3.8B) بدلاً منه — يحتاج نموذج 8B بصيغة Q4_K_M هامشاً لا يضمنه نظام 8 جيجابايت بشكل موثوق دائماً.

هل استدلال CPU قابل للاستخدام لروبوتات الدردشة؟

نعم، للاستخدام التفاعلي إن اخترت الحجم الصحيح للنموذج. Phi-4-mini بسرعة 15–25 tok/s (8 جيجابايت رام) وQwen3 1.7B بسرعة 25–40 tok/s (4 جيجابايت رام) كلاهما سريع بما يكفي للدردشة الفورية. نموذج من فئة 7B على CPU (8–15 tok/s) أنسب للمهام الدفعية — الصياغة والتلخيص والمراجعة دون اتصال — من المحادثة الحية المتبادلة.

هل ينبغي أن أستخدم Phi-4-mini أم Qwen3 1.7B على عتاد CPU فقط؟

استخدم Phi-4-mini (3.8B) إن كان لديك 8 جيجابايت رام — يدعم البرمجة والاستدلال بسرعة 15–25 tok/s. استخدم Qwen3 1.7B إن كان لديك 4 جيجابايت رام فقط أو تريد أسرع استجابة ممكنة (25–40 tok/s) على حساب بعض الجودة في المهام المعقدة.

كيف أتحقق إن كان لدي أي GPU على الإطلاق؟

شغّل `nvidia-smi` في الطرفية لوحدات NVIDIA المنفصلة. إن أعاد "command not found"، تحقق من `lspci` (على Linux) أو مدير الأجهزة (على Windows) بحثاً عن iGPU من نوع Intel Iris Xe أو AMD Radeon — يمكن لهذه أن تفوّض بعض الطبقات حتى دون دعم CUDA.

كيف يؤثر التكميم على سرعة الاستدلال؟

يقلّل التكميم أساساً متطلبات عرض نطاق الذاكرة، لا الحوسبة. Q2 (2 بت) أسرع بنحو 30% من Q4 (4 بت) لأن النموذج يحمّل بايتات أقل لكل تمريرة أمامية. لكن Q2 يحمل عقوبة جودة ~10%. القاعدة العملية: استخدم Q4_K_M افتراضياً لكل مستوى في هذا الدليل، اخفض إلى Q3 فقط إن لم يتناسب Q4_K_M مع الرام المتاحة.

هل يمكنني استخدام تكميم دون Q2؟

تقنياً نعم (Q1)، لكن الجودة تتدهور بشكل كارثي — حتى 30% فقدان دقة. غير موصى به لأي حالة استخدام عملية، بما في ذلك مستوى 4 جيجابايت رام في هذا الدليل.

هل الاستدلال الهجين CPU + iGPU مدعوم؟

نعم، عبر تفريغ الطبقات. مع نظام 8 جيجابايت رام وiGPU من Intel Iris Xe، يبلغ Qwen3 4B سرعة 12–20 tok/s مع تفويض جزئي مقارنة بـ CPU فقط. اضبط `OLLAMA_NUM_GPU=1` وسيفوّض Ollama تلقائياً الطبقات التي تتناسب.

ما أسرع LLM محلي لكمبيوتر منخفض المواصفات؟

Qwen3 1.7B بصيغة Q4_K_M هو أسرع نموذج في هذا الدليل — 25–40 tok/s على i5/Ryzen 5 حديث مع 4 جيجابايت رام ودون GPU. لجودة أفضل بسرعة مماثلة، يعمل Phi-4-mini (3.8B) بسرعة 15–25 tok/s مع 8 جيجابايت رام ويدعم البرمجة والاستدلال بشكل أفضل ملحوظاً.

هل يمكنني تشغيل LLM محلي بـ 4 جيجابايت من الرام؟

نعم — Qwen3 1.7B بصيغة Q4_K_M هو الخيار الموصى به لـ 4 جيجابايت رام، CPU فقط، ويبلغ 25–40 tok/s على i5/Ryzen 5 حديث. إنه أسرع نموذج في هذا الدليل ويتناسب بهامش لنظام التشغيل.

هل GPU ضرورية لسرعة أعلى؟

لا — تعمل جميع نماذج هذا الدليل على CPU فقط. تضيف iGPU من Intel Iris دفعة سرعة ملحوظة (Qwen3 4B: 12–20 tok/s مع تفويض جزئي مقابل CPU فقط) لكنها اختيارية. GPU منفصلة مثل RTX 4060 8 GB مستعملة أسرع بـ 5–10× من أي تكوين CPU، لكنها مسار ترقية منفصل، لا شرط أساسي.

هل iGPU من Intel Iris كافية لنماذج LLM المحلية؟

نعم — مع 8 جيجابايت رام وiGPU من Intel Iris Xe، يبلغ Qwen3 4B سرعة 12–20 tok/s مع تفويض جزئي للطبقات، أسرع من CPU فقط في نفس مستوى الرام. مع 16 جيجابايت رام وiGPU، يبلغ Llama 3.2 3B سرعة 20–35 tok/s. أي iGPU تتفوق على CPU فقط لاستدلال نماذج LLM المحلية.

هل ينبغي أن أستخدم تكميم Q2 أم Q4 على العتاد منخفض المواصفات؟

ابدأ بـ Q4_K_M — يتناسب مع كل مستوى نموذج في هذا الدليل (من 1.7B إلى 8B) بفقدان جودة ~1% فقط. اخفض إلى Q3 أو Q2 فقط إن سبّب Q4_K_M أخطاء نفاد ذاكرة. Q2 أسرع بنحو 30% لكن بفقدان جودة ~10% — ملحوظ في مهام الاستدلال والكود.

كيف أتحقق من الرام المتاحة لدي على Windows؟

افتح مدير المهام ← الأداء ← الذاكرة. الإجمالي المعروض هو رام النظام لديك — قارنه بجدول قرار العتاد أعلاه (مستويات 4 أو 8 أو 16 جيجابايت) لاختيار النموذج الصحيح.

هل يستخدم Ollama وحدة GPU المدمجة لدي تلقائياً؟

جزئياً — اضبط `OLLAMA_NUM_GPU=1` لتفعيل التفويض الجزئي للطبقات على رسوميات Intel Iris أو AMD Radeon المدمجة. تحقق بـ `ollama ps` بعد تحميل نموذج — يعرض توزيع الطبقات بين CPU وGPU.

ما أفضل بديل مجاني لـ ChatGPT على كمبيوتر منخفض المواصفات؟

Phi-4-mini (3.8B) بصيغة Q4_K_M على Ollama مع 8 جيجابايت رام، CPU فقط، يعطي 15–25 tok/s — كافٍ للدردشة والتلخيصات والمساعدة في الكود. الجودة أقل من نموذج سحابي متقدم لكنها كافية للمهام اليومية. مجاني تماماً، يعمل دون اتصال، دون حاجة لمفتاح API.

كم أسرع GPU منفصلة من CPU لنماذج LLM المحلية؟

أسرع بين 5 و10 أضعاف. تتفوق RTX 4060 8 GB مستعملة (~250 دولاراً) بشكل كبير على أي إعداد CPU فقط في هذا الدليل. تقع iGPU من Intel Iris في مرتبة وسطى — على سبيل المثال يبلغ Qwen3 4B سرعة 12–20 tok/s مع تفويض iGPU مقابل 8–15 tok/s لـ CPU فقط في أقرب مستوى مقارن.

هل نموذج الذكاء الاصطناعي المحلي هو نفسه LLM المحلي؟

بالنسبة لهذا الدليل، نعم. "نموذج الذكاء الاصطناعي المحلي" هو التعبير الشائع لما يسميه المجال LLM محلي (نموذج لغوي كبير) — أوزان مولّدة للنص تُحمّل مرة واحدة وتُشغّل على جهازك الخاص، دون اتصال. لا يهم هذا التمييز إلا عندما يكون نموذج الذكاء الاصطناعي غير نصي: مولدات الصور مثل Stable Diffusion ونماذج الكلام مثل Whisper تعمل محلياً أيضاً، لكن لها ملفات أجهزة مختلفة ولا تنطبق عليها أرقام tok/s في هذا الدليل.

ما هو أخف LLM محلي لا يزال يكتب نصاً قابلاً للاستخدام؟

Qwen3 1.7B بصيغة Q4_K_M هو أخف نموذج في هذا الدليل يستحق الاستخدام — نحو 1.1 جيجابايت على القرص، يعمل بـ 4 جيجابايت رام، وبسرعة 25–40 tok/s على CPU فقط. توجد خيارات أصغر (TinyLlama 1.1B، Qwen3 0.6B) وهي أسرع، لكن جودة الإخراج تنخفض بشكل حاد يجعل التعامل معها كإكمال تلقائي أفضل من اعتبارها مساعد كتابة. دون نحو 1 مليار معامل، لا ينتج أي نموذج خفيف نصاً طويلاً متماسكاً بشكل موثوق.

هل Gemma 4 E2B أسرع من Qwen3 1.7B على كمبيوتر منخفض الأداء؟

Gemma 4 E2B (جوجل، صدر في يونيو 2026، ~1.5–2 جيجابايت) خيار أحدث وملائم لـ CPU يستحق التجربة إلى جانب Qwen3 1.7B على أنظمة 4–8 جيجابايت رام. سجّل 15 tok/s على معالج Intel i7-12700 في دليل PromptQuorum المرجعي لمعالج فقط — معالج مكتبي أقوى من أجهزة الميني بي سي وأجهزة الألترابوك المُختبرة في هذه الصفحة. يبقى Qwen3 1.7B الخيار المُختبر في هذا الدليل للأجهزة الأضعف (25–40 tok/s على معالجات من فئة Intel N100/i5-1235U)؛ إذا كان جهازك أقرب إلى i7 مكتبي، جرّب `ollama run gemma4:e2b` للمقارنة.

المصادر

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs