Key Takeaways
- CPU فقط (دون GPU): Phi-4 Mini 3.8B بسرعة 5–15 tok/s. أفضل خيار على CPU للدردشة والتلخيصات.
- 4 GB VRAM: TinyLlama 1.1B Q5 بسرعة 20–40 tok/s. ردود سريعة، مهام بسيطة.
- 6 GB VRAM: Phi-4 Mini Q5 بسرعة 15–30 tok/s. كود خفيف ودردشة.
- 8 GB VRAM (النقطة المثلى): Mistral Small Q4 بسرعة 25–60 tok/s. تجربة مساعد كاملة وسلسة.
- 16 GB+: نماذج 13B Q4 بسرعة 20–50 tok/s. جودة عالية للمهام الصعبة.
- ترتيب السرعة (من الأعلى للأدنى): GPU 4 GB > GPU 8 GB > 16 GB+ > GPU 6 GB > CPU.
- ترتيب الجودة: 13B > Mistral Small = Llama 3.3 8B > Phi-4 Mini > TinyLlama 1B.
- التكلفة: جميعها مجانية (مفتوحة المصدر) مقابل API لـ ChatGPT (~0.002 دولار لكل 1K رمز).
على جهاز يعمل بالمعالج CPU فقط مع 8 جيجابايت رام، يعمل Phi-4-mini 3.8B Q4_K_M بسرعة 15–25 رمزاً/ثانية للبرمجة والاستدلال؛ مع 4 جيجابايت، يصل Qwen3 1.7B Q4_K_M إلى 25–40 رمزاً/ثانية.
لا تحتاج إلى GPU للألعاب لتشغيل الذكاء الاصطناعي محلياً. هذه النماذج تعمل كلياً على المعالج والذاكرة العادية. النماذج الصغيرة (1–4B معامل) قادرة بشكل مدهش على المهام اليومية وسريعة بما يكفي لمحادثة حقيقية.
ما النموذج الأسرع لعتادك؟
اربط عتادك بالنموذج الصحيح — الاختيار الخاطئ يترك 10–30× من السرعة دون استغلال.
| عتادك | النموذج الموصى به | السرعة المتوقَّعة |
|---|---|---|
| CPU فقط (دون GPU) | Phi-4 Mini Q4 | 5–15 tok/s |
| 4 GB VRAM (الجودة) | TinyLlama 1B Q5 | 20–40 tok/s |
| 4 GB VRAM (السرعة) | Gemma 3 2B Q5 | 30–50 tok/s |
| 6 GB VRAM | Phi-4 Mini Q5 | 15–30 tok/s |
| 8 GB VRAM | Mistral Small Q4 | 25–60 tok/s |
| 16 GB+ | نماذج 13B Q4 | 20–50 tok/s |
أي نموذج ينبغي أن تستخدم؟
اربط وضعك بالنموذج الصحيح — هذا أهم قرار:
- حاسوب محمول بـ 8 GB RAM (دون GPU منفصلة): Mistral Small Q4 — توازن جيد بين السرعة والجودة للاستدلال على CPU فقط.
- 16 GB RAM: Llama 3.3 8B Q5 — جودة أعلى من Q4، يتناسب بهامش.
- كمبيوتر قديم جداً (4 GB RAM أو أقل): TinyLlama 1B Q5 أو Phi-4 Mini Q4 — الخياران الوحيدان القابلان للتطبيق في هذا المستوى.
- تريد أقصى سرعة: نماذج 3B (Phi-4 Mini، Llama 3.2 3B) — 60–120 tok/s على أي GPU حديثة.
- تريد الجودة: 7B Q5 (Mistral Small Q5 أو Llama 3.3 8B Q5) — من بين خيارات الجودة الأعلى التي تتناسب مع أقل من 8 GB VRAM.
أي LLM محلي ينبغي أن تشغّل على عتادك؟
**اختر أكبر نموذج تستطيع VRAM لديك استيعابه بصيغة Q4، ثم اخفض التكميم قبل التحوّل إلى نموذج أصغر. يقلّل التكميم الجودة أقل من خفض حجم النموذج.**
| Hardware | Model | Quant | Speed | Experience |
|---|---|---|---|---|
| CPU فقط | Phi-4 Mini | Q4 | 5–15 t/s | بطيء لكن قابل للاستخدام |
| GPU 4 GB | TinyLlama 1B | Q5 | 20–40 t/s | مهام بسيطة سريعة |
| GPU 6 GB | Phi-4 Mini | Q5 | 15–30 t/s | مقبول |
| GPU 8 GB | Mistral Small | Q4 | 25–60 t/s | سلس |
| 16 GB+ | نماذج 13B | Q4 | 20–50 t/s | متين |

GPU مقابل CPU لنماذج LLM المحلية: أيهما أسرع على العتاد منخفض المواصفات؟
استدلال GPU: 15–20 tok/s على RTX 3060. يتطلب إعداد CUDA. سريع، جودة أفضل. راجع دليل وحدات GPU الاقتصادية للخيارات المجدية.
iGPU (مدمجة): 5–8 tok/s على Intel Iris. دون إعداد إضافي. أبطأ من GPU المنفصلة.
استدلال CPU: 1–5 tok/s على متعدد الأنوية الحديث. يعمل في أي مكان. الأبطأ.
القاعدة: إن كان لديك أي GPU (حتى مدمجة)، استخدمها. CPU هو الملاذ الأخير.

لماذا النماذج الأصغر أسرع على أجهزة الكمبيوتر منخفضة المواصفات
يحدّد حجم النموذج السرعة مباشرة. يتناسب نموذج 1B–3B بالكامل مع RAM النظام، مما يتيح لـ CPU أو GPU بث البيانات باستمرار. تتطلب النماذج الأكبر تبادل الذاكرة — نقل البيانات بين RAM والقرص — مما يبطئ التوليد بين 10 و100 مرة (الاختناق هو دخل/خرج القرص، لا الحوسبة).
يعكس جدول قرار العتاد أعلاه هذا المبدأ: يبلغ TinyLlama 1.1B (1B معامل) سرعة 5–10 tok/s على وحدات CPU القديمة، بينما تكون نماذج 13B+ غير عملية على العتاد منخفض المواصفات لأن التبادل يهيمن.
- نماذج 1B–3B: تتناسب مع 4–8 GB RAM ← توليد أسرع ← جودة مقبولة
- نماذج 7B: ضيقة على أنظمة 8 GB ← أبطأ بسبب ضغط الذاكرة ← جودة عالية
- نماذج 13B+: تتطلب 16+ GB VRAM أو تبادلاً ضخماً ← بطيئة جداً للاستخدام التفاعلي
ما مدى سرعة نماذج LLM المحلية على أجهزة الكمبيوتر منخفضة المواصفات؟
على أنظمة CPU فقط، توقّع:
- نماذج 3B ← 15–40 رمز/ثانية (وحدات CPU قديمة: 10–15، وحدات CPU جديدة بتحسين: 30–40)
- نماذج 7B ← 10–25 رمز/ثانية (يعتمد على أنوية CPU والتكميم؛ بتحسين عدواني يبلغ بعضها 30+)
- هذا أبطأ من واجهات API السحابية (ChatGPT 4o: 80–150 tok/s) لكنه كافٍ للاستخدام التفاعلي. ينتج نموذج 3B بسرعة 25 tok/s رداً من 500 رمز في 20 ثانية — مقبول للمهام غير العاجلة كمراجعة الكود والتلخيصات والكتابة الإبداعية.
كيف يؤثر التكميم على السرعة على أجهزة الكمبيوتر منخفضة المواصفات؟
Q4 (4 بت): ~1% فقدان جودة، 50% توفير في VRAM. الخيار القياسي. لتفاصيل جميع مستويات التكميم وكيف تعمل، راجع الدليل الكامل.
Q3 (3 بت): ~3% فقدان جودة، 62% توفير في VRAM. مقبول للدردشة.
Q2 (2 بت): ~10% فقدان جودة، 75% توفير في VRAM. محفوف بالمخاطر؛ استخدمه فقط عند نفاد الذاكرة.
تأثير السرعة: Q2 أسرع بـ ~30% من Q4 بسبب استخدام أقل لعرض نطاق الذاكرة، لا بسبب الحوسبة.
الاستراتيجية: كمّم النماذج الكبيرة (Mistral Small Q2) بدلاً من استخدام نماذج صغيرة (TinyLlama).
يتفوق Mistral Small Q2 على TinyLlama 1.1B Q4 في السرعة والجودة معاً.
تضحّي النماذج الأسرع بالجودة مقابل السرعة — لكن ضبط temperature وtop-p يستعيد جزءاً كبيراً من تلك الجودة. ينتج temperature منخفض (0.1–0.3) في النماذج السريعة نتائج أكثر اتساقاً من الإعداد الافتراضي. راجع شرح temperature وtop-p للإعدادات الدقيقة.
كيف تسرّع الاستدلال على CPU فقط؟
- تفعيل AVX-512: إن دعمه CPU، استخدم `LLAMACPP_AVX512=1 ollama run phi`. ~20% تحسّن سرعة.
- تقليل نافذة السياق: سياق أقصر = أسرع. استخدم `--ctx-size 1024` بدلاً من 4096.
- **استخدام llama.cpp بدلاً من Ollama:** أسرع قليلاً على CPU (~10% مكسب) بحمل أقل.
- تعطيل تعدد الخيوط: على عكس الحدس، لكن على وحدات CPU الضعيفة يكون وضع الخيط الواحد أسرع (دون حمل خيوط).
- التفويض إلى iGPU: حتى GPU مدمجة ضعيفة تتفوق على CPU. تحقق من التوافر بـ `lspci`.
ما مدى سرعة هذه النماذج؟ معايير حقيقية (أبريل 2026)
قياسات حقيقية حسب مستوى العتاد، أبريل 2026. الجميع يشغّل Ollama بالإعداد الافتراضي، دون ضبط:
- CPU فقط (Ryzen 7 7700X) + Phi-4 Mini Q4: 5–15 tok/s.
- 4 GB VRAM (GTX 1650) + TinyLlama 1B Q5: 20–40 tok/s.
- 6 GB VRAM (RTX 2060) + Phi-4 Mini Q5: 15–30 tok/s.
- 8 GB VRAM (RTX 3060) + Mistral Small Q4: 25–60 tok/s.
- 16 GB+ (RTX 3080 / 4070) + نماذج 13B Q4: 20–50 tok/s. للمستندات الطويلة، جرّب Llama 4 Scout 8B (نافذة سياق 10M، أُطلق في مارس 2026) بـ `ollama run llama4:8b`.
ما "السريع" فعلاً لنماذج LLM المحلية؟
تُدرَك السرعة بشكل مختلف حسب المهمة — استخدم هذا كمرجع:
إن كان نموذجك يعمل دون 15 tok/s، اخفض حجم النموذج (7B ← 3B) أو اخفض مستوى تكميم (Q5 ← Q4) قبل شراء عتاد جديد.
- دون 10 tok/s ← يبدو معطّلاً. تظهر الكلمات واحدة تلو الأخرى بفواصل ملحوظة. غير قابل للاستخدام للدردشة التفاعلية.
- 15–25 tok/s ← مقبول. سرعة قابلة للقراءة لمعظم المستخدمين. جيد للأسئلة والأجوبة والتلخيصات والمساعدة في الكود.
- 30+ tok/s ← سلس. يبدو كمساعد حقيقي. مريح لجميع المهام التفاعلية.
- 60+ tok/s ← فوري. أسرع من القراءة. مثالي للإكمال التلقائي في الوقت الفعلي والتكرار السريع.
ما يجب تجنّبه على أجهزة الكمبيوتر منخفضة المواصفات
- لا تشغّل نماذج 13B+ — تتجاوز حدود RAM. يتطلب نموذج 13B بصيغة Q4 سعة 8–10 GB VRAM، متجاوزاً السعة العملية لكمبيوتر منخفض المواصفات. حتى مع تكميم Q2 العدواني، تتطلب نماذج 13B سعة 5–6 GB، تاركةً هامشاً غير كافٍ لنظام التشغيل وحمل جدولة GPU. استخدم 7B أو أقل.
- تجنّب تكميم Q8 — أبطأ بمكسب جودة ضئيل. يستخدم Q8 نحو 2× من VRAM في Q4 (8 GB مقابل 5.5 GB لـ Mistral Small) بتحسّن جودة ~2% فقط. على أنظمة 4 GB، Q8 غير عملي؛ على أنظمة 8 GB، يبقى Q4 الأمثل. Q3 هي المفاضلة الوحيدة التي تستحق النظر عندما يسبّب Q4 نفاد الذاكرة.
- لا تتوقع أداء إكمال تلقائي في الوقت الفعلي. بسرعة 3 tok/s على CPU، يستغرق توليد 50 رمزاً 16 ثانية. يتطلب الإكمال التلقائي التفاعلي ≥20 tok/s. تخدم نماذج LLM المحلية على وحدات CPU منخفضة المواصفات الدردشة الدفعية والمسودات والمراجعة — لا الإكمال التلقائي الحي أو الكود أثناء الكتابة.
- لا تستخدم الاستدلال على CPU فقط لروبوتات الدردشة الإنتاجية. مقبول للأدوات الداخلية والنماذج الأولية والعمل الدفعي دون اتصال. تتفوق واجهات API السحابية (زمن استجابة 15–20 ms) على وحدات CPU منخفضة المواصفات (زمن استجابة 300+ ms) للخدمات الموجهة للمستخدم. استخدم الاستدلال المحلي للسيناريوهات الحرجة للخصوصية أو دون اتصال، لا الحرجة للسرعة.
الأخطاء الشائعة
- خطأ: استخدام TinyLlama على CPU لسرعة أعلى. المشكلة: TinyLlama يخص GPU بسعة 4 GB، لا CPU — Phi-4 Mini 3.8B أسرع وأفضل بكثير على عتاد CPU فقط. الحل: شغّل Phi-4 Mini 3.8B على CPU؛ احتفظ بـ TinyLlama Q5 لـ 4 GB VRAM.
- خطأ: عدم تفعيل أعلام تسريع CPU. المشكلة: عدم تفعيل AVX/NEON يهدر 20% من السرعة دون تكلفة. الحل: اضبط `LLAMACPP_AVX512=1` أو `LLAMACPP_NEON=1` قبل تشغيل Ollama.
- خطأ: التكميم إلى Q2 لإجبار 7B في 4 GB. المشكلة: كثيراً ما يسبّب تكميم Q2 تعليقاً بسبب نفاد الذاكرة بسبب حمل ذاكرة KV المؤقتة أثناء الاستدلال. الحل: استخدم نموذج 3B بصيغة Q4.
- خطأ: افتراض أن العتاد الأحدث يعني دائماً استدلالاً أسرع. المشكلة: Ryzen المكتبي ليس أسرع لكل رمز من ARM المحمول لأن برمجيات سطح المكتب تفتقر إلى تحسين الذاكرة. الحل: أجرِ معايير على عتادك الحقيقي.
- خطأ: استخدام slug خاطئ في Ollama لنموذجك. المشكلة: `ollama run phi` يحمّل Phi-2، لا Phi-4 Mini. الحل: استخدم `ollama run phi4-mini` لأحدث نموذج Phi. راجع دائماً ollama.com/library للوسوم الدقيقة للنماذج.
نماذج LLM المحلية على أجهزة الكمبيوتر منخفضة المواصفات: السياق الإقليمي
الاتحاد الأوروبي / GDPR: محلياً على أجهزة منخفضة التكلفة: لا تغادر بيانات الاستنتاج الجهاز — وهذه طريقة تقنية بسيطة لكثير من الشركات الصغيرة والمتوسطة والعاملين لحسابهم الخاص لتجنب مخاطر النقل وفق المادة 44 من اللائحة العامة لحماية البيانات. لا يفرض قانون الذكاء الاصطناعي للاتحاد الأوروبي (ساري منذ فبراير 2025) متطلبات توثيق للاستدلال للاستخدام الشخصي. للشركات الألمانية الصغيرة والمتوسطة التي تستخدم نماذج LLM المحلية لمهام العمل الداخلية، يوصي BSI-Grundschutz بالاستدلال المحلي لمعالجة المستندات الحساسة. غير أن الامتثال الشامل لحماية البيانات يعتمد على التشغيل الكامل، وليس على بنية الاستنتاج وحدها.
أمريكا اللاتينية: يستوفي الاستدلال المحلي على العتاد الاستهلاكي قوانين حماية البيانات الرئيسية في المنطقة: LFPDPPP في المكسيك، والقانون 25.326 في الأرجنتين، والقانون 1581 في كولومبيا. بما أن لا بيانات تغادر الجهاز، يلغي الاستدلال المحلي الحاجة إلى البنود التعاقدية النموذجية مع مزودي ذكاء اصطناعي خارجيين ويستوفي متطلبات إقامة البيانات حيثما انطبقت. للشركات اللاتينية التي تعالج بيانات العملاء أو مستندات داخلية حساسة، الاستدلال المحلي على عتاد ميسور هو خيار الامتثال الأبسط.
الصين: الاستدلال المحلي على العتاد الاستهلاكي شائع لعمليات نشر Qwen3 وDeepSeek-R1 في الصين، حيث يكون الوصول إلى واجهات API السحابية للنماذج غير الصينية مقيّداً. يعمل Qwen3 1.5B و3B على عتاد CPU فقط، موفّراً بديلاً عملياً لواجهات API السحابية للمستخدمين ذوي العتاد المحدود.
الأسئلة الشائعة حول كيفية تشغيل نماذج LLM المحلية على أجهزة الكمبيوتر منخفضة المواصفات
ما الذي يُعَد كمبيوتراً منخفض المواصفات لتشغيل نماذج LLM المحلية؟
الكمبيوتر منخفض المواصفات لنماذج LLM المحلية هو أي جهاز بأقل من 8 GB من VRAM المخصصة، أو نظام CPU فقط. يشمل معظم الحواسيب المحمولة بمعالجات رسوم مدمجة Intel Iris أو AMD Radeon، وأجهزة سطح المكتب بوحدات GPU من نوع GTX 1060 أو أقدم، وأجهزة Chromebook. القيد الرئيسي ليس سرعة CPU بل الذاكرة المتاحة لاستيعاب أوزان النموذج.
هل يمكنني تشغيل Mistral Small على GPU بسعة 4 GB؟
بتكميم Q2، نعم. بـ Q4، لا (تعليق بسبب نفاد الذاكرة). لدى Q2 فقدان جودة مقبول (~5–10% أقل في درجة MMLU)، لكن السرعة تزيد 30%. إنها مفاضلة عملية للمستخدمين ذوي VRAM المحدودة.
هل استدلال CPU قابل للاستخدام لروبوتات الدردشة؟
نعم، للسيناريوهات غير المتزامنة منخفضة الإنتاجية. بسرعة 3 tok/s، يستغرق رد من 100 رمز ~3 دقائق. هذا غير قابل للاستخدام للمحادثة التفاعلية لكنه مقبول للمعالجة الدفعية الليلية أو المهام غير الفورية كصياغة البريد.
هل ينبغي أن أستخدم Phi-4 Mini أم TinyLlama 1.1B على CPU؟
Phi-4 Mini 3.8B هو الخيار الأفضل لأنظمة CPU فقط — يبلغ 5–15 tok/s وينتج جودة إخراج أفضل بكثير من TinyLlama. TinyLlama 1.1B Q5 مُحسَّن لـ 4 GB VRAM (20–40 tok/s)، لا للاستدلال على CPU فقط.
كيف أتحقق إن كانت GPU لدي تدعم CUDA؟
شغّل `nvidia-smi` في الطرفية. إن عرض معلومات GPU، فلديك دعم CUDA. إن أعاد "command not found" أو "no NVIDIA GPU"، راجع وثائق Intel/AMD لتعريفات GPU المدمجة.
كيف يؤثر التكميم على سرعة الاستدلال؟
يقلّل التكميم أساساً متطلبات عرض نطاق الذاكرة، لا الحوسبة. Q2 (2 بت) أسرع بنحو 30% من Q4 (4 بت) لأن النموذج يحمّل بايتات أقل لكل تمريرة أمامية. لكن Q2 يحمل عقوبة جودة ~10%. القاعدة العملية: استخدم Q4 افتراضياً، اخفض إلى Q2 فقط إن لم تستطع استيعاب النموذج في VRAM المتاحة بصيغة Q4.
هل يمكنني استخدام تكميم دون Q2؟
تقنياً نعم (Q1)، لكن الجودة تتدهور بشكل كارثي — حتى 30% فقدان دقة. غير موصى به لأي حالة استخدام عملية.
هل الاستدلال الهجين CPU + GPU مدعوم؟
نعم، عبر تفريغ الطبقات. مع llama.cpp يمكنك استخدام `--n-gpu-layers 10` لتفويض أول 10 طبقات إلى GPU مع إبقاء الباقي على CPU. يمنحك هذا النهج الهجين سرعة قريبة من GPU بـ VRAM محدودة.
ما أسرع LLM محلي؟
أسرع النماذج هي نماذج 1B–3B معامل مثل Llama 3.2 3B، التي يمكن أن تبلغ 15–40 رمز/ثانية على وحدات CPU حديثة محسَّنة وحتى 40–60 tok/s مع تسريع GPU. تعتمد السرعة على العتاد أكثر من النموذج — 7B على GPU (25–40 tok/s) يتفوق على 3B على CPU (10–25 tok/s).
هل يمكنني تشغيل LLM محلي بـ 4 GB من RAM؟
نعم — تعمل نماذج 1B بشكل مريح على أنظمة 4 GB (1–1.3 GB لكل نموذج + 2–3 GB لنظام التشغيل والهامش). تتطلب النماذج الأكبر مزيداً: 3B يحتاج 2–3 GB، 7B يحتاج 5.5–8 GB بصيغة Q4. لأنظمة 4 GB، Llama 3.2 1B أو TinyLlama 1.1B خياران عمليان، لكن الجودة محدودة.
هل GPU ضرورية لسرعة أعلى؟
لا، لكن وحدات GPU تزيد السرعة بشكل كبير. يمكن لأنظمة CPU فقط بلوغ 10–25 tok/s لنماذج 3B بتحسين؛ تبلغ وحدات GPU 25–60 tok/s. لمستخدمي CPU فقط، النماذج الأصغر (1B–3B) ضرورية. GPU ضرورية فقط إن احتجت سرعات تفاعلية على نماذج 7B+.
المصادر
- بطاقة نموذج Phi-4 Mini — Microsoft Research. 68% MMLU، 70% HumanEval. أُطلق في 2025.
- بطاقة نموذج Gemma 3 — Google DeepMind. Gemma 3 2B بنافذة سياق 128K. أُطلق في 2025.
- Llama 4 Scout 8B — Meta. نافذة سياق 10M، أُطلق في مارس 2026.
- مستودع TinyLlama 1.1B — Stability AI. اكتمل التدريب في 2024. نموذج مستقر، دون تحديثات. موصى به لمستوى 4 GB VRAM.
- دليل تحسين CPU لـ llama.cpp — أعلام تسريع CPU بما فيها AVX-512 وNEON وإعداد الخيوط.
