Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/أسرع نماذج ⁨LLM⁩ المحلية لأجهزة الكمبيوتر منخفضة المواصفات في ⁨2026⁩: نماذج حسب مستوى ⁨VRAM⁩ (⁨CPU⁩ إلى ⁨8 GB⁩)
Models by Use Case

أسرع نماذج ⁨LLM⁩ المحلية لأجهزة الكمبيوتر منخفضة المواصفات في ⁨2026⁩: نماذج حسب مستوى ⁨VRAM⁩ (⁨CPU⁩ إلى ⁨8 GB⁩)

·8 دقائق للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

CPU فقط: Phi-4 Mini 3.8B بسرعة 5–15 tok/s. 4 GB VRAM: TinyLlama 1.1B Q5 بسرعة 20–40 tok/s. 8 GB VRAM: Mistral Small Q4 أو Llama 3.3 8B Q4 بسرعة 25–60 tok/s. تبلغ نماذج 1B–3B سرعة 60–120 tok/s لأقصى سرعة.

CPU فقط: يبلغ Phi-4 Mini 3.8B سرعة 5–15 tok/s. 4 GB VRAM: يصل TinyLlama 1.1B Q5 إلى 20–40 tok/s. 8 GB VRAM (النقطة المثلى): يبلغ Mistral Small Q4 وLlama 3.3 8B Q4 سرعة 25–60 tok/s. اعتباراً من أبريل 2026، تبلغ نماذج 1B–3B سرعة 60–120 tok/s لأقصى سرعة؛ يقدّم 8 GB VRAM تجربة مساعد كاملة بسرعات تفاعلية. تعمل جميع النماذج على Ollama — أوامر التثبيت مدرجة لكل مستوى.

أسرع نماذج LLM المحلية لأجهزة الكمبيوتر منخفضة المواصفات (2026)

تعتمد السرعة على مستوى VRAM. اربط عتادك بالنموذج الصحيح — الاختيار الخاطئ يترك 4–10× من السرعة دون استغلال.

  • CPU فقط (دون GPU): Phi-4 Mini 3.8B — 5–15 tok/s، دردشة أساسية وتلخيصات
  • 4 GB VRAM: TinyLlama 1.1B Q5 — 20–40 tok/s، ردود سريعة ومهام بسيطة
  • 8 GB VRAM (النقطة المثلى): Mistral Small Q4 أو Llama 3.3 8B Q4 — 25–60 tok/s، تجربة مساعد كاملة

توقّع بين 5–60 tok/s حسب العتاد. تبلغ نماذج 1B–3B سرعة 60–120 tok/s لأقصى سرعة. أي GPU منفصلة تتفوق على CPU — حتى 4 GB VRAM تعطي 20–40 tok/s.

العرض التقديمي: أسرع نماذج ⁨LLM⁩ المحلية لأجهزة الكمبيوتر منخفضة المواصفات في ⁨2026⁩: نماذج حسب مستوى ⁨VRAM⁩ (⁨CPU⁩ إلى ⁨8 GB⁩)

عرض تفاعلي من 14 شريحة حول أسرع نماذج LLM المحلية لأجهزة الكمبيوتر منخفضة المواصفات: CPU فقط (5–15 tok/s)، GPU 4 GB (20–40 tok/s)، النقطة المثلى GPU 8 GB (25–60 tok/s). تشمل الشرائح جدول قرار العتاد-النموذج، وتوصية واحدة لكل مستوى بأرقام RAM/VRAM، ودليل التكميم (Q4/Q3/Q2)، وعتبات إدراك السرعة، والأخطاء الشائعة. نزّل ملف PDF كبطاقة مرجعية لعتاد نماذج LLM المحلية.

تصفّح الشرائح أدناه أو نزّلها بصيغة PDF للرجوع إليها دون اتصال. تنزيل البطاقة المرجعية (PDF)

أسرع نماذج ⁨LLM⁩ المحلية لأجهزة الكمبيوتر منخفضة المواصفات في ⁨2026⁩: نماذج حسب مستوى ⁨VRAM⁩ (⁨CPU⁩ إلى ⁨8 GB⁩)

Key Takeaways

  • CPU فقط (دون GPU): Phi-4 Mini 3.8B بسرعة 5–15 tok/s. أفضل خيار على CPU للدردشة والتلخيصات.
  • 4 GB VRAM: TinyLlama 1.1B Q5 بسرعة 20–40 tok/s. ردود سريعة، مهام بسيطة.
  • 6 GB VRAM: Phi-4 Mini Q5 بسرعة 15–30 tok/s. كود خفيف ودردشة.
  • 8 GB VRAM (النقطة المثلى): Mistral Small Q4 بسرعة 25–60 tok/s. تجربة مساعد كاملة وسلسة.
  • 16 GB+: نماذج 13B Q4 بسرعة 20–50 tok/s. جودة عالية للمهام الصعبة.
  • ترتيب السرعة (من الأعلى للأدنى): GPU 4 GB > GPU 8 GB > 16 GB+ > GPU 6 GB > CPU.
  • ترتيب الجودة: 13B > Mistral Small = Llama 3.3 8B > Phi-4 Mini > TinyLlama 1B.
  • التكلفة: جميعها مجانية (مفتوحة المصدر) مقابل API لـ ChatGPT (~0.002 دولار لكل 1K رمز).

على جهاز يعمل بالمعالج CPU فقط مع 8 جيجابايت رام، يعمل Phi-4-mini 3.8B Q4_K_M بسرعة 15–25 رمزاً/ثانية للبرمجة والاستدلال؛ مع 4 جيجابايت، يصل Qwen3 1.7B Q4_K_M إلى 25–40 رمزاً/ثانية.

لا تحتاج إلى GPU للألعاب لتشغيل الذكاء الاصطناعي محلياً. هذه النماذج تعمل كلياً على المعالج والذاكرة العادية. النماذج الصغيرة (1–4B معامل) قادرة بشكل مدهش على المهام اليومية وسريعة بما يكفي لمحادثة حقيقية.

ما النموذج الأسرع لعتادك؟

اربط عتادك بالنموذج الصحيح — الاختيار الخاطئ يترك 10–30× من السرعة دون استغلال.

عتادكالنموذج الموصى بهالسرعة المتوقَّعة
CPU فقط (دون GPU)Phi-4 Mini Q45–15 tok/s
4 GB VRAM (الجودة)TinyLlama 1B Q520–40 tok/s
4 GB VRAM (السرعة)Gemma 3 2B Q530–50 tok/s
6 GB VRAMPhi-4 Mini Q515–30 tok/s
8 GB VRAMMistral Small Q425–60 tok/s
16 GB+نماذج 13B Q420–50 tok/s

أي نموذج ينبغي أن تستخدم؟

اربط وضعك بالنموذج الصحيح — هذا أهم قرار:

  • حاسوب محمول بـ 8 GB RAM (دون GPU منفصلة): Mistral Small Q4 — توازن جيد بين السرعة والجودة للاستدلال على CPU فقط.
  • 16 GB RAM: Llama 3.3 8B Q5 — جودة أعلى من Q4، يتناسب بهامش.
  • كمبيوتر قديم جداً (4 GB RAM أو أقل): TinyLlama 1B Q5 أو Phi-4 Mini Q4 — الخياران الوحيدان القابلان للتطبيق في هذا المستوى.
  • تريد أقصى سرعة: نماذج 3B (Phi-4 Mini، Llama 3.2 3B) — 60–120 tok/s على أي GPU حديثة.
  • تريد الجودة: 7B Q5 (Mistral Small Q5 أو Llama 3.3 8B Q5) — من بين خيارات الجودة الأعلى التي تتناسب مع أقل من 8 GB VRAM.

أي LLM محلي ينبغي أن تشغّل على عتادك؟

**اختر أكبر نموذج تستطيع VRAM لديك استيعابه بصيغة Q4، ثم اخفض التكميم قبل التحوّل إلى نموذج أصغر. يقلّل التكميم الجودة أقل من خفض حجم النموذج.**

HardwareModelQuantSpeedExperience
CPU فقطPhi-4 MiniQ45–15 t/sبطيء لكن قابل للاستخدام
GPU 4 GBTinyLlama 1BQ520–40 t/sمهام بسيطة سريعة
GPU 6 GBPhi-4 MiniQ515–30 t/sمقبول
GPU 8 GBMistral SmallQ425–60 t/sسلس
16 GB+نماذج 13BQ420–50 t/sمتين
سرعة LLM المحلي حسب مستوى العتاد: CPU فقط (5–15 tok/s، 2.5 GB RAM)، GPU 4 GB (20–40 tok/s)، GPU 6 GB (15–30 tok/s)، النقطة المثلى GPU 8 GB (25–60 tok/s، Mistral Small Q4)، 16 GB+ (20–50 tok/s). معايير أبريل 2026.
سرعة LLM المحلي حسب مستوى العتاد: CPU فقط (5–15 tok/s، 2.5 GB RAM)، GPU 4 GB (20–40 tok/s)، GPU 6 GB (15–30 tok/s)، النقطة المثلى GPU 8 GB (25–60 tok/s، Mistral Small Q4)، 16 GB+ (20–50 tok/s). معايير أبريل 2026.

GPU مقابل CPU لنماذج LLM المحلية: أيهما أسرع على العتاد منخفض المواصفات؟

استدلال GPU: 15–20 tok/s على RTX 3060. يتطلب إعداد CUDA. سريع، جودة أفضل. راجع دليل وحدات GPU الاقتصادية للخيارات المجدية.

iGPU (مدمجة): 5–8 tok/s على Intel Iris. دون إعداد إضافي. أبطأ من GPU المنفصلة.

استدلال CPU: 1–5 tok/s على متعدد الأنوية الحديث. يعمل في أي مكان. الأبطأ.

القاعدة: إن كان لديك أي GPU (حتى مدمجة)، استخدمها. CPU هو الملاذ الأخير.

مقارنة سرعة CPU مقابل GPU لنماذج LLM المحلية: CPU فقط يبلغ 10–25 tok/s (نماذج 3B) و15–40 tok/s. GPU (RTX 3060، 8 GB) يصل إلى 25–60 tok/s — أسرع بين 4 و10 أضعاف من الاستدلال على CPU فقط.
مقارنة سرعة CPU مقابل GPU لنماذج LLM المحلية: CPU فقط يبلغ 10–25 tok/s (نماذج 3B) و15–40 tok/s. GPU (RTX 3060، 8 GB) يصل إلى 25–60 tok/s — أسرع بين 4 و10 أضعاف من الاستدلال على CPU فقط.

لماذا النماذج الأصغر أسرع على أجهزة الكمبيوتر منخفضة المواصفات

يحدّد حجم النموذج السرعة مباشرة. يتناسب نموذج 1B–3B بالكامل مع RAM النظام، مما يتيح لـ CPU أو GPU بث البيانات باستمرار. تتطلب النماذج الأكبر تبادل الذاكرة — نقل البيانات بين RAM والقرص — مما يبطئ التوليد بين 10 و100 مرة (الاختناق هو دخل/خرج القرص، لا الحوسبة).

يعكس جدول قرار العتاد أعلاه هذا المبدأ: يبلغ TinyLlama 1.1B (1B معامل) سرعة 5–10 tok/s على وحدات CPU القديمة، بينما تكون نماذج 13B+ غير عملية على العتاد منخفض المواصفات لأن التبادل يهيمن.

  • نماذج 1B–3B: تتناسب مع 4–8 GB RAM ← توليد أسرع ← جودة مقبولة
  • نماذج 7B: ضيقة على أنظمة 8 GB ← أبطأ بسبب ضغط الذاكرة ← جودة عالية
  • نماذج 13B+: تتطلب 16+ GB VRAM أو تبادلاً ضخماً ← بطيئة جداً للاستخدام التفاعلي

ما مدى سرعة نماذج LLM المحلية على أجهزة الكمبيوتر منخفضة المواصفات؟

على أنظمة CPU فقط، توقّع:

  • نماذج 3B ← 15–40 رمز/ثانية (وحدات CPU قديمة: 10–15، وحدات CPU جديدة بتحسين: 30–40)
  • نماذج 7B ← 10–25 رمز/ثانية (يعتمد على أنوية CPU والتكميم؛ بتحسين عدواني يبلغ بعضها 30+)
  • هذا أبطأ من واجهات API السحابية (ChatGPT 4o: 80–150 tok/s) لكنه كافٍ للاستخدام التفاعلي. ينتج نموذج 3B بسرعة 25 tok/s رداً من 500 رمز في 20 ثانية — مقبول للمهام غير العاجلة كمراجعة الكود والتلخيصات والكتابة الإبداعية.

كيف يؤثر التكميم على السرعة على أجهزة الكمبيوتر منخفضة المواصفات؟

Q4 (4 بت): ~1% فقدان جودة، 50% توفير في VRAM. الخيار القياسي. لتفاصيل جميع مستويات التكميم وكيف تعمل، راجع الدليل الكامل.

Q3 (3 بت): ~3% فقدان جودة، 62% توفير في VRAM. مقبول للدردشة.

Q2 (2 بت): ~10% فقدان جودة، 75% توفير في VRAM. محفوف بالمخاطر؛ استخدمه فقط عند نفاد الذاكرة.

تأثير السرعة: Q2 أسرع بـ ~30% من Q4 بسبب استخدام أقل لعرض نطاق الذاكرة، لا بسبب الحوسبة.

الاستراتيجية: كمّم النماذج الكبيرة (Mistral Small Q2) بدلاً من استخدام نماذج صغيرة (TinyLlama).

يتفوق Mistral Small Q2 على TinyLlama 1.1B Q4 في السرعة والجودة معاً.

تضحّي النماذج الأسرع بالجودة مقابل السرعة — لكن ضبط temperature وtop-p يستعيد جزءاً كبيراً من تلك الجودة. ينتج temperature منخفض (0.1–0.3) في النماذج السريعة نتائج أكثر اتساقاً من الإعداد الافتراضي. راجع شرح temperature وtop-p للإعدادات الدقيقة.

مفاضلات التكميم لنماذج LLM المحلية: Q4 (1% فقدان جودة، 50% توفير في VRAM، 4.5 GB لـ Mistral Small) هو المعيار. Q2 أسرع بـ 30% لكن بهبوط جودة 10%. تجنّب Q8 — تكلفة VRAM مضاعفة بمكسب ضئيل.
مفاضلات التكميم لنماذج LLM المحلية: Q4 (1% فقدان جودة، 50% توفير في VRAM، 4.5 GB لـ Mistral Small) هو المعيار. Q2 أسرع بـ 30% لكن بهبوط جودة 10%. تجنّب Q8 — تكلفة VRAM مضاعفة بمكسب ضئيل.

كيف تسرّع الاستدلال على CPU فقط؟

  • تفعيل AVX-512: إن دعمه CPU، استخدم `LLAMACPP_AVX512=1 ollama run phi`. ~20% تحسّن سرعة.
  • تقليل نافذة السياق: سياق أقصر = أسرع. استخدم `--ctx-size 1024` بدلاً من 4096.
  • **استخدام llama.cpp بدلاً من Ollama:** أسرع قليلاً على CPU (~10% مكسب) بحمل أقل.
  • تعطيل تعدد الخيوط: على عكس الحدس، لكن على وحدات CPU الضعيفة يكون وضع الخيط الواحد أسرع (دون حمل خيوط).
  • التفويض إلى iGPU: حتى GPU مدمجة ضعيفة تتفوق على CPU. تحقق من التوافر بـ `lspci`.

ما مدى سرعة هذه النماذج؟ معايير حقيقية (أبريل 2026)

قياسات حقيقية حسب مستوى العتاد، أبريل 2026. الجميع يشغّل Ollama بالإعداد الافتراضي، دون ضبط:

  • CPU فقط (Ryzen 7 7700X) + Phi-4 Mini Q4: 5–15 tok/s.
  • 4 GB VRAM (GTX 1650) + TinyLlama 1B Q5: 20–40 tok/s.
  • 6 GB VRAM (RTX 2060) + Phi-4 Mini Q5: 15–30 tok/s.
  • 8 GB VRAM (RTX 3060) + Mistral Small Q4: 25–60 tok/s.
  • 16 GB+ (RTX 3080 / 4070) + نماذج 13B Q4: 20–50 tok/s. للمستندات الطويلة، جرّب Llama 4 Scout 8B (نافذة سياق 10M، أُطلق في مارس 2026) بـ `ollama run llama4:8b`.

ما "السريع" فعلاً لنماذج LLM المحلية؟

تُدرَك السرعة بشكل مختلف حسب المهمة — استخدم هذا كمرجع:

إن كان نموذجك يعمل دون 15 tok/s، اخفض حجم النموذج (7B ← 3B) أو اخفض مستوى تكميم (Q5 ← Q4) قبل شراء عتاد جديد.

  • دون 10 tok/s ← يبدو معطّلاً. تظهر الكلمات واحدة تلو الأخرى بفواصل ملحوظة. غير قابل للاستخدام للدردشة التفاعلية.
  • 15–25 tok/s ← مقبول. سرعة قابلة للقراءة لمعظم المستخدمين. جيد للأسئلة والأجوبة والتلخيصات والمساعدة في الكود.
  • 30+ tok/s ← سلس. يبدو كمساعد حقيقي. مريح لجميع المهام التفاعلية.
  • 60+ tok/s ← فوري. أسرع من القراءة. مثالي للإكمال التلقائي في الوقت الفعلي والتكرار السريع.
عتبات إدراك السرعة لنماذج LLM المحلية: دون 10 tok/s يبدو معطّلاً، 15–25 tok/s مقبول للأسئلة والأجوبة، 30+ tok/s سلس لجميع المهام، 60+ tok/s يتيح الإكمال التلقائي في الوقت الفعلي.
عتبات إدراك السرعة لنماذج LLM المحلية: دون 10 tok/s يبدو معطّلاً، 15–25 tok/s مقبول للأسئلة والأجوبة، 30+ tok/s سلس لجميع المهام، 60+ tok/s يتيح الإكمال التلقائي في الوقت الفعلي.

ما يجب تجنّبه على أجهزة الكمبيوتر منخفضة المواصفات

  • لا تشغّل نماذج 13B+ — تتجاوز حدود RAM. يتطلب نموذج 13B بصيغة Q4 سعة 8–10 GB VRAM، متجاوزاً السعة العملية لكمبيوتر منخفض المواصفات. حتى مع تكميم Q2 العدواني، تتطلب نماذج 13B سعة 5–6 GB، تاركةً هامشاً غير كافٍ لنظام التشغيل وحمل جدولة GPU. استخدم 7B أو أقل.
  • تجنّب تكميم Q8 — أبطأ بمكسب جودة ضئيل. يستخدم Q8 نحو 2× من VRAM في Q4 (8 GB مقابل 5.5 GB لـ Mistral Small) بتحسّن جودة ~2% فقط. على أنظمة 4 GB، Q8 غير عملي؛ على أنظمة 8 GB، يبقى Q4 الأمثل. Q3 هي المفاضلة الوحيدة التي تستحق النظر عندما يسبّب Q4 نفاد الذاكرة.
  • لا تتوقع أداء إكمال تلقائي في الوقت الفعلي. بسرعة 3 tok/s على CPU، يستغرق توليد 50 رمزاً 16 ثانية. يتطلب الإكمال التلقائي التفاعلي ≥20 tok/s. تخدم نماذج LLM المحلية على وحدات CPU منخفضة المواصفات الدردشة الدفعية والمسودات والمراجعة — لا الإكمال التلقائي الحي أو الكود أثناء الكتابة.
  • لا تستخدم الاستدلال على CPU فقط لروبوتات الدردشة الإنتاجية. مقبول للأدوات الداخلية والنماذج الأولية والعمل الدفعي دون اتصال. تتفوق واجهات API السحابية (زمن استجابة 15–20 ms) على وحدات CPU منخفضة المواصفات (زمن استجابة 300+ ms) للخدمات الموجهة للمستخدم. استخدم الاستدلال المحلي للسيناريوهات الحرجة للخصوصية أو دون اتصال، لا الحرجة للسرعة.

الأخطاء الشائعة

  • خطأ: استخدام TinyLlama على CPU لسرعة أعلى. المشكلة: TinyLlama يخص GPU بسعة 4 GB، لا CPU — Phi-4 Mini 3.8B أسرع وأفضل بكثير على عتاد CPU فقط. الحل: شغّل Phi-4 Mini 3.8B على CPU؛ احتفظ بـ TinyLlama Q5 لـ 4 GB VRAM.
  • خطأ: عدم تفعيل أعلام تسريع CPU. المشكلة: عدم تفعيل AVX/NEON يهدر 20% من السرعة دون تكلفة. الحل: اضبط `LLAMACPP_AVX512=1` أو `LLAMACPP_NEON=1` قبل تشغيل Ollama.
  • خطأ: التكميم إلى Q2 لإجبار 7B في 4 GB. المشكلة: كثيراً ما يسبّب تكميم Q2 تعليقاً بسبب نفاد الذاكرة بسبب حمل ذاكرة KV المؤقتة أثناء الاستدلال. الحل: استخدم نموذج 3B بصيغة Q4.
  • خطأ: افتراض أن العتاد الأحدث يعني دائماً استدلالاً أسرع. المشكلة: Ryzen المكتبي ليس أسرع لكل رمز من ARM المحمول لأن برمجيات سطح المكتب تفتقر إلى تحسين الذاكرة. الحل: أجرِ معايير على عتادك الحقيقي.
  • خطأ: استخدام slug خاطئ في Ollama لنموذجك. المشكلة: `ollama run phi` يحمّل Phi-2، لا Phi-4 Mini. الحل: استخدم `ollama run phi4-mini` لأحدث نموذج Phi. راجع دائماً ollama.com/library للوسوم الدقيقة للنماذج.

نماذج LLM المحلية على أجهزة الكمبيوتر منخفضة المواصفات: السياق الإقليمي

الاتحاد الأوروبي / GDPR: محلياً على أجهزة منخفضة التكلفة: لا تغادر بيانات الاستنتاج الجهاز — وهذه طريقة تقنية بسيطة لكثير من الشركات الصغيرة والمتوسطة والعاملين لحسابهم الخاص لتجنب مخاطر النقل وفق المادة 44 من اللائحة العامة لحماية البيانات. لا يفرض قانون الذكاء الاصطناعي للاتحاد الأوروبي (ساري منذ فبراير 2025) متطلبات توثيق للاستدلال للاستخدام الشخصي. للشركات الألمانية الصغيرة والمتوسطة التي تستخدم نماذج LLM المحلية لمهام العمل الداخلية، يوصي BSI-Grundschutz بالاستدلال المحلي لمعالجة المستندات الحساسة. غير أن الامتثال الشامل لحماية البيانات يعتمد على التشغيل الكامل، وليس على بنية الاستنتاج وحدها.

أمريكا اللاتينية: يستوفي الاستدلال المحلي على العتاد الاستهلاكي قوانين حماية البيانات الرئيسية في المنطقة: LFPDPPP في المكسيك، والقانون 25.326 في الأرجنتين، والقانون 1581 في كولومبيا. بما أن لا بيانات تغادر الجهاز، يلغي الاستدلال المحلي الحاجة إلى البنود التعاقدية النموذجية مع مزودي ذكاء اصطناعي خارجيين ويستوفي متطلبات إقامة البيانات حيثما انطبقت. للشركات اللاتينية التي تعالج بيانات العملاء أو مستندات داخلية حساسة، الاستدلال المحلي على عتاد ميسور هو خيار الامتثال الأبسط.

الصين: الاستدلال المحلي على العتاد الاستهلاكي شائع لعمليات نشر Qwen3 وDeepSeek-R1 في الصين، حيث يكون الوصول إلى واجهات API السحابية للنماذج غير الصينية مقيّداً. يعمل Qwen3 1.5B و3B على عتاد CPU فقط، موفّراً بديلاً عملياً لواجهات API السحابية للمستخدمين ذوي العتاد المحدود.

الأسئلة الشائعة حول كيفية تشغيل نماذج LLM المحلية على أجهزة الكمبيوتر منخفضة المواصفات

ما الذي يُعَد كمبيوتراً منخفض المواصفات لتشغيل نماذج LLM المحلية؟

الكمبيوتر منخفض المواصفات لنماذج LLM المحلية هو أي جهاز بأقل من 8 GB من VRAM المخصصة، أو نظام CPU فقط. يشمل معظم الحواسيب المحمولة بمعالجات رسوم مدمجة Intel Iris أو AMD Radeon، وأجهزة سطح المكتب بوحدات GPU من نوع GTX 1060 أو أقدم، وأجهزة Chromebook. القيد الرئيسي ليس سرعة CPU بل الذاكرة المتاحة لاستيعاب أوزان النموذج.

هل يمكنني تشغيل Mistral Small على GPU بسعة 4 GB؟

بتكميم Q2، نعم. بـ Q4، لا (تعليق بسبب نفاد الذاكرة). لدى Q2 فقدان جودة مقبول (~5–10% أقل في درجة MMLU)، لكن السرعة تزيد 30%. إنها مفاضلة عملية للمستخدمين ذوي VRAM المحدودة.

هل استدلال CPU قابل للاستخدام لروبوتات الدردشة؟

نعم، للسيناريوهات غير المتزامنة منخفضة الإنتاجية. بسرعة 3 tok/s، يستغرق رد من 100 رمز ~3 دقائق. هذا غير قابل للاستخدام للمحادثة التفاعلية لكنه مقبول للمعالجة الدفعية الليلية أو المهام غير الفورية كصياغة البريد.

هل ينبغي أن أستخدم Phi-4 Mini أم TinyLlama 1.1B على CPU؟

Phi-4 Mini 3.8B هو الخيار الأفضل لأنظمة CPU فقط — يبلغ 5–15 tok/s وينتج جودة إخراج أفضل بكثير من TinyLlama. TinyLlama 1.1B Q5 مُحسَّن لـ 4 GB VRAM (20–40 tok/s)، لا للاستدلال على CPU فقط.

كيف أتحقق إن كانت GPU لدي تدعم CUDA؟

شغّل `nvidia-smi` في الطرفية. إن عرض معلومات GPU، فلديك دعم CUDA. إن أعاد "command not found" أو "no NVIDIA GPU"، راجع وثائق Intel/AMD لتعريفات GPU المدمجة.

كيف يؤثر التكميم على سرعة الاستدلال؟

يقلّل التكميم أساساً متطلبات عرض نطاق الذاكرة، لا الحوسبة. Q2 (2 بت) أسرع بنحو 30% من Q4 (4 بت) لأن النموذج يحمّل بايتات أقل لكل تمريرة أمامية. لكن Q2 يحمل عقوبة جودة ~10%. القاعدة العملية: استخدم Q4 افتراضياً، اخفض إلى Q2 فقط إن لم تستطع استيعاب النموذج في VRAM المتاحة بصيغة Q4.

هل يمكنني استخدام تكميم دون Q2؟

تقنياً نعم (Q1)، لكن الجودة تتدهور بشكل كارثي — حتى 30% فقدان دقة. غير موصى به لأي حالة استخدام عملية.

هل الاستدلال الهجين CPU + GPU مدعوم؟

نعم، عبر تفريغ الطبقات. مع llama.cpp يمكنك استخدام `--n-gpu-layers 10` لتفويض أول 10 طبقات إلى GPU مع إبقاء الباقي على CPU. يمنحك هذا النهج الهجين سرعة قريبة من GPU بـ VRAM محدودة.

ما أسرع LLM محلي؟

أسرع النماذج هي نماذج 1B–3B معامل مثل Llama 3.2 3B، التي يمكن أن تبلغ 15–40 رمز/ثانية على وحدات CPU حديثة محسَّنة وحتى 40–60 tok/s مع تسريع GPU. تعتمد السرعة على العتاد أكثر من النموذج — 7B على GPU (25–40 tok/s) يتفوق على 3B على CPU (10–25 tok/s).

هل يمكنني تشغيل LLM محلي بـ 4 GB من RAM؟

نعم — تعمل نماذج 1B بشكل مريح على أنظمة 4 GB (1–1.3 GB لكل نموذج + 2–3 GB لنظام التشغيل والهامش). تتطلب النماذج الأكبر مزيداً: 3B يحتاج 2–3 GB، 7B يحتاج 5.5–8 GB بصيغة Q4. لأنظمة 4 GB، Llama 3.2 1B أو TinyLlama 1.1B خياران عمليان، لكن الجودة محدودة.

هل GPU ضرورية لسرعة أعلى؟

لا، لكن وحدات GPU تزيد السرعة بشكل كبير. يمكن لأنظمة CPU فقط بلوغ 10–25 tok/s لنماذج 3B بتحسين؛ تبلغ وحدات GPU 25–60 tok/s. لمستخدمي CPU فقط، النماذج الأصغر (1B–3B) ضرورية. GPU ضرورية فقط إن احتجت سرعات تفاعلية على نماذج 7B+.

المصادر

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs