Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/عتاد ⁨LLM⁩ المحلي في ⁨2026⁩: مقارنة بين ⁨GPU⁩ و⁨Mini PC⁩ و⁨Mac⁩
Hardware & Performance

عتاد ⁨LLM⁩ المحلي في ⁨2026⁩: مقارنة بين ⁨GPU⁩ و⁨Mini PC⁩ و⁨Mac⁩

·13 دقيقة للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

تعتمد متطلبات عتاد LLM المحلي بشكل أساسي على VRAM: تحتاج نماذج 7B إلى 8 GB، وتحتاج نماذج 13B إلى 12-16 GB، وتحتاج نماذج 70B إلى 35-48 GB حسب التكميم. اختيار GPU يهم 10× أكثر من CPU لسرعة الاستدلال.

تشغيل LLM محلي يعني مطابقة النموذج مع VRAM الخاص بـ GPU لديك. قاعدة سريعة: يحتاج نموذج 7B عند Q4 إلى ~4-5 GB VRAM فقط -- نحو 0.6 GB لكل مليار معامل عند دقة 4-بت. اعتبارًا من يوليو 2026، يحتاج نموذج 7B إلى 8-9 GB VRAM عند Q8، ويحتاج نموذج 14B إلى ~9 GB عند Q4_K_M، وتحتاج معظم نماذج 70B إلى ~40 GB -- أكثر مما يحمله RTX 4090 (24 GB) الواحد. يقدم هذا الدليل متطلبات العتاد الدقيقة لكل حجم نموذج، ثم أفضل نموذج لمستويات 8 GB و12 GB و16 GB و24 GB VRAM، وما يتطلبه فعليًا تشغيل 70B (وGLM-5.2 الأكبر بكثير) محليًا، والاستدلال على CPU فقط بذاكرة نظام 16 GB، وخيارات MacBook بسعة 8 GB، وأسعار GPU الحالية في يوليو 2026 بعد نقص الذاكرة هذا العام.

العرض التقديمي: عتاد ⁨LLM⁩ المحلي في ⁨2026⁩: مقارنة بين ⁨GPU⁩ و⁨Mini PC⁩ و⁨Mac⁩

تغطي شرائح العرض أدناه: مستويات GPU VRAM لـ 12/16/24 GB، أفضل النماذج لكل مستوى مع استخدام VRAM وقياسات السرعة المرجعية، الاستدلال على CPU فقط بذاكرة 16 GB، وعلامات سرعة llama.cpp لـ RTX 4070 Ti. نزّل ملف PDF كبطاقة مرجعية لدليل عتاد LLM المحلي 2026.

تصفّح الشرائح أدناه أو نزّلها بصيغة PDF للرجوع إليها دون اتصال. تنزيل البطاقة المرجعية (PDF)

عتاد ⁨LLM⁩ المحلي في ⁨2026⁩: مقارنة بين ⁨GPU⁩ و⁨Mini PC⁩ و⁨Mac⁩

Key Takeaways

  • حساب VRAM: (حجم النموذج بالـ GB) ÷ التكميم = VRAM المطلوب. مثال: 70B عند Q4 = 70 ÷ 8 = 8.75 GB × المعاملات ≈ 39 GB إجمالًا.
  • قاعدة 7B عند Q4: نموذج 7B بتكميم Q4_K_M يحتاج ~4-5 GB VRAM فقط -- نحو 0.6 GB لكل مليار معامل عند دقة 4-بت. يتوسع هذا خطيًا: 14B ≈ 9 GB، 32B ≈ 19 GB، 70B ≈ 40 GB، جميعها عند Q4_K_M.
  • 12 GB VRAM (RTX 4070 Ti): أفضل نموذج: Llama 3.1 8B Q8 (~9 GB، 80 tok/sec). أيضًا: Qwen3 8B (~8 GB، أفضل متعدد اللغات + برمجة). ملاحظة: يحتاج Llama 4 Scout (17B نشط / 109B إجمالي MoE) إلى ~55 GB عند Q4 ولا يتسع في 12 GB.
  • 16 GB VRAM (RTX 5080 / RTX 5070 Ti): أفضل نموذج: Mistral Small 3.1 24B Q4_K_M (~13 GB، 55 tok/sec). أيضًا: Devstral Small 24B Q4_K_M للبرمجة الوكيلة. يُعد Mistral Small 4 (مارس 2026) الخليفة الأحدث ذو النموذج الواحد الذي يدمج الاستدلال والرؤية والبرمجة.
  • 24 GB VRAM (RTX 4090 / RTX 5090): معظم نماذج 70B عند Q4_K_M (~40 GB) لا تتسع. أفضل خيار: Qwen3.6 27B Q4_K_M (~16 GB، 77.2% SWE-bench، أفضل مبرمج كثيف) أو DeepSeek-R1 32B Q4_K_M (~19 GB، 60 tok/sec).
  • CPU فقط (ذاكرة نظام 16 GB): Llama 3.2 3B Q8 (20 tok/sec) أو Phi-4 Mini Q4_K_M (25 tok/sec). بطاقة RTX 4060 8 GB مستعملة (~$250) أو RTX 5060 Ti 16 GB جديدة (~$394) أسرع 5-10×.
  • MacBook بذاكرة 8 GB: شغّل نماذج 3-4B فقط — Phi-4 Mini أو Llama 3.2 3B أو Gemma 3 4B عند Q4_K_M عبر llama.cpp/Ollama (Metal). نموذج 7B على الحافة عند 8 GB؛ 16 GB هو الحد الأدنى المريح لـ Mac.
  • Apple M5 Max (128 GB موحدة): يشغّل نماذج 70B عند Q4_K_M بشكل مريح (~12-15 tok/sec) في حاسوب محمول أو Mac Studio — إلى جانب أنظمة Mac Studio وأنظمة AMD Strix Halo بسعة 128 GB التي تحمل أيضًا نموذج 70B.
  • أسعار يوليو 2026: ارتفع سعر RTX 5090 في السوق من نحو $4,000 في يونيو إلى $4,300-$5,000+ في منتصف يوليو، ولا يزال يرتفع، بسبب استمرار نقص GDDR7 وإيقاف RTX 4090. بديل أرخص إلى حد كبير غير متأثر تقريبًا بالنقص: AMD RX 9070 XT (16 GB GDDR6، ~$630-700). اشترِ من سلسلة RTX 50 المتوفرة في المخزون أو فكّر في بطاقة AMD؛ تحقق من الأسعار الحية قبل الشراء.
  • نصيحة سرعة llama.cpp: اضبط دائمًا `--n-gpu-layers 99`. هذا وحده يضاعف السرعة على RTX 4070 Ti من ~40 إلى ~85 tok/sec.
  • مرجع سريع: 7B@Q4_K_M = 4-5 GB | 70B@Q4_K_M = 40 GB | GLM-5.2@2-bit = ~239 GB | RTX 4070 Ti = ~80 tok/s | RTX 4090 = ~150 tok/s | CPU فقط 16 GB = 12-28 tok/s

تُحدَّد متطلبات أجهزة نماذج اللغة المحلية بذاكرة VRAM: نماذج 7B تحتاج 8 جيجابايت، و13–14B تحتاج 12–16 جيجابايت، و70B تحتاج 35–48 جيجابايت — بطاقة RTX 4060 8 جيجابايت المستعملة (≈250 دولار) هي أفضل خيار للمبتدئين في 2026.

VRAM هي الذاكرة المخصصة في بطاقة الرسومات. كلما كان نموذج الذكاء الاصطناعي أكبر، احتاج ذاكرة VRAM أكثر. القاعدة العامة: اقسم حجم النموذج بالجيجابايت على مستوى الضغط (Q4 = اقسم على 8) للحصول على تقدير لـ VRAM المطلوبة.

متطلبات عتاد LLM المحلي 2026

الحد الأدنى من العتاد لتشغيل LLM محلي في 2026 هو GPU بسعة 8 GB VRAM — أو جهاز Mac بمعالج Apple Silicon بذاكرة موحدة 16 GB — لنماذج فئة 7B. ثم تتدرج المتطلبات مع حجم النموذج: 14B يحتاج 12 GB، و24B يحتاج 16 GB، و32B يحتاج 24 GB، ويحتاج نموذج 70B إلى ~40 GB عند Q4_K_M. يُعد VRAM الخاص بـ GPU الحد الصارم: فهو يقرر أي النماذج تُحمَّل أصلًا. يؤثر CPU وذاكرة النظام على وقت التحميل وسرعة الاحتياط على CPU فقط، لكن ليس على أي نموذج يتسع في GPU.

استخدم هذا الجدول كإجابة مباشرة على "ما العتاد الذي أحتاجه" — اعثر على حجم نموذجك أو مستوى VRAM، ثم انتقل إلى اختيارات النماذج لكل مستوى أدناه.

حجم النموذجVRAM عند Q4_K_Mمثال GPU (2026)أفضل نموذجالسرعة
3-4B4-5 GBأي 8 GB / Mac 8 GBPhi-4 Mini، Gemma 3 4B60-90 tok/s
7-8B5-9 GBRTX 5060 Ti، RTX 4060 (8 GB)Llama 3.1 8B، Qwen3 8B50-80 tok/s
14B~9 GBRTX 5070 (12 GB)Qwen3 14B~80 tok/s
24B~14 GBRTX 5070 Ti / 5080 (16 GB)Mistral Small 3.1 24B~55 tok/s
27-32B16-19 GBRTX 4090 / 5090 (24-32 GB)Qwen3.6 27B، DeepSeek-R1 32B55-60 tok/s
70B~40 GBRTX 5090 مزدوجة، A100، Mac M5 Max 128 GBLlama 3.3 70B10-60 tok/s

KeyPoint: في جملة واحدة: طابق النموذج مع VRAM لديك — 8 GB يشغّل 7B، و12 GB يشغّل 14B، و16 GB يشغّل 24B، و24 GB يشغّل 32B، وفقط 40 GB+ يشغّل نموذج 70B بجودة Q4_K_M قابلة للاستخدام.

ProTip: أضف هامشًا لـ KV cache (سياق المحادثة): خصّص 25% فوق أوزان النموذج لسياق 8K وحتى 100% لسياق 32K. راجع قسم KV cache أدناه.

أفضل بطاقات GPU للشراء — توصيات 2026

الخيار المتوفر في المخزون لـ LLM المحلي في يوليو 2026 هو سلسلة NVIDIA RTX 50 (Blackwell): 5060 Ti، 5070، 5070 Ti، 5080، 5090. سلسلة RTX 40 (4060، 4070 Ti، 4090) موقوفة وتُباع الآن نادرة وفوق أسعارها القديمة في السوق المستعمل. دفع نقص GDDR7/الذاكرة المتفاقم في 2026 حتى بطاقات سلسلة 50 إلى ما فوق MSRP بكثير، لذا تعامل مع كل رقم أدناه على أنه سعر سوق نموذجي ليوليو 2026 وتحقق من القوائم الحية قبل الشراء. التوصيات حسب حالة الاستخدام:

  • لنماذج 7B (Mistral، Phi-4، Llama 3.1) — اقتصادية: RTX 5060 Ti 16 GB (~$394، قريب من MSRP) أو RTX 4060 8 GB مستعملة (~$250). تشغّل أي نموذج 7B عند Q4_K_M. السرعة: 50–70 tok/sec. المستوى: الهواة الاقتصاديون.
  • لنماذج 14B (Qwen3 14B، DeepSeek-R1) — السائد: RTX 5070 (12 GB، ~$609). أفضل بطاقة جديدة من حيث السعر مقابل الأداء. يعمل Qwen3 14B Q4_K_M جيدًا مع هامش. السرعة: 85–110 tok/sec. المستوى: الأكثر شعبية.
  • لنماذج 24-32B (Qwen3.6، Mistral Small) — المتوسط: RTX 5070 Ti (16 GB، ~$979) أو RTX 5080 (16 GB، ~$1,249). تشغّل Mistral Small 3.1 24B وDevstral Small 24B Q4_K_M. السرعة: 110–150 tok/sec. المستوى: المطورون المحترفون. بديل اقتصادي: AMD RX 9070 XT (16 GB GDDR6، ~$630-700) يشغّل نفس النماذج بسرعة مشابهة تقريبًا وهو غير متأثر تقريبًا بنقص GDDR7.
  • لنماذج 70B (Llama 3.3) — الراقي: RTX 5090 (32 GB، ~$2,000 MSRP لكن ~$4,300–5,000+ في السوق) يتسع لـ 70B عند Q4_K_M مع إزاحة CPU خفيفة. RTX 4090 مستعملة (24 GB، ~$2,300) تشغّل 70B فقط عند Q2_K. للحصول على Q4_K_M كامل، استخدم RTX 5090 مزدوجة. السرعة: ~200 tok/sec (5090، نماذج أصغر). المستوى: البحث + الإنتاج.
  • لـ GLM-5.2 (744B MoE، 40B نشط) — أقصى درجة: لا توجد بطاقة GPU استهلاكية واحدة كافية. لا يزال GGUF الديناميكي بتكميم 2-بت يحتاج ~239 GB VRAM/RAM مجتمعة. المسارات المحلية الواقعية: نظام 4× RTX 3090/4090 بذاكرة نظام 192 GB+، أو Mac Studio بسعة 256 GB+، وكلاهما بسرعة تقارب 3-9 tok/sec عبر إزاحة هجينة CPU/GPU.
  • أفضل قيمة 2026: بطاقة RTX 5070 Ti أو 5080 (16 GB) واحدة هي النقطة المثالية — تشغّل كل شيء حتى 32B عند Q4_K_M دون مبالغة أسعار سلسلة 50 على 5090.
  • لمستخدمي Apple: Mac M5 Max (ذاكرة موحدة 128 GB، ~$6,000) يشغّل 70B عند Q4_K_M بسرعة ~12-15 tok/sec — أبطأ من حاسوب مكتبي متعدد GPU، لكنه صامت وموفر للطاقة ومحمول.
GPUالأفضل لـالسعرالسرعةالمستوى
RTX 5060 Ti (16 GB)نماذج 7-13B~$39450–70 tok/sاقتصادية
RTX 5070 (12 GB)نماذج 14B~$60985–110 tok/sسائد
RTX 5070 Ti / 5080 (16 GB)نماذج 24-32B~$979–1,249110–150 tok/sاحترافي
RX 9070 XT (16 GB)نماذج 24-32B~$630–70090–130 tok/sبديل اقتصادي
RTX 4090 (24 GB، مستعملة)32B، 70B (Q2)~$2,300150–180 tok/sEOL / مستعملة
RTX 5090 (32 GB)70B (Q4، إزاحة خفيفة)~$2,000 MSRP (~$4,300–5,000+ في السوق)~200 tok/sراقٍ
RTX 5090 مزدوجة70B (Q4) كامل~$8,600–10,000300+ tok/sمؤسسي
4× RTX 3090/4090 + 192GB RAMGLM-5.2 (2-بت)~$6,000–9,0003–9 tok/sMoE أقصى
Mac M5 Max 128GB70B (Q4)~$6,000~12–15 tok/s (70B)حاسوب محمول احترافي

⚠️Warning: تسعير يوليو 2026 متقلب ويزداد سوءًا. دفع نقص GDDR7/الذاكرة المستمر سعر RTX 5090 في السوق إلى $4,300-$5,000+، أكثر من ضعف MSRP البالغ $1,999، وتكلف RTX 4090 الموقوفة الآن مستعملة أكثر مما كانت جديدة. الاستثناء: AMD RX 9070 XT (16 GB GDDR6، ~$630-700) غير متأثر تقريبًا بالنقص. الأسعار أعلاه أرقام سوق نموذجية — تحقق دائمًا من القوائم الحالية قبل الشراء.

كيف تحسب متطلبات VRAM؟

تعتمد متطلبات VRAM على ثلاثة عوامل: حجم النموذج (المعاملات)، والتكميم (بتات لكل وزن)، ووضع الاستدلال. استخدم هذه الصيغة لتحديد ما إذا كان GPU لديك يملك ذاكرة كافية. للحصول على حاسبة تفاعلية، راجع حاسبة VRAM لـ LLM المحلي.

الصيغة:

```text VRAM (GB) = (حجم النموذج × بتات التكميم) ÷ 8 ```

قيم التكميم: FP16 = 16 بت، Q8_0 = 8 بت، Q5_K_M = 5 بت، Q4_K_M = 4 بت. النقطة المثالية العملية هي Q4_K_M -- فهي تستخدم أوزانًا 4-بت مع تكميم K، الذي تسرّعه بطاقات NVIDIA بكفاءة أعلى من تنسيق Q4_0 الأقدم.

النموذجFP16Q8_0Q5_K_MQ4_K_M
Llama 4 Scout (109B إجمالي MoE)~218 GB~109 GB~68 GB~55 GB
Llama 3.1 8B16 GB8.5 GB5.7 GB4.7 GB
Qwen 3.6 27B~54 GB~28 GB~19 GB~16 GB
Qwen3 8B~16 GB~8.5 GB~5.7 GB~5 GB
Llama 3.3 70B140 GB70 GB48 GB40 GB
Qwen3 32B64 GB33 GB22 GB19 GB
Mistral Small 3.1 24B48 GB25 GB17 GB14 GB
Phi-4 Mini 3.8B7.6 GB4.1 GB2.7 GB2.3 GB

Q4_K_M هو الافتراضي الموصى به للعتاد الاستهلاكي -- 90-95% من جودة FP16 بـ 25-30% من تكلفة VRAM. يستخدم Llama 4 Scout بنية MoE بـ 17B معامل نشط من أصل 109B إجمالي. يجب تحميل جميع خبراء 109B في الذاكرة، لذا يحتاج Scout إلى ~55 GB عند Q4 (يتسع في 24 GB فقط عند 1.78-بت). يقلل MoE الحساب لكل رمز، وليس بصمة VRAM.

حاسبة VRAM تُظهر الصيغة (حجم النموذج × البتات) ÷ 8، مع أمثلة: 8B Q4_K_M = 4.7 GB، 13B Q5_K_M = 9.1 GB، 70B Q4_K_M = 40 GB. Q4_K_M هي النقطة المثالية الموصى بها لمعظم العتاد.
حاسبة VRAM تُظهر الصيغة (حجم النموذج × البتات) ÷ 8، مع أمثلة: 8B Q4_K_M = 4.7 GB، 13B Q5_K_M = 9.1 GB، 70B Q4_K_M = 40 GB. Q4_K_M هي النقطة المثالية الموصى بها لمعظم العتاد.

KeyPoint: في جملة واحدة: VRAM هو مجمع الذاكرة المخصص لـ GPU -- الرقم الوحيد الذي يحدد أي نماذج ذكاء اصطناعي يمكنك تشغيلها محليًا وبأي جودة.

KV Cache: تكلفة VRAM الخفية

صيغة VRAM (حجم النموذج × البتات ÷ 8) تغطي أوزان النموذج فقط -- يضيف KV cache كمية كبيرة إضافية من VRAM التي تتجاهلها معظم الأدلة.

يخزّن KV cache حالة الانتباه لكل رمز في نافذة السياق لديك. ينمو خطيًا مع طول السياق ويبقى في VRAM طوال الجلسة.

صيغة VRAM لـ KV cache: `KV cache ≈ layers × heads × head_dim × 2 × context_length × 2 bytes`

النموذجسياق 4Kسياق 32Kسياق 128K
Llama 3.1 8B0.5 GB4 GB16 GB
Llama 3.3 70B2 GB16 GB64 GB
Qwen3 32B1 GB8 GB32 GB

KeyPoint: في جملة واحدة: KV cache هو VRAM مؤقت يُستخدم لتخزين سياق المحادثة -- ينمو مع كل رمز تولّده وهو منفصل عن تخزين أوزان النموذج.

⚠️Warning: يحتاج Llama 3.1 8B عند Q4_K_M إلى 4.7 GB للأوزان -- لكن أضف نافذة سياق 32K ويرتفع إجمالي VRAM إلى ~8.7 GB. على بطاقة 8 GB، يسبب هذا أخطاء OOM.

KeyPoint: قاعدة عامة: أضف 25% إلى حجم أوزان النموذج لسياق 8K النموذجي، و100% لسياق 32K. السياق الافتراضي لـ Ollama هو 2,048 رمزًا. لضبط قيمة أعلى: PARAMETER num_ctx 32768 في Modelfile الخاص بك.

أي مستوى GPU يطابق عبء عملك؟

اعتبارًا من يوليو 2026، توفر بطاقات NVIDIA أعلى عدد رموز/ثانية لاستدلال LLM المحلي عبر جميع نقاط الأسعار. تقدم الأقسام الخاصة بكل مستوى أدناه توصيات نماذج محددة. للحصول على مقارنة قياس مرجعي مفصلة، راجع دليل أفضل بطاقات GPU لـ LLM المحلي.

المستوىGPUVRAMالأفضل لـالسرعة
اقتصادية (~$394)RTX 5060 Ti16 GBنماذج 7-13B~60 tok/s
سائد (~$609)RTX 507012 GBنماذج 7-14B~90 tok/s
متوسط (~$979)RTX 5070 Ti16 GBنماذج 14-32B~110 tok/s
عالٍ (~$1,249)RTX 508016 GBنماذج 14-32B~130 tok/s
الأعلى (~$4,300–5,000+ في السوق)RTX 509032 GB70B (Q4، إزاحة خفيفة)~200 tok/s
خادم ($7,000+)RTX 6000 Ada / A10048-80 GBمتعدد المستخدمين، 70B+إنتاج
ذكاء اصطناعي مكتبي ($4,699)NVIDIA DGX Spark128 GBنماذج MoE كبيرة (لا يشمل GLM-5.2)~3 tok/s (70B كثيف)
توصيات مستويات GPU (أسعار سوق يوليو 2026): ~$394 RTX 5060 Ti (16GB، 7-13B، 60 tok/s)، ~$609 RTX 5070 (12GB، 14B، 90 tok/s)، ~$1,249 RTX 5080 (16GB، 14-32B، 130 tok/s)، ~$4,300–5,000+ RTX 5090 (32GB، 70B، 200 tok/s)، $4,699 DGX Spark (128GB، MoE كبير). اختيار GPU يهم 10× أكثر من CPU.
توصيات مستويات GPU (أسعار سوق يوليو 2026): ~$394 RTX 5060 Ti (16GB، 7-13B، 60 tok/s)، ~$609 RTX 5070 (12GB، 14B، 90 tok/s)، ~$1,249 RTX 5080 (16GB، 14-32B، 130 tok/s)، ~$4,300–5,000+ RTX 5090 (32GB، 70B، 200 tok/s)، $4,699 DGX Spark (128GB، MoE كبير). اختيار GPU يهم 10× أكثر من CPU.

KeyPoint: اعتبارًا من يوليو 2026، سلسلة RTX 50 (Blackwell) هي الجيل الحالي والبطاقات الاستهلاكية الوحيدة من NVIDIA التي لا تزال في الإنتاج — سلسلة RTX 40 موقوفة. RTX 5090 (32 GB) هي البطاقة التي يجب شراؤها لأعمال 70B، رغم أن نقص الذاكرة المتفاقم يبقي أسعار السوق فوق MSRP البالغ $1,999 بكثير.

أفضل نماذج LLM المحلية حسب مستوى VRAM (يوليو 2026)

استخدم هذا كبحث سريع حسب مستوى VRAM الخاص بـ GPU لديك:

جميع النماذج المدرجة أدناه مفتوحة الأوزان — قابلة للتنزيل والضبط الدقيق ومجانية للتشغيل محليًا. إذا كنت تختار بين الأوزان المفتوحة وواجهات API الخاصة، راجع مقارنة LLM مفتوحة المصدر مقابل الخاصة للمفاضلات في التكلفة والأداء عند أحجام رموز مختلفة.

يحدد العتاد أي النماذج يمكنك تشغيلها؛ وتحدد هندسة الموجهات مدى جودة أدائها. غالبًا ما يتفوق موجه جيد التنظيم على نموذج 7B على موجه كسول على نموذج 70B. راجع دليل هندسة الموجهات الكامل لتقنيات تزيد جودة المخرجات عند أي عدد معاملات.

  • 8 GB VRAM (RTX 5060 Ti، RTX 4060، Intel B580): Llama 3.1 8B Q4_K_M (4.7 GB، ~70 tok/s) -- موصى به. Qwen3 8B (5 GB، أفضل متعدد اللغات + برمجة). Phi-4 Mini 3.8B (2.3 GB، الأسرع). Gemma 3 4B (~3 GB، نموذج Google الصغير الحالي، متعدد الوسائط). تجنب نماذج 13B+.
  • 12 GB VRAM (RTX 4070 Ti، RTX 5070، Intel B770): Llama 3.1 8B (4.7 GB، سريع مع هامش). Qwen3 14B Q4_K_M (8.5 GB، استدلال أفضل بميزانية محدودة). Qwen3 8B (5 GB، أفضل متعدد اللغات + برمجة). DeepSeek-R1 8B (5 GB، أفضل استدلال). تجنب نماذج 30B+ وMoE مثل Llama 4 Scout (~55 GB عند Q4).
  • 16 GB VRAM (RTX 4080، RTX 5070 Ti، RTX 5080): Mistral Small 3.1 24B Q4_K_M (14 GB، أفضل جودة في المستوى). Devstral Small 24B Q4_K_M (~16 GB) للبرمجة الوكيلة. Qwen3 14B (9 GB، سريع مع هامش سياق). Llama 3.3 70B عند Q2_K (17 GB، ممكن لكن بجودة منخفضة).
  • 24 GB VRAM (RTX 5090، RTX 4090، Tesla L40): Qwen 3.6 27B Q4_K_M (~16 GB، 77.2% SWE-bench، أفضل نموذج برمجة كثيف). DeepSeek-R1 32B Q4_K_M (~19 GB، أفضل استدلال). Qwen3 32B Q5_K_M (~21 GB). يحتاج Llama 3.3 70B إلى بطاقتي GPU بسعة 24 GB عند Q4_K_M.
  • 32 GB VRAM (RTX 5090): Llama 3.3 70B Q4_K_M (40 GB -- يحتاج إزاحة CPU طفيفة للطبقات الأخيرة). Qwen3 32B (19 GB، يتسع بالكامل مع 13 GB فائضة). للبرمجة الوكيلة، خط Kimi K2 (MoE، 1T إجمالي / 32B نشط، Modified MIT) هو الاختيار الثقيل -- Kimi K2.7 Code (يونيو 2026) هو الأحدث، مع K2.6 الإصدار العام السابق؛ كلاهما يحتاج تكميمًا وإزاحة ثقيلة في هذا المستوى. RTX 5090 هي أول GPU استهلاكية واحدة تتسع لـ 70B كثيف بإزاحة طفيفة.
  • 48+ GB VRAM (RTX 6000 Ada، A100، DGX Spark): Llama 3.3 70B Q4_K_M (40 GB، يتسع بالكامل). Llama 4 Scout (17B نشط / 109B إجمالي MoE، ~55 GB عند Q4 -- أفضل اختيار للسياق الطويل 10M رمز / متعدد الوسائط). Llama 4 Maverick (17B نشط، 400B إجمالي، MoE). Llama 3.3 70B Q8_0 (70 GB -- يحتاج A100 بسعة 80 GB). NVIDIA DGX Spark (128 GB موحدة) يتسع لكل نموذج مفتوح الأوزان حتى 70B عند Q8_0 مع 58 GB فائضة -- لكن ليس لأحدث نماذج MoE الطليعية: يحتاج GLM-5.2 (744B إجمالي، 40B نشط) إلى ~239 GB حتى عند تكميم 2-بت شديد، وهو ما يتجاوز بكثير سعة DGX Spark أو Mac Studio واحد بسعة 128 GB.

أفضل نماذج LLM المحلية لـ 16 GB VRAM (2026)

أفضل نموذج LLM محلي لبطاقة GPU بسعة 16 GB VRAM في 2026 هو Mistral Small 3.1 24B عند Q4_K_M: يستخدم ~13 GB، ويعمل بسرعة 55 tok/sec، وهو أقوى نموذج عام يتسع مع هامش سياق. تصل بطاقات 16 GB (NVIDIA RTX 5080، RTX 5070 Ti، RTX 4080 مستعملة، أو RTX 4090 لحاسوب محمول) إلى حد أقصى من نماذج 14-24B — يحتاج نموذج 70B إلى ~40 GB ولا يتسع.

للبرمجة الوكيلة، يتسع Devstral Small 24B Q4_K_M عند ~16 GB؛ وللاستدلال، DeepSeek-R1 14B Q8_0 هو الاختيار. يُعد Mistral Small 4 الأحدث (مارس 2026) نموذجًا واحدًا يدمج الاستدلال والرؤية والبرمجة معًا وهو الخليفة الطبيعي كافتراضي لفئة 16 GB. يُظهر الجدول أدناه ما يتسع وما لا يتسع — صفوف "لا يتسع" هي الخطأ الأكثر شيوعًا الذي يرتكبه أصحاب بطاقات 16 GB.

النموذجالتكميمVRAM المستخدمالسرعة (RTX 4080)الأفضل لـيتسع في 16 GB؟
Mistral Small 3.1 24BQ4_K_M~13 GB55 tok/secمحادثة عامة✅ نعم
Devstral Small 24BQ4_K_M~16 GB45 tok/secبرمجة وكيلة✅ ضيق
Qwen3 14BQ8_0~15 GB45 tok/secبرمجة + استدلال✅ نعم
DeepSeek-R1 14BQ8_0~15 GB40 tok/secرياضيات + تحليل✅ نعم
Llama 3.1 8BFP16~16 GB70 tok/secأسرع الردود✅ ضيق
Llama 3.3 70BQ4_K_M~39 GB----❌ لا (يحتاج 39 GB)
مخطط شريطي يُظهر أي النماذج تتسع في 16 GB VRAM: Mistral Small 3.1 24B Q4_K_M (13 GB ✅)، Devstral Small 24B Q4_K_M (16 GB ✅)، Qwen3 14B Q8_0 (15 GB ✅)، Llama 3.3 70B Q4_K_M (39 GB ❌). أفضل خيار: Mistral Small 3.1 24B بسرعة 55 tok/sec.
مخطط شريطي يُظهر أي النماذج تتسع في 16 GB VRAM: Mistral Small 3.1 24B Q4_K_M (13 GB ✅)، Devstral Small 24B Q4_K_M (16 GB ✅)، Qwen3 14B Q8_0 (15 GB ✅)، Llama 3.3 70B Q4_K_M (39 GB ❌). أفضل خيار: Mistral Small 3.1 24B بسرعة 55 tok/sec.

ProTip: 🏆 الأفضل إجمالًا لـ 16 GB: Mistral Small 3.1 24B Q4_K_M عند ~13 GB، 55 tok/sec. للبرمجة الوكيلة، استخدم Devstral Small 24B (Mistral AI، فرنسا) بسرعة 45 tok/sec. أفضل استدلال: DeepSeek-R1 14B Q8_0 بسرعة 40 tok/sec.

⚠️Warning: تملك بطاقات RTX 4090 للحاسوب المحمول 16 GB VRAM (وليس 24 GB). تشترك في نفس سقف النموذج مع RTX 4080 المكتبية.

KeyPoint: متى تترقى إلى 24 GB (RTX 4090 مكتبية): فقط إذا كنت تحتاج نماذج 32B+ عند Q8، أو تريد تشغيل نموذجين في آن واحد دون إعادة تحميل.

أي نماذج LLM المحلية تعمل بأفضل شكل على 12 GB VRAM؟

على بطاقة GPU بسعة 12 GB VRAM (NVIDIA RTX 5070، RTX 4070 Ti، أو RTX 3060 12 GB)، يمكنك تشغيل نماذج 7-8B عند Q8 أو 14B عند Q4_K_M. ملاحظة: نماذج MoE مثل Llama 4 Scout لا تتسع هنا -- رغم أن Scout يُفعّل 17B معامل فقط لكل رمز، يجب تحميل جميع خبراء 109B الإجمالية في الذاكرة، ما يتطلب ~55 GB عند Q4.

Llama 3.1 8B عند Q8_0 هو الخيار الأكثر موثوقية للإعدادات المحافظة: 9 GB VRAM، 80 tok/sec، وجودة كاملة في اتباع التعليمات. يتسع Qwen3 14B عند Q4_K_M أيضًا عند ~8.5 GB ويقدم استدلالًا أفضل بشكل ملحوظ من فئة 8B.

النموذجالتكميمVRAM المستخدمالسرعة (RTX 4070 Ti)الأفضل لـيتسع في 12 GB؟
Llama 3.1 8BQ8_0~9 GB80 tok/secالأفضل إجمالًا، محادثة عامة + برمجة✅ نعم
Qwen3 14BQ4_K_M~8.5 GB65 tok/secاستدلال أفضل بميزانية محدودة✅ نعم
Llama 3.2 11B VisionQ5_K_M~8 GB65 tok/secمهام الصور + النص✅ نعم
Qwen3 8BQ8_0~8 GB85 tok/secأفضل متعدد اللغات + برمجة✅ نعم
Mistral Small v0.3FP16~14 GB----❌ لا (يحتاج 14 GB عند FP16)
Llama 4 Scout (109B إجمالي MoE)Q4_K_M~55 GB----❌ لا (يجب تحميل جميع خبراء 109B)

ProTip: 🏆 الأفضل إجمالًا لـ 12 GB: Llama 3.1 8B Q8_0 عند ~9 GB، 80 tok/sec. لاستدلال أفضل على نفس البطاقة، استخدم Qwen3 14B Q4_K_M عند ~8.5 GB. لا يتسع Llama 4 Scout -- خبراؤه الإجمالية 109B MoE يحتاجون ~55 GB عند Q4.

KeyPoint: RTX 3060 12GB هي نقطة الدخول الاقتصادية (~$200 مستعملة). تشغّل جميع نماذج 12 GB لكن بسرعة ~60-70 tok/sec مقابل ~80-90 tok/sec على RTX 4070 Ti بسبب بنية الذاكرة الأقدم.

أي نماذج 70B تتسع فعليًا في 24 GB VRAM (RTX 4090)؟

متطلب العتاد لتشغيل نموذج 70B محليًا بجودة Q4_K_M قابلة للاستخدام هو ~40 GB من VRAM — لذا فإن RTX 4090 الواحدة بسعة 24 GB ليست كافية. خياراتك الحقيقية لـ 70B في 2026 هي: 2× RTX 5090 (64 GB مجتمعة)، أو RTX 5090 (32 GB) مع إزاحة CPU خفيفة، أو GPU خادم بسعة 48-80 GB (RTX 6000 Ada / A100)، أو نظام Apple M5 Max / ذاكرة موحدة 128 GB. الاعتقاد الخاطئ الشائع هو أن "Q4 صغير" — عند 70B معامل، حتى Q4 يحتاج ~40 GB.

على بطاقة 24 GB واحدة، الاستراتيجية الأفضل هي نموذج 27-32B، الذي يقدم جودة قوية ويتسع بشكل مريح مع هامش سياق. Qwen3.6 27B عند Q4_K_M هو أفضل نموذج برمجة كثيف (77.2% SWE-bench)؛ وDeepSeek-R1 32B هو أفضل اختيار للاستدلال. يمكن لبطاقة GPU بسعة 24 GB أن تحمل 70B فقط عند Q2_K، حيث تنخفض الجودة بشكل ملحوظ. راجع كيفية تشغيل نماذج 70B على 24 GB VRAM لتقنيات الإزاحة وثنائية GPU.

النموذجالتكميمVRAM المطلوبيتسع في 24 GB؟السرعة (RTX 4090)ملاحظات
Qwen 3.6 27BQ4_K_M~16 GB✅ نعم55 tok/secأفضل نموذج برمجة كثيف، 77.2% SWE-bench
DeepSeek-R1 32BQ4_K_M~19 GB✅ نعم60 tok/secأفضل استدلال، جودة إجمالية قوية
Qwen3 32BQ5_K_M~21 GB✅ نعم55 tok/secجودة عالية، برمجة + اتباع تعليمات ممتاز
Qwen3 32BQ8_0~34 GB❌ لا--يتطلب GPU بسعة 48 GB
Llama 3.3 70BQ2_K~24 GB⚠️ بالكاد30 tok/secيتسع لكن جودة Q2 منخفضة بشكل ملحوظ
Llama 3.3 70BQ4_K_M~39 GB❌ لا--يحتاج 2× RTX 4090 أو A100 80 GB
متطلبات VRAM مقابل حد RTX 4090 24 GB: Qwen 3.6 27B Q4_K_M (16 GB ✅)، DeepSeek-R1 32B Q4_K_M (19 GB ✅)، Qwen3 32B Q5_K_M (21 GB ✅)، Llama 3.3 70B Q4_K_M (39 GB ❌ -- يتجاوز 24 GB بنسبة 63%). النقطة المثالية: نماذج 27-32B عند Q4-Q5.
متطلبات VRAM مقابل حد RTX 4090 24 GB: Qwen 3.6 27B Q4_K_M (16 GB ✅)، DeepSeek-R1 32B Q4_K_M (19 GB ✅)، Qwen3 32B Q5_K_M (21 GB ✅)، Llama 3.3 70B Q4_K_M (39 GB ❌ -- يتجاوز 24 GB بنسبة 63%). النقطة المثالية: نماذج 27-32B عند Q4-Q5.

KeyPoint: 🏆 الأفضل لـ RTX 4090 (24 GB): Qwen 3.6 27B Q4_K_M (~16 GB، 77.2% SWE-bench) لأفضل نموذج برمجة كثيف. للاستدلال: DeepSeek-R1 32B Q4_K_M (~19 GB، 60 tok/sec). أفضل من Llama 3.3 70B Q2_K بـ VRAM أقل بكثير.

⚠️Warning: إذا كنت تحتاج تحديدًا جودة 70B عند Q4+، فإن RTX 4090 ليست GPU المناسبة. تحتاج 2× RTX 4090 (48 GB مجتمعة عبر التوازي الموتري) أو RTX 6000 Ada (48 GB). تشغيل 70B عند Q2_K على 4090 واحدة يضر بجودة المخرجات بشكل ملحوظ.

أي CPU وذاكرة تحتاج؟

مع GPU مخصصة، يُعد CPU والذاكرة مكونين ثانويين. يتولى GPU حساب المصفوفات؛ ويدير CPU/الذاكرة تحضير السياق. لمقارنة كاملة لسرعات استدلال GPU مقابل CPU مقابل Apple Silicon، راجع دليل GPU مقابل CPU مقابل Apple Silicon.

الحد الأدنى لـ CPU: معالج 8 أنوية (Intel Core i7 الجيل الرابع عشر، AMD Ryzen 7 7700X، أو أحدث). تضيف المعالجات الأقدم 20%+ من زمن الاستجابة.

الذاكرة: 16 GB كحد أدنى (مع GPU). إذا كنت تشغّل بدون GPU، يُوصى بـ 32+ GB. لا تحد الذاكرة مباشرة حجم النموذج عند وجود GPU.

التخزين: SSD بسعة 500 GB لملفات النماذج ونظام التشغيل. يُفضّل M.2 NVMe (تحميل أسرع للنماذج).

أي النماذج تعمل جيدًا على ذاكرة نظام 16 GB دون GPU؟

بدون GPU، يمكن لجهاز بذاكرة نظام 16 GB تشغيل نماذج 3B-7B بسرعة 8-20 رمز/ثانية باستخدام استدلال CPU. عنق الزجاجة هو عرض نطاق الذاكرة، وليس سعة الذاكرة -- تملك المعالجات عرض نطاق أقل بكثير من بطاقات GPU، ولهذا يكون الاستدلال أبطأ 5-10×.

على ذاكرة نظام 16 GB، القاعدة العملية هي: حجم ملف النموذج + 4 GB حمل نظام التشغيل ≤ 16 GB. يتسع نموذج 7B عند Q4_K_M (4.9 GB)، لكنه يترك هامشًا ضئيلًا للسياقات الطويلة. يُظهر الجدول أدناه خيارات واقعية اعتبارًا من يوليو 2026.

للحصول على دليل نماذج كامل محسّن للسرعة يغطي CPU فقط ومستويات 4 GB و6 GB و8 GB VRAM مع قياسات مرجعية حقيقية، راجع **أسرع نماذج LLM المحلية لأجهزة الكمبيوتر الضعيفة**.

النموذجالتكميمالذاكرة المستخدمةالسرعة (Ryzen 9 7950X)الأفضل لـملاحظات
Gemma 2 2BQ8_0~2.7 GB28 tok/secالأسرع، أدنى ذاكرةيترك 13 GB حرة لنظام التشغيل
Phi-4 Mini 3.8BQ4_K_M~2.5 GB25 tok/secبرمجة على CPUأفضل نسبة جودة لكل ذاكرة
Llama 3.2 3BQ8_0~3.8 GB20 tok/secمحادثة عامة، ذاكرة منخفضةموثوق، مدعوم على نطاق واسع
Llama 3.1 8BQ4_K_M~4.9 GB12 tok/secأفضل جودة على CPU12 tok/sec بطيء لكن قابل للاستخدام للمهام الدفعية
Llama 3.1 8BQ8_0~9 GB8 tok/secأقصى جودة على CPUبطيء جدًا للاستخدام التفاعلي على معظم المعالجات
سرعات الاستدلال على CPU فقط بمعالج Ryzen 9 7950X: Gemma 2 2B Q8_0 (28 tok/sec الأسرع)، Phi-4 Mini Q4_K_M (25 tok/sec أفضل خيار)، Llama 3.1 8B Q8_0 (8 tok/sec). تحقق RTX 3060 مستعملة ($200) سرعة أعلى 5-8×.
سرعات الاستدلال على CPU فقط بمعالج Ryzen 9 7950X: Gemma 2 2B Q8_0 (28 tok/sec الأسرع)، Phi-4 Mini Q4_K_M (25 tok/sec أفضل خيار)، Llama 3.1 8B Q8_0 (8 tok/sec). تحقق RTX 3060 مستعملة ($200) سرعة أعلى 5-8×.

ProTip: 🏆 الأفضل لـ 16 GB ذاكرة، بدون GPU: Phi-4 Mini 3.8B Q4_K_M (2.5 GB، 25 tok/sec). يقدم برمجة واستدلالًا قويين بشكل مفاجئ بالنسبة لحجمه.

KeyPoint: واقع سرعة CPU مقابل GPU: تشغّل NVIDIA RTX 3060 12 GB مستعملة (~$200) نموذج Llama 3.1 8B بسرعة 70+ tok/sec -- أسرع 5-8× من Ryzen 9 7950X في الاستدلال على CPU فقط. إذا كانت السرعة مهمة، اشترِ GPU قبل إضافة ذاكرة.

⚠️Warning: تشغيل نموذج 7B على ذاكرة 16 GB بـ CPU فقط يترك أقل من 7 GB لنظام التشغيل والمتصفح. مع سياقات محادثة طويلة (32k+ رمز)، ينمو ملف النموذج إلى ما يتجاوز حجمه الأساسي وقد يسبب استنفاد الذاكرة. أبقِ حجم السياق دون 4096 على أجهزة CPU فقط بذاكرة 16 GB.

كم تحتاج من التخزين؟

ملفات النماذج كبيرة: نموذج 7B عند تكميم 4-بت هو 4-5 GB. خطط للتخزين حول عدد وحجم النماذج التي تريد الاحتفاظ بها محليًا.

  • SSD بسعة 500 GB: نظام التشغيل + 1-2 نموذج صغير (3B، 7B)
  • SSD بسعة 1 TB: نظام التشغيل + 3-5 نماذج (مزيج من 7B و13B)
  • SSD بسعة 2 TB: نظام التشغيل + 10+ نماذج (أحجام مختلفة)
  • NVMe RAID بسعة 4 TB: إعداد إنتاجي، تحميل سريع للنماذج

أي تجميعة عتاد ينبغي أن تشتري؟

بناء جهاز LLM محلي من الصفر يعني إعطاء الأولوية لـ GPU أولًا، ثم CPU والذاكرة. إليك ثلاثة تكوينات واقعية. لتجميعات متعددة GPU، راجع دليل LLM المحلي متعدد GPU. لإعدادات أتمتة المنزل، غالبًا ما تكون أجهزة Mini PC المدمجة أنسب من تجميعات الحاسوب المكتبي الكاملة — راجع أفضل Mini PC لـ Home Assistant بذكاء اصطناعي محلي →.

الميزانيةGPUCPUالذاكرةالنماذجالتكلفة
$1500 (مدخل)RTX 4070 Tii7 1370016 GB7-13Bواقعي
$2500 (متين)RTX 4080i7 14700K32 GB13-30Bموصى به
$4000 (راقٍ)2× RTX 4090Ryzen 9 7950X128 GBأي (70B+)مبالغ فيه للاستخدام الشخصي
ثلاثة تكوينات بناء: $1500 لمستوى المدخل (RTX 4070 Ti، i7 13700، 16GB) لنماذج 7-13B، $2500 بناء متين (RTX 4080، i7 14700K، 32GB) لـ 13-30B، $4000 راقٍ (2× RTX 4090، Ryzen 9، 128GB) لأي نموذج. يقدم المستوى المتوسط أفضل قيمة.
ثلاثة تكوينات بناء: $1500 لمستوى المدخل (RTX 4070 Ti، i7 13700، 16GB) لنماذج 7-13B، $2500 بناء متين (RTX 4080، i7 14700K، 32GB) لـ 13-30B، $4000 راقٍ (2× RTX 4090، Ryzen 9، 128GB) لأي نموذج. يقدم المستوى المتوسط أفضل قيمة.

ماذا لو لم تستطع تحمل تكلفة العتاد؟

إذا كانت GPU بسعر $250–400 خارج ميزانيتك، أو كان حاسوبك المحمول قديمًا جدًا لدعم محركات الاستدلال الحديثة، فقد لا تكون نماذج LLM المحلية فعّالة من حيث التكلفة لك في 2026.

احسب التكلفة الحقيقية:

  • محلي: $800–2,000 عتاد مقدمًا + كهرباء + صيانة على مدى 2–3 سنوات
  • سحابي: $5–50/شهر للاستخدام النموذجي للمطور (Llama API أو GPT-5.5 mini)

للمستخدمين الخفيفين (< 100,000 رمز/شهر)، تكلف واجهات API السحابية $5–10/شهر ولا تتطلب أي عتاد. للمستخدمين الثقيلين (> 10M رمز/شهر)، يتعادل المحلي خلال 6–12 شهرًا.

قارن مفاضلات التكلفة والأداء الكاملة بين المحلي والسحابي** لإيجاد نقطة التعادل الخاصة بك. يكتشف الكثير من المطورين أن السحابة أرخص لنمط استخدامهم الفعلي.

هل تتسوق بالفعل دون مستويات VRAM الموصى بها؟ راجع أفضل تطبيق ذكاء اصطناعي محلي لجهاز كمبيوتر ضعيف لمعرفة أي مجموعات نماذج وتطبيقات تعمل فعليًا على 8 GB أو أقل.

كيف تزيد سرعة llama.cpp إلى أقصاها على RTX 4070 Ti؟

بالإعدادات الصحيحة، يحقق llama.cpp على RTX 4070 Ti سرعة 85-95 رمز/ثانية على Llama 3.1 8B Q4_K_M -- أكثر من ضعف السرعة الافتراضية الجاهزة. العلامة الأكثر تأثيرًا هي `--n-gpu-layers 99`، التي تزيح جميع طبقات النموذج إلى GPU. بدونها، تعود الطبقات إلى CPU، ما يخلق عنق زجاجة حادًا.

تنطبق هذه الإعدادات على llama.cpp مباشرة وعلى Ollama (الذي يستخدم llama.cpp داخليًا). يضبط Ollama `--n-gpu-layers 99` تلقائيًا على عتاد NVIDIA إذا كانت التعريفات مثبتة بشكل صحيح.

  • Q4_K_M يتفوق على Q4_0 بنسبة 15-20% على RTX 4070 Ti. يستخدم متغير K_M تكميمًا مختلطًا تسرّعه أنوية NVIDIA الموترية بكفاءة أعلى. اختر دائمًا Q4_K_M على Q4_0 عند توفر كليهما.
  • IQ4_XS هو أصغر تنسيق (~8% أصغر من Q4_K_M) بأقل خسارة في الجودة. مفيد لاحتواء Qwen3 14B في 12 GB VRAM عندما يكون Q4_K_M على الحافة.
  • Q5_K_M يعمل بسرعة تكاد تساوي Q4_K_M على بطاقات NVIDIA (< 5% أبطأ) مع تقديم جودة مخرجات أفضل بشكل ملحوظ. يستحق الاستخدام عندما يكون لديك هامش VRAM بنسبة 20%.
العلامةما تفعلهالتأثيرالافتراضيملاحظات
--n-gpu-layers 99تزيح جميع الطبقات إلى GPU+100-150% سرعة0 (CPU فقط)أهم علامة -- اضبطها دائمًا أولًا
--threads [cores]خيوط CPU لمعالجة الموجه+10-15% سرعةجميع الخيوط (بما في ذلك HT)اضبطها على عدد الأنوية الفيزيائية فقط. التشعب الفائق يضر بالاستدلال.
--ctx-size 2048حجم KV cache / نافذة السياقيوفر 0.5-8 GB VRAM40962048 = ~0.5 GB VRAM إضافي. 32768 = ~8 GB إضافي. زِدها فقط عند الحاجة.
--n-batch 512حجم دفعة معالجة الموجه+5-10% إنتاجية512افتراضي جيد. زِدها إلى 1024 لأعباء العمل الدفعية إذا سمح VRAM.
--flash-attnنواة Flash Attention 2-20-30% VRAM عند السياق الطويلمعطّلمتوفر منذ llama.cpp b2900. يقلل VRAM للسياقات > 8k رمز.
إعداد llama.cpp الافتراضي: ~40 tok/sec. المُحسّن (--n-gpu-layers 99 + --ctx-size 2048 + --flash-attn): ~90 tok/sec -- تحسّن سرعة بنسبة 125% على RTX 4070 Ti يشغّل Llama 3.1 8B Q4_K_M.
إعداد llama.cpp الافتراضي: ~40 tok/sec. المُحسّن (--n-gpu-layers 99 + --ctx-size 2048 + --flash-attn): ~90 tok/sec -- تحسّن سرعة بنسبة 125% على RTX 4070 Ti يشغّل Llama 3.1 8B Q4_K_M.

ProTip: شغّل `ollama ps` للتأكد من تحميل نموذجك على GPU. إذا أظهر استخدام GPU نسبة 0% في `nvidia-smi` أثناء التوليد، فإن التعريفات لا توجّه بشكل صحيح إلى CUDA. أعد تثبيت NVIDIA CUDA Toolkit وأعد تشغيل Ollama.

KeyPoint: مرجع سرعة RTX 4070 Ti: Llama 3.1 8B Q4_K_M = 85-95 tok/sec. Llama 3.3 13B Q4_K_M = 60-70 tok/sec. Qwen3 7B Q8_0 = 90-95 tok/sec. تفترض هذه --n-gpu-layers 99 و--ctx-size 2048.

⚠️Warning: زيادة --ctx-size إلى ما يتجاوز 8192 على GPU بسعة 12 GB سيسبب إعادة إزاحة طبقة النموذج إلى CPU إذا استنفد KV cache بقية VRAM. إذا انخفضت السرعة فجأة في المحادثات الطويلة، قلّل حجم السياق أو استخدم --flash-attn.

هل يمكن لعتاد Mac تشغيل نماذج LLM المحلية؟

تشغّل Apple Silicon (سلسلة M) نماذج LLM المحلية بكفاءة باستخدام ذاكرة موحدة مشتركة بين CPU وGPU. أُطلق M5 الأساسي في أكتوبر 2025؛ وتبعه M5 Pro وM5 Max في مارس 2026. تقيس Apple معالجة موجهات LLM أسرع حتى 4× (زمن أول رمز) على M5 Pro/Max مقابل جيل M4، رغم أن مكاسب توليد الرموز أكثر تواضعًا.

يشغّل M5 Max بذاكرة موحدة 128 GB (حتى 614 GB/s) نماذج 70B عند Q4_K_M بشكل مريح — نحو 12-15 tok/sec — في حاسوب محمول أو بشكل Mac Studio. يتعامل M5 Pro (حتى 64 GB موحدة، 307 GB/s) مع نماذج 32B بهامش سخي لـ KV cache وتعدد المهام. اعتبارًا من يوليو 2026، يُعد M5 Max أعلى Apple Silicon متوفر؛ ويُشاع عن M5 Ultra Mac Studio لكنه لم يُطلق بعد. يُلاحَظ أن M5 Max لا يزال بعيدًا كل البعد عن احتياجات GLM-5.2 البالغة ~239 GB حتى عند تكميم 2-بت -- وهذا مجال تكون فيه سعة الذاكرة الموحدة لدى Apple أهم من السرعة الخام.

على MacBook بذاكرة 8 GB، التزم بنماذج 3-4B. مع ذاكرة موحدة مشتركة بين نظام التشغيل والنموذج، يتسع 8 GB واقعيًا لـ Phi-4 Mini 3.8B أو Llama 3.2 3B أو Gemma 3 4B عند Q4_K_M عبر Ollama أو llama.cpp (كلاهما يستخدم خلفية Metal GPU تلقائيًا). نموذج 7B على الحافة عند 8 GB وسيستخدم التبديل تحت الحمل؛ 16 GB هو الحد الأدنى المريح لنماذج 7-8B على Mac.

Macذاكرة GPUالأفضل لـالقيد
سلسلة M بذاكرة 8 GB (Air / أساسي)8 GB موحدةنماذج 3-4B (Phi-4 Mini، Gemma 3 4B)7B على الحافة؛ نظام التشغيل ينافس على الذاكرة
M3 Pro MacBook Pro 16"18 GB موحدةنماذج 7-8B (سريع)يمكن تشغيل 14B ببطء
M4 Max36-128 GB موحدةنماذج 13-32B70B فقط عند أعلى تكوين 128 GB
M5 Pro (MacBook Pro)64 GB موحدة، 307 GB/sنماذج 32B بشكل مريحيعمل Llama 4 Scout جيدًا
M5 Max (MacBook Pro / Studio)128 GB موحدة، حتى 614 GB/sنماذج 70B عند Q4_K_M~12-15 tok/sec على 70B
مقارنة عتاد Mac: سلسلة M بذاكرة 8 GB (نماذج 3-4B)، M3 Pro 16" (18GB، 7-8B)، M4 Max (36-128GB، 13-32B)، M5 Pro (64GB، 32B)، M5 Max (128GB، 70B عند Q4_K_M ~12-15 tok/sec). 16 GB موحدة هو الحد الأدنى المريح لنماذج 7B على Mac.
مقارنة عتاد Mac: سلسلة M بذاكرة 8 GB (نماذج 3-4B)، M3 Pro 16" (18GB، 7-8B)، M4 Max (36-128GB، 13-32B)، M5 Pro (64GB، 32B)، M5 Max (128GB، 70B عند Q4_K_M ~12-15 tok/sec). 16 GB موحدة هو الحد الأدنى المريح لنماذج 7B على Mac.

متى ينبغي أن تستخدم عتاد الخادم مقابل العتاد الاستهلاكي؟

للنشر الإنتاجي (تشغيل 24/7، مستخدمون متعددون)، يُوصى بعتاد من فئة الخادم على بطاقات GPU الاستهلاكية. العتاد الاستهلاكي محسّن للألعاب، وليس للاستدلال المستدام.

  • استهلاكي (RTX 5090): ~$2,000 MSRP (~$4,300–5,000+ في السوق اعتبارًا من يوليو 2026)، 32 GB VRAM، مستخدم واحد، عرضة للخنق الحراري تحت الحمل المستدام.
  • خادم (RTX 6000 Ada): ~$7,000، 48 GB VRAM، مصمم للاستخدام 24/7، تبريد أفضل، تصحيح أخطاء.
  • التوصية: ابدأ بـ RTX 5090. إذا كنت تشغّل نماذج 70B على مدار 24/7 لمستخدمين متعددين، رقِّ إلى A100 مزدوجة أو RTX 6000 Ada.
العتاد الاستهلاكي مقابل الخادم: RTX 5090 (~$4,300–5,000+ في السوق اعتبارًا من يوليو 2026، 32GB، مستخدم واحد، جزئي الوقت) مقابل RTX 6000 Ada ($7,000+، 48GB، متعدد المستخدمين، عمل 24/7). ابدأ بالعتاد الاستهلاكي؛ رقِّ إلى فئة الخادم فقط إذا كنت تشغّل خدمات إنتاجية.
العتاد الاستهلاكي مقابل الخادم: RTX 5090 (~$4,300–5,000+ في السوق اعتبارًا من يوليو 2026، 32GB، مستخدم واحد، جزئي الوقت) مقابل RTX 6000 Ada ($7,000+، 48GB، متعدد المستخدمين، عمل 24/7). ابدأ بالعتاد الاستهلاكي؛ رقِّ إلى فئة الخادم فقط إذا كنت تشغّل خدمات إنتاجية.

NVIDIA DGX Spark: حاسوب ذكاء اصطناعي مكتبي بسعة 128 GB

NVIDIA DGX Spark ($4,699 اعتبارًا من فبراير 2026، ارتفاعًا من سعر إطلاقه $3,999) هو حاسوب ذكاء اصطناعي مكتبي مدمج بسعة 128 GB يمكنه حمل Llama 3.3 70B عند Q8_0 بالكامل في الذاكرة الموحدة. يمكن لأجهزة Apple Mac Studio / MacBook Pro بسعة 128 GB وأنظمة AMD Strix Halo 128 GB فعل الشيء نفسه، لذا فهو ليس فريدًا — لكنه يأتي مع مجموعة برامج CUDA من NVIDIA -- لكن سقفه البالغ 128 GB ليس غير محدود: يحتاج GLM-5.2 (744B إجمالي، 40B نشط، صدر في يونيو 2026) إلى ~239 GB حتى عند تكميم 2-بت ولا يتسع في DGX Spark واحد.

مبني على شريحة GB10 Grace Blackwell Superchip الفائقة، أُطلق DGX Spark في أكتوبر 2025 بذاكرة موحدة 128 GB LPDDR5x. ملاحظة: عرض نطاق ذاكرته الحقيقي هو ~273 GB/s، لذا فإن توليد رموز 70B الكثيف بطيء — قاست الاختبارات المستقلة (LMSYS) نحو 3 tok/sec على Llama 70B. لا يترجم رقم حساب FP4 البارز إلى فك تشفير سريع لتيار واحد. يُعد DGX Spark الأنسب لنماذج خليط الخبراء الكبيرة (Llama 4 Scout/Maverick، Kimi K2) حيث يُفعّل جزء فقط من المعاملات لكل رمز.

المواصفةالقيمة
الذاكرة الموحدة128 GB LPDDR5x
Llama 3.3 70B عند Q4_K_M✅ يتسع (40 GB)
Llama 3.3 70B عند Q8_0✅ يتسع (70 GB)
GLM-5.2 عند تكميم 2-بت (~239 GB)❌ لا يتسع
سرعة الاستدلال (70B)~3 tok/s
السعر$4,699
نظام التشغيلDGX OS (Ubuntu)، Ollama مثبّت مسبقًا
عرض نطاق الذاكرة~273 GB/s (حقيقي)
مقابل RTX 5090ذاكرة أكثر 4×، لكن عرض نطاق أقل بكثير

KeyPoint: تولّد GPU منفصلة (RTX 5090، أو 5090 مزدوجة) الرموز أسرع بكثير من DGX Spark على النماذج الكثيفة بسبب عرض النطاق الأعلى بكثير للذاكرة. اختر DGX Spark للسعة — حمل نماذج MoE كبيرة جدًا في صندوق واحد — وليس لسرعة 70B لتيار واحد.

ما أكثر أخطاء العتاد شيوعًا؟

  • شراء CPU فقط عند توفر GPU. ستتفوق RTX 4070 Ti بسعر $600 على CPU بسعر $2000. يهيمن GPU على سرعة LLM.
  • عدم احتساب حمل VRAM الزائد. حجم ملف النموذج + حمل النظام + السياق = إجمالي VRAM المستخدم. اشترِ دائمًا 25% أكثر من حجم النموذج.
  • افتراض أن جميع نماذج 70B تتسع في 40GB VRAM. تتسع، بالكاد، عند تكميم Q4 (4-بت) فقط. يتطلب Q5 أكثر من 45 GB.
  • تجاهل مصدر الطاقة والتبريد. تسحب RTX 4090 قدرة 575W. تحتاج PSU بقدرة 1200W وتدفق هواء جيد للصندوق.
  • الاعتقاد بأن GPU قديمة ستعمل. RTX 2080 أبطأ 10× من RTX 4070 Ti. تتفوق بنية GPU الحديثة بشكل كبير على الأجيال السابقة.
  • عدم احتساب VRAM لـ KV cache فوق أوزان النموذج: نموذج 7B عند Q4_K_M هو 4.7 GB من الأوزان -- لكن مع نافذة سياق 32K، يضيف KV cache ~4 GB أخرى، بإجمالي ~8.7 GB. على بطاقة 8 GB يسبب هذا أخطاء OOM. أضف دائمًا 25-100% إلى حجم النموذج حسب طول السياق.
  • معاملة تكلفة العتاد كالتكلفة الوحيدة: إذا لم تستطع تحمل 16+ GB ذاكرة أو GPU مخصصة، تكلف واجهات API السحابية أقل للاستخدام منخفض الحجم ($0.01–0.05 لكل 1K رمز). راجع LLM المحلي مقابل السحابي: تحليل التكلفة للمفاضلة الكاملة.

ما قواعد الامتثال الإقليمية التي تنطبق على عتاد LLM المحلي؟

الاتحاد الأوروبي (GDPR + قانون الذكاء الاصطناعي الأوروبي): يبقي تشغيل نماذج LLM محليًا جميع بيانات الاستدلال داخل بنيتك التحتية، ما يلغي مخاوف نقل البيانات عبر الحدود بموجب المادة 44 من GDPR. كانت التزامات قانون الذكاء الاصطناعي الأوروبي لأنظمة الذكاء الاصطناعي عالية المخاطر المستقلة (الملحق III) محددة أصلًا لتطبق من 2 أغسطس 2026، لكن "Digital Omnibus on AI" — المتفق عليه مبدئيًا في مايو 2026 والذي ينتظر الاعتماد الرسمي اعتبارًا من يونيو 2026 — يؤجل ذلك التاريخ إلى 2 ديسمبر 2027 (مع تأجيل الذكاء الاصطناعي عالي المخاطر المضمّن في منتجات منظمة إلى 2 أغسطس 2028). لا تزال واجبات الشفافية في المادة 50 من القانون تنطبق وفق الجدول الأصلي. يلبي العتاد المحلي متطلبات إقامة البيانات افتراضيًا.

اليابان (APPI): شدّد تعديل APPI لعام 2022 في اليابان قواعد الإخطار بالخروقات والنقل عبر الحدود لكنه لا يفرض متطلب تقليل بيانات خاصًا بالذكاء الاصطناعي (يعتمد على واجبات تحديد الغرض العامة). الأكثر صلة بالذكاء الاصطناعي هي حزمة إصلاح APPI لعام 2025 في اليابان وأول قانون ذكاء اصطناعي لها — قانون تعزيز الذكاء الاصطناعي (ساري منذ يونيو 2025)، إطار يضع الابتكار أولًا دون عقوبات. يبقي عتاد LLM المحلي البيانات الشخصية داخل بنيتك التحتية لمعالجة المستندات وأتمتة دعم العملاء.

الصين: تتطلب التدابير المؤقتة لخدمات الذكاء الاصطناعي التوليدي الصادرة عن إدارة الفضاء السيبراني الصينية (CAC) (سارية من أغسطس 2023) من المزودين ذوي التأثير على الرأي العام إكمال تقييم أمني من CAC وتسجيل الخوارزمية. منذ 1 سبتمبر 2025، تفرض الصين أيضًا وسم المحتوى المولّد بالذكاء الاصطناعي بموجب تدابير الوسم من CAC والمعيار الوطني GB 45438-2025. يتجنب تشغيل عتاد محلي بنماذج مفتوحة الأوزان تعرّض الامتثال القائم على API للاستخدام المؤسسي الداخلي.

أسئلة شائعة حول عتاد LLM المحلي

هل يمكنني تشغيل نموذج 70B على حاسوب محمول؟

فقط مع تكميم ثقيل (Q2، 2-بت) واحتياط CPU. غير عملي. الحواسيب المحمولة مناسبة لنماذج 7B. لـ 70B، استخدم حاسوبًا مكتبيًا مع RTX 4090+.

هل RTX 4090 مبالغ فيها للاستخدام الشخصي؟

ليس إذا كنت تشغّل نماذج 70B أو نماذج متعددة في آن واحد. لمجرد محادثة 7B، تكفي RTX 4070 Ti. RTX 4090 مقاومة للتقادم إذا أردت مرونة.

هل أشتري RTX 5090 أم أنتظر RTX 6090؟

RTX 5090 متوفرة (أوائل 2026). بطاقات RTX 6000 Ada للخوادم متينة أيضًا. ما لم تكن لديك ميزانية غير محدودة، فإن RTX 5090 أو 4090 ممتازتان.

كيف يؤثر التكميم على الجودة؟

FP16 = 100% جودة (الأساس)، Q8 = 99%، Q5 = 95%، Q4 = 90-95%. لمعظم المهام، Q4 لا يمكن تمييزه عن FP16.

هل يمكنني ترقية GPU لاحقًا؟

نعم. ابدأ بـ RTX 4070 Ti الآن، ورقِّ إلى RTX 5090 خلال سنتين إذا لزم الأمر. GPU هو أكثر المكونات قابلية للاستبدال.

كم أحتاج من الذاكرة لتشغيل نموذج 7B محليًا؟

8 GB ذاكرة هو الحد الأدنى المطلق لنموذج 7B. يُوصى بـ 16 GB للاستخدام المريح إلى جانب المتصفح ونظام التشغيل. يمنح 32 GB هامشًا لنوافذ سياق أكبر وتعدد المهام.

هل يمكنني تشغيل نماذج LLM المحلية على Apple Silicon (M1/M2/M3/M4/M5)؟

نعم. تستخدم Apple Silicon ذاكرة موحدة مشتركة بين CPU وGPU. يشغّل M5 Pro (64 GB، 307 GB/s) نماذج 32B جيدًا. يشغّل M5 Max (128 GB، حتى 614 GB/s) نماذج 70B عند Q4_K_M بسرعة نحو 12-15 tok/sec. على Mac بذاكرة 8 GB، التزم بنماذج 3-4B.

ما أفضل نماذج llama.cpp لـ MacBook بمعالج M3 وذاكرة 8 GB؟

على MacBook M3 بذاكرة 8 GB، شغّل نماذج 3-4B عند Q4_K_M: Phi-4 Mini 3.8B أو Llama 3.2 3B أو Gemma 3 4B. استخدم Ollama أو llama.cpp — كلاهما يستخدم خلفية Metal GPU تلقائيًا. نموذج 7B على الحافة وسيستخدم التبديل تحت الحمل؛ أبقِ السياق دون 4096 رمزًا. للاستخدام المريح لنماذج 7-8B على Mac، 16 GB ذاكرة موحدة هو الحد الأدنى العملي.

أي CPU هو الأفضل لنماذج LLM المحلية دون GPU؟

معالجات عالية عدد الأنوية بذاكرة L3 كبيرة: AMD Ryzen 9 7950X أو Intel Core i9-14900K. توقّع 5-15 رمز/ثانية لنماذج 7B. استدلال CPU أبطأ 3-5× من GPU.

هل تؤثر سرعة التخزين على أداء LLM المحلي؟

نعم، عند وقت تحميل النموذج. يحمّل NVMe SSD (3-7 GB/s) نموذج 7B في 2-5 ثوانٍ مقابل 20-60 ثانية على HDD. سرعة الاستدلال بعد التحميل لا تتأثر بالتخزين.

هل يمكنني استخدام بطاقات GPU متعددة لتشغيل نماذج أكبر؟

نعم، عبر التوازي الموتري. توفر بطاقتا RTX 5090 (32 GB لكل منهما) 64 GB VRAM، تكفي لنموذج 70B عند Q4_K_M. يدعم Ollama وllama.cpp تعدد GPU عبر --n-gpu-layers موزّعة على البطاقات.

ما أفضل نماذج LLM المحلية لـ 16 GB VRAM في 2026؟

Mistral Small 3.1 24B Q4_K_M (13 GB، 55 tok/sec) هو الأفضل إجمالًا لـ RTX 5080 / RTX 5070 Ti / RTX 4090 لحاسوب محمول. للبرمجة الوكيلة: Devstral Small 24B Q4_K_M (16 GB، 45 tok/sec). للاستدلال: DeepSeek-R1 14B (15 GB، 40 tok/sec). يُعد Mistral Small 4 الأحدث (مارس 2026) الخليفة ذا النموذج الواحد. لا يتسع Llama 3.3 70B -- يتطلب ~40 GB عند Q4_K_M.

هل يمكن لـ RTX 4090 واحدة تشغيل نموذج 70B بجودة جيدة؟

لا -- ليس بجودة Q4_K_M. يتطلب Llama 3.3 70B عند Q4_K_M ~39 GB VRAM. تملك RTX 4090 سعة 24 GB. يمكنك تشغيله عند Q2_K (~24 GB) لكن الجودة تنخفض بشكل ملحوظ. خيارات أفضل: Qwen 3.6 27B Q4_K_M (~16 GB، 77.2% SWE-bench، أفضل برمجة كثيفة) أو DeepSeek-R1 32B Q4_K_M (~19 GB، أفضل استدلال).

ما أفضل نموذج LLM محلي لذاكرة نظام 16 GB دون GPU؟

Phi-4 Mini 3.8B Q4_K_M (2.5 GB ذاكرة، ~25 tok/sec على Ryzen 9 7950X) هو أفضل خيار للاستدلال على CPU فقط بذاكرة نظام 16 GB. Gemma 2 2B Q8 هو الأسرع عند ~28 tok/sec. يتسع Llama 3.1 8B Q4_K_M (4.9 GB) أيضًا لكنه يعمل بسرعة ~12 tok/sec -- بطيء للاستخدام التفاعلي.

ما قاعدة الذاكرة العملية لنموذج 7B بتكميم Q4؟

نموذج 7B بتكميم Q4_K_M يحتاج نحو 4-5 GB من VRAM (أو ذاكرة النظام للاستدلال على CPU فقط) -- تقريبًا 0.6 GB لكل مليار معامل عند دقة 4-بت. يتوسع هذا خطيًا: نموذج 14B يحتاج ~9 GB، ونموذج 32B يحتاج ~19 GB، ونموذج 70B يحتاج ~40 GB، جميعها عند Q4_K_M.

ما العتاد الذي أحتاجه لتشغيل GLM-5.2 محليًا؟

GLM-5.2 (من Z.ai، صدر في يونيو 2026) هو نموذج MoE بـ744B معامل مع 40B معامل نشط لكل رمز. حتى GGUF الديناميكي الأكثر عدوانية بتكميم 2-بت يحتاج ~239 GB من VRAM/RAM مجتمعة -- أكبر من أن تتسع في RTX 5090 واحدة (32 GB)، أو DGX Spark بسعة 128 GB، أو Mac Studio بسعة 128 GB. المسارات المحلية الواقعية هي نظام 4× RTX 3090/4090 بذاكرة نظام 192 GB+، أو Mac Studio بسعة 256 GB+، وكلاهما يعمل بسرعة تقارب 3-9 رمز/ثانية عبر إزاحة هجينة CPU/GPU. بالنسبة لمعظم المستخدمين، GLM-5.2 هو عمليًا نموذج سحابي فقط.

المصادر

هل تعرف احتياجاتك من العتاد؟ اعثر على أفضل GPU اقتصادية لـ LLM المحلي.

أفضل بطاقات GPU الاقتصادية لـ LLM المحلي →

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs