Key Takeaways
- حساب VRAM: (حجم النموذج بالـ GB) ÷ التكميم = VRAM المطلوب. مثال: 70B عند Q4 = 70 ÷ 8 = 8.75 GB × المعاملات ≈ 39 GB إجمالًا.
- قاعدة 7B عند Q4: نموذج 7B بتكميم Q4_K_M يحتاج ~4-5 GB VRAM فقط -- نحو 0.6 GB لكل مليار معامل عند دقة 4-بت. يتوسع هذا خطيًا: 14B ≈ 9 GB، 32B ≈ 19 GB، 70B ≈ 40 GB، جميعها عند Q4_K_M.
- 12 GB VRAM (RTX 4070 Ti): أفضل نموذج: Llama 3.1 8B Q8 (~9 GB، 80 tok/sec). أيضًا: Qwen3 8B (~8 GB، أفضل متعدد اللغات + برمجة). ملاحظة: يحتاج Llama 4 Scout (17B نشط / 109B إجمالي MoE) إلى ~55 GB عند Q4 ولا يتسع في 12 GB.
- 16 GB VRAM (RTX 5080 / RTX 5070 Ti): أفضل نموذج: Mistral Small 3.1 24B Q4_K_M (~13 GB، 55 tok/sec). أيضًا: Devstral Small 24B Q4_K_M للبرمجة الوكيلة. يُعد Mistral Small 4 (مارس 2026) الخليفة الأحدث ذو النموذج الواحد الذي يدمج الاستدلال والرؤية والبرمجة.
- 24 GB VRAM (RTX 4090 / RTX 5090): معظم نماذج 70B عند Q4_K_M (~40 GB) لا تتسع. أفضل خيار: Qwen3.6 27B Q4_K_M (~16 GB، 77.2% SWE-bench، أفضل مبرمج كثيف) أو DeepSeek-R1 32B Q4_K_M (~19 GB، 60 tok/sec).
- CPU فقط (ذاكرة نظام 16 GB): Llama 3.2 3B Q8 (20 tok/sec) أو Phi-4 Mini Q4_K_M (25 tok/sec). بطاقة RTX 4060 8 GB مستعملة (~$250) أو RTX 5060 Ti 16 GB جديدة (~$394) أسرع 5-10×.
- MacBook بذاكرة 8 GB: شغّل نماذج 3-4B فقط — Phi-4 Mini أو Llama 3.2 3B أو Gemma 3 4B عند Q4_K_M عبر llama.cpp/Ollama (Metal). نموذج 7B على الحافة عند 8 GB؛ 16 GB هو الحد الأدنى المريح لـ Mac.
- Apple M5 Max (128 GB موحدة): يشغّل نماذج 70B عند Q4_K_M بشكل مريح (~12-15 tok/sec) في حاسوب محمول أو Mac Studio — إلى جانب أنظمة Mac Studio وأنظمة AMD Strix Halo بسعة 128 GB التي تحمل أيضًا نموذج 70B.
- أسعار يوليو 2026: ارتفع سعر RTX 5090 في السوق من نحو $4,000 في يونيو إلى $4,300-$5,000+ في منتصف يوليو، ولا يزال يرتفع، بسبب استمرار نقص GDDR7 وإيقاف RTX 4090. بديل أرخص إلى حد كبير غير متأثر تقريبًا بالنقص: AMD RX 9070 XT (16 GB GDDR6، ~$630-700). اشترِ من سلسلة RTX 50 المتوفرة في المخزون أو فكّر في بطاقة AMD؛ تحقق من الأسعار الحية قبل الشراء.
- نصيحة سرعة llama.cpp: اضبط دائمًا `--n-gpu-layers 99`. هذا وحده يضاعف السرعة على RTX 4070 Ti من ~40 إلى ~85 tok/sec.
- مرجع سريع: 7B@Q4_K_M = 4-5 GB | 70B@Q4_K_M = 40 GB | GLM-5.2@2-bit = ~239 GB | RTX 4070 Ti = ~80 tok/s | RTX 4090 = ~150 tok/s | CPU فقط 16 GB = 12-28 tok/s
تُحدَّد متطلبات أجهزة نماذج اللغة المحلية بذاكرة VRAM: نماذج 7B تحتاج 8 جيجابايت، و13–14B تحتاج 12–16 جيجابايت، و70B تحتاج 35–48 جيجابايت — بطاقة RTX 4060 8 جيجابايت المستعملة (≈250 دولار) هي أفضل خيار للمبتدئين في 2026.
VRAM هي الذاكرة المخصصة في بطاقة الرسومات. كلما كان نموذج الذكاء الاصطناعي أكبر، احتاج ذاكرة VRAM أكثر. القاعدة العامة: اقسم حجم النموذج بالجيجابايت على مستوى الضغط (Q4 = اقسم على 8) للحصول على تقدير لـ VRAM المطلوبة.
متطلبات عتاد LLM المحلي 2026
الحد الأدنى من العتاد لتشغيل LLM محلي في 2026 هو GPU بسعة 8 GB VRAM — أو جهاز Mac بمعالج Apple Silicon بذاكرة موحدة 16 GB — لنماذج فئة 7B. ثم تتدرج المتطلبات مع حجم النموذج: 14B يحتاج 12 GB، و24B يحتاج 16 GB، و32B يحتاج 24 GB، ويحتاج نموذج 70B إلى ~40 GB عند Q4_K_M. يُعد VRAM الخاص بـ GPU الحد الصارم: فهو يقرر أي النماذج تُحمَّل أصلًا. يؤثر CPU وذاكرة النظام على وقت التحميل وسرعة الاحتياط على CPU فقط، لكن ليس على أي نموذج يتسع في GPU.
استخدم هذا الجدول كإجابة مباشرة على "ما العتاد الذي أحتاجه" — اعثر على حجم نموذجك أو مستوى VRAM، ثم انتقل إلى اختيارات النماذج لكل مستوى أدناه.
| حجم النموذج | VRAM عند Q4_K_M | مثال GPU (2026) | أفضل نموذج | السرعة |
|---|---|---|---|---|
| 3-4B | 4-5 GB | أي 8 GB / Mac 8 GB | Phi-4 Mini، Gemma 3 4B | 60-90 tok/s |
| 7-8B | 5-9 GB | RTX 5060 Ti، RTX 4060 (8 GB) | Llama 3.1 8B، Qwen3 8B | 50-80 tok/s |
| 14B | ~9 GB | RTX 5070 (12 GB) | Qwen3 14B | ~80 tok/s |
| 24B | ~14 GB | RTX 5070 Ti / 5080 (16 GB) | Mistral Small 3.1 24B | ~55 tok/s |
| 27-32B | 16-19 GB | RTX 4090 / 5090 (24-32 GB) | Qwen3.6 27B، DeepSeek-R1 32B | 55-60 tok/s |
| 70B | ~40 GB | RTX 5090 مزدوجة، A100، Mac M5 Max 128 GB | Llama 3.3 70B | 10-60 tok/s |
•KeyPoint: في جملة واحدة: طابق النموذج مع VRAM لديك — 8 GB يشغّل 7B، و12 GB يشغّل 14B، و16 GB يشغّل 24B، و24 GB يشغّل 32B، وفقط 40 GB+ يشغّل نموذج 70B بجودة Q4_K_M قابلة للاستخدام.
•ProTip: أضف هامشًا لـ KV cache (سياق المحادثة): خصّص 25% فوق أوزان النموذج لسياق 8K وحتى 100% لسياق 32K. راجع قسم KV cache أدناه.
أفضل بطاقات GPU للشراء — توصيات 2026
الخيار المتوفر في المخزون لـ LLM المحلي في يوليو 2026 هو سلسلة NVIDIA RTX 50 (Blackwell): 5060 Ti، 5070، 5070 Ti، 5080، 5090. سلسلة RTX 40 (4060، 4070 Ti، 4090) موقوفة وتُباع الآن نادرة وفوق أسعارها القديمة في السوق المستعمل. دفع نقص GDDR7/الذاكرة المتفاقم في 2026 حتى بطاقات سلسلة 50 إلى ما فوق MSRP بكثير، لذا تعامل مع كل رقم أدناه على أنه سعر سوق نموذجي ليوليو 2026 وتحقق من القوائم الحية قبل الشراء. التوصيات حسب حالة الاستخدام:
- لنماذج 7B (Mistral، Phi-4، Llama 3.1) — اقتصادية: RTX 5060 Ti 16 GB (~$394، قريب من MSRP) أو RTX 4060 8 GB مستعملة (~$250). تشغّل أي نموذج 7B عند Q4_K_M. السرعة: 50–70 tok/sec. المستوى: الهواة الاقتصاديون.
- لنماذج 14B (Qwen3 14B، DeepSeek-R1) — السائد: RTX 5070 (12 GB، ~$609). أفضل بطاقة جديدة من حيث السعر مقابل الأداء. يعمل Qwen3 14B Q4_K_M جيدًا مع هامش. السرعة: 85–110 tok/sec. المستوى: الأكثر شعبية.
- لنماذج 24-32B (Qwen3.6، Mistral Small) — المتوسط: RTX 5070 Ti (16 GB، ~$979) أو RTX 5080 (16 GB، ~$1,249). تشغّل Mistral Small 3.1 24B وDevstral Small 24B Q4_K_M. السرعة: 110–150 tok/sec. المستوى: المطورون المحترفون. بديل اقتصادي: AMD RX 9070 XT (16 GB GDDR6، ~$630-700) يشغّل نفس النماذج بسرعة مشابهة تقريبًا وهو غير متأثر تقريبًا بنقص GDDR7.
- لنماذج 70B (Llama 3.3) — الراقي: RTX 5090 (32 GB، ~$2,000 MSRP لكن ~$4,300–5,000+ في السوق) يتسع لـ 70B عند Q4_K_M مع إزاحة CPU خفيفة. RTX 4090 مستعملة (24 GB، ~$2,300) تشغّل 70B فقط عند Q2_K. للحصول على Q4_K_M كامل، استخدم RTX 5090 مزدوجة. السرعة: ~200 tok/sec (5090، نماذج أصغر). المستوى: البحث + الإنتاج.
- لـ GLM-5.2 (744B MoE، 40B نشط) — أقصى درجة: لا توجد بطاقة GPU استهلاكية واحدة كافية. لا يزال GGUF الديناميكي بتكميم 2-بت يحتاج ~239 GB VRAM/RAM مجتمعة. المسارات المحلية الواقعية: نظام 4× RTX 3090/4090 بذاكرة نظام 192 GB+، أو Mac Studio بسعة 256 GB+، وكلاهما بسرعة تقارب 3-9 tok/sec عبر إزاحة هجينة CPU/GPU.
- أفضل قيمة 2026: بطاقة RTX 5070 Ti أو 5080 (16 GB) واحدة هي النقطة المثالية — تشغّل كل شيء حتى 32B عند Q4_K_M دون مبالغة أسعار سلسلة 50 على 5090.
- لمستخدمي Apple: Mac M5 Max (ذاكرة موحدة 128 GB، ~$6,000) يشغّل 70B عند Q4_K_M بسرعة ~12-15 tok/sec — أبطأ من حاسوب مكتبي متعدد GPU، لكنه صامت وموفر للطاقة ومحمول.
| GPU | الأفضل لـ | السعر | السرعة | المستوى |
|---|---|---|---|---|
| RTX 5060 Ti (16 GB) | نماذج 7-13B | ~$394 | 50–70 tok/s | اقتصادية |
| RTX 5070 (12 GB) | نماذج 14B | ~$609 | 85–110 tok/s | سائد |
| RTX 5070 Ti / 5080 (16 GB) | نماذج 24-32B | ~$979–1,249 | 110–150 tok/s | احترافي |
| RX 9070 XT (16 GB) | نماذج 24-32B | ~$630–700 | 90–130 tok/s | بديل اقتصادي |
| RTX 4090 (24 GB، مستعملة) | 32B، 70B (Q2) | ~$2,300 | 150–180 tok/s | EOL / مستعملة |
| RTX 5090 (32 GB) | 70B (Q4، إزاحة خفيفة) | ~$2,000 MSRP (~$4,300–5,000+ في السوق) | ~200 tok/s | راقٍ |
| RTX 5090 مزدوجة | 70B (Q4) كامل | ~$8,600–10,000 | 300+ tok/s | مؤسسي |
| 4× RTX 3090/4090 + 192GB RAM | GLM-5.2 (2-بت) | ~$6,000–9,000 | 3–9 tok/s | MoE أقصى |
| Mac M5 Max 128GB | 70B (Q4) | ~$6,000 | ~12–15 tok/s (70B) | حاسوب محمول احترافي |
⚠️Warning: تسعير يوليو 2026 متقلب ويزداد سوءًا. دفع نقص GDDR7/الذاكرة المستمر سعر RTX 5090 في السوق إلى $4,300-$5,000+، أكثر من ضعف MSRP البالغ $1,999، وتكلف RTX 4090 الموقوفة الآن مستعملة أكثر مما كانت جديدة. الاستثناء: AMD RX 9070 XT (16 GB GDDR6، ~$630-700) غير متأثر تقريبًا بالنقص. الأسعار أعلاه أرقام سوق نموذجية — تحقق دائمًا من القوائم الحالية قبل الشراء.
كيف تحسب متطلبات VRAM؟
تعتمد متطلبات VRAM على ثلاثة عوامل: حجم النموذج (المعاملات)، والتكميم (بتات لكل وزن)، ووضع الاستدلال. استخدم هذه الصيغة لتحديد ما إذا كان GPU لديك يملك ذاكرة كافية. للحصول على حاسبة تفاعلية، راجع حاسبة VRAM لـ LLM المحلي.
الصيغة:
```text VRAM (GB) = (حجم النموذج × بتات التكميم) ÷ 8 ```
قيم التكميم: FP16 = 16 بت، Q8_0 = 8 بت، Q5_K_M = 5 بت، Q4_K_M = 4 بت. النقطة المثالية العملية هي Q4_K_M -- فهي تستخدم أوزانًا 4-بت مع تكميم K، الذي تسرّعه بطاقات NVIDIA بكفاءة أعلى من تنسيق Q4_0 الأقدم.
| النموذج | FP16 | Q8_0 | Q5_K_M | Q4_K_M |
|---|---|---|---|---|
| Llama 4 Scout (109B إجمالي MoE) | ~218 GB | ~109 GB | ~68 GB | ~55 GB |
| Llama 3.1 8B | 16 GB | 8.5 GB | 5.7 GB | 4.7 GB |
| Qwen 3.6 27B | ~54 GB | ~28 GB | ~19 GB | ~16 GB |
| Qwen3 8B | ~16 GB | ~8.5 GB | ~5.7 GB | ~5 GB |
| Llama 3.3 70B | 140 GB | 70 GB | 48 GB | 40 GB |
| Qwen3 32B | 64 GB | 33 GB | 22 GB | 19 GB |
| Mistral Small 3.1 24B | 48 GB | 25 GB | 17 GB | 14 GB |
| Phi-4 Mini 3.8B | 7.6 GB | 4.1 GB | 2.7 GB | 2.3 GB |
Q4_K_M هو الافتراضي الموصى به للعتاد الاستهلاكي -- 90-95% من جودة FP16 بـ 25-30% من تكلفة VRAM. يستخدم Llama 4 Scout بنية MoE بـ 17B معامل نشط من أصل 109B إجمالي. يجب تحميل جميع خبراء 109B في الذاكرة، لذا يحتاج Scout إلى ~55 GB عند Q4 (يتسع في 24 GB فقط عند 1.78-بت). يقلل MoE الحساب لكل رمز، وليس بصمة VRAM.

•KeyPoint: في جملة واحدة: VRAM هو مجمع الذاكرة المخصص لـ GPU -- الرقم الوحيد الذي يحدد أي نماذج ذكاء اصطناعي يمكنك تشغيلها محليًا وبأي جودة.
KV Cache: تكلفة VRAM الخفية
صيغة VRAM (حجم النموذج × البتات ÷ 8) تغطي أوزان النموذج فقط -- يضيف KV cache كمية كبيرة إضافية من VRAM التي تتجاهلها معظم الأدلة.
يخزّن KV cache حالة الانتباه لكل رمز في نافذة السياق لديك. ينمو خطيًا مع طول السياق ويبقى في VRAM طوال الجلسة.
صيغة VRAM لـ KV cache: `KV cache ≈ layers × heads × head_dim × 2 × context_length × 2 bytes`
| النموذج | سياق 4K | سياق 32K | سياق 128K |
|---|---|---|---|
| Llama 3.1 8B | 0.5 GB | 4 GB | 16 GB |
| Llama 3.3 70B | 2 GB | 16 GB | 64 GB |
| Qwen3 32B | 1 GB | 8 GB | 32 GB |
•KeyPoint: في جملة واحدة: KV cache هو VRAM مؤقت يُستخدم لتخزين سياق المحادثة -- ينمو مع كل رمز تولّده وهو منفصل عن تخزين أوزان النموذج.
⚠️Warning: يحتاج Llama 3.1 8B عند Q4_K_M إلى 4.7 GB للأوزان -- لكن أضف نافذة سياق 32K ويرتفع إجمالي VRAM إلى ~8.7 GB. على بطاقة 8 GB، يسبب هذا أخطاء OOM.
•KeyPoint: قاعدة عامة: أضف 25% إلى حجم أوزان النموذج لسياق 8K النموذجي، و100% لسياق 32K. السياق الافتراضي لـ Ollama هو 2,048 رمزًا. لضبط قيمة أعلى: PARAMETER num_ctx 32768 في Modelfile الخاص بك.
أي مستوى GPU يطابق عبء عملك؟
اعتبارًا من يوليو 2026، توفر بطاقات NVIDIA أعلى عدد رموز/ثانية لاستدلال LLM المحلي عبر جميع نقاط الأسعار. تقدم الأقسام الخاصة بكل مستوى أدناه توصيات نماذج محددة. للحصول على مقارنة قياس مرجعي مفصلة، راجع دليل أفضل بطاقات GPU لـ LLM المحلي.
| المستوى | GPU | VRAM | الأفضل لـ | السرعة |
|---|---|---|---|---|
| اقتصادية (~$394) | RTX 5060 Ti | 16 GB | نماذج 7-13B | ~60 tok/s |
| سائد (~$609) | RTX 5070 | 12 GB | نماذج 7-14B | ~90 tok/s |
| متوسط (~$979) | RTX 5070 Ti | 16 GB | نماذج 14-32B | ~110 tok/s |
| عالٍ (~$1,249) | RTX 5080 | 16 GB | نماذج 14-32B | ~130 tok/s |
| الأعلى (~$4,300–5,000+ في السوق) | RTX 5090 | 32 GB | 70B (Q4، إزاحة خفيفة) | ~200 tok/s |
| خادم ($7,000+) | RTX 6000 Ada / A100 | 48-80 GB | متعدد المستخدمين، 70B+ | إنتاج |
| ذكاء اصطناعي مكتبي ($4,699) | NVIDIA DGX Spark | 128 GB | نماذج MoE كبيرة (لا يشمل GLM-5.2) | ~3 tok/s (70B كثيف) |
•KeyPoint: اعتبارًا من يوليو 2026، سلسلة RTX 50 (Blackwell) هي الجيل الحالي والبطاقات الاستهلاكية الوحيدة من NVIDIA التي لا تزال في الإنتاج — سلسلة RTX 40 موقوفة. RTX 5090 (32 GB) هي البطاقة التي يجب شراؤها لأعمال 70B، رغم أن نقص الذاكرة المتفاقم يبقي أسعار السوق فوق MSRP البالغ $1,999 بكثير.
أفضل نماذج LLM المحلية حسب مستوى VRAM (يوليو 2026)
استخدم هذا كبحث سريع حسب مستوى VRAM الخاص بـ GPU لديك:
جميع النماذج المدرجة أدناه مفتوحة الأوزان — قابلة للتنزيل والضبط الدقيق ومجانية للتشغيل محليًا. إذا كنت تختار بين الأوزان المفتوحة وواجهات API الخاصة، راجع مقارنة LLM مفتوحة المصدر مقابل الخاصة للمفاضلات في التكلفة والأداء عند أحجام رموز مختلفة.
يحدد العتاد أي النماذج يمكنك تشغيلها؛ وتحدد هندسة الموجهات مدى جودة أدائها. غالبًا ما يتفوق موجه جيد التنظيم على نموذج 7B على موجه كسول على نموذج 70B. راجع دليل هندسة الموجهات الكامل لتقنيات تزيد جودة المخرجات عند أي عدد معاملات.
- 8 GB VRAM (RTX 5060 Ti، RTX 4060، Intel B580): Llama 3.1 8B Q4_K_M (4.7 GB، ~70 tok/s) -- موصى به. Qwen3 8B (5 GB، أفضل متعدد اللغات + برمجة). Phi-4 Mini 3.8B (2.3 GB، الأسرع). Gemma 3 4B (~3 GB، نموذج Google الصغير الحالي، متعدد الوسائط). تجنب نماذج 13B+.
- 12 GB VRAM (RTX 4070 Ti، RTX 5070، Intel B770): Llama 3.1 8B (4.7 GB، سريع مع هامش). Qwen3 14B Q4_K_M (8.5 GB، استدلال أفضل بميزانية محدودة). Qwen3 8B (5 GB، أفضل متعدد اللغات + برمجة). DeepSeek-R1 8B (5 GB، أفضل استدلال). تجنب نماذج 30B+ وMoE مثل Llama 4 Scout (~55 GB عند Q4).
- 16 GB VRAM (RTX 4080، RTX 5070 Ti، RTX 5080): Mistral Small 3.1 24B Q4_K_M (14 GB، أفضل جودة في المستوى). Devstral Small 24B Q4_K_M (~16 GB) للبرمجة الوكيلة. Qwen3 14B (9 GB، سريع مع هامش سياق). Llama 3.3 70B عند Q2_K (17 GB، ممكن لكن بجودة منخفضة).
- 24 GB VRAM (RTX 5090، RTX 4090، Tesla L40): Qwen 3.6 27B Q4_K_M (~16 GB، 77.2% SWE-bench، أفضل نموذج برمجة كثيف). DeepSeek-R1 32B Q4_K_M (~19 GB، أفضل استدلال). Qwen3 32B Q5_K_M (~21 GB). يحتاج Llama 3.3 70B إلى بطاقتي GPU بسعة 24 GB عند Q4_K_M.
- 32 GB VRAM (RTX 5090): Llama 3.3 70B Q4_K_M (40 GB -- يحتاج إزاحة CPU طفيفة للطبقات الأخيرة). Qwen3 32B (19 GB، يتسع بالكامل مع 13 GB فائضة). للبرمجة الوكيلة، خط Kimi K2 (MoE، 1T إجمالي / 32B نشط، Modified MIT) هو الاختيار الثقيل -- Kimi K2.7 Code (يونيو 2026) هو الأحدث، مع K2.6 الإصدار العام السابق؛ كلاهما يحتاج تكميمًا وإزاحة ثقيلة في هذا المستوى. RTX 5090 هي أول GPU استهلاكية واحدة تتسع لـ 70B كثيف بإزاحة طفيفة.
- 48+ GB VRAM (RTX 6000 Ada، A100، DGX Spark): Llama 3.3 70B Q4_K_M (40 GB، يتسع بالكامل). Llama 4 Scout (17B نشط / 109B إجمالي MoE، ~55 GB عند Q4 -- أفضل اختيار للسياق الطويل 10M رمز / متعدد الوسائط). Llama 4 Maverick (17B نشط، 400B إجمالي، MoE). Llama 3.3 70B Q8_0 (70 GB -- يحتاج A100 بسعة 80 GB). NVIDIA DGX Spark (128 GB موحدة) يتسع لكل نموذج مفتوح الأوزان حتى 70B عند Q8_0 مع 58 GB فائضة -- لكن ليس لأحدث نماذج MoE الطليعية: يحتاج GLM-5.2 (744B إجمالي، 40B نشط) إلى ~239 GB حتى عند تكميم 2-بت شديد، وهو ما يتجاوز بكثير سعة DGX Spark أو Mac Studio واحد بسعة 128 GB.
أفضل نماذج LLM المحلية لـ 16 GB VRAM (2026)
أفضل نموذج LLM محلي لبطاقة GPU بسعة 16 GB VRAM في 2026 هو Mistral Small 3.1 24B عند Q4_K_M: يستخدم ~13 GB، ويعمل بسرعة 55 tok/sec، وهو أقوى نموذج عام يتسع مع هامش سياق. تصل بطاقات 16 GB (NVIDIA RTX 5080، RTX 5070 Ti، RTX 4080 مستعملة، أو RTX 4090 لحاسوب محمول) إلى حد أقصى من نماذج 14-24B — يحتاج نموذج 70B إلى ~40 GB ولا يتسع.
للبرمجة الوكيلة، يتسع Devstral Small 24B Q4_K_M عند ~16 GB؛ وللاستدلال، DeepSeek-R1 14B Q8_0 هو الاختيار. يُعد Mistral Small 4 الأحدث (مارس 2026) نموذجًا واحدًا يدمج الاستدلال والرؤية والبرمجة معًا وهو الخليفة الطبيعي كافتراضي لفئة 16 GB. يُظهر الجدول أدناه ما يتسع وما لا يتسع — صفوف "لا يتسع" هي الخطأ الأكثر شيوعًا الذي يرتكبه أصحاب بطاقات 16 GB.
| النموذج | التكميم | VRAM المستخدم | السرعة (RTX 4080) | الأفضل لـ | يتسع في 16 GB؟ |
|---|---|---|---|---|---|
| Mistral Small 3.1 24B | Q4_K_M | ~13 GB | 55 tok/sec | محادثة عامة | ✅ نعم |
| Devstral Small 24B | Q4_K_M | ~16 GB | 45 tok/sec | برمجة وكيلة | ✅ ضيق |
| Qwen3 14B | Q8_0 | ~15 GB | 45 tok/sec | برمجة + استدلال | ✅ نعم |
| DeepSeek-R1 14B | Q8_0 | ~15 GB | 40 tok/sec | رياضيات + تحليل | ✅ نعم |
| Llama 3.1 8B | FP16 | ~16 GB | 70 tok/sec | أسرع الردود | ✅ ضيق |
| Llama 3.3 70B | Q4_K_M | ~39 GB | -- | -- | ❌ لا (يحتاج 39 GB) |
•ProTip: 🏆 الأفضل إجمالًا لـ 16 GB: Mistral Small 3.1 24B Q4_K_M عند ~13 GB، 55 tok/sec. للبرمجة الوكيلة، استخدم Devstral Small 24B (Mistral AI، فرنسا) بسرعة 45 tok/sec. أفضل استدلال: DeepSeek-R1 14B Q8_0 بسرعة 40 tok/sec.
⚠️Warning: تملك بطاقات RTX 4090 للحاسوب المحمول 16 GB VRAM (وليس 24 GB). تشترك في نفس سقف النموذج مع RTX 4080 المكتبية.
•KeyPoint: متى تترقى إلى 24 GB (RTX 4090 مكتبية): فقط إذا كنت تحتاج نماذج 32B+ عند Q8، أو تريد تشغيل نموذجين في آن واحد دون إعادة تحميل.
أي نماذج LLM المحلية تعمل بأفضل شكل على 12 GB VRAM؟
على بطاقة GPU بسعة 12 GB VRAM (NVIDIA RTX 5070، RTX 4070 Ti، أو RTX 3060 12 GB)، يمكنك تشغيل نماذج 7-8B عند Q8 أو 14B عند Q4_K_M. ملاحظة: نماذج MoE مثل Llama 4 Scout لا تتسع هنا -- رغم أن Scout يُفعّل 17B معامل فقط لكل رمز، يجب تحميل جميع خبراء 109B الإجمالية في الذاكرة، ما يتطلب ~55 GB عند Q4.
Llama 3.1 8B عند Q8_0 هو الخيار الأكثر موثوقية للإعدادات المحافظة: 9 GB VRAM، 80 tok/sec، وجودة كاملة في اتباع التعليمات. يتسع Qwen3 14B عند Q4_K_M أيضًا عند ~8.5 GB ويقدم استدلالًا أفضل بشكل ملحوظ من فئة 8B.
| النموذج | التكميم | VRAM المستخدم | السرعة (RTX 4070 Ti) | الأفضل لـ | يتسع في 12 GB؟ |
|---|---|---|---|---|---|
| Llama 3.1 8B | Q8_0 | ~9 GB | 80 tok/sec | الأفضل إجمالًا، محادثة عامة + برمجة | ✅ نعم |
| Qwen3 14B | Q4_K_M | ~8.5 GB | 65 tok/sec | استدلال أفضل بميزانية محدودة | ✅ نعم |
| Llama 3.2 11B Vision | Q5_K_M | ~8 GB | 65 tok/sec | مهام الصور + النص | ✅ نعم |
| Qwen3 8B | Q8_0 | ~8 GB | 85 tok/sec | أفضل متعدد اللغات + برمجة | ✅ نعم |
| Mistral Small v0.3 | FP16 | ~14 GB | -- | -- | ❌ لا (يحتاج 14 GB عند FP16) |
| Llama 4 Scout (109B إجمالي MoE) | Q4_K_M | ~55 GB | -- | -- | ❌ لا (يجب تحميل جميع خبراء 109B) |
•ProTip: 🏆 الأفضل إجمالًا لـ 12 GB: Llama 3.1 8B Q8_0 عند ~9 GB، 80 tok/sec. لاستدلال أفضل على نفس البطاقة، استخدم Qwen3 14B Q4_K_M عند ~8.5 GB. لا يتسع Llama 4 Scout -- خبراؤه الإجمالية 109B MoE يحتاجون ~55 GB عند Q4.
•KeyPoint: RTX 3060 12GB هي نقطة الدخول الاقتصادية (~$200 مستعملة). تشغّل جميع نماذج 12 GB لكن بسرعة ~60-70 tok/sec مقابل ~80-90 tok/sec على RTX 4070 Ti بسبب بنية الذاكرة الأقدم.
أي نماذج 70B تتسع فعليًا في 24 GB VRAM (RTX 4090)؟
متطلب العتاد لتشغيل نموذج 70B محليًا بجودة Q4_K_M قابلة للاستخدام هو ~40 GB من VRAM — لذا فإن RTX 4090 الواحدة بسعة 24 GB ليست كافية. خياراتك الحقيقية لـ 70B في 2026 هي: 2× RTX 5090 (64 GB مجتمعة)، أو RTX 5090 (32 GB) مع إزاحة CPU خفيفة، أو GPU خادم بسعة 48-80 GB (RTX 6000 Ada / A100)، أو نظام Apple M5 Max / ذاكرة موحدة 128 GB. الاعتقاد الخاطئ الشائع هو أن "Q4 صغير" — عند 70B معامل، حتى Q4 يحتاج ~40 GB.
على بطاقة 24 GB واحدة، الاستراتيجية الأفضل هي نموذج 27-32B، الذي يقدم جودة قوية ويتسع بشكل مريح مع هامش سياق. Qwen3.6 27B عند Q4_K_M هو أفضل نموذج برمجة كثيف (77.2% SWE-bench)؛ وDeepSeek-R1 32B هو أفضل اختيار للاستدلال. يمكن لبطاقة GPU بسعة 24 GB أن تحمل 70B فقط عند Q2_K، حيث تنخفض الجودة بشكل ملحوظ. راجع كيفية تشغيل نماذج 70B على 24 GB VRAM لتقنيات الإزاحة وثنائية GPU.
| النموذج | التكميم | VRAM المطلوب | يتسع في 24 GB؟ | السرعة (RTX 4090) | ملاحظات |
|---|---|---|---|---|---|
| Qwen 3.6 27B | Q4_K_M | ~16 GB | ✅ نعم | 55 tok/sec | أفضل نموذج برمجة كثيف، 77.2% SWE-bench |
| DeepSeek-R1 32B | Q4_K_M | ~19 GB | ✅ نعم | 60 tok/sec | أفضل استدلال، جودة إجمالية قوية |
| Qwen3 32B | Q5_K_M | ~21 GB | ✅ نعم | 55 tok/sec | جودة عالية، برمجة + اتباع تعليمات ممتاز |
| Qwen3 32B | Q8_0 | ~34 GB | ❌ لا | -- | يتطلب GPU بسعة 48 GB |
| Llama 3.3 70B | Q2_K | ~24 GB | ⚠️ بالكاد | 30 tok/sec | يتسع لكن جودة Q2 منخفضة بشكل ملحوظ |
| Llama 3.3 70B | Q4_K_M | ~39 GB | ❌ لا | -- | يحتاج 2× RTX 4090 أو A100 80 GB |
•KeyPoint: 🏆 الأفضل لـ RTX 4090 (24 GB): Qwen 3.6 27B Q4_K_M (~16 GB، 77.2% SWE-bench) لأفضل نموذج برمجة كثيف. للاستدلال: DeepSeek-R1 32B Q4_K_M (~19 GB، 60 tok/sec). أفضل من Llama 3.3 70B Q2_K بـ VRAM أقل بكثير.
⚠️Warning: إذا كنت تحتاج تحديدًا جودة 70B عند Q4+، فإن RTX 4090 ليست GPU المناسبة. تحتاج 2× RTX 4090 (48 GB مجتمعة عبر التوازي الموتري) أو RTX 6000 Ada (48 GB). تشغيل 70B عند Q2_K على 4090 واحدة يضر بجودة المخرجات بشكل ملحوظ.
أي CPU وذاكرة تحتاج؟
مع GPU مخصصة، يُعد CPU والذاكرة مكونين ثانويين. يتولى GPU حساب المصفوفات؛ ويدير CPU/الذاكرة تحضير السياق. لمقارنة كاملة لسرعات استدلال GPU مقابل CPU مقابل Apple Silicon، راجع دليل GPU مقابل CPU مقابل Apple Silicon.
الحد الأدنى لـ CPU: معالج 8 أنوية (Intel Core i7 الجيل الرابع عشر، AMD Ryzen 7 7700X، أو أحدث). تضيف المعالجات الأقدم 20%+ من زمن الاستجابة.
الذاكرة: 16 GB كحد أدنى (مع GPU). إذا كنت تشغّل بدون GPU، يُوصى بـ 32+ GB. لا تحد الذاكرة مباشرة حجم النموذج عند وجود GPU.
التخزين: SSD بسعة 500 GB لملفات النماذج ونظام التشغيل. يُفضّل M.2 NVMe (تحميل أسرع للنماذج).
أي النماذج تعمل جيدًا على ذاكرة نظام 16 GB دون GPU؟
بدون GPU، يمكن لجهاز بذاكرة نظام 16 GB تشغيل نماذج 3B-7B بسرعة 8-20 رمز/ثانية باستخدام استدلال CPU. عنق الزجاجة هو عرض نطاق الذاكرة، وليس سعة الذاكرة -- تملك المعالجات عرض نطاق أقل بكثير من بطاقات GPU، ولهذا يكون الاستدلال أبطأ 5-10×.
على ذاكرة نظام 16 GB، القاعدة العملية هي: حجم ملف النموذج + 4 GB حمل نظام التشغيل ≤ 16 GB. يتسع نموذج 7B عند Q4_K_M (4.9 GB)، لكنه يترك هامشًا ضئيلًا للسياقات الطويلة. يُظهر الجدول أدناه خيارات واقعية اعتبارًا من يوليو 2026.
للحصول على دليل نماذج كامل محسّن للسرعة يغطي CPU فقط ومستويات 4 GB و6 GB و8 GB VRAM مع قياسات مرجعية حقيقية، راجع **أسرع نماذج LLM المحلية لأجهزة الكمبيوتر الضعيفة**.
| النموذج | التكميم | الذاكرة المستخدمة | السرعة (Ryzen 9 7950X) | الأفضل لـ | ملاحظات |
|---|---|---|---|---|---|
| Gemma 2 2B | Q8_0 | ~2.7 GB | 28 tok/sec | الأسرع، أدنى ذاكرة | يترك 13 GB حرة لنظام التشغيل |
| Phi-4 Mini 3.8B | Q4_K_M | ~2.5 GB | 25 tok/sec | برمجة على CPU | أفضل نسبة جودة لكل ذاكرة |
| Llama 3.2 3B | Q8_0 | ~3.8 GB | 20 tok/sec | محادثة عامة، ذاكرة منخفضة | موثوق، مدعوم على نطاق واسع |
| Llama 3.1 8B | Q4_K_M | ~4.9 GB | 12 tok/sec | أفضل جودة على CPU | 12 tok/sec بطيء لكن قابل للاستخدام للمهام الدفعية |
| Llama 3.1 8B | Q8_0 | ~9 GB | 8 tok/sec | أقصى جودة على CPU | بطيء جدًا للاستخدام التفاعلي على معظم المعالجات |
•ProTip: 🏆 الأفضل لـ 16 GB ذاكرة، بدون GPU: Phi-4 Mini 3.8B Q4_K_M (2.5 GB، 25 tok/sec). يقدم برمجة واستدلالًا قويين بشكل مفاجئ بالنسبة لحجمه.
•KeyPoint: واقع سرعة CPU مقابل GPU: تشغّل NVIDIA RTX 3060 12 GB مستعملة (~$200) نموذج Llama 3.1 8B بسرعة 70+ tok/sec -- أسرع 5-8× من Ryzen 9 7950X في الاستدلال على CPU فقط. إذا كانت السرعة مهمة، اشترِ GPU قبل إضافة ذاكرة.
⚠️Warning: تشغيل نموذج 7B على ذاكرة 16 GB بـ CPU فقط يترك أقل من 7 GB لنظام التشغيل والمتصفح. مع سياقات محادثة طويلة (32k+ رمز)، ينمو ملف النموذج إلى ما يتجاوز حجمه الأساسي وقد يسبب استنفاد الذاكرة. أبقِ حجم السياق دون 4096 على أجهزة CPU فقط بذاكرة 16 GB.
كم تحتاج من التخزين؟
ملفات النماذج كبيرة: نموذج 7B عند تكميم 4-بت هو 4-5 GB. خطط للتخزين حول عدد وحجم النماذج التي تريد الاحتفاظ بها محليًا.
- SSD بسعة 500 GB: نظام التشغيل + 1-2 نموذج صغير (3B، 7B)
- SSD بسعة 1 TB: نظام التشغيل + 3-5 نماذج (مزيج من 7B و13B)
- SSD بسعة 2 TB: نظام التشغيل + 10+ نماذج (أحجام مختلفة)
- NVMe RAID بسعة 4 TB: إعداد إنتاجي، تحميل سريع للنماذج
أي تجميعة عتاد ينبغي أن تشتري؟
بناء جهاز LLM محلي من الصفر يعني إعطاء الأولوية لـ GPU أولًا، ثم CPU والذاكرة. إليك ثلاثة تكوينات واقعية. لتجميعات متعددة GPU، راجع دليل LLM المحلي متعدد GPU. لإعدادات أتمتة المنزل، غالبًا ما تكون أجهزة Mini PC المدمجة أنسب من تجميعات الحاسوب المكتبي الكاملة — راجع أفضل Mini PC لـ Home Assistant بذكاء اصطناعي محلي →.
| الميزانية | GPU | CPU | الذاكرة | النماذج | التكلفة |
|---|---|---|---|---|---|
| $1500 (مدخل) | RTX 4070 Ti | i7 13700 | 16 GB | 7-13B | واقعي |
| $2500 (متين) | RTX 4080 | i7 14700K | 32 GB | 13-30B | موصى به |
| $4000 (راقٍ) | 2× RTX 4090 | Ryzen 9 7950X | 128 GB | أي (70B+) | مبالغ فيه للاستخدام الشخصي |
ماذا لو لم تستطع تحمل تكلفة العتاد؟
إذا كانت GPU بسعر $250–400 خارج ميزانيتك، أو كان حاسوبك المحمول قديمًا جدًا لدعم محركات الاستدلال الحديثة، فقد لا تكون نماذج LLM المحلية فعّالة من حيث التكلفة لك في 2026.
احسب التكلفة الحقيقية:
- محلي: $800–2,000 عتاد مقدمًا + كهرباء + صيانة على مدى 2–3 سنوات
- سحابي: $5–50/شهر للاستخدام النموذجي للمطور (Llama API أو GPT-5.5 mini)
للمستخدمين الخفيفين (< 100,000 رمز/شهر)، تكلف واجهات API السحابية $5–10/شهر ولا تتطلب أي عتاد. للمستخدمين الثقيلين (> 10M رمز/شهر)، يتعادل المحلي خلال 6–12 شهرًا.
قارن مفاضلات التكلفة والأداء الكاملة بين المحلي والسحابي** لإيجاد نقطة التعادل الخاصة بك. يكتشف الكثير من المطورين أن السحابة أرخص لنمط استخدامهم الفعلي.
هل تتسوق بالفعل دون مستويات VRAM الموصى بها؟ راجع أفضل تطبيق ذكاء اصطناعي محلي لجهاز كمبيوتر ضعيف لمعرفة أي مجموعات نماذج وتطبيقات تعمل فعليًا على 8 GB أو أقل.
كيف تزيد سرعة llama.cpp إلى أقصاها على RTX 4070 Ti؟
بالإعدادات الصحيحة، يحقق llama.cpp على RTX 4070 Ti سرعة 85-95 رمز/ثانية على Llama 3.1 8B Q4_K_M -- أكثر من ضعف السرعة الافتراضية الجاهزة. العلامة الأكثر تأثيرًا هي `--n-gpu-layers 99`، التي تزيح جميع طبقات النموذج إلى GPU. بدونها، تعود الطبقات إلى CPU، ما يخلق عنق زجاجة حادًا.
تنطبق هذه الإعدادات على llama.cpp مباشرة وعلى Ollama (الذي يستخدم llama.cpp داخليًا). يضبط Ollama `--n-gpu-layers 99` تلقائيًا على عتاد NVIDIA إذا كانت التعريفات مثبتة بشكل صحيح.
- Q4_K_M يتفوق على Q4_0 بنسبة 15-20% على RTX 4070 Ti. يستخدم متغير K_M تكميمًا مختلطًا تسرّعه أنوية NVIDIA الموترية بكفاءة أعلى. اختر دائمًا Q4_K_M على Q4_0 عند توفر كليهما.
- IQ4_XS هو أصغر تنسيق (~8% أصغر من Q4_K_M) بأقل خسارة في الجودة. مفيد لاحتواء Qwen3 14B في 12 GB VRAM عندما يكون Q4_K_M على الحافة.
- Q5_K_M يعمل بسرعة تكاد تساوي Q4_K_M على بطاقات NVIDIA (< 5% أبطأ) مع تقديم جودة مخرجات أفضل بشكل ملحوظ. يستحق الاستخدام عندما يكون لديك هامش VRAM بنسبة 20%.
| العلامة | ما تفعله | التأثير | الافتراضي | ملاحظات |
|---|---|---|---|---|
| --n-gpu-layers 99 | تزيح جميع الطبقات إلى GPU | +100-150% سرعة | 0 (CPU فقط) | أهم علامة -- اضبطها دائمًا أولًا |
| --threads [cores] | خيوط CPU لمعالجة الموجه | +10-15% سرعة | جميع الخيوط (بما في ذلك HT) | اضبطها على عدد الأنوية الفيزيائية فقط. التشعب الفائق يضر بالاستدلال. |
| --ctx-size 2048 | حجم KV cache / نافذة السياق | يوفر 0.5-8 GB VRAM | 4096 | 2048 = ~0.5 GB VRAM إضافي. 32768 = ~8 GB إضافي. زِدها فقط عند الحاجة. |
| --n-batch 512 | حجم دفعة معالجة الموجه | +5-10% إنتاجية | 512 | افتراضي جيد. زِدها إلى 1024 لأعباء العمل الدفعية إذا سمح VRAM. |
| --flash-attn | نواة Flash Attention 2 | -20-30% VRAM عند السياق الطويل | معطّل | متوفر منذ llama.cpp b2900. يقلل VRAM للسياقات > 8k رمز. |
•ProTip: شغّل `ollama ps` للتأكد من تحميل نموذجك على GPU. إذا أظهر استخدام GPU نسبة 0% في `nvidia-smi` أثناء التوليد، فإن التعريفات لا توجّه بشكل صحيح إلى CUDA. أعد تثبيت NVIDIA CUDA Toolkit وأعد تشغيل Ollama.
•KeyPoint: مرجع سرعة RTX 4070 Ti: Llama 3.1 8B Q4_K_M = 85-95 tok/sec. Llama 3.3 13B Q4_K_M = 60-70 tok/sec. Qwen3 7B Q8_0 = 90-95 tok/sec. تفترض هذه --n-gpu-layers 99 و--ctx-size 2048.
⚠️Warning: زيادة --ctx-size إلى ما يتجاوز 8192 على GPU بسعة 12 GB سيسبب إعادة إزاحة طبقة النموذج إلى CPU إذا استنفد KV cache بقية VRAM. إذا انخفضت السرعة فجأة في المحادثات الطويلة، قلّل حجم السياق أو استخدم --flash-attn.
هل يمكن لعتاد Mac تشغيل نماذج LLM المحلية؟
تشغّل Apple Silicon (سلسلة M) نماذج LLM المحلية بكفاءة باستخدام ذاكرة موحدة مشتركة بين CPU وGPU. أُطلق M5 الأساسي في أكتوبر 2025؛ وتبعه M5 Pro وM5 Max في مارس 2026. تقيس Apple معالجة موجهات LLM أسرع حتى 4× (زمن أول رمز) على M5 Pro/Max مقابل جيل M4، رغم أن مكاسب توليد الرموز أكثر تواضعًا.
يشغّل M5 Max بذاكرة موحدة 128 GB (حتى 614 GB/s) نماذج 70B عند Q4_K_M بشكل مريح — نحو 12-15 tok/sec — في حاسوب محمول أو بشكل Mac Studio. يتعامل M5 Pro (حتى 64 GB موحدة، 307 GB/s) مع نماذج 32B بهامش سخي لـ KV cache وتعدد المهام. اعتبارًا من يوليو 2026، يُعد M5 Max أعلى Apple Silicon متوفر؛ ويُشاع عن M5 Ultra Mac Studio لكنه لم يُطلق بعد. يُلاحَظ أن M5 Max لا يزال بعيدًا كل البعد عن احتياجات GLM-5.2 البالغة ~239 GB حتى عند تكميم 2-بت -- وهذا مجال تكون فيه سعة الذاكرة الموحدة لدى Apple أهم من السرعة الخام.
على MacBook بذاكرة 8 GB، التزم بنماذج 3-4B. مع ذاكرة موحدة مشتركة بين نظام التشغيل والنموذج، يتسع 8 GB واقعيًا لـ Phi-4 Mini 3.8B أو Llama 3.2 3B أو Gemma 3 4B عند Q4_K_M عبر Ollama أو llama.cpp (كلاهما يستخدم خلفية Metal GPU تلقائيًا). نموذج 7B على الحافة عند 8 GB وسيستخدم التبديل تحت الحمل؛ 16 GB هو الحد الأدنى المريح لنماذج 7-8B على Mac.
| Mac | ذاكرة GPU | الأفضل لـ | القيد |
|---|---|---|---|
| سلسلة M بذاكرة 8 GB (Air / أساسي) | 8 GB موحدة | نماذج 3-4B (Phi-4 Mini، Gemma 3 4B) | 7B على الحافة؛ نظام التشغيل ينافس على الذاكرة |
| M3 Pro MacBook Pro 16" | 18 GB موحدة | نماذج 7-8B (سريع) | يمكن تشغيل 14B ببطء |
| M4 Max | 36-128 GB موحدة | نماذج 13-32B | 70B فقط عند أعلى تكوين 128 GB |
| M5 Pro (MacBook Pro) | 64 GB موحدة، 307 GB/s | نماذج 32B بشكل مريح | يعمل Llama 4 Scout جيدًا |
| M5 Max (MacBook Pro / Studio) | 128 GB موحدة، حتى 614 GB/s | نماذج 70B عند Q4_K_M | ~12-15 tok/sec على 70B |
متى ينبغي أن تستخدم عتاد الخادم مقابل العتاد الاستهلاكي؟
للنشر الإنتاجي (تشغيل 24/7، مستخدمون متعددون)، يُوصى بعتاد من فئة الخادم على بطاقات GPU الاستهلاكية. العتاد الاستهلاكي محسّن للألعاب، وليس للاستدلال المستدام.
- استهلاكي (RTX 5090): ~$2,000 MSRP (~$4,300–5,000+ في السوق اعتبارًا من يوليو 2026)، 32 GB VRAM، مستخدم واحد، عرضة للخنق الحراري تحت الحمل المستدام.
- خادم (RTX 6000 Ada): ~$7,000، 48 GB VRAM، مصمم للاستخدام 24/7، تبريد أفضل، تصحيح أخطاء.
- التوصية: ابدأ بـ RTX 5090. إذا كنت تشغّل نماذج 70B على مدار 24/7 لمستخدمين متعددين، رقِّ إلى A100 مزدوجة أو RTX 6000 Ada.
NVIDIA DGX Spark: حاسوب ذكاء اصطناعي مكتبي بسعة 128 GB
NVIDIA DGX Spark ($4,699 اعتبارًا من فبراير 2026، ارتفاعًا من سعر إطلاقه $3,999) هو حاسوب ذكاء اصطناعي مكتبي مدمج بسعة 128 GB يمكنه حمل Llama 3.3 70B عند Q8_0 بالكامل في الذاكرة الموحدة. يمكن لأجهزة Apple Mac Studio / MacBook Pro بسعة 128 GB وأنظمة AMD Strix Halo 128 GB فعل الشيء نفسه، لذا فهو ليس فريدًا — لكنه يأتي مع مجموعة برامج CUDA من NVIDIA -- لكن سقفه البالغ 128 GB ليس غير محدود: يحتاج GLM-5.2 (744B إجمالي، 40B نشط، صدر في يونيو 2026) إلى ~239 GB حتى عند تكميم 2-بت ولا يتسع في DGX Spark واحد.
مبني على شريحة GB10 Grace Blackwell Superchip الفائقة، أُطلق DGX Spark في أكتوبر 2025 بذاكرة موحدة 128 GB LPDDR5x. ملاحظة: عرض نطاق ذاكرته الحقيقي هو ~273 GB/s، لذا فإن توليد رموز 70B الكثيف بطيء — قاست الاختبارات المستقلة (LMSYS) نحو 3 tok/sec على Llama 70B. لا يترجم رقم حساب FP4 البارز إلى فك تشفير سريع لتيار واحد. يُعد DGX Spark الأنسب لنماذج خليط الخبراء الكبيرة (Llama 4 Scout/Maverick، Kimi K2) حيث يُفعّل جزء فقط من المعاملات لكل رمز.
| المواصفة | القيمة |
|---|---|
| الذاكرة الموحدة | 128 GB LPDDR5x |
| Llama 3.3 70B عند Q4_K_M | ✅ يتسع (40 GB) |
| Llama 3.3 70B عند Q8_0 | ✅ يتسع (70 GB) |
| GLM-5.2 عند تكميم 2-بت (~239 GB) | ❌ لا يتسع |
| سرعة الاستدلال (70B) | ~3 tok/s |
| السعر | $4,699 |
| نظام التشغيل | DGX OS (Ubuntu)، Ollama مثبّت مسبقًا |
| عرض نطاق الذاكرة | ~273 GB/s (حقيقي) |
| مقابل RTX 5090 | ذاكرة أكثر 4×، لكن عرض نطاق أقل بكثير |
•KeyPoint: تولّد GPU منفصلة (RTX 5090، أو 5090 مزدوجة) الرموز أسرع بكثير من DGX Spark على النماذج الكثيفة بسبب عرض النطاق الأعلى بكثير للذاكرة. اختر DGX Spark للسعة — حمل نماذج MoE كبيرة جدًا في صندوق واحد — وليس لسرعة 70B لتيار واحد.
ما أكثر أخطاء العتاد شيوعًا؟
- شراء CPU فقط عند توفر GPU. ستتفوق RTX 4070 Ti بسعر $600 على CPU بسعر $2000. يهيمن GPU على سرعة LLM.
- عدم احتساب حمل VRAM الزائد. حجم ملف النموذج + حمل النظام + السياق = إجمالي VRAM المستخدم. اشترِ دائمًا 25% أكثر من حجم النموذج.
- افتراض أن جميع نماذج 70B تتسع في 40GB VRAM. تتسع، بالكاد، عند تكميم Q4 (4-بت) فقط. يتطلب Q5 أكثر من 45 GB.
- تجاهل مصدر الطاقة والتبريد. تسحب RTX 4090 قدرة 575W. تحتاج PSU بقدرة 1200W وتدفق هواء جيد للصندوق.
- الاعتقاد بأن GPU قديمة ستعمل. RTX 2080 أبطأ 10× من RTX 4070 Ti. تتفوق بنية GPU الحديثة بشكل كبير على الأجيال السابقة.
- عدم احتساب VRAM لـ KV cache فوق أوزان النموذج: نموذج 7B عند Q4_K_M هو 4.7 GB من الأوزان -- لكن مع نافذة سياق 32K، يضيف KV cache ~4 GB أخرى، بإجمالي ~8.7 GB. على بطاقة 8 GB يسبب هذا أخطاء OOM. أضف دائمًا 25-100% إلى حجم النموذج حسب طول السياق.
- معاملة تكلفة العتاد كالتكلفة الوحيدة: إذا لم تستطع تحمل 16+ GB ذاكرة أو GPU مخصصة، تكلف واجهات API السحابية أقل للاستخدام منخفض الحجم ($0.01–0.05 لكل 1K رمز). راجع LLM المحلي مقابل السحابي: تحليل التكلفة للمفاضلة الكاملة.
ما قواعد الامتثال الإقليمية التي تنطبق على عتاد LLM المحلي؟
الاتحاد الأوروبي (GDPR + قانون الذكاء الاصطناعي الأوروبي): يبقي تشغيل نماذج LLM محليًا جميع بيانات الاستدلال داخل بنيتك التحتية، ما يلغي مخاوف نقل البيانات عبر الحدود بموجب المادة 44 من GDPR. كانت التزامات قانون الذكاء الاصطناعي الأوروبي لأنظمة الذكاء الاصطناعي عالية المخاطر المستقلة (الملحق III) محددة أصلًا لتطبق من 2 أغسطس 2026، لكن "Digital Omnibus on AI" — المتفق عليه مبدئيًا في مايو 2026 والذي ينتظر الاعتماد الرسمي اعتبارًا من يونيو 2026 — يؤجل ذلك التاريخ إلى 2 ديسمبر 2027 (مع تأجيل الذكاء الاصطناعي عالي المخاطر المضمّن في منتجات منظمة إلى 2 أغسطس 2028). لا تزال واجبات الشفافية في المادة 50 من القانون تنطبق وفق الجدول الأصلي. يلبي العتاد المحلي متطلبات إقامة البيانات افتراضيًا.
اليابان (APPI): شدّد تعديل APPI لعام 2022 في اليابان قواعد الإخطار بالخروقات والنقل عبر الحدود لكنه لا يفرض متطلب تقليل بيانات خاصًا بالذكاء الاصطناعي (يعتمد على واجبات تحديد الغرض العامة). الأكثر صلة بالذكاء الاصطناعي هي حزمة إصلاح APPI لعام 2025 في اليابان وأول قانون ذكاء اصطناعي لها — قانون تعزيز الذكاء الاصطناعي (ساري منذ يونيو 2025)، إطار يضع الابتكار أولًا دون عقوبات. يبقي عتاد LLM المحلي البيانات الشخصية داخل بنيتك التحتية لمعالجة المستندات وأتمتة دعم العملاء.
الصين: تتطلب التدابير المؤقتة لخدمات الذكاء الاصطناعي التوليدي الصادرة عن إدارة الفضاء السيبراني الصينية (CAC) (سارية من أغسطس 2023) من المزودين ذوي التأثير على الرأي العام إكمال تقييم أمني من CAC وتسجيل الخوارزمية. منذ 1 سبتمبر 2025، تفرض الصين أيضًا وسم المحتوى المولّد بالذكاء الاصطناعي بموجب تدابير الوسم من CAC والمعيار الوطني GB 45438-2025. يتجنب تشغيل عتاد محلي بنماذج مفتوحة الأوزان تعرّض الامتثال القائم على API للاستخدام المؤسسي الداخلي.
أسئلة شائعة حول عتاد LLM المحلي
هل يمكنني تشغيل نموذج 70B على حاسوب محمول؟
فقط مع تكميم ثقيل (Q2، 2-بت) واحتياط CPU. غير عملي. الحواسيب المحمولة مناسبة لنماذج 7B. لـ 70B، استخدم حاسوبًا مكتبيًا مع RTX 4090+.
هل RTX 4090 مبالغ فيها للاستخدام الشخصي؟
ليس إذا كنت تشغّل نماذج 70B أو نماذج متعددة في آن واحد. لمجرد محادثة 7B، تكفي RTX 4070 Ti. RTX 4090 مقاومة للتقادم إذا أردت مرونة.
هل أشتري RTX 5090 أم أنتظر RTX 6090؟
RTX 5090 متوفرة (أوائل 2026). بطاقات RTX 6000 Ada للخوادم متينة أيضًا. ما لم تكن لديك ميزانية غير محدودة، فإن RTX 5090 أو 4090 ممتازتان.
كيف يؤثر التكميم على الجودة؟
FP16 = 100% جودة (الأساس)، Q8 = 99%، Q5 = 95%، Q4 = 90-95%. لمعظم المهام، Q4 لا يمكن تمييزه عن FP16.
هل يمكنني ترقية GPU لاحقًا؟
نعم. ابدأ بـ RTX 4070 Ti الآن، ورقِّ إلى RTX 5090 خلال سنتين إذا لزم الأمر. GPU هو أكثر المكونات قابلية للاستبدال.
كم أحتاج من الذاكرة لتشغيل نموذج 7B محليًا؟
8 GB ذاكرة هو الحد الأدنى المطلق لنموذج 7B. يُوصى بـ 16 GB للاستخدام المريح إلى جانب المتصفح ونظام التشغيل. يمنح 32 GB هامشًا لنوافذ سياق أكبر وتعدد المهام.
هل يمكنني تشغيل نماذج LLM المحلية على Apple Silicon (M1/M2/M3/M4/M5)؟
نعم. تستخدم Apple Silicon ذاكرة موحدة مشتركة بين CPU وGPU. يشغّل M5 Pro (64 GB، 307 GB/s) نماذج 32B جيدًا. يشغّل M5 Max (128 GB، حتى 614 GB/s) نماذج 70B عند Q4_K_M بسرعة نحو 12-15 tok/sec. على Mac بذاكرة 8 GB، التزم بنماذج 3-4B.
ما أفضل نماذج llama.cpp لـ MacBook بمعالج M3 وذاكرة 8 GB؟
على MacBook M3 بذاكرة 8 GB، شغّل نماذج 3-4B عند Q4_K_M: Phi-4 Mini 3.8B أو Llama 3.2 3B أو Gemma 3 4B. استخدم Ollama أو llama.cpp — كلاهما يستخدم خلفية Metal GPU تلقائيًا. نموذج 7B على الحافة وسيستخدم التبديل تحت الحمل؛ أبقِ السياق دون 4096 رمزًا. للاستخدام المريح لنماذج 7-8B على Mac، 16 GB ذاكرة موحدة هو الحد الأدنى العملي.
أي CPU هو الأفضل لنماذج LLM المحلية دون GPU؟
معالجات عالية عدد الأنوية بذاكرة L3 كبيرة: AMD Ryzen 9 7950X أو Intel Core i9-14900K. توقّع 5-15 رمز/ثانية لنماذج 7B. استدلال CPU أبطأ 3-5× من GPU.
هل تؤثر سرعة التخزين على أداء LLM المحلي؟
نعم، عند وقت تحميل النموذج. يحمّل NVMe SSD (3-7 GB/s) نموذج 7B في 2-5 ثوانٍ مقابل 20-60 ثانية على HDD. سرعة الاستدلال بعد التحميل لا تتأثر بالتخزين.
هل يمكنني استخدام بطاقات GPU متعددة لتشغيل نماذج أكبر؟
نعم، عبر التوازي الموتري. توفر بطاقتا RTX 5090 (32 GB لكل منهما) 64 GB VRAM، تكفي لنموذج 70B عند Q4_K_M. يدعم Ollama وllama.cpp تعدد GPU عبر --n-gpu-layers موزّعة على البطاقات.
ما أفضل نماذج LLM المحلية لـ 16 GB VRAM في 2026؟
Mistral Small 3.1 24B Q4_K_M (13 GB، 55 tok/sec) هو الأفضل إجمالًا لـ RTX 5080 / RTX 5070 Ti / RTX 4090 لحاسوب محمول. للبرمجة الوكيلة: Devstral Small 24B Q4_K_M (16 GB، 45 tok/sec). للاستدلال: DeepSeek-R1 14B (15 GB، 40 tok/sec). يُعد Mistral Small 4 الأحدث (مارس 2026) الخليفة ذا النموذج الواحد. لا يتسع Llama 3.3 70B -- يتطلب ~40 GB عند Q4_K_M.
هل يمكن لـ RTX 4090 واحدة تشغيل نموذج 70B بجودة جيدة؟
لا -- ليس بجودة Q4_K_M. يتطلب Llama 3.3 70B عند Q4_K_M ~39 GB VRAM. تملك RTX 4090 سعة 24 GB. يمكنك تشغيله عند Q2_K (~24 GB) لكن الجودة تنخفض بشكل ملحوظ. خيارات أفضل: Qwen 3.6 27B Q4_K_M (~16 GB، 77.2% SWE-bench، أفضل برمجة كثيفة) أو DeepSeek-R1 32B Q4_K_M (~19 GB، أفضل استدلال).
ما أفضل نموذج LLM محلي لذاكرة نظام 16 GB دون GPU؟
Phi-4 Mini 3.8B Q4_K_M (2.5 GB ذاكرة، ~25 tok/sec على Ryzen 9 7950X) هو أفضل خيار للاستدلال على CPU فقط بذاكرة نظام 16 GB. Gemma 2 2B Q8 هو الأسرع عند ~28 tok/sec. يتسع Llama 3.1 8B Q4_K_M (4.9 GB) أيضًا لكنه يعمل بسرعة ~12 tok/sec -- بطيء للاستخدام التفاعلي.
ما قاعدة الذاكرة العملية لنموذج 7B بتكميم Q4؟
نموذج 7B بتكميم Q4_K_M يحتاج نحو 4-5 GB من VRAM (أو ذاكرة النظام للاستدلال على CPU فقط) -- تقريبًا 0.6 GB لكل مليار معامل عند دقة 4-بت. يتوسع هذا خطيًا: نموذج 14B يحتاج ~9 GB، ونموذج 32B يحتاج ~19 GB، ونموذج 70B يحتاج ~40 GB، جميعها عند Q4_K_M.
ما العتاد الذي أحتاجه لتشغيل GLM-5.2 محليًا؟
GLM-5.2 (من Z.ai، صدر في يونيو 2026) هو نموذج MoE بـ744B معامل مع 40B معامل نشط لكل رمز. حتى GGUF الديناميكي الأكثر عدوانية بتكميم 2-بت يحتاج ~239 GB من VRAM/RAM مجتمعة -- أكبر من أن تتسع في RTX 5090 واحدة (32 GB)، أو DGX Spark بسعة 128 GB، أو Mac Studio بسعة 128 GB. المسارات المحلية الواقعية هي نظام 4× RTX 3090/4090 بذاكرة نظام 192 GB+، أو Mac Studio بسعة 256 GB+، وكلاهما يعمل بسرعة تقارب 3-9 رمز/ثانية عبر إزاحة هجينة CPU/GPU. بالنسبة لمعظم المستخدمين، GLM-5.2 هو عمليًا نموذج سحابي فقط.
المصادر
- NVIDIA. (2026). "GeForce GPU Specifications." https://www.nvidia.com/en-us/geforce/graphics-cards/ -- مواصفات VRAM وعرض النطاق الرسمية لبطاقات RTX 40-series وRTX 50-series.
- Apple. (2026). "Apple M5 Chip." https://www.apple.com/mac/ -- مواصفات M5 Pro/Max، عرض نطاق الذاكرة، ادعاءات أداء LLM. M5 هو أول Mac يشغّل نماذج 70B عند Q4_K_M بشكل مريح.
- NVIDIA. (2025). "DGX Spark Product Page." https://www.nvidia.com/en-us/products/workstations/dgx-spark/ -- مواصفات رسمية لشريحة GB10 Grace Blackwell Superchip والذاكرة الموحدة 128 GB.
- Meta AI. (2024). "Llama 3.3 Model Card." https://llama.meta.com/ -- مواصفات Llama 3.3 70B الرسمية ومتطلبات VRAM.
- Meta AI. (2025). "Llama 4 Model Card." https://llama.meta.com/ -- بنية Llama 4 Scout/Maverick MoE، متطلبات VRAM.
- Z.ai. (2026). "GLM-5.2: Built for Long-Horizon Tasks." https://huggingface.co/blog/zai-org/glm-52-blog -- بطاقة نموذج GLM-5.2 الرسمية: بنية MoE بـ744B إجمالي / 40B نشط، ترخيص MIT، تاريخ الإصدار.
