Skip to main content
PromptQuorum
Home/Local LLMs/دليل النشر المحلي لـ Qwen 2026: Qwen 3.6 27B وCoder وVL على كل مستوى أجهزة
Qwen Models

دليل النشر المحلي لـ Qwen 2026: Qwen 3.6 27B وCoder وVL على كل مستوى أجهزة

·14 دقيقة قراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

تحتوي هذه الصفحة على روابط مرجعية لمنتجات طرف ثالث. لا يشارك PromptQuorum في أي برنامج تابع — هذه روابط عادية لا تدر أي عمولة. النقر على الروابط والخطوات التالية تقع على عاتقك بالكامل. لا تمثل هذه الروابط أي تأييد أو تحقق من قِبَل PromptQuorum.

الاختيار الرائد الجديد هو Qwen 3.6 27B — نموذج كثيف برخصة Apache 2.0 ونافذة سياق 256K يعمل بـ ~17 GB من VRAM عند Q4_K_M عبر `ollama run qwen3.6:27b`. لإعداد أخف، ثبّت Ollama ونفّذ `ollama pull qwen2.5:7b` لتشغيل Qwen3 8B — يتطلب 5.5 GB من VRAM ويقدّم 57 token/ثانية على RTX 3060. لمهام الكود استخدم Qwen2.5-Coder؛ ولـ OCR للمستندات الصينية/اليابانية استخدم Qwen2-VL. هل تعرف بالفعل ميزانية VRAM لديك؟ انتقل مباشرة إلى بطاقة الرسوم أو جهاز Mac المناسب لكل مستوى من Qwen.

Qwen 3.6 27B هو الاختيار الرئيسي الجديد للنشر المحلي — نموذج كثيف بترخيص Apache 2.0 وسياق 256K، يعمل بـ ~17 GB VRAM عبر `ollama run qwen3.6:27b`. يعمل Qwen3 8B بـ 5.5 GB فقط من VRAM عبر Ollama — أمر واحد، بلا إعداد. يحقق Qwen2.5-Coder 32B نسبة 92.7% في HumanEval. وQwen2-VL 7B هو نموذج الرؤية المحلي الرائد لـ OCR للمستندات الصينية واليابانية. يغطي هذا الدليل عائلة نماذج Qwen الكاملة: أي نموذج تشغّل على كل مستوى أجهزة، والإعداد عبر Ollama وLM Studio، وتوصيات التكميم، وبيانات المعايير، وكيف يقارن Qwen بـ DeepSeek وLlama على الأجهزة الاستهلاكية في 2026.

العرض التقديمي: دليل النشر المحلي لـ Qwen 2026: Qwen 3.6 27B وCoder وVL على كل مستوى أجهزة

يغطي العرض التقديمي أدناه: الاختيار الرائد الجديد Qwen 3.6 27B (سياق 256K، ~17 GB عند Q4_K_M)، وعائلة نماذج Qwen الكاملة (Qwen3 من 0.6B إلى 32B، وQwen2.5 من 7B إلى 72B)، ومتطلبات VRAM حسب مستوى الأجهزة، وبيانات معيار Qwen3-Coder 32B، وجدول قرار Qwen مقابل DeepSeek مقابل Llama. نزّله كبطاقة مرجعية لنشر Qwen.

تصفّح الشرائح أدناه أو نزّلها بصيغة PDF للرجوع إليها دون اتصال. تنزيل البطاقة المرجعية (PDF)

دليل النشر المحلي لـ Qwen 2026: Qwen 3.6 27B وCoder وVL على كل مستوى أجهزة

Key Takeaways

  • Qwen 3.6 27B هو الاختيار الرائد الجديد: كثيف، Apache 2.0، سياق 256K، ~17 GB من VRAM عند Q4_K_M عبر `ollama run qwen3.6:27b` (صدر في أبريل 2026).
  • يعمل Qwen3 8B بـ 5.5 GB من VRAM — أمر واحد `ollama pull qwen2.5:7b` وينطلق بـ 57 token/ثانية على RTX 3060.
  • أربع عائلات فرعية عملية: Qwen3 (استخدام عام، وضع استدلال)، Qwen2.5 (استخدام عام، الأكثر اختبارًا)، Qwen2.5-Coder (برمجة، 92.7% في HumanEval على 32B)، Qwen2-VL (رؤية، أفضل OCR محلي لـ CJK).
  • بنية كثيفة = متوافقة مع الأجهزة الاستهلاكية: على عكس نموذج MoE بحجم 236B لـ DeepSeek (~130 GB من RAM)، يتسع Qwen2.5-72B في 46 GB من VRAM على بطاقتي RTX 3090.
  • متعدد اللغات أصليًا: مدرَّب مسبقًا على الصينية واليابانية والكورية والعربية والألمانية والفرنسية و23 لغة أخرى — يتفوق Qwen3 باستمرار على Llama 3.3 في مهام CJK.
  • Q4_K_M هو التكميم الصحيح لمعظم المستخدمين: تقليل VRAM بنحو 55%، أقل من 1% فقدان جودة في المعايير.
  • قرار الأجهزة: 12 GB من VRAM ← نموذج 14B؛ 24 GB ← 32B؛ 48 GB+ (بطاقتا رسوم أو Apple Silicon 64 GB) ← 72B.

يغطي Qwen3 ثلاث عائلات فرعية للنشر المحلي — استخدام عام (7B–72B) وبرمجة (Coder 7B–32B) ورؤية (VL 7B–72B) — جميعها قابلة للتشغيل عبر Ollama أو LM Studio.

تشغيل نموذج محليًا يعني أن الذكاء الاصطناعي يعمل على حاسوبك بدلًا من خادم سحابي. لا تغادر أي بيانات جهازك ولا توجد تكلفة لكل token بعد اقتناء الأجهزة.

نظرة عامة على عائلة نماذج Qwen

تضم تشكيلة Qwen الآن خمسة خيارات عملية: الرائد Qwen 3.6 27B، وعائلة Qwen3 الأحدث، وQwen2.5 للاستدلال العام، وQwen2.5-Coder، وQwen2-VL للرؤية — لكل منها خيارات أحجام متعددة. جميعها نماذج ذات أوزان مفتوحة نشرها فريق Qwen التابع لـ Alibaba على Hugging Face بموجب ترخيص Apache 2.0.

اختر العائلة الفرعية أولًا ثم الحجم الذي يلائم VRAM لديك. من المعتاد دمج العائلات الفرعية: Qwen2.5-Coder 14B لإكمال الكود وQwen3 8B أو Qwen 3.6 27B لتلخيص المستندات.

Subfamilia
Tamaños disponibles
Uso principal
Prefijo de etiqueta Ollama
Qwen30.6B، 1.7B، 4B، 8B، 14B، 32Bالاستدلال العام، وضع الاستدلال، متعدد اللغات، المهام الوكيليةqwen3:
Qwen2.57B، 14B، 32B، 72Bالاستدلال العام، المهام بالصينية/متعددة اللغات، RAGqwen2.5:
Qwen2.5-Coder7B، 14B، 32Bتوليد الكود، التصحيح، HumanEval، SWE-benchqwen2.5-coder:
Qwen2-VL2B، 7B، 72BOCR للمستندات، الأسئلة عن الصور، استخراج نص CJKqwen2-vl:

Qwen 3.6 27B (صدر في أبريل 2026) هو الاختيار الرائد الجديد — نموذج كثيف بنافذة سياق 256K يعمل بـ ~17 GB من VRAM عند Q4_K_M عبر `ollama run qwen3.6:27b`. تظل Qwen2.5 العائلة الأكثر اختبارًا، بأوسع تغطية في Ollama وGGUF حتى منتصف 2026. راجع أفضل نماذج LLM المحلية 2026 لمقارنة أوسع.

متطلبات الأجهزة حسب حجم النموذج

اختر مستوى VRAM لديك أولًا ثم أكبر نموذج Qwen3 يتسع. Q4_K_M هو التكميم القياسي المستخدم في جميع الأرقام أدناه — يقدّم أفضل نسبة حجم/جودة لـ Ollama وLM Studio.

Modelo
VRAM
GPU mínima
Apple Silicon
Velocidad (RTX 3060)
Qwen3 8B Q4_K_M5.5 GBRTX 3060 6 GB، RTX 4060M1/M2 8 GB~57 tok/s
Qwen3-Coder 7B Q4_K_M5.5 GBRTX 3060 6 GB، RTX 4060M1/M2 8 GB~55 tok/s
Qwen2-VL 7B Q4_K_M6.2 GBRTX 3060 8 GB، RTX 4060M1/M2 16 GB
Qwen3 14B Q4_K_M9.5 GBRTX 4070 12 GBM2 Pro 16 GB
Qwen3-Coder 14B Q4_K_M9.5 GBRTX 4070 12 GBM2 Pro 16 GB
Qwen3 32B Q4_K_M20.5 GBRTX 3090 24 GBM3 Max 48 GB
Qwen3-Coder 32B Q4_K_M20.5 GBRTX 3090 24 GBM3 Max 48 GB
Qwen 3.6 27B Q4_K_M~17 GBRTX 4090 24 GBM3 Max 36 GB
Qwen2.5-72B Q4_K_M46 GB2× RTX 3090 (48 GB)M2 Ultra 64 GB

أرقام VRAM تخصّ ملفات GGUF Q4_K_M من مكتبة Ollama. أضف 1–2 GB لذاكرة KV المؤقتة بسياق 4K. إذا كانت بطاقة الرسوم تملك VRAM أقل مما يحتاج النموذج، يفرّغ Ollama الطبقات تلقائيًا إلى RAM النظام — يعمل، لكنه يقلّل السرعة بشكل كبير.

متطلبات VRAM لـ Qwen3 حسب حجم النموذج (Q4_K_M) — PromptQuorum 2026
متطلبات VRAM لـ Qwen3 حسب حجم النموذج (Q4_K_M) — PromptQuorum 2026

💡نصيحة: هل حددت مستوى VRAM الخاص بك؟ اطّلع على بطاقة الرسوم أو جهاز Mac المناسب تمامًا لهذا المستوى — 6 GB ← RTX 4060، 12 GB ← RTX 4070 Super، 24 GB ← RTX 3090/4090، 48 GB فأكثر ← Mac mini M5 Pro أو بطاقتا رسوم.

الإعداد عبر Ollama

Ollama هو أسرع طريقة لتشغيل أي نموذج Qwen3 محليًا — يدير تنزيل النموذج وتكميم GGUF وواجهة API المحلية على `localhost:11434` دون أي إعداد. ثبّته من ollama.com. إذا لم تستخدم Ollama من قبل، اقرأ أولًا كيفية تثبيت Ollama.

  1. 1
    ثبّت Ollama
    Why it matters: متاح لـ macOS وLinux (تثبيت بسطر واحد) وWindows. لا حاجة لإعداد تعريفات بطاقة الرسوم — يكتشف Ollama CUDA وROCm وMetal تلقائيًا.
  2. 2
    نزّل النموذج بوسم حجم صريح
    Why it matters: حدّد الحجم دائمًا: `qwen2.5:7b`، `qwen2.5:14b`، `qwen2.5:32b`. يُحل `qwen2.5` غير الموسوم إلى نموذج 7B، لكنه قد يتغير بين إصدارات Ollama.
  3. 3
    شغّل النموذج
    Why it matters: `ollama run qwen2.5:7b` يفتح دردشة تفاعلية. اكتب أمرك واضغط Enter. أغلق بـ `/bye`.
  4. 4
    اضبط نافذة السياق عند الحاجة
    Why it matters: يدعم Qwen3 افتراضيًا سياق 32K في Ollama. لاستخدام سياق 128K على نموذج 7B، نفّذ `ollama run qwen2.5:7b --num-ctx 131072`. يتطلب هذا مزيدًا من VRAM.
  5. 5
    اختبر نقطة نهاية API
    Why it matters: يكشف Ollama واجهة API متوافقة مع OpenAI. تتصل تطبيقات مثل PromptQuorum وContinue.dev وOpen WebUI مباشرة بـ `http://localhost:11434/v1`.
bash
# Instalar Ollama (Linux)
curl -fsSL https://ollama.com/install.sh | sh

# macOS: descarga el .dmg desde ollama.com o:
brew install ollama

# Descargar modelos — usa etiquetas explícitas
ollama pull qwen3.6:27b          # insignia, contexto 256K (~17 GB)
ollama pull qwen3:8b             # Qwen3 uso general 8B (~5,5 GB)
ollama pull qwen2.5:7b           # Qwen2.5 uso general 7B (~5,5 GB)
ollama pull qwen2.5:14b          # Qwen2.5 uso general 14B (~9,5 GB)
ollama pull qwen2.5:32b          # Qwen2.5 uso general 32B (~20,5 GB)
ollama pull qwen2.5-coder:32b    # Qwen2.5-Coder 32B (~20,5 GB)
ollama pull qwen2-vl:7b          # visión 7B (~6,2 GB)

# Ejecutar en modo interactivo
ollama run qwen2.5:7b

# Probar la API compatible con OpenAI
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen2.5:7b","messages":[{"role":"user","content":"Hola"}]}'

الإعداد عبر LM Studio

يقدّم LM Studio واجهة رسومية لـ Qwen3 دون الحاجة إلى أوامر طرفية. نزّله من lmstudio.ai أو راجع كيفية تثبيت LM Studio. يعمل على macOS وWindows وLinux.

  1. 1
    افتح متصفح النماذج
    Why it matters: ابحث عن "Qwen3" أو "Qwen Coder" لاستكشاف جميع بناءات GGUF المتاحة. رشّح حسب Q4_K_M للحصول على نسبة الجودة/الحجم الموصى بها.
  2. 2
    نزّل بناء GGUF
    Why it matters: اختر متغير Q4_K_M. يعرض LM Studio حجم الملف قبل التنزيل — تأكد من أنه يتسع في VRAM المتاح.
  3. 3
    حمّل النموذج وابدأ الدردشة
    Why it matters: انقر على النموذج في الشريط الجانبي الأيسر لتحميله في الذاكرة. توزيع الطبقات على بطاقة الرسوم تلقائي حسب VRAM المكتشف.
  4. 4
    ابدأ الخادم المحلي
    Why it matters: "بدء الخادم" يكشف نقطة نهاية متوافقة مع OpenAI على `localhost:1234`. تتصل به تطبيقاتك ونصوصك كما لو كان API الخاص بـ OpenAI.

التكميم: أي تنسيق تختار

Q4_K_M هو القيمة الافتراضية الصحيحة لـ Qwen3 على الأجهزة الاستهلاكية. يقلّل VRAM بين 55–60% مقارنةً بـ FP16 مع أقل من 1% تدهور في MMLU وHumanEval. للتنسيقات الأخرى حالات استخدام محددة:

Q4_K_M هو أفضل تكميم لـ Qwen3 لمعظم المستخدمين: يقلّل VRAM بنسبة 55% مع أقل من 1% فقدان جودة مقارنةً بـ FP16.

يضغط التكميم أرقام النموذج من 16 بت إلى 4 بت، فيقلّل حجم الملف وVRAM المطلوب إلى النصف تقريبًا. الأمر أشبه بالانتقال من TIFF إلى JPEG عالي الجودة — ملف أصغر، ونتيجة شبه متطابقة لمعظم الاستخدامات.

  • Q4_K_M (موصى به): ~5.5 GB لـ 7B. أفضل نسبة جودة لكل GB. ابدأ بهذا.
  • Q8_0: ~8.5 GB لـ 7B. جودة قريبة من FP16؛ استخدمه إذا كان لديك فائض VRAM وتريد أقصى دقة.
  • Q5_K_M: ~6.5 GB لـ 7B. تحسّن هامشي على Q4_K_M — اخترْه فقط إذا كانت جودة مخرجات Q4_K_M ضعيفة بوضوح لمهمتك.
  • Q2_K: ~3 GB لـ 7B. أصغر ملف، لكن جودة المخرجات بالصينية تتدهور بشكل ملحوظ — تجنّبه مع Qwen3 إذا كانت الصينية جزءًا من حالة استخدامك.
  • IQ4_XS: ~4.8 GB لـ 7B. تكميم imatrix أحدث يتفوق على جودة Q4_K_M بحجم أصغر قليلًا — متاح في إصدارات حديثة من llama.cpp وLM Studio 0.3+.

أداء المعايير على الأجهزة الاستهلاكية

يقدّم Qwen3 32B Q4_K_M على RTX 4090 سرعة 28 token/ثانية — سرعة كافية للمساعدة البرمجية في الوقت الفعلي. الدرجات أدناه تخصّ بناءات GGUF Q4_K_M المختبرة في Ollama. درجات FP16 أعلى بـ 1–2%.

Modelo (Q4_K_M)
MMLU
Math
HumanEval
Velocidad (RTX 3060 12 GB)
Qwen3 8B74.2%58.8%57.3%57 tok/s
Qwen3 14B79.9%69.8%64.6%
Qwen3 32B83.3%79.5%71.3%
Qwen2.5-72B86.1%83.1%73.2%
Qwen3-Coder 7B75.6%55 tok/s
Qwen3-Coder 14B85.2%
Qwen3-Coder 32B92.7%
درجات معيار Qwen3 (Q4_K_M) — PromptQuorum 2026
درجات معيار Qwen3 (Q4_K_M) — PromptQuorum 2026

💡نصيحة: هل تريد تحقيق درجة 92.7% في HumanEval بسرعة 27 token/ثانية؟ اطّلع على بطاقة الرسوم بسعة 24 GB التي تشغّل Qwen3-Coder 32B.

Qwen مقابل DeepSeek مقابل Llama: ماذا تشغّل محليًا

يفوز Qwen3 في المهام بالصينية وكفاءة VRAM؛ ويفوز DeepSeek-V2.5 في الاستدلال واسع النطاق لكنه غير عملي على الأجهزة الاستهلاكية؛ وLlama 3.3 70B هو الخيار الأفضل على بطاقة رسوم واحدة إذا كنت تفضّل النموذج المفتوح من Meta. يقارن الجدول أدناه الخيارات العملية في كل مستوى VRAM.

Nivel de VRAM
Mejor Qwen
Mejor competidor
Veredicto
6 GBQwen3 8BLlama 3.2 3B (يتسع، لكنه 3B فقط)يفوز Qwen3 8B — نفس VRAM، نموذج أكبر بكثير
12 GBQwen3-Coder 14BLlama 3.1 8B InstructQwen3-Coder 14B للكود؛ Llama 3.1 8B للدردشة العامة
24 GBQwen3-Coder 32BLlama 3.3 70B (مع تفريغ)Qwen3-Coder 32B للكود؛ Llama 3.3 70B إذا كانت الجودة > السرعة
48 GB+Qwen2.5-72BDeepSeek-V2.5 236B MoEيحتاج DeepSeek إلى ~130 GB من RAM؛ Qwen2.5-72B هو الخيار العملي لـ 48 GB

المستخدمون الناطقون بالعربية: سيادة البيانات والنشر المحلي

تشغيل Qwen3 محليًا يعني أن أي بيانات لا تغادر جهازك — لا نقل إلى خوادم سحابية، ولا تعرّض بموجب GDPR أو قوانين حماية البيانات في الخليج. تتطلب واجهات API لنماذج LLM السحابية إرسال الأوامر إلى خوادم خارجية، مما يُفعّل متطلبات معالجة البيانات وعمليات النقل الدولية المحتملة.

دُرّب Qwen3 على يد فريق Qwen التابع لـ Alibaba على مجموعة نصية صينية ومتعددة اللغات في الغالب. وهو أقوى نموذج بنشر محلي للمستندات بالصينية المبسّطة والتقليدية والنصوص المختلطة (صينية/عربية/إنجليزية).

لعمليات النشر في الشركات الناطقة بالعربية: إعداد Qwen3 دون اتصال بالإنترنت أثناء الاستدلال متوافق تمامًا مع الأطر التنظيمية في السعودية (PDPL) والإمارات (قانون حماية البيانات) ودول الخليج الأخرى. يعمل النموذج بالكامل على أجهزة محلية — لا يصل أي طرف ثالث إلى بيانات الإدخال أو الإخراج. كما تتوفر بدائل عربية سيادية مثل Jais وALLaM للمؤسسات التي تفضّل نماذج عربية المنشأ. راجع تشغيل الذكاء الاصطناعي دون اتصال بالكامل للحصول على دليل كامل للإعداد المعزول.

يعمل Qwen3 دون اتصال بالكامل بعد التنزيل — لا تغادر أي بيانات جهازك، مما يلغي مخاطر نقل البيانات عبر الحدود بموجب GDPR وقوانين الخليج.

عندما تشغّل Qwen3 محليًا، لا تغادر أوامرك ومستنداتك حاسوبك أبدًا. لا استدعاءات إلى API سحابي، ولا خادم خارجي، ولا بيانات يمكن للجهات التنظيمية أو الأطراف الثالثة الوصول إليها.

ما الجهاز الذي ينبغي شراؤه لنشر Qwen3؟

طابِق مستوى Qwen المستهدف مع VRAM المطلوب أولًا، ثم اشترِ أرخص بطاقة تحقّق هذا الحد — دفع ثمن VRAM أكثر مما يحتاجه نموذجك هو أكثر أخطاء الإنفاق شيوعًا في هذه القائمة. تتوافق الاختيارات أدناه مباشرة مع جدول الأجهزة أعلاه: اقتصادي ← RTX 4060، متوسط ← RTX 4070 Super، فئة عليا ← RTX 3090/4090، Apple Silicon ← Mac mini M5 Pro، تشغيل متواصل ← حاسوب صغير. تعكس الأسعار أدناه سوق بطاقات الرسوم في 2026 — أدى نقص رقائق الذاكرة والطلب من مراكز بيانات الذكاء الاصطناعي إلى ارتفاع أسعار بطاقات الرسوم الجديدة وتشكيلات ذاكرة Apple؛ تحقّق من السعر الفعلي قبل الشراء.

💡نصيحة: تخطَّ هذا القسم إذا كنت تملك بالفعل بطاقة رسوم بسعة 8 GB من VRAM أو أكثر — شغّل Qwen3 8B أولًا على ما تملكه. اشترِ جهازًا جديدًا فقط بعد بلوغ هذا الحد ورغبتك في نموذج أكبر.

1

NVIDIA RTX 4060 8 GB

اختيار اقتصادي — Qwen3 8B وQwen3-Coder 7B (5.5 GB VRAM)

أرخص بطاقة في هذه القائمة تحقّق متطلب 5.5 GB لـ Qwen3 8B مع هامش للسياق. تشغّل Qwen3-Coder 7B بسرعة ~55 token/ثانية — سرعة كافية للمساعدة البرمجية التفاعلية.

الإيجابيات

  • +يتحقق متطلب 5.5 GB من VRAM مع هامش لذاكرة KV المؤقتة للسياق الطويل
  • +أقل سعر في هذه القائمة — بطاقة الرسوم الأولى المناسبة إذا لم تشغّل نموذج LLM محليًا من قبل
  • +50–57 token/ثانية على نماذج 7B/8B، بأداء مماثل للبطاقات الأغلى عند هذا الحجم من النماذج

السلبيات

  • يقتصر على Qwen3 8B / Qwen3-Coder 7B — لا هامش للانتقال إلى 14B دون ضغط ذاكرة KV المؤقتة
تحقّق من السعر الحالي ←رابط منتج · مُفصح عنه
2

NVIDIA RTX 4070 Super 12 GB

اختيار متوسط — Qwen3 14B وQwen3-Coder 14B (9.5 GB VRAM)

تشغّل Qwen3-Coder 14B (85.2% في HumanEval) بسرعة 36–38 token/ثانية مع بقاء 2–3 GB من VRAM للسياق — المستوى الذي تقفز فيه جودة البرمجة بشكل ملحوظ مقارنةً بنماذج 7B/8B.

الإيجابيات

  • +يتسع النموذج بحجم 9.5 GB مع بقاء 2–3 GB من VRAM — مساحة لنوافذ سياق أطول
  • +ترتفع نتيجة HumanEval من 75.6% (7B) إلى 85.2% (14B) — أوضح قفزة في الجودة مقابل السعر ضمن هذه المجموعة
  • +تحافظ سرعة ~38 token/ثانية على استجابة الدردشة التفاعلية وإكمال الكود

السلبيات

  • لا يكفي VRAM لمستوى 32B — خطّط للبيع أو إعادة الاستخدام إذا تجاوزت 14B
تحقّق من السعر الحالي ←رابط منتج · مُفصح عنه
3

NVIDIA RTX 4090 24 GB (أو RTX 3090 24 GB مستعملة)

اختيار فئة عليا — Qwen3-Coder 32B وQwen 3.6 27B (~17–20.5 GB VRAM)

تقدّم 4090 سرعة 27–28 token/ثانية على Qwen3-Coder 32B — سرعة برمجة في الوقت الفعلي بدرجة 92.7% في HumanEval. تملك RTX 3090 المستعملة نفس سعة 24 GB من VRAM، وتقترب من سرعة استدلال 4090 بفارق نحو 15% فقط، بسعر أقل بكثير إذا وجدت عرضًا مستعملًا موثوقًا.

الإيجابيات

  • +تغطي سعة 24 GB من VRAM جميع إصدارات Qwen3 32B وQwen 3.6 27B مع هامش إضافي
  • +27–28 token/ثانية على Qwen3-Coder 32B (92.7% في HumanEval) — سريعة بما يكفي للبرمجة الزوجية في الوقت الفعلي
  • +RTX 3090 المستعملة هي البديل الاقتصادي: سقف VRAM نفسه، أبطأ بنحو 15%، وأرخص بشكل ملحوظ مستعملة

السلبيات

  • أعلى تكلفة مبدئية في هذه القائمة — لا تُبرَّر إلا عند الحاجة الفعلية لجودة فئة 32B
تحقّق من السعر الحالي ←رابط منتج · مُفصح عنهاطّلع على العروض المستعملة ←رابط منتج · مُفصح عنه
4

Apple Mac mini M5 Pro 64 GB

اختيار Apple Silicon — Qwen3 32B، هادئ ومنخفض الاستهلاك

أفضل قيمة لتشغيل Qwen3 32B عبر الذاكرة الموحّدة — هادئ، استهلاك طاقة منخفض، ولا حاجة لتركيب بطاقة رسوم منفصلة. أما Qwen2.5-72B فيتطلب M2 Ultra 192 GB بدلًا من ذلك.

الإيجابيات

  • +تتوفر تكوينات M5 Pro بذاكرة موحّدة تصل حتى 64 GB — أعلى بكثير من متطلب 20.5 GB لـ Qwen3 32B، مع مساحة إضافية لتطبيقات أخرى
  • +تشغيل صامت واستهلاك طاقة مناسب لمكتب العمل — دون إدارة تبريد مخصص لبطاقة رسوم
  • +عملية شراء واحدة تغطي نظام التشغيل والتخزين والاستدلال — دون تجميع منفصل لبطاقة رسوم/مزود طاقة/هيكل

السلبيات

  • لا تتوفر بعد اختبارات أداء مستقلة لـ Qwen3 32B على شريحة M5 Pro — توقّع أداءً أبطأ بوضوح من بطاقة رسوم مخصصة مثل RTX 4090، بما يتسق مع أجيال Apple Silicon السابقة في Mac mini
تحقّق من السعر الحالي ←رابط منتج · مُفصح عنه
5

MINISFORUM UM890 Pro (أو حاسوب صغير مماثل بمعالج AMD Ryzen AI)

اختيار للتشغيل المتواصل — Qwen3 8B على CPU + iGPU (~8–12 token/ثانية، أقل من 35 واط)

غير مخصص للاستخدام التفاعلي — بل لتشغيل نسخة من Qwen3 8B على مدار الساعة طوال أيام الأسبوع لمهام خلفية، أو أتمتة المنزل، أو نقطة نهاية API منخفضة الحركة حيث تهم تكلفة الطاقة أكثر من السرعة.

الإيجابيات

  • +استهلاك أقل من 35 واط — رخيص التشغيل المستمر، على عكس تجميعة سطح مكتب ببطاقة رسوم
  • +حجم صغير يناسب أي مكان؛ دون حاجة لبطاقة رسوم منفصلة أو تبريدها
  • +يشغّل Qwen3 8B دون أي بطاقة رسوم مخصصة على الإطلاق

السلبيات

  • سرعة 8–12 token/ثانية بطيئة جدًا للدردشة التفاعلية — اختيار مخصص للاستخدام الخلفي/API فقط
تحقّق من السعر الحالي ←رابط منتج · مُفصح عنه

الأخطاء الشائعة عند تشغيل Qwen3 محليًا

  • استخدام الأمر `ollama pull qwen2.5` دون وسم حجم. بدون وسم حجم صريح (`:7b`، `:14b`، إلخ)، قد يُحل Ollama إلى الحجم الافتراضي، الذي قد يتغير بين تحديثات المكتبة. استخدم دائمًا وسومًا صريحة: `ollama pull qwen2.5:14b`.
  • تجاهل حجم نافذة السياق. يدعم Qwen3 سياق 128K. تحدد مواصفات Modelfile في Ollama القيمة الافتراضية لـ `num_ctx` بـ 2048، لكن وقت التشغيل الفعلي يختار قيمة افتراضية متدرجة حسب VRAM: 4K أقل من 24 GiB، و32K بين 24 و48 GiB، و256K فوق 48 GiB. لا تعتمد على أي من القيمتين الافتراضيتين: اضبط `num_ctx` صراحةً، مثلاً بإضافة `--num-ctx 8192` (أو أكثر) إلى أمر التشغيل — وإلا يقتطع النموذج الإدخال بصمت.
  • اختيار تكميم Q2_K للاستخدام بالصينية. بدقة 2 بت، تتدهور مخرجات Qwen3 بالصينية بشكل ملحوظ. استخدم Q4_K_M كحد أدنى لأي عمل بالصينية.
  • تشغيل نموذج 32B بـ VRAM قليل. إذا كانت بطاقة الرسوم تملك 16 GB والنموذج يحتاج إلى 20.5 GB، يفرّغ Ollama الطبقات إلى RAM النظام. يعمل النموذج لكن بـ 3–5 token/ثانية — غير قابل للاستخدام التفاعلي. راجع جدول الأجهزة واختر نموذجًا يتسع في VRAM لديك.
  • استخدام العائلة الفرعية الخاطئة للبرمجة. يسجّل Qwen3 8B (استخدام عام) 57.3% في HumanEval. ويسجّل Qwen3-Coder 7B نسبة 75.6% في المعيار نفسه — تحسّن نسبي بنسبة 32%. إذا كانت حالة استخدامك هي الكود، استخدم دائمًا متغير Coder بالحجم نفسه.

الخطوات التالية

الأسئلة الشائعة

كم من VRAM أحتاج لتشغيل Qwen3 8B محليًا؟

يتطلب Qwen3 8B Q4_K_M 5.5 GB من VRAM. تكفي RTX 3060 6 GB أو RTX 4060 أو شريحة Apple M بذاكرة موحدة 8 GB.

ما أفضل نموذج Qwen للبرمجة محليًا؟

Qwen3-Coder 32B — 92.7% في HumanEval، يحتاج إلى بطاقة رسوم بسعة 24 GB. بـ 12 GB من VRAM أو أقل: Qwen3-Coder 14B (85.2%، 9.5 GB من VRAM).

كيف يقارن Qwen بـ DeepSeek للنشر المحلي؟

يستخدم Qwen3 بنية كثيفة متوافقة مع الأجهزة الاستهلاكية. DeepSeek-V2.5 نموذج MoE بحجم 236B يحتاج إلى ~130 GB من RAM — غير عملي دون بطاقة رسوم خوادم.

هل يمكنني تشغيل Qwen على جهاز Mac؟

نعم. يشغّل M2 Pro 32 GB نموذج Qwen3 14B بـ ~32 token/ثانية. ويتعامل M3 Max 64 GB مع Qwen3 32B بـ ~22 token/ثانية.

ما أمر Ollama الذي أستخدمه لـ Qwen؟

للنموذج الرائد، `ollama run qwen3.6:27b` (~17 GB من VRAM). لـ Qwen3، `ollama pull qwen3:8b`. لـ Qwen2.5، `ollama pull qwen2.5:7b` لـ 7B، و`:14b` لـ 14B، و`:32b` لـ 32B، أو `qwen2.5-coder:32b` لمتغير البرمجة. استخدم دائمًا وسوم حجم صريحة.

هل Qwen مناسب للمهام باللغة الصينية؟

نعم. دُرّب Qwen3 مسبقًا على مجموعة نصية صينية ضخمة ويدعم أصليًا الصينية المبسّطة والتقليدية واليابانية والكورية و24 لغة أخرى.

أي تكميم ينبغي أن أستخدم لـ Qwen3؟

Q4_K_M افتراضيًا — يقلّل VRAM بنحو 55% مقارنةً بـ FP16 مع أقل من 1% فقدان جودة. تجنّب Q2_K للاستخدام بالصينية.

هل يعمل Qwen2-VL لـ OCR للمستندات الصينية؟

نعم — `ollama pull qwen2-vl:7b`، ~6 GB من VRAM، يقرأ نص CJK بدقات تصل إلى 4096×4096 بكسل.

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text.

وزّع بين Qwen3 وDeepSeek وLlama من واجهة واحدة ←

جرّب PromptQuorum مجانًا

← Back to Local LLMs