Skip to main content
PromptQuorum
الرئيسية/LLM المحلية المتقدمة/مراجعة NVIDIA Dynamo: خدمة الاستدلال بحجم مراكز البيانات
Overview & Reference

مراجعة NVIDIA Dynamo: خدمة الاستدلال بحجم مراكز البيانات

·وقت القراءة 10 دقائق·بقلم Hans Kuepper · مؤسس PromptQuorum، أداة إرسال الذكاء الاصطناعي متعددة النماذج · PromptQuorum

NVIDIA Dynamo هو إطار عمل مجاني ومفتوح المصدر لخدمة الاستدلال الموزّع بحجم مراكز البيانات، يُنسّق محركات استدلال — vLLM وTensorRT-LLM وSGLang — عبر عدة وحدات معالجة رسومية وعقد، بدلاً من تنفيذ الاستدلال بنفسه. وهو موجّه للفرق التي تنشر نماذج اللغة الكبيرة على نطاق واسع في مركز بيانات أو مجموعة سحابية، باستخدام خدمة التهيئة المسبقة/فك التشفير المنفصلة والتوجيه الواعي بذاكرة التخزين المؤقت KV؛ وتوضّح وثائق NVIDIA نفسها صراحةً أن عمليات النشر على وحدة معالجة رسومية واحدة ونموذج واحد لا تحتاج إليه.

NVIDIA Dynamo (github.com/ai-dynamo/dynamo) هو إطار عمل مجاني ومفتوح المصدر لخدمة الاستدلال الموزّع بحجم مراكز البيانات، يُنسّق محركات استدلال مثل vLLM وTensorRT-LLM وSGLang عبر عدة وحدات معالجة رسومية وعقد، وقد تجاوز 8,100 نجمة على GitHub. هذه المراجعة مكمّلة لمدخل NVIDIA Dynamo في دليل برمجيات نماذج اللغة الكبيرة المحلية، وتوضّح ما يقوم به فعليًا، ولمن صُمم، وأين يقع ضمن المشهد التقني — وهذه ليست أداة للهواة الذين يعملون على جهاز واحد.

النقاط الرئيسية

  • NVIDIA Dynamo (github.com/ai-dynamo/dynamo) هو إطار عمل مجاني ومفتوح المصدر لخدمة الاستدلال الموزّع بحجم مراكز البيانات
  • الترخيص: يفيد ملف LICENSE في المستودع بأنه Apache-2.0؛ ويُبلغ حقل بيانات واجهة برمجة تطبيقات GitHub نفسه بشكل منفصل عن NOASSERTION لنفس المستودع — وقد تم التحقق من ذلك مباشرةً مقابل ملف LICENSE
  • يُنسّق محركات استدلال قائمة بالفعل — vLLM وTensorRT-LLM وSGLang — بدلاً من استبدالها
  • التقنيات الأساسية: خدمة التهيئة المسبقة/فك التشفير المنفصلة، والتوجيه الواعي بذاكرة التخزين المؤقت KV، ومدير كتل KV لنقل ذاكرة التخزين المؤقت إلى وحدة المعالجة المركزية/SSD/التخزين البعيد، وأداة تحجيم تلقائي مدفوعة باتفاقيات مستوى الخدمة تُدعى Planner
  • مصمم صراحةً لعمليات النشر متعددة وحدات المعالجة الرسومية والعقد في مركز بيانات أو مجموعة سحابية — توضّح وثائق NVIDIA نفسها أن حالات استخدام وحدة معالجة رسومية واحدة ونموذج واحد لا تحتاج إليه
  • أكثر من 8,100 نجمة على GitHub، وأكثر من 1,590 عملية تفرّع، وعدد كبير من المشكلات المفتوحة (أكثر من 1,500) حتى وقت هذه المراجعة

📍 في جملة واحدة

NVIDIA Dynamo هو إطار عمل مجاني ومفتوح المصدر لخدمة الاستدلال الموزّع بحجم مراكز البيانات، بأكثر من 8,100 نجمة على GitHub، يُنسّق vLLM وTensorRT-LLM وSGLang عبر عدة وحدات معالجة رسومية وعقد باستخدام خدمة التهيئة المسبقة/فك التشفير المنفصلة والتوجيه الواعي بذاكرة التخزين المؤقت KV.

💬 بعبارات بسيطة

NVIDIA Dynamo ليس أداة تشغيل نماذج تُثبّتها على جهاز كمبيوتر محمول — بل هو طبقة تنسيق تضعها الفرق الكبيرة أمام محرك استدلال (مثل vLLM) عندما تشغّل نماذج عبر عدد كبير من وحدات المعالجة الرسومية أو الخوادم في آن واحد، بحيث يتم توجيه الطلبات بكفاءة وتتوسع المجموعة تلقائيًا لتحقيق أهداف زمن الاستجابة.

📌ملاحظة: تستند هذه المراجعة إلى مستودع NVIDIA Dynamo على GitHub ووثائقه الرسمية. أرقام الأداء مثل مضاعفات الإنتاجية المحددة هي معايير أداء نشرتها NVIDIA نفسها، وليست أرقامًا أعاد PromptQuorum إنتاجها بشكل مستقل — تعامل معها كأرقام مُعلَنة من المورّد إلى أن يتم التحقق منها على الأجهزة وأحمال العمل الخاصة بك.

ما هو NVIDIA Dynamo؟

NVIDIA Dynamo هو إطار عمل مجاني ومفتوح المصدر يُنسّق كيفية خدمة نماذج اللغة الكبيرة عبر عدة وحدات معالجة رسومية وعقد في مركز بيانات أو مجموعة سحابية، بدلاً من تنفيذ الاستدلال بنفسه. تصفه NVIDIA بأنه طبقة التنسيق فوق محركات الاستدلال، يحوّل مجموعة من وحدات المعالجة الرسومية إلى نظام استدلال واحد منسّق.

  • نوع المنتج: إطار عمل لتنسيق الاستدلال الموزّع — وليس محرك استدلال مستقلاً أو أداة تشغيل نماذج أو تطبيق سطح مكتب
  • الجهة المشرفة: NVIDIA، ويُطوَّر كمشروع مفتوح المصدر تحت منظمة ai-dynamo على GitHub
  • الترخيص: ملف LICENSE في المستودع هو Apache-2.0؛ يُلاحظ أن بيانات NVIDIA التلقائية للكشف عن الترخيص لنفس المستودع تُظهر بشكل منفصل NOASSERTION — تعتمد هذه المراجعة على ملف LICENSE نفسه كمرجع موثوق
  • أُنشئ المستودع في مارس 2025، وفقًا لبيانات GitHub الوصفية
  • الحجم: أكثر من 8,100 نجمة على GitHub وأكثر من 1,590 عملية تفرّع حتى وقت هذه المراجعة، مع عدد كبير بشكل غير معتاد من المشكلات المفتوحة (أكثر من 1,500) بالنسبة لحجم مشروع من هذا النوع — وهو أمر معتاد في مشاريع البنية التحتية سريعة التطور وذات المساهمات الكثيرة، لكنه يستحق الأخذ في الاعتبار عند تقييم مدى جاهزية الإنتاج

ما هو تاريخ إصدارات NVIDIA Dynamo؟

يصدر NVIDIA Dynamo علامات إصدار خاصة بنماذج ومنصات محددة بوتيرة سريعة، مع علامات تطوير نشطة تتراوح بين v1.4 وv1.6 حتى وقت هذه المراجعة.

  • تشمل الإصدارات الموسومة الأخيرة إصدارات خاصة بنماذج ومنصات محددة (على سبيل المثال، إصدارات مرتبطة بعائلات نماذج معينة مثل DeepSeek أو Kimi أو Solar)، ما يعكس مدى متابعة المشروع الدقيقة لإصدارات النماذج المفتوحة الأوزان الجديدة
  • حقق المشروع معالم جاهزية إنتاج عامة تصفها NVIDIA بأنها تشمل النشر بدون إعداد، ودعم الاستدلال الوكيلي (agentic)، ومعالجة التهيئة/التشفير/فك التشفير متعددة الوسائط، ودعم توليد الفيديو الأصلي
  • تشير نتائج NVIDIA المنشورة للإصدارات اللاحقة إلى مكاسب كبيرة في الإنتاجية على تركيبات نماذج/أجهزة محددة (على سبيل المثال DeepSeek R1 وأنظمة NVIDIA GB300 NVL72) — وهذه معايير أداء مُعلَنة من المورّد، وليست أرقامًا تحقق منها PromptQuorum بشكل مستقل

ماذا يفعل NVIDIA Dynamo فعليًا؟

يقف NVIDIA Dynamo أمام محرك استدلال واحد أو أكثر، ويقرر كيفية توجيه الطلبات وتجميعها في دفعات وتوسيعها عبر مجموعة وحدات المعالجة الرسومية لتحقيق أهداف زمن الاستجابة والتكلفة.

  • الخدمة المنفصلة: تقسّم مرحلتي التهيئة المسبقة وفك التشفير في الاستدلال إلى مجموعات وحدات معالجة رسومية قابلة للتوسع بشكل مستقل، بحيث يمكن لكل مرحلة استخدام أجهزة مخصصة لحجم عملها الخاص
  • التوجيه الواعي بذاكرة التخزين المؤقت KV: يوجّه الطلبات بناءً على حمل العمل في وحدات التنفيذ والتداخل القائم في ذاكرة التخزين المؤقت للمفتاح-القيمة لتجنّب الحسابات المكررة، وهو ما تصفه وثائق NVIDIA بأنه يُقلّل تقريبًا إلى النصف زمن إنتاج الرمز الأول في التكوينات المدعومة
  • مدير كتل KV (KVBM): ينقل ذاكرة التخزين المؤقت للمفتاح-القيمة عبر وحدة المعالجة الرسومية ووحدة المعالجة المركزية وSSD والتخزين البعيد لتوسيع طول السياق الفعّال إلى ما بعد ذاكرة وحدة معالجة رسومية واحدة
  • Planner: أداة تحجيم تلقائي مدفوعة باتفاقيات مستوى الخدمة تُحلّل أحمال العمل وتُعيد ضبط حجم مجموعات وحدات المعالجة الرسومية لتحقيق أهداف زمن الاستجابة بتكلفة إجمالية أقل للملكية
  • ModelExpress: يبثّ أوزان النموذج من وحدة معالجة رسومية إلى أخرى عبر NIXL/NVLink، وهو ما تصفه وثائق NVIDIA بأنه يُقلّل بشكل كبير من زمن بدء التشغيل البارد للنسخ الجديدة
  • دعم الخلفيات: تكامل كامل مع vLLM وTensorRT-LLM وSGLang، مع مصفوفة ميزات موثقة تغطي دعم كل خلفية لمهايئات LoRA وترحيل الطلبات وفك التشفير التخميني

كيف تنشر NVIDIA Dynamo؟

يُنشر NVIDIA Dynamo عادةً عبر حاويات Docker لكل خلفية استدلال، ويُثبَّت عبر pip لأغراض التطوير، أو يُنشر على مجموعة باستخدام Kubernetes ومخططات Helm.

  • Docker: تنشر NVIDIA صورًا جاهزة لكل خلفية (مثل sglang-runtime وtensorrtllm-runtime وvllm-runtime) عبر سجل الحاويات الخاص بها
  • Python/pip: ثبّته باستخدام إضافة خاصة بالخلفية، مثل `uv pip install --prerelease=allow "ai-dynamo[sglang]"`، مع استبدال الإضافة الموضوعة بين قوسين بالخلفية التي تختارها
  • البناء من المصدر: يُدعم البناء الكامل بلغتي Rust وPython من المصدر للمساهمين، ويتطلب حزمة build-essential وسلسلة أدوات Rust
  • Kubernetes: تستخدم عمليات النشر في الإنتاج عادةً مخططات Helm وبيانات YAML بدون إعداد من NVIDIA، والتي تطبّق التحجيم التلقائي المدفوع باتفاقيات مستوى الخدمة تلقائيًا
bash
uv pip install --prerelease=allow "ai-dynamo[sglang]"

المنصة والتسعير والترخيص

المنصة

ما تذكره وثائق NVIDIA Dynamo:
إطار عمل خدمة موزّع مبني على Linux وموجّه لمراكز البيانات/Kubernetes — لا يوجد مثبّت لجهاز واحد.

التكلفة

ما تذكره وثائق NVIDIA Dynamo:
مجاني ومفتوح المصدر. ستدفع تكلفة وحدات المعالجة الرسومية والبنية التحتية والسحابة التي ينسّقها.

الترخيص

ما تذكره وثائق NVIDIA Dynamo:
ملف LICENSE هو Apache-2.0؛ حقل بيانات الترخيص المنفصل في GitHub لنفس المستودع يُظهر NOASSERTION.

طريقة التثبيت

ما تذكره وثائق NVIDIA Dynamo:
صور Docker لكل خلفية، أو pip/uv pip مع إضافة خاصة بالخلفية، أو Kubernetes/Helm، أو بناء كامل من المصدر.

تحقق من مسار التثبيت الموصى به حاليًا وعلامات الحاويات على github.com/ai-dynamo/dynamo، حيث تتغير الصور الخاصة بالخلفيات وإضافات الحزم بين الإصدارات.

كم تبلغ تكلفة NVIDIA Dynamo؟

NVIDIA Dynamo نفسه مجاني — لا رسوم ترخيص ولا اشتراك ولا رسوم قائمة على الاستخدام. تكلفتك الفعلية هي أجهزة وحدات المعالجة الرسومية والبنية التحتية السحابية والشبكات التي ينسّقها، وهي عادةً كبيرة في عمليات النشر متعددة العقد.

  • إطار العمل: مجاني ومفتوح المصدر (Apache-2.0 وفقًا لملف LICENSE)، بدون فئة مدفوعة
  • تكاليف البنية التحتية: عدة وحدات معالجة رسومية، غالبًا عبر عدة عقد، بالإضافة إلى وصلات ربط سريعة (NVLink/NIXL) للحصول على الفائدة الكاملة من ميزات بث الأوزان ونقل ذاكرة التخزين المؤقت KV
  • لا يناسب ميزانيات وحدة المعالجة الرسومية الواحدة: توضّح وثائق NVIDIA نفسها أن عمليات النشر على وحدة معالجة رسومية واحدة ونموذج واحد لا تحتاج إلى Dynamo، لذا لا توجد حالة استخدام ذات معنى ضمن "الفئة الاقتصادية" هنا

NVIDIA Dynamo مقابل GPUStack: ما الفرق؟

يساعد كل من NVIDIA Dynamo وGPUStack في تنسيق موارد وحدات المعالجة الرسومية لخدمة نماذج اللغة الكبيرة، لكنهما يعملان على نطاقين مختلفين: يدير GPUStack ويجمّع وحدات معالجة رسومية غير متجانسة في مجموعة واحدة لتشغيل النماذج، بينما ينسّق Dynamo توجيه الطلبات والتهيئة المسبقة/فك التشفير المنفصلة والتحجيم التلقائي فوق مجموعة وحدات معالجة رسومية كبيرة قائمة بالفعل.

الهدف الأساسي

NVIDIA Dynamo:
تنسيق محركات الاستدلال (vLLM وTensorRT-LLM وSGLang) عبر العديد من وحدات المعالجة الرسومية/العقد
GPUStack:
تجميع وحدات معالجة رسومية غير متجانسة في مجموعة واحدة قابلة للإدارة لتشغيل النماذج

النطاق النموذجي

NVIDIA Dynamo:
مراكز البيانات، متعددة العقد، غالبًا مُحسَّنة لأجهزة NVIDIA
GPUStack:
مجموعات صغيرة إلى متوسطة الحجم، بوحدات معالجة رسومية استهلاكية/شبه احترافية مختلطة

التقنية الرئيسية

NVIDIA Dynamo:
التهيئة المسبقة/فك التشفير المنفصلة، والتوجيه الواعي بذاكرة التخزين المؤقت KV
GPUStack:
تجميع موارد وحدات المعالجة الرسومية وجدولتها عبر مجموعة

الجهة المشرفة

NVIDIA Dynamo:
NVIDIA
GPUStack:
مشروع مفتوح المصدر (راجع مراجعة GPUStack للتفاصيل)

يمكن أن تكون هذه الأدوات متكاملة بدلاً من متنافسة بشكل صارم — إدارة المجموعات على طريقة GPUStack وتنسيق الطلبات على طريقة Dynamo يعالجان طبقتين مختلفتين من عملية نشر كبيرة.

من يجب أن يستخدم NVIDIA Dynamo؟

يناسب NVIDIA Dynamo فرق البنية التحتية للتعلم الآلي التي تشغّل نماذج اللغة الكبيرة على نطاق واسع عبر عدة وحدات معالجة رسومية أو عقد — وهو غير موجّه للهواة الذين يشغّلون نموذجًا على جهاز واحد.

ما لا يصلح له NVIDIA Dynamo

لا يُعد NVIDIA Dynamo خيارًا جيدًا لحالات استخدام وحدة معالجة رسومية واحدة، أو جهاز واحد، أو الذكاء الاصطناعي المحلي للمبتدئين — فهو صراحةً طبقة تنسيق بحجم مراكز البيانات.

  • غير مخصص لعمليات النشر على وحدة معالجة رسومية واحدة أو نموذج واحد — توضّح وثائق NVIDIA نفسها أن حالة الاستخدام هذه لا تحتاج إلى Dynamo
  • ليست أداة للمبتدئين أو الهواة — فهي تفترض خبرة تشغيلية في Kubernetes والشبكات متعددة العقد ومحركات الاستدلال
  • ليس محرك استدلال مستقلاً — يتطلب خلفية موجودة بالفعل (vLLM أو TensorRT-LLM أو SGLang) لتشغيل النماذج فعليًا
  • لم تتحقق هذه المراجعة بشكل مستقل من مضاعفات الأداء المحددة التي نشرتها — تعامل مع أرقام الإنتاجية وزمن الاستجابة التي تنشرها NVIDIA كأرقام مُعلَنة من المورّد إلى أن يتم اختبارها على حمل عملك الخاص
  • الترخيص غير قاطع الوضوح من بيانات GitHub الوصفية وحدها — يفيد ملف LICENSE في المستودع بأنه Apache-2.0، لكن حقل الكشف التلقائي عن الترخيص في GitHub يُظهر بشكل منفصل NOASSERTION لنفس المستودع، لذا تحقق من الترخيص مباشرة مقابل ملف LICENSE قبل افتراض انطباق شروط Apache-2.0 القياسية دون تحفظ

الأخطاء الشائعة عند تقييم NVIDIA Dynamo

معظم اللبس حول NVIDIA Dynamo ينشأ من توقّع أن يتصرف كأداة استدلال على جهاز واحد، أو من سوء فهم الطبقة التي يحل محلها فعليًا في المكدس التقني.

المنافسون والبدائل

غالبًا ما تتم مقارنة NVIDIA Dynamo بـGPUStack وLMDeploy، ومحركات الاستدلال التي يمكنه تنسيقها، vLLM وSGLang — وأبرز ما يميّزه هو تنسيق التهيئة المسبقة/فك التشفير المنفصلة المصمم خصيصًا لمجموعات وحدات معالجة رسومية NVIDIA الكبيرة والمتعددة العقد.

GPUStack

أشهر ما تُعرف به:
تجميع وحدات معالجة رسومية غير متجانسة في مجموعة واحدة قابلة للإدارة لخدمة النماذج
مقالات حول GPUStack (3)

مذكور أيضًا في:

LMDeploy

أشهر ما تُعرف به:
أدوات خدمة واستدلال موزّعة لنماذج اللغة الكبيرة مع دعم التكميم
مقالات حول LMDeploy (1)

مذكور أيضًا في:

vLLM

أشهر ما تُعرف به:
محرك استدلال عالي الإنتاجية ومتوافق مع OpenAI، وهو خلفية شائعة لـ Dynamo
الرابط:
شرح vLLM
مقالات حول vLLM (10)

+81 أخرى غير معروضة

SGLang

أشهر ما تُعرف به:
محرك استدلال متوافق مع OpenAI مع تحسينات للتوليد المُهيكل، وهو خلفية شائعة لـ Dynamo
الرابط:
شرح SGLang
مقالات حول SGLang (5)

مذكور أيضًا في:

تعكس هذه القائمة الأدوات التي تُقيَّم عادةً إلى جانب NVIDIA Dynamo، وليست تصنيفًا مستقلاً من PromptQuorum — تحقق من مجموعة الميزات الحالية ومتطلبات الأجهزة لكل أداة قبل الاختيار.

الأسئلة الشائعة

ما هو NVIDIA Dynamo؟

NVIDIA Dynamo (github.com/ai-dynamo/dynamo) هو إطار عمل مجاني ومفتوح المصدر لخدمة الاستدلال الموزّع بحجم مراكز البيانات، يُنسّق محركات استدلال مثل vLLM وTensorRT-LLM وSGLang عبر عدة وحدات معالجة رسومية وعقد.

هل NVIDIA Dynamo مجاني؟

نعم، إطار العمل نفسه مجاني ومفتوح المصدر. يفيد ملف LICENSE في مستودعه بأنه Apache-2.0. ستظل تدفع تكلفة أجهزة وحدات المعالجة الرسومية وبنية المجموعة التحتية التي ينسّقها.

هل أحتاج إلى NVIDIA Dynamo لتشغيل نموذج لغة كبير محلي على جهاز الكمبيوتر الخاص بي؟

لا. توضّح وثائق NVIDIA نفسها صراحةً أن عمليات النشر على وحدة معالجة رسومية واحدة ونموذج واحد لا تحتاج إلى Dynamo. لجهاز واحد، استخدم محرك استدلال مثل vLLM أو بيئة تشغيل محلية أبسط مباشرة.

هل يحل NVIDIA Dynamo محل vLLM أو TensorRT-LLM؟

لا، بل ينسّقهما. Dynamo طبقة تنسيق تقف فوق محركات استدلال موجودة بالفعل — vLLM وTensorRT-LLM وSGLang — بدلاً من استبدال أي منها.

ما هي خدمة التهيئة المسبقة/فك التشفير المنفصلة؟

هي تقنية تفصل مرحلة التهيئة المسبقة (معالجة موجّه الإدخال) عن مرحلة فك التشفير (توليد رموز الإخراج) إلى مجموعات وحدات معالجة رسومية قابلة للتوسع بشكل منفصل، بحيث يمكن لكل مرحلة استخدام أجهزة مخصصة لخصائص حمل عملها الخاص.

من يشرف على صيانة NVIDIA Dynamo؟

تشرف NVIDIA على صيانته كمشروع مفتوح المصدر تحت منظمة ai-dynamo على GitHub.

هل ترخيص NVIDIA Dynamo هو Apache-2.0 أم NOASSERTION؟

يفيد ملف LICENSE الخاص بالمستودع نفسه بأنه Apache-2.0. يُظهر حقل بيانات GitHub الوصفية المنفصل والتلقائي للكشف عن الترخيص NOASSERTION لنفس المستودع — تعتمد هذه المراجعة على ملف LICENSE كمرجع موثوق.

ما الأجهزة التي يتطلبها NVIDIA Dynamo؟

لا يوجد حد أدنى موثق واحد، لأنه مصمم لعمليات النشر بحجم مراكز البيانات ومتعددة وحدات المعالجة الرسومية والعقد، وليس لحد أدنى ثابت من الأجهزة الاستهلاكية. كما يتوقع نظام Linux، وللاستفادة من كامل مجموعة ميزاته، وصلات ربط سريعة مثل NVLink/NIXL.

كيف أثبّت NVIDIA Dynamo؟

المسارات الشائعة هي صور Docker لكل خلفية، أو `uv pip install --prerelease=allow "ai-dynamo[sglang]"` (مع استبدال إضافة الخلفية)، أو نشر عبر Kubernetes/Helm للإنتاج. تحقق أولاً من أسماء الحزم والصور الحالية على مستودع GitHub.

هل تحقق PromptQuorum بشكل مستقل من ادعاءات NVIDIA حول أداء Dynamo؟

لا. تستند هذه المراجعة إلى مستودع NVIDIA نفسه على GitHub ووثائقه. أرقام الإنتاجية وزمن الاستجابة المحددة هي معايير أداء نشرتها NVIDIA نفسها، وليست أرقامًا أعاد PromptQuorum إنتاجها بشكل مستقل.

المصادر

← العودة إلى LLM المحلية المتقدمة