النقاط الرئيسية
- KServe (kserve.github.io/website) منصة مجانية ومفتوحة المصدر أصيلة لـ Kubernetes لتقديم النماذج — وليست تطبيق ذكاء اصطناعي محلي على جهاز واحد
- أُطلقت في الأصل باسم KFServing ضمن مشروع Kubeflow؛ أُنشئ مستودعها على GitHub في مارس 2019
- مرخّصة بموجب Apache 2.0، مؤكَّد من بيانات الترخيص في مستودع GitHub
- مشروع في مرحلة احتضان لدى مؤسسة Cloud Native Computing Foundation (CNCF)، وفقًا لملف README وموقعها الرسمي
- توحّد تقديم الذكاء الاصطناعي التوليدي (استدلال LLM مدعوم بـ vLLM ببروتوكول متوافق مع OpenAI) وتقديم الذكاء الاصطناعي التنبؤي (TensorFlow وPyTorch وscikit-learn وXGBoost وONNX) في منصة واحدة
- تتطلب عنقود Kubernetes قائمًا مسبقًا (الإصدار 1.32 أو أحدث، وفقًا لدليل البدء السريع الخاص بها) — وليست تطبيقًا مستقلًا
- أكثر من 5,900 نجمة على GitHub، وأكثر من 1,600 تفرع، ومئات المساهمين حتى وقت كتابة هذه المراجعة
📍 في جملة واحدة
KServe منصة مجانية ومفتوحة المصدر (Apache 2.0) أصيلة لـ Kubernetes وفي مرحلة احتضان CNCF، أُطلقت في الأصل باسم KFServing ضمن Kubeflow عام 2019، وتنشر نماذج ذكاء اصطناعي توليدية (مدعومة بـ LLM/vLLM) وتنبؤية (متعددة الأطر) على نطاق واسع على عنقودك الخاص.
💬 بعبارات بسيطة
ليست KServe شيئًا تثبّته على حاسوب محمول للدردشة مع نموذج محلي — إنها برمجية بنية تحتية تعمل على عنقود Kubernetes (خوادمك الخاصة، أو خدمة Kubernetes مُدارة من مزوّد سحابي) لتقديم نماذج الذكاء الاصطناعي لتطبيقات أخرى في الإنتاج، على نطاق واسع، بميزات مثل القياس التلقائي للحمل والطرح التدريجي. إنها مجانية ومفتوحة المصدر، لكنها تفترض أنك تشغّل Kubernetes بالفعل.
📌ملاحظة: تستند هذه المراجعة إلى مستودع KServe على GitHub، وملف README، وموقع التوثيق العام الخاص بها. لا تدّعي أن PromptQuorum أجرت عمليات نشر عملية مباشرة على عنقود KServe، وهي تتعمد عدم المبالغة في تقديمها كأداة سهلة للمبتدئين — فهي موجّهة لمهندسي المنصات/التعلم الآلي الذين يشغّلون بنية تحتية إنتاجية لـ Kubernetes.
ما هي KServe؟
KServe منصة موحّدة وموزَّعة لتقديم النماذج، مخصصة لنشر نماذج الذكاء الاصطناعي التوليدي والتنبؤي على نطاق واسع على Kubernetes. يصف ملف README الخاص بها المشروع بأنه يوحّد "الاستدلال التوليدي والتنبؤي للذكاء الاصطناعي على Kubernetes"، وهو بسيط بما يكفي للنشر السريع لكنه مصمَّم للتعامل مع أحمال عمل بحجم المؤسسات.
- نوع المنتج: برمجية بنية تحتية أصيلة لـ Kubernetes (تعريفات موارد مخصصة، ووحدات تحكم، ومكونات وقت تشغيل) — وليست تطبيق سطح مكتب، ولا أداة CLI تشغّلها بشكل مستقل، ولا خادم استدلال محلي على جهاز واحد
- التجريد الأساسي: المورد المخصص
InferenceService(CRD)، الذي يمثّل نقطة نهاية نموذج منشور؛ ويربط الموردInferenceGraphعدة مكونات (متنبئ، محوّل، مفسِّر) معًا - الحوكمة: مشروع في مرحلة احتضان لدى Cloud Native Computing Foundation (CNCF)، وفقًا لملف README وموقعها الرسمي
- الترخيص: Apache 2.0، مؤكَّد من بيانات الترخيص في مستودع GitHub
- المستودع: github.com/kserve/kserve، أُنشئ في مارس 2019 — أحد أكثر المشاريع رسوخًا في هذه الفئة، وليس وافدًا جديدًا
- الحجم: أكثر من 5,900 نجمة على GitHub، وأكثر من 1,600 تفرع، وعدة مئات من المساهمين حتى وقت كتابة هذه المراجعة
من KFServing إلى KServe: تاريخ المشروع
أُنشئ مستودع KServe على GitHub في مارس 2019 تحت اسم KFServing، كمكوّن تقديم ضمن مشروع Kubeflow. أُعيدت تسميته لاحقًا إلى KServe وانفصل كمشروع قائم بذاته، وانضم منذ ذلك الحين إلى CNCF كمشروع في مرحلة احتضان. تُظهر الإصدارات الأخيرة تحوّلًا نحو توحيد تقديم الذكاء الاصطناعي التوليدي الموجّه لنماذج اللغة الكبيرة إلى جانب قدرات تقديم التعلم الآلي التنبؤي الأصلية.
- 1الإصدار v0.18.0 — 29 أبريل 2026: تحسينات على التقديم التنبؤي
Why it matters: جزء من سلسلة 0.18.x التي ركّزت على الاستقرار وإصلاحات التهيئة تمهيدًا لدفعة ميزات الذكاء الاصطناعي التوليدي في 0.19، وفقًا لملاحظات الإصدار. - 2الإصدار v0.18.1 — 15 يوليو 2026: تصحيحات مخططات Helm
Why it matters: إصدار تصحيح يصلح مشكلات مخططات Helm من سلسلة 0.18.0، وفقًا لسجل التغييرات الرسمي. - 3الإصدار v0.19.0 — 14 يونيو 2026: LocalModelCache والتتبع الموزَّع
Why it matters: قدّم دعم LocalModelCache لخدمة LLMInferenceService، وواجهة برمجة تطبيقات للتتبع الموزَّع، وتوجيهًا مزدوج البروتوكول (REST/gRPC)، إضافة إلى تحسينات على حالة القياس التلقائي للحمل عبر HPA/KEDA. - 4الإصدار v0.20.0 — 6 أغسطس 2026: وقت تشغيل vLLM والتقديم السري
Why it matters: أضاف دعم وقت تشغيل vLLM، وتكامل AutoGluon Server، وقدرة تقديم نماذج سرية (confidential)، وتحسينات على إفراغ ذاكرة التخزين المؤقت KV — الإصدار الأكثر تركيزًا على التقديم التوليدي/LLM حتى الآن، بمشاركة أكثر من 35 مساهمًا وفقًا لملاحظات الإصدار. - 5الإصدار v0.21.0-rc0 — 10 سبتمبر 2026: تحسينات خدمة استدلال LLM
Why it matters: إصدار مرشّح يتضمن مزيدًا من تحسينات LLMInferenceService، واختبارات دورة حياة للنشر التدريجي (canary)، ودعمًا مباشرًا للقياس عبر KEDA — أحدث إصدار موسوم تمكنت هذه المراجعة من تأكيده حتى وقت النشر.
ماذا يمكنك أن تفعل باستخدام KServe؟
تنقسم مجموعة ميزات KServe إلى تقديم الذكاء الاصطناعي التوليدي (موجّه لنماذج اللغة الكبيرة) وتقديم الذكاء الاصطناعي التنبؤي (التعلم الآلي التقليدي)، موحّدين في منصة واحدة. إليك ما يفعله كل جزء، وفقًا لملف README الخاص بـ KServe والتوثيق.
- تقديم الذكاء الاصطناعي التوليدي — استدلال LLM مدعوم بـ vLLM وllm-d، وبروتوكول استدلال متوافق مع OpenAI، وتقديم مُسرَّع بواسطة GPU مع إدارة ذاكرة محسَّنة، وتخزين مؤقت ذكي للنماذج، وإفراغ ذاكرة التخزين المؤقت KV إلى وحدة المعالجة المركزية/القرص للتسلسلات الأطول
- تقديم الذكاء الاصطناعي التنبؤي — نشر نماذج متعدد الأطر لـ TensorFlow وPyTorch وscikit-learn وXGBoost وONNX، مع توجيه ذكي للطلبات بين مكونات المتنبئ والمحوّل والمفسِّر
- أنماط نشر متقدمة — طرح تدريجي (canary)، وخطوط أنابيب استدلال، وتجميعات (ensembles) عبر المورد
InferenceGraph - القياس التلقائي للحمل — قياس تلقائي قائم على الطلبات لكل من أحمال العمل التوليدية والتنبؤية، بما في ذلك التقليص إلى صفر عند التشغيل في وضع Knative/serverless (غير متاح في وضع RawDeployment الخفيف)
- تفسير النماذج ومراقبتها — دعم مدمج لإسناد الميزات/تفسيرات النماذج، إضافة إلى تسجيل الحمولات، وكشف القيم الشاذة، وكشف الهجمات العدائية، وكشف الانحراف (drift) لأحمال العمل التنبؤية
- أوضاع النشر — Kubernetes القياسي (RawDeployment، خفيف الوزن، بلا طرح تدريجي أو تقليص إلى صفر)، وKnative/Serverless (يضيف الطرح التدريجي والتقليص إلى صفر)، وModelMesh (لتقديم نماذج بكثافة عالية ومتغيرة بشكل متكرر على نطاق واسع)
- التكامل مع Kubeflow — KServe مكوّن إضافي لـ Kubeflow، ويمكن تثبيتها كجزء من نشر Kubeflow على AWS أو OpenShift، إضافة إلى التثبيت المستقل
أمثلة استخدام: ثلاث طرق لاستخدام KServe
هذه سير عمل ملموسة مبنية على الميزات الموثَّقة لـ KServe أعلاه — وليست حالات استخدام افتراضية. تتطلب جميعها عنقود Kubernetes قائمًا مسبقًا.
تثبيت KServe
تُنشَر KServe عبر kubectl، أو مخططات Helm، أو أحد نصوص التثبيت السريع الخاصة بها — لا يوجد تثبيت عبر مدير حزم أو تطبيق سطح مكتب. وفقًا لـ دليل البدء السريع الخاص بـ KServe، تحتاج إلى Kubernetes 1.32 أو أحدث، إضافة إلى kubectl وَhelm وَgit مثبَّتة محليًا؛ تحقق دائمًا من خطوات التثبيت الحالية على الموقع مباشرة، إذ تُصدَر الأوامر مع كل إصدار.
موقع التوثيق الرسمي
- الرابط:
- kserve.github.io/website
مستودع GitHub (الشيفرة المصدرية، Apache 2.0)
- الرابط:
- github.com/kserve/kserve
تثبيت سريع (الوضع القياسي)
- الرابط:
- نص مرتبط من صفحة الإصدارات (
kserve-standard-mode-full-install-with-manifests.sh)
تثبيت سريع (وضع Knative/serverless)
- الرابط:
- نص مرتبط من صفحة الإصدارات (
kserve-knative-mode-full-install-with-manifests.sh)
الإصدارات (سجل النُسخ)
بالنسبة للنشر الإنتاجي، يوجّهك توثيق KServe الرسمي إلى دليل المسؤول الخاص بها بدلًا من نصوص البدء السريع — فتلك النصوص مخصصة صراحة للتجريب فقط. أرقام الإصدارات الدقيقة في روابط التثبيت تتغير مع كل إصدار؛ تأكد من الرقم الحالي قبل تشغيل أي أمر.
أسعار KServe: هل هي مجانية فعلًا؟
نعم — لا تحتوي KServe نفسها على فئة مدفوعة. إنها مرخّصة بموجب Apache 2.0، مجانية ومفتوحة المصدر، دون نسخة SaaS مستضافة من مزوّد أو اشتراك مرتبط بالمشروع نفسه.
- لا اشتراك، ولا فئة مدفوعة، ولا حدود استخدام تفرضها KServe نفسها
- تشغّلها على بنية Kubernetes التحتية التي تديرها بالفعل أو تدفع مقابلها بشكل منفصل — لذا تكلفتك الحقيقية هي الحوسبة الأساسية (العقد، ووحدات GPU، والتخزين) إضافة إلى أي رسوم لخدمة Kubernetes المُدارة يفرضها مزوّدك السحابي، وليست KServe
- رخصة Apache 2.0: متساهلة، تسمح بالاستخدام التجاري والتعديل وإعادة التوزيع، دون التزامات حقوق نسخ متروكة (copyleft)
- بصفتها مشروعًا في مرحلة احتضان CNCF، تُحكَم KServe ببنية مجتمعية/مؤسسية بدلًا من مزوّد تجاري واحد، رغم أن بعض المؤسسات تقدّم دعمًا تجاريًا حولها
KServe مقابل NVIDIA Dynamo
تستهدف كل من KServe وNVIDIA Dynamo تقديم استدلال ذكاء اصطناعي إنتاجي على نطاق واسع، لكنهما تنطلقان من نقطتين مختلفتين. KServe منصة عامة الغرض أصيلة لـ Kubernetes توحّد التقديم التوليدي والتنبؤي عبر أطر عمل عديدة، وتحكمها CNCF. أما Dynamo فهو إطار عمل NVIDIA الخاص بها لتقديم الاستدلال الموزَّع، محسَّن بإحكام أكبر حول عتاد GPU من NVIDIA وتقنيات التقديم غير المتجانس (disaggregated).
الحوكمة
- KServe:
- مشروع في مرحلة احتضان CNCF، محايد تجاه المزوّدين
- NVIDIA Dynamo:
- مشروع بقيادة NVIDIA — راجع المراجعة المخصصة لتفاصيل الحوكمة الحالية
النطاق
- KServe:
- تقديم ذكاء اصطناعي توليدي وتنبؤي، متعدد الأطر
- NVIDIA Dynamo:
- تقديم استدلال توليدي/LLM بشكل أساسي
المنصة
- KServe:
- أصيلة لـ Kubernetes (أي عنقود متوافق/مزوّد GPU)
- NVIDIA Dynamo:
- محسَّنة تحديدًا لبنية GPU من NVIDIA
الارتباط بالعتاد
- KServe:
- لا يوجد ارتباط تفرضه KServe نفسها
- NVIDIA Dynamo:
- مرتبطة بوحدات GPU من NVIDIA — راجع المراجعة المخصصة للتفاصيل
الترخيص
- KServe:
- Apache 2.0
- NVIDIA Dynamo:
- راجع مراجعة Dynamo المخصصة لتفاصيل الترخيص الحالية
إذا كانت بنيتك التحتية متعددة المزوّدين أو أردت طبقة تقديم محايدة تجاه الأطر وتحكمها CNCF، فإن KServe هي الخيار الأوسع ملاءمة. أما إذا كنت موحَّدًا بالفعل على بنية GPU من NVIDIA وتريد تقديمًا مضبوطًا خصيصًا لها، فقيّم NVIDIA Dynamo مباشرة — راجع تلك المراجعة المخصصة للتفاصيل الكاملة بدلًا من افتراض تداخل كامل في الميزات.
لمن تناسب KServe؟
تعتمد ملاءمة KServe لك بشكل كبير على ما إذا كنت تشغّل بالفعل بنية تحتية Kubernetes وتحتاج إلى تقديم نماذج بمستوى إنتاجي على نطاق واسع، مقابل رغبتك في تطبيق دردشة محلي بسيط أو خادم API لنموذج واحد.
المنافسون والبدائل
تقع KServe في فئة تقديم النماذج الإنتاجي على نطاق واسع، إلى جانب منصات استدلال أخرى موجّهة لمراكز البيانات/المؤسسات. تتميز بكونها أصيلة لـ Kubernetes، وتحكمها CNCF، وتوحّد صراحة تقديم الذكاء الاصطناعي التوليدي والتنبؤي في منصة واحدة بدلًا من التركيز على أحدهما فقط.
NVIDIA Dynamo
- الأشهر في:
- إطار عمل موزَّع لاستدلال LLM محسَّن لعتاد NVIDIA
- الرابط:
- مراجعة Dynamo
مقالات حول NVIDIA Dynamo (2)
- NVIDIA Dynamo Review: Datacenter-Scale Inference Servingمحدَّث ١٩ سبتمبر ٢٠٢٦
- KServe Review: Kubernetes-Native Model Serving at Scaleمحدَّث ١٩ سبتمبر ٢٠٢٦
مذكور أيضًا في:
- LoRAX Review: Serving Thousands of LoRA Adapters on One GPUمحدَّث ١٩ سبتمبر ٢٠٢٦
LMDeploy
- الأشهر في:
- أدوات لضغط ونشر وتقديم نماذج LLM (من فريق InternLM/MMDeploy)
- الرابط:
- مراجعة LMDeploy
مقالات حول LMDeploy (1)
- LMDeploy Review: High-Throughput LLM Serving and Quantizationمحدَّث ١٩ سبتمبر ٢٠٢٦
مذكور أيضًا في:
- NVIDIA Dynamo Review: Datacenter-Scale Inference Servingمحدَّث ١٩ سبتمبر ٢٠٢٦
- LoRAX Review: Serving Thousands of LoRA Adapters on One GPUمحدَّث ١٩ سبتمبر ٢٠٢٦
- Shimmy Review 2026: A 5MB Rust Alternative to Ollamaمحدَّث ١٩ سبتمبر ٢٠٢٦
- TurboFieldfare Review: Running Gemma 4 26B-A4B in 2 GB of RAMمحدَّث ١٩ سبتمبر ٢٠٢٦
vLLM
- الأشهر في:
- محرك استدلال وتقديم عالي الإنتاجية لـ LLM يمكن لـ KServe نفسها تشغيله كخلفية
- الرابط:
- vllm.ai
مقالات حول vLLM (10)
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)محدَّث ٦ سبتمبر ٢٠٢٦
- llama.cpp Explained: The Engine Powering Ollama (2026)محدَّث ٢٠ سبتمبر ٢٠٢٦
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026محدَّث ٢٠ سبتمبر ٢٠٢٦
- candle-vllm Review: Rust-Native LLM Serving on CUDA and Metalمحدَّث ١٩ سبتمبر ٢٠٢٦
- NVIDIA Dynamo Review: Datacenter-Scale Inference Servingمحدَّث ١٩ سبتمبر ٢٠٢٦
- KServe Review: Kubernetes-Native Model Serving at Scaleمحدَّث ١٩ سبتمبر ٢٠٢٦
- LMDeploy Review: High-Throughput LLM Serving and Quantizationمحدَّث ١٩ سبتمبر ٢٠٢٦
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API Serverمحدَّث ١٩ سبتمبر ٢٠٢٦
- TranslateBooksWithLLMs Review: Translate Full Books With a Local or Cloud LLMمحدَّث ١٩ سبتمبر ٢٠٢٦
- vllm-mlx Review: vLLM-Style Serving for Apple Siliconمحدَّث ١٩ سبتمبر ٢٠٢٦
+81 أخرى غير معروضة
Seldon Core
- الأشهر في:
- منصة تقديم نماذج تعلم آلي أخرى أصيلة لـ Kubernetes، أقرب إلى نطاق التقديم التنبؤي لدى KServe
- الرابط:
- seldon.io
تعكس هذه القائمة أدوات يشيع مناقشتها إلى جانب KServe في مجال تقديم النماذج الإنتاجي/المؤسسي، وليست تصنيفًا مستقلًا من PromptQuorum — تحقق من النطاق والترخيص ومتطلبات العتاد الحالية لكل أداة قبل الاختيار. راجع دليل برمجيات LLM المحلية للكتالوج الكامل، الذي يغطي أيضًا أدوات محلية على جهاز واحد تستثنيها هذه المقارنة.
أخطاء شائعة عند تقييم KServe
يأتي معظم الالتباس حول KServe من تاريخ إعادة تسميتها، أو اعتمادها على Kubernetes، أو افتراض أنها أداة ذكاء اصطناعي محلية سهلة للمبتدئين.
الأسئلة الشائعة
ما هي KServe؟
KServe (kserve.github.io/website، والشيفرة المصدرية على github.com/kserve/kserve) منصة مجانية ومفتوحة المصدر أصيلة لـ Kubernetes لنشر نماذج الذكاء الاصطناعي التوليدي والتنبؤي على نطاق واسع على عنقودك الخاص.
هل KServe مجانية؟
نعم. إنها مرخّصة بموجب Apache 2.0 دون فئة مدفوعة أو نسخة SaaS مستضافة من مزوّد مرتبطة بالمشروع نفسه. تكلفتك الحقيقية هي بنية Kubernetes التحتية (الحوسبة، ووحدات GPU، والتخزين) التي تشغّلها عليها.
هل أحتاج إلى Kubernetes لاستخدام KServe؟
نعم. لا تملك KServe مسار نشر مستقل أو بدون Kubernetes — فهي تتطلب Kubernetes الإصدار 1.32 أو أحدث، وفقًا لدليل البدء السريع الخاص بها، إضافة إلى kubectl وHelm وgit للتثبيت.
هل كانت KServe تُعرف سابقًا باسم KFServing؟
نعم. أُطلقت في الأصل باسم KFServing ضمن مشروع Kubeflow (أُنشئ المستودع في مارس 2019)، وأُعيدت تسميتها لاحقًا إلى KServe وانفصلت كمشروع قائم بذاته في مرحلة احتضان CNCF.
ما أطر التعلم الآلي التي تدعمها KServe؟
للذكاء الاصطناعي التنبؤي: TensorFlow وPyTorch وscikit-learn وXGBoost وONNX. أما للذكاء الاصطناعي التوليدي: استدلال LLM عبر vLLM وllm-d، مع بروتوكول متوافق مع OpenAI ودعم أصلي لنماذج Hugging Face.
هل تدعم KServe الطرح التدريجي والقياس التلقائي للحمل؟
نعم، في وضع نشر Knative/Serverless — الذي يضيف الطرح التدريجي والقياس التلقائي للحمل القائم على الطلبات مع التقليص إلى صفر. لا يدعم وضع Kubernetes القياسي الأخف (RawDeployment) هذه الميزات.
هل تناسب KServe مبتدئًا يشغّل ذكاءً اصطناعيًا محليًا على جهاز واحد؟
لا. KServe برمجية بنية تحتية إنتاجية لـ Kubernetes موجَّهة لمهندسي المنصات/التعلم الآلي الذين يشغّلون عناقيد على نطاق واسع — وليست تطبيق دردشة محلي على جهاز واحد. لهذا الاستخدام، راجع أدوات مثل Ollama أو LM Studio بدلًا من ذلك.
هل KServe مشروع CNCF؟
نعم، KServe مشروع في مرحلة احتضان لدى Cloud Native Computing Foundation (CNCF)، وفقًا لملف README وموقع التوثيق الخاصين بها.
كيف أثبّت KServe للتجريب؟
وفقًا لدليل البدء السريع الخاص بـ KServe، شغّل أحد نصوص التثبيت السريع (الوضع القياسي، أو وضع Knative، أو LLMInferenceService فقط) على عنقود Kind أو Minikube محلي يستوفي متطلب Kubernetes 1.32+. هذه النصوص مخصصة صراحة للتجريب، لا للإنتاج.
هل اختبرت PromptQuorum ادعاءات KServe بشكل مستقل؟
تستند هذه المراجعة إلى مستودع KServe على GitHub، وملف README، وملاحظات الإصدارات، وموقع التوثيق العام، بدلًا من اختبار نشر فعلي على عنقود أجرته PromptQuorum بنفسها.