Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/KServe : le service de modèles natif Kubernetes à grande échelle
Overview & Reference

KServe : le service de modèles natif Kubernetes à grande échelle

·11 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

KServe est une plateforme gratuite, open source et native Kubernetes pour déployer des modèles d'IA générative et prédictive à grande échelle — elle nécessite un cluster Kubernetes existant et s'adresse aux ingénieurs plateforme/ML qui exploitent une infrastructure d'inférence en production, et non à une installation d'IA locale sur une seule machine. À l'origine KFServing au sein du projet Kubeflow (créé en 2019), c'est aujourd'hui un projet indépendant en incubation à la CNCF, sous licence Apache 2.0, prenant en charge le service prédictif multi-framework (TensorFlow, PyTorch, scikit-learn, XGBoost, ONNX) et le service génératif orienté LLM via vLLM, avec autoscaling, déploiements canary et un protocole d'inférence compatible OpenAI.

KServe (kserve.github.io/website, code source sur github.com/kserve/kserve) est une plateforme gratuite, open source et native Kubernetes pour déployer des modèles d'IA générative et prédictive à grande échelle sur votre propre cluster. Lancé à l'origine sous le nom KFServing au sein du projet Kubeflow en 2019, il constitue désormais un projet indépendant en incubation à la Cloud Native Computing Foundation (CNCF). Cet avis présente ce que l'outil fait réellement, comment l'installer, et à qui il s'adresse — il s'agit d'un outil de production pour opérateurs de cluster, non d'une application amateur pour une seule machine, et cet avis se garde en conséquence de tout excès.

Points clés

  • KServe (kserve.github.io/website) est une plateforme gratuite, open source et native Kubernetes pour le service de modèles — et non une application d'IA locale pour une seule machine
  • Lancé à l'origine sous le nom KFServing au sein du projet Kubeflow ; son dépôt GitHub a été créé en mars 2019
  • Sous licence Apache 2.0, confirmée via les métadonnées de licence du dépôt GitHub
  • Un projet en incubation à la Cloud Native Computing Foundation (CNCF), selon son propre README et son site
  • Unifie le service d'IA générative (inférence LLM adossée à vLLM avec un protocole compatible OpenAI) et le service d'IA prédictive (TensorFlow, PyTorch, scikit-learn, XGBoost, ONNX) sur une seule plateforme
  • Nécessite un cluster Kubernetes existant (version 1.32 ou supérieure, selon son propre guide de démarrage rapide) — ce n'est pas une application autonome
  • Plus de 5 900 étoiles GitHub, plus de 1 600 forks et des centaines de contributeurs au moment de cet avis

📍 En une phrase

KServe est une plateforme gratuite, open source (Apache 2.0), native Kubernetes et en incubation CNCF, lancée à l'origine sous le nom KFServing au sein de Kubeflow en 2019, qui déploie des modèles d'IA à la fois génératifs (LLM adossés à vLLM) et prédictifs (multi-framework) à grande échelle sur votre propre cluster.

💬 En termes simples

KServe n'est pas un outil que vous installez sur un ordinateur portable pour discuter avec un modèle local — c'est un logiciel d'infrastructure qui s'exécute sur un cluster Kubernetes (vos propres serveurs, ou le Kubernetes managé d'un fournisseur cloud) pour servir des modèles d'IA à d'autres applications en production, à grande échelle, avec des fonctionnalités comme l'autoscaling et des déploiements progressifs. Il est gratuit et open source, mais suppose que vous exploitez déjà Kubernetes.

📌Remarque: Cet avis s'appuie sur le dépôt GitHub, le README et le site de documentation publique de KServe. Il ne prétend pas que PromptQuorum a réalisé des déploiements de cluster pratiques de KServe, et évite délibérément de le présenter comme un outil accessible aux débutants — il s'adresse aux ingénieurs plateforme/ML exploitant une infrastructure Kubernetes de production.

Qu'est-ce que KServe ?

KServe est une plateforme de service de modèles standardisée et distribuée, pour déployer des modèles d'IA générative et prédictive à grande échelle sur Kubernetes. Son propre README le décrit comme unifiant « l'inférence d'IA générative et prédictive sur Kubernetes », assez simple pour des déploiements rapides, mais conçu pour gérer des charges de travail à l'échelle de l'entreprise.

  • Type de produit : logiciel d'infrastructure natif Kubernetes (définitions de ressources personnalisées, contrôleurs et composants d'exécution) — ni une application de bureau, ni un outil CLI autonome, ni un serveur d'inférence local pour une seule machine
  • Abstraction centrale : la ressource personnalisée (CRD) InferenceService, qui représente un point de terminaison de modèle déployé ; une ressource InferenceGraph enchaîne plusieurs composants (predictor, transformer, explainer)
  • Gouvernance : un projet en incubation à la Cloud Native Computing Foundation (CNCF), selon son propre README et son site
  • Licence : Apache 2.0, confirmée via les métadonnées de licence du dépôt GitHub
  • Dépôt : github.com/kserve/kserve, créé en mars 2019 — l'un des projets les plus établis de cette catégorie, et non un nouvel entrant
  • Échelle : plus de 5 900 étoiles GitHub, plus de 1 600 forks et plusieurs centaines de contributeurs au moment de cet avis

De KFServing à KServe : historique du projet

Le dépôt GitHub de KServe a été créé en mars 2019 sous le nom KFServing, en tant que composant de service du projet Kubeflow. Il a ensuite été renommé KServe et détaché en tant que projet indépendant, et a depuis rejoint la CNCF en tant que projet en incubation. Les versions récentes montrent une évolution vers l'unification du service d'IA générative orienté LLM aux côtés de ses capacités originelles de service ML prédictif.

  1. 1
    v0.18.0 — 29 avril 2026 : améliorations du service prédictif
    Why it matters: Fait partie de la ligne 0.18.x, axée sur la stabilité et les corrections de configuration avant la poussée de fonctionnalités d'IA générative de la 0.19, selon les notes de version.
  2. 2
    v0.18.1 — 15 juillet 2026 : corrections des charts Helm
    Why it matters: Une version corrective résolvant des problèmes de charts Helm issus de la ligne 0.18.0, selon le changelog officiel.
  3. 3
    v0.19.0 — 14 juin 2026 : LocalModelCache et traçage distribué
    Why it matters: Introduction du support LocalModelCache pour LLMInferenceService, d'une API de traçage distribué, d'un routage dual-protocole (REST/gRPC), ainsi que d'améliorations du statut d'autoscaling HPA/KEDA.
  4. 4
    v0.20.0 — 6 août 2026 : runtime vLLM et service confidentiel
    Why it matters: Ajout du support du runtime vLLM, de l'intégration AutoGluon Server, d'une capacité de service de modèles confidentiel, et d'améliorations du déchargement de cache KV — la version la plus axée sur le service génératif/LLM à ce jour, avec plus de 35 contributeurs selon les notes de version.
  5. 5
    v0.21.0-rc0 — 10 septembre 2026 : améliorations du service d'inférence LLM
    Why it matters: Une release candidate apportant de nouvelles améliorations à LLMInferenceService, des tests de cycle de vie de déploiement canary, et un support direct du scaling KEDA — la version taguée la plus récente que cet avis a pu confirmer au moment de sa publication.

Que pouvez-vous faire avec KServe ?

L'ensemble des fonctionnalités de KServe se divise entre le service d'IA générative (orienté LLM) et le service d'IA prédictive (ML traditionnel), unifiés sur une seule plateforme. Voici ce que fait chaque partie, selon le README et la documentation propres à KServe.

  • Service d'IA générative — inférence LLM adossée à vLLM et llm-d, un protocole d'inférence compatible OpenAI, un service accéléré par GPU avec gestion de mémoire optimisée, une mise en cache intelligente des modèles, et un déchargement de cache KV vers le CPU/disque pour les séquences plus longues
  • Service d'IA prédictive — déploiement de modèles multi-framework pour TensorFlow, PyTorch, scikit-learn, XGBoost et ONNX, avec un routage intelligent des requêtes entre les composants predictor, transformer et explainer
  • Schémas de déploiement avancés — déploiements canary, pipelines d'inférence et ensembles via la ressource InferenceGraph
  • Autoscaling — autoscaling basé sur les requêtes pour les charges de travail génératives et prédictives, y compris le scale-to-zero en mode Knative/serverless (non disponible en mode RawDeployment léger)
  • Explicabilité des modèles et surveillance — support intégré pour l'attribution de caractéristiques/les explications de modèles, ainsi que la journalisation des payloads, la détection d'anomalies, la détection adversariale et la détection de dérive pour les charges de travail prédictives
  • Modes de déploiement — Kubernetes standard (RawDeployment, léger, sans canary ni scale-to-zero), Knative/Serverless (ajoute canary et scale-to-zero), et ModelMesh (pour un service de modèles à haute échelle, haute densité et fréquemment modifié)
  • Intégration Kubeflow — KServe est un composant additionnel de Kubeflow, installable dans le cadre d'un déploiement Kubeflow sur AWS ou OpenShift, en plus d'une installation autonome

Exemples d'utilisation : trois façons d'utiliser KServe

Voici des workflows concrets construits à partir des fonctionnalités documentées de KServe ci-dessus — et non des cas d'usage hypothétiques. Tous nécessitent un cluster Kubernetes existant.

Tarifs KServe : est-il vraiment gratuit ?

Oui — KServe lui-même n'a aucun forfait payant. Il est sous licence Apache 2.0, gratuit et open source, sans version SaaS hébergée par un éditeur ni abonnement lié au projet lui-même.

  • Aucun abonnement, aucun forfait payant, aucune limite d'usage imposée par KServe lui-même
  • Vous l'exécutez sur une infrastructure Kubernetes que vous gérez déjà ou payez séparément — votre coût réel est donc le calcul sous-jacent (nœuds, GPU, stockage) plus les frais de Kubernetes managé éventuellement facturés par votre fournisseur cloud, et non KServe
  • Licence Apache 2.0 : permissive, autorise l'usage commercial, la modification et la redistribution, sans obligation de copyleft
  • En tant que projet en incubation CNCF, KServe est régi par une structure communautaire/fondation plutôt que par un unique éditeur commercial, bien que certaines organisations proposent un support commercial autour de lui

KServe vs. NVIDIA Dynamo

KServe et NVIDIA Dynamo visent tous deux le service d'inférence IA de production à grande échelle, mais partent de points de départ différents. KServe est une plateforme généraliste et native Kubernetes, unifiant le service génératif et prédictif sur de nombreux frameworks, régie par la CNCF. Dynamo est le framework de service d'inférence distribué propre à NVIDIA, plus étroitement optimisé pour le matériel GPU NVIDIA et les techniques de service désagrégé.

Gouvernance

KServe:
Projet en incubation CNCF, neutre vis-à-vis des éditeurs
NVIDIA Dynamo:
Projet piloté par NVIDIA — voir l'avis dédié pour les détails actuels de gouvernance

Périmètre

KServe:
Service IA générative + prédictive, multi-framework
NVIDIA Dynamo:
Principalement le service d'inférence générative/LLM

Plateforme

KServe:
Native Kubernetes (tout cluster/fournisseur GPU conforme)
NVIDIA Dynamo:
Optimisé spécifiquement pour l'infrastructure GPU NVIDIA

Dépendance matérielle

KServe:
Aucune imposée par KServe lui-même
NVIDIA Dynamo:
Lié aux GPU NVIDIA — voir l'avis dédié pour les détails

Licence

KServe:
Apache 2.0
NVIDIA Dynamo:
Voir l'avis Dynamo dédié pour les détails actuels de licence

Si votre infrastructure est multi-fournisseur ou si vous voulez une couche de service régie par la CNCF, indépendante du matériel, KServe est le choix le plus large. Si vous êtes déjà standardisé sur une infrastructure GPU NVIDIA et voulez un service optimisé spécifiquement pour elle, évaluez NVIDIA Dynamo directement — consultez cet avis dédié pour tous les détails plutôt que de supposer un chevauchement total des fonctionnalités.

À qui s'adresse KServe ?

Le choix de KServe dépend fortement du fait que vous exploitiez déjà une infrastructure Kubernetes et ayez besoin d'un service de modèles de qualité production à grande échelle, par opposition à vouloir une simple application de chat locale ou un serveur d'API à modèle unique.

Concurrents et alternatives

KServe se situe dans la catégorie du service de modèles de production à grande échelle, aux côtés d'autres plateformes d'inférence orientées datacenter/entreprise. Il se différencie en étant natif Kubernetes, régi par la CNCF, et en unifiant explicitement le service génératif et prédictif sur une seule plateforme plutôt que de se concentrer sur un seul des deux.

NVIDIA Dynamo

Réputé pour:
Framework de service d'inférence LLM distribué optimisé par NVIDIA
Articles sur NVIDIA Dynamo (2)

Également mentionné dans :

LMDeploy

Réputé pour:
Boîte à outils pour compresser, déployer et servir des LLM (de l'équipe InternLM/MMDeploy)
Articles sur LMDeploy (1)

Également mentionné dans :

vLLM

Réputé pour:
Moteur d'inférence et de service LLM à haut débit, que KServe peut lui-même exécuter comme backend
Lien:
vllm.ai
Articles sur vLLM (10)

+81 autres non affichés

Seldon Core

Réputé pour:
Autre plateforme de service de modèles ML native Kubernetes, proche du périmètre prédictif de KServe

Cette liste reflète les outils habituellement mentionnés aux côtés de KServe dans l'espace du service de modèles de production/entreprise, et non un classement indépendant de PromptQuorum — vérifiez le périmètre, les licences et les exigences matérielles actuels de chaque outil avant de choisir. Voir le Répertoire des logiciels LLM locaux pour le catalogue complet, qui couvre aussi les outils locaux mono-machine exclus de cette comparaison.

Erreurs courantes lors de l'évaluation de KServe

La plupart des confusions autour de KServe viennent de son historique de renommage, de sa dépendance à Kubernetes, ou de l'hypothèse qu'il s'agit d'un outil d'IA locale accessible aux débutants.

Questions fréquentes

Qu'est-ce que KServe ?

KServe (kserve.github.io/website, code source sur github.com/kserve/kserve) est une plateforme gratuite, open source et native Kubernetes pour déployer des modèles d'IA générative et prédictive à grande échelle sur votre propre cluster.

KServe est-il gratuit ?

Oui. Il est sous licence Apache 2.0, sans forfait payant ni version SaaS hébergée par un éditeur liée au projet lui-même. Votre coût réel est l'infrastructure Kubernetes (calcul, GPU, stockage) sur laquelle vous l'exécutez.

Ai-je besoin de Kubernetes pour utiliser KServe ?

Oui. KServe n'offre aucun chemin de déploiement autonome ou hors Kubernetes — il nécessite Kubernetes version 1.32 ou supérieure, selon son propre guide de démarrage rapide, ainsi que kubectl, Helm et git pour l'installation.

KServe s'appelait-il auparavant KFServing ?

Oui. Il a été lancé à l'origine sous le nom KFServing au sein du projet Kubeflow (dépôt créé en mars 2019), puis renommé KServe et détaché en tant que projet indépendant en incubation à la CNCF.

Quels frameworks ML KServe prend-il en charge ?

Pour l'IA prédictive : TensorFlow, PyTorch, scikit-learn, XGBoost et ONNX. Pour l'IA générative : l'inférence LLM via vLLM et llm-d, avec un protocole compatible OpenAI et un support natif des modèles Hugging Face.

KServe prend-il en charge les déploiements canary et l'autoscaling ?

Oui, en mode de déploiement Knative/Serverless — cela ajoute les déploiements canary et l'autoscaling basé sur les requêtes avec scale-to-zero. Le mode Kubernetes standard plus léger (RawDeployment) ne prend pas en charge ces fonctionnalités.

KServe convient-il à un débutant exécutant de l'IA locale sur une seule machine ?

Non. KServe est un logiciel d'infrastructure Kubernetes de production destiné aux ingénieurs plateforme/ML exploitant des clusters à grande échelle — et non une application de chat locale pour une seule machine. Pour ce cas d'usage, voir des outils comme Ollama ou LM Studio.

KServe est-il un projet CNCF ?

Oui, KServe est un projet en incubation à la Cloud Native Computing Foundation (CNCF), selon son propre README et son site de documentation.

Comment installer KServe pour l'expérimentation ?

Selon le propre guide de démarrage rapide de KServe, exécutez l'un de ses scripts d'installation rapide (mode Standard, mode Knative, ou LLMInferenceService uniquement) sur un cluster Kind ou Minikube local répondant à l'exigence Kubernetes 1.32+. Ces scripts sont explicitement réservés à l'expérimentation, et non à la production.

PromptQuorum a-t-il testé de façon indépendante les affirmations de KServe ?

Cet avis s'appuie sur le dépôt GitHub, le README, les notes de version et le site de documentation publique de KServe, plutôt que sur des tests pratiques de déploiement de cluster réalisés par PromptQuorum.

Sources

← Retour aux LLM locaux avancés