Skip to main content
PromptQuorum
主页/本地LLM进阶/KServe 评测:原生支持 Kubernetes 的大规模模型服务平台
Overview & Reference

KServe 评测:原生支持 Kubernetes 的大规模模型服务平台

·阅读约11分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

KServe 是一个免费、开源、原生支持 Kubernetes 的模型服务平台,用于大规模部署生成式和预测式 AI 模型——它需要一个已有的 Kubernetes 集群,面向运维生产级推理基础设施的平台/机器学习工程师,而非单机本地 AI 环境。它最初是 Kubeflow 项目下的 KFServing(创建于 2019 年),如今已是采用 Apache 2.0 许可证的独立 CNCF 孵化项目,支持多框架预测式服务(TensorFlow、PyTorch、scikit-learn、XGBoost、ONNX)以及通过 vLLM 实现的面向 LLM 的生成式服务,并提供自动扩缩容、金丝雀发布和兼容 OpenAI 的推理协议。

KServe(kserve.github.io/website,源代码位于 github.com/kserve/kserve)是一个免费、开源、原生支持 Kubernetes 的平台,可在你自己的集群上大规模部署生成式和预测式 AI 模型。它最初于 2019 年作为 Kubeflow 项目中的 KFServing 推出,如今已成为云原生计算基金会(CNCF)的独立孵化项目。本评测介绍它实际能做什么、如何安装,以及适合哪些人使用——它是面向集群运维人员的生产级工具,而不是单机爱好者应用,因此本评测的措辞也相应保持审慎。

关键要点

  • KServe(kserve.github.io/website)是一个免费、开源、原生支持 Kubernetes 的模型服务平台——不是单机本地 AI 应用
  • 最初作为 Kubeflow 项目中的 KFServing 推出;其 GitHub 仓库创建于 2019 年 3 月
  • 采用 Apache 2.0 许可证,已通过 GitHub 仓库的许可证元数据确认
  • 根据其自身 README 和官网,是云原生计算基金会(CNCF)的孵化项目
  • 在一个平台上统一了生成式 AI 服务(基于 vLLM 的 LLM 推理,兼容 OpenAI 协议)与预测式 AI 服务(TensorFlow、PyTorch、scikit-learn、XGBoost、ONNX)
  • 需要一个已有的 Kubernetes 集群(根据其自身快速入门指南,需 1.32 或更高版本)——它不是一个独立应用程序
  • 截至本评测,GitHub star 数超过 5,900、fork 数超过 1,600,贡献者数以百计

📍 简单一句话

KServe 是一个免费、开源(Apache 2.0)、原生支持 Kubernetes、由 CNCF 孵化的平台,最初于 2019 年作为 Kubeflow 旗下的 KFServing 推出,可在你自己的集群上大规模部署生成式(基于 LLM/vLLM)和预测式(多框架)AI 模型。

💬 简单来说

KServe 不是那种装在笔记本电脑上用来和本地模型聊天的软件——它是运行在 Kubernetes 集群上(你自己的服务器,或云厂商的托管 Kubernetes)的基础设施软件,用于在生产环境中大规模地向其他应用提供 AI 模型服务,并具备自动扩缩容、渐进式发布等特性。它免费开源,但前提是你已经在运行 Kubernetes。

📌: 本评测基于 KServe 自身的 GitHub 仓库、README 和公开文档站点撰写。本文并不声称 PromptQuorum 已对 KServe 进行过实际集群部署测试,也刻意不将其过度宣传为一款新手友好型工具——它面向运维生产级 Kubernetes 基础设施的平台/机器学习工程师。

KServe 是什么?

KServe 是一个标准化的分布式模型服务平台,用于在 Kubernetes 上大规模部署生成式和预测式 AI 模型。其自身 README 将其描述为统一了"Kubernetes 上的生成式与预测式 AI 推理",既能满足快速部署的简单需求,又能支撑企业级规模的工作负载。

  • 产品类型:原生支持 Kubernetes 的基础设施软件(自定义资源定义、控制器和运行时组件)——不是桌面应用、独立运行的 CLI 工具,也不是单机本地推理服务器
  • 核心抽象:InferenceService 自定义资源(CRD),代表一个已部署的模型端点;InferenceGraph 资源则将预测器、转换器、解释器等多个组件串联在一起
  • 治理结构:根据其自身 README 和官网,是云原生计算基金会(CNCF)的孵化项目
  • 许可证:Apache 2.0,已通过 GitHub 仓库的许可证元数据确认
  • 代码仓库:github.com/kserve/kserve,创建于 2019 年 3 月——是该领域中较为成熟的项目之一,而非新入局者
  • 规模:截至本评测,GitHub star 数超过 5,900、fork 数超过 1,600,贡献者达数百人

从 KFServing 到 KServe:项目历史

KServe 的 GitHub 仓库创建于 2019 年 3 月,当时名为 KFServing,是 Kubeflow 项目中的一个服务组件。后来它被更名为 KServe 并独立成一个项目,此后又作为孵化项目加入了 CNCF。近期版本显示,该项目正在将面向 LLM 的生成式 AI 服务与其最初的预测式机器学习服务能力进行整合。

  1. 1
    v0.18.0——2026 年 4 月 29 日:预测式服务改进
    Why it matters: 根据发布说明,属于 0.18.x 系列版本,专注于稳定性和配置修复,为 0.19 版本的生成式 AI 功能推进做准备。
  2. 2
    v0.18.1——2026 年 7 月 15 日:Helm chart 修正
    Why it matters: 根据官方更新日志,这是修复 0.18.0 系列 Helm chart 问题的补丁版本。
  3. 3
    v0.19.0——2026 年 6 月 14 日:LocalModelCache 与分布式追踪
    Why it matters: 为 LLMInferenceService 引入了 LocalModelCache 支持、分布式追踪 API 和双协议(REST/gRPC)路由,并改进了 HPA/KEDA 自动扩缩容状态。
  4. 4
    v0.20.0——2026 年 8 月 6 日:vLLM 运行时与机密服务
    Why it matters: 新增 vLLM 运行时支持、AutoGluon Server 集成、机密模型服务能力以及 KV 缓存卸载改进——根据发布说明,这是迄今为止最专注于生成式/LLM 服务的版本,共有 35 位以上贡献者参与。
  5. 5
    v0.21.0-rc0——2026 年 9 月 10 日:LLM 推理服务改进
    Why it matters: 这是一个候选发布版本,进一步改进了 LLMInferenceService,新增了金丝雀部署生命周期测试和直接的 KEDA 扩缩容支持——截至本评测发布时,这是能够确认的最新标记版本。

KServe 能做什么?

KServe 的功能集分为生成式 AI 服务(专注 LLM)和预测式 AI 服务(传统机器学习)两部分,并统一在一个平台之下。以下是根据 KServe 自身 README文档整理的各部分功能说明。

  • 生成式 AI 服务——基于 vLLM 和 llm-d 的 LLM 推理、兼容 OpenAI 的推理协议、经过内存管理优化的 GPU 加速服务、智能模型缓存,以及针对长序列的 KV 缓存到 CPU/磁盘的卸载
  • 预测式 AI 服务——支持 TensorFlow、PyTorch、scikit-learn、XGBoost 和 ONNX 模型的多框架部署,并在预测器、转换器和解释器组件之间实现智能请求路由
  • 高级部署模式——通过 InferenceGraph 资源实现金丝雀发布、推理流水线和模型集成
  • 自动扩缩容——为生成式和预测式工作负载均提供基于请求量的自动扩缩容,在 Knative/serverless 模式下还支持缩容至零(轻量级 RawDeployment 模式不支持此功能)
  • 模型可解释性与监控——内置支持特征归因/模型解释功能,并为预测式工作负载提供载荷日志、异常检测、对抗样本检测和漂移检测
  • 部署模式——标准 Kubernetes(RawDeployment,轻量级,不支持金丝雀发布/缩容至零)、Knative/Serverless(支持金丝雀发布和缩容至零)以及 ModelMesh(适用于高规模、高密度、频繁变更的模型服务场景)
  • Kubeflow 集成——KServe 是 Kubeflow 的一个附加组件,除了独立安装外,还可以作为 AWS 或 OpenShift 上 Kubeflow 部署的一部分进行安装

使用示例:KServe 的三种使用方式

以下是基于 KServe 上述已记录功能构建的具体工作流程——而非假设性用例。所有场景都需要一个已有的 Kubernetes 集群。

KServe 定价:真的免费吗?

是的——KServe 本身没有付费套餐。它采用 Apache 2.0 许可证,免费开源,该项目本身也没有任何供应商托管的 SaaS 版本或订阅服务。

  • 没有订阅、没有付费套餐,KServe 本身也不设使用量限制
  • 你在自己已管理或另行付费的 Kubernetes 基础设施上运行它——因此真正的成本是底层计算资源(节点、GPU、存储),加上云厂商对托管 Kubernetes 收取的任何费用,而不是 KServe 本身
  • Apache 2.0 许可证:宽松型许可证,允许商业使用、修改和再分发,不附带任何 copyleft 义务
  • 作为 CNCF 孵化项目,KServe 由社区/基金会结构治理,而非单一商业供应商,不过也有一些机构围绕它提供商业支持服务

KServe 对比 NVIDIA Dynamo

KServe 和 NVIDIA Dynamo 都面向大规模生产级 AI 推理服务,但二者的出发点不同。KServe 是一个通用、原生支持 Kubernetes 的平台,由 CNCF 治理,在多个框架之间统一了生成式和预测式服务。Dynamo 则是 NVIDIA 自家的分布式推理服务框架,更紧密地围绕 NVIDIA GPU 硬件和分离式服务技术进行优化。

治理结构

KServe:
CNCF 孵化项目,厂商中立
NVIDIA Dynamo:
由 NVIDIA 主导的项目——具体治理详情请参见专门评测

覆盖范围

KServe:
生成式 + 预测式 AI 服务,多框架支持
NVIDIA Dynamo:
主要面向生成式/LLM 推理服务

平台

KServe:
原生支持 Kubernetes(适用于任何兼容集群/GPU 厂商)
NVIDIA Dynamo:
专门针对 NVIDIA GPU 基础设施进行优化

硬件绑定

KServe:
KServe 本身不强制绑定任何硬件
NVIDIA Dynamo:
绑定 NVIDIA GPU——具体细节请参见专门评测

许可证

KServe:
Apache 2.0
NVIDIA Dynamo:
具体许可证详情请参见 Dynamo 专门评测

如果你的基础设施是多厂商混合环境,或者你想要一个由 CNCF 治理、与框架无关的服务层,KServe 的适用范围更广。如果你已经统一使用 NVIDIA GPU 基础设施,并希望获得专门针对其调优的服务方案,请直接评估 NVIDIA Dynamo——具体细节请参见该专门评测,而不要假定二者功能完全重叠。

谁适合使用 KServe?

KServe 是否适合你,很大程度上取决于你是否已经在运维 Kubernetes 基础设施、并需要大规模生产级模型服务,还是你只想要一个简单的本地聊天应用或单模型 API 服务器。

竞品与替代方案

KServe 属于大规模生产级模型服务这一类别,与其他面向数据中心/企业的推理平台同属一个赛道。它的差异化在于原生支持 Kubernetes、由 CNCF 治理,并在一个平台上明确统一了生成式和预测式 AI 服务,而不是只专注于其中一种。

NVIDIA Dynamo

主要特点:
针对 NVIDIA 优化的分布式 LLM 推理服务框架
关于NVIDIA Dynamo的文章(2篇)

其他提及:

LMDeploy

主要特点:
用于压缩、部署和提供 LLM 服务的工具包(来自 InternLM/MMDeploy 团队)
关于LMDeploy的文章(1篇)

其他提及:

vLLM

主要特点:
高吞吐量 LLM 推理与服务引擎,KServe 本身也可将其作为后端运行
链接:
vllm.ai
关于vLLM的文章(10篇)

另有81篇未显示

Seldon Core

主要特点:
另一款原生支持 Kubernetes 的机器学习模型服务平台,与 KServe 的预测式服务范围更接近
链接:
seldon.io

此列表反映的是在生产/企业级模型服务领域中常与 KServe 一同被提及的工具,并非 PromptQuorum 独立排名——选择前请核实各工具当前的功能范围、许可证和硬件要求。完整目录请参见本地 LLM 软件目录,其中也涵盖了本次对比未包含的单机本地工具。

评估 KServe 时的常见误区

关于 KServe 的大多数误解,都源于它的更名历史、对 Kubernetes 的依赖,或误以为它是一款新手友好型本地 AI 工具。

常见问题

KServe 是什么?

KServe(kserve.github.io/website,源代码见 github.com/kserve/kserve)是一个免费、开源、原生支持 Kubernetes 的平台,可在你自己的集群上大规模部署生成式和预测式 AI 模型。

KServe 是免费的吗?

是的。它采用 Apache 2.0 许可证,该项目本身没有付费套餐或供应商托管的 SaaS 版本。你真正的成本在于运行它所依赖的 Kubernetes 基础设施(计算资源、GPU、存储)。

使用 KServe 需要 Kubernetes 吗?

需要。KServe 没有独立于 Kubernetes 之外的部署路径——根据其自身快速入门指南,它需要 Kubernetes 1.32 或更高版本,并需要安装 kubectl、Helm 和 git。

KServe 以前是否叫 KFServing?

是的。它最初作为 Kubeflow 项目中的 KFServing 推出(仓库创建于 2019 年 3 月),后来更名为 KServe,并独立成为一个 CNCF 孵化项目。

KServe 支持哪些机器学习框架?

预测式 AI 方面:TensorFlow、PyTorch、scikit-learn、XGBoost 和 ONNX。生成式 AI 方面:通过 vLLM 和 llm-d 实现 LLM 推理,支持兼容 OpenAI 的协议以及原生 Hugging Face 模型支持。

KServe 支持金丝雀发布和自动扩缩容吗?

支持,但仅限于 Knative/Serverless 部署模式——该模式增加了金丝雀发布以及支持缩容至零的基于请求量自动扩缩容。更轻量的标准 Kubernetes(RawDeployment)模式不支持这些功能。

KServe 适合在单机上运行本地 AI 的新手吗?

不适合。KServe 是面向大规模运维集群的平台/机器学习工程师的生产级 Kubernetes 基础设施软件——不是单机本地聊天应用。这种需求建议改用 Ollama 或 LM Studio 这类工具。

KServe 是 CNCF 项目吗?

是的,根据其自身 README 和文档站点,KServe 是云原生计算基金会(CNCF)的孵化项目。

如何安装 KServe 用于实验?

根据 KServe 自身的快速入门指南,可以在满足 Kubernetes 1.32+ 要求的本地 Kind 或 Minikube 集群上,运行其中一个快速安装脚本(标准模式、Knative 模式,或仅 LLMInferenceService)。这些脚本被明确标注为仅用于实验,而非生产环境。

PromptQuorum 是否独立测试过 KServe 的相关说法?

本评测基于 KServe 自身的 GitHub 仓库、README、发布说明和公开文档站点撰写,而非 PromptQuorum 的实际集群部署测试。

资料来源

← 返回 本地LLM进阶