Skip to main content
PromptQuorum
/고급 로컬 LLM/KServe 리뷰: Kubernetes 네이티브 대규모 모델 서빙
Overview & Reference

KServe 리뷰: Kubernetes 네이티브 대규모 모델 서빙

·11분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

KServe는 생성형·예측형 AI 모델을 대규모로 배포하는 무료 오픈소스 Kubernetes 네이티브 모델 서빙 플랫폼입니다 — 기존 Kubernetes 클러스터가 필요하며, 단일 머신 로컬 AI 환경이 아니라 프로덕션 추론 인프라를 운영하는 플랫폼/ML 엔지니어를 대상으로 합니다. 원래 Kubeflow 프로젝트 산하 KFServing(2019년 생성)이었던 이 프로젝트는 현재 독립적인 CNCF 인큐베이팅 프로젝트이며 Apache 2.0 라이선스를 사용합니다. 멀티 프레임워크 예측형 서빙(TensorFlow, PyTorch, scikit-learn, XGBoost, ONNX)과 vLLM 기반 LLM 지향 생성형 서빙을 지원하며, 오토스케일링, 카나리 롤아웃, OpenAI 호환 추론 프로토콜을 제공합니다.

KServe (kserve.github.io/website, 소스 코드는 github.com/kserve/kserve)는 자체 클러스터에서 생성형·예측형 AI 모델을 모두 대규모로 배포할 수 있는 무료 오픈소스 Kubernetes 네이티브 플랫폼입니다. 2019년 Kubeflow 프로젝트 내 KFServing으로 처음 출시되었으며, 현재는 독립적인 Cloud Native Computing Foundation(CNCF) 인큐베이팅 프로젝트입니다. 이 리뷰는 KServe가 실제로 무엇을 하는지, 어떻게 설치하는지, 어떤 사용자에게 적합한지를 다룹니다 — 이는 단일 머신용 취미 앱이 아니라 프로덕션급 클러스터 운영 도구이므로, 이 리뷰도 그에 맞게 신중한 표현을 사용합니다.

핵심 요점

  • KServe(kserve.github.io/website)는 무료 오픈소스 Kubernetes 네이티브 모델 서빙 플랫폼이며, 단일 머신용 로컬 AI 앱이 아닙니다
  • 원래 Kubeflow 프로젝트 내 KFServing으로 출시되었으며, GitHub 저장소는 2019년 3월에 생성되었습니다
  • GitHub 저장소의 라이선스 메타데이터로 확인된 Apache 2.0 라이선스입니다
  • 자체 README 및 웹사이트 기준 Cloud Native Computing Foundation(CNCF) 인큐베이팅 프로젝트입니다
  • 생성형 AI 서빙(OpenAI 호환 프로토콜을 갖춘 vLLM 기반 LLM 추론)과 예측형 AI 서빙(TensorFlow, PyTorch, scikit-learn, XGBoost, ONNX)을 하나의 플랫폼에서 통합합니다
  • 기존 Kubernetes 클러스터(자체 퀵스타트 가이드 기준 버전 1.32 이상)가 필요하며, 독립 실행형 애플리케이션이 아닙니다
  • 이 리뷰 작성 시점 기준 GitHub 스타 5,900개 이상, 포크 1,600개 이상, 수백 명의 기여자입니다

📍 한 문장으로

KServe는 2019년 Kubeflow 산하 KFServing으로 처음 출시된 무료 오픈소스(Apache 2.0) Kubernetes 네이티브 CNCF 인큐베이팅 플랫폼으로, 생성형(LLM/vLLM 기반)과 예측형(멀티 프레임워크) AI 모델을 모두 자체 클러스터에서 대규모로 배포합니다.

💬 쉽게 말하면

KServe는 로컬 모델과 대화하기 위해 노트북에 설치하는 종류의 도구가 아닙니다 — 자체 서버든 클라우드 프로바이더의 매니지드 Kubernetes든, Kubernetes 클러스터에서 실행되어 오토스케일링과 점진적 롤아웃 같은 기능과 함께 다른 애플리케이션에 AI 모델을 프로덕션 규모로 서빙하는 인프라 소프트웨어입니다. 무료 오픈소스이지만, 이미 Kubernetes를 운영하고 있다는 전제가 필요합니다.

📌참고: 이 리뷰는 KServe 자체의 GitHub 저장소, README, 공개 문서 사이트를 바탕으로 작성되었습니다. PromptQuorum이 KServe를 직접 클러스터에 배포해 테스트했다고 주장하지 않으며, 의도적으로 이를 입문자 친화적인 도구로 과장하지 않습니다 — 이는 프로덕션 Kubernetes 인프라를 운영하는 플랫폼/ML 엔지니어를 대상으로 합니다.

KServe란 무엇입니까?

KServe는 Kubernetes에서 생성형·예측형 AI 모델을 대규모로 배포하는 표준화된 분산 모델 서빙 플랫폼입니다. 자체 README는 "Kubernetes에서의 생성형 및 예측형 AI 추론"을 통합한다고 설명하며, 빠른 배포가 가능할 만큼 단순하면서도 엔터프라이즈급 워크로드를 처리하도록 설계되었다고 밝힙니다.

  • 제품 유형: Kubernetes 네이티브 인프라 소프트웨어(사용자 정의 리소스 정의, 컨트롤러, 런타임 컴포넌트) — 데스크톱 앱도, 독립적으로 실행하는 CLI 도구도, 단일 머신 로컬 추론 서버도 아닙니다
  • 핵심 추상화: 배포된 모델 엔드포인트를 나타내는 InferenceService 사용자 정의 리소스(CRD); 여러 컴포넌트(predictor, transformer, explainer)를 연결하는 InferenceGraph 리소스
  • 거버넌스: 자체 README 및 웹사이트 기준 Cloud Native Computing Foundation(CNCF) 인큐베이팅 프로젝트
  • 라이선스: Apache 2.0, GitHub 저장소의 라이선스 메타데이터로 확인됨
  • 저장소: github.com/kserve/kserve, 2019년 3월 생성 — 이 카테고리에서 신생 프로젝트가 아니라 비교적 오래 자리 잡은 프로젝트입니다
  • 규모: 이 리뷰 작성 시점 기준 GitHub 스타 5,900개 이상, 포크 1,600개 이상, 수백 명의 기여자

KFServing에서 KServe로: 프로젝트 역사

KServe의 GitHub 저장소는 2019년 3월 KFServing이라는 이름으로 Kubeflow 프로젝트의 서빙 컴포넌트로서 생성되었습니다. 이후 KServe로 이름이 바뀌며 독립 프로젝트로 분리되었고, 현재는 CNCF 인큐베이팅 프로젝트로 참여하고 있습니다. 최근 릴리스는 기존 예측형 ML 서빙 기능과 함께 LLM 중심 생성형 AI 서빙을 통합하는 방향으로 이동하고 있습니다.

  1. 1
    v0.18.0 — 2026년 4월 29일: 예측형 서빙 개선
    Why it matters: 릴리스 노트에 따르면 0.19 생성형 AI 기능 강화에 앞서 안정성과 구성 수정에 초점을 맞춘 0.18.x 라인의 일부입니다.
  2. 2
    v0.18.1 — 2026년 7월 15일: Helm 차트 수정
    Why it matters: 공식 변경 로그에 따르면 0.18.0 라인의 Helm 차트 문제를 수정한 패치 릴리스입니다.
  3. 3
    v0.19.0 — 2026년 6월 14일: LocalModelCache 및 분산 트레이싱
    Why it matters: LLMInferenceService용 LocalModelCache 지원, 분산 트레이싱 API, 이중 프로토콜(REST/gRPC) 라우팅을 도입했으며, HPA/KEDA 오토스케일링 상태 개선도 포함되었습니다.
  4. 4
    v0.20.0 — 2026년 8월 6일: vLLM 런타임 및 기밀 서빙
    Why it matters: vLLM 런타임 지원, AutoGluon Server 통합, 기밀 모델 서빙 기능, KV 캐시 오프로딩 개선을 추가했습니다 — 릴리스 노트에 따르면 기여자 35명 이상이 참여한, 지금까지 생성형/LLM 서빙에 가장 초점을 맞춘 릴리스입니다.
  5. 5
    v0.21.0-rc0 — 2026년 9월 10일: LLM 추론 서비스 개선
    Why it matters: LLMInferenceService 추가 개선, 카나리 배포 수명 주기 테스트, 직접적인 KEDA 스케일링 지원을 담은 릴리스 후보로, 이 리뷰가 발행 시점에 확인할 수 있었던 가장 최근 태그 릴리스입니다.

KServe로 무엇을 할 수 있는가?

KServe의 기능은 생성형 AI 서빙(LLM 중심)과 예측형 AI 서빙(전통적 ML)으로 나뉘며, 하나의 플랫폼으로 통합되어 있습니다. KServe 자체 README문서를 기준으로 각 기능은 다음과 같습니다.

  • 생성형 AI 서빙 — vLLM 및 llm-d 기반 LLM 추론, OpenAI 호환 추론 프로토콜, 최적화된 메모리 관리를 갖춘 GPU 가속 서빙, 지능형 모델 캐싱, 더 긴 시퀀스를 위한 CPU/디스크 KV 캐시 오프로딩
  • 예측형 AI 서빙 — TensorFlow, PyTorch, scikit-learn, XGBoost, ONNX 모델을 위한 멀티 프레임워크 모델 배포와, predictor·transformer·explainer 컴포넌트 간 지능형 요청 라우팅
  • 고급 배포 패턴InferenceGraph 리소스를 통한 카나리 롤아웃, 추론 파이프라인, 앙상블
  • 오토스케일링 — 생성형·예측형 워크로드 모두를 위한 요청 기반 오토스케일링, Knative/서버리스 모드 실행 시 스케일 투 제로 포함(경량 RawDeployment 모드에서는 미지원)
  • 모델 설명 가능성 및 모니터링 — 특성 기여도/모델 설명에 대한 내장 지원과, 예측형 워크로드를 위한 페이로드 로깅, 이상치 탐지, 적대적 공격 탐지, 드리프트 탐지
  • 배포 모드 — 표준 Kubernetes(RawDeployment, 경량, 카나리/스케일 투 제로 미지원), Knative/서버리스(카나리와 스케일 투 제로 추가), ModelMesh(고규모·고밀도·빈번한 모델 변경 서빙용)
  • Kubeflow 통합 — KServe는 Kubeflow의 애드온 컴포넌트로, 독립 설치 외에도 AWS나 OpenShift상의 Kubeflow 배포 일부로 설치할 수 있습니다

사용 예시: KServe를 활용하는 세 가지 방법

아래는 앞서 소개한 KServe의 문서화된 기능을 바탕으로 한 실제 워크플로이며, 가상의 사용 사례가 아닙니다. 모두 기존 Kubernetes 클러스터가 필요합니다.

KServe 요금제: 정말 무료인가?

예 — KServe 자체에는 유료 등급이 없습니다. Apache 2.0 라이선스의 무료 오픈소스이며, 프로젝트 자체에 결부된 벤더 호스팅 SaaS 버전이나 구독제는 없습니다.

  • KServe 자체가 부과하는 구독료, 유료 등급, 사용량 제한이 없습니다
  • 이미 관리 중이거나 별도로 비용을 지불하는 Kubernetes 인프라에서 실행하므로, 실제 비용은 KServe가 아니라 기반 컴퓨팅(노드, GPU, 스토리지)과 클라우드 프로바이더의 매니지드 Kubernetes 요금입니다
  • Apache 2.0 라이선스: 상업적 이용, 수정, 재배포를 허용하는 관대한 라이선스이며 카피레프트 의무가 없습니다
  • CNCF 인큐베이팅 프로젝트로서 KServe는 단일 상업 벤더가 아니라 커뮤니티/재단 구조로 거버넌스가 이루어지지만, 일부 조직이 상업적 지원을 별도로 제공하기도 합니다

KServe와 NVIDIA Dynamo 비교

KServe와 NVIDIA Dynamo는 모두 대규모 프로덕션 AI 추론 서빙을 목표로 하지만, 출발점이 다릅니다. KServe는 여러 프레임워크에서 생성형·예측형 서빙을 통합하는 범용 Kubernetes 네이티브 플랫폼으로 CNCF가 거버넌스를 담당합니다. Dynamo는 NVIDIA 자체의 분산 추론 서빙 프레임워크로, NVIDIA GPU 하드웨어와 분리형(disaggregated) 서빙 기법에 더 긴밀하게 최적화되어 있습니다.

거버넌스

KServe:
CNCF 인큐베이팅 프로젝트, 벤더 중립
NVIDIA Dynamo:
NVIDIA 주도 프로젝트 — 현재 거버넌스는 전용 리뷰 참고

범위

KServe:
생성형 + 예측형 AI 서빙, 멀티 프레임워크
NVIDIA Dynamo:
주로 생성형/LLM 추론 서빙

플랫폼

KServe:
Kubernetes 네이티브(호환되는 모든 클러스터/GPU 벤더)
NVIDIA Dynamo:
NVIDIA GPU 인프라에 특화되어 최적화

하드웨어 종속성

KServe:
KServe 자체가 강제하는 종속성 없음
NVIDIA Dynamo:
NVIDIA GPU에 종속 — 세부 내용은 전용 리뷰 참고

라이선스

KServe:
Apache 2.0
NVIDIA Dynamo:
현재 라이선스 정보는 Dynamo 전용 리뷰 참고

인프라가 다중 벤더 환경이거나 CNCF가 거버넌스를 담당하는 프레임워크 중립적 서빙 계층을 원한다면 KServe가 더 폭넓게 맞습니다. 이미 NVIDIA GPU 인프라로 표준화되어 있고 그에 특화된 서빙을 원한다면, 전체 기능이 겹친다고 단정하지 말고 NVIDIA Dynamo를 직접 검토해 해당 전용 리뷰의 세부 내용을 확인하시기 바랍니다.

KServe는 누구에게 적합한가?

KServe가 적합한지는 이미 Kubernetes 인프라를 운영하며 대규모 프로덕션급 모델 서빙이 필요한지, 아니면 단순한 로컬 채팅 앱이나 단일 모델 API 서버를 원하는지에 크게 좌우됩니다.

경쟁 제품 및 대안

KServe는 데이터센터/엔터프라이즈 지향 추론 플랫폼과 함께 대규모 프로덕션 모델 서빙 카테고리에 속합니다. 하나의 영역에만 집중하지 않고 Kubernetes 네이티브, CNCF 거버넌스, 생성형·예측형 AI 서빙의 명시적 통합이라는 점에서 차별화됩니다.

NVIDIA Dynamo

대표 강점:
NVIDIA에 최적화된 분산 LLM 추론 서빙 프레임워크
NVIDIA Dynamo 관련 문서 (2개)

기타 언급:

LMDeploy

대표 강점:
LLM 압축, 배포, 서빙을 위한 툴킷(InternLM/MMDeploy 팀 제작)
LMDeploy 관련 문서 (1개)

기타 언급:

vLLM

대표 강점:
KServe가 백엔드로 실행할 수 있는 고처리량 LLM 추론 및 서빙 엔진
링크:
vllm.ai
vLLM 관련 문서 (10개)

표시되지 않은 81개 더보기

Seldon Core

대표 강점:
KServe의 예측형 서빙 범위에 더 가까운 또 다른 Kubernetes 네이티브 ML 모델 서빙 플랫폼
링크:
seldon.io

이 목록은 프로덕션/엔터프라이즈 모델 서빙 영역에서 KServe와 함께 자주 언급되는 도구를 정리한 것으로, PromptQuorum의 독자적인 순위가 아닙니다 — 선택 전에 각 도구의 현재 범위, 라이선스, 하드웨어 요구 사항을 직접 확인하시기 바랍니다. 이 비교에서 제외된 단일 머신 로컬 도구를 포함한 전체 카탈로그는 로컬 LLM 소프트웨어 디렉터리를 참고하십시오.

KServe 평가 시 흔한 오해

KServe에 대한 혼동은 대부분 이름 변경 이력, Kubernetes 의존성, 혹은 초보자 친화적인 로컬 AI 도구라는 오해에서 비롯됩니다.

자주 묻는 질문

KServe란 무엇입니까?

KServe(kserve.github.io/website, 소스는 github.com/kserve/kserve)는 자체 클러스터에서 생성형·예측형 AI 모델을 대규모로 배포하는 무료 오픈소스 Kubernetes 네이티브 플랫폼입니다.

KServe는 무료입니까?

예. Apache 2.0 라이선스이며, 프로젝트 자체에 결부된 유료 등급이나 벤더 호스팅 SaaS 버전은 없습니다. 실제 비용은 이를 실행하는 Kubernetes 인프라(컴퓨팅, GPU, 스토리지)입니다.

KServe를 사용하려면 Kubernetes가 필요합니까?

예. KServe에는 독립 실행형이나 비Kubernetes 배포 경로가 없습니다 — 자체 퀵스타트 가이드에 따르면 Kubernetes 버전 1.32 이상과 함께 설치를 위한 kubectl, Helm, git이 필요합니다.

KServe는 이전에 KFServing이라고 불렸습니까?

예. 원래 Kubeflow 프로젝트 내에서 KFServing으로 출시되었으며(저장소는 2019년 3월 생성), 이후 KServe로 이름이 바뀌어 독립적인 CNCF 인큐베이팅 프로젝트로 분리되었습니다.

KServe는 어떤 ML 프레임워크를 지원합니까?

예측형 AI의 경우 TensorFlow, PyTorch, scikit-learn, XGBoost, ONNX를 지원합니다. 생성형 AI의 경우 vLLM과 llm-d를 통한 LLM 추론을 지원하며, OpenAI 호환 프로토콜과 네이티브 Hugging Face 모델 지원을 제공합니다.

KServe는 카나리 롤아웃과 오토스케일링을 지원합니까?

예, Knative/서버리스 배포 모드에서 지원합니다 — 이 모드는 카나리 롤아웃과 스케일 투 제로를 포함한 요청 기반 오토스케일링을 추가합니다. 더 가벼운 표준 Kubernetes(RawDeployment) 모드는 이 기능들을 지원하지 않습니다.

한 대의 머신에서 로컬 AI를 실행하려는 초보자에게 KServe가 적합합니까?

아닙니다. KServe는 대규모 클러스터를 운영하는 플랫폼/ML 엔지니어를 대상으로 한 프로덕션 Kubernetes 인프라 소프트웨어이며, 단일 머신 로컬 채팅 앱이 아닙니다. 그런 용도라면 Ollama나 LM Studio 같은 도구를 참고하십시오.

KServe는 CNCF 프로젝트입니까?

예, KServe는 자체 README와 문서 사이트 기준 Cloud Native Computing Foundation(CNCF) 인큐베이팅 프로젝트입니다.

실험을 위해 KServe를 어떻게 설치합니까?

KServe 자체 퀵스타트 가이드에 따르면, Kubernetes 1.32 이상 요구 사항을 충족하는 로컬 Kind나 Minikube 클러스터에서 퀵 설치 스크립트(표준 모드, Knative 모드, 또는 LLMInferenceService 전용) 중 하나를 실행하십시오. 이는 명시적으로 실험용이며 프로덕션용이 아닙니다.

PromptQuorum이 KServe의 주장을 독자적으로 테스트했습니까?

이 리뷰는 PromptQuorum의 직접적인 클러스터 배포 테스트가 아니라, KServe 자체의 GitHub 저장소, README, 릴리스 노트, 공개 문서 사이트를 바탕으로 작성되었습니다.

출처

← 고급 로컬 LLM으로 돌아가기