Skip to main content
PromptQuorum
/고급 로컬 LLM/vLLM이란? PagedAttention 기반 고성능 LLM 서빙 엔진 해설 (2026)
Overview & Reference

vLLM이란? PagedAttention 기반 고성능 LLM 서빙 엔진 해설 (2026)

·13분 소요·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

**vLLM은 UC Berkeley의 Sky Computing Lab에서 시작되어 현재는 대규모 오픈소스 커뮤니티가 관리하는, 무료이며 오픈소스(Apache 2.0)인 고성능 LLM 추론·서빙 라이브러리입니다.** 핵심 기술적 차별점은 PagedAttention으로, 운영체제가 가상 메모리를 관리하는 방식과 비슷하게 어텐션 KV 캐시를 고정 크기의 비연속 블록으로 관리합니다. 이를 통해 GPU는 각 요청에 메모리를 과도하게 할당하지 않고도 훨씬 더 많은 동시 요청의 상태를 유지할 수 있습니다. continuous batching과 결합하면, vLLM은 단순한 서빙 루프보다 적은 메모리 낭비로 한 대의 GPU(또는 텐서 병렬 멀티 GPU 구성)에서 다수의 동시 사용자를 처리할 수 있습니다. vLLM은 내장 OpenAI 호환 API 서버(vllm serve)를 제공하고, AWQ·GPTQ·FP8 등의 양자화 포맷을 지원하며, 프로덕션 및 멀티테넌트 서빙을 위해 만들어졌습니다 — Ollama나 LM Studio 같은 도구가 대상으로 하는 단일 사용자 클릭형 사용 사례를 위한 것이 아닙니다.

vLLM은 UC Berkeley의 Sky Computing Lab에서 시작되어 현재는 대규모 오픈소스 커뮤니티가 관리하는, 무료이며 Apache 2.0 라이선스인 LLM 추론·서빙 라이브러리입니다. 핵심 기술적 기여는 PagedAttention으로, 어텐션 키-값(KV) 캐시를 관리하는 메모리 관리 기법입니다. 이를 통해 단순한 어텐션 구현보다 같은 메모리로 훨씬 더 많은 동시 요청을 GPU에서 처리할 수 있으며, 고정 배치를 순서대로 처리하는 대신 다수의 동시 요청 동안 GPU를 계속 바쁘게 유지하는 continuous batching(연속 배칭)과 결합됩니다. vLLM은 OpenAI 호환 API 서버를 내장하고 있으며 다중 사용자 프로덕션 서빙을 대상으로 합니다 — Ollama나 LM Studio 같은 단일 사용자 데스크톱 앱과는 다른 종류의 도구입니다.

vLLM이란? PagedAttention 기반 고성능 LLM 서빙 엔진 해설 (2026)

핵심 요점

  • 무료이며 Apache 2.0 라이선스 오픈소스, UC Berkeley의 Sky Computing Lab에서 시작
  • PagedAttention이 고정 크기의 비연속 블록으로 KV 캐시를 관리해 GPU 메모리 낭비를 줄임
  • continuous batching이 고정 배치를 하나씩 처리하는 대신 다수의 동시 요청을 처리함
  • vllm serve 명령으로 실행하는 내장 OpenAI 호환 API 서버
  • AWQ, GPTQ, FP8 등의 양자화 포맷 지원
  • 여러 GPU에 걸친 텐서 병렬 및 파이프라인 병렬 서빙 지원
  • 주요하고 가장 잘 지원되는 하드웨어는 NVIDIA GPU이며, AMD·Intel 등 백엔드도 있지만 지원 범위가 더 좁음
  • 단일 사용자 데스크톱 앱이 아님 — 그래픽 설치 프로그램이 없고, llama.cpp나 Ollama처럼 CPU 전용이나 Apple Silicon을 대상으로 설계되지 않음

📍 한 문장으로

vLLM은 UC Berkeley의 Sky Computing Lab에서 시작된 무료, Apache 2.0 라이선스 추론·서빙 라이브러리로, PagedAttention과 continuous batching을 사용해 한 대의 GPU에서 다수의 동시 LLM 요청을 효율적으로 처리하며 내장 OpenAI 호환 API 서버를 제공한다.

💬 쉽게 말하면

데스크톱 채팅 앱이 아니라, vLLM은 서버 소프트웨어입니다. 모델을 지정하면 많은 사람이나 애플리케이션이 동시에 호출할 수 있는 API를 제공하며, 요청을 하나씩 처리하는 단순한 구성보다 GPU 메모리를 더 효율적으로 사용합니다.

📌참고: 이 글은 vLLM의 공식 GitHub 저장소와 공개 문서를 기반으로 작성되었으며, 자체 벤치마크 결과가 아닙니다. 구체적인 처리량이나 지연 시간 수치는 이 글을 위해 독립적으로 측정되지 않았고 GPU, 모델, 배치 크기, vLLM 버전에 따라 크게 달라지므로 포함하지 않았습니다.

vLLM이란 무엇인가?

vLLM은 대규모로 대형 언어 모델 추론을 실행하기 위한, 무료이며 Apache 2.0 라이선스인 라이브러리이자 서버입니다. UC Berkeley의 Sky Computing Lab의 연구 프로젝트로 시작되었으며, 이후 학계와 업계의 수천 명의 개발자가 기여하는 가장 널리 사용되는 오픈소스 LLM 서빙 엔진 중 하나로 성장했습니다. 자신의 기기에서 모델과 대화하는 단일 사용자를 주로 대상으로 만들어진 도구와 달리, vLLM은 여러 사용자나 애플리케이션의 다수 동시 요청을 공유 GPU 용량에서 가능한 한 효율적으로 처리하도록 설계되었습니다.

  • UC Berkeley의 Sky Computing Lab에서 시작되었으며, 현재는 커뮤니티가 주도하는 오픈소스 프로젝트
  • Apache 2.0 라이선스: 소스 코드는 라이선스 조건에 따라 사용, 수정, 재배포를 위해 공개되어 있음
  • Hugging Face Transformers 호환 포맷으로 모델을 로드해 Llama, Mistral, Qwen, DeepSeek 등 다양한 모델 계열의 아키텍처를 폭넓게 지원하며, 대부분의 모델에서 별도의 변환 단계가 필요 없음
  • 단일 대화를 빠르게 처리하는 것뿐 아니라 다수의 동시 요청을 효율적으로 처리하도록 만들어짐
  • GitHub에서 가장 많이 참조되는 오픈소스 LLM 서빙 프로젝트 중 하나

PagedAttention이란 무엇이고, 왜 중요한가?

PagedAttention은 vLLM이 가장 잘 알려진 메모리 관리 기법입니다. 생성 과정에서 트랜스포머 모델은 활성 상태인 각 요청의 모든 토큰에 대해 어텐션 키-값(KV) 캐시를 저장합니다 — 일반적으로 이 캐시는 요청이 가질 수 있는 최대 길이에 맞춰 크기가 정해진 하나의 큰 연속 블록으로 요청마다 할당되는데, 이는 요청이 일찍 끝나거나 예약된 최대치보다 짧을 때마다 GPU 메모리를 낭비하게 만듭니다. PagedAttention은 대신 KV 캐시를 작은 고정 크기 블록(페이지)으로 나누어 비연속적으로 할당하고 요청 간에 공유할 수 있게 합니다 — 운영체제가 가상 메모리를 관리하는 방식에서 아이디어를 빌려온 것입니다.

  • 결국 최대 길이보다 짧게 끝나는 요청을 위해 KV 캐시 공간을 과도하게 예약함으로써 발생하는 메모리 낭비를 줄임
  • 동일한 시스템 프롬프트처럼 공통 접두사를 공유하는 요청 간에 메모리 블록을 공유할 수 있게 함
  • 단순한 연속 할당 방식에 비해 같은 양의 메모리로 더 많은 동시 요청의 KV 캐시를 GPU에 유지할 수 있게 함
  • continuous batching과 함께 작동해, 고정 배치가 완전히 끝날 때까지 기다렸다가 다음 배치를 시작하는 대신 요청이 도착하고 완료됨에 따라 진행 중인 배치에 요청을 추가하거나 제거할 수 있게 함

vLLM에는 어떤 하드웨어가 필요한가?

vLLM의 주요하고 가장 잘 지원되는 대상은 CUDA를 갖춘 NVIDIA GPU이며, 대부분의 프로덕션 배포는 NVIDIA 하드웨어에서 실행됩니다. 프로젝트는 추가 백엔드도 문서화하고 있지만, 그 지원 범위와 성능이 모두 동등하지는 않습니다.

NVIDIA GPU (CUDA)

세부 사항:
주요하고 가장 성숙한 대상. 여러 NVIDIA GPU에 걸친 텐서 병렬·파이프라인 병렬 서빙이 잘 문서화되어 있고 프로덕션에서 널리 사용됨.

AMD GPU (ROCm)

세부 사항:
ROCm을 통해 AMD 하드웨어를 지원하는 백엔드로 문서화되어 있지만, 실제 채택과 커뮤니티 지원 범위는 CUDA 경로보다 좁음.

Intel GPU 및 Gaudi 가속기

세부 사항:
프로젝트가 Intel 하드웨어용으로 문서화한 추가 백엔드; NVIDIA GPU보다 더 작고 검증이 덜 된 배포 경로로 취급해야 함.

Google TPU

세부 사항:
이미 해당 인프라에서 운영 중인 팀을 위한, Google Cloud TPU 하드웨어용 문서화된 백엔드.

CPU (x86 / ARM / PowerPC)

세부 사항:
CPU 전용 백엔드가 존재하지만 vLLM이 대상으로 하는 사용 사례는 아님 — 프로젝트는 GPU 서빙을 위해 만들어졌으며, CPU 실행은 GPU 백엔드보다 상당히 느리다고 문서화되어 있음.

Apple Silicon (Mac)

세부 사항:
공식적으로 관리되는 최우선 경로가 아님. 커뮤니티가 관리하는 프로젝트(예: Metal 백엔드 플러그인)가 부분적인 Apple Silicon 지원을 추가하지만, 지원 범위와 성숙도는 vLLM의 NVIDIA GPU 지원에 크게 못 미침.

한 대의 Mac이나 CPU 전용 머신에서 모델을 실행하는 것이 목표라면, vLLM은 그 목적으로 만들어진 도구가 아닙니다 — llama.cpp와 그 위에 구축된 Ollama, LM Studio 같은 도구가 CPU와 Apple Silicon 하드웨어를 직접 대상으로 하며 그런 시나리오에 더 적합합니다.

vLLM은 어떤 양자화 포맷을 지원하는가?

vLLM은 단일 독점 포맷이 아니라 여러 확립된 양자화 포맷을 사용해, 메모리 사용량을 줄이고 많은 경우 처리량을 높이기 위해 낮은 수치 정밀도로 모델을 서빙하는 것을 지원합니다.

AWQ

세부 사항:
Activation-aware Weight Quantization은 널리 쓰이는 4비트 가중치 양자화 방식으로, 커뮤니티가 Hugging Face에 사전 양자화된 모델을 게시함.

GPTQ

세부 사항:
일반적으로 사전 양자화된 모델 체크포인트로 배포되는 학습 후 양자화 방식으로, 이 역시 보통 4비트 정밀도.

FP8

세부 사항:
하드웨어 FP8을 지원하는 최신 세대 NVIDIA GPU에서 지원되는 8비트 부동소수점 정밀도로, FP16/BF16 대비 정밀도를 다소 낮추는 대신 메모리 사용량을 줄이고 실행 속도를 높임.

INT8 / INT4

세부 사항:
추가적인 메모리 절감을 위해 AWQ, GPTQ와 함께 프로젝트가 문서화한 더 낮은 정밀도의 정수 양자화 경로.

이 글에는 포맷별로 독립적으로 측정한 품질 저하 수치가 포함되어 있지 않습니다 — 이는 모델 아키텍처와 작업에 따라 달라집니다. 자신의 프롬프트로 몇 가지 포맷의 출력을 비교해 보는 것이 자신의 워크로드에 맞는 트레이드오프를 판단하는 가장 신뢰할 수 있는 방법입니다.

vLLM의 OpenAI 호환 서버는 무엇을 제공하는가?

vllm serve를 실행하면 OpenAI API 프로토콜을 구현한 HTTP 서버가 시작되므로, 이미 OpenAI API용으로 만들어진 애플리케이션과 SDK는 흔히 기본 URL과 모델 이름만 바꿔서 자체 호스팅된 vLLM 인스턴스를 가리킬 수 있습니다.

  • OpenAI API 기반 클라이언트 코드의 직접적인 대체재로 사용할 수 있는, OpenAI 호환 채팅 완성 및 완성 엔드포인트
  • 설정 가능한 호스트와 포트(서버는 기본적으로 http://localhost:8000에서 대기)
  • 서버 시작 시 설정하는, 텐서 병렬 크기·GPU 메모리 사용률 목표·양자화 포맷에 대한 엔진 플래그
  • 하나의 로드된 기본 모델에 대해 여러 LoRA 어댑터를 서빙하는 지원
  • 호환되는 요청 형식에 대한 구조화된 출력 및 함수/도구 호출 지원

vLLM을 어떻게 설치하고 실행하는가?

vLLM은 파이썬 패키지로 배포되며, 일반적으로 NVIDIA GPU와 호환되는 CUDA 드라이버가 있는 파이썬 환경에서 pip으로 설치합니다.

  1. 1
    지원되는 NVIDIA GPU와 최신 CUDA 드라이버가 설치되어 있는지 확인합니다(AMD/Intel/TPU 백엔드 중 하나를 대상으로 한다면 해당 설치 안내를 프로젝트 문서에서 확인하세요).
  2. 2
    파이썬 가상 환경을 만들고 vLLM을 설치합니다: pip install vllm.
  3. 3
    Hugging Face의 모델로 OpenAI 호환 서버를 시작합니다. 예: vllm serve meta-llama/Llama-3.1-8B-Instruct.
  4. 4
    사전 양자화된 모델의 경우 해당 플래그를 전달합니다. 예: vllm serve TheBloke/Llama-2-13B-AWQ --quantization awq.
  5. 5
    멀티 GPU 서빙의 경우 텐서 병렬 플래그를 추가합니다. 예: vllm serve <model> --tensor-parallel-size 2로 모델을 두 개의 GPU에 분산합니다.
  6. 6
    기본적으로 서버는 http://localhost:8000에서 대기합니다. 아무 OpenAI API 호환 클라이언트 라이브러리나 curl/v1/chat/completions 엔드포인트에 요청을 보냅니다.
  7. 7
    기존 OpenAI API 클라이언트 코드는 기본 URL과 모델 이름만 바꿔서 자체 호스팅 서버를 가리키게 합니다.

vLLM을 실행하려면 GPU가 필요한가요?

테스트 이상의 용도라면 필요합니다 — vLLM의 주요하고 가장 잘 지원되는 대상은 NVIDIA GPU입니다. CPU 전용 백엔드가 존재하지만 상당히 느리다고 문서화되어 있으며 프로젝트의 초점이 아닙니다.

양자화된 모델로 vLLM을 실행할 수 있나요?

네 — vLLM은 AWQ, GPTQ, FP8 같은 포맷을 지원하며, 이런 포맷으로 사전 양자화된 많은 모델이 Hugging Face에 게시되어 있어 해당 --quantization 플래그로 서빙할 수 있습니다.

vLLM은 Ollama, LM Studio와 어떻게 다른가?

Ollama와 LM Studio는 vLLM과는 다른 문제를 대상으로 합니다: 한 사람에게 자신의 기기에서 대화할 수 있는 모델을 빠르고 간단하게 제공하는 것입니다. vLLM은 공유 GPU 용량에서 다수의 동시 사용자나 애플리케이션을 가능한 한 효율적으로 서빙하는 것을 목표로 합니다. 이 두 범주의 도구는 대부분의 사용 사례에서 서로 가까운 대체재가 아닙니다.

  • Ollama와 LM Studio는 보통 llama.cpp나 유사한 엔진, GGUF 모델 포맷 위에 구축되며, CPU 전용 머신과 Apple Silicon을 포함한 소비자용 하드웨어에서의 단일 사용자 사용에 최적화되어 있음
  • vLLM은 PagedAttention과 continuous batching 위에 구축되며, 보통 수준의 하드웨어에서의 단일 사용자 응답성보다 고동시성 GPU 서빙에 최적화되어 있음
  • Ollama는 GPU 없이 명령 하나로 설치됨; vLLM은 파이썬 환경, 대부분의 배포에서 NVIDIA GPU, 그리고 명령줄 설정을 필요로 함
  • LM Studio는 그래픽 데스크톱 채팅 인터페이스를 추가함; vLLM에는 그래픽 인터페이스가 없으며 OpenAI 호환 API나 명령줄 플래그를 통해 접근함
  • vLLM과 llama.cpp 기반 도구 모두 OpenAI 호환 API를 노출할 수 있어, 해당 API용으로 만들어진 프런트엔드 도구는 둘 중 어느 쪽과도 잘 작동하는 경우가 많음

vLLM은 TGI, TensorRT-LLM과 어떻게 다른가?

vLLM, Hugging Face의 Text Generation Inference(TGI), NVIDIA의 TensorRT-LLM은 모두 대규모 프로덕션 LLM 서빙이라는 같은 큰 과제를 대상으로 하지만, 설계와 트레이드오프가 다릅니다.

vLLM

세부 사항:
Apache 2.0 라이선스, 파이썬 기반, PagedAttention과 continuous batching을 중심으로 구축됨. Hugging Face Transformers 호환 모델을 직접 로드하며, 넓은 아키텍처 지원 범위와 다중 벤더 GPU 백엔드 지원(NVIDIA가 주력이며 AMD·Intel·TPU도 문서화됨)을 갖춤.

TGI

세부 사항:
Hugging Face 자체의 서빙 엔진으로, Apache 2.0 라이선스이며 continuous batching과 여러 양자화 포맷도 지원함. Hugging Face Hub 및 그 생태계와 긴밀하게 통합되어 있음.

TensorRT-LLM

세부 사항:
NVIDIA GPU 전용으로 만들어진 NVIDIA의 엔진. 모델은 대상 GPU에 최적화된 TensorRT 엔진으로 사전에 컴파일되며, 이는 해당 특정 하드웨어에서 뛰어난 성능을 낼 수 있지만 컴파일 단계가 필요하고 vLLM이나 TGI보다 하드웨어 간 유연성이 떨어짐.

이 글은 이 세 엔진을 서로 독립적으로 벤치마크하지 않았으며 어느 하나가 보편적으로 더 빠르다고 주장하지 않습니다 — 처리량은 모델, 하드웨어, 배치 특성, 각 엔진의 버전에 크게 좌우됩니다. 세 엔진의 배포와 라이선스에 대한 더 상세한 비교는 엔터프라이즈 추론 서버 가이드를 참고하세요.

vLLM은 누구에게 적합한가?

vLLM은 GPU 인프라에서 다수의 동시 사용자나 애플리케이션에 모델을 서빙하는 팀에 적합하며, 자신의 컴퓨터에서 모델과 가장 빨리 대화하는 방법을 찾는 사람을 위한 것이 아닙니다.

vLLM과 대안 한눈에 비교

이 도구들은 단일 사용자 사용과 프로덕션 서빙 사이의 스펙트럼에서 서로 다른 위치에 있습니다.

vLLM

인터페이스 및 설치:
pip으로 설치하는 파이썬 패키지; vllm serve로 실행하는 OpenAI 호환 API 서버. 대부분의 배포에서 NVIDIA GPU와 CUDA가 필요.
가장 적합한 용도:
프로덕션 환경의 고처리량, 다중 사용자 GPU 서빙.

Ollama

인터페이스 및 설치:
CLI와 REST API. 대부분의 플랫폼에서 llama.cpp를 백엔드로 사용한다고 흔히 알려져 있음. 명령 하나로 설치하고, 명령 하나로 모델을 내려받아 실행함.
가장 적합한 용도:
빌드 단계나 GPU 없이 단일 사용자를 위해 가장 빠르게 로컬 모델을 실행하는 방법.

LM Studio

인터페이스 및 설치:
Mac, Windows, Linux용 그래픽 데스크톱 앱. 다운로드하고 설치한 뒤 앱 안에서 모델을 찾아 내려받음.
가장 적합한 용도:
클릭 한 번으로 쓰는 로컬 채팅 앱을 원하는 비기술직 사용자.

llama.cpp

인터페이스 및 설치:
CLI, 내장 웹 UI, llama-server를 통한 OpenAI 호환 API. 소스에서 빌드하거나 미리 빌드된 바이너리 사용; CPU 또는 GPU에서 실행됨.
가장 적합한 용도:
엔진 수준의 직접적인 제어, 임베디드/엣지 배포, CPU나 Apple Silicon 하드웨어.

이 글은 이 도구들 간 속도나 출력 품질을 독립적으로 벤치마크하지 않았으며 어느 하나가 기술적으로 우수하다고 주장하지 않습니다 — 위 비교는 문서화된 아키텍처, 설치, 접근 모델 사실만 다룹니다. 하드웨어별 처리량 수치는 llama.cpp vs. Ollama vs. vLLM 비교엔터프라이즈 추론 서버 가이드를 참고하세요.

이 글이 다루지 않는 것

이 글은 vLLM의 공개 문서와 저장소를 바탕으로 작성된 해설 기사이며, 실제 벤치마크 보고서가 아닙니다.

  • 독립적으로 측정된 처리량, 지연 시간, 초당 요청 수 수치 없음 — 이는 GPU, 모델, 배치 구성, vLLM 버전에 크게 좌우됨
  • 특정 양자화 포맷에 대해 독립적으로 검증된 품질 저하 비율 없음 — 이는 모델 아키텍처와 작업에 따라 달라짐
  • vLLM 코드베이스에 대한 줄 단위 보안 감사 없음 — 오픈소스이며 Apache 2.0 라이선스이므로 코드 자체는 검토 가능함
  • 지원되는 모든 하드웨어 백엔드, 엔진 플래그, 배포 오케스트레이션 옵션(Kubernetes, 클라우드별 설정)에 대한 완전한 커버리지 없음 — 이 글은 대부분의 팀이 가장 먼저 평가하는 개념과 플래그에 초점을 맞춤
  • 상업적 지원 계약이나 vLLM 관리형 호스팅 서비스에 대한 다룸 없음 — vLLM 자체가 지원 계약이 있는 벤더 제품이 아니라 커뮤니티 오픈소스 프로젝트이기 때문

vLLM을 시도할 때 흔한 실수

vLLM과 관련된 대부분의 마찰은 이를 프로덕션 서버 소프트웨어가 아니라 단일 사용자 데스크톱 도구처럼 다루는 데서 비롯됩니다.

자주 묻는 질문

vLLM이란 무엇인가요?

vLLM은 UC Berkeley의 Sky Computing Lab에서 시작된, 고처리량 LLM 추론을 위한 무료, Apache 2.0 라이선스 라이브러리이자 서버입니다. PagedAttention과 continuous batching을 사용해 한 대의 GPU에서 다수의 동시 요청을 효율적으로 처리합니다.

vLLM은 무료인가요?

네. vLLM은 Apache 2.0 라이선스로 배포되는 무료 오픈소스 소프트웨어이며, 직접 실행하는 데 구독이나 계정이 필요하지 않습니다.

PagedAttention이란 무엇인가요?

PagedAttention은 요청마다 하나의 큰 연속 메모리를 할당하는 대신, 작고 고정 크기인 비연속 블록으로 어텐션 KV 캐시를 관리하는 vLLM의 기법으로, GPU 메모리 낭비를 줄이고 공통 접두사를 가진 요청 간에 메모리를 공유할 수 있게 합니다.

vLLM에는 GPU가 필요한가요?

실제 워크로드라면 필요합니다 — vLLM의 주요하고 가장 잘 지원되는 대상은 NVIDIA GPU입니다. CPU 전용 백엔드가 존재하지만 상당히 느리다고 문서화되어 있으며 프로젝트의 초점이 아니고, Apple Silicon 지원은 최우선 경로가 아니라 커뮤니티가 관리하는 애드온에 한정됩니다.

vLLM은 어떤 양자화 포맷을 지원하나요?

vLLM은 AWQ, GPTQ, FP8, INT8/INT4를 포함한 여러 포맷을 지원하며, 이런 포맷으로 사전 양자화된 많은 모델이 Hugging Face에 게시되어 있습니다.

vLLM이 Ollama보다 나은가요?

"더 낫다"는 것은 목적에 달려 있습니다: vLLM은 고동시성 프로덕션 GPU 서빙을 위해 만들어졌고, Ollama는 GPU 없이 단일 사용자 로컬 모델에 가장 빠르게 도달하기 위해 만들어졌습니다. 대부분의 사용 사례에서 서로 가까운 대체재가 아닙니다 — 위 비교표를 참고하세요.

vLLM은 여러 GPU에 걸쳐 모델을 서빙할 수 있나요?

네. vLLM은 여러 GPU에 걸친 텐서 병렬 및 파이프라인 병렬 서빙을 지원하며, 서버 시작 시 --tensor-parallel-size 같은 플래그로 설정할 수 있습니다.

vLLM에는 OpenAI 호환 API가 있나요?

네. vllm serve를 실행하면 OpenAI API 프로토콜을 구현한 서버가 시작되어, OpenAI API용으로 만들어진 많은 애플리케이션이 기본 URL과 모델 이름만 바꿔서 자체 호스팅된 vLLM 인스턴스를 가리킬 수 있습니다.

vLLM은 TensorRT-LLM과 어떻게 다른가요?

TensorRT-LLM은 NVIDIA의 엔진으로, 모델을 특정 NVIDIA GPU에 최적화된 엔진으로 미리 컴파일합니다. vLLM은 사전 컴파일 단계 없이 Hugging Face Transformers 호환 모델을 직접 로드하며, NVIDIA GPU 이외의 백엔드 지원도 문서화하고 있습니다. 이는 하드웨어별 최적화를 다소 희생하는 대신 더 큰 유연성과 더 빠른 반복을 제공합니다.

출처

← 고급 로컬 LLM으로 돌아가기