Skip to main content
PromptQuorum
/고급 로컬 LLM/LMDeploy 리뷰: 고처리량 LLM 서빙과 양자화
Overview & Reference

LMDeploy 리뷰: 고처리량 LLM 서빙과 양자화

·10분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

LMDeploy는 NVIDIA GPU에서 대형 언어 모델을 압축, 양자화, 서빙하기 위한 무료 오픈소스(Apache 2.0) 명령줄 툴킷 겸 Python 라이브러리로, pip install lmdeploy로 설치합니다. InternLM/OpenMMLab 생태계 내 MMRazor 및 MMDeploy 팀이 개발했으며, TurboMind(처리량에 최적화된 C++/CUDA 엔진)와 순수 Python 기반 PyTorch 엔진이라는 두 가지 추론 엔진에 더해 AWQ 및 KV 캐시 양자화, OpenAI 호환 API 서버, 그리고 50개를 훨씬 웃도는 오픈 웨이트 LLM 및 VLM 계열 지원을 갖추고 있습니다.

LMDeploy(github.com/InternLM/lmdeploy)는 대형 언어 모델을 압축, 양자화, 서빙하기 위한 무료 오픈소스(Apache 2.0) 툴킷으로, InternLM/OpenMMLab 생태계 내 MMRazor 및 MMDeploy 팀이 개발했습니다. pip install lmdeploy로 설치하며 TurboMind와 순수 Python 기반 PyTorch 엔진이라는 두 가지 추론 엔진과 OpenAI 호환 API 서버를 제공하고, GitHub 스타 수는 8,000개를 넘습니다. 이 리뷰는 로컬 LLM 소프트웨어 디렉터리의 LMDeploy 항목과 짝을 이루는 글로, 실제로 무엇을 할 수 있는지, 어떻게 설치하는지, 누구에게 적합한지를 다룹니다.

핵심 요점

  • LMDeploy(github.com/InternLM/lmdeploy)는 무료, 오픈소스이며 pip로 설치 가능한 추론·양자화 툴킷으로, GUI 앱이 아닌 CLI/라이브러리다
  • InternLM/OpenMMLab 생태계(상하이 AI 연구소) 내 MMRazor 및 MMDeploy 팀이 개발; 저장소는 2023년 6월 15일 생성
  • GitHub 저장소의 LICENSE 파일로 확인된 Apache 2.0 라이선스
  • 두 가지 추론 엔진 탑재: TurboMind(C++/CUDA, 처리량 최적화)와 순수 Python 기반 PyTorch 엔진
  • AWQ 4비트 가중치 전용 양자화와 int8/int4 KV 캐시 양자화 지원
  • 이 리뷰 작성 시점 기준 GitHub 스타 8,000개 이상, 포크 750개 이상; 최신 태그 릴리스는 v0.17.0으로 2026년 9월 1일 공개됨

📍 한 문장으로

LMDeploy는 InternLM/OpenMMLab 생태계 내 MMRazor 및 MMDeploy 팀이 개발한, NVIDIA GPU에서 LLM을 압축, 양자화, 서빙하기 위한 무료 오픈소스(Apache 2.0) 툴킷으로, pip install lmdeploy로 설치하며 GitHub 스타 8,000개 이상을 보유하고 있다.

💬 쉽게 말하면

LMDeploy는 pip로 설치하는 명령줄 도구이자 Python 라이브러리로, 이미 가지고 있는 LLM(예: HuggingFace에서 받은 모델)을 자신의 GPU에서 빠르게 실행해주며, 필요하면 먼저 4비트 양자화로 축소해 메모리 사용량을 줄일 수 있습니다. 클릭할 창이 있는 채팅 앱이 아니라 서버에서 실행하는 인프라이며, 다른 애플리케이션들은 OpenAI 호환 API를 통해 이와 통신합니다.

📌참고: 이 리뷰는 LMDeploy 자체의 GitHub 저장소, README, 문서, PyPI 페이지를 기반으로 합니다. 처리량 및 양자화 속도 수치("vLLM보다 1.8배 빠름" 등)는 LMDeploy가 자체 발표한 벤치마크이며 PromptQuorum이 독립적으로 측정한 것이 아닙니다 — 구매나 아키텍처 결정에서 특정 수치에 의존하기 전에 최신 공개 벤치마크를 확인하세요.

LMDeploy란?

LMDeploy는 대형 언어 모델을 압축, 배포, 서빙하기 위한 툴킷으로, NVIDIA GPU에서 고처리량 추론을 수행하도록 만들어졌습니다. GitHub 설명에 따르면 MMRazor 및 MMDeploy 팀이 개발했으며, 두 팀 모두 InternLM 모델 계열을 만든 곳과 같은 조직인 상하이 AI 연구소가 운영하는 오픈소스 컴퓨터 비전·모델 배포 생태계인 OpenMMLab 산하 프로젝트입니다.

  • 제품 유형: 명령줄 도구와 Python 라이브러리 — 그래픽 인터페이스는 없으며 터미널, Python 스크립트, Docker 컨테이너에서 사용
  • 개발사: MMRazor 및 MMDeploy 팀, 상하이 AI 연구소 산하 InternLM/OpenMMLab 생태계의 일부
  • 저장소: GitHub의 InternLM/lmdeploy, 2023년 6월 15일 생성
  • 라이선스: Apache 2.0, 저장소의 LICENSE 파일로 확인됨
  • 규모: 이 리뷰 작성 시점 기준 GitHub 스타 8,000개 이상, 포크 750개, 열린 이슈 596개
  • 배포: PyPI에 lmdeploy 패키지로 게시되며, 프로젝트 문서에 따르면 공식 Docker 이미지도 제공됨

프로젝트 연혁과 버전 이정표

LMDeploy의 GitHub 저장소는 2023년 6월에 생성되었으며, 이후 단일 TurboMind 추론 엔진에서 양자화, 멀티모달(VLM) 지원, 분산 서빙을 갖춘 두 엔진 체제의 툴킷으로 지속적으로 확장되어 왔습니다.

  1. 1
    2023/08 — 4비트 AWQ 양자화 및 HuggingFace Hub 공개
    Why it matters: 공식 변경 로그에 따르면 AWQ 기반 4비트 가중치 전용 양자화를 추가하고 즉시 사용 가능한 4비트 모델을 HuggingFace에 공개했다.
  2. 2
    2024/01 — PyTorch 추론 엔진 도입
    Why it matters: TurboMind와 함께 순수 Python으로 작성된 두 번째 추론 엔진을 추가해, 개발자가 서빙 스택을 확장하거나 디버그하는 진입 장벽을 낮췄다.
  3. 3
    2024/06–2024/07 — VLM 및 함수 호출 지원
    Why it matters: 멀티모달(시각-언어 모델) 추론 파이프라인과 서빙을 추가했고, Llama 3.1 및 InternLM2.5용 도구/함수 호출도 함께 추가했다.
  4. 4
    2025/01 — DeepSeek V3 및 R1 지원
    Why it matters: 널리 사용되는 추론 모델 계열인 DeepSeek V3 및 R1 모델 계열을 출시 시점에 가깝게 지원했다.
  5. 5
    2025/06 — DeepSeek PD 분리
    Why it matters: DLSlime과 Mooncake를 통해 DeepSeek 모델용 prefill/decode 분리를 통합했으며, 이는 대규모 MoE 모델 서빙을 여러 머신에 걸쳐 확장하는 프로덕션 기법이다.
  6. 6
    2025/09 — NVIDIA GPU(V100 이상)에서 MXFP4 지원
    Why it matters: MXFP4 양자화 추론을 추가했으며, LMDeploy 자체 변경 로그에 따르면 H800 GPU에서 OpenAI gpt-oss 모델 기준 vLLM 대비 1.5배 처리량을 기록했다.
  7. 7
    2026/02 — Qwen3.5 지원 및 llm-compressor 통합
    Why it matters: Qwen3.5 모델 컬렉션 지원을 추가하고, 대칭/비대칭 4비트 양자화를 위해 vllm-project/llm-compressor를 통합했다.
  8. 8
    v0.17.0 — 2026년 9월 1일
    Why it matters: 이 리뷰 작성 시점 기준 GitHub 최신 태그 릴리스 — 이 리뷰 게시일 이후 출시된 내용은 [GitHub 릴리스 페이지](https://github.com/InternLM/lmdeploy/releases)에서 직접 확인하세요.

LMDeploy로 할 수 있는 것

LMDeploy의 기능 구성은 모델을 양자화로 축소하고, 효율적으로 실행하고, 네트워크 서비스로 노출하는 세 가지 작업을 중심으로 합니다. LMDeploy 자체의 README문서에 따르면 각 부분이 실제로 하는 일은 다음과 같습니다.

  • 두 가지 추론 엔진 — LMDeploy가 가장 높은 처리량 옵션으로 내세우는 C++/CUDA 엔진인 TurboMind와, 확장하거나 새 모델 아키텍처를 추가하기 더 쉬운 순수 Python 기반 PyTorch 엔진; LMDeploy 자체의 지원 모델 표를 참고해 모델별로 선택
  • 지속적 배칭과 페이지드 어텐션 — 지속적(연속) 배칭, 블록/페이지 단위 KV 캐시, 동적 split-and-fuse 등, 동시 요청 상황에서 GPU 활용도를 높이기 위해 다른 프로덕션급 추론 엔진들도 사용하는 것과 같은 부류의 기법
  • 양자화 — AWQ 4비트 가중치 전용 양자화에 더해 AWQ와 동시에 조합할 수 있는 int8/int4 KV 캐시 양자화, 그리고 (2026/02부터) llm-compressor 통합을 통한 대칭/비대칭 4비트 양자화
  • 폭넓은 모델 지원 — LMDeploy의 지원 모델 문서에 따르면 Llama, Llama2/3/3.1/3.2, InternLM2/3, Qwen1.5/2/2.5/3, Qwen3-MoE, Qwen3-Next, DeepSeek-MoE/V2/V3/R1, Mistral, Mixtral, ChatGLM2, GLM-4, Yi, Baichuan2, Code Llama 등 수십 개의 LLM 계열
  • 시각-언어 모델(VLM) 지원 — InternVL, LLaVA, MiniGemini, CogVLM2 등 멀티모달 모델을 위한 오프라인 추론 파이프라인과 API 서빙
  • OpenAI 호환 API 서버lmdeploy serve api_server를 실행하면 OpenAI 채팅 완성 요청/응답 형식을 모방하는 서버가 시작되며, LLM과 VLM에 대해 각각 별도로 문서화되어 있음
  • 오프라인 배치 추론 파이프라인 — 서버를 세우지 않고 스크립트 안에서 직접 추론을 실행할 수 있는 Python lmdeploy.pipeline() API
  • 다중 모델, 다중 머신 프록시 서버 — 여러 머신과 GPU에 걸쳐 여러 모델을 하나의 진입점 뒤에서 실행하기 위한 요청 분산 서비스
  • NVIDIA CUDA GPU를 넘어서는 하드웨어 지원 — PyTorch 엔진을 통한 화웨이 어센드(Ascend) NPU 지원, TurboMind를 통한 Windows 지원(텐서 병렬 차수 1)

사용 예시: LMDeploy를 사용하는 세 가지 방법

다음은 위에서 문서화한 LMDeploy 명령어를 기반으로 한 구체적인 워크플로우이며, 가상의 사용 사례가 아닙니다.

가격과 라이선스

LMDeploy는 무료이자 오픈소스이며 유료 등급이 없습니다. GitHub 저장소의 LICENSE 파일은 수정 없이 Apache License, Version 2.0을 적용하며, 프로젝트 문서 어디에도 가격 페이지가 없습니다.

  • 구독도, 유료 등급도, LMDeploy 자체가 부과하는 사용량 제한도 없음
  • 툴킷을 설치하거나 사용하는 데 계정이나 가입이 필요하지 않음
  • 실제 비용은 LMDeploy를 실행하는 GPU 하드웨어나 클라우드 GPU 인스턴스의 비용이며, LMDeploy 자체는 추가 요금을 부과하지 않음
  • Apache 2.0은 관대한 라이선스로, 자체 코드를 공개해야 하는 카피레프트 의무가 없으며 상업적/프로덕션 사용이 명시적으로 허용됨

LMDeploy vs. vLLM

LMDeploy와 vLLM은 가장 널리 쓰이는 오픈소스 LLM 추론 엔진 중 두 가지이며, LMDeploy 자체 마케팅도 명시적으로 vLLM을 벤치마크 대상으로 삼고 있습니다. 둘 다 무료이고, Apache 2.0에 가까우며(vLLM도 Apache 2.0), Python으로 설치 가능하고, OpenAI 호환 API 서버를 지원합니다 — 차이는 주로 엔진 아키텍처, 생태계 규모, 중점을 두는 모델 계열에 있습니다.

핵심 엔진

LMDeploy:
TurboMind(C++/CUDA)와 PyTorch 엔진
vLLM:
PagedAttention 기반 단일 엔진

처리량 주장

LMDeploy:
vLLM 대비 최대 1.8배(자체 보고)
vLLM:
업계 표준 기준선으로 널리 인용됨

양자화

LMDeploy:
AWQ, int8/int4 KV 캐시, MXFP4
vLLM:
AWQ, GPTQ, FP8 등 다양한 형식

생태계 규모

LMDeploy:
약 8,000 GitHub 스타
vLLM:
더 큰 커뮤니티와 더 넓은 서드파티 연동 범위

모델 계열 강점

LMDeploy:
InternLM과 Qwen에 대한 강력한 일급 지원
vLLM:
매우 폭넓으며 여러 랩의 신모델을 가장 먼저 지원하는 경우가 많음

개발사

LMDeploy:
MMRazor/MMDeploy 팀(상하이 AI 연구소)
vLLM:
UC 버클리에서 시작되어 지금은 여러 기업이 참여하는 폭넓은 오픈소스 프로젝트

LMDeploy의 처리량 주장은 자체 발표한 수치이며 PromptQuorum의 독립적인 벤치마크가 아닙니다 — 프로덕션에서 둘 중 하나를 선택하기 전에 목표 모델, GPU, 트래픽 패턴으로 직접 비교해 보세요. vLLM 자체에 대한 자세한 내용은 vLLM 해설을 참고하세요.

LMDeploy는 누구에게 적합한가

LMDeploy는 데스크톱 채팅 앱이 아니라 양자화를 지원하는 고처리량 서빙 스택을 원하며, 자체 관리하는 NVIDIA GPU 인프라에 LLM을 배포하는 팀에 적합합니다.

경쟁 제품 및 대안

LMDeploy는 vLLM, TensorRT-LLM, SGLang, ExLlamaV2와 함께 프로덕션 LLM 서빙 엔진 영역에 속합니다 — 이들은 소비자용 데스크톱 앱과 달리 전용 GPU 하드웨어에서 대규모로 모델을 실행하도록 만들어진 도구입니다.

vLLM

대표적 특징:
가장 널리 채택된 오픈소스 추론 엔진, PagedAttention, 신모델에 대한 폭넓은 출시 당일 지원
vLLM 관련 문서 (10개)

표시되지 않은 81개 더보기

TensorRT-LLM

대표적 특징:
NVIDIA 자체의 컴파일러 기반 추론 라이브러리로, 자사 하드웨어에 깊이 최적화됨
TensorRT-LLM 관련 문서 (7개)

기타 언급:

SGLang

대표적 특징:
RadixAttention 캐싱을 중심으로 구축된 추론 엔진 겸 구조화 생성 언어
SGLang 관련 문서 (5개)

기타 언급:

ExLlamaV2

대표적 특징:
양자화에 특화된 엔진으로, 소비자용 GPU에서 GPTQ/EXL2 모델을 실행하는 데 인기 있음
ExLlamaV2 관련 문서 (2개)

기타 언급:

이 목록은 프로덕션 서빙 영역에서 LMDeploy와 흔히 비교되는 도구들을 보여줄 뿐, PromptQuorum의 독립적인 순위가 아닙니다 — 선택하기 전에 각 도구의 현재 기능 집합과 하드웨어 요구 사항을 확인하세요.

LMDeploy 평가 시 흔한 실수

LMDeploy에 대한 혼란은 대부분 이를 데스크톱 채팅 앱처럼 취급하거나, 자체 보고된 벤치마크 수치를 독립적으로 검증된 사실처럼 인용하는 데서 비롯됩니다.

자주 묻는 질문

LMDeploy란 무엇인가요?

LMDeploy(github.com/InternLM/lmdeploy)는 NVIDIA GPU에서 대형 언어 모델을 압축, 양자화, 서빙하기 위한 무료 오픈소스(Apache 2.0) 툴킷으로, InternLM/OpenMMLab 생태계 내 MMRazor 및 MMDeploy 팀이 개발했습니다.

LMDeploy는 무료인가요?

네. LMDeploy는 Apache 2.0 라이선스이며 가격 페이지나 유료 등급이 없습니다. 실제 비용은 이를 실행하는 GPU 하드웨어나 클라우드 인스턴스의 비용입니다.

LMDeploy는 어떻게 설치하나요?

Python 3.10–3.13 환경에서 pip install lmdeploy를 실행하세요(conda 환경 사용을 권장). v0.13.0부터 기본 PyPI 휠이 CUDA 12.8을 대상으로 하므로, 일반적인 NVIDIA GPU 환경에서는 별도의 CUDA 설치 없이도 대개 충분합니다.

LMDeploy에 그래픽 인터페이스가 있나요?

없습니다. LMDeploy는 명령줄 툴킷이자 Python 라이브러리입니다. 채팅 창이 없으며, 터미널이나 Python 스크립트, 또는 OpenAI 호환 API 서버를 통해 상호작용합니다.

LMDeploy가 vLLM보다 빠른가요?

LMDeploy 자체 README는 자체 발표한 벤치마크를 근거로 vLLM 대비 최대 1.8배 높은 요청 처리량을 보고합니다. 이는 독립적으로 검증된 수치가 아니므로, 이에 의존하기 전에 목표 모델과 하드웨어로 직접 벤치마크를 실행하세요.

LMDeploy는 어떤 양자화를 지원하나요?

AWQ 4비트 가중치 전용 양자화, int8/int4 KV 캐시 양자화(AWQ와 조합 가능), 지원되는 NVIDIA GPU에서의 MXFP4, 그리고 2026/02부터는 vllm-project/llm-compressor와의 통합을 통한 대칭/비대칭 4비트 양자화를 지원합니다.

LMDeploy는 어떤 모델을 지원하나요?

Llama, InternLM2/3, Qwen1.5부터 Qwen3까지, DeepSeek-MoE/V2/V3/R1, Mistral, ChatGLM2, GLM-4, Code Llama를 포함한 수십 개의 LLM 계열과, InternVL, LLaVA, CogVLM2 같은 시각-언어 모델을 지원합니다. 완전하고 최신인 목록은 LMDeploy 자체의 지원 모델 문서를 참고하세요.

LMDeploy는 NVIDIA 이외의 GPU도 지원하나요?

주요 TurboMind 엔진은 NVIDIA CUDA GPU를 대상으로 합니다. PyTorch 엔진은 화웨이 어센드 NPU 지원을 추가합니다. 이 리뷰에서는 CPU 전용이나 Apple Silicon 지원 경로를 찾지 못했습니다.

LMDeploy는 누가 개발하나요?

상하이 AI 연구소가 관리하는 오픈소스 InternLM/OpenMMLab 생태계의 일부인 MMRazor 및 MMDeploy 팀입니다.

LMDeploy에 OpenAI 호환 API 서버가 있나요?

네. lmdeploy serve api_server를 실행하면 OpenAI 채팅 완성 요청/응답 형식을 모방하는 로컬 서버가 시작되어, 기존 OpenAI 클라이언트 코드가 클라우드 엔드포인트 대신 이곳을 가리키도록 할 수 있습니다.

출처

← 고급 로컬 LLM으로 돌아가기