关键要点
- LMDeploy(github.com/InternLM/lmdeploy)是一款免费、开源、可通过 pip 安装的推理与量化工具包——是 CLI/库,而非 GUI 应用
- 由 InternLM/OpenMMLab 生态系统(上海人工智能实验室)内的 MMRazor 与 MMDeploy 团队开发;仓库创建于 2023 年 6 月 15 日
- Apache 2.0 许可,已通过 GitHub 仓库的 LICENSE 文件确认
- 内置两个推理引擎:TurboMind(C++/CUDA,针对吞吐量优化)和一个纯 Python 的 PyTorch 引擎
- 支持 AWQ 4 位仅权重量化以及 int8/int4 KV 缓存量化
- 截至本评测时 GitHub 星标超过 8,000,Fork 超过 750;最新标记发布版本为 v0.17.0,发布于 2026 年 9 月 1 日
📍 简单一句话
LMDeploy 是一款免费、开源(Apache 2.0)的工具包,用于在 NVIDIA GPU 上压缩、量化和服务 LLM,由 InternLM/OpenMMLab 生态系统内的 MMRazor 与 MMDeploy 团队开发,可通过 pip install lmdeploy 安装,GitHub 星标超过 8,000。
💬 简单来说
LMDeploy 是一个通过 pip 安装的命令行工具和 Python 库,它接收您已经拥有的 LLM(例如来自 HuggingFace 的模型),在您自己的 GPU 上快速运行,也可以先通过 4 位量化压缩以减少显存占用。它不是带窗口可点击的聊天应用,而是您在服务器上运行的基础设施,其他应用通过兼容 OpenAI 的 API 与它通信。
📌注: 本评测基于 LMDeploy 自身的 GitHub 仓库、README、文档和 PyPI 页面。吞吐量与量化速度数据(如"比 vLLM 快 1.8 倍")均为 LMDeploy 自行公布的基准,并非 PromptQuorum 的独立测量结果——在依据某一具体数字做出采购或架构决策前,请核实当前发布的基准数据。
LMDeploy 是什么?
LMDeploy 是一款用于压缩、部署和服务大语言模型的工具包,旨在 NVIDIA GPU 上实现高吞吐量推理。 其自身的 GitHub 描述 指出,它由 MMRazor 和 MMDeploy 团队开发——两者都是 OpenMMLab 项目,即由上海人工智能实验室维护的开源计算机视觉与模型部署生态系统,也正是 InternLM 系列模型的开发方。
- 产品类型:命令行工具和 Python 库——没有图形界面;通过终端、Python 脚本或 Docker 容器使用
- 开发方:MMRazor 与 MMDeploy 团队,隶属于上海人工智能实验室旗下的 InternLM/OpenMMLab 生态系统
- 仓库:GitHub 上的 InternLM/lmdeploy,创建于 2023 年 6 月 15 日
- 许可证:Apache 2.0,已通过仓库的 LICENSE 文件确认
- 规模:截至本评测时 GitHub 星标超过 8,000,Fork 超过 750,开放 Issue 596 个
- 发布渠道:在 PyPI 上以
lmdeploy包发布,据项目文档还提供官方 Docker 镜像
项目历史与版本里程碑
LMDeploy 的 GitHub 仓库创建于 2023 年 6 月,此后项目持续迭代,从单一的 TurboMind 推理引擎扩展为具备量化、多模态(VLM)支持和分布式服务能力的双引擎工具包。
- 12023/08 —— 4 位 AWQ 量化与 HuggingFace Hub 上线
Why it matters: 据官方更新日志,新增了基于 AWQ 的 4 位仅权重量化,并在 HuggingFace 上发布了开箱即用的 4 位模型。 - 22024/01 —— 引入 PyTorch 推理引擎
Why it matters: 在 TurboMind 之外新增了第二个纯 Python 推理引擎,降低了开发者扩展或调试服务栈的门槛。 - 32024/06–2024/07 —— VLM 与函数调用支持
Why it matters: 新增了多模态(视觉语言模型)推理流水线与服务能力,以及针对 Llama 3.1 和 InternLM2.5 的工具/函数调用。 - 42025/01 —— 支持 DeepSeek V3 和 R1
Why it matters: 为广泛使用的推理模型系列 DeepSeek V3 和 R1 提供了近乎同步的支持。 - 52025/06 —— DeepSeek 的 PD 分离
Why it matters: 通过 DLSlime 和 Mooncake 集成了针对 DeepSeek 模型的 prefill/decode 分离,这是一种用于跨多机扩展大型 MoE 模型服务的生产级技术。 - 62025/09 —— NVIDIA GPU(V100 及更新)上的 MXFP4 支持
Why it matters: 新增了 MXFP4 量化推理,据 LMDeploy 自身的更新日志,在 H800 GPU 上针对 OpenAI gpt-oss 模型的吞吐量达到 vLLM 的 1.5 倍。 - 72026/02 —— Qwen3.5 支持与 llm-compressor 集成
Why it matters: 新增了对 Qwen3.5 模型系列的支持,并集成了 vllm-project/llm-compressor,用于对称/非对称 4 位量化。 - 8v0.17.0 —— 2026 年 9 月 1 日
Why it matters: 截至本评测时最新的 GitHub 标记发布版本——若要了解本评测发布日期之后的任何更新,请直接查看 [GitHub 发布页面](https://github.com/InternLM/lmdeploy/releases)。
LMDeploy 能做什么?
- 两个推理引擎 —— TurboMind 是 LMDeploy 定位为吞吐量最高选项的 C++/CUDA 引擎,另一个是更易于扩展和添加新模型架构的纯 Python PyTorch 引擎;具体选用哪个引擎需参考 LMDeploy 自身的 支持模型表
- 持续批处理与分页注意力 —— 持久性(持续)批处理、分块/分页 KV 缓存以及动态 split-and-fuse,这与其他生产级推理引擎所用的技术属于同一类,用于在并发请求下提高 GPU 利用率
- 量化 —— AWQ 4 位仅权重量化,外加可与 AWQ 同时组合使用的 int8/int4 KV 缓存量化,以及(自 2026/02 起)通过 llm-compressor 集成实现的对称/非对称 4 位量化
- 广泛的模型支持 —— 根据 LMDeploy 的支持模型文档,涵盖数十个 LLM 系列,包括 Llama、Llama2/3/3.1/3.2、InternLM2/3、Qwen1.5/2/2.5/3、Qwen3-MoE、Qwen3-Next、DeepSeek-MoE/V2/V3/R1、Mistral、Mixtral、ChatGLM2、GLM-4、Yi、Baichuan2 以及 Code Llama
- 视觉语言模型(VLM)支持 —— 为 InternVL、LLaVA、MiniGemini、CogVLM2 等多模态模型提供离线推理流水线和 API 服务
- 兼容 OpenAI 的 API 服务器 —— 运行
lmdeploy serve api_server会启动一个服务器,模拟 OpenAI 聊天补全的请求/响应格式,针对 LLM 和 VLM 分别提供文档 - 离线批量推理流水线 —— Python 的
lmdeploy.pipeline()API,可直接在脚本内运行推理,无需搭建服务器 - 多模型、多机代理服务器 —— 一种请求分发服务,可在一个入口后面跨多台机器和多个 GPU 运行多个模型
- NVIDIA CUDA GPU 之外的硬件支持 —— 通过 PyTorch 引擎支持华为昇腾 NPU,并通过 TurboMind 支持 Windows(张量并行度为 1)
使用示例:三种使用 LMDeploy 的方式
以下是基于上文所述 LMDeploy 文档化命令构建的具体工作流程,而非假设性的使用场景。
安装 LMDeploy
LMDeploy 可在 Python 3.10–3.13 环境中通过 pip 免费安装,其源代码托管在 GitHub 上。 它的 TurboMind 引擎需要 NVIDIA CUDA GPU;PyTorch 引擎和华为昇腾支持为特定使用场景扩展了硬件选择。
Source | Link |
|---|---|
| GitHub 仓库(源代码,Apache 2.0) | github.com/InternLM/lmdeploy |
| PyPI 包 | pypi.org/project/lmdeploy |
| 文档 | lmdeploy.readthedocs.io |
| 安装命令 | conda create -n lmdeploy python=3.12 -y && conda activate lmdeploy && pip install lmdeploy |
据项目自身 README,自 v0.13.0 起,默认的 PyPI wheel 已针对 CUDA 12.8 构建,因此对于典型的 NVIDIA GPU 配置(包括 GeForce RTX 50 系列),仅需执行 pip install lmdeploy 即可。没有 GUI 安装程序——由于安装说明可能随版本变化,请在运行任何命令前先在 GitHub 上核实当前推荐的安装方法。
价格与许可
LMDeploy 免费且开源,没有付费套餐。 GitHub 仓库的 LICENSE 文件 未经修改地采用了 Apache License 2.0,项目文档中也不存在任何价格页面。
- 没有订阅、没有付费套餐,也没有 LMDeploy 自身施加的使用限制
- 安装或使用该工具包无需账号或注册
- 您的实际成本取决于运行 LMDeploy 的 GPU 硬件或云 GPU 实例——LMDeploy 本身不额外收费
- Apache 2.0 是一种宽松许可证:没有必须公开自有代码的著佐权义务,并明确允许商业/生产使用
LMDeploy vs. vLLM
LMDeploy 和 vLLM 是使用最广泛的两款开源 LLM 推理引擎,LMDeploy 自身的宣传材料也明确将自己与 vLLM 进行基准对比。 两者都是免费、接近 Apache 2.0(vLLM 同样采用 Apache 2.0)、可通过 Python 安装,并支持兼容 OpenAI 的 API 服务器——差异主要体现在引擎架构、生态规模和模型系列侧重点上。
核心引擎
- LMDeploy:
- TurboMind(C++/CUDA)加一个 PyTorch 引擎
- vLLM:
- 单一的基于 PagedAttention 的引擎
吞吐量宣称
- LMDeploy:
- 最高达 vLLM 的 1.8 倍(自称)
- vLLM:
- 被广泛视为行业标准基准
量化方式
- LMDeploy:
- AWQ、int8/int4 KV 缓存、MXFP4
- vLLM:
- AWQ、GPTQ、FP8 及其他格式
生态规模
- LMDeploy:
- 约 8,000 GitHub 星标
- vLLM:
- 更大的社区和更广泛的第三方集成面
模型系列优势
- LMDeploy:
- 对 InternLM 和 Qwen 有强大的一流支持
- vLLM:
- 覆盖非常广泛,常常率先支持众多实验室的新模型
开发方
- LMDeploy:
- MMRazor/MMDeploy 团队(上海人工智能实验室)
- vLLM:
- 发源于 UC Berkeley,如今是跨多家公司的广泛开源项目
LMDeploy 的吞吐量宣称均为其自行发布的数据,并非 PromptQuorum 的独立基准测试——在为生产环境选择其中之一前,请针对您的目标模型、GPU 和流量模式进行自己的对比测试。更多关于 vLLM 本身的内容,请参见 vLLM 详解。
谁适合使用 LMDeploy?
LMDeploy 适合那些在自有 NVIDIA GPU 基础设施上部署 LLM、想要一套支持量化、吞吐量高的服务栈而非桌面聊天应用的团队。
竞品与替代方案
LMDeploy 处于生产级 LLM 服务引擎这一细分领域,与 vLLM、TensorRT-LLM、SGLang 和 ExLlamaV2 并列——这些工具专为在专用 GPU 硬件上大规模运行模型而设计,与面向消费者的桌面应用有明显区别。
vLLM
- 主要特点:
- 采用最广泛的开源推理引擎,PagedAttention,对新模型的支持覆盖面广、往往首发即支持
- Link:
- vLLM 详解
关于vLLM的文章(10篇)
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)更新于 2026年9月6日
- llama.cpp Explained: The Engine Powering Ollama (2026)更新于 2026年9月20日
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026更新于 2026年9月20日
- candle-vllm Review: Rust-Native LLM Serving on CUDA and Metal更新于 2026年9月19日
- NVIDIA Dynamo Review: Datacenter-Scale Inference Serving更新于 2026年9月19日
- KServe Review: Kubernetes-Native Model Serving at Scale更新于 2026年9月19日
- LMDeploy Review: High-Throughput LLM Serving and Quantization更新于 2026年9月19日
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API Server更新于 2026年9月19日
- TranslateBooksWithLLMs Review: Translate Full Books With a Local or Cloud LLM更新于 2026年9月19日
- vllm-mlx Review: vLLM-Style Serving for Apple Silicon更新于 2026年9月19日
另有81篇未显示
TensorRT-LLM
- 主要特点:
- NVIDIA 自研的基于编译器的推理库,针对 NVIDIA 硬件进行深度优化
- Link:
- TensorRT-LLM 详解
关于TensorRT-LLM的文章(7篇)
- TensorRT-LLM Explained: NVIDIA's GPU-Optimized Inference Engine (2026)更新于 2026年9月6日
- NVIDIA Dynamo Review: Datacenter-Scale Inference Serving更新于 2026年9月19日
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AI更新于 2026年9月12日
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)更新于 2026年9月6日
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)更新于 2026年9月6日
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"更新于 2026年9月5日
- Enterprise LLM Inference Servers 2026: vLLM vs TGI vs NVIDIA NIM vs Ollama更新于 2026年9月2日
其他提及:
SGLang
- 主要特点:
- 围绕 RadixAttention 缓存构建的推理引擎与结构化生成语言
- Link:
- SGLang 详解
关于SGLang的文章(5篇)
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)更新于 2026年9月6日
- NVIDIA Dynamo Review: Datacenter-Scale Inference Serving更新于 2026年9月19日
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AI更新于 2026年9月12日
- Kilo Code Review: The Open-Source Coding Agent Now Owned by Anaconda更新于 2026年9月12日
- Text-Generation-WebUI vs vLLM vs llama.cpp in 2026: Inference Engine Comparison更新于 2026年8月29日
其他提及:
- AIClient2API Review: One Local Proxy for Every AI Protocol更新于 2026年9月19日
- LMDeploy Review: High-Throughput LLM Serving and Quantization更新于 2026年9月19日
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API Server更新于 2026年9月19日
- Locally Uncensored Review 2026: Local Chat, Image, and Video in One App更新于 2026年9月12日
ExLlamaV2
- 主要特点:
- 专注量化的引擎,在消费级 GPU 上运行 GPTQ/EXL2 模型时颇受欢迎
- Link:
- ExLlamaV2 详解
关于ExLlamaV2的文章(2篇)
- ExLlamaV2 Explained 2026: Archived, Succeeded by ExLlamaV3更新于 2026年9月6日
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"更新于 2026年9月5日
其他提及:
此列表反映了在生产服务领域常与 LMDeploy 比较的工具,并非 PromptQuorum 的独立排名——请在选择前核实每款工具当前的功能集和硬件要求。
评估 LMDeploy 时的常见误区
关于 LMDeploy 的大多数误解,源于把它当作桌面聊天应用来对待,或将其自行报告的基准数据当作已独立验证的事实来引用。
常见问题
LMDeploy 是什么?
LMDeploy(github.com/InternLM/lmdeploy)是一款免费、开源(Apache 2.0)的工具包,用于在 NVIDIA GPU 上压缩、量化和服务大语言模型,由 InternLM/OpenMMLab 生态系统内的 MMRazor 与 MMDeploy 团队开发。
LMDeploy 是免费的吗?
是的。LMDeploy 采用 Apache 2.0 许可,没有价格页面,也没有付费套餐。您的实际成本取决于运行它所用的 GPU 硬件或云实例。
如何安装 LMDeploy?
在 Python 3.10–3.13 环境中运行 pip install lmdeploy(建议使用 conda 环境)。自 v0.13.0 起,默认的 PyPI wheel 针对 CUDA 12.8 构建,因此对典型的 NVIDIA GPU 配置通常无需单独安装 CUDA。
LMDeploy 有图形界面吗?
没有。LMDeploy 是一个命令行工具包和 Python 库。它没有聊天窗口——您通过终端、Python 脚本或兼容 OpenAI 的 API 服务器与它交互。
LMDeploy 比 vLLM 更快吗?
LMDeploy 自身的 README 基于其自行发布的基准,报告请求吞吐量比 vLLM 最高提升 1.8 倍。这不是独立验证的数字——在依赖它之前,请在您的目标模型和硬件上运行自己的基准测试。
LMDeploy 支持哪些量化方式?
AWQ 4 位仅权重量化、int8/int4 KV 缓存量化(可与 AWQ 组合使用)、受支持 NVIDIA GPU 上的 MXFP4,以及自 2026/02 起通过与 vllm-project/llm-compressor 的集成实现的对称/非对称 4 位量化。
LMDeploy 支持哪些模型?
数十个 LLM 系列——包括 Llama、InternLM2/3、Qwen1.5 到 Qwen3、DeepSeek-MoE/V2/V3/R1、Mistral、ChatGLM2、GLM-4 和 Code Llama——外加 InternVL、LLaVA、CogVLM2 等视觉语言模型。完整、最新的列表请参见 LMDeploy 自身的支持模型文档。
LMDeploy 支持 NVIDIA 以外的 GPU 吗?
其主要的 TurboMind 引擎面向 NVIDIA CUDA GPU。PyTorch 引擎增加了对华为昇腾 NPU 的支持。本评测未发现纯 CPU 或 Apple Silicon 的支持路径。
LMDeploy 是谁开发的?
MMRazor 与 MMDeploy 团队,隶属于上海人工智能实验室维护的开源 InternLM/OpenMMLab 生态系统。
LMDeploy 有兼容 OpenAI 的 API 服务器吗?
有。运行 lmdeploy serve api_server 会启动一个本地服务器,模拟 OpenAI 聊天补全的请求/响应格式,让现有 OpenAI 客户端代码可以指向它,而不必指向云端点。