Points clés
- LMDeploy (github.com/InternLM/lmdeploy) est une boîte à outils gratuite, open source, installable via pip pour l'inférence et la quantification — une CLI/bibliothèque, pas une appli graphique
- Développé par les équipes MMRazor et MMDeploy au sein de l'écosystème InternLM/OpenMMLab (Shanghai AI Laboratory) ; dépôt créé le 15 juin 2023
- Sous licence Apache 2.0, confirmée via le fichier LICENSE du dépôt GitHub
- Embarque deux moteurs d'inférence : TurboMind (C++/CUDA, optimisé pour le débit) et un moteur PyTorch en Python pur
- Prend en charge la quantification 4 bits AWQ des poids et la quantification int8/int4 du cache KV
- Plus de 8 000 étoiles GitHub et 750 forks au moment de cette review ; dernière release taguée v0.17.0, publiée le 1er septembre 2026
📍 En une phrase
LMDeploy est une boîte à outils gratuite et open source (Apache 2.0) pour compresser, quantifier et servir des LLM sur GPU NVIDIA, développée par les équipes MMRazor et MMDeploy au sein de l'écosystème InternLM/OpenMMLab, installée via pip install lmdeploy, avec plus de 8 000 étoiles GitHub.
💬 En termes simples
LMDeploy est un outil en ligne de commande et une bibliothèque Python que vous installez avec pip, qui prend un LLM que vous possédez déjà (depuis HuggingFace, par exemple) et l'exécute rapidement sur votre propre GPU, en le réduisant éventuellement au préalable via une quantification 4 bits pour utiliser moins de mémoire. Ce n'est pas une appli de chat avec une fenêtre à cliquer — c'est une infrastructure que vous exécutez sur un serveur, et d'autres applications lui parlent via une API compatible OpenAI.
📌Remarque: Cette review s'appuie sur le dépôt GitHub, le README, la documentation et la fiche PyPI de LMDeploy. Les chiffres de débit et de vitesse de quantification (comme « 1,8x plus rapide que vLLM ») sont des benchmarks auto-publiés par LMDeploy, pas des mesures indépendantes de PromptQuorum — vérifiez les benchmarks publiés actuels avant de vous fier à un chiffre précis pour une décision d'achat ou d'architecture.
Qu'est-ce que LMDeploy ?
LMDeploy est une boîte à outils pour compresser, déployer et servir de grands modèles de langage, conçue pour l'inférence à haut débit sur GPU NVIDIA. Sa propre description GitHub indique qu'elle a été développée par les équipes MMRazor et MMDeploy — deux projets OpenMMLab, l'écosystème open source de vision par ordinateur et de déploiement de modèles maintenu par le Shanghai AI Laboratory, la même organisation derrière la famille de modèles InternLM.
- Type de produit : un outil en ligne de commande et une bibliothèque Python — aucune interface graphique ; utilisation depuis un terminal, un script Python ou un conteneur Docker
- Développeur : les équipes MMRazor et MMDeploy, au sein de l'écosystème InternLM/OpenMMLab sous le Shanghai AI Laboratory
- Dépôt : InternLM/lmdeploy sur GitHub, créé le 15 juin 2023
- Licence : Apache 2.0, confirmée via le fichier LICENSE du dépôt
- Échelle : plus de 8 000 étoiles GitHub, 750 forks et 596 issues ouvertes au moment de cette review
- Distribution : publié sur PyPI sous le paquet
lmdeploy, plus des images Docker officielles selon la documentation du projet
Historique du projet et jalons de versions
Le dépôt GitHub de LMDeploy a été créé en juin 2023, et le projet a été livré en continu depuis, passant d'un unique moteur d'inférence TurboMind à une boîte à outils à deux moteurs avec quantification, support multimodal (VLM) et service distribué.
- 12023/08 — Quantification AWQ 4 bits et lancement sur HuggingFace Hub
Why it matters: A ajouté la quantification 4 bits des poids basée sur AWQ et publié des modèles 4 bits prêts à l'emploi sur HuggingFace, selon le changelog officiel. - 22024/01 — Introduction du moteur d'inférence PyTorch
Why it matters: A ajouté un second moteur d'inférence, en Python pur, aux côtés de TurboMind, abaissant la barrière pour les développeurs souhaitant étendre ou déboguer la pile de service. - 32024/06–2024/07 — Support VLM et appel de fonctions
Why it matters: A ajouté des pipelines d'inférence multimodale (modèles vision-langage) et leur service, ainsi que l'appel d'outils/fonctions pour Llama 3.1 et InternLM2.5. - 42025/01 — Support de DeepSeek V3 et R1
Why it matters: A ajouté un support quasi immédiat des familles de modèles DeepSeek V3 et R1, une lignée de modèles de raisonnement largement utilisée. - 52025/06 — Désagrégation prefill/decode pour DeepSeek
Why it matters: A intégré la désagrégation prefill/decode pour les modèles DeepSeek via DLSlime et Mooncake, une technique de production pour faire évoluer le service de grands modèles MoE sur plusieurs machines. - 62025/09 — Support MXFP4 sur GPU NVIDIA (V100 et plus récents)
Why it matters: A ajouté l'inférence quantifiée MXFP4, dont le changelog de LMDeploy indique un débit 1,5x supérieur à celui de vLLM sur GPU H800 pour les modèles gpt-oss d'OpenAI. - 72026/02 — Support de Qwen3.5 et intégration llm-compressor
Why it matters: A ajouté le support de la collection de modèles Qwen3.5 et intégré vllm-project/llm-compressor pour la quantification 4 bits symétrique/asymétrique. - 8v0.17.0 — 1er septembre 2026
Why it matters: La dernière release taguée sur GitHub au moment de cette review — consultez directement la [page des releases GitHub](https://github.com/InternLM/lmdeploy/releases) pour tout ce qui a été publié après la date de publication de cette review.
Que peut-on faire avec LMDeploy ?
L'ensemble de fonctionnalités de LMDeploy se concentre sur trois missions : réduire un modèle via la quantification, l'exécuter efficacement et l'exposer comme service réseau. Voici ce que fait réellement chaque partie, selon le README et la documentation propres de LMDeploy.
- Deux moteurs d'inférence — TurboMind, un moteur C++/CUDA que LMDeploy présente comme son option la plus performante en débit, et un moteur PyTorch en Python pur, plus facile à étendre et à enrichir de nouvelles architectures de modèles ; choisissez selon le modèle en fonction du tableau des modèles pris en charge de LMDeploy
- Batching continu et attention paginée — batching persistant (continu), cache KV bloqué/paginé et split-and-fuse dynamique, la même classe de techniques utilisée par d'autres moteurs d'inférence en production pour augmenter l'utilisation GPU sous des requêtes concurrentes
- Quantification — quantification 4 bits AWQ des poids, plus quantification int8/int4 du cache KV combinable avec AWQ en même temps, et (depuis 2026/02) quantification 4 bits symétrique/asymétrique via une intégration llm-compressor
- Large support de modèles — des dizaines de familles LLM incluant Llama, Llama2/3/3.1/3.2, InternLM2/3, Qwen1.5/2/2.5/3, Qwen3-MoE, Qwen3-Next, DeepSeek-MoE/V2/V3/R1, Mistral, Mixtral, ChatGLM2, GLM-4, Yi, Baichuan2 et Code Llama, selon la documentation des modèles pris en charge de LMDeploy
- Support des modèles vision-langage (VLM) — pipelines d'inférence hors ligne et service API pour des modèles multimodaux tels qu'InternVL, LLaVA, MiniGemini et CogVLM2
- Serveur API compatible OpenAI —
lmdeploy serve api_serverdémarre un serveur qui reproduit le format de requête/réponse chat-completions d'OpenAI, documenté séparément pour les LLM et les VLM - Pipeline d'inférence par lots hors ligne — une API Python
lmdeploy.pipeline()pour exécuter l'inférence directement dans un script, sans monter de serveur - Serveur proxy multi-modèles, multi-machines — un service de répartition des requêtes pour exécuter plusieurs modèles sur plusieurs machines et GPU derrière un point d'entrée unique
- Support matériel au-delà des GPU NVIDIA CUDA — support des NPU Huawei Ascend via le moteur PyTorch, et support Windows (degré de parallélisme tensoriel 1) via TurboMind
Exemples d'utilisation : trois façons d'utiliser LMDeploy
Ce sont des workflows concrets construits à partir des commandes documentées ci-dessus de LMDeploy — pas des cas d'usage hypothétiques.
Installer LMDeploy
LMDeploy s'installe gratuitement via pip dans un environnement Python 3.10–3.13, et son code source est sur GitHub. Le moteur TurboMind nécessite un GPU NVIDIA CUDA ; le moteur PyTorch et le support Huawei Ascend étendent les options matérielles pour des cas d'usage spécifiques.
Source | Link |
|---|---|
| Dépôt GitHub (code source, Apache 2.0) | github.com/InternLM/lmdeploy |
| Paquet PyPI | pypi.org/project/lmdeploy |
| Documentation | lmdeploy.readthedocs.io |
| Commande d'installation | conda create -n lmdeploy python=3.12 -y && conda activate lmdeploy && pip install lmdeploy |
Depuis la v0.13.0, les wheels PyPI par défaut sont compilées pour CUDA 12.8, donc un simple pip install lmdeploy suffit pour les configurations GPU NVIDIA classiques, y compris la série GeForce RTX 50, selon le README du projet. Il n'existe pas d'installeur graphique — vérifiez la méthode d'installation actuellement recommandée sur GitHub avant d'exécuter une commande, car les instructions peuvent changer d'une version à l'autre.
Tarifs et licence
LMDeploy est gratuit et open source, sans offre payante. Le fichier LICENSE du dépôt GitHub applique la licence Apache, version 2.0, sans modification, et aucune page tarifaire n'existe dans la documentation du projet.
- Aucun abonnement, aucune offre payante, aucune limite d'usage imposée par LMDeploy lui-même
- Aucun compte ni inscription requis pour installer ou utiliser la boîte à outils
- Votre coût réel correspond au matériel GPU ou à l'instance GPU cloud sur laquelle vous exécutez LMDeploy — LMDeploy lui-même n'ajoute aucun frais
- Apache 2.0 est une licence permissive : aucune obligation de copyleft de publier votre propre code, l'usage commercial/en production est explicitement autorisé
LMDeploy vs. vLLM
LMDeploy et vLLM figurent parmi les moteurs d'inférence LLM open source les plus utilisés, et le marketing de LMDeploy se compare explicitement à vLLM. Les deux sont gratuits, proches d'Apache 2.0 (vLLM est aussi sous Apache 2.0), installables via Python et prennent en charge un serveur API compatible OpenAI — les différences résident surtout dans l'architecture du moteur, la taille de l'écosystème et le focus sur certaines familles de modèles.
Moteurs principaux
- LMDeploy:
- TurboMind (C++/CUDA) plus un moteur PyTorch
- vLLM:
- Un seul moteur basé sur PagedAttention
Débit annoncé
- LMDeploy:
- Jusqu'à 1,8x vLLM (auto-déclaré)
- vLLM:
- Largement cité comme référence standard du secteur
Quantification
- LMDeploy:
- AWQ, cache KV int8/int4, MXFP4
- vLLM:
- AWQ, GPTQ, FP8 et autres formats
Taille de l'écosystème
- LMDeploy:
- ~8 000 étoiles GitHub
- vLLM:
- Une communauté plus large et une surface d'intégration tierce plus étendue
Force par famille de modèles
- LMDeploy:
- Fort support de première classe pour InternLM et Qwen
- vLLM:
- Très large, souvent le premier à supporter de nouvelles sorties de nombreux labos
Développeur
- LMDeploy:
- Équipes MMRazor/MMDeploy (Shanghai AI Laboratory)
- vLLM:
- Né à UC Berkeley, aujourd'hui un large projet open source multi-entreprises
Les chiffres de débit de LMDeploy sont ses propres résultats auto-publiés, pas un benchmark indépendant de PromptQuorum — effectuez votre propre comparaison sur votre modèle cible, votre GPU et votre profil de trafic avant de choisir l'un ou l'autre pour la production. Voir l'explicatif vLLM pour en savoir plus sur vLLM en particulier.
À qui s'adresse LMDeploy ?
LMDeploy convient aux équipes qui déploient des LLM sur leur propre infrastructure GPU NVIDIA et veulent une pile de service sensible à la quantification et à haut débit plutôt qu'une appli de chat de bureau.
Concurrents et alternatives
LMDeploy se situe dans le segment des moteurs de service LLM en production, aux côtés de vLLM, TensorRT-LLM, SGLang et ExLlamaV2 — des outils conçus pour exécuter des modèles à grande échelle sur du matériel GPU dédié, distincts des applications de bureau grand public.
vLLM
- Connu pour:
- Le moteur d'inférence open source le plus adopté, PagedAttention, large support dès le premier jour
- Link:
- vLLM expliqué
Articles sur vLLM (10)
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)Mis à jour 6 septembre 2026
- llama.cpp Explained: The Engine Powering Ollama (2026)Mis à jour 20 septembre 2026
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026Mis à jour 20 septembre 2026
- candle-vllm Review: Rust-Native LLM Serving on CUDA and MetalMis à jour 19 septembre 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingMis à jour 19 septembre 2026
- KServe Review: Kubernetes-Native Model Serving at ScaleMis à jour 19 septembre 2026
- LMDeploy Review: High-Throughput LLM Serving and QuantizationMis à jour 19 septembre 2026
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API ServerMis à jour 19 septembre 2026
- TranslateBooksWithLLMs Review: Translate Full Books With a Local or Cloud LLMMis à jour 19 septembre 2026
- vllm-mlx Review: vLLM-Style Serving for Apple SiliconMis à jour 19 septembre 2026
+81 autres non affichés
TensorRT-LLM
- Connu pour:
- La bibliothèque d'inférence basée sur un compilateur propre à NVIDIA, très optimisée pour son matériel
Articles sur TensorRT-LLM (7)
- TensorRT-LLM Explained: NVIDIA's GPU-Optimized Inference Engine (2026)Mis à jour 6 septembre 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingMis à jour 19 septembre 2026
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIMis à jour 12 septembre 2026
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)Mis à jour 6 septembre 2026
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)Mis à jour 6 septembre 2026
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"Mis à jour 5 septembre 2026
- Enterprise LLM Inference Servers 2026: vLLM vs TGI vs NVIDIA NIM vs OllamaMis à jour 2 septembre 2026
Également mentionné dans :
- LMDeploy Review: High-Throughput LLM Serving and QuantizationMis à jour 19 septembre 2026
- Running LLMs and VLA Models On-Robot 2026: What Fits, What Doesn'tMis à jour 2 septembre 2026
- Apple MLX vs NVIDIA CUDA for Local LLMs: Which System Should You Choose in 2026?Mis à jour 29 août 2026
SGLang
- Connu pour:
- Un moteur d'inférence et langage de génération structurée basé sur le cache RadixAttention
- Link:
- SGLang expliqué
Articles sur SGLang (5)
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)Mis à jour 6 septembre 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingMis à jour 19 septembre 2026
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIMis à jour 12 septembre 2026
- Kilo Code Review: The Open-Source Coding Agent Now Owned by AnacondaMis à jour 12 septembre 2026
- Text-Generation-WebUI vs vLLM vs llama.cpp in 2026: Inference Engine ComparisonMis à jour 29 août 2026
Également mentionné dans :
- AIClient2API Review: One Local Proxy for Every AI ProtocolMis à jour 19 septembre 2026
- LMDeploy Review: High-Throughput LLM Serving and QuantizationMis à jour 19 septembre 2026
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API ServerMis à jour 19 septembre 2026
- Locally Uncensored Review 2026: Local Chat, Image, and Video in One AppMis à jour 12 septembre 2026
ExLlamaV2
- Connu pour:
- Un moteur axé quantification, populaire pour exécuter des modèles GPTQ/EXL2 sur GPU grand public
- Link:
- ExLlamaV2 expliqué
Articles sur ExLlamaV2 (2)
- ExLlamaV2 Explained 2026: Archived, Succeeded by ExLlamaV3Mis à jour 6 septembre 2026
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"Mis à jour 5 septembre 2026
Également mentionné dans :
- LMDeploy Review: High-Throughput LLM Serving and QuantizationMis à jour 19 septembre 2026
- How to Double Local LLM Speed: Optimization TechniquesMis à jour 28 août 2026
Cette liste reflète les outils couramment comparés à LMDeploy dans le segment du service en production, et non un classement indépendant de PromptQuorum — vérifiez l'ensemble de fonctionnalités et les exigences matérielles actuels de chaque outil avant de choisir.
Erreurs courantes lors de l'évaluation de LMDeploy
La plupart des confusions autour de LMDeploy viennent du fait de le traiter comme une appli de chat de bureau, ou de citer ses chiffres de benchmark auto-déclarés comme vérifiés de manière indépendante.
Questions fréquemment posées
Qu'est-ce que LMDeploy ?
LMDeploy (github.com/InternLM/lmdeploy) est une boîte à outils gratuite et open source (Apache 2.0) pour compresser, quantifier et servir de grands modèles de langage sur GPU NVIDIA, développée par les équipes MMRazor et MMDeploy au sein de l'écosystème InternLM/OpenMMLab.
LMDeploy est-il gratuit ?
Oui. LMDeploy est sous licence Apache 2.0, sans page tarifaire ni offre payante. Votre coût réel correspond au matériel GPU ou à l'instance cloud sur laquelle vous l'exécutez.
Comment installer LMDeploy ?
Exécutez pip install lmdeploy dans un environnement Python 3.10–3.13 (un environnement conda est recommandé). Depuis la v0.13.0, les wheels PyPI par défaut ciblent CUDA 12.8, ce qui suffit généralement sans installation CUDA séparée sur des configurations GPU NVIDIA classiques.
LMDeploy a-t-il une interface graphique ?
Non. LMDeploy est une boîte à outils en ligne de commande et une bibliothèque Python. Il n'a pas de fenêtre de chat — vous interagissez via le terminal, un script Python ou son serveur API compatible OpenAI.
LMDeploy est-il plus rapide que vLLM ?
Le README de LMDeploy indique un débit de requêtes jusqu'à 1,8x supérieur à vLLM, sur la base de benchmarks auto-publiés. Ce n'est pas un chiffre vérifié de manière indépendante — effectuez votre propre benchmark sur votre modèle et votre matériel cibles avant de vous y fier.
Quelle quantification LMDeploy prend-il en charge ?
La quantification 4 bits AWQ des poids, la quantification int8/int4 du cache KV (combinable avec AWQ), MXFP4 sur les GPU NVIDIA pris en charge, et, depuis 2026/02, la quantification 4 bits symétrique/asymétrique via une intégration avec vllm-project/llm-compressor.
Quels modèles LMDeploy prend-il en charge ?
Des dizaines de familles LLM — dont Llama, InternLM2/3, Qwen1.5 à Qwen3, DeepSeek-MoE/V2/V3/R1, Mistral, ChatGLM2, GLM-4 et Code Llama — plus des modèles vision-langage comme InternVL, LLaVA et CogVLM2. Consultez la documentation des modèles pris en charge de LMDeploy pour la liste complète et actuelle.
LMDeploy prend-il en charge des GPU autres que NVIDIA ?
Son moteur TurboMind principal vise les GPU NVIDIA CUDA. Le moteur PyTorch ajoute un support pour les NPU Huawei Ascend. Cette review n'a trouvé aucun chemin de support CPU seul ou Apple Silicon.
Qui développe LMDeploy ?
Les équipes MMRazor et MMDeploy, au sein de l'écosystème open source InternLM/OpenMMLab maintenu par le Shanghai AI Laboratory.
LMDeploy dispose-t-il d'un serveur API compatible OpenAI ?
Oui. Exécuter lmdeploy serve api_server démarre un serveur local qui reproduit le format de requête/réponse chat-completions d'OpenAI, permettant à du code client OpenAI existant de le cibler au lieu d'un point de terminaison cloud.