Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/LMDeploy Review : service LLM à haut débit et quantification
Overview & Reference

LMDeploy Review : service LLM à haut débit et quantification

·10 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

LMDeploy est une boîte à outils et bibliothèque Python gratuite et open source (Apache 2.0) en ligne de commande pour compresser, quantifier et servir de grands modèles de langage sur GPU NVIDIA, installée via pip install lmdeploy. Développée par les équipes MMRazor et MMDeploy au sein de l'écosystème InternLM/OpenMMLab, elle embarque deux moteurs d'inférence — TurboMind (un moteur C++/CUDA optimisé pour le débit) et un moteur PyTorch en Python pur — plus la quantification AWQ et du cache KV, un serveur API compatible OpenAI, et la prise en charge de bien plus de 50 familles de LLM et VLM ouverts.

LMDeploy (github.com/InternLM/lmdeploy) est une boîte à outils gratuite et open source (Apache 2.0) pour compresser, quantifier et servir de grands modèles de langage, développée par les équipes MMRazor et MMDeploy au sein de l'écosystème InternLM/OpenMMLab. Elle s'installe via pip install lmdeploy et embarque deux moteurs d'inférence — TurboMind et un moteur PyTorch en Python pur — plus un serveur API compatible OpenAI, avec plus de 8 000 étoiles GitHub. Cette review complète la fiche de LMDeploy dans le Local LLM Software Directory et détaille ce qu'il fait réellement, comment l'installer et à qui il convient.

Points clés

  • LMDeploy (github.com/InternLM/lmdeploy) est une boîte à outils gratuite, open source, installable via pip pour l'inférence et la quantification — une CLI/bibliothèque, pas une appli graphique
  • Développé par les équipes MMRazor et MMDeploy au sein de l'écosystème InternLM/OpenMMLab (Shanghai AI Laboratory) ; dépôt créé le 15 juin 2023
  • Sous licence Apache 2.0, confirmée via le fichier LICENSE du dépôt GitHub
  • Embarque deux moteurs d'inférence : TurboMind (C++/CUDA, optimisé pour le débit) et un moteur PyTorch en Python pur
  • Prend en charge la quantification 4 bits AWQ des poids et la quantification int8/int4 du cache KV
  • Plus de 8 000 étoiles GitHub et 750 forks au moment de cette review ; dernière release taguée v0.17.0, publiée le 1er septembre 2026

📍 En une phrase

LMDeploy est une boîte à outils gratuite et open source (Apache 2.0) pour compresser, quantifier et servir des LLM sur GPU NVIDIA, développée par les équipes MMRazor et MMDeploy au sein de l'écosystème InternLM/OpenMMLab, installée via pip install lmdeploy, avec plus de 8 000 étoiles GitHub.

💬 En termes simples

LMDeploy est un outil en ligne de commande et une bibliothèque Python que vous installez avec pip, qui prend un LLM que vous possédez déjà (depuis HuggingFace, par exemple) et l'exécute rapidement sur votre propre GPU, en le réduisant éventuellement au préalable via une quantification 4 bits pour utiliser moins de mémoire. Ce n'est pas une appli de chat avec une fenêtre à cliquer — c'est une infrastructure que vous exécutez sur un serveur, et d'autres applications lui parlent via une API compatible OpenAI.

📌Remarque: Cette review s'appuie sur le dépôt GitHub, le README, la documentation et la fiche PyPI de LMDeploy. Les chiffres de débit et de vitesse de quantification (comme « 1,8x plus rapide que vLLM ») sont des benchmarks auto-publiés par LMDeploy, pas des mesures indépendantes de PromptQuorum — vérifiez les benchmarks publiés actuels avant de vous fier à un chiffre précis pour une décision d'achat ou d'architecture.

Qu'est-ce que LMDeploy ?

LMDeploy est une boîte à outils pour compresser, déployer et servir de grands modèles de langage, conçue pour l'inférence à haut débit sur GPU NVIDIA. Sa propre description GitHub indique qu'elle a été développée par les équipes MMRazor et MMDeploy — deux projets OpenMMLab, l'écosystème open source de vision par ordinateur et de déploiement de modèles maintenu par le Shanghai AI Laboratory, la même organisation derrière la famille de modèles InternLM.

  • Type de produit : un outil en ligne de commande et une bibliothèque Python — aucune interface graphique ; utilisation depuis un terminal, un script Python ou un conteneur Docker
  • Développeur : les équipes MMRazor et MMDeploy, au sein de l'écosystème InternLM/OpenMMLab sous le Shanghai AI Laboratory
  • Dépôt : InternLM/lmdeploy sur GitHub, créé le 15 juin 2023
  • Licence : Apache 2.0, confirmée via le fichier LICENSE du dépôt
  • Échelle : plus de 8 000 étoiles GitHub, 750 forks et 596 issues ouvertes au moment de cette review
  • Distribution : publié sur PyPI sous le paquet lmdeploy, plus des images Docker officielles selon la documentation du projet

Historique du projet et jalons de versions

Le dépôt GitHub de LMDeploy a été créé en juin 2023, et le projet a été livré en continu depuis, passant d'un unique moteur d'inférence TurboMind à une boîte à outils à deux moteurs avec quantification, support multimodal (VLM) et service distribué.

  1. 1
    2023/08 — Quantification AWQ 4 bits et lancement sur HuggingFace Hub
    Why it matters: A ajouté la quantification 4 bits des poids basée sur AWQ et publié des modèles 4 bits prêts à l'emploi sur HuggingFace, selon le changelog officiel.
  2. 2
    2024/01 — Introduction du moteur d'inférence PyTorch
    Why it matters: A ajouté un second moteur d'inférence, en Python pur, aux côtés de TurboMind, abaissant la barrière pour les développeurs souhaitant étendre ou déboguer la pile de service.
  3. 3
    2024/06–2024/07 — Support VLM et appel de fonctions
    Why it matters: A ajouté des pipelines d'inférence multimodale (modèles vision-langage) et leur service, ainsi que l'appel d'outils/fonctions pour Llama 3.1 et InternLM2.5.
  4. 4
    2025/01 — Support de DeepSeek V3 et R1
    Why it matters: A ajouté un support quasi immédiat des familles de modèles DeepSeek V3 et R1, une lignée de modèles de raisonnement largement utilisée.
  5. 5
    2025/06 — Désagrégation prefill/decode pour DeepSeek
    Why it matters: A intégré la désagrégation prefill/decode pour les modèles DeepSeek via DLSlime et Mooncake, une technique de production pour faire évoluer le service de grands modèles MoE sur plusieurs machines.
  6. 6
    2025/09 — Support MXFP4 sur GPU NVIDIA (V100 et plus récents)
    Why it matters: A ajouté l'inférence quantifiée MXFP4, dont le changelog de LMDeploy indique un débit 1,5x supérieur à celui de vLLM sur GPU H800 pour les modèles gpt-oss d'OpenAI.
  7. 7
    2026/02 — Support de Qwen3.5 et intégration llm-compressor
    Why it matters: A ajouté le support de la collection de modèles Qwen3.5 et intégré vllm-project/llm-compressor pour la quantification 4 bits symétrique/asymétrique.
  8. 8
    v0.17.0 — 1er septembre 2026
    Why it matters: La dernière release taguée sur GitHub au moment de cette review — consultez directement la [page des releases GitHub](https://github.com/InternLM/lmdeploy/releases) pour tout ce qui a été publié après la date de publication de cette review.

Que peut-on faire avec LMDeploy ?

L'ensemble de fonctionnalités de LMDeploy se concentre sur trois missions : réduire un modèle via la quantification, l'exécuter efficacement et l'exposer comme service réseau. Voici ce que fait réellement chaque partie, selon le README et la documentation propres de LMDeploy.

  • Deux moteurs d'inférence — TurboMind, un moteur C++/CUDA que LMDeploy présente comme son option la plus performante en débit, et un moteur PyTorch en Python pur, plus facile à étendre et à enrichir de nouvelles architectures de modèles ; choisissez selon le modèle en fonction du tableau des modèles pris en charge de LMDeploy
  • Batching continu et attention paginée — batching persistant (continu), cache KV bloqué/paginé et split-and-fuse dynamique, la même classe de techniques utilisée par d'autres moteurs d'inférence en production pour augmenter l'utilisation GPU sous des requêtes concurrentes
  • Quantification — quantification 4 bits AWQ des poids, plus quantification int8/int4 du cache KV combinable avec AWQ en même temps, et (depuis 2026/02) quantification 4 bits symétrique/asymétrique via une intégration llm-compressor
  • Large support de modèles — des dizaines de familles LLM incluant Llama, Llama2/3/3.1/3.2, InternLM2/3, Qwen1.5/2/2.5/3, Qwen3-MoE, Qwen3-Next, DeepSeek-MoE/V2/V3/R1, Mistral, Mixtral, ChatGLM2, GLM-4, Yi, Baichuan2 et Code Llama, selon la documentation des modèles pris en charge de LMDeploy
  • Support des modèles vision-langage (VLM) — pipelines d'inférence hors ligne et service API pour des modèles multimodaux tels qu'InternVL, LLaVA, MiniGemini et CogVLM2
  • Serveur API compatible OpenAIlmdeploy serve api_server démarre un serveur qui reproduit le format de requête/réponse chat-completions d'OpenAI, documenté séparément pour les LLM et les VLM
  • Pipeline d'inférence par lots hors ligne — une API Python lmdeploy.pipeline() pour exécuter l'inférence directement dans un script, sans monter de serveur
  • Serveur proxy multi-modèles, multi-machines — un service de répartition des requêtes pour exécuter plusieurs modèles sur plusieurs machines et GPU derrière un point d'entrée unique
  • Support matériel au-delà des GPU NVIDIA CUDA — support des NPU Huawei Ascend via le moteur PyTorch, et support Windows (degré de parallélisme tensoriel 1) via TurboMind

Exemples d'utilisation : trois façons d'utiliser LMDeploy

Ce sont des workflows concrets construits à partir des commandes documentées ci-dessus de LMDeploy — pas des cas d'usage hypothétiques.

Tarifs et licence

LMDeploy est gratuit et open source, sans offre payante. Le fichier LICENSE du dépôt GitHub applique la licence Apache, version 2.0, sans modification, et aucune page tarifaire n'existe dans la documentation du projet.

  • Aucun abonnement, aucune offre payante, aucune limite d'usage imposée par LMDeploy lui-même
  • Aucun compte ni inscription requis pour installer ou utiliser la boîte à outils
  • Votre coût réel correspond au matériel GPU ou à l'instance GPU cloud sur laquelle vous exécutez LMDeploy — LMDeploy lui-même n'ajoute aucun frais
  • Apache 2.0 est une licence permissive : aucune obligation de copyleft de publier votre propre code, l'usage commercial/en production est explicitement autorisé

LMDeploy vs. vLLM

LMDeploy et vLLM figurent parmi les moteurs d'inférence LLM open source les plus utilisés, et le marketing de LMDeploy se compare explicitement à vLLM. Les deux sont gratuits, proches d'Apache 2.0 (vLLM est aussi sous Apache 2.0), installables via Python et prennent en charge un serveur API compatible OpenAI — les différences résident surtout dans l'architecture du moteur, la taille de l'écosystème et le focus sur certaines familles de modèles.

Moteurs principaux

LMDeploy:
TurboMind (C++/CUDA) plus un moteur PyTorch
vLLM:
Un seul moteur basé sur PagedAttention

Débit annoncé

LMDeploy:
Jusqu'à 1,8x vLLM (auto-déclaré)
vLLM:
Largement cité comme référence standard du secteur

Quantification

LMDeploy:
AWQ, cache KV int8/int4, MXFP4
vLLM:
AWQ, GPTQ, FP8 et autres formats

Taille de l'écosystème

LMDeploy:
~8 000 étoiles GitHub
vLLM:
Une communauté plus large et une surface d'intégration tierce plus étendue

Force par famille de modèles

LMDeploy:
Fort support de première classe pour InternLM et Qwen
vLLM:
Très large, souvent le premier à supporter de nouvelles sorties de nombreux labos

Développeur

LMDeploy:
Équipes MMRazor/MMDeploy (Shanghai AI Laboratory)
vLLM:
Né à UC Berkeley, aujourd'hui un large projet open source multi-entreprises

Les chiffres de débit de LMDeploy sont ses propres résultats auto-publiés, pas un benchmark indépendant de PromptQuorum — effectuez votre propre comparaison sur votre modèle cible, votre GPU et votre profil de trafic avant de choisir l'un ou l'autre pour la production. Voir l'explicatif vLLM pour en savoir plus sur vLLM en particulier.

À qui s'adresse LMDeploy ?

LMDeploy convient aux équipes qui déploient des LLM sur leur propre infrastructure GPU NVIDIA et veulent une pile de service sensible à la quantification et à haut débit plutôt qu'une appli de chat de bureau.

Concurrents et alternatives

LMDeploy se situe dans le segment des moteurs de service LLM en production, aux côtés de vLLM, TensorRT-LLM, SGLang et ExLlamaV2 — des outils conçus pour exécuter des modèles à grande échelle sur du matériel GPU dédié, distincts des applications de bureau grand public.

vLLM

Connu pour:
Le moteur d'inférence open source le plus adopté, PagedAttention, large support dès le premier jour
Articles sur vLLM (10)

+81 autres non affichés

TensorRT-LLM

Connu pour:
La bibliothèque d'inférence basée sur un compilateur propre à NVIDIA, très optimisée pour son matériel
Articles sur TensorRT-LLM (7)

Également mentionné dans :

SGLang

Connu pour:
Un moteur d'inférence et langage de génération structurée basé sur le cache RadixAttention
Articles sur SGLang (5)

Également mentionné dans :

ExLlamaV2

Connu pour:
Un moteur axé quantification, populaire pour exécuter des modèles GPTQ/EXL2 sur GPU grand public
Articles sur ExLlamaV2 (2)

Également mentionné dans :

Cette liste reflète les outils couramment comparés à LMDeploy dans le segment du service en production, et non un classement indépendant de PromptQuorum — vérifiez l'ensemble de fonctionnalités et les exigences matérielles actuels de chaque outil avant de choisir.

Erreurs courantes lors de l'évaluation de LMDeploy

La plupart des confusions autour de LMDeploy viennent du fait de le traiter comme une appli de chat de bureau, ou de citer ses chiffres de benchmark auto-déclarés comme vérifiés de manière indépendante.

Questions fréquemment posées

Qu'est-ce que LMDeploy ?

LMDeploy (github.com/InternLM/lmdeploy) est une boîte à outils gratuite et open source (Apache 2.0) pour compresser, quantifier et servir de grands modèles de langage sur GPU NVIDIA, développée par les équipes MMRazor et MMDeploy au sein de l'écosystème InternLM/OpenMMLab.

LMDeploy est-il gratuit ?

Oui. LMDeploy est sous licence Apache 2.0, sans page tarifaire ni offre payante. Votre coût réel correspond au matériel GPU ou à l'instance cloud sur laquelle vous l'exécutez.

Comment installer LMDeploy ?

Exécutez pip install lmdeploy dans un environnement Python 3.10–3.13 (un environnement conda est recommandé). Depuis la v0.13.0, les wheels PyPI par défaut ciblent CUDA 12.8, ce qui suffit généralement sans installation CUDA séparée sur des configurations GPU NVIDIA classiques.

LMDeploy a-t-il une interface graphique ?

Non. LMDeploy est une boîte à outils en ligne de commande et une bibliothèque Python. Il n'a pas de fenêtre de chat — vous interagissez via le terminal, un script Python ou son serveur API compatible OpenAI.

LMDeploy est-il plus rapide que vLLM ?

Le README de LMDeploy indique un débit de requêtes jusqu'à 1,8x supérieur à vLLM, sur la base de benchmarks auto-publiés. Ce n'est pas un chiffre vérifié de manière indépendante — effectuez votre propre benchmark sur votre modèle et votre matériel cibles avant de vous y fier.

Quelle quantification LMDeploy prend-il en charge ?

La quantification 4 bits AWQ des poids, la quantification int8/int4 du cache KV (combinable avec AWQ), MXFP4 sur les GPU NVIDIA pris en charge, et, depuis 2026/02, la quantification 4 bits symétrique/asymétrique via une intégration avec vllm-project/llm-compressor.

Quels modèles LMDeploy prend-il en charge ?

Des dizaines de familles LLM — dont Llama, InternLM2/3, Qwen1.5 à Qwen3, DeepSeek-MoE/V2/V3/R1, Mistral, ChatGLM2, GLM-4 et Code Llama — plus des modèles vision-langage comme InternVL, LLaVA et CogVLM2. Consultez la documentation des modèles pris en charge de LMDeploy pour la liste complète et actuelle.

LMDeploy prend-il en charge des GPU autres que NVIDIA ?

Son moteur TurboMind principal vise les GPU NVIDIA CUDA. Le moteur PyTorch ajoute un support pour les NPU Huawei Ascend. Cette review n'a trouvé aucun chemin de support CPU seul ou Apple Silicon.

Qui développe LMDeploy ?

Les équipes MMRazor et MMDeploy, au sein de l'écosystème open source InternLM/OpenMMLab maintenu par le Shanghai AI Laboratory.

LMDeploy dispose-t-il d'un serveur API compatible OpenAI ?

Oui. Exécuter lmdeploy serve api_server démarre un serveur local qui reproduit le format de requête/réponse chat-completions d'OpenAI, permettant à du code client OpenAI existant de le cibler au lieu d'un point de terminaison cloud.

Sources

← Retour aux LLM locaux avancés