Conclusiones clave
- LMDeploy (github.com/InternLM/lmdeploy) es un kit de herramientas de inferencia y cuantización gratuito, de código abierto e instalable con pip —una CLI/biblioteca, no una app gráfica
- Desarrollado por los equipos MMRazor y MMDeploy dentro del ecosistema InternLM/OpenMMLab (Shanghai AI Laboratory); repositorio creado el 15 de junio de 2023
- Licenciado bajo Apache 2.0, confirmado a través del archivo LICENSE del repositorio de GitHub
- Incluye dos motores de inferencia: TurboMind (C++/CUDA, optimizado para rendimiento) y un motor PyTorch en Python puro
- Soporta cuantización AWQ de 4 bits solo de pesos y cuantización int8/int4 de caché KV
- Más de 8.000 estrellas en GitHub y 750 forks al momento de esta review; última versión etiquetada v0.17.0, publicada el 1 de septiembre de 2026
📍 En una frase
LMDeploy es un kit de herramientas gratuito y de código abierto (Apache 2.0) para comprimir, cuantizar y servir LLM en GPU NVIDIA, desarrollado por los equipos MMRazor y MMDeploy en el ecosistema InternLM/OpenMMLab, instalado con pip install lmdeploy, con más de 8.000 estrellas en GitHub.
💬 En términos simples
LMDeploy es una herramienta de línea de comandos y una biblioteca de Python que se instala con pip y que toma un LLM que ya tiene (por ejemplo, de HuggingFace) y lo ejecuta rápido en su propia GPU, opcionalmente reduciéndolo antes mediante cuantización de 4 bits para usar menos memoria. No es una app de chat con una ventana en la que se hace clic: es infraestructura que se ejecuta en un servidor, y otras aplicaciones se comunican con ella a través de una API compatible con OpenAI.
📌Nota: Esta review se basa en el propio repositorio de GitHub, el README, la documentación y la ficha de PyPI de LMDeploy. Las cifras de rendimiento y velocidad de cuantización (como "1,8x más rápido que vLLM") son benchmarks publicados por el propio LMDeploy, no mediciones independientes de PromptQuorum —verifique los benchmarks publicados actuales antes de basar una decisión de compra o de arquitectura en una cifra concreta.
¿Qué es LMDeploy?
LMDeploy es un kit de herramientas para comprimir, desplegar y servir grandes modelos de lenguaje, construido para ejecutar inferencia en GPU NVIDIA con alto rendimiento. Su propia descripción en GitHub indica que fue desarrollado por los equipos MMRazor y MMDeploy —ambos proyectos de OpenMMLab, el ecosistema de código abierto de visión por computadora y despliegue de modelos mantenido por el Shanghai AI Laboratory, la misma organización detrás de la familia de modelos InternLM.
- Tipo de producto: una herramienta de línea de comandos y una biblioteca de Python —sin interfaz gráfica; se usa desde una terminal, un script de Python o un contenedor Docker
- Desarrollador: los equipos MMRazor y MMDeploy, parte del ecosistema InternLM/OpenMMLab bajo el Shanghai AI Laboratory
- Repositorio: InternLM/lmdeploy en GitHub, creado el 15 de junio de 2023
- Licencia: Apache 2.0, confirmada a través del archivo LICENSE del repositorio
- Escala: más de 8.000 estrellas en GitHub, 750 forks y 596 issues abiertos al momento de esta review
- Distribución: publicado en PyPI como el paquete
lmdeploy, además de imágenes Docker oficiales según la documentación del proyecto
Historia del proyecto e hitos de versiones
El repositorio de GitHub de LMDeploy se creó en junio de 2023, y el proyecto se ha desarrollado de forma continua desde entonces, ampliándose de un único motor de inferencia TurboMind a un kit de herramientas de dos motores con cuantización, soporte multimodal (VLM) y servicio distribuido.
- 12023/08 — Cuantización AWQ de 4 bits y lanzamiento en HuggingFace Hub
Why it matters: Añadió cuantización de pesos de 4 bits basada en AWQ y publicó modelos de 4 bits listos para usar en HuggingFace, según el changelog oficial. - 22024/01 — Introducción del motor de inferencia PyTorch
Why it matters: Añadió un segundo motor de inferencia, en Python puro, junto a TurboMind, reduciendo la barrera para que los desarrolladores extiendan o depuren la pila de servicio. - 32024/06–2024/07 — Soporte de VLM y llamadas a funciones
Why it matters: Añadió pipelines de inferencia multimodal (modelos de visión y lenguaje) y su servicio, además de llamadas a herramientas/funciones para Llama 3.1 e InternLM2.5. - 42025/01 — Soporte para DeepSeek V3 y R1
Why it matters: Añadió soporte casi inmediato para las familias de modelos DeepSeek V3 y R1, una línea de modelos de razonamiento ampliamente utilizada. - 52025/06 — Desagregación PD de DeepSeek
Why it matters: Integró la desagregación de prefill/decode para modelos DeepSeek a través de DLSlime y Mooncake, una técnica de producción para escalar el servicio de grandes modelos MoE entre varias máquinas. - 62025/09 — Soporte de MXFP4 en GPU NVIDIA (V100 y posteriores)
Why it matters: Añadió inferencia cuantizada MXFP4, que según el propio changelog de LMDeploy alcanza 1,5x el rendimiento de vLLM en GPU H800 para modelos gpt-oss de OpenAI. - 72026/02 — Soporte de Qwen3.5 e integración con llm-compressor
Why it matters: Añadió soporte para la colección de modelos Qwen3.5 e integró vllm-project/llm-compressor para cuantización simétrica/asimétrica de 4 bits. - 8v0.17.0 — 1 de septiembre de 2026
Why it matters: La última versión etiquetada en GitHub al momento de esta review —consulte directamente la [página de releases de GitHub](https://github.com/InternLM/lmdeploy/releases) para cualquier cosa publicada después de la fecha de publicación de esta review.
¿Qué se puede hacer con LMDeploy?
El conjunto de funciones de LMDeploy se centra en tres tareas: reducir un modelo mediante cuantización, ejecutarlo de forma eficiente y exponerlo como un servicio de red. Esto es lo que hace realmente cada parte, según el propio README y la documentación de LMDeploy.
- Dos motores de inferencia — TurboMind, un motor C++/CUDA que LMDeploy posiciona como su opción de mayor rendimiento, y un motor PyTorch en Python puro, más fácil de extender y ampliar con nuevas arquitecturas de modelos; elija según el modelo consultando la propia tabla de modelos soportados de LMDeploy
- Batching continuo y atención paginada — batching persistente (continuo), caché KV en bloques/paginada y split-and-fuse dinámico, la misma clase de técnicas usadas por otros motores de inferencia en producción para aumentar el uso de GPU con solicitudes concurrentes
- Cuantización — cuantización AWQ de 4 bits solo de pesos, más cuantización int8/int4 de caché KV que puede combinarse con AWQ al mismo tiempo, y (desde 2026/02) cuantización simétrica/asimétrica de 4 bits mediante una integración con llm-compressor
- Amplio soporte de modelos — decenas de familias de LLM, incluyendo Llama, Llama2/3/3.1/3.2, InternLM2/3, Qwen1.5/2/2.5/3, Qwen3-MoE, Qwen3-Next, DeepSeek-MoE/V2/V3/R1, Mistral, Mixtral, ChatGLM2, GLM-4, Yi, Baichuan2 y Code Llama, según la documentación de modelos soportados de LMDeploy
- Soporte de modelos de visión y lenguaje (VLM) — pipelines de inferencia sin conexión y servicio por API para modelos multimodales como InternVL, LLaVA, MiniGemini y CogVLM2
- Servidor API compatible con OpenAI —
lmdeploy serve api_serverinicia un servidor que reproduce el formato de solicitud/respuesta de chat completions de OpenAI, documentado por separado para LLM y VLM - Pipeline de inferencia por lotes sin conexión — una API de Python
lmdeploy.pipeline()para ejecutar inferencia directamente dentro de un script, sin necesidad de levantar un servidor - Servidor proxy multimodelo y multimáquina — un servicio de distribución de solicitudes para ejecutar varios modelos en varias máquinas y GPU detrás de un único punto de entrada
- Soporte de hardware más allá de las GPU NVIDIA CUDA — soporte de NPU Huawei Ascend a través del motor PyTorch, y soporte de Windows (grado de paralelismo tensorial 1) a través de TurboMind
Ejemplos de uso: tres formas de usar LMDeploy
Estos son flujos de trabajo concretos construidos a partir de los comandos documentados de LMDeploy anteriores —no casos de uso hipotéticos.
Instalar LMDeploy
LMDeploy se instala gratis con pip dentro de un entorno Python 3.10–3.13, y su código fuente está en GitHub. Requiere una GPU NVIDIA CUDA para su motor TurboMind; el motor PyTorch y el soporte de Huawei Ascend amplían las opciones de hardware para casos de uso específicos.
Fuente | Link |
|---|---|
| Repositorio de GitHub (código fuente, Apache 2.0) | github.com/InternLM/lmdeploy |
| Paquete PyPI | pypi.org/project/lmdeploy |
| Documentación | lmdeploy.readthedocs.io |
| Comando de instalación | conda create -n lmdeploy python=3.12 -y && conda activate lmdeploy && pip install lmdeploy |
Desde la v0.13.0, las wheels de PyPI por defecto se compilan contra CUDA 12.8, por lo que un simple pip install lmdeploy basta para configuraciones típicas de GPU NVIDIA, incluida la serie GeForce RTX 50, según el propio README del proyecto. No hay instalador gráfico —verifique el método de instalación recomendado actualmente en GitHub antes de ejecutar cualquier comando, ya que las instrucciones pueden cambiar entre versiones.
Precios y licencia
LMDeploy es gratuito y de código abierto, sin ningún nivel de pago. El archivo LICENSE del repositorio de GitHub aplica la Apache License, versión 2.0, sin modificaciones, y no existe ninguna página de precios en la documentación del proyecto.
- Sin suscripción, sin nivel de pago, sin límites de uso impuestos por LMDeploy
- No se requiere cuenta ni registro para instalar o usar el kit de herramientas
- Su costo real es el del hardware de GPU o la instancia de GPU en la nube en la que ejecuta LMDeploy —LMDeploy en sí no añade ningún cargo adicional
- Apache 2.0 es una licencia permisiva: sin obligación de copyleft de liberar su propio código, y el uso comercial/en producción está explícitamente permitido
LMDeploy vs. vLLM
LMDeploy y vLLM están entre los motores de inferencia de LLM de código abierto más usados, y el propio marketing de LMDeploy se compara explícitamente con vLLM. Ambos son gratuitos, cercanos a Apache 2.0 (vLLM también es Apache 2.0), instalables con Python y soportan un servidor API compatible con OpenAI —las diferencias están sobre todo en la arquitectura del motor, el tamaño del ecosistema y el enfoque en ciertas familias de modelos.
Motores principales
- LMDeploy:
- TurboMind (C++/CUDA) más un motor PyTorch
- vLLM:
- Un único motor basado en PagedAttention
Afirmación de rendimiento
- LMDeploy:
- Hasta 1,8x vLLM (según sus propios datos)
- vLLM:
- Ampliamente citado como referencia estándar del sector
Cuantización
- LMDeploy:
- AWQ, caché KV int8/int4, MXFP4
- vLLM:
- AWQ, GPTQ, FP8 y otros formatos
Tamaño del ecosistema
- LMDeploy:
- ~8.000 estrellas en GitHub
- vLLM:
- Una comunidad más grande y una superficie de integración de terceros más amplia
Fortaleza por familia de modelos
- LMDeploy:
- Soporte de primera clase muy sólido para InternLM y Qwen
- vLLM:
- Muy amplio, a menudo el primero en soportar nuevos lanzamientos de muchos laboratorios
Desarrollador
- LMDeploy:
- Equipos MMRazor/MMDeploy (Shanghai AI Laboratory)
- vLLM:
- Originado en UC Berkeley, ahora un amplio proyecto open source con muchas empresas
Las afirmaciones de rendimiento de LMDeploy son cifras propias publicadas por el proyecto, no un benchmark independiente de PromptQuorum —realice su propia comparación con su modelo, GPU y patrón de tráfico objetivo antes de elegir uno para producción. Vea la explicación de vLLM para más detalles sobre vLLM en particular.
¿Quién debería usar LMDeploy?
LMDeploy encaja con equipos que despliegan LLM en su propia infraestructura de GPU NVIDIA y quieren una pila de servicio consciente de la cuantización y de alto rendimiento, en lugar de una app de chat de escritorio.
Competidores y alternativas
LMDeploy se ubica en el segmento de motores de servicio de LLM en producción junto a vLLM, TensorRT-LLM, SGLang y ExLlamaV2 —herramientas construidas para ejecutar modelos a escala en hardware de GPU dedicado, distintas de las apps de escritorio orientadas al consumidor.
vLLM
- Conocida por:
- El motor de inferencia open source más adoptado, PagedAttention, amplio soporte desde el primer día
- Link:
- vLLM explicado
Artículos sobre vLLM (10)
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)Actualizado 6 de septiembre de 2026
- llama.cpp Explained: The Engine Powering Ollama (2026)Actualizado 20 de septiembre de 2026
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026Actualizado 20 de septiembre de 2026
- candle-vllm Review: Rust-Native LLM Serving on CUDA and MetalActualizado 19 de septiembre de 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingActualizado 19 de septiembre de 2026
- KServe Review: Kubernetes-Native Model Serving at ScaleActualizado 19 de septiembre de 2026
- LMDeploy Review: High-Throughput LLM Serving and QuantizationActualizado 19 de septiembre de 2026
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API ServerActualizado 19 de septiembre de 2026
- TranslateBooksWithLLMs Review: Translate Full Books With a Local or Cloud LLMActualizado 19 de septiembre de 2026
- vllm-mlx Review: vLLM-Style Serving for Apple SiliconActualizado 19 de septiembre de 2026
+81 más no mostrados
TensorRT-LLM
- Conocida por:
- La biblioteca de inferencia propia de NVIDIA basada en compilador, muy optimizada para su hardware
Artículos sobre TensorRT-LLM (7)
- TensorRT-LLM Explained: NVIDIA's GPU-Optimized Inference Engine (2026)Actualizado 6 de septiembre de 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingActualizado 19 de septiembre de 2026
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIActualizado 12 de septiembre de 2026
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)Actualizado 6 de septiembre de 2026
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)Actualizado 6 de septiembre de 2026
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"Actualizado 5 de septiembre de 2026
- Enterprise LLM Inference Servers 2026: vLLM vs TGI vs NVIDIA NIM vs OllamaActualizado 2 de septiembre de 2026
También mencionado en:
- LMDeploy Review: High-Throughput LLM Serving and QuantizationActualizado 19 de septiembre de 2026
- Running LLMs and VLA Models On-Robot 2026: What Fits, What Doesn'tActualizado 2 de septiembre de 2026
- Apple MLX vs NVIDIA CUDA for Local LLMs: Which System Should You Choose in 2026?Actualizado 29 de agosto de 2026
SGLang
- Conocida por:
- Un motor de inferencia y lenguaje de generación estructurada basado en la caché RadixAttention
- Link:
- SGLang explicado
Artículos sobre SGLang (5)
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)Actualizado 6 de septiembre de 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingActualizado 19 de septiembre de 2026
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIActualizado 12 de septiembre de 2026
- Kilo Code Review: The Open-Source Coding Agent Now Owned by AnacondaActualizado 12 de septiembre de 2026
- Text-Generation-WebUI vs vLLM vs llama.cpp in 2026: Inference Engine ComparisonActualizado 29 de agosto de 2026
También mencionado en:
- AIClient2API Review: One Local Proxy for Every AI ProtocolActualizado 19 de septiembre de 2026
- LMDeploy Review: High-Throughput LLM Serving and QuantizationActualizado 19 de septiembre de 2026
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API ServerActualizado 19 de septiembre de 2026
- Locally Uncensored Review 2026: Local Chat, Image, and Video in One AppActualizado 12 de septiembre de 2026
ExLlamaV2
- Conocida por:
- Un motor centrado en la cuantización, popular para ejecutar modelos GPTQ/EXL2 en GPU de consumo
- Link:
- ExLlamaV2 explicado
Artículos sobre ExLlamaV2 (2)
- ExLlamaV2 Explained 2026: Archived, Succeeded by ExLlamaV3Actualizado 6 de septiembre de 2026
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"Actualizado 5 de septiembre de 2026
También mencionado en:
- LMDeploy Review: High-Throughput LLM Serving and QuantizationActualizado 19 de septiembre de 2026
- How to Double Local LLM Speed: Optimization TechniquesActualizado 28 de agosto de 2026
Esta lista refleja herramientas que suelen compararse con LMDeploy en el segmento de servicio en producción, no un ranking independiente de PromptQuorum —verifique el conjunto de funciones y los requisitos de hardware actuales de cada herramienta antes de elegir.
Errores comunes al evaluar LMDeploy
La mayor parte de la confusión sobre LMDeploy proviene de tratarlo como una app de chat de escritorio, o de citar sus cifras de benchmark autorreportadas como si fueran verificadas de forma independiente.
Preguntas frecuentes
¿Qué es LMDeploy?
LMDeploy (github.com/InternLM/lmdeploy) es un kit de herramientas gratuito y de código abierto (Apache 2.0) para comprimir, cuantizar y servir grandes modelos de lenguaje en GPU NVIDIA, desarrollado por los equipos MMRazor y MMDeploy dentro del ecosistema InternLM/OpenMMLab.
¿Es gratis LMDeploy?
Sí. LMDeploy tiene licencia Apache 2.0, sin página de precios ni nivel de pago. Su costo real es el del hardware de GPU o la instancia en la nube en la que lo ejecuta.
¿Cómo instalo LMDeploy?
Ejecute pip install lmdeploy dentro de un entorno Python 3.10–3.13 (se recomienda un entorno conda). Desde la v0.13.0, las wheels de PyPI por defecto apuntan a CUDA 12.8, por lo que suele bastar sin una instalación de CUDA aparte en configuraciones típicas de GPU NVIDIA.
¿Tiene LMDeploy interfaz gráfica?
No. LMDeploy es un kit de herramientas de línea de comandos y una biblioteca de Python. No tiene ventana de chat —interactúa con él mediante la terminal, un script de Python o su servidor API compatible con OpenAI.
¿Es LMDeploy más rápido que vLLM?
El propio README de LMDeploy reporta hasta 1,8x más rendimiento de solicitudes que vLLM, basado en benchmarks propios publicados. No es una cifra verificada de forma independiente —ejecute su propio benchmark con su modelo y hardware objetivo antes de confiar en ella.
¿Qué cuantización soporta LMDeploy?
Cuantización AWQ de 4 bits solo de pesos, cuantización int8/int4 de caché KV (combinable con AWQ), MXFP4 en GPU NVIDIA soportadas, y, desde 2026/02, cuantización simétrica/asimétrica de 4 bits mediante una integración con vllm-project/llm-compressor.
¿Qué modelos soporta LMDeploy?
Decenas de familias de LLM —incluyendo Llama, InternLM2/3, Qwen1.5 hasta Qwen3, DeepSeek-MoE/V2/V3/R1, Mistral, ChatGLM2, GLM-4 y Code Llama— además de modelos de visión y lenguaje como InternVL, LLaVA y CogVLM2. Consulte la propia documentación de modelos soportados de LMDeploy para la lista completa y actualizada.
¿Soporta LMDeploy GPU distintas de NVIDIA?
Su motor principal, TurboMind, apunta a GPU NVIDIA CUDA. El motor PyTorch añade soporte para NPU Huawei Ascend. Esta review no encontró una vía de soporte solo de CPU o Apple Silicon.
¿Quién desarrolla LMDeploy?
Los equipos MMRazor y MMDeploy, parte del ecosistema open source InternLM/OpenMMLab mantenido por el Shanghai AI Laboratory.
¿Tiene LMDeploy un servidor API compatible con OpenAI?
Sí. Ejecutar lmdeploy serve api_server inicia un servidor local que reproduce el formato de solicitud/respuesta de chat completions de OpenAI, de modo que el código cliente de OpenAI ya existente puede apuntar a él en lugar de a un endpoint en la nube.