Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Review de LMDeploy: servicio de LLM de alto rendimiento y cuantización
Overview & Reference

Review de LMDeploy: servicio de LLM de alto rendimiento y cuantización

·10 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

LMDeploy es un kit de herramientas y biblioteca de Python gratuito y de código abierto (Apache 2.0), de línea de comandos, para comprimir, cuantizar y servir grandes modelos de lenguaje en GPU NVIDIA, instalado con pip install lmdeploy. Desarrollado por los equipos MMRazor y MMDeploy dentro del ecosistema InternLM/OpenMMLab, incluye dos motores de inferencia —TurboMind (un motor C++/CUDA optimizado para rendimiento) y un motor PyTorch en Python puro— además de cuantización AWQ y de caché KV, un servidor API compatible con OpenAI, y soporte para bastante más de 50 familias de LLM y VLM de pesos abiertos.

LMDeploy (github.com/InternLM/lmdeploy) es un kit de herramientas gratuito y de código abierto (Apache 2.0) para comprimir, cuantizar y servir grandes modelos de lenguaje, desarrollado por los equipos MMRazor y MMDeploy dentro del ecosistema InternLM/OpenMMLab. Se instala con pip install lmdeploy e incluye dos motores de inferencia —TurboMind y un motor PyTorch en Python puro— además de un servidor API compatible con OpenAI, con más de 8.000 estrellas en GitHub. Esta review es el complemento de la entrada de LMDeploy en el Directorio de Software LLM Local y explica qué hace realmente, cómo instalarlo y a quién le conviene.

Conclusiones clave

  • LMDeploy (github.com/InternLM/lmdeploy) es un kit de herramientas de inferencia y cuantización gratuito, de código abierto e instalable con pip —una CLI/biblioteca, no una app gráfica
  • Desarrollado por los equipos MMRazor y MMDeploy dentro del ecosistema InternLM/OpenMMLab (Shanghai AI Laboratory); repositorio creado el 15 de junio de 2023
  • Licenciado bajo Apache 2.0, confirmado a través del archivo LICENSE del repositorio de GitHub
  • Incluye dos motores de inferencia: TurboMind (C++/CUDA, optimizado para rendimiento) y un motor PyTorch en Python puro
  • Soporta cuantización AWQ de 4 bits solo de pesos y cuantización int8/int4 de caché KV
  • Más de 8.000 estrellas en GitHub y 750 forks al momento de esta review; última versión etiquetada v0.17.0, publicada el 1 de septiembre de 2026

📍 En una frase

LMDeploy es un kit de herramientas gratuito y de código abierto (Apache 2.0) para comprimir, cuantizar y servir LLM en GPU NVIDIA, desarrollado por los equipos MMRazor y MMDeploy en el ecosistema InternLM/OpenMMLab, instalado con pip install lmdeploy, con más de 8.000 estrellas en GitHub.

💬 En términos simples

LMDeploy es una herramienta de línea de comandos y una biblioteca de Python que se instala con pip y que toma un LLM que ya tiene (por ejemplo, de HuggingFace) y lo ejecuta rápido en su propia GPU, opcionalmente reduciéndolo antes mediante cuantización de 4 bits para usar menos memoria. No es una app de chat con una ventana en la que se hace clic: es infraestructura que se ejecuta en un servidor, y otras aplicaciones se comunican con ella a través de una API compatible con OpenAI.

📌Nota: Esta review se basa en el propio repositorio de GitHub, el README, la documentación y la ficha de PyPI de LMDeploy. Las cifras de rendimiento y velocidad de cuantización (como "1,8x más rápido que vLLM") son benchmarks publicados por el propio LMDeploy, no mediciones independientes de PromptQuorum —verifique los benchmarks publicados actuales antes de basar una decisión de compra o de arquitectura en una cifra concreta.

¿Qué es LMDeploy?

LMDeploy es un kit de herramientas para comprimir, desplegar y servir grandes modelos de lenguaje, construido para ejecutar inferencia en GPU NVIDIA con alto rendimiento. Su propia descripción en GitHub indica que fue desarrollado por los equipos MMRazor y MMDeploy —ambos proyectos de OpenMMLab, el ecosistema de código abierto de visión por computadora y despliegue de modelos mantenido por el Shanghai AI Laboratory, la misma organización detrás de la familia de modelos InternLM.

  • Tipo de producto: una herramienta de línea de comandos y una biblioteca de Python —sin interfaz gráfica; se usa desde una terminal, un script de Python o un contenedor Docker
  • Desarrollador: los equipos MMRazor y MMDeploy, parte del ecosistema InternLM/OpenMMLab bajo el Shanghai AI Laboratory
  • Repositorio: InternLM/lmdeploy en GitHub, creado el 15 de junio de 2023
  • Licencia: Apache 2.0, confirmada a través del archivo LICENSE del repositorio
  • Escala: más de 8.000 estrellas en GitHub, 750 forks y 596 issues abiertos al momento de esta review
  • Distribución: publicado en PyPI como el paquete lmdeploy, además de imágenes Docker oficiales según la documentación del proyecto

Historia del proyecto e hitos de versiones

El repositorio de GitHub de LMDeploy se creó en junio de 2023, y el proyecto se ha desarrollado de forma continua desde entonces, ampliándose de un único motor de inferencia TurboMind a un kit de herramientas de dos motores con cuantización, soporte multimodal (VLM) y servicio distribuido.

  1. 1
    2023/08 — Cuantización AWQ de 4 bits y lanzamiento en HuggingFace Hub
    Why it matters: Añadió cuantización de pesos de 4 bits basada en AWQ y publicó modelos de 4 bits listos para usar en HuggingFace, según el changelog oficial.
  2. 2
    2024/01 — Introducción del motor de inferencia PyTorch
    Why it matters: Añadió un segundo motor de inferencia, en Python puro, junto a TurboMind, reduciendo la barrera para que los desarrolladores extiendan o depuren la pila de servicio.
  3. 3
    2024/06–2024/07 — Soporte de VLM y llamadas a funciones
    Why it matters: Añadió pipelines de inferencia multimodal (modelos de visión y lenguaje) y su servicio, además de llamadas a herramientas/funciones para Llama 3.1 e InternLM2.5.
  4. 4
    2025/01 — Soporte para DeepSeek V3 y R1
    Why it matters: Añadió soporte casi inmediato para las familias de modelos DeepSeek V3 y R1, una línea de modelos de razonamiento ampliamente utilizada.
  5. 5
    2025/06 — Desagregación PD de DeepSeek
    Why it matters: Integró la desagregación de prefill/decode para modelos DeepSeek a través de DLSlime y Mooncake, una técnica de producción para escalar el servicio de grandes modelos MoE entre varias máquinas.
  6. 6
    2025/09 — Soporte de MXFP4 en GPU NVIDIA (V100 y posteriores)
    Why it matters: Añadió inferencia cuantizada MXFP4, que según el propio changelog de LMDeploy alcanza 1,5x el rendimiento de vLLM en GPU H800 para modelos gpt-oss de OpenAI.
  7. 7
    2026/02 — Soporte de Qwen3.5 e integración con llm-compressor
    Why it matters: Añadió soporte para la colección de modelos Qwen3.5 e integró vllm-project/llm-compressor para cuantización simétrica/asimétrica de 4 bits.
  8. 8
    v0.17.0 — 1 de septiembre de 2026
    Why it matters: La última versión etiquetada en GitHub al momento de esta review —consulte directamente la [página de releases de GitHub](https://github.com/InternLM/lmdeploy/releases) para cualquier cosa publicada después de la fecha de publicación de esta review.

¿Qué se puede hacer con LMDeploy?

El conjunto de funciones de LMDeploy se centra en tres tareas: reducir un modelo mediante cuantización, ejecutarlo de forma eficiente y exponerlo como un servicio de red. Esto es lo que hace realmente cada parte, según el propio README y la documentación de LMDeploy.

  • Dos motores de inferencia — TurboMind, un motor C++/CUDA que LMDeploy posiciona como su opción de mayor rendimiento, y un motor PyTorch en Python puro, más fácil de extender y ampliar con nuevas arquitecturas de modelos; elija según el modelo consultando la propia tabla de modelos soportados de LMDeploy
  • Batching continuo y atención paginada — batching persistente (continuo), caché KV en bloques/paginada y split-and-fuse dinámico, la misma clase de técnicas usadas por otros motores de inferencia en producción para aumentar el uso de GPU con solicitudes concurrentes
  • Cuantización — cuantización AWQ de 4 bits solo de pesos, más cuantización int8/int4 de caché KV que puede combinarse con AWQ al mismo tiempo, y (desde 2026/02) cuantización simétrica/asimétrica de 4 bits mediante una integración con llm-compressor
  • Amplio soporte de modelos — decenas de familias de LLM, incluyendo Llama, Llama2/3/3.1/3.2, InternLM2/3, Qwen1.5/2/2.5/3, Qwen3-MoE, Qwen3-Next, DeepSeek-MoE/V2/V3/R1, Mistral, Mixtral, ChatGLM2, GLM-4, Yi, Baichuan2 y Code Llama, según la documentación de modelos soportados de LMDeploy
  • Soporte de modelos de visión y lenguaje (VLM) — pipelines de inferencia sin conexión y servicio por API para modelos multimodales como InternVL, LLaVA, MiniGemini y CogVLM2
  • Servidor API compatible con OpenAIlmdeploy serve api_server inicia un servidor que reproduce el formato de solicitud/respuesta de chat completions de OpenAI, documentado por separado para LLM y VLM
  • Pipeline de inferencia por lotes sin conexión — una API de Python lmdeploy.pipeline() para ejecutar inferencia directamente dentro de un script, sin necesidad de levantar un servidor
  • Servidor proxy multimodelo y multimáquina — un servicio de distribución de solicitudes para ejecutar varios modelos en varias máquinas y GPU detrás de un único punto de entrada
  • Soporte de hardware más allá de las GPU NVIDIA CUDA — soporte de NPU Huawei Ascend a través del motor PyTorch, y soporte de Windows (grado de paralelismo tensorial 1) a través de TurboMind

Ejemplos de uso: tres formas de usar LMDeploy

Estos son flujos de trabajo concretos construidos a partir de los comandos documentados de LMDeploy anteriores —no casos de uso hipotéticos.

Precios y licencia

LMDeploy es gratuito y de código abierto, sin ningún nivel de pago. El archivo LICENSE del repositorio de GitHub aplica la Apache License, versión 2.0, sin modificaciones, y no existe ninguna página de precios en la documentación del proyecto.

  • Sin suscripción, sin nivel de pago, sin límites de uso impuestos por LMDeploy
  • No se requiere cuenta ni registro para instalar o usar el kit de herramientas
  • Su costo real es el del hardware de GPU o la instancia de GPU en la nube en la que ejecuta LMDeploy —LMDeploy en sí no añade ningún cargo adicional
  • Apache 2.0 es una licencia permisiva: sin obligación de copyleft de liberar su propio código, y el uso comercial/en producción está explícitamente permitido

LMDeploy vs. vLLM

LMDeploy y vLLM están entre los motores de inferencia de LLM de código abierto más usados, y el propio marketing de LMDeploy se compara explícitamente con vLLM. Ambos son gratuitos, cercanos a Apache 2.0 (vLLM también es Apache 2.0), instalables con Python y soportan un servidor API compatible con OpenAI —las diferencias están sobre todo en la arquitectura del motor, el tamaño del ecosistema y el enfoque en ciertas familias de modelos.

Motores principales

LMDeploy:
TurboMind (C++/CUDA) más un motor PyTorch
vLLM:
Un único motor basado en PagedAttention

Afirmación de rendimiento

LMDeploy:
Hasta 1,8x vLLM (según sus propios datos)
vLLM:
Ampliamente citado como referencia estándar del sector

Cuantización

LMDeploy:
AWQ, caché KV int8/int4, MXFP4
vLLM:
AWQ, GPTQ, FP8 y otros formatos

Tamaño del ecosistema

LMDeploy:
~8.000 estrellas en GitHub
vLLM:
Una comunidad más grande y una superficie de integración de terceros más amplia

Fortaleza por familia de modelos

LMDeploy:
Soporte de primera clase muy sólido para InternLM y Qwen
vLLM:
Muy amplio, a menudo el primero en soportar nuevos lanzamientos de muchos laboratorios

Desarrollador

LMDeploy:
Equipos MMRazor/MMDeploy (Shanghai AI Laboratory)
vLLM:
Originado en UC Berkeley, ahora un amplio proyecto open source con muchas empresas

Las afirmaciones de rendimiento de LMDeploy son cifras propias publicadas por el proyecto, no un benchmark independiente de PromptQuorum —realice su propia comparación con su modelo, GPU y patrón de tráfico objetivo antes de elegir uno para producción. Vea la explicación de vLLM para más detalles sobre vLLM en particular.

¿Quién debería usar LMDeploy?

LMDeploy encaja con equipos que despliegan LLM en su propia infraestructura de GPU NVIDIA y quieren una pila de servicio consciente de la cuantización y de alto rendimiento, en lugar de una app de chat de escritorio.

Competidores y alternativas

LMDeploy se ubica en el segmento de motores de servicio de LLM en producción junto a vLLM, TensorRT-LLM, SGLang y ExLlamaV2 —herramientas construidas para ejecutar modelos a escala en hardware de GPU dedicado, distintas de las apps de escritorio orientadas al consumidor.

vLLM

Conocida por:
El motor de inferencia open source más adoptado, PagedAttention, amplio soporte desde el primer día
Artículos sobre vLLM (10)

+81 más no mostrados

TensorRT-LLM

Conocida por:
La biblioteca de inferencia propia de NVIDIA basada en compilador, muy optimizada para su hardware
Artículos sobre TensorRT-LLM (7)

También mencionado en:

SGLang

Conocida por:
Un motor de inferencia y lenguaje de generación estructurada basado en la caché RadixAttention
Artículos sobre SGLang (5)

También mencionado en:

ExLlamaV2

Conocida por:
Un motor centrado en la cuantización, popular para ejecutar modelos GPTQ/EXL2 en GPU de consumo
Artículos sobre ExLlamaV2 (2)

También mencionado en:

Esta lista refleja herramientas que suelen compararse con LMDeploy en el segmento de servicio en producción, no un ranking independiente de PromptQuorum —verifique el conjunto de funciones y los requisitos de hardware actuales de cada herramienta antes de elegir.

Errores comunes al evaluar LMDeploy

La mayor parte de la confusión sobre LMDeploy proviene de tratarlo como una app de chat de escritorio, o de citar sus cifras de benchmark autorreportadas como si fueran verificadas de forma independiente.

Preguntas frecuentes

¿Qué es LMDeploy?

LMDeploy (github.com/InternLM/lmdeploy) es un kit de herramientas gratuito y de código abierto (Apache 2.0) para comprimir, cuantizar y servir grandes modelos de lenguaje en GPU NVIDIA, desarrollado por los equipos MMRazor y MMDeploy dentro del ecosistema InternLM/OpenMMLab.

¿Es gratis LMDeploy?

Sí. LMDeploy tiene licencia Apache 2.0, sin página de precios ni nivel de pago. Su costo real es el del hardware de GPU o la instancia en la nube en la que lo ejecuta.

¿Cómo instalo LMDeploy?

Ejecute pip install lmdeploy dentro de un entorno Python 3.10–3.13 (se recomienda un entorno conda). Desde la v0.13.0, las wheels de PyPI por defecto apuntan a CUDA 12.8, por lo que suele bastar sin una instalación de CUDA aparte en configuraciones típicas de GPU NVIDIA.

¿Tiene LMDeploy interfaz gráfica?

No. LMDeploy es un kit de herramientas de línea de comandos y una biblioteca de Python. No tiene ventana de chat —interactúa con él mediante la terminal, un script de Python o su servidor API compatible con OpenAI.

¿Es LMDeploy más rápido que vLLM?

El propio README de LMDeploy reporta hasta 1,8x más rendimiento de solicitudes que vLLM, basado en benchmarks propios publicados. No es una cifra verificada de forma independiente —ejecute su propio benchmark con su modelo y hardware objetivo antes de confiar en ella.

¿Qué cuantización soporta LMDeploy?

Cuantización AWQ de 4 bits solo de pesos, cuantización int8/int4 de caché KV (combinable con AWQ), MXFP4 en GPU NVIDIA soportadas, y, desde 2026/02, cuantización simétrica/asimétrica de 4 bits mediante una integración con vllm-project/llm-compressor.

¿Qué modelos soporta LMDeploy?

Decenas de familias de LLM —incluyendo Llama, InternLM2/3, Qwen1.5 hasta Qwen3, DeepSeek-MoE/V2/V3/R1, Mistral, ChatGLM2, GLM-4 y Code Llama— además de modelos de visión y lenguaje como InternVL, LLaVA y CogVLM2. Consulte la propia documentación de modelos soportados de LMDeploy para la lista completa y actualizada.

¿Soporta LMDeploy GPU distintas de NVIDIA?

Su motor principal, TurboMind, apunta a GPU NVIDIA CUDA. El motor PyTorch añade soporte para NPU Huawei Ascend. Esta review no encontró una vía de soporte solo de CPU o Apple Silicon.

¿Quién desarrolla LMDeploy?

Los equipos MMRazor y MMDeploy, parte del ecosistema open source InternLM/OpenMMLab mantenido por el Shanghai AI Laboratory.

¿Tiene LMDeploy un servidor API compatible con OpenAI?

Sí. Ejecutar lmdeploy serve api_server inicia un servidor local que reproduce el formato de solicitud/respuesta de chat completions de OpenAI, de modo que el código cliente de OpenAI ya existente puede apuntar a él en lugar de a un endpoint en la nube.

Fuentes

← Volver a LLM locales avanzados