Principais conclusões
- O LMDeploy (github.com/InternLM/lmdeploy) é um toolkit de inferência e quantização gratuito, de código aberto e instalável via pip — uma CLI/biblioteca, não um app gráfico
- Desenvolvido pelas equipes MMRazor e MMDeploy dentro do ecossistema InternLM/OpenMMLab (Shanghai AI Laboratory); repositório criado em 15 de junho de 2023
- Licenciado sob Apache 2.0, confirmado pelo arquivo LICENSE do repositório no GitHub
- Traz dois mecanismos de inferência: TurboMind (C++/CUDA, otimizado para throughput) e um mecanismo PyTorch em Python puro
- Suporta quantização AWQ de 4 bits somente dos pesos e quantização int8/int4 do cache KV
- Mais de 8.000 estrelas no GitHub e 750 forks no momento desta review; última release marcada v0.17.0, publicada em 1º de setembro de 2026
📍 Em uma frase
O LMDeploy é um toolkit gratuito e de código aberto (Apache 2.0) para comprimir, quantizar e servir LLMs em GPUs NVIDIA, desenvolvido pelas equipes MMRazor e MMDeploy no ecossistema InternLM/OpenMMLab, instalado via pip install lmdeploy, com mais de 8.000 estrelas no GitHub.
💬 Em termos simples
O LMDeploy é uma ferramenta de linha de comando e uma biblioteca Python que você instala com pip, e que pega um LLM que você já tem (do HuggingFace, por exemplo) e o executa rapidamente na sua própria GPU, opcionalmente reduzindo-o antes com quantização de 4 bits para usar menos memória. Não é um app de chat com uma janela para clicar — é uma infraestrutura que você executa em um servidor, e outras aplicações conversam com ela por meio de uma API compatível com a OpenAI.
📌Nota: Esta review se baseia no próprio repositório GitHub, README, documentação e página do PyPI do LMDeploy. Os números de throughput e velocidade de quantização (como "1,8x mais rápido que o vLLM") são benchmarks autopublicados pelo LMDeploy, não medições independentes da PromptQuorum — verifique os benchmarks publicados atuais antes de basear uma decisão de compra ou arquitetura em um número específico.
O que é o LMDeploy?
O LMDeploy é um toolkit para comprimir, implantar e servir grandes modelos de linguagem, construído para rodar inferência em GPUs NVIDIA com alto throughput. Sua própria descrição no GitHub afirma que ele foi desenvolvido pelas equipes MMRazor e MMDeploy — ambos projetos OpenMMLab, o ecossistema open source de visão computacional e implantação de modelos mantido pelo Shanghai AI Laboratory, a mesma organização por trás da família de modelos InternLM.
- Tipo de produto: uma ferramenta de linha de comando e uma biblioteca Python — sem interface gráfica; usada a partir de um terminal, um script Python ou um contêiner Docker
- Desenvolvedor: as equipes MMRazor e MMDeploy, parte do ecossistema InternLM/OpenMMLab sob o Shanghai AI Laboratory
- Repositório: InternLM/lmdeploy no GitHub, criado em 15 de junho de 2023
- Licença: Apache 2.0, confirmada pelo arquivo LICENSE do repositório
- Escala: mais de 8.000 estrelas no GitHub, 750 forks e 596 issues abertas no momento desta review
- Distribuição: publicado no PyPI como o pacote
lmdeploy, além de imagens Docker oficiais segundo a documentação do projeto
História do projeto e marcos de versão
O repositório GitHub do LMDeploy foi criado em junho de 2023, e o projeto vem sendo lançado continuamente desde então, expandindo-se de um único mecanismo de inferência TurboMind para um toolkit de dois mecanismos com quantização, suporte multimodal (VLM) e serviço distribuído.
- 12023/08 — Quantização AWQ de 4 bits e lançamento no HuggingFace Hub
Why it matters: Adicionou quantização de pesos de 4 bits baseada em AWQ e publicou modelos de 4 bits prontos para uso no HuggingFace, segundo o changelog oficial. - 22024/01 — Mecanismo de inferência PyTorch introduzido
Why it matters: Adicionou um segundo mecanismo de inferência, em Python puro, ao lado do TurboMind, reduzindo a barreira para que desenvolvedores estendam ou depurem o stack de serviço. - 32024/06–2024/07 — Suporte a VLM e chamada de funções
Why it matters: Adicionou pipelines de inferência multimodal (modelos de visão e linguagem) e seu serviço, além de chamada de ferramentas/funções para Llama 3.1 e InternLM2.5. - 42025/01 — Suporte a DeepSeek V3 e R1
Why it matters: Adicionou suporte quase imediato às famílias de modelos DeepSeek V3 e R1, uma linhagem de modelos de raciocínio amplamente usada. - 52025/06 — Desagregação PD do DeepSeek
Why it matters: Integrou a desagregação de prefill/decode para modelos DeepSeek via DLSlime e Mooncake, uma técnica de produção para escalar o serviço de grandes modelos MoE entre várias máquinas. - 62025/09 — Suporte a MXFP4 em GPUs NVIDIA (V100 e mais recentes)
Why it matters: Adicionou inferência quantizada MXFP4, que segundo o próprio changelog do LMDeploy alcança 1,5x o throughput do vLLM em GPUs H800 para modelos gpt-oss da OpenAI. - 72026/02 — Suporte ao Qwen3.5 e integração com llm-compressor
Why it matters: Adicionou suporte à coleção de modelos Qwen3.5 e integrou o vllm-project/llm-compressor para quantização simétrica/assimétrica de 4 bits. - 8v0.17.0 — 1º de setembro de 2026
Why it matters: A última release marcada no GitHub no momento desta review — consulte diretamente a [página de releases do GitHub](https://github.com/InternLM/lmdeploy/releases) para qualquer coisa lançada após a data de publicação desta review.
O que dá para fazer com o LMDeploy?
O conjunto de recursos do LMDeploy se concentra em três tarefas: reduzir um modelo por meio de quantização, executá-lo com eficiência e expô-lo como um serviço de rede. Veja o que cada parte realmente faz, segundo o próprio README e a documentação do LMDeploy.
- Dois mecanismos de inferência — TurboMind, um mecanismo C++/CUDA que o LMDeploy posiciona como sua opção de maior throughput, e um mecanismo PyTorch em Python puro, mais fácil de estender e de receber novas arquiteturas de modelos; escolha conforme o modelo com base na própria tabela de modelos suportados do LMDeploy
- Batching contínuo e atenção paginada — batching persistente (contínuo), cache KV em blocos/paginado e split-and-fuse dinâmico, a mesma classe de técnicas usada por outros mecanismos de inferência em produção para aumentar a utilização da GPU sob requisições concorrentes
- Quantização — quantização AWQ de 4 bits somente dos pesos, além de quantização int8/int4 do cache KV que pode ser combinada com AWQ ao mesmo tempo, e (desde 2026/02) quantização simétrica/assimétrica de 4 bits via integração com o llm-compressor
- Amplo suporte a modelos — dezenas de famílias de LLM, incluindo Llama, Llama2/3/3.1/3.2, InternLM2/3, Qwen1.5/2/2.5/3, Qwen3-MoE, Qwen3-Next, DeepSeek-MoE/V2/V3/R1, Mistral, Mixtral, ChatGLM2, GLM-4, Yi, Baichuan2 e Code Llama, segundo a documentação de modelos suportados do LMDeploy
- Suporte a modelos de visão e linguagem (VLM) — pipelines de inferência offline e serviço via API para modelos multimodais como InternVL, LLaVA, MiniGemini e CogVLM2
- Servidor de API compatível com a OpenAI —
lmdeploy serve api_serverinicia um servidor que reproduz o formato de requisição/resposta de chat completions da OpenAI, documentado separadamente para LLMs e VLMs - Pipeline de inferência em lote offline — uma API Python
lmdeploy.pipeline()para executar inferência diretamente dentro de um script, sem precisar subir um servidor - Servidor proxy multimodelo e multimáquina — um serviço de distribuição de requisições para executar vários modelos em várias máquinas e GPUs atrás de um único ponto de entrada
- Suporte a hardware além das GPUs NVIDIA CUDA — suporte a NPUs Huawei Ascend via o mecanismo PyTorch, e suporte ao Windows (grau de paralelismo tensorial 1) via TurboMind
Exemplos de uso: três formas de usar o LMDeploy
Estes são fluxos de trabalho concretos construídos a partir dos comandos documentados do LMDeploy acima — não casos de uso hipotéticos.
Instalar o LMDeploy
O LMDeploy se instala gratuitamente via pip em um ambiente Python 3.10–3.13, e seu código-fonte está no GitHub. Ele exige uma GPU NVIDIA CUDA para seu mecanismo TurboMind; o mecanismo PyTorch e o suporte a Huawei Ascend ampliam as opções de hardware para casos de uso específicos.
Fonte | Link |
|---|---|
| Repositório GitHub (código-fonte, Apache 2.0) | github.com/InternLM/lmdeploy |
| Pacote PyPI | pypi.org/project/lmdeploy |
| Documentação | lmdeploy.readthedocs.io |
| Comando de instalação | conda create -n lmdeploy python=3.12 -y && conda activate lmdeploy && pip install lmdeploy |
Desde a v0.13.0, as wheels padrão do PyPI são compiladas contra o CUDA 12.8, então um simples pip install lmdeploy é suficiente para configurações típicas de GPU NVIDIA, incluindo a série GeForce RTX 50, segundo o próprio README do projeto. Não há instalador gráfico — verifique o método de instalação atualmente recomendado no GitHub antes de rodar qualquer comando, já que as instruções podem mudar entre releases.
Preços e licenciamento
O LMDeploy é gratuito e de código aberto, sem nenhum plano pago. O arquivo LICENSE do repositório GitHub aplica a Apache License, versão 2.0, sem modificações, e não existe nenhuma página de preços na documentação do projeto.
- Sem assinatura, sem plano pago, sem limites de uso impostos pelo próprio LMDeploy
- Não é necessário criar conta nem se cadastrar para instalar ou usar o toolkit
- Seu custo real é o do hardware de GPU ou da instância de GPU na nuvem em que você roda o LMDeploy — o LMDeploy em si não adiciona nenhuma taxa
- Apache 2.0 é uma licença permissiva: sem obrigação de copyleft de liberar seu próprio código, e o uso comercial/em produção é explicitamente permitido
LMDeploy vs. vLLM
O LMDeploy e o vLLM estão entre os mecanismos de inferência de LLM de código aberto mais usados, e o próprio marketing do LMDeploy se compara explicitamente ao vLLM. Ambos são gratuitos, próximos da Apache 2.0 (o vLLM também é Apache 2.0), instaláveis via Python e suportam um servidor de API compatível com a OpenAI — as diferenças estão principalmente na arquitetura do mecanismo, no tamanho do ecossistema e no foco em certas famílias de modelos.
Mecanismos principais
- LMDeploy:
- TurboMind (C++/CUDA) mais um mecanismo PyTorch
- vLLM:
- Um único mecanismo baseado em PagedAttention
Alegação de throughput
- LMDeploy:
- Até 1,8x o vLLM (autodeclarado)
- vLLM:
- Amplamente citado como referência padrão do setor
Quantização
- LMDeploy:
- AWQ, cache KV int8/int4, MXFP4
- vLLM:
- AWQ, GPTQ, FP8 e outros formatos
Tamanho do ecossistema
- LMDeploy:
- ~8.000 estrelas no GitHub
- vLLM:
- Uma comunidade maior e uma superfície de integração de terceiros mais ampla
Força por família de modelos
- LMDeploy:
- Suporte de primeira classe forte para InternLM e Qwen
- vLLM:
- Muito amplo, frequentemente o primeiro a suportar novos lançamentos de muitos laboratórios
Desenvolvedor
- LMDeploy:
- Equipes MMRazor/MMDeploy (Shanghai AI Laboratory)
- vLLM:
- Originado na UC Berkeley, hoje um amplo projeto open source com várias empresas
As alegações de throughput do LMDeploy são números próprios autopublicados, não um benchmark independente da PromptQuorum — faça sua própria comparação com seu modelo, GPU e padrão de tráfego alvo antes de escolher um deles para produção. Veja o explicador do vLLM para mais detalhes sobre o vLLM em si.
Para quem o LMDeploy é indicado?
O LMDeploy se encaixa em equipes que implantam LLMs na própria infraestrutura de GPU NVIDIA e querem um stack de serviço com suporte a quantização e alto throughput, em vez de um app de chat de desktop.
Concorrentes e alternativas
O LMDeploy fica no segmento de mecanismos de serviço de LLM em produção, ao lado do vLLM, TensorRT-LLM, SGLang e ExLlamaV2 — ferramentas construídas para rodar modelos em escala em hardware de GPU dedicado, diferentes dos apps de desktop voltados ao consumidor.
vLLM
- Conhecida por:
- O mecanismo de inferência open source mais adotado, PagedAttention, amplo suporte desde o primeiro dia
- Link:
- vLLM explicado
Artigos sobre vLLM (10)
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)Atualizado 6 de setembro de 2026
- llama.cpp Explained: The Engine Powering Ollama (2026)Atualizado 20 de setembro de 2026
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026Atualizado 20 de setembro de 2026
- candle-vllm Review: Rust-Native LLM Serving on CUDA and MetalAtualizado 19 de setembro de 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingAtualizado 19 de setembro de 2026
- KServe Review: Kubernetes-Native Model Serving at ScaleAtualizado 19 de setembro de 2026
- LMDeploy Review: High-Throughput LLM Serving and QuantizationAtualizado 19 de setembro de 2026
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API ServerAtualizado 19 de setembro de 2026
- TranslateBooksWithLLMs Review: Translate Full Books With a Local or Cloud LLMAtualizado 19 de setembro de 2026
- vllm-mlx Review: vLLM-Style Serving for Apple SiliconAtualizado 19 de setembro de 2026
+81 mais não exibidos
TensorRT-LLM
- Conhecida por:
- A biblioteca de inferência própria da NVIDIA baseada em compilador, profundamente otimizada para seu hardware
Artigos sobre TensorRT-LLM (7)
- TensorRT-LLM Explained: NVIDIA's GPU-Optimized Inference Engine (2026)Atualizado 6 de setembro de 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingAtualizado 19 de setembro de 2026
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIAtualizado 12 de setembro de 2026
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)Atualizado 6 de setembro de 2026
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)Atualizado 6 de setembro de 2026
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"Atualizado 5 de setembro de 2026
- Enterprise LLM Inference Servers 2026: vLLM vs TGI vs NVIDIA NIM vs OllamaAtualizado 2 de setembro de 2026
Também mencionado em:
- LMDeploy Review: High-Throughput LLM Serving and QuantizationAtualizado 19 de setembro de 2026
- Running LLMs and VLA Models On-Robot 2026: What Fits, What Doesn'tAtualizado 2 de setembro de 2026
- Apple MLX vs NVIDIA CUDA for Local LLMs: Which System Should You Choose in 2026?Atualizado 29 de agosto de 2026
SGLang
- Conhecida por:
- Um mecanismo de inferência e linguagem de geração estruturada construído em torno do cache RadixAttention
- Link:
- SGLang explicado
Artigos sobre SGLang (5)
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)Atualizado 6 de setembro de 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingAtualizado 19 de setembro de 2026
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIAtualizado 12 de setembro de 2026
- Kilo Code Review: The Open-Source Coding Agent Now Owned by AnacondaAtualizado 12 de setembro de 2026
- Text-Generation-WebUI vs vLLM vs llama.cpp in 2026: Inference Engine ComparisonAtualizado 29 de agosto de 2026
Também mencionado em:
- AIClient2API Review: One Local Proxy for Every AI ProtocolAtualizado 19 de setembro de 2026
- LMDeploy Review: High-Throughput LLM Serving and QuantizationAtualizado 19 de setembro de 2026
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API ServerAtualizado 19 de setembro de 2026
- Locally Uncensored Review 2026: Local Chat, Image, and Video in One AppAtualizado 12 de setembro de 2026
ExLlamaV2
- Conhecida por:
- Um mecanismo focado em quantização, popular para rodar modelos GPTQ/EXL2 em GPUs de consumo
- Link:
- ExLlamaV2 explicado
Artigos sobre ExLlamaV2 (2)
- ExLlamaV2 Explained 2026: Archived, Succeeded by ExLlamaV3Atualizado 6 de setembro de 2026
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"Atualizado 5 de setembro de 2026
Também mencionado em:
- LMDeploy Review: High-Throughput LLM Serving and QuantizationAtualizado 19 de setembro de 2026
- How to Double Local LLM Speed: Optimization TechniquesAtualizado 28 de agosto de 2026
Esta lista reflete ferramentas comumente comparadas ao LMDeploy no segmento de serviço em produção, não um ranking independente da PromptQuorum — verifique o conjunto de recursos e os requisitos de hardware atuais de cada ferramenta antes de escolher.
Erros comuns ao avaliar o LMDeploy
A maior parte da confusão em torno do LMDeploy vem de tratá-lo como um app de chat de desktop, ou de citar seus números de benchmark autodeclarados como se fossem verificados de forma independente.
Perguntas frequentes
O que é o LMDeploy?
O LMDeploy (github.com/InternLM/lmdeploy) é um toolkit gratuito e de código aberto (Apache 2.0) para comprimir, quantizar e servir grandes modelos de linguagem em GPUs NVIDIA, desenvolvido pelas equipes MMRazor e MMDeploy dentro do ecossistema InternLM/OpenMMLab.
O LMDeploy é gratuito?
Sim. O LMDeploy é licenciado sob Apache 2.0, sem página de preços nem plano pago. Seu custo real é o do hardware de GPU ou da instância na nuvem em que você o roda.
Como instalo o LMDeploy?
Execute pip install lmdeploy em um ambiente Python 3.10–3.13 (recomenda-se um ambiente conda). Desde a v0.13.0, as wheels padrão do PyPI têm como alvo o CUDA 12.8, então isso costuma bastar sem uma instalação de CUDA separada em configurações típicas de GPU NVIDIA.
O LMDeploy tem interface gráfica?
Não. O LMDeploy é um toolkit de linha de comando e uma biblioteca Python. Ele não tem janela de chat — você interage por meio do terminal, um script Python ou seu servidor de API compatível com a OpenAI.
O LMDeploy é mais rápido que o vLLM?
O próprio README do LMDeploy relata throughput de requisições até 1,8x maior que o vLLM, com base em benchmarks próprios autopublicados. Esse não é um número verificado de forma independente — rode seu próprio benchmark com seu modelo e hardware alvo antes de confiar nele.
Que quantização o LMDeploy suporta?
Quantização AWQ de 4 bits somente dos pesos, quantização int8/int4 do cache KV (combinável com AWQ), MXFP4 em GPUs NVIDIA suportadas e, desde 2026/02, quantização simétrica/assimétrica de 4 bits via integração com o vllm-project/llm-compressor.
Que modelos o LMDeploy suporta?
Dezenas de famílias de LLM — incluindo Llama, InternLM2/3, Qwen1.5 até Qwen3, DeepSeek-MoE/V2/V3/R1, Mistral, ChatGLM2, GLM-4 e Code Llama — além de modelos de visão e linguagem como InternVL, LLaVA e CogVLM2. Consulte a própria documentação de modelos suportados do LMDeploy para a lista completa e atualizada.
O LMDeploy suporta GPUs além da NVIDIA?
Seu mecanismo principal, o TurboMind, tem como alvo GPUs NVIDIA CUDA. O mecanismo PyTorch acrescenta suporte a NPUs Huawei Ascend. Esta review não encontrou um caminho de suporte apenas de CPU ou Apple Silicon.
Quem desenvolve o LMDeploy?
As equipes MMRazor e MMDeploy, parte do ecossistema open source InternLM/OpenMMLab mantido pelo Shanghai AI Laboratory.
O LMDeploy tem um servidor de API compatível com a OpenAI?
Sim. Executar lmdeploy serve api_server inicia um servidor local que reproduz o formato de requisição/resposta de chat completions da OpenAI, permitindo que código cliente OpenAI já existente aponte para ele em vez de para um endpoint na nuvem.