Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/LMDeploy Review: Durchsatzstarkes LLM-Serving und Quantisierung
Overview & Reference

LMDeploy Review: Durchsatzstarkes LLM-Serving und Quantisierung

·10 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

LMDeploy ist ein kostenloses, quelloffenes (Apache 2.0) Kommandozeilen-Toolkit und Python-Library zum Komprimieren, Quantisieren und Servieren großer Sprachmodelle auf NVIDIA-GPUs, installiert über pip install lmdeploy. Entwickelt von den Teams MMRazor und MMDeploy innerhalb des InternLM/OpenMMLab-Ökosystems, bringt es zwei Inference-Engines mit — TurboMind (eine auf Durchsatz optimierte C++/CUDA-Engine) und eine reine Python-/PyTorch-Engine — plus AWQ- und KV-Cache-Quantisierung, einen OpenAI-kompatiblen API-Server und Unterstützung für weit über 50 offene LLM- und VLM-Modellfamilien.

LMDeploy (github.com/InternLM/lmdeploy) ist ein kostenloses, quelloffenes (Apache 2.0) Toolkit zum Komprimieren, Quantisieren und Servieren großer Sprachmodelle, entwickelt von den Teams MMRazor und MMDeploy innerhalb des InternLM/OpenMMLab-Ökosystems. Es wird über pip install lmdeploy installiert und bringt zwei Inference-Engines mit — TurboMind und eine reine Python-/PyTorch-Engine — plus einen OpenAI-kompatiblen API-Server, bei über 8.000 GitHub-Stars. Diese Review ist das Pendant zu LMDeploys Eintrag im Local LLM Software Directory und beschreibt, was es tatsächlich leistet, wie man es installiert und für wen es geeignet ist.

Wichtigste Erkenntnisse

  • LMDeploy (github.com/InternLM/lmdeploy) ist ein kostenloses, quelloffenes, pip-installierbares Inference- und Quantisierungs-Toolkit — eine CLI/Library, keine GUI-App
  • Entwickelt von den Teams MMRazor und MMDeploy innerhalb des InternLM/OpenMMLab-Ökosystems (Shanghai AI Laboratory); Repository erstellt am 15. Juni 2023
  • Apache-2.0-lizenziert, bestätigt über die LICENSE-Datei des GitHub-Repositorys
  • Bringt zwei Inference-Engines mit: TurboMind (C++/CUDA, auf Durchsatz optimiert) und eine reine Python-/PyTorch-Engine
  • Unterstützt AWQ-4-Bit-Gewicht-Quantisierung und int8/int4-KV-Cache-Quantisierung
  • Über 8.000 GitHub-Stars und 750 Forks zum Zeitpunkt dieser Review; neuestes getaggtes Release v0.17.0, veröffentlicht am 1. September 2026

📍 In einem Satz

LMDeploy ist ein kostenloses, quelloffenes (Apache 2.0) Toolkit zum Komprimieren, Quantisieren und Servieren von LLMs auf NVIDIA-GPUs, entwickelt von den Teams MMRazor und MMDeploy im InternLM/OpenMMLab-Ökosystem, installiert über pip install lmdeploy, mit über 8.000 GitHub-Stars.

💬 In einfachen Worten

LMDeploy ist ein Kommandozeilen-Tool und eine Python-Library, die Sie per pip installieren und die ein LLM, das Sie bereits haben (etwa von HuggingFace), schnell auf Ihrer eigenen GPU ausführt — optional vorher per 4-Bit-Quantisierung verkleinert, um weniger Speicher zu belegen. Es ist keine Chat-App mit einem anklickbaren Fenster, sondern Infrastruktur, die Sie auf einem Server betreiben, und mit der andere Anwendungen über eine OpenAI-kompatible API kommunizieren.

📌Hinweis: Diese Review basiert auf LMDeploys eigenem GitHub-Repository, README, Dokumentation und PyPI-Eintrag. Durchsatz- und Quantisierungsgeschwindigkeits-Zahlen (etwa "1,8x schneller als vLLM") sind LMDeploys eigene, selbst veröffentlichte Benchmarks, keine unabhängigen Messungen von PromptQuorum — prüfen Sie aktuelle veröffentlichte Benchmarks, bevor Sie sich bei einer Kauf- oder Architekturentscheidung auf eine konkrete Zahl verlassen.

Was ist LMDeploy?

LMDeploy ist ein Toolkit zum Komprimieren, Deployen und Servieren großer Sprachmodelle, entwickelt für Inference auf NVIDIA-GPUs mit hohem Durchsatz. Die eigene GitHub-Beschreibung gibt an, dass es von den Teams MMRazor und MMDeploy entwickelt wurde — beides OpenMMLab-Projekte, das quelloffene Computer-Vision- und Modell-Deployment-Ökosystem, das unter dem Shanghai AI Laboratory gepflegt wird, derselben Organisation hinter der InternLM-Modellfamilie.

  • Produkttyp: ein Kommandozeilen-Tool und eine Python-Library — keine grafische Oberfläche; Nutzung über ein Terminal, ein Python-Skript oder einen Docker-Container
  • Entwickler: die Teams MMRazor und MMDeploy, Teil des InternLM/OpenMMLab-Ökosystems unter dem Shanghai AI Laboratory
  • Repository: InternLM/lmdeploy auf GitHub, erstellt am 15. Juni 2023
  • Lizenz: Apache 2.0, bestätigt über die LICENSE-Datei des Repositorys
  • Umfang: über 8.000 GitHub-Stars, 750 Forks und 596 offene Issues zum Zeitpunkt dieser Review
  • Distribution: auf PyPI als Paket lmdeploy veröffentlicht, plus offizielle Docker-Images laut Projektdokumentation

Projektgeschichte und Versions-Meilensteine

LMDeploys GitHub-Repository wurde im Juni 2023 erstellt, und das Projekt wird seither kontinuierlich weiterentwickelt — von einer einzelnen TurboMind-Inference-Engine zu einem Zwei-Engine-Toolkit mit Quantisierung, multimodaler (VLM-)Unterstützung und verteiltem Serving.

  1. 1
    2023/08 — 4-Bit-AWQ-Quantisierung und HuggingFace-Hub-Start
    Why it matters: Laut offiziellem Changelog wurde 4-Bit-Gewicht-Quantisierung auf AWQ-Basis hinzugefügt und einsatzbereite 4-Bit-Modelle auf HuggingFace veröffentlicht.
  2. 2
    2024/01 — PyTorch-Inference-Engine eingeführt
    Why it matters: Fügte eine zweite, reine Python-Inference-Engine neben TurboMind hinzu und senkte damit die Hürde für Entwickler, den Serving-Stack zu erweitern oder zu debuggen.
  3. 3
    2024/06–2024/07 — VLM- und Function-Calling-Unterstützung
    Why it matters: Fügte multimodale (Vision-Language-Model-)Inference-Pipelines und -Serving sowie Tool-/Function-Calling für Llama 3.1 und InternLM2.5 hinzu.
  4. 4
    2025/01 — Unterstützung für DeepSeek V3 und R1
    Why it matters: Fügte quasi zeitgleiche Unterstützung für die Modellfamilien DeepSeek V3 und R1 hinzu, eine weit verbreitete Reasoning-Modell-Linie.
  5. 5
    2025/06 — DeepSeek-PD-Disaggregation
    Why it matters: Integrierte Prefill/Decode-Disaggregation für DeepSeek-Modelle über DLSlime und Mooncake, eine produktionstaugliche Technik zur Skalierung des Servings großer MoE-Modelle über mehrere Maschinen hinweg.
  6. 6
    2025/09 — MXFP4-Unterstützung auf NVIDIA-GPUs (V100 und neuer)
    Why it matters: Fügte MXFP4-quantisierte Inference hinzu, die laut LMDeploys eigenem Changelog auf H800-GPUs den 1,5-fachen Durchsatz von vLLM für OpenAI-gpt-oss-Modelle erreicht.
  7. 7
    2026/02 — Qwen3.5-Unterstützung und llm-compressor-Integration
    Why it matters: Fügte Unterstützung für die Qwen3.5-Modellsammlung hinzu und integrierte vllm-project/llm-compressor für symmetrische/asymmetrische 4-Bit-Quantisierung.
  8. 8
    v0.17.0 — 1. September 2026
    Why it matters: Das zum Zeitpunkt dieser Review neueste getaggte GitHub-Release — prüfen Sie die [GitHub-Releases-Seite](https://github.com/InternLM/lmdeploy/releases) direkt für alles, was nach dem Veröffentlichungsdatum dieser Review erschienen ist.

Was können Sie mit LMDeploy tun?

LMDeploys Funktionsumfang konzentriert sich auf drei Aufgaben: ein Modell durch Quantisierung verkleinern, es effizient ausführen und als Netzwerkdienst bereitstellen. Hier ist, was jeder Teil laut LMDeploys eigenem README und Dokumentation tatsächlich tut.

  • Zwei Inference-Engines — TurboMind, eine C++/CUDA-Engine, die LMDeploy als seine durchsatzstärkste Option positioniert, und eine reine Python-/PyTorch-Engine, die sich leichter erweitern und um neue Modellarchitekturen ergänzen lässt; wählen Sie pro Modell anhand von LMDeploys eigener Supported-Models-Tabelle
  • Continuous Batching und Paged Attention — persistentes (kontinuierliches) Batching, geblockter/paged KV-Cache und dynamisches Split-and-Fuse, dieselbe Klasse von Techniken, die auch andere produktive Inference-Engines nutzen, um die GPU-Auslastung bei gleichzeitigen Anfragen zu erhöhen
  • Quantisierung — AWQ-4-Bit-Gewicht-Quantisierung, plus int8/int4-KV-Cache-Quantisierung, die gleichzeitig mit AWQ kombiniert werden kann, und (seit 2026/02) symmetrische/asymmetrische 4-Bit-Quantisierung über eine llm-compressor-Integration
  • Breite Modellunterstützung — Dutzende LLM-Familien, darunter Llama, Llama2/3/3.1/3.2, InternLM2/3, Qwen1.5/2/2.5/3, Qwen3-MoE, Qwen3-Next, DeepSeek-MoE/V2/V3/R1, Mistral, Mixtral, ChatGLM2, GLM-4, Yi, Baichuan2 und Code Llama, laut LMDeploys Supported-Models-Dokumentation
  • Vision-Language-Model-(VLM)-Unterstützung — Offline-Inference-Pipelines und API-Serving für multimodale Modelle wie InternVL, LLaVA, MiniGemini und CogVLM2
  • OpenAI-kompatibler API-Serverlmdeploy serve api_server startet einen Server, der das OpenAI-Chat-Completions-Anfrage-/Antwortformat nachbildet, separat für LLMs und VLMs dokumentiert
  • Offline-Batch-Inference-Pipeline — eine Python-lmdeploy.pipeline()-API, um Inference direkt innerhalb eines Skripts auszuführen, ohne einen Server aufzusetzen
  • Multi-Modell-, Multi-Maschinen-Proxy-Server — ein Anfrageverteilungsdienst, um mehrere Modelle über mehrere Maschinen und GPUs hinter einem Einstiegspunkt zu betreiben
  • Hardware-Unterstützung über NVIDIA-CUDA-GPUs hinaus — Huawei-Ascend-NPU-Unterstützung über die PyTorch-Engine sowie Windows-Unterstützung (Tensor-Parallel-Grad 1) über TurboMind

Anwendungsbeispiele: Drei Wege, LMDeploy zu nutzen

Dies sind konkrete Workflows, die auf den oben dokumentierten LMDeploy-Befehlen basieren — keine hypothetischen Anwendungsfälle.

Preise und Lizenzierung

LMDeploy ist kostenlos und quelloffen, ohne kostenpflichtige Stufe. Die LICENSE-Datei des GitHub-Repositorys wendet die Apache License, Version 2.0, unverändert an, und es gibt keine Preisseite in der Projektdokumentation.

  • Kein Abonnement, keine kostenpflichtige Stufe, keine von LMDeploy selbst auferlegten Nutzungslimits
  • Kein Account und keine Registrierung erforderlich, um das Toolkit zu installieren oder zu nutzen
  • Ihre tatsächlichen Kosten sind die der GPU-Hardware oder Cloud-GPU-Instanz, auf der Sie LMDeploy betreiben — LMDeploy selbst berechnet keine zusätzliche Gebühr
  • Apache 2.0 ist eine permissive Lizenz: keine Copyleft-Pflicht, eigenen Code zu veröffentlichen, kommerzielle/produktive Nutzung ist ausdrücklich erlaubt

LMDeploy vs. vLLM

LMDeploy und vLLM gehören zu den meistgenutzten quelloffenen LLM-Inference-Engines, und LMDeploys eigenes Marketing benchmarkt sich explizit gegen vLLM. Beide sind kostenlos, Apache-2.0-nah (vLLM ist ebenfalls Apache 2.0), per Python installierbar und unterstützen einen OpenAI-kompatiblen API-Server — die Unterschiede liegen vor allem in der Engine-Architektur, der Ökosystemgröße und dem Fokus auf Modellfamilien.

Kern-Engines

LMDeploy:
TurboMind (C++/CUDA) plus eine PyTorch-Engine
vLLM:
Eine einzelne PagedAttention-basierte Engine

Durchsatz-Angabe

LMDeploy:
Bis zu 1,8x vLLM (selbstberichtet)
vLLM:
Weithin als Industriestandard-Baseline zitiert

Quantisierung

LMDeploy:
AWQ, int8/int4-KV-Cache, MXFP4
vLLM:
AWQ, GPTQ, FP8 und weitere Formate

Ökosystemgröße

LMDeploy:
~8.000 GitHub-Stars
vLLM:
Eine größere Community und breitere Drittanbieter-Integrationsfläche

Stärke bei Modellfamilien

LMDeploy:
Starke erstklassige Unterstützung für InternLM und Qwen
vLLM:
Sehr breit, oft als Erstes bei neuen Releases vieler Labs dabei

Entwickler

LMDeploy:
Teams MMRazor/MMDeploy (Shanghai AI Laboratory)
vLLM:
Ursprünglich UC Berkeley, heute ein breites Multi-Firmen-Open-Source-Projekt

LMDeploys Durchsatz-Angaben sind eigene, selbst veröffentlichte Zahlen, kein unabhängiger PromptQuorum-Benchmark — führen Sie einen eigenen Vergleich mit Ihrem Zielmodell, Ihrer GPU und Ihrem Traffic-Muster durch, bevor Sie sich für die Produktion für eines entscheiden. Siehe den vLLM-Explainer für mehr zu vLLM speziell.

Für wen eignet sich LMDeploy?

LMDeploy passt zu Teams, die LLMs auf eigener NVIDIA-GPU-Infrastruktur deployen und einen quantisierungsbewussten, durchsatzstarken Serving-Stack statt einer Desktop-Chat-App möchten.

Wettbewerber und Alternativen

LMDeploy bewegt sich im Segment produktiver LLM-Serving-Engines neben vLLM, TensorRT-LLM, SGLang und ExLlamaV2 — Tools, die dafür gebaut sind, Modelle im großen Maßstab auf dedizierter GPU-Hardware zu betreiben, im Unterschied zu konsumentenorientierten Desktop-Apps.

vLLM

Bekannt für:
Die meistgenutzte quelloffene Inference-Engine, PagedAttention, breite Tag-eins-Modellunterstützung
Artikel über vLLM (10)

+81 weitere nicht angezeigt

SGLang

Bekannt für:
Eine Inference-Engine und strukturierte Generierungssprache rund um RadixAttention-Caching
Artikel über SGLang (5)

Auch erwähnt in:

ExLlamaV2

Bekannt für:
Eine auf Quantisierung fokussierte Engine, beliebt für GPTQ/EXL2-Modelle auf Consumer-GPUs
Artikel über ExLlamaV2 (2)

Auch erwähnt in:

Diese Liste zeigt Tools, die häufig mit LMDeploy im Produktions-Serving-Segment verglichen werden, keine unabhängige PromptQuorum-Rangliste — prüfen Sie vor der Wahl den aktuellen Funktionsumfang und die Hardware-Anforderungen jedes Tools.

Häufige Fehler bei der Bewertung von LMDeploy

Die meiste Verwirrung um LMDeploy entsteht, weil es wie eine Desktop-Chat-App behandelt wird oder seine selbst berichteten Benchmark-Zahlen als unabhängig verifiziert zitiert werden.

Häufig gestellte Fragen

Was ist LMDeploy?

LMDeploy (github.com/InternLM/lmdeploy) ist ein kostenloses, quelloffenes (Apache 2.0) Toolkit zum Komprimieren, Quantisieren und Servieren großer Sprachmodelle auf NVIDIA-GPUs, entwickelt von den Teams MMRazor und MMDeploy innerhalb des InternLM/OpenMMLab-Ökosystems.

Ist LMDeploy kostenlos?

Ja. LMDeploy ist Apache-2.0-lizenziert, ohne Preisseite und ohne kostenpflichtige Stufe. Ihre tatsächlichen Kosten sind die der GPU-Hardware oder Cloud-Instanz, auf der Sie es betreiben.

Wie installiere ich LMDeploy?

Führen Sie pip install lmdeploy in einer Python-3.10–3.13-Umgebung aus (eine conda-Umgebung wird empfohlen). Seit v0.13.0 zielen die Standard-PyPI-Wheels auf CUDA 12.8 ab, sodass dies bei typischen NVIDIA-GPU-Setups meist ohne separate CUDA-Installation genügt.

Hat LMDeploy eine grafische Oberfläche?

Nein. LMDeploy ist ein Kommandozeilen-Toolkit und eine Python-Library. Es hat kein Chat-Fenster — Sie interagieren über das Terminal, ein Python-Skript oder den OpenAI-kompatiblen API-Server.

Ist LMDeploy schneller als vLLM?

LMDeploys eigenes README berichtet von bis zu 1,8x höherem Anfragen-Durchsatz als vLLM, basierend auf eigenen, selbst veröffentlichten Benchmarks. Das ist keine unabhängig verifizierte Zahl — führen Sie vor dem Vertrauen darauf einen eigenen Benchmark mit Ihrem Zielmodell und Ihrer Hardware durch.

Welche Quantisierung unterstützt LMDeploy?

AWQ-4-Bit-Gewicht-Quantisierung, int8/int4-KV-Cache-Quantisierung (kombinierbar mit AWQ), MXFP4 auf unterstützten NVIDIA-GPUs und, seit 2026/02, symmetrische/asymmetrische 4-Bit-Quantisierung über eine Integration mit vllm-project/llm-compressor.

Welche Modelle unterstützt LMDeploy?

Dutzende LLM-Familien — darunter Llama, InternLM2/3, Qwen1.5 bis Qwen3, DeepSeek-MoE/V2/V3/R1, Mistral, ChatGLM2, GLM-4 und Code Llama — plus Vision-Language-Modelle wie InternVL, LLaVA und CogVLM2. Die vollständige, aktuelle Liste finden Sie in LMDeploys eigener Supported-Models-Dokumentation.

Unterstützt LMDeploy auch andere GPUs als NVIDIA?

Die primäre TurboMind-Engine zielt auf NVIDIA-CUDA-GPUs. Die PyTorch-Engine ergänzt Unterstützung für Huawei-Ascend-NPUs. Diese Review fand keinen reinen CPU- oder Apple-Silicon-Unterstützungspfad.

Wer entwickelt LMDeploy?

Die Teams MMRazor und MMDeploy, Teil des quelloffenen InternLM/OpenMMLab-Ökosystems, das unter dem Shanghai AI Laboratory gepflegt wird.

Hat LMDeploy einen OpenAI-kompatiblen API-Server?

Ja. Der Befehl lmdeploy serve api_server startet einen lokalen Server, der das OpenAI-Chat-Completions-Anfrage-/Antwortformat nachbildet, sodass bestehender OpenAI-Client-Code statt auf einen Cloud-Endpunkt darauf verweisen kann.

Quellen

← Zurück zu Lokale LLMs Pro