Wichtigste Erkenntnisse
- LMDeploy (github.com/InternLM/lmdeploy) ist ein kostenloses, quelloffenes, pip-installierbares Inference- und Quantisierungs-Toolkit — eine CLI/Library, keine GUI-App
- Entwickelt von den Teams MMRazor und MMDeploy innerhalb des InternLM/OpenMMLab-Ökosystems (Shanghai AI Laboratory); Repository erstellt am 15. Juni 2023
- Apache-2.0-lizenziert, bestätigt über die LICENSE-Datei des GitHub-Repositorys
- Bringt zwei Inference-Engines mit: TurboMind (C++/CUDA, auf Durchsatz optimiert) und eine reine Python-/PyTorch-Engine
- Unterstützt AWQ-4-Bit-Gewicht-Quantisierung und int8/int4-KV-Cache-Quantisierung
- Über 8.000 GitHub-Stars und 750 Forks zum Zeitpunkt dieser Review; neuestes getaggtes Release v0.17.0, veröffentlicht am 1. September 2026
📍 In einem Satz
LMDeploy ist ein kostenloses, quelloffenes (Apache 2.0) Toolkit zum Komprimieren, Quantisieren und Servieren von LLMs auf NVIDIA-GPUs, entwickelt von den Teams MMRazor und MMDeploy im InternLM/OpenMMLab-Ökosystem, installiert über pip install lmdeploy, mit über 8.000 GitHub-Stars.
💬 In einfachen Worten
LMDeploy ist ein Kommandozeilen-Tool und eine Python-Library, die Sie per pip installieren und die ein LLM, das Sie bereits haben (etwa von HuggingFace), schnell auf Ihrer eigenen GPU ausführt — optional vorher per 4-Bit-Quantisierung verkleinert, um weniger Speicher zu belegen. Es ist keine Chat-App mit einem anklickbaren Fenster, sondern Infrastruktur, die Sie auf einem Server betreiben, und mit der andere Anwendungen über eine OpenAI-kompatible API kommunizieren.
📌Hinweis: Diese Review basiert auf LMDeploys eigenem GitHub-Repository, README, Dokumentation und PyPI-Eintrag. Durchsatz- und Quantisierungsgeschwindigkeits-Zahlen (etwa "1,8x schneller als vLLM") sind LMDeploys eigene, selbst veröffentlichte Benchmarks, keine unabhängigen Messungen von PromptQuorum — prüfen Sie aktuelle veröffentlichte Benchmarks, bevor Sie sich bei einer Kauf- oder Architekturentscheidung auf eine konkrete Zahl verlassen.
Was ist LMDeploy?
LMDeploy ist ein Toolkit zum Komprimieren, Deployen und Servieren großer Sprachmodelle, entwickelt für Inference auf NVIDIA-GPUs mit hohem Durchsatz. Die eigene GitHub-Beschreibung gibt an, dass es von den Teams MMRazor und MMDeploy entwickelt wurde — beides OpenMMLab-Projekte, das quelloffene Computer-Vision- und Modell-Deployment-Ökosystem, das unter dem Shanghai AI Laboratory gepflegt wird, derselben Organisation hinter der InternLM-Modellfamilie.
- Produkttyp: ein Kommandozeilen-Tool und eine Python-Library — keine grafische Oberfläche; Nutzung über ein Terminal, ein Python-Skript oder einen Docker-Container
- Entwickler: die Teams MMRazor und MMDeploy, Teil des InternLM/OpenMMLab-Ökosystems unter dem Shanghai AI Laboratory
- Repository: InternLM/lmdeploy auf GitHub, erstellt am 15. Juni 2023
- Lizenz: Apache 2.0, bestätigt über die LICENSE-Datei des Repositorys
- Umfang: über 8.000 GitHub-Stars, 750 Forks und 596 offene Issues zum Zeitpunkt dieser Review
- Distribution: auf PyPI als Paket
lmdeployveröffentlicht, plus offizielle Docker-Images laut Projektdokumentation
Projektgeschichte und Versions-Meilensteine
LMDeploys GitHub-Repository wurde im Juni 2023 erstellt, und das Projekt wird seither kontinuierlich weiterentwickelt — von einer einzelnen TurboMind-Inference-Engine zu einem Zwei-Engine-Toolkit mit Quantisierung, multimodaler (VLM-)Unterstützung und verteiltem Serving.
- 12023/08 — 4-Bit-AWQ-Quantisierung und HuggingFace-Hub-Start
Why it matters: Laut offiziellem Changelog wurde 4-Bit-Gewicht-Quantisierung auf AWQ-Basis hinzugefügt und einsatzbereite 4-Bit-Modelle auf HuggingFace veröffentlicht. - 22024/01 — PyTorch-Inference-Engine eingeführt
Why it matters: Fügte eine zweite, reine Python-Inference-Engine neben TurboMind hinzu und senkte damit die Hürde für Entwickler, den Serving-Stack zu erweitern oder zu debuggen. - 32024/06–2024/07 — VLM- und Function-Calling-Unterstützung
Why it matters: Fügte multimodale (Vision-Language-Model-)Inference-Pipelines und -Serving sowie Tool-/Function-Calling für Llama 3.1 und InternLM2.5 hinzu. - 42025/01 — Unterstützung für DeepSeek V3 und R1
Why it matters: Fügte quasi zeitgleiche Unterstützung für die Modellfamilien DeepSeek V3 und R1 hinzu, eine weit verbreitete Reasoning-Modell-Linie. - 52025/06 — DeepSeek-PD-Disaggregation
Why it matters: Integrierte Prefill/Decode-Disaggregation für DeepSeek-Modelle über DLSlime und Mooncake, eine produktionstaugliche Technik zur Skalierung des Servings großer MoE-Modelle über mehrere Maschinen hinweg. - 62025/09 — MXFP4-Unterstützung auf NVIDIA-GPUs (V100 und neuer)
Why it matters: Fügte MXFP4-quantisierte Inference hinzu, die laut LMDeploys eigenem Changelog auf H800-GPUs den 1,5-fachen Durchsatz von vLLM für OpenAI-gpt-oss-Modelle erreicht. - 72026/02 — Qwen3.5-Unterstützung und llm-compressor-Integration
Why it matters: Fügte Unterstützung für die Qwen3.5-Modellsammlung hinzu und integrierte vllm-project/llm-compressor für symmetrische/asymmetrische 4-Bit-Quantisierung. - 8v0.17.0 — 1. September 2026
Why it matters: Das zum Zeitpunkt dieser Review neueste getaggte GitHub-Release — prüfen Sie die [GitHub-Releases-Seite](https://github.com/InternLM/lmdeploy/releases) direkt für alles, was nach dem Veröffentlichungsdatum dieser Review erschienen ist.
Was können Sie mit LMDeploy tun?
LMDeploys Funktionsumfang konzentriert sich auf drei Aufgaben: ein Modell durch Quantisierung verkleinern, es effizient ausführen und als Netzwerkdienst bereitstellen. Hier ist, was jeder Teil laut LMDeploys eigenem README und Dokumentation tatsächlich tut.
- Zwei Inference-Engines — TurboMind, eine C++/CUDA-Engine, die LMDeploy als seine durchsatzstärkste Option positioniert, und eine reine Python-/PyTorch-Engine, die sich leichter erweitern und um neue Modellarchitekturen ergänzen lässt; wählen Sie pro Modell anhand von LMDeploys eigener Supported-Models-Tabelle
- Continuous Batching und Paged Attention — persistentes (kontinuierliches) Batching, geblockter/paged KV-Cache und dynamisches Split-and-Fuse, dieselbe Klasse von Techniken, die auch andere produktive Inference-Engines nutzen, um die GPU-Auslastung bei gleichzeitigen Anfragen zu erhöhen
- Quantisierung — AWQ-4-Bit-Gewicht-Quantisierung, plus int8/int4-KV-Cache-Quantisierung, die gleichzeitig mit AWQ kombiniert werden kann, und (seit 2026/02) symmetrische/asymmetrische 4-Bit-Quantisierung über eine llm-compressor-Integration
- Breite Modellunterstützung — Dutzende LLM-Familien, darunter Llama, Llama2/3/3.1/3.2, InternLM2/3, Qwen1.5/2/2.5/3, Qwen3-MoE, Qwen3-Next, DeepSeek-MoE/V2/V3/R1, Mistral, Mixtral, ChatGLM2, GLM-4, Yi, Baichuan2 und Code Llama, laut LMDeploys Supported-Models-Dokumentation
- Vision-Language-Model-(VLM)-Unterstützung — Offline-Inference-Pipelines und API-Serving für multimodale Modelle wie InternVL, LLaVA, MiniGemini und CogVLM2
- OpenAI-kompatibler API-Server —
lmdeploy serve api_serverstartet einen Server, der das OpenAI-Chat-Completions-Anfrage-/Antwortformat nachbildet, separat für LLMs und VLMs dokumentiert - Offline-Batch-Inference-Pipeline — eine Python-
lmdeploy.pipeline()-API, um Inference direkt innerhalb eines Skripts auszuführen, ohne einen Server aufzusetzen - Multi-Modell-, Multi-Maschinen-Proxy-Server — ein Anfrageverteilungsdienst, um mehrere Modelle über mehrere Maschinen und GPUs hinter einem Einstiegspunkt zu betreiben
- Hardware-Unterstützung über NVIDIA-CUDA-GPUs hinaus — Huawei-Ascend-NPU-Unterstützung über die PyTorch-Engine sowie Windows-Unterstützung (Tensor-Parallel-Grad 1) über TurboMind
Anwendungsbeispiele: Drei Wege, LMDeploy zu nutzen
Dies sind konkrete Workflows, die auf den oben dokumentierten LMDeploy-Befehlen basieren — keine hypothetischen Anwendungsfälle.
LMDeploy installieren
LMDeploy installiert sich kostenlos über pip in einer Python-3.10–3.13-Umgebung, der Quellcode liegt auf GitHub. Für die TurboMind-Engine ist eine NVIDIA-CUDA-GPU erforderlich; die PyTorch-Engine und Huawei-Ascend-Unterstützung erweitern die Hardware-Optionen für spezielle Anwendungsfälle.
Quelle | Link |
|---|---|
| GitHub-Repository (Quellcode, Apache 2.0) | github.com/InternLM/lmdeploy |
| PyPI-Paket | pypi.org/project/lmdeploy |
| Dokumentation | lmdeploy.readthedocs.io |
| Installationsbefehl | conda create -n lmdeploy python=3.12 -y && conda activate lmdeploy && pip install lmdeploy |
Seit v0.13.0 sind die Standard-PyPI-Wheels gegen CUDA 12.8 gebaut, sodass laut Projekt-README ein einfaches pip install lmdeploy für typische NVIDIA-GPU-Setups genügt, einschließlich der GeForce-RTX-50-Serie. Es gibt keinen GUI-Installer — prüfen Sie die aktuell empfohlene Installationsmethode auf GitHub, bevor Sie einen Befehl ausführen, da sich Anweisungen zwischen Releases ändern können.
Preise und Lizenzierung
LMDeploy ist kostenlos und quelloffen, ohne kostenpflichtige Stufe. Die LICENSE-Datei des GitHub-Repositorys wendet die Apache License, Version 2.0, unverändert an, und es gibt keine Preisseite in der Projektdokumentation.
- Kein Abonnement, keine kostenpflichtige Stufe, keine von LMDeploy selbst auferlegten Nutzungslimits
- Kein Account und keine Registrierung erforderlich, um das Toolkit zu installieren oder zu nutzen
- Ihre tatsächlichen Kosten sind die der GPU-Hardware oder Cloud-GPU-Instanz, auf der Sie LMDeploy betreiben — LMDeploy selbst berechnet keine zusätzliche Gebühr
- Apache 2.0 ist eine permissive Lizenz: keine Copyleft-Pflicht, eigenen Code zu veröffentlichen, kommerzielle/produktive Nutzung ist ausdrücklich erlaubt
LMDeploy vs. vLLM
LMDeploy und vLLM gehören zu den meistgenutzten quelloffenen LLM-Inference-Engines, und LMDeploys eigenes Marketing benchmarkt sich explizit gegen vLLM. Beide sind kostenlos, Apache-2.0-nah (vLLM ist ebenfalls Apache 2.0), per Python installierbar und unterstützen einen OpenAI-kompatiblen API-Server — die Unterschiede liegen vor allem in der Engine-Architektur, der Ökosystemgröße und dem Fokus auf Modellfamilien.
Kern-Engines
- LMDeploy:
- TurboMind (C++/CUDA) plus eine PyTorch-Engine
- vLLM:
- Eine einzelne PagedAttention-basierte Engine
Durchsatz-Angabe
- LMDeploy:
- Bis zu 1,8x vLLM (selbstberichtet)
- vLLM:
- Weithin als Industriestandard-Baseline zitiert
Quantisierung
- LMDeploy:
- AWQ, int8/int4-KV-Cache, MXFP4
- vLLM:
- AWQ, GPTQ, FP8 und weitere Formate
Ökosystemgröße
- LMDeploy:
- ~8.000 GitHub-Stars
- vLLM:
- Eine größere Community und breitere Drittanbieter-Integrationsfläche
Stärke bei Modellfamilien
- LMDeploy:
- Starke erstklassige Unterstützung für InternLM und Qwen
- vLLM:
- Sehr breit, oft als Erstes bei neuen Releases vieler Labs dabei
Entwickler
- LMDeploy:
- Teams MMRazor/MMDeploy (Shanghai AI Laboratory)
- vLLM:
- Ursprünglich UC Berkeley, heute ein breites Multi-Firmen-Open-Source-Projekt
LMDeploys Durchsatz-Angaben sind eigene, selbst veröffentlichte Zahlen, kein unabhängiger PromptQuorum-Benchmark — führen Sie einen eigenen Vergleich mit Ihrem Zielmodell, Ihrer GPU und Ihrem Traffic-Muster durch, bevor Sie sich für die Produktion für eines entscheiden. Siehe den vLLM-Explainer für mehr zu vLLM speziell.
Für wen eignet sich LMDeploy?
LMDeploy passt zu Teams, die LLMs auf eigener NVIDIA-GPU-Infrastruktur deployen und einen quantisierungsbewussten, durchsatzstarken Serving-Stack statt einer Desktop-Chat-App möchten.
Wettbewerber und Alternativen
LMDeploy bewegt sich im Segment produktiver LLM-Serving-Engines neben vLLM, TensorRT-LLM, SGLang und ExLlamaV2 — Tools, die dafür gebaut sind, Modelle im großen Maßstab auf dedizierter GPU-Hardware zu betreiben, im Unterschied zu konsumentenorientierten Desktop-Apps.
vLLM
- Bekannt für:
- Die meistgenutzte quelloffene Inference-Engine, PagedAttention, breite Tag-eins-Modellunterstützung
- Link:
- vLLM erklärt
Artikel über vLLM (10)
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)Aktualisiert 6. September 2026
- llama.cpp Explained: The Engine Powering Ollama (2026)Aktualisiert 20. September 2026
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026Aktualisiert 20. September 2026
- candle-vllm Review: Rust-Native LLM Serving on CUDA and MetalAktualisiert 19. September 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingAktualisiert 19. September 2026
- KServe Review: Kubernetes-Native Model Serving at ScaleAktualisiert 19. September 2026
- LMDeploy Review: High-Throughput LLM Serving and QuantizationAktualisiert 19. September 2026
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API ServerAktualisiert 19. September 2026
- TranslateBooksWithLLMs Review: Translate Full Books With a Local or Cloud LLMAktualisiert 19. September 2026
- vllm-mlx Review: vLLM-Style Serving for Apple SiliconAktualisiert 19. September 2026
+81 weitere nicht angezeigt
TensorRT-LLM
- Bekannt für:
- NVIDIAs eigene compilerbasierte Inference-Library, tief auf NVIDIA-Hardware optimiert
- Link:
- TensorRT-LLM erklärt
Artikel über TensorRT-LLM (7)
- TensorRT-LLM Explained: NVIDIA's GPU-Optimized Inference Engine (2026)Aktualisiert 6. September 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingAktualisiert 19. September 2026
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIAktualisiert 12. September 2026
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)Aktualisiert 6. September 2026
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)Aktualisiert 6. September 2026
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"Aktualisiert 5. September 2026
- Enterprise LLM Inference Servers 2026: vLLM vs TGI vs NVIDIA NIM vs OllamaAktualisiert 2. September 2026
Auch erwähnt in:
- LMDeploy Review: High-Throughput LLM Serving and QuantizationAktualisiert 19. September 2026
- Running LLMs and VLA Models On-Robot 2026: What Fits, What Doesn'tAktualisiert 2. September 2026
- Apple MLX vs NVIDIA CUDA for Local LLMs: Which System Should You Choose in 2026?Aktualisiert 29. August 2026
SGLang
- Bekannt für:
- Eine Inference-Engine und strukturierte Generierungssprache rund um RadixAttention-Caching
- Link:
- SGLang erklärt
Artikel über SGLang (5)
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)Aktualisiert 6. September 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingAktualisiert 19. September 2026
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIAktualisiert 12. September 2026
- Kilo Code Review: The Open-Source Coding Agent Now Owned by AnacondaAktualisiert 12. September 2026
- Text-Generation-WebUI vs vLLM vs llama.cpp in 2026: Inference Engine ComparisonAktualisiert 29. August 2026
Auch erwähnt in:
- AIClient2API Review: One Local Proxy for Every AI ProtocolAktualisiert 19. September 2026
- LMDeploy Review: High-Throughput LLM Serving and QuantizationAktualisiert 19. September 2026
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API ServerAktualisiert 19. September 2026
- Locally Uncensored Review 2026: Local Chat, Image, and Video in One AppAktualisiert 12. September 2026
ExLlamaV2
- Bekannt für:
- Eine auf Quantisierung fokussierte Engine, beliebt für GPTQ/EXL2-Modelle auf Consumer-GPUs
- Link:
- ExLlamaV2 erklärt
Artikel über ExLlamaV2 (2)
- ExLlamaV2 Explained 2026: Archived, Succeeded by ExLlamaV3Aktualisiert 6. September 2026
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"Aktualisiert 5. September 2026
Auch erwähnt in:
- LMDeploy Review: High-Throughput LLM Serving and QuantizationAktualisiert 19. September 2026
- How to Double Local LLM Speed: Optimization TechniquesAktualisiert 28. August 2026
Diese Liste zeigt Tools, die häufig mit LMDeploy im Produktions-Serving-Segment verglichen werden, keine unabhängige PromptQuorum-Rangliste — prüfen Sie vor der Wahl den aktuellen Funktionsumfang und die Hardware-Anforderungen jedes Tools.
Häufige Fehler bei der Bewertung von LMDeploy
Die meiste Verwirrung um LMDeploy entsteht, weil es wie eine Desktop-Chat-App behandelt wird oder seine selbst berichteten Benchmark-Zahlen als unabhängig verifiziert zitiert werden.
Häufig gestellte Fragen
Was ist LMDeploy?
LMDeploy (github.com/InternLM/lmdeploy) ist ein kostenloses, quelloffenes (Apache 2.0) Toolkit zum Komprimieren, Quantisieren und Servieren großer Sprachmodelle auf NVIDIA-GPUs, entwickelt von den Teams MMRazor und MMDeploy innerhalb des InternLM/OpenMMLab-Ökosystems.
Ist LMDeploy kostenlos?
Ja. LMDeploy ist Apache-2.0-lizenziert, ohne Preisseite und ohne kostenpflichtige Stufe. Ihre tatsächlichen Kosten sind die der GPU-Hardware oder Cloud-Instanz, auf der Sie es betreiben.
Wie installiere ich LMDeploy?
Führen Sie pip install lmdeploy in einer Python-3.10–3.13-Umgebung aus (eine conda-Umgebung wird empfohlen). Seit v0.13.0 zielen die Standard-PyPI-Wheels auf CUDA 12.8 ab, sodass dies bei typischen NVIDIA-GPU-Setups meist ohne separate CUDA-Installation genügt.
Hat LMDeploy eine grafische Oberfläche?
Nein. LMDeploy ist ein Kommandozeilen-Toolkit und eine Python-Library. Es hat kein Chat-Fenster — Sie interagieren über das Terminal, ein Python-Skript oder den OpenAI-kompatiblen API-Server.
Ist LMDeploy schneller als vLLM?
LMDeploys eigenes README berichtet von bis zu 1,8x höherem Anfragen-Durchsatz als vLLM, basierend auf eigenen, selbst veröffentlichten Benchmarks. Das ist keine unabhängig verifizierte Zahl — führen Sie vor dem Vertrauen darauf einen eigenen Benchmark mit Ihrem Zielmodell und Ihrer Hardware durch.
Welche Quantisierung unterstützt LMDeploy?
AWQ-4-Bit-Gewicht-Quantisierung, int8/int4-KV-Cache-Quantisierung (kombinierbar mit AWQ), MXFP4 auf unterstützten NVIDIA-GPUs und, seit 2026/02, symmetrische/asymmetrische 4-Bit-Quantisierung über eine Integration mit vllm-project/llm-compressor.
Welche Modelle unterstützt LMDeploy?
Dutzende LLM-Familien — darunter Llama, InternLM2/3, Qwen1.5 bis Qwen3, DeepSeek-MoE/V2/V3/R1, Mistral, ChatGLM2, GLM-4 und Code Llama — plus Vision-Language-Modelle wie InternVL, LLaVA und CogVLM2. Die vollständige, aktuelle Liste finden Sie in LMDeploys eigener Supported-Models-Dokumentation.
Unterstützt LMDeploy auch andere GPUs als NVIDIA?
Die primäre TurboMind-Engine zielt auf NVIDIA-CUDA-GPUs. Die PyTorch-Engine ergänzt Unterstützung für Huawei-Ascend-NPUs. Diese Review fand keinen reinen CPU- oder Apple-Silicon-Unterstützungspfad.
Wer entwickelt LMDeploy?
Die Teams MMRazor und MMDeploy, Teil des quelloffenen InternLM/OpenMMLab-Ökosystems, das unter dem Shanghai AI Laboratory gepflegt wird.
Hat LMDeploy einen OpenAI-kompatiblen API-Server?
Ja. Der Befehl lmdeploy serve api_server startet einen lokalen Server, der das OpenAI-Chat-Completions-Anfrage-/Antwortformat nachbildet, sodass bestehender OpenAI-Client-Code statt auf einen Cloud-Endpunkt darauf verweisen kann.