Wichtigste Erkenntnisse
- candle-vllm (github.com/EricLBuehler/candle-vllm) ist eine kostenlose, quelloffene, Rust-native Inferenz- und Serving-Engine
- Aufgebaut auf Hugging Faces Candle-Machine-Learning-Framework, entwickelt von EricLBuehler
- MIT-lizenziert, bestätigt über die Lizenz des Repositorys
- Übernimmt sein Serving-Konzept – Continuous Batching, effizientes KV-Cache-Handling – vom Python-Projekt vLLM, zitiert über das vLLM-Paper (arxiv.org/abs/2309.06180), ist aber eine von Grund auf neue Rust-Implementierung und keine Portierung von vLLMs Python-Code
- Betreibt standardmäßig einen OpenAI-kompatiblen API-Server unter
http://localhost:2000, mit optionaler integrierter Weboberfläche - Plattformübergreifend mit derselben Codebasis: NVIDIA CUDA 11/12/13 unter Linux, Apple Metal unter macOS/Apple Silicon (empfohlen: 16 GB+ Unified Memory) und CPU-Fallback
- Rund 728 GitHub-Stars zum Zeitpunkt dieses Tests
📍 In einem Satz
candle-vllm ist eine kostenlose, quelloffene (MIT) LLM-Serving-Engine, die nativ in Rust auf Basis von Hugging Faces Candle-Framework geschrieben ist und einen OpenAI-kompatiblen API-Server mit vLLM-ähnlichem Serving-Verhalten auf NVIDIA CUDA und Apple Metal bietet.
💬 In einfachen Worten
candle-vllm ist ein Programm, das ein KI-Sprachmodell auf dem eigenen Computer oder Server ausführt und anderen Apps erlaubt, im gleichen Anfrageformat wie OpenAIs API mit ihm zu kommunizieren – Tools, die für OpenAIs API gebaut wurden, lassen sich so oft mit einer kleinen Konfigurationsänderung darauf umleiten. Es ist vollständig in Rust statt in Python gebaut, was der Entwickler als Sicherheits- und Kompilierungsvorteil einordnet, und übernimmt das Serving-Design des bekannten Python-Projekts vLLM, ohne dessen Python-Code wörtlich weiterzuverwenden.
📌Hinweis: Dieser Test basiert auf dem eigenen GitHub-Repository und der README des Projekts. Die vom Projekt selbst angegebenen Decode-Geschwindigkeits-Benchmarks werden nicht als unabhängig verifizierte Werte wiedergegeben, da PromptQuorum keine eigenen praktischen Performance-Tests von candle-vllm durchgeführt hat.
Was ist candle-vllm?
candle-vllm ist eine kostenlose, quelloffene LLM-Inferenz- und Serving-Engine, die vollständig in Rust geschrieben ist und auf Hugging Faces Candle-Machine-Learning-Framework aufbaut – nicht auf Python. Sie wird von EricLBuehler entwickelt und über GitHub vertrieben.
- Produkttyp: eine selbst betriebene Serving-Engine bzw. ein API-Server, kein gehosteter Dienst und keine Desktop-Chat-App
- Entwickler: EricLBuehler
- Zugrunde liegendes Framework: Candle, Hugging Faces Rust-natives Machine-Learning-Framework — candle-vllm baut darauf auf, ist aber kein Fork oder Umbenennung von Candle selbst
- Lizenz: MIT
- Finanzierung: Für diesen Test wurde keine Finanzierungsrunde, kein Investor und kein kommerzieller Träger gefunden — als unabhängig gepflegtes Open-Source-Community-Projekt zu betrachten
- Umfang: rund 728 GitHub-Stars, etwa 90 Forks und eine aktive, aktuelle Commit-Historie zum Zeitpunkt dieses Tests
Was leistet candle-vllm konkret?
candle-vllm lädt ein offenes LLM und stellt es über eine OpenAI-kompatible HTTP-API bereit, mit Serving-Optimierungen, die im Geiste dem Python-Projekt vLLM ähneln — Continuous Batching, effizientes Speichermanagement für den Attention-Cache und Quantisierungsunterstützung —, nativ in Rust implementiert.
- OpenAI-kompatibler API-Server: lauscht standardmäßig auf
http://localhost:2000, sodass Clients, die für das OpenAI-API-Format gebaut wurden, sich oft mit einer Änderung der Basis-URL verbinden können - Optionale integrierte Weboberfläche: Laut Projekt-README lässt sich parallel zur API eine ChatGPT-artige Chat-Oberfläche auf einem vom API-Port abweichenden Port starten
- Breite Modellfamilien-Unterstützung laut README: Qwen, Llama, Mistral, Phi3/Phi4, DeepSeek (inklusive V3/R1), GLM, Yi, StableLM, Gemma, QwQ sowie Vision-Language-Modelle
- Unterstützte Modellformate laut Projektdokumentation: SafeTensors, GGUF, GPTQ, AWQ, Marlin, MXFP4 und NVFP4
- In der README beschriebene Performance-Funktionen: Flash Attention, eine FlashInfer-Backend-Option, CUDA Graphs, Continuous Batching und Prefix-Caching (Wiederverwendung des KV-Cache über Anfragen hinweg)
- Speichereffizienz-Funktion: "TurboQuant"-KV-Cache-Komprimierung, die laut README durch 2–4-Bit-Cache-Quantisierungsvarianten eine deutliche Erweiterung der Kontextlänge ermöglichen soll
- Multi-GPU- und Multi-Node-Unterstützung: Tensor-parallele Multi-GPU-Inferenz (laut README wird der Multi-Prozess-Modus empfohlen) und TCP-basierte Multi-Node-Koordination ohne MPI-Abhängigkeit
- Tool-Integration: dokumentierte Unterstützung für das Model Context Protocol (MCP) und OpenAI-kompatibles Tool-/Function-Calling
Plattform, Preise und Lizenzierung
Plattform
- Was candle-vllm angibt:
- Ein selbst gehosteter Server-Prozess, über die Kommandozeile oder als Rust-Bibliothek betrieben. Plattformübergreifend: Linux (CUDA 11/12/13), macOS/Apple Silicon (Metal) und CPU-Fallback, dieselbe Codebasis für alle drei.
Kosten
- Was candle-vllm angibt:
- Kostenlos und quelloffen, keine kostenpflichtige Stufe. Sie stellen eigene Rechenleistung und laden offene Modellgewichte separat herunter (z. B. von Hugging Face).
Lizenzierung
- Was candle-vllm angibt:
- MIT-Lizenz.
Installationsmethode
- Was candle-vllm angibt:
- Laut Projekt-README: ein Ein-Zeilen-Shell-Installer für DEB-/Binärinstallationen, ein Quellbau via
cargo installmit CUDA-/Metal-/CPU-Feature-Flags, oder ein Docker-Image mit konfigurierbarer CUDA-/SM-Version.
Prüfen Sie die aktuell empfohlene Installationsmethode und CUDA-/Treiberkompatibilität auf github.com/EricLBuehler/candle-vllm, bevor Sie einen Befehl ausführen, da sich Installationsanweisungen und unterstützte CUDA-Versionen zwischen Releases ändern können.
candle-vllm installieren
candle-vllm lässt sich kostenlos per Shell-Skript, Cargo (Quellbau) oder Docker installieren, der Quellcode liegt auf GitHub.
Quelle | Link |
|---|---|
| GitHub-Repository (Quellcode, MIT) | github.com/EricLBuehler/candle-vllm |
| Candle-Framework (zugrunde liegendes ML-Framework) | github.com/huggingface/candle |
| Eintrag im Local LLM Software Directory | Local LLM Software Directory |
candle-vllm benötigt ein Terminal sowie entweder eine vorgefertigte Binärdatei/ein Docker-Image oder eine Rust-Toolchain (via Cargo) für den Quellbau — es gibt keinen GUI-Installer, da es sich um eine Server-/API-Komponente und keine Endnutzer-Desktop-App handelt.
candle-vllm vs. Python-vLLM
candle-vllm ist kein Fork oder Port des ursprünglichen Python-vLLM-Projekts — es ist eine eigenständige, von Grund auf neue Rust-Implementierung, die einem ähnlichen Serving-Design folgt (Continuous Batching, effizientes KV-Cache-Management) und das vLLM-Paper als Referenzansatz zitiert.
Sprache/Laufzeit
- candle-vllm:
- Rust, keine Python-Laufzeit zum Betrieb des Servers nötig
- Python-vLLM:
- Python, benötigt eine Python-Umgebung
Zugrunde liegendes Framework
- candle-vllm:
- Hugging Face Candle (Rust-ML-Framework)
- Python-vLLM:
- PyTorch
API-Kompatibilität
- candle-vllm:
- OpenAI-kompatible HTTP-API
- Python-vLLM:
- OpenAI-kompatible HTTP-API
Plattformunterstützung
- candle-vllm:
- CUDA, Apple Metal, CPU — dieselbe Codebasis
- Python-vLLM:
- Primär auf CUDA/ROCm fokussiert, kein natives Apple-Metal-Backend
Ökosystem-Reife
- candle-vllm:
- Kleinere Community (~728 Stars), neueres Projekt
- Python-vLLM:
- Groß, breit im Produktiveinsatz von LLM-Serving-Stacks
Dieser Vergleich spiegelt die jeweils eigene Dokumentation der Projekte wider, keine unabhängige PromptQuorum-Benchmarking. Prüfen Sie aktuelle Feature-Parität und Performance direkt bei jedem Projekt, bevor Sie sich entscheiden.
Für wen eignet sich candle-vllm?
candle-vllm eignet sich für Entwickler, die eine OpenAI-kompatible lokale Serving-Engine ohne Python-Abhängigkeit wollen und Wert darauf legen, dieselbe Codebasis auf CUDA und Apple Metal zu betreiben.
Wofür candle-vllm nicht geeignet ist
candle-vllm ist keine gute Wahl, wenn Sie das größte bestehende Integrations-Ökosystem, einen GUI-Installer ohne Terminal oder unabhängig verifizierte Performance-Zahlen benötigen, bevor Sie sich festlegen.
- Nicht das ausgereifteste Ökosystem — Python-vLLM hat zum Zeitpunkt dieses Tests eine viel größere Community, mehr Drittanbieter-Integrationen und mehr Produktions-Erfahrung
- Keine GUI- oder Ein-Klick-Desktop-Installation — es handelt sich um eine Server-/API-Komponente, die per Shell-Skript, Cargo-Build oder Docker eingerichtet wird
- Kein Drop-in-Ersatz für jedes Python-vLLM-spezifische Plugin oder jeden Workflow — manche Tools, die speziell für die internen Abläufe von Python-vLLM gebaut wurden, haben hier kein direktes Rust-Äquivalent
- Nicht unabhängig von PromptQuorum benchmarkt — dieser Test bestätigt die vom Projekt selbst gemeldeten Decode-Geschwindigkeitswerte nicht durch eigene praktische Tests
- Keine für diesen Test verifizierbare Finanzierungsrunde oder Firma dahinter — als unabhängig gepflegtes, community-getragenes Projekt zu betrachten
Häufige Fehler bei der Bewertung von candle-vllm
Die meisten Missverständnisse zu candle-vllm entstehen durch die Annahme, es handle sich um eine Python-zu-Rust-Portierung von vLLM, oder durch die Annahme, es sei wegen des "vllm" im Namen in Python geschrieben.
Konkurrenten und Alternativen
Innerhalb lokaler LLM-Inferenz- und Serving-Engines ist candle-vllm am ehesten mit anderen selbst gehosteten, OpenAI-kompatiblen Serving-Plattformen vergleichbar — sein Hauptunterscheidungsmerkmal ist, Rust-nativ statt Python-basiert zu sein, mit nativer Apple-Metal-Unterstützung neben CUDA.
Tool | Bekannt für | Link |
|---|---|---|
| LMDeploy | Python-basiertes LLM-Serving-Toolkit des InternLM-Teams mit Quantisierung und Hochdurchsatz-Inferenz | LMDeploy Test |
| NVIDIA Dynamo | Verteiltes Inferenz-Serving-Framework für großskalige, Multi-Node-LLM-Deployments | Dynamo Test |
| LoRAX | Multi-LoRA-Adapter-Serving-Framework zum Betrieb vieler feinjustierter Varianten eines Basismodells | LoRAX Test |
Diese Liste spiegelt Tools wider, die häufig mit candle-vllm im Bereich Inferenz-/Serving-Engines verglichen werden, keine unabhängige PromptQuorum-Rangliste — prüfen Sie vor der Wahl den aktuellen Funktionsumfang jedes Tools.
Häufig gestellte Fragen
Was ist candle-vllm?
candle-vllm (github.com/EricLBuehler/candle-vllm) ist eine kostenlose, quelloffene, Rust-native LLM-Inferenz- und Serving-Engine auf Basis von Hugging Faces Candle-Framework, mit OpenAI-kompatiblem API-Server.
Ist candle-vllm in Python geschrieben?
Nein. Trotz des "vllm" im Namen ist candle-vllm vollständig in Rust auf Basis von Hugging Faces Candle-Machine-Learning-Framework geschrieben. Zum Betrieb des Servers ist keine Python-Laufzeit erforderlich.
Ist candle-vllm dasselbe Projekt wie vLLM?
Nein. Es ist eine eigenständige, von Grund auf neue Rust-Implementierung, die einem ähnlichen Serving-Design (Continuous Batching, KV-Cache-Management) wie das Python-Projekt vLLM folgt und das vLLM-Paper zitiert, aber vLLMs Python-Code nicht weiterverwendet.
Ist candle-vllm kostenlos?
Ja, es ist kostenlos und quelloffen unter der MIT-Lizenz, ohne kostenpflichtige Stufe.
Welche Plattformen unterstützt candle-vllm?
Dieselbe Codebasis läuft auf NVIDIA CUDA (11/12/13) unter Linux, Apple Metal unter macOS/Apple Silicon (empfohlen: 16 GB+ Unified Memory) sowie CPU als Fallback.
Wie installiere ich candle-vllm?
Laut Projekt-README: ein Ein-Zeilen-Shell-Installer für DEB-/Binärinstallationen, ein Quellbau via cargo install mit den passenden CUDA-/Metal-/CPU-Feature-Flags, oder ein Docker-Image.
Unterstützt candle-vllm quantisierte Modelle?
Ja. Laut Projektdokumentation werden die Modellformate SafeTensors, GGUF, GPTQ, AWQ, Marlin, MXFP4 und NVFP4 unterstützt.
Wer hat candle-vllm entwickelt?
Entwickler EricLBuehler hat candle-vllm erstellt und pflegt es, aufgebaut auf Hugging Faces Candle-Machine-Learning-Framework.
Hat candle-vllm eine Weboberfläche?
Optional lässt sich laut Projekt-README parallel zum API-Server eine integrierte, ChatGPT-artige Weboberfläche auf einem vom API-Port abweichenden Port starten.
Hat PromptQuorum die Performance-Angaben von candle-vllm unabhängig überprüft?
Nein. Dieser Test basiert auf dem eigenen GitHub-Repository und der README des Projekts, nicht auf praktischen Performance-Tests durch PromptQuorum.