Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/candle-vllm im Test: Rust-natives LLM-Serving auf CUDA und Metal
Overview & Reference

candle-vllm im Test: Rust-natives LLM-Serving auf CUDA und Metal

·9 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

candle-vllm ist eine kostenlose, quelloffene, Rust-native LLM-Inferenz- und Serving-Engine, die auf Hugging Faces Candle-Machine-Learning-Framework aufbaut und einen OpenAI-kompatiblen API-Server mit vLLM-ähnlichen Serving-Funktionen (Continuous Batching, PagedAttention-artiges Speichermanagement, Quantisierungsunterstützung) bereitstellt – nativ in Rust implementiert, nicht als Python-Portierung. Sie nutzt dieselbe Codebasis auf NVIDIA CUDA (Linux) und Apple Metal (macOS/Apple Silicon) sowie als CPU-Fallback und unterstützt zahlreiche offene Modellfamilien in den Formaten SafeTensors, GGUF, GPTQ, AWQ und weiteren.

candle-vllm (github.com/EricLBuehler/candle-vllm) ist eine kostenlose, quelloffene, Rust-native LLM-Inferenz- und Serving-Engine, die auf Hugging Faces Candle-Machine-Learning-Framework aufbaut. Sie bietet einen OpenAI-kompatiblen API-Server und strebt ein Serving-Verhalten im Stil von vLLM an – ohne Python-Laufzeit. Sie läuft aus derselben Codebasis sowohl auf NVIDIA CUDA als auch auf Apple Metal. Dieser Test beleuchtet die Funktionen, den Vergleich mit dem in Python geschriebenen vLLM-Projekt, an dessen Serving-Modell sie sich orientiert, und für wen sie geeignet ist.

Wichtigste Erkenntnisse

  • candle-vllm (github.com/EricLBuehler/candle-vllm) ist eine kostenlose, quelloffene, Rust-native Inferenz- und Serving-Engine
  • Aufgebaut auf Hugging Faces Candle-Machine-Learning-Framework, entwickelt von EricLBuehler
  • MIT-lizenziert, bestätigt über die Lizenz des Repositorys
  • Übernimmt sein Serving-Konzept – Continuous Batching, effizientes KV-Cache-Handling – vom Python-Projekt vLLM, zitiert über das vLLM-Paper (arxiv.org/abs/2309.06180), ist aber eine von Grund auf neue Rust-Implementierung und keine Portierung von vLLMs Python-Code
  • Betreibt standardmäßig einen OpenAI-kompatiblen API-Server unter http://localhost:2000, mit optionaler integrierter Weboberfläche
  • Plattformübergreifend mit derselben Codebasis: NVIDIA CUDA 11/12/13 unter Linux, Apple Metal unter macOS/Apple Silicon (empfohlen: 16 GB+ Unified Memory) und CPU-Fallback
  • Rund 728 GitHub-Stars zum Zeitpunkt dieses Tests

📍 In einem Satz

candle-vllm ist eine kostenlose, quelloffene (MIT) LLM-Serving-Engine, die nativ in Rust auf Basis von Hugging Faces Candle-Framework geschrieben ist und einen OpenAI-kompatiblen API-Server mit vLLM-ähnlichem Serving-Verhalten auf NVIDIA CUDA und Apple Metal bietet.

💬 In einfachen Worten

candle-vllm ist ein Programm, das ein KI-Sprachmodell auf dem eigenen Computer oder Server ausführt und anderen Apps erlaubt, im gleichen Anfrageformat wie OpenAIs API mit ihm zu kommunizieren – Tools, die für OpenAIs API gebaut wurden, lassen sich so oft mit einer kleinen Konfigurationsänderung darauf umleiten. Es ist vollständig in Rust statt in Python gebaut, was der Entwickler als Sicherheits- und Kompilierungsvorteil einordnet, und übernimmt das Serving-Design des bekannten Python-Projekts vLLM, ohne dessen Python-Code wörtlich weiterzuverwenden.

📌Hinweis: Dieser Test basiert auf dem eigenen GitHub-Repository und der README des Projekts. Die vom Projekt selbst angegebenen Decode-Geschwindigkeits-Benchmarks werden nicht als unabhängig verifizierte Werte wiedergegeben, da PromptQuorum keine eigenen praktischen Performance-Tests von candle-vllm durchgeführt hat.

Was ist candle-vllm?

candle-vllm ist eine kostenlose, quelloffene LLM-Inferenz- und Serving-Engine, die vollständig in Rust geschrieben ist und auf Hugging Faces Candle-Machine-Learning-Framework aufbaut – nicht auf Python. Sie wird von EricLBuehler entwickelt und über GitHub vertrieben.

  • Produkttyp: eine selbst betriebene Serving-Engine bzw. ein API-Server, kein gehosteter Dienst und keine Desktop-Chat-App
  • Entwickler: EricLBuehler
  • Zugrunde liegendes Framework: Candle, Hugging Faces Rust-natives Machine-Learning-Framework — candle-vllm baut darauf auf, ist aber kein Fork oder Umbenennung von Candle selbst
  • Lizenz: MIT
  • Finanzierung: Für diesen Test wurde keine Finanzierungsrunde, kein Investor und kein kommerzieller Träger gefunden — als unabhängig gepflegtes Open-Source-Community-Projekt zu betrachten
  • Umfang: rund 728 GitHub-Stars, etwa 90 Forks und eine aktive, aktuelle Commit-Historie zum Zeitpunkt dieses Tests

Was leistet candle-vllm konkret?

candle-vllm lädt ein offenes LLM und stellt es über eine OpenAI-kompatible HTTP-API bereit, mit Serving-Optimierungen, die im Geiste dem Python-Projekt vLLM ähneln — Continuous Batching, effizientes Speichermanagement für den Attention-Cache und Quantisierungsunterstützung —, nativ in Rust implementiert.

  • OpenAI-kompatibler API-Server: lauscht standardmäßig auf http://localhost:2000, sodass Clients, die für das OpenAI-API-Format gebaut wurden, sich oft mit einer Änderung der Basis-URL verbinden können
  • Optionale integrierte Weboberfläche: Laut Projekt-README lässt sich parallel zur API eine ChatGPT-artige Chat-Oberfläche auf einem vom API-Port abweichenden Port starten
  • Breite Modellfamilien-Unterstützung laut README: Qwen, Llama, Mistral, Phi3/Phi4, DeepSeek (inklusive V3/R1), GLM, Yi, StableLM, Gemma, QwQ sowie Vision-Language-Modelle
  • Unterstützte Modellformate laut Projektdokumentation: SafeTensors, GGUF, GPTQ, AWQ, Marlin, MXFP4 und NVFP4
  • In der README beschriebene Performance-Funktionen: Flash Attention, eine FlashInfer-Backend-Option, CUDA Graphs, Continuous Batching und Prefix-Caching (Wiederverwendung des KV-Cache über Anfragen hinweg)
  • Speichereffizienz-Funktion: "TurboQuant"-KV-Cache-Komprimierung, die laut README durch 2–4-Bit-Cache-Quantisierungsvarianten eine deutliche Erweiterung der Kontextlänge ermöglichen soll
  • Multi-GPU- und Multi-Node-Unterstützung: Tensor-parallele Multi-GPU-Inferenz (laut README wird der Multi-Prozess-Modus empfohlen) und TCP-basierte Multi-Node-Koordination ohne MPI-Abhängigkeit
  • Tool-Integration: dokumentierte Unterstützung für das Model Context Protocol (MCP) und OpenAI-kompatibles Tool-/Function-Calling

Plattform, Preise und Lizenzierung

Plattform

Was candle-vllm angibt:
Ein selbst gehosteter Server-Prozess, über die Kommandozeile oder als Rust-Bibliothek betrieben. Plattformübergreifend: Linux (CUDA 11/12/13), macOS/Apple Silicon (Metal) und CPU-Fallback, dieselbe Codebasis für alle drei.

Kosten

Was candle-vllm angibt:
Kostenlos und quelloffen, keine kostenpflichtige Stufe. Sie stellen eigene Rechenleistung und laden offene Modellgewichte separat herunter (z. B. von Hugging Face).

Lizenzierung

Was candle-vllm angibt:
MIT-Lizenz.

Installationsmethode

Was candle-vllm angibt:
Laut Projekt-README: ein Ein-Zeilen-Shell-Installer für DEB-/Binärinstallationen, ein Quellbau via cargo install mit CUDA-/Metal-/CPU-Feature-Flags, oder ein Docker-Image mit konfigurierbarer CUDA-/SM-Version.

Prüfen Sie die aktuell empfohlene Installationsmethode und CUDA-/Treiberkompatibilität auf github.com/EricLBuehler/candle-vllm, bevor Sie einen Befehl ausführen, da sich Installationsanweisungen und unterstützte CUDA-Versionen zwischen Releases ändern können.

candle-vllm vs. Python-vLLM

candle-vllm ist kein Fork oder Port des ursprünglichen Python-vLLM-Projekts — es ist eine eigenständige, von Grund auf neue Rust-Implementierung, die einem ähnlichen Serving-Design folgt (Continuous Batching, effizientes KV-Cache-Management) und das vLLM-Paper als Referenzansatz zitiert.

Sprache/Laufzeit

candle-vllm:
Rust, keine Python-Laufzeit zum Betrieb des Servers nötig
Python-vLLM:
Python, benötigt eine Python-Umgebung

Zugrunde liegendes Framework

candle-vllm:
Hugging Face Candle (Rust-ML-Framework)
Python-vLLM:
PyTorch

API-Kompatibilität

candle-vllm:
OpenAI-kompatible HTTP-API
Python-vLLM:
OpenAI-kompatible HTTP-API

Plattformunterstützung

candle-vllm:
CUDA, Apple Metal, CPU — dieselbe Codebasis
Python-vLLM:
Primär auf CUDA/ROCm fokussiert, kein natives Apple-Metal-Backend

Ökosystem-Reife

candle-vllm:
Kleinere Community (~728 Stars), neueres Projekt
Python-vLLM:
Groß, breit im Produktiveinsatz von LLM-Serving-Stacks

Dieser Vergleich spiegelt die jeweils eigene Dokumentation der Projekte wider, keine unabhängige PromptQuorum-Benchmarking. Prüfen Sie aktuelle Feature-Parität und Performance direkt bei jedem Projekt, bevor Sie sich entscheiden.

Für wen eignet sich candle-vllm?

candle-vllm eignet sich für Entwickler, die eine OpenAI-kompatible lokale Serving-Engine ohne Python-Abhängigkeit wollen und Wert darauf legen, dieselbe Codebasis auf CUDA und Apple Metal zu betreiben.

Wofür candle-vllm nicht geeignet ist

candle-vllm ist keine gute Wahl, wenn Sie das größte bestehende Integrations-Ökosystem, einen GUI-Installer ohne Terminal oder unabhängig verifizierte Performance-Zahlen benötigen, bevor Sie sich festlegen.

  • Nicht das ausgereifteste Ökosystem — Python-vLLM hat zum Zeitpunkt dieses Tests eine viel größere Community, mehr Drittanbieter-Integrationen und mehr Produktions-Erfahrung
  • Keine GUI- oder Ein-Klick-Desktop-Installation — es handelt sich um eine Server-/API-Komponente, die per Shell-Skript, Cargo-Build oder Docker eingerichtet wird
  • Kein Drop-in-Ersatz für jedes Python-vLLM-spezifische Plugin oder jeden Workflow — manche Tools, die speziell für die internen Abläufe von Python-vLLM gebaut wurden, haben hier kein direktes Rust-Äquivalent
  • Nicht unabhängig von PromptQuorum benchmarkt — dieser Test bestätigt die vom Projekt selbst gemeldeten Decode-Geschwindigkeitswerte nicht durch eigene praktische Tests
  • Keine für diesen Test verifizierbare Finanzierungsrunde oder Firma dahinter — als unabhängig gepflegtes, community-getragenes Projekt zu betrachten

Häufige Fehler bei der Bewertung von candle-vllm

Die meisten Missverständnisse zu candle-vllm entstehen durch die Annahme, es handle sich um eine Python-zu-Rust-Portierung von vLLM, oder durch die Annahme, es sei wegen des "vllm" im Namen in Python geschrieben.

Konkurrenten und Alternativen

Innerhalb lokaler LLM-Inferenz- und Serving-Engines ist candle-vllm am ehesten mit anderen selbst gehosteten, OpenAI-kompatiblen Serving-Plattformen vergleichbar — sein Hauptunterscheidungsmerkmal ist, Rust-nativ statt Python-basiert zu sein, mit nativer Apple-Metal-Unterstützung neben CUDA.

Tool
Bekannt für
Link
LMDeployPython-basiertes LLM-Serving-Toolkit des InternLM-Teams mit Quantisierung und Hochdurchsatz-InferenzLMDeploy Test
NVIDIA DynamoVerteiltes Inferenz-Serving-Framework für großskalige, Multi-Node-LLM-DeploymentsDynamo Test
LoRAXMulti-LoRA-Adapter-Serving-Framework zum Betrieb vieler feinjustierter Varianten eines BasismodellsLoRAX Test

Diese Liste spiegelt Tools wider, die häufig mit candle-vllm im Bereich Inferenz-/Serving-Engines verglichen werden, keine unabhängige PromptQuorum-Rangliste — prüfen Sie vor der Wahl den aktuellen Funktionsumfang jedes Tools.

Häufig gestellte Fragen

Was ist candle-vllm?

candle-vllm (github.com/EricLBuehler/candle-vllm) ist eine kostenlose, quelloffene, Rust-native LLM-Inferenz- und Serving-Engine auf Basis von Hugging Faces Candle-Framework, mit OpenAI-kompatiblem API-Server.

Ist candle-vllm in Python geschrieben?

Nein. Trotz des "vllm" im Namen ist candle-vllm vollständig in Rust auf Basis von Hugging Faces Candle-Machine-Learning-Framework geschrieben. Zum Betrieb des Servers ist keine Python-Laufzeit erforderlich.

Ist candle-vllm dasselbe Projekt wie vLLM?

Nein. Es ist eine eigenständige, von Grund auf neue Rust-Implementierung, die einem ähnlichen Serving-Design (Continuous Batching, KV-Cache-Management) wie das Python-Projekt vLLM folgt und das vLLM-Paper zitiert, aber vLLMs Python-Code nicht weiterverwendet.

Ist candle-vllm kostenlos?

Ja, es ist kostenlos und quelloffen unter der MIT-Lizenz, ohne kostenpflichtige Stufe.

Welche Plattformen unterstützt candle-vllm?

Dieselbe Codebasis läuft auf NVIDIA CUDA (11/12/13) unter Linux, Apple Metal unter macOS/Apple Silicon (empfohlen: 16 GB+ Unified Memory) sowie CPU als Fallback.

Wie installiere ich candle-vllm?

Laut Projekt-README: ein Ein-Zeilen-Shell-Installer für DEB-/Binärinstallationen, ein Quellbau via cargo install mit den passenden CUDA-/Metal-/CPU-Feature-Flags, oder ein Docker-Image.

Unterstützt candle-vllm quantisierte Modelle?

Ja. Laut Projektdokumentation werden die Modellformate SafeTensors, GGUF, GPTQ, AWQ, Marlin, MXFP4 und NVFP4 unterstützt.

Wer hat candle-vllm entwickelt?

Entwickler EricLBuehler hat candle-vllm erstellt und pflegt es, aufgebaut auf Hugging Faces Candle-Machine-Learning-Framework.

Hat candle-vllm eine Weboberfläche?

Optional lässt sich laut Projekt-README parallel zum API-Server eine integrierte, ChatGPT-artige Weboberfläche auf einem vom API-Port abweichenden Port starten.

Hat PromptQuorum die Performance-Angaben von candle-vllm unabhängig überprüft?

Nein. Dieser Test basiert auf dem eigenen GitHub-Repository und der README des Projekts, nicht auf praktischen Performance-Tests durch PromptQuorum.

Quellen

← Zurück zu Lokale LLMs Pro