Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Lokale Inferenz-Engines, Runtimes & Gateways im Vergleich (2026): Modelle ausführen und bereitstellen
Overview & Reference

Lokale Inferenz-Engines, Runtimes & Gateways im Vergleich (2026): Modelle ausführen und bereitstellen

·10 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Die 46 lokalen Run-and-Serve-Werkzeuge im PromptQuorum-Verzeichnis lassen sich in drei Arten einteilen, die getrennt verglichen werden sollten: Inferenz-Engines (30 Werkzeuge), Runtimes und Manager (13) sowie Router und Gateways (4). Bei den Engines dokumentieren 15 die Unterstützung von NVIDIA-GPUs, 17 die Unterstützung von Apple Silicon und 21 eine OpenAI-kompatible API; bei den Runtimes dokumentieren 6 eine OpenAI-kompatible API. Nutzen Sie die Vergleichstabelle unten und lesen Sie den jeweiligen Test eines Werkzeugs, bevor Sie es installieren.

Ein Modell auf eigener Hardware zu betreiben, umfasst drei verschiedene Arten von Werkzeugen — Inferenz-Engines, die das Modell ausführen, Runtimes und Manager, die Modelle für Sie herunterladen und starten, sowie Router und Gateways, die davor geschaltet werden — und keine einzelne Funktionsliste vergleicht sie fair. Dieser Leitfaden vergleicht 46 kostenlose und Freemium-Werkzeuge, jeweils innerhalb einer Werkzeugart, anhand einer Vergleichstabelle, die aus denselben Daten erzeugt wird wie der jeweilige PromptQuorum-Test des Werkzeugs, sodass sich Tabelle und Tests nicht widersprechen können.

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.

Wichtigste Erkenntnisse

  • 46 Werkzeuge, drei Arten: Inferenz-Engines (30), Runtimes und Manager (13), Router und Gateways (4). Ollama erscheint in zwei Gruppen, weil es sowohl Engine als auch Runtime ist.
  • Die Tabelle wird aus dem Datensatz jedes Werkzeugs erzeugt und anhand seiner offiziellen README oder Website geprüft; ein Strich bedeutet „in der Dokumentation nicht angegeben“, niemals „nein“. Bei einigen bekannten Werkzeugen schweigt die hier zitierte Dokumentation zu einer bestimmten Funktion, weshalb ihre Zellen einen Strich zeigen.
  • Jeder Werkzeugname in der Tabelle verlinkt auf den eigenen PromptQuorum-Test, in dem Installationsschritte und Grenzen behandelt werden.

📍 In einem Satz

Der lokale Modellbetrieb umfasst drei Arten von Werkzeugen — Inferenz-Engines, Runtimes und Manager sowie Router und Gateways —, daher werden die 46 Werkzeuge im PromptQuorum-Verzeichnis jeweils innerhalb ihrer Art verglichen, anhand einer Tabelle, die aus denselben Werkzeugdaten erzeugt wird wie der jeweilige Test des Werkzeugs.

💬 In einfachen Worten

Eine Engine ist der Teil, der das Modell tatsächlich ausführt, eine Runtime oder ein Manager lädt Modelle für Sie herunter und startet sie, und ein Gateway leitet Anfragen zwischen ihnen weiter. Eine Engine und ein Gateway bei der GPU-Unterstützung zu vergleichen, ergibt keinen Sinn, deshalb vergleicht dieser Leitfaden nur Gleichartiges.

So haben wir verglichen

Die Fakten jedes Werkzeugs — Preis, Lizenz, Plattformen, Hardware-Anforderungen und kategoriespezifische Merkmale — werden einmal im Verzeichniseintrag des Werkzeugs gespeichert. Die Vergleichstabelle unten wird aus diesen Einträgen erzeugt, und der Test des Werkzeugs stützt sich auf denselben Eintrag, sodass beide keine unterschiedlichen Werte nennen können.

Kategoriespezifische Merkmale (zum Beispiel OpenAI-kompatible API oder AMD-GPU-Unterstützung) wurden der offiziellen README oder Website jedes Projekts entnommen und am genauen Wortlaut dort geprüft. Wo die Dokumentation schweigt, zeigt die Tabelle einen Strich statt einer Vermutung; wo eine Aussage eingeschränkt ist (experimentell, geplant oder nur über ein separates Projekt verfügbar), wird das Merkmal aus der Tabelle weggelassen und stattdessen im Test des Werkzeugs behandelt.

In der Tabelle stehen nur Werkzeuge mit eigenem PromptQuorum-Test. Werkzeuge, die nur als API-Server aufgeführt sind (h2oGPT, Tabby und OpenAI Edge TTS), werden in ihren eigenen Kategorien verglichen. Der Vergleich listet Werkzeuge auf, die auf Ihrer eigenen Hardware laufen; er erstellt keine Rangfolge, weil das passende Werkzeug von Ihrer Anforderung abhängt.

Vergleichstabelle

Wählen Sie unten eine Werkzeugart und lesen Sie dann quer durch eine Zeile. Klicken Sie auf einen Werkzeugnamen, um den vollständigen PromptQuorum-Test zu öffnen.

WerkzeugPreisLizenzPlattformenAusführungHardwareVersionOpenAI-kompatible APINVIDIA-GPUApple SiliconAMD-GPUCPU-InferenzMulti-GPU / Multi-NodeTestProduktlink · offengelegt
candle-vllmKostenlosMITmacOS, Windows, LinuxLokalJe nach Modell unterschiedlichv0.9.1JaJaJaJaTest lesencandle-vllm
claude-code-localKostenlosMITmacOSLokalJe nach Modell unterschiedlichv0.3.0JaTest lesenclaude-code-local
ExLlamaV2KostenlosMITWindows, LinuxLokal8 GB VRAMv0.3.2JaJaTest lesenExLlamaV2
exoKostenlosApache-2.0macOS, LinuxLokalJe nach Modell unterschiedlichJaJaJaJaTest lesenexo
KoboldCppKostenlosAGPL-3.0Windows, Linux, macOSLokalJe nach Modell unterschiedlichv1.121JaJaJaJaJaTest lesenKoboldCpp
KServeKostenlosApache-2.0LinuxLokalCPU genügtv0.20.0JaJaTest lesenKServe
llama.cppKostenlosMITmacOS, Windows, LinuxLokalJe nach Modell unterschiedlichv0.4.1JaJaJaJaJaTest lesenllama.cpp
LlamafileKostenlosApache-2.0macOS, Windows, LinuxLokalJe nach Modell unterschiedlich0.10.6Test lesenLlamafile
LMDeployKostenlosApache-2.0LinuxLokalJe nach Modell unterschiedlichv0.17.0JaJaTest lesenLMDeploy
LocalAIKostenlosMITmacOS, Windows, LinuxLokalJe nach Modell unterschiedlichJaJaJaJaJaJaTest lesenLocalAI
LoRAXKostenlosApache-2.0LinuxLokalJe nach Modell unterschiedlichv0.12.1JaJaJaTest lesenLoRAX
LuceboxKostenlosApache-2.0LinuxLokalJe nach Modell unterschiedlichJaJaJaJaTest lesenLucebox
MLC LLMKostenlosApache-2.0macOS, Windows, Linux, iOS, AndroidLokalJe nach Modell unterschiedlichJaJaJaJaTest lesenMLC LLM
MLX-LMKostenlosMITmacOSLokalJe nach Modell unterschiedlichJaJaTest lesenMLX-LM
mlx-serveKostenlosMITmacOSLokalJe nach Modell unterschiedlichv26.9.4JaJaTest lesenmlx-serve
mlxcelKostenlosApache-2.0macOS, LinuxLokalJe nach Modell unterschiedlichv0.7.0JaJaJaJaTest lesenmlxcel
NVIDIA DynamoKostenlosApache-2.0LinuxLokalJe nach Modell unterschiedlichv1.4–v1.6JaJaTest lesenNVIDIA Dynamo
OllamaKostenlosMITmacOS, Windows, LinuxLokalJe nach Modell unterschiedlichTest lesenOllama
OlliteRTKostenlosApache-2.0AndroidLokalCPU genügtJaJaTest lesenOlliteRT
oMLXKostenlosApache-2.0macOSLokalJe nach Modell unterschiedlichv0.6.4JaJaJaTest lesenoMLX
OpenLLMKostenlosApache-2.0HybridJe nach Modell unterschiedlichJaTest lesenOpenLLM
Rapid-MLXKostenlosApache-2.0macOSLokal8 GB RAMJaJaTest lesenRapid-MLX
SGLangKostenlosApache-2.0LinuxLokalJe nach Modell unterschiedlichJaJaJaJaTest lesenSGLang
ShimmyKostenlosApache-2.0macOS, Windows, LinuxLokalJe nach Modell unterschiedlichJaJaJaJaTest lesenShimmy
SwiftLMKostenlosMITmacOS, iOSLokalJe nach Modell unterschiedlichJaJaTest lesenSwiftLM
TensorRT-LLMKostenlosApache-2.0Windows, LinuxLokalJe nach Modell unterschiedlichJaTest lesenTensorRT-LLM
text-generation-webuiKostenlosAGPL-3.0Windows, Linux, macOSLokalJe nach Modell unterschiedlichJaJaJaJaJaTest lesentext-generation-webui
TurboFieldfareKostenlosApache-2.0macOSLokal2 GB RAMJaTest lesenTurboFieldfare
vLLMKostenlosApache-2.0LinuxLokalJe nach Modell unterschiedlichJaJaJaJaJaTest lesenvLLM
vllm-mlxKostenlosApache-2.0macOSLokalJe nach Modell unterschiedlichJaJaTest lesenvllm-mlx

„—“ bedeutet, dass die eigene Dokumentation des Projekts es nicht angibt, nicht dass die Funktion fehlt. Die Werte stammen aus der offiziellen README oder Website des jeweiligen Projekts und werden erneut geprüft, wenn der Test eines Werkzeugs aktualisiert wird.

Inferenz-Engines: Die Unterschiede

Runtimes und Manager: Die Unterschiede

  • OpenAI-kompatible API. Docker Model Runner, Foundry Local, GPUStack, Jan, Lemonade und Osaurus dokumentieren eine OpenAI-kompatible API.
  • Desktop-App. GPT4All, Jan, LM Studio, Osaurus und Ypipe dokumentieren eine installierbare Desktop-App.
  • Integrierte Modellbibliothek. Foundry Local, GPUStack, Jan, Lemonade, LM Studio und Ollama dokumentieren eine integrierte Möglichkeit, Modelle zu finden und herunterzuladen.
  • Headless- oder Servermodus. DreamServer, GPUStack, Lemonade und Osaurus dokumentieren den Betrieb als Hintergrunddienst oder Server ohne grafische Oberfläche.
  • Lizenz und Preis. Vier Runtimes hier stehen unter Apache-2.0 und vier unter MIT. LM Studio und Docker Model Runner sind proprietär (LM Studio ist kostenlos nutzbar; Docker Model Runner ist in Docker Desktop enthalten), Msty ist Closed Source mit kostenloser Stufe, und RunAnywhere und YPipe verwenden eigene oder nicht dokumentierte Bedingungen — prüfen Sie den jeweiligen Test.

Router und Gateways: Die Unterschiede

  • OpenAI-kompatibler Endpunkt. AIClient2API und litellm dokumentieren einen OpenAI-kompatiblen Endpunkt.
  • Routing zu lokalen Modellen. litellm dokumentiert lokale oder selbst gehostete Modelle (etwa Ollama) unter seinen unterstützten Anbietern.
  • Fallback und Lastverteilung. AIClient2API, ClawRouter und litellm dokumentieren Fallback, Wiederholungsversuche oder Lastverteilung über Modelle oder Anbieter hinweg.
  • Lizenz. Zwei der vier stehen unter MIT, eines unter GPL-3.0 und eines unter Apache-2.0.

Was dieser Vergleich nicht leisten kann

  • Er vergleicht dokumentierte Fähigkeiten, nicht die Leistung. Er sagt nichts über Token pro Sekunde, Speicherverbrauch oder Latenz — PromptQuorum hat sie für diese Werkzeuge nicht gemessen, und sie hängen stark von Ihrer Hardware und Ihrem Modell ab.
  • Striche sind Lücken in der von uns geprüften Dokumentation, keine negativen Befunde. Manche Werkzeuge unterstützen möglicherweise eine Funktion, die ihre README nicht erwähnt; das zeigt sich besonders bei einigen weit verbreiteten Werkzeugen mit kurzen READMEs, die wenig aussagen (zum Beispiel die Engine-Funktionen von Ollama).
  • Die Hardware-Unterstützung entspricht den Angaben der Dokumentation und ist keine Garantie für ein gutes Nutzungserlebnis auf dieser Hardware; die tatsächlichen Anforderungen finden Sie im Test des Werkzeugs.
  • Werkzeuge ändern sich schnell. Der Test jedes Werkzeugs nennt die Version, gegen die er geprüft wurde, und dieser Leitfaden wird aktualisiert, wenn ein Test aktualisiert wird.

Häufig gestellte Fragen

Was ist der Unterschied zwischen einer Inferenz-Engine, einer Runtime und einem Gateway?

Eine Inferenz-Engine führt das Modell auf Ihrer Hardware aus (zum Beispiel llama.cpp oder vLLM). Eine Runtime oder ein Manager lädt Modelle herunter und führt sie für Sie aus, oft mit einer Desktop-App oder einer Modellbibliothek (zum Beispiel Ollama oder LM Studio). Ein Router oder Gateway sitzt vor einem oder mehreren Modellen oder Anbietern und leitet Anfragen weiter. Sie erfüllen unterschiedliche Aufgaben und werden deshalb getrennt verglichen.

Was bedeutet ein Strich in der Vergleichstabelle?

Er bedeutet, dass die eigene Dokumentation des Projekts dieses Merkmal nicht angibt. Er bedeutet nicht, dass die Funktion fehlt; prüfen Sie den Test des Werkzeugs oder sein Repository.

Warum steht Ollama in zwei Gruppen?

Ollama ist sowohl eine Inferenz-Engine als auch eine Runtime, die Modelle verwaltet, und wird deshalb unter beiden geführt. Seine README nennt nur wenige der hier verglichenen Merkmale, daher zeigen viele seiner Zellen einen Strich.

Hat eines dieser Werkzeuge einen Affiliate-Link?

Nein. PromptQuorum hat zum Zeitpunkt der Erstellung mit keinem Werkzeug in diesem Vergleich eine Affiliate-Beziehung, und kein Link hier bringt eine Provision.

Wie oft wird dieser Vergleich aktualisiert?

Er wird zweimal im Jahr aktualisiert sowie immer dann, wenn der Test eines der aufgeführten Werkzeuge aktualisiert wird, weil die Tabelle aus denselben Daten wie diese Tests erzeugt wird.

Quellen

← Zurück zu Lokale LLMs Pro