Wichtigste Erkenntnisse
- 46 Werkzeuge, drei Arten: Inferenz-Engines (30), Runtimes und Manager (13), Router und Gateways (4). Ollama erscheint in zwei Gruppen, weil es sowohl Engine als auch Runtime ist.
- Die Tabelle wird aus dem Datensatz jedes Werkzeugs erzeugt und anhand seiner offiziellen README oder Website geprüft; ein Strich bedeutet „in der Dokumentation nicht angegeben“, niemals „nein“. Bei einigen bekannten Werkzeugen schweigt die hier zitierte Dokumentation zu einer bestimmten Funktion, weshalb ihre Zellen einen Strich zeigen.
- Jeder Werkzeugname in der Tabelle verlinkt auf den eigenen PromptQuorum-Test, in dem Installationsschritte und Grenzen behandelt werden.
📍 In einem Satz
Der lokale Modellbetrieb umfasst drei Arten von Werkzeugen — Inferenz-Engines, Runtimes und Manager sowie Router und Gateways —, daher werden die 46 Werkzeuge im PromptQuorum-Verzeichnis jeweils innerhalb ihrer Art verglichen, anhand einer Tabelle, die aus denselben Werkzeugdaten erzeugt wird wie der jeweilige Test des Werkzeugs.
💬 In einfachen Worten
Eine Engine ist der Teil, der das Modell tatsächlich ausführt, eine Runtime oder ein Manager lädt Modelle für Sie herunter und startet sie, und ein Gateway leitet Anfragen zwischen ihnen weiter. Eine Engine und ein Gateway bei der GPU-Unterstützung zu vergleichen, ergibt keinen Sinn, deshalb vergleicht dieser Leitfaden nur Gleichartiges.
So haben wir verglichen
Die Fakten jedes Werkzeugs — Preis, Lizenz, Plattformen, Hardware-Anforderungen und kategoriespezifische Merkmale — werden einmal im Verzeichniseintrag des Werkzeugs gespeichert. Die Vergleichstabelle unten wird aus diesen Einträgen erzeugt, und der Test des Werkzeugs stützt sich auf denselben Eintrag, sodass beide keine unterschiedlichen Werte nennen können.
Kategoriespezifische Merkmale (zum Beispiel OpenAI-kompatible API oder AMD-GPU-Unterstützung) wurden der offiziellen README oder Website jedes Projekts entnommen und am genauen Wortlaut dort geprüft. Wo die Dokumentation schweigt, zeigt die Tabelle einen Strich statt einer Vermutung; wo eine Aussage eingeschränkt ist (experimentell, geplant oder nur über ein separates Projekt verfügbar), wird das Merkmal aus der Tabelle weggelassen und stattdessen im Test des Werkzeugs behandelt.
In der Tabelle stehen nur Werkzeuge mit eigenem PromptQuorum-Test. Werkzeuge, die nur als API-Server aufgeführt sind (h2oGPT, Tabby und OpenAI Edge TTS), werden in ihren eigenen Kategorien verglichen. Der Vergleich listet Werkzeuge auf, die auf Ihrer eigenen Hardware laufen; er erstellt keine Rangfolge, weil das passende Werkzeug von Ihrer Anforderung abhängt.
Vergleichstabelle
Wählen Sie unten eine Werkzeugart und lesen Sie dann quer durch eine Zeile. Klicken Sie auf einen Werkzeugnamen, um den vollständigen PromptQuorum-Test zu öffnen.
| Werkzeug | Preis | Lizenz | Plattformen | Ausführung | Hardware | Version | OpenAI-kompatible API | NVIDIA-GPU | Apple Silicon | AMD-GPU | CPU-Inferenz | Multi-GPU / Multi-Node | Test | Produktlink · offengelegt |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| candle-vllm | Kostenlos | MIT | macOS, Windows, Linux | Lokal | Je nach Modell unterschiedlich | v0.9.1 | Ja | Ja | Ja | — | — | Ja | Test lesen → | candle-vllm |
| claude-code-local | Kostenlos | MIT | macOS | Lokal | Je nach Modell unterschiedlich | v0.3.0 | — | — | Ja | — | — | — | Test lesen → | claude-code-local |
| ExLlamaV2 | Kostenlos | MIT | Windows, Linux | Lokal | 8 GB VRAM | v0.3.2 | — | Ja | — | — | — | Ja | Test lesen → | ExLlamaV2 |
| exo | Kostenlos | Apache-2.0 | macOS, Linux | Lokal | Je nach Modell unterschiedlich | — | Ja | — | Ja | — | Ja | Ja | Test lesen → | exo |
| KoboldCpp | Kostenlos | AGPL-3.0 | Windows, Linux, macOS | Lokal | Je nach Modell unterschiedlich | v1.121 | Ja | Ja | Ja | Ja | Ja | — | Test lesen → | KoboldCpp |
| KServe | Kostenlos | Apache-2.0 | Linux | Lokal | CPU genügt | v0.20.0 | Ja | — | — | — | — | Ja | Test lesen → | KServe |
| llama.cpp | Kostenlos | MIT | macOS, Windows, Linux | Lokal | Je nach Modell unterschiedlich | v0.4.1 | Ja | Ja | Ja | Ja | Ja | — | Test lesen → | llama.cpp |
| Llamafile | Kostenlos | Apache-2.0 | macOS, Windows, Linux | Lokal | Je nach Modell unterschiedlich | 0.10.6 | — | — | — | — | — | — | Test lesen → | Llamafile |
| LMDeploy | Kostenlos | Apache-2.0 | Linux | Lokal | Je nach Modell unterschiedlich | v0.17.0 | — | Ja | — | — | — | Ja | Test lesen → | LMDeploy |
| LocalAI | Kostenlos | MIT | macOS, Windows, Linux | Lokal | Je nach Modell unterschiedlich | — | Ja | Ja | Ja | Ja | Ja | Ja | Test lesen → | LocalAI |
| LoRAX | Kostenlos | Apache-2.0 | Linux | Lokal | Je nach Modell unterschiedlich | v0.12.1 | Ja | Ja | — | — | — | Ja | Test lesen → | LoRAX |
| Lucebox | Kostenlos | Apache-2.0 | Linux | Lokal | Je nach Modell unterschiedlich | — | Ja | Ja | — | Ja | — | Ja | Test lesen → | Lucebox |
| MLC LLM | Kostenlos | Apache-2.0 | macOS, Windows, Linux, iOS, Android | Lokal | Je nach Modell unterschiedlich | — | Ja | Ja | Ja | Ja | — | — | Test lesen → | MLC LLM |
| MLX-LM | Kostenlos | MIT | macOS | Lokal | Je nach Modell unterschiedlich | — | — | — | Ja | — | — | Ja | Test lesen → | MLX-LM |
| mlx-serve | Kostenlos | MIT | macOS | Lokal | Je nach Modell unterschiedlich | v26.9.4 | Ja | — | Ja | — | — | — | Test lesen → | mlx-serve |
| mlxcel | Kostenlos | Apache-2.0 | macOS, Linux | Lokal | Je nach Modell unterschiedlich | v0.7.0 | Ja | Ja | Ja | — | — | Ja | Test lesen → | mlxcel |
| NVIDIA Dynamo | Kostenlos | Apache-2.0 | Linux | Lokal | Je nach Modell unterschiedlich | v1.4–v1.6 | Ja | — | — | — | — | Ja | Test lesen → | NVIDIA Dynamo |
| Ollama | Kostenlos | MIT | macOS, Windows, Linux | Lokal | Je nach Modell unterschiedlich | — | — | — | — | — | — | — | Test lesen → | Ollama |
| OlliteRT | Kostenlos | Apache-2.0 | Android | Lokal | CPU genügt | — | Ja | — | — | — | Ja | — | Test lesen → | OlliteRT |
| oMLX | Kostenlos | Apache-2.0 | macOS | Lokal | Je nach Modell unterschiedlich | v0.6.4 | Ja | — | Ja | — | — | Ja | Test lesen → | oMLX |
| OpenLLM | Kostenlos | Apache-2.0 | — | Hybrid | Je nach Modell unterschiedlich | — | Ja | — | — | — | — | — | Test lesen → | OpenLLM |
| Rapid-MLX | Kostenlos | Apache-2.0 | macOS | Lokal | 8 GB RAM | — | Ja | — | Ja | — | — | — | Test lesen → | Rapid-MLX |
| SGLang | Kostenlos | Apache-2.0 | Linux | Lokal | Je nach Modell unterschiedlich | — | — | Ja | — | Ja | Ja | Ja | Test lesen → | SGLang |
| Shimmy | Kostenlos | Apache-2.0 | macOS, Windows, Linux | Lokal | Je nach Modell unterschiedlich | — | Ja | Ja | Ja | Ja | — | — | Test lesen → | Shimmy |
| SwiftLM | Kostenlos | MIT | macOS, iOS | Lokal | Je nach Modell unterschiedlich | — | Ja | — | Ja | — | — | — | Test lesen → | SwiftLM |
| TensorRT-LLM | Kostenlos | Apache-2.0 | Windows, Linux | Lokal | Je nach Modell unterschiedlich | — | — | Ja | — | — | — | — | Test lesen → | TensorRT-LLM |
| text-generation-webui | Kostenlos | AGPL-3.0 | Windows, Linux, macOS | Lokal | Je nach Modell unterschiedlich | — | Ja | Ja | Ja | Ja | Ja | — | Test lesen → | text-generation-webui |
| TurboFieldfare | Kostenlos | Apache-2.0 | macOS | Lokal | 2 GB RAM | — | — | — | Ja | — | — | — | Test lesen → | TurboFieldfare |
| vLLM | Kostenlos | Apache-2.0 | Linux | Lokal | Je nach Modell unterschiedlich | — | Ja | Ja | — | Ja | Ja | Ja | Test lesen → | vLLM |
| vllm-mlx | Kostenlos | Apache-2.0 | macOS | Lokal | Je nach Modell unterschiedlich | — | Ja | — | Ja | — | — | — | Test lesen → | vllm-mlx |
„—“ bedeutet, dass die eigene Dokumentation des Projekts es nicht angibt, nicht dass die Funktion fehlt. Die Werte stammen aus der offiziellen README oder Website des jeweiligen Projekts und werden erneut geprüft, wenn der Test eines Werkzeugs aktualisiert wird.
Inferenz-Engines: Die Unterschiede
- OpenAI-kompatible API. candle-vllm, NVIDIA Dynamo, exo, KoboldCpp, KServe, llama.cpp, LocalAI, LoRAX, Lucebox, MLC LLM, mlx-serve, mlxcel, OlliteRT, oMLX, OpenLLM, Rapid-MLX, Shimmy, SwiftLM, text-generation-webui, vllm-mlx und vLLM dokumentieren eine OpenAI-kompatible HTTP-API, sodass für die OpenAI-API geschriebene Apps auf sie zeigen können.
- NVIDIA-GPUs. candle-vllm, ExLlamaV2, KoboldCpp, llama.cpp, LMDeploy, LocalAI, LoRAX, Lucebox, MLC LLM, mlxcel, SGLang, Shimmy, TensorRT-LLM, text-generation-webui und vLLM dokumentieren die Unterstützung von NVIDIA-GPUs (CUDA).
- Apple Silicon. candle-vllm, claude-code-local, exo, KoboldCpp, llama.cpp, LocalAI, MLC LLM, MLX-LM, mlx-serve, mlxcel, oMLX, Rapid-MLX, Shimmy, SwiftLM, text-generation-webui, TurboFieldfare und vllm-mlx dokumentieren die Unterstützung von Apple Silicon, Metal oder MLX.
- AMD-GPUs. KoboldCpp, llama.cpp, LocalAI, Lucebox, MLC LLM, SGLang, Shimmy, text-generation-webui und vLLM dokumentieren die Unterstützung von AMD-GPUs.
- CPU-Inferenz. exo, KoboldCpp, llama.cpp, LocalAI, OlliteRT, SGLang, text-generation-webui und vLLM dokumentieren die Ausführung der Inferenz auf einer CPU.
- Multi-GPU und Multi-Node. candle-vllm, NVIDIA Dynamo, ExLlamaV2, exo, KServe, LMDeploy, LocalAI, LoRAX, Lucebox, MLX-LM, mlxcel, oMLX, SGLang und vLLM dokumentieren Multi-GPU-, Tensor-Parallel- oder Multi-Node-Inferenz.
- Lizenz. Die meisten Engines hier stehen unter Apache-2.0 (19 Werkzeuge) oder MIT (9); KoboldCpp und text-generation-webui stehen unter AGPL-3.0. Copyleft-Lizenzen knüpfen Bedingungen an die Weitergabe veränderter Versionen — siehe KI-Tool-Lizenzen erklärt.
Runtimes und Manager: Die Unterschiede
- OpenAI-kompatible API. Docker Model Runner, Foundry Local, GPUStack, Jan, Lemonade und Osaurus dokumentieren eine OpenAI-kompatible API.
- Desktop-App. GPT4All, Jan, LM Studio, Osaurus und Ypipe dokumentieren eine installierbare Desktop-App.
- Integrierte Modellbibliothek. Foundry Local, GPUStack, Jan, Lemonade, LM Studio und Ollama dokumentieren eine integrierte Möglichkeit, Modelle zu finden und herunterzuladen.
- Headless- oder Servermodus. DreamServer, GPUStack, Lemonade und Osaurus dokumentieren den Betrieb als Hintergrunddienst oder Server ohne grafische Oberfläche.
- Lizenz und Preis. Vier Runtimes hier stehen unter Apache-2.0 und vier unter MIT. LM Studio und Docker Model Runner sind proprietär (LM Studio ist kostenlos nutzbar; Docker Model Runner ist in Docker Desktop enthalten), Msty ist Closed Source mit kostenloser Stufe, und RunAnywhere und YPipe verwenden eigene oder nicht dokumentierte Bedingungen — prüfen Sie den jeweiligen Test.
Router und Gateways: Die Unterschiede
- OpenAI-kompatibler Endpunkt. AIClient2API und litellm dokumentieren einen OpenAI-kompatiblen Endpunkt.
- Routing zu lokalen Modellen. litellm dokumentiert lokale oder selbst gehostete Modelle (etwa Ollama) unter seinen unterstützten Anbietern.
- Fallback und Lastverteilung. AIClient2API, ClawRouter und litellm dokumentieren Fallback, Wiederholungsversuche oder Lastverteilung über Modelle oder Anbieter hinweg.
- Lizenz. Zwei der vier stehen unter MIT, eines unter GPL-3.0 und eines unter Apache-2.0.
Was dieser Vergleich nicht leisten kann
- Er vergleicht dokumentierte Fähigkeiten, nicht die Leistung. Er sagt nichts über Token pro Sekunde, Speicherverbrauch oder Latenz — PromptQuorum hat sie für diese Werkzeuge nicht gemessen, und sie hängen stark von Ihrer Hardware und Ihrem Modell ab.
- Striche sind Lücken in der von uns geprüften Dokumentation, keine negativen Befunde. Manche Werkzeuge unterstützen möglicherweise eine Funktion, die ihre README nicht erwähnt; das zeigt sich besonders bei einigen weit verbreiteten Werkzeugen mit kurzen READMEs, die wenig aussagen (zum Beispiel die Engine-Funktionen von Ollama).
- Die Hardware-Unterstützung entspricht den Angaben der Dokumentation und ist keine Garantie für ein gutes Nutzungserlebnis auf dieser Hardware; die tatsächlichen Anforderungen finden Sie im Test des Werkzeugs.
- Werkzeuge ändern sich schnell. Der Test jedes Werkzeugs nennt die Version, gegen die er geprüft wurde, und dieser Leitfaden wird aktualisiert, wenn ein Test aktualisiert wird.
Häufig gestellte Fragen
Was ist der Unterschied zwischen einer Inferenz-Engine, einer Runtime und einem Gateway?
Eine Inferenz-Engine führt das Modell auf Ihrer Hardware aus (zum Beispiel llama.cpp oder vLLM). Eine Runtime oder ein Manager lädt Modelle herunter und führt sie für Sie aus, oft mit einer Desktop-App oder einer Modellbibliothek (zum Beispiel Ollama oder LM Studio). Ein Router oder Gateway sitzt vor einem oder mehreren Modellen oder Anbietern und leitet Anfragen weiter. Sie erfüllen unterschiedliche Aufgaben und werden deshalb getrennt verglichen.
Was bedeutet ein Strich in der Vergleichstabelle?
Er bedeutet, dass die eigene Dokumentation des Projekts dieses Merkmal nicht angibt. Er bedeutet nicht, dass die Funktion fehlt; prüfen Sie den Test des Werkzeugs oder sein Repository.
Warum steht Ollama in zwei Gruppen?
Ollama ist sowohl eine Inferenz-Engine als auch eine Runtime, die Modelle verwaltet, und wird deshalb unter beiden geführt. Seine README nennt nur wenige der hier verglichenen Merkmale, daher zeigen viele seiner Zellen einen Strich.
Hat eines dieser Werkzeuge einen Affiliate-Link?
Nein. PromptQuorum hat zum Zeitpunkt der Erstellung mit keinem Werkzeug in diesem Vergleich eine Affiliate-Beziehung, und kein Link hier bringt eine Provision.
Wie oft wird dieser Vergleich aktualisiert?
Er wird zweimal im Jahr aktualisiert sowie immer dann, wenn der Test eines der aufgeführten Werkzeuge aktualisiert wird, weil die Tabelle aus denselben Daten wie diese Tests erzeugt wird.
Quellen
- Die offizielle README oder Website jedes Werkzeugs, aufgeführt im jeweiligen PromptQuorum-Test (verlinkt in der Vergleichstabelle).
- PromptQuorum-Verzeichnis lokaler KI-Apps — der Datensatz, aus dem jede Zeile der Tabelle erzeugt wird.
- KI-Tool-Lizenzen erklärt — was die oben genannten Lizenzfamilien bedeuten.