Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/LiteLLM Review 2026: Ein Gateway für über 100 LLM-Anbieter-APIs
Overview & Reference

LiteLLM Review 2026: Ein Gateway für über 100 LLM-Anbieter-APIs

·12 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

LiteLLM (github.com/BerriAI/litellm) ist ein Open-Source-Gateway, mit dem Ihr Code über 100 LLM-Anbieter-APIs durch eine einzige OpenAI-kompatible Schnittstelle aufrufen kann, statt für jeden Anbieter separaten Integrationscode zu schreiben. Es gibt ein Python-SDK (pip install litellm) für die direkte Nutzung im Anwendungscode sowie einen selbst gehosteten Proxy-Server mit einem Admin-Dashboard für virtuelle Schlüssel, gedacht für Teams, die zentrales Routing, Kostenverfolgung und Rate-Limiting über mehrere Apps und Nutzer hinweg wollen. Das Kern-Repository steht laut eigener LICENSE-Datei unter der MIT-Lizenz, mit einer separaten Enterprise-Lizenz-Ausnahme, die ausschließlich für das Unterverzeichnis enterprise/ gilt — für diese Review direkt anhand der LICENSE-Datei des Repositorys geprüft. Stand dieser Review zeigt GitHub rund 58.663 Sterne und 11.415 Forks.

LiteLLM (github.com/BerriAI/litellm, Dokumentation auf docs.litellm.ai) ist ein Open-Source-LLM-Gateway, das Ihrem Code eine einzige OpenAI-kompatible Schnittstelle für den Aufruf von über 100 verschiedenen Anbieter-APIs bietet — OpenAI, Anthropic, Google Gemini, AWS Bedrock, Azure, Ollama und viele weitere — statt für jeden Anbieter separaten Integrationscode zu schreiben. Es gibt zwei Zugangswege: ein importierbares Python-SDK (pip install litellm) und einen selbst gehosteten Proxy-Server mit Admin-Dashboard, bereitstellbar über Docker, Helm, AWS ECS Fargate oder Google Cloud Run. Diese Review zeigt, was LiteLLM tatsächlich leistet, wie man beide Modi installiert und betreibt, wie die Lizenzierung aussieht (die nicht einfach „MIT" für das gesamte Repository ist), und wie es sich zu vLLM, LocalAI und gehosteten Routing-Diensten wie OpenRouter verhält.

LiteLLM Review 2026: Ein Gateway für über 100 LLM-Anbieter-APIs

Wichtigste Erkenntnisse

  • Open Source auf GitHub (BerriAI/litellm); Stand dieser Review rund 58.663 Sterne und 11.415 Forks
  • Das Kern-Repository steht laut eigener LICENSE-Datei unter der MIT-Lizenz; eine separate Lizenz gilt ausschließlich für das Unterverzeichnis enterprise/, für diese Review direkt anhand der LICENSE-Datei geprüft
  • Zwei Produkte: das Python-SDK litellm (pip install litellm) für den direkten Aufruf von Anbietern aus dem Code heraus, sowie der LiteLLM Proxy Server (`pip install 'litellm[proxy]'` oder Docker) als selbst gehostetes Gateway mit Admin-Dashboard
  • Vereint über 100 Anbieter-APIs (OpenAI, Anthropic, Google Gemini, AWS Bedrock, Azure OpenAI, Ollama und weitere) hinter einem einheitlichen Anfrage-/Antwortformat, laut eigenem README des Projekts
  • Im README und auf der Doku-Seite dokumentierte Funktionen: Load Balancing, Routing, Fallback/Failover, Budgets pro Schlüssel und pro Nutzer, Rate-Limiting, Request-Caching und Ausgaben-Protokollierung
  • Keine GPU nötig — LiteLLM leitet Anfragen weiter, statt Modellgewichte auszuführen; die produktive Bereitstellung des Proxys benötigt PostgreSQL (Schlüssel, Ausgabendaten) und Redis (instanzübergreifendes Rate-Limiting), keine GPU
  • Bereitstellbar über Docker (docker.litellm.ai/berriai/litellm), Helm-Charts, ein offizielles AWS-ECS-Fargate-Terraform-Modul, ein offizielles Google-Cloud-Run-Terraform-Modul oder Ein-Klick-Buttons für Render/Railway
  • Eine separate kostenpflichtige Enterprise-Stufe existiert unter litellm.ai/enterprise mit SSO, priorisierten Feature-Wünschen und dediziertem Support — SDK und Proxy bleiben ohne sie vollständig nutzbar

📍 In einem Satz

LiteLLM ist ein Open-Source-Gateway, das Anwendungen über eine einzige OpenAI-kompatible Schnittstelle Zugriff auf über 100 LLM-Anbieter-APIs gibt — verfügbar als Python-SDK oder als selbst gehosteter Proxy-Server mit Routing, Fallback, Kostenverfolgung und Rate-Limiting.

💬 In einfachen Worten

Wenn Ihre App heute mit OpenAI sprechen soll und morgen mit Anthropic oder einem lokalen Ollama-Modell, müssten Sie normalerweise den Integrationscode für jeden neu schreiben. LiteLLM sitzt dazwischen und übersetzt die API jedes Anbieters in dasselbe OpenAI-ähnliche Format, sodass Ihr Code nur ein Format lernen muss — und die Proxy-Variante liefert zusätzlich ein Dashboard, das zeigt, wer wie viel ausgibt.

📌Hinweis: Diese Review ist der vertiefende Begleittext zu LiteLLMs Eintrag im Local LLM Software Directory — dort sehen Sie auf einen Blick, wie LiteLLM im Vergleich zu Dutzenden anderer lokaler KI-Tools abschneidet.

Was ist LiteLLM?

LiteLLM ist ein Gateway, das ein einziges OpenAI-kompatibles Anfrageformat in Aufrufe an über 100 verschiedene LLM-Anbieter-APIs übersetzt. Das eigene GitHub-README beschreibt es als „the fastest, litest AI Gateway", aufgebaut mit einem Rust-Kern und einem Python-SDK darüber — ein Wandel gegenüber der reinen Python-Implementierung der früheren Projektjahre. Statt separaten Client-Code für die OpenAI-API, die Anthropic-API und einen lokalen Ollama-Server zu schreiben, ruft eine Anwendung LiteLLM einmal auf, und LiteLLM leitet die Anfrage an den für diesen Modellnamen konfigurierten Anbieter weiter.

  • Kernfunktion: eine Anfrage im OpenAI-Format chat/completions (oder im nativen Format des Zielanbieters) entgegennehmen, an den konfigurierten Anbieter weiterleiten und eine normalisierte Antwort zurückgeben
  • Zwei Zugangswege: das Python-SDK litellm, direkt in den Code einer Anwendung eingebunden, sowie der LiteLLM Proxy Server, ein eigenständiger Dienst, den andere Anwendungen per HTTP aufrufen
  • Entwickler: BerriAI, die Organisation hinter dem Repository github.com/BerriAI/litellm
  • Keine Modell-Laufzeitumgebung: LiteLLM lädt selbst keine Modellgewichte und führt keine Inferenz aus — es leitet Anfragen an Anbieter weiter, die das tun, einschließlich Cloud-APIs und lokaler Server wie Ollama oder vLLM
  • Produktionsreife Proxy-Funktionen laut Dokumentation: virtuelle API-Schlüssel, Ausgabenbudgets pro Schlüssel und pro Nutzer, Rate-Limiting, Load Balancing über mehrere Deployments desselben Modells sowie automatischer Fallback bei Anbieterfehlern

Was können Sie mit LiteLLM tun?

LiteLLMs Funktionsumfang deckt Anfrage-Routing, Kostenkontrolle und Zuverlässigkeit ab — die Teile des Betriebs einer LLM-gestützten Anwendung, die mit mehr Anbietern und mehr Nutzern schwieriger werden, laut LiteLLMs eigener Dokumentation.

  • Einheitliche API-Oberfläche — eine Anfrage im OpenAI-Format senden; LiteLLM übersetzt sie in das native Format des jeweiligen Anbieters und normalisiert die Antwort zurück
  • Routing und Load Balancing — Traffic über mehrere Deployments desselben Modells verteilen (zum Beispiel mehrere Azure-OpenAI-Regionen), um einen einzelnen Ausfallpunkt oder eine Rate-Limit-Obergrenze zu vermeiden
  • Fallback- und Retry-Logik — eine fehlgeschlagene Anfrage automatisch bei einem anderen Anbieter oder Modell-Deployment erneut versuchen, statt den Fehler an den Endnutzer durchzureichen
  • Kostenverfolgung und Budgets — Ausgaben pro API-Schlüssel, Nutzer oder Team protokollieren und feste Budgetgrenzen setzen, die weitere Anfragen blockieren, sobald sie überschritten sind
  • Rate-Limiting — Anfragen pro Minute bzw. Token pro Schlüssel oder Nutzer begrenzen, über mehrere Proxy-Instanzen hinweg per Redis durchgesetzt
  • Guardrails und Logging — Hooks für Content-Moderation und Observability-Integrationen sowie strukturiertes Anfrage-/Antwort-Logging für Audits
  • Admin-Dashboard — eine Weboberfläche (unter /ui auf dem Proxy), um virtuelle Schlüssel zu verwalten, Ausgaben einzusehen und Modelle zu konfigurieren, ohne die Konfigurationsdatei direkt zu bearbeiten
  • Funktioniert auch mit lokalen Laufzeitumgebungen — dieselbe Routing-Schicht, die OpenAI oder Anthropic aufruft, kann ebenso auf einen lokalen Ollama- oder vLLM-Endpunkt zeigen, sodass ein Gateway Cloud- und lokale Modelle mischen kann

Anwendungsbeispiele: Zwei Wege, LiteLLM zu nutzen

Dies sind konkrete Arbeitsabläufe, aufgebaut auf den oben dokumentierten Installationswegen von LiteLLM — keine hypothetischen Anwendungsfälle.

LiteLLM installieren: SDK, Proxy und Docker

LiteLLM ist ein Framework und selbst gehostetes Gateway, keine herunterladbare Endnutzer-App — es gibt keinen Installer aus einem App Store. Unten stehen die tatsächlichen Installations- und Schnellstart-Befehle laut LiteLLMs eigener Dokumentation und Docker-Schnellstart; prüfen Sie vor jedem Deployment die Doku direkt, da sich genaue Flags und Image-Tags zwischen Releases ändern können.

Python-SDK

Befehl:
pip install litellm (oder uv add litellm)

Proxy Server (pip)

Befehl:
`pip install 'litellm[proxy]', dann litellm --model gpt-4o`

Proxy Server (Docker)

Befehl:
docker run -v $(pwd)/config.yaml:/app/config.yaml -e OPENAI_API_KEY=<key> -e LITELLM_MASTER_KEY=sk-1234 -p 4000:4000 docker.litellm.ai/berriai/litellm:latest --config /app/config.yaml

Helm (Kubernetes)

Befehl:
helm install litellm oci://ghcr.io/berriai/litellm-helm -f values.yaml

AWS ECS Fargate

Befehl:
Offizielles Terraform-Modul BerriAI/litellm/aws (stellt VPC, Aurora PostgreSQL, ElastiCache Redis, ALB, ECS bereit)

Google Cloud Run

Befehl:
Offizielles Terraform-Modul BerriAI/litellm/google (stellt Cloud SQL, Memorystore Redis, GCS, HTTPS-Load-Balancer bereit)

Der Proxy verwendet standardmäßig Port 4000, mit dem Admin-Dashboard unter http://localhost:4000/ui (Standard-Login: Benutzername admin, Passwort entspricht Ihrem LITELLM_MASTER_KEY). Eine minimale config.yaml benötigt ein model_list-Array, das einen model_name auf litellm_params (den tatsächlichen Anbieter-Modellstring plus dessen API-Schlüssel) abbildet — ein vollständiges Beispiel finden Sie im Proxy-Schnellstart. Render und Railway bieten laut LiteLLMs Deployment-Doku ebenfalls Ein-Klick-Buttons für den Proxy an.

LiteLLM-Preise: Ist LiteLLM wirklich kostenlos?

Das Open-Source-SDK und der Proxy Server sind kostenlos — Sie zahlen nur für die zugrunde liegenden Anbieter-API-Aufrufe, die Sie über LiteLLM leiten, plus Ihre eigenen Hosting-Kosten. LiteLLM selbst berechnet für den Open-Source-Weg weder pro Anfrage noch pro Token etwas. Eine separate, kostenpflichtige LiteLLM-Enterprise-Stufe existiert unter litellm.ai/enterprise mit SSO, priorisierten Feature-Wünschen und dediziertem Support, laut der eigenen Projektseite — diese Review fand keine veröffentlichten Enterprise-Preise und empfiehlt, für ein Angebot direkt Kontakt mit LiteLLM aufzunehmen.

  • Open-Source-SDK und Proxy Server: keine Lizenzgebühr, Kern-Repository unter MIT-Lizenz (siehe Lizenzhinweis unten)
  • Sie zahlen weiterhin an den Anbieter, an den geroutet wird — LiteLLM senkt nicht die API-Preise von OpenAI, Anthropic oder Bedrock, es vereint und protokolliert sie nur
  • Das Selbst-Hosten des Proxys hat eigene Infrastrukturkosten: einen Server oder Container-Host, plus PostgreSQL und Redis für den produktiven Einsatz
  • LiteLLM Enterprise ergänzt SSO, priorisierten Support und weitere Business-Funktionen auf demselben Open-Source-Kern, laut litellm.ai/enterprise — Preise sind nicht veröffentlicht und erfordern Kontakt mit dem Unternehmen

LiteLLM vs. vLLM vs. LocalAI

LiteLLM, vLLM und LocalAI lösen unterschiedliche Probleme, die leicht verwechselt werden, weil alle drei eine OpenAI-kompatible API bereitstellen. LiteLLM leitet Anfragen an anderswo laufende Modelle weiter; vLLM und LocalAI führen die Modellgewichte selbst aus.

Aspekt
LiteLLM
vLLM
LocalAI
Was es tutLeitet Anfragen an Anbieter weiterFührt Modelle selbst ausFührt Modelle selbst aus
Führt Modellgewichte ausNeinJaJa
LizenzMIT (+ Enterprise-Ausnahme)Apache-2.0MIT
GPU nötigNein (nur Router)Ja, für EchtzeitbetriebKommt auf Modell an
Am besten fürMulti-Anbieter-Routing & KostenverfolgungHochdurchsatz-Betrieb selbst gehostetEinzelner selbst gehosteter OpenAI-API-Server

Diese Tools werden meist zusammen eingesetzt, nicht als Ersatz füreinander: LiteLLM kann als Routing- und Kostenverfolgungs-Schicht vor einem vLLM- oder LocalAI-Deployment stehen, während vLLM oder LocalAI die eigentliche Modell-Inferenz übernimmt. Details zu diesen beiden finden Sie im vLLM-Erklärartikel und LocalAI-Erklärartikel.

Für wen ist LiteLLM geeignet?

Ob LiteLLM passt, hängt davon ab, ob Ihre Anwendung bereits mehr als einen LLM-Anbieter aufruft oder dies plant — eine Ein-Anbieter-App profitiert weniger von einer Routing-Schicht.

LiteLLM vs. andere Gateways und Frameworks

Stand dieser Review ist LiteLLM das erste Router-/Gateway-Tool mit eigener ausführlicher Review in PromptQuorums Local LLM Software Directory — es gibt noch kein zweites Tool im selben Segment (Router/Gateway) für einen direkten Vergleich. Die nächstliegenden sinnvollen Vergleiche stammen stattdessen von benachbarten Tools im selben „Run & Serve"-Teil des Directorys, ergänzt um eine bekannte gehostete Alternative außerhalb des Directorys.

  • vLLM — eine selbst gehostete Inferenz-Engine, die tatsächlich Modellgewichte ausführt (GPU erforderlich); wird meist zusammen mit LiteLLM eingesetzt statt als Konkurrenz, wobei LiteLLM als Routing-Schicht vor einem oder mehreren vLLM-Deployments steht.
  • LocalAI — ein selbst gehosteter, OpenAI-kompatibler API-Server zum lokalen Betrieb offener Modelle; löst ein anderes Problem als LiteLLM (Ausführen vs. Routing), bietet aber eine ähnliche OpenAI-Format-API — eine häufige Verwechslungsquelle zwischen beiden.
  • LangChain — ein Anwendungs-Framework zum Bauen LLM-gestützter Apps (Chains, Agenten, Memory); kann LiteLLM (oder jeden Anbieter direkt) als Modellzugriffsschicht nutzen, statt zu ersetzen, was LiteLLM tut.
  • OpenRouter (extern, nicht im Directory von PromptQuorum) — ein gehosteter, verwalteter Routing-Dienst für einen ähnlichen Multi-Anbieter-Anwendungsfall wie LiteLLMs Proxy, jedoch als Drittanbieter-Dienst, den Sie aufrufen, statt Infrastruktur, die Sie selbst betreiben; ein direkter Vergleich lohnt sich, wenn Sie zero-ops-Routing statt eines eigenen Proxys wollen.

Häufige Fehler bei der Bewertung von LiteLLM

Die meiste Verwirrung um LiteLLM entsteht, wenn es mit einer Modell-Serving-Engine verwechselt wird oder wenn seine Lizenz zu stark vereinfacht wird.

Häufig gestellte Fragen

Was ist LiteLLM?

LiteLLM (github.com/BerriAI/litellm) ist ein Open-Source-Gateway, mit dem Anwendungen über eine einzige OpenAI-kompatible Schnittstelle auf über 100 LLM-Anbieter-APIs zugreifen können, verfügbar als Python-SDK oder als selbst gehosteter Proxy-Server mit Routing, Kostenverfolgung und Rate-Limiting.

Ist LiteLLM kostenlos?

Das Open-Source-SDK und der Proxy Server sind kostenlos — Sie zahlen nur für die zugrunde liegenden Anbieter-API-Aufrufe und Ihr eigenes Hosting. Eine separate kostenpflichtige LiteLLM-Enterprise-Stufe ergänzt SSO und dedizierten Support; die Preise sind nicht veröffentlicht und erfordern direkten Kontakt mit LiteLLM.

Welche Lizenz verwendet LiteLLM?

Das Kern-Repository steht laut eigener LICENSE-Datei unter der MIT-Lizenz. Eine separate Lizenz gilt ausschließlich für das Unterverzeichnis enterprise/, unter enterprise/LICENSE — für diese Review direkt anhand der LICENSE-Datei des Repositorys geprüft.

Braucht LiteLLM eine GPU?

Nein. LiteLLM ist ein Anfrage-Router, keine Modell-Inferenz-Engine — es leitet Aufrufe an Anbieter (Cloud-APIs oder lokale Laufzeitumgebungen wie Ollama) weiter, statt selbst Modellgewichte auszuführen, und läuft daher problemlos auf reiner CPU-Hardware.

Wie installiere ich LiteLLM?

Für das Python-SDK: pip install litellm. Für den selbst gehosteten Proxy: `pip install 'litellm[proxy]', dann litellm --model gpt-4o, oder das Docker-Image docker.litellm.ai/berriai/litellm:latest mit gemounteter config.yaml` ausführen. Weitere Optionen wie Helm, AWS ECS Fargate und Google Cloud Run finden Sie in der Installationstabelle oben.

Benötigt der LiteLLM-Proxy eine Datenbank?

Für den produktiven Einsatz ja — PostgreSQL speichert virtuelle Schlüssel und Ausgabendaten dauerhaft, und Redis hält das Rate-Limiting über mehrere Proxy-Instanzen hinweg konsistent, laut LiteLLMs eigener Deployment-Dokumentation. Ein schneller lokaler Test läuft auch ohne beides, verliert dann aber diese Funktionen.

Kann LiteLLM an ein lokal gehostetes Modell routen?

Ja. Dieselbe model_list in der config.yaml, die auf OpenAI oder Anthropic zeigt, kann ebenso auf einen lokalen Ollama- oder vLLM-Endpunkt zeigen, sodass ein Gateway Cloud- und lokale Modelle mischen kann.

Wie schneidet LiteLLM im Vergleich zu OpenRouter ab?

Beide vereinen mehrere LLM-Anbieter hinter einer Schnittstelle. LiteLLM ist selbst gehostete Infrastruktur, die Sie selbst betreiben (Open-Source-Proxy oder SDK); OpenRouter ist ein gehosteter Drittanbieter-Routing-Dienst, den Sie aufrufen, statt einen eigenen zu betreiben. Die Wahl hängt davon ab, ob Sie zero-ops (OpenRouter) oder volle Kontrolle ohne Aufschlag pro Anfrage durch einen Router-Anbieter (selbst gehostetes LiteLLM) wollen.

Wer entwickelt LiteLLM?

BerriAI, die Organisation hinter dem Repository github.com/BerriAI/litellm, das Stand dieser Review rund 58.663 Sterne und 11.415 Forks aufweist.

Quellen

← Zurück zu Lokale LLMs Pro