Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/LiteLLM en 2026 : une passerelle unique pour plus de 100 API LLM
Overview & Reference

LiteLLM en 2026 : une passerelle unique pour plus de 100 API LLM

·12 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

LiteLLM (github.com/BerriAI/litellm) est une passerelle open source qui permet à votre code d'appeler plus de 100 API de fournisseurs LLM via une seule interface compatible OpenAI, au lieu d'écrire du code d'intégration séparé pour chaque fournisseur. Le projet se décline en un SDK Python (pip install litellm) pour un usage direct dans une application, et un serveur proxy auto-hébergé avec tableau de bord de clés virtuelles, destiné aux équipes qui veulent un routage centralisé, un suivi des coûts et une limitation de débit sur plusieurs applications et utilisateurs. Le dépôt principal est sous licence MIT selon son propre fichier LICENSE, avec une exception de licence enterprise distincte qui s'applique uniquement au sous-répertoire enterprise/ — vérifié directement dans le fichier LICENSE du dépôt pour cet avis. Au moment de cet avis, GitHub affiche environ 58 663 étoiles et 11 415 forks.

LiteLLM (github.com/BerriAI/litellm, documentation sur docs.litellm.ai) est une passerelle LLM open source qui offre à votre code une interface unique compatible OpenAI pour appeler plus de 100 API de fournisseurs différents — OpenAI, Anthropic, Google Gemini, AWS Bedrock, Azure, Ollama et bien d'autres — au lieu d'écrire du code d'intégration séparé pour chacun. Le projet se présente sous deux formes : un SDK Python importable (pip install litellm) et un serveur proxy auto-hébergé avec tableau de bord d'administration, déployable via Docker, Helm, AWS ECS Fargate ou Google Cloud Run. Ce guide pratique détaille ce que fait réellement LiteLLM, comment installer et exploiter les deux modes, sa licence (qui n'est pas simplement « MIT » pour l'ensemble du dépôt), et sa place face à vLLM, LocalAI et des services de routage hébergés comme OpenRouter.

LiteLLM en 2026 : une passerelle unique pour plus de 100 API LLM

Points clés

  • Open source sur GitHub (BerriAI/litellm) ; environ 58 663 étoiles et 11 415 forks au moment de cet avis
  • Le dépôt principal est sous licence MIT selon son propre fichier LICENSE ; une licence distincte s'applique uniquement au sous-répertoire enterprise/, vérifié directement dans le fichier LICENSE pour cet avis
  • Deux produits : le SDK Python litellm (pip install litellm) pour appeler les fournisseurs directement depuis le code, et le LiteLLM Proxy Server (`pip install 'litellm[proxy]'`, ou Docker) pour une passerelle auto-hébergée avec tableau de bord d'administration
  • Unifie plus de 100 API de fournisseurs (OpenAI, Anthropic, Google Gemini, AWS Bedrock, Azure OpenAI, Ollama et bien d'autres) derrière un format unique de requête/réponse, selon le README du projet
  • Fonctionnalités documentées dans le README et le site de documentation : répartition de charge, routage, secours/basculement, budgets par clé et par utilisateur, limitation de débit, mise en cache des requêtes et journalisation des dépenses
  • Aucun GPU requis — LiteLLM transmet les requêtes au lieu d'exécuter les poids du modèle ; le déploiement en production du proxy nécessite PostgreSQL (clés, données de dépenses) et Redis (limitation de débit inter-instances), pas de GPU
  • Déployable via Docker (docker.litellm.ai/berriai/litellm), des charts Helm, un module Terraform officiel pour AWS ECS Fargate, un module Terraform officiel pour Google Cloud Run, ou des boutons de déploiement en un clic Render/Railway
  • Une offre commerciale Enterprise distincte existe sur litellm.ai/enterprise, couvrant SSO, demandes de fonctionnalités prioritaires et support dédié — le SDK et le proxy open source restent pleinement utilisables sans elle

📍 En une phrase

LiteLLM est une passerelle open source qui permet aux applications d'appeler plus de 100 API de fournisseurs LLM via une seule interface compatible OpenAI, disponible comme SDK Python ou comme serveur proxy auto-hébergé avec routage, secours, suivi des coûts et limitation de débit.

💬 En termes simples

Si votre application doit parler à OpenAI aujourd'hui et à Anthropic ou à un modèle Ollama local demain, il faudrait normalement réécrire le code d'intégration à chaque fois. LiteLLM se place au milieu et traduit l'API de chaque fournisseur dans le même format proche d'OpenAI, donc votre code n'a besoin d'apprendre qu'un seul format — et la version proxy ajoute un tableau de bord pour suivre qui dépense quoi.

📌Remarque: Cet avis est le complément approfondi de la fiche LiteLLM dans le Local LLM Software Directory — consultez cette page pour comparer LiteLLM en un coup d'œil à des dizaines d'autres outils d'IA locale.

Qu'est-ce que LiteLLM ?

LiteLLM est une passerelle qui traduit un format de requête unique compatible OpenAI en appels vers plus de 100 API de fournisseurs LLM différents. Son propre README GitHub le décrit comme « la passerelle IA la plus rapide et la plus légère », construite avec un cœur en Rust et un SDK Python par-dessus — une évolution par rapport à l'implémentation purement Python des premières années du projet. Plutôt que d'écrire du code client séparé pour l'API OpenAI, l'API Anthropic et un serveur Ollama local, une application appelle LiteLLM une seule fois, et LiteLLM transmet la requête au fournisseur configuré pour ce nom de modèle.

  • Fonction principale : recevoir une requête au format chat/completions d'OpenAI (ou au format natif du fournisseur cible), la transmettre au fournisseur configuré, et renvoyer une réponse normalisée
  • Deux modes d'accès : le SDK Python litellm, importé directement dans le code d'une application, et le LiteLLM Proxy Server, un service autonome que d'autres applications appellent via HTTP
  • Développeur : BerriAI, l'organisation derrière le dépôt github.com/BerriAI/litellm
  • Pas un moteur d'exécution de modèle : LiteLLM ne charge pas les poids du modèle et n'effectue pas d'inférence lui-même — il route les requêtes vers des fournisseurs qui le font, y compris des API cloud et des serveurs locaux comme Ollama ou vLLM
  • Fonctionnalités de niveau production selon la documentation : clés API virtuelles, budgets de dépenses par clé et par utilisateur, limitation de débit, répartition de charge entre plusieurs déploiements du même modèle, et basculement automatique en cas d'erreur d'un fournisseur

Que peut-on faire avec LiteLLM ?

L'ensemble des fonctionnalités de LiteLLM couvre le routage des requêtes, le contrôle des coûts et la fiabilité — les aspects de l'exploitation d'une application basée sur des LLM qui se compliquent à mesure qu'on ajoute des fournisseurs et des utilisateurs, selon la documentation de LiteLLM.

  • Surface API unifiée — envoyer une requête au format OpenAI ; LiteLLM la traduit dans le format natif du fournisseur du modèle cible, et normalise la réponse en retour
  • Routage et répartition de charge — répartir le trafic entre plusieurs déploiements du même modèle (par exemple plusieurs régions Azure OpenAI) pour éviter un point de défaillance unique ou un plafond de limitation de débit
  • Logique de secours et de nouvelle tentative — retenter automatiquement une requête échouée auprès d'un autre fournisseur ou déploiement de modèle plutôt que de renvoyer l'erreur à l'utilisateur final
  • Suivi des coûts et budgets — journaliser les dépenses par clé API, par utilisateur ou par équipe, et fixer des limites de budget strictes qui bloquent les requêtes suivantes une fois dépassées
  • Limitation de débit — plafonner les requêtes par minute/token par clé ou par utilisateur, appliqué de façon cohérente sur plusieurs instances de proxy via Redis
  • Garde-fous et journalisation — points d'ancrage pour la modération de contenu et les intégrations d'observabilité, plus une journalisation structurée des requêtes/réponses pour les audits
  • Tableau de bord d'administration — une interface web (servie sur /ui du proxy) pour gérer les clés virtuelles, consulter les dépenses et configurer les modèles sans modifier directement le fichier de configuration
  • Fonctionne aussi avec des runtimes locaux — la même couche de routage qui appelle OpenAI ou Anthropic peut tout aussi bien pointer vers un point de terminaison Ollama ou vLLM local, permettant à une passerelle de mélanger modèles cloud et modèles locaux

Exemples d'utilisation : deux façons d'utiliser LiteLLM

Voici des flux de travail concrets construits à partir des parcours d'installation documentés de LiteLLM ci-dessus — pas des cas d'usage hypothétiques.

Installer LiteLLM : SDK, proxy et Docker

LiteLLM est un framework et une passerelle auto-hébergée, pas une application téléchargeable pour l'utilisateur final — il n'y a pas d'installateur à récupérer sur une boutique d'applications. Voici les véritables commandes d'installation et de démarrage rapide, selon la documentation officielle de LiteLLM et son guide de démarrage Docker ; vérifiez toujours la documentation directement avant tout déploiement, car les options exactes et les tags d'image peuvent changer entre les versions.

SDK Python

Commande:
pip install litellm (ou uv add litellm)

Proxy Server (pip)

Commande:
`pip install 'litellm[proxy]' puis litellm --model gpt-4o`

Proxy Server (Docker)

Commande:
docker run -v $(pwd)/config.yaml:/app/config.yaml -e OPENAI_API_KEY=<clé> -e LITELLM_MASTER_KEY=sk-1234 -p 4000:4000 docker.litellm.ai/berriai/litellm:latest --config /app/config.yaml

Helm (Kubernetes)

Commande:
helm install litellm oci://ghcr.io/berriai/litellm-helm -f values.yaml

AWS ECS Fargate

Commande:
Module Terraform officiel BerriAI/litellm/aws (fournit VPC, Aurora PostgreSQL, ElastiCache Redis, ALB, ECS)

Google Cloud Run

Commande:
Module Terraform officiel BerriAI/litellm/google (fournit Cloud SQL, Memorystore Redis, GCS, load balancer HTTPS)

Le proxy utilise par défaut le port 4000, avec le tableau de bord d'administration sur http://localhost:4000/ui (identifiants par défaut : nom d'utilisateur admin, mot de passe égal à votre LITELLM_MASTER_KEY). Un config.yaml minimal nécessite un tableau model_list associant un model_name à des litellm_params (la chaîne de modèle réelle du fournisseur plus sa clé API) — voir le démarrage rapide du proxy pour un exemple complet. Render et Railway proposent aussi des boutons de déploiement en un clic pour le proxy, selon la documentation de déploiement de LiteLLM.

Tarifs LiteLLM : est-ce vraiment gratuit ?

Le SDK open source et le Proxy Server sont gratuits — vous ne payez que les appels API aux fournisseurs sous-jacents routés via LiteLLM, plus vos propres coûts d'hébergement. LiteLLM lui-même ne facture ni par requête ni par token pour la voie open source. Une offre payante distincte, LiteLLM Enterprise, existe sur litellm.ai/enterprise, couvrant SSO, demandes de fonctionnalités prioritaires et support dédié, selon le site du projet — cet avis n'a trouvé aucun tarif Enterprise publié et recommande de contacter directement LiteLLM pour un devis.

  • SDK open source et Proxy Server : aucun frais de licence, dépôt principal sous licence MIT (voir la remarque sur la licence ci-dessous)
  • Vous continuez à payer le fournisseur vers lequel vous routez — LiteLLM ne réduit pas les tarifs des API OpenAI, Anthropic ou Bedrock, il les unifie et les suit seulement
  • L'auto-hébergement du proxy a son propre coût d'infrastructure : un serveur ou un hébergeur de conteneurs, plus PostgreSQL et Redis pour un usage en production
  • LiteLLM Enterprise ajoute SSO, support prioritaire et d'autres fonctionnalités professionnelles au-dessus du même cœur open source, selon litellm.ai/enterprise — les tarifs ne sont pas publiés et nécessitent de contacter l'entreprise

LiteLLM vs. vLLM vs. LocalAI

LiteLLM, vLLM et LocalAI résolvent des problèmes différents que l'on confond facilement car les trois exposent une API compatible OpenAI. LiteLLM route les requêtes vers des modèles exécutés ailleurs ; vLLM et LocalAI exécutent eux-mêmes les poids du modèle.

Aspect
LiteLLM
vLLM
LocalAI
Ce que ça faitRoute les requêtes vers des fournisseursExécute les modèles lui-mêmeExécute les modèles lui-même
Exécute les poids du modèleNonOuiOui
LicenceMIT (+ exception enterprise)Apache-2.0MIT
GPU nécessaireNon (routeur uniquement)Oui, pour le service en temps réelSelon le modèle
Idéal pourRoutage multi-fournisseurs & suivi des dépensesService auto-hébergé à haut débitAPI unique auto-hébergée compatible OpenAI

Ces outils sont généralement utilisés ensemble plutôt que comme des substituts l'un de l'autre : LiteLLM peut se placer devant un déploiement vLLM ou LocalAI comme couche de routage et de suivi des coûts, pendant que vLLM ou LocalAI réalise l'inférence proprement dite. Voir les articles dédiés vLLM expliqué et LocalAI expliqué pour plus de détails sur ces deux outils.

Pour qui LiteLLM est-il adapté ?

La pertinence de LiteLLM dépend du fait que votre application appelle déjà, ou prévoit d'appeler, plus d'un fournisseur LLM — une application mono-fournisseur tire moins de bénéfice d'une couche de routage.

LiteLLM face aux autres passerelles et frameworks

Au moment de cet avis, LiteLLM est le premier outil de la catégorie routeur/passerelle à disposer de sa propre revue approfondie dans le Local LLM Software Directory de PromptQuorum — il n'existe pas encore de deuxième FeatureAppPost du même segment (routeur/passerelle) pour une comparaison directe. Les comparaisons utiles les plus proches viennent plutôt d'outils voisins dans la même partie « Run & Serve » du répertoire, complétées par une alternative hébergée largement connue en dehors du répertoire.

  • vLLM — un moteur d'inférence auto-hébergé qui exécute réellement les poids du modèle (GPU requis) ; couramment associé à LiteLLM plutôt qu'en concurrence avec lui, LiteLLM servant de couche de routage devant un ou plusieurs déploiements vLLM.
  • LocalAI — un serveur API auto-hébergé compatible OpenAI pour exécuter localement des modèles ouverts ; résout un problème différent de celui de LiteLLM (exécution vs. routage) mais expose une API de format OpenAI similaire, source fréquente de confusion entre les deux.
  • LangChain — un framework applicatif pour construire des applications basées sur des LLM (chaînes, agents, mémoire) ; il peut appeler LiteLLM (ou n'importe quel fournisseur directement) comme couche d'accès aux modèles plutôt que de remplacer ce que fait LiteLLM.
  • OpenRouter (externe, absent du répertoire de PromptQuorum) — un service de routage hébergé et géré couvrant un cas d'usage multi-fournisseurs similaire au proxy de LiteLLM, mais en tant que service tiers que vous appelez plutôt qu'une infrastructure que vous auto-hébergez ; à comparer directement si vous voulez un routage sans exploitation plutôt que d'exploiter votre propre proxy.

Erreurs fréquentes en évaluant LiteLLM

La plupart des confusions autour de LiteLLM viennent du fait de le confondre avec un moteur de service de modèles, ou de trop simplifier sa licence.

Questions fréquemment posées

Qu'est-ce que LiteLLM ?

LiteLLM (github.com/BerriAI/litellm) est une passerelle open source qui permet aux applications d'appeler plus de 100 API de fournisseurs LLM via une seule interface compatible OpenAI, disponible comme SDK Python ou comme serveur proxy auto-hébergé avec routage, suivi des coûts et limitation de débit.

LiteLLM est-il gratuit ?

Le SDK open source et le Proxy Server sont gratuits — vous ne payez que les appels API aux fournisseurs sous-jacents et votre propre hébergement. Une offre payante distincte, LiteLLM Enterprise, ajoute SSO et un support dédié ; ses tarifs ne sont pas publiés et nécessitent de contacter directement LiteLLM.

Quelle licence utilise LiteLLM ?

Le dépôt principal est sous licence MIT, selon son propre fichier LICENSE. Une licence distincte s'applique uniquement au sous-répertoire enterprise/, définie dans enterprise/LICENSE — vérifié directement dans le fichier LICENSE du dépôt pour cet avis.

LiteLLM nécessite-t-il un GPU ?

Non. LiteLLM est un routeur de requêtes, pas un moteur d'inférence de modèle — il transmet les appels aux fournisseurs (API cloud ou runtimes locaux comme Ollama) au lieu d'exécuter lui-même les poids du modèle, il fonctionne donc très bien sur du matériel CPU uniquement.

Comment installer LiteLLM ?

Pour le SDK Python : pip install litellm. Pour le proxy auto-hébergé : `pip install 'litellm[proxy]' puis litellm --model gpt-4o, ou exécuter l'image Docker docker.litellm.ai/berriai/litellm:latest avec un config.yaml` monté. Voir le tableau d'installation ci-dessus pour les options Helm, AWS ECS Fargate et Google Cloud Run.

Le proxy LiteLLM nécessite-t-il une base de données ?

Pour un usage en production, oui — PostgreSQL conserve les clés virtuelles et les données de dépenses, et Redis maintient une limitation de débit cohérente sur plusieurs instances de proxy, selon la documentation de déploiement de LiteLLM. Un test local rapide peut fonctionner sans les deux, mais perd ces fonctionnalités.

LiteLLM peut-il router vers un modèle hébergé localement ?

Oui. La même model_list du config.yaml qui pointe vers OpenAI ou Anthropic peut tout aussi bien pointer vers un point de terminaison Ollama ou vLLM local, permettant à une passerelle de mélanger modèles cloud et locaux.

Comment LiteLLM se compare-t-il à OpenRouter ?

Les deux unifient plusieurs fournisseurs LLM derrière une interface. LiteLLM est une infrastructure auto-hébergée que vous exploitez vous-même (proxy ou SDK open source) ; OpenRouter est un service de routage hébergé par un tiers que vous appelez au lieu d'exploiter le vôtre. Le choix dépend de si vous voulez du zero-ops (OpenRouter) ou un contrôle total sans marge par requête d'un fournisseur de routage (LiteLLM auto-hébergé).

Qui développe LiteLLM ?

BerriAI, l'organisation derrière le dépôt github.com/BerriAI/litellm, qui affiche environ 58 663 étoiles et 11 415 forks au moment de cet avis.

Sources

← Retour aux LLM locaux avancés