Points clés
- OpenLLM (github.com/bentoml/OpenLLM) est un serveur d'inférence gratuit et open source sous licence Apache-2.0, pas une application de bureau à télécharger
- Développé et maintenu par BentoML ; le dépôt a été créé le 19 avril 2023
- S'installe via
pip install openllm; un premier lancement rapide se fait avecopenllm hello - Sert 15+ familles de modèles à poids ouverts — Llama, DeepSeek, Qwen2.5, Mistral, Gemma, Phi et d'autres — derrière une API compatible OpenAI, selon le README officiel
- Peut utiliser vLLM comme backend d'inférence, et embarque une interface de chat sur le point de terminaison
/chat - Les noms de modèles sont résolus via le dépôt compagnon bentoml/openllm-models, avec prise en charge de dépôts personnalisés
openllm deployoffre un chemin optionnel, séparément payant, vers BentoCloud, le produit cloud géré de BentoML — pas une condition pour utiliser OpenLLM- Le dépôt GitHub affiche environ 12 535 étoiles et 842 forks en septembre 2026
📍 En une phrase
OpenLLM est un serveur d'inférence gratuit et open source (Apache-2.0) de BentoML qui exécute des LLM à poids ouverts comme Llama, DeepSeek et Qwen derrière une API compatible OpenAI, installé via pip install openllm, avec un chemin payant optionnel vers l'hébergement géré BentoCloud de BentoML.
💬 En termes simples
OpenLLM est un outil en ligne de commande, pas une application à télécharger et ouvrir en cliquant — vous l'installez avec une commande pip, puis lancez une seule commande pour démarrer un serveur local avec lequel d'autres programmes (ou vous) peuvent dialoguer dans le même format de requête que l'API OpenAI. Tout fonctionne sur votre propre machine, sauf si vous choisissez de déployer sur BentoCloud, le produit cloud séparé et payant de BentoML.
📌Remarque: Cette review est le complément approfondi de la fiche d'OpenLLM dans l'annuaire de logiciels LLM locaux — consultez cette page pour voir comment OpenLLM se compare en un coup d'œil à des dizaines d'autres outils d'IA locale.
Qu'est-ce qu'OpenLLM ?
OpenLLM est un serveur d'inférence basé sur Python qui transforme un LLM à poids ouverts en un point de terminaison API compatible OpenAI avec une seule commande, développé et maintenu par BentoML. Sa propre description GitHub le formule simplement : « Run any open-source LLMs, such as DeepSeek and Llama, as OpenAI compatible API endpoint in the cloud. » Malgré la formulation « in the cloud » de ce slogan, le serveur lui-même fonctionne partout où Python peut tourner — un ordinateur portable, une machine GPU sur site, ou une VM cloud que vous contrôlez ; l'auto-hébergement est le cas par défaut, pas une option secondaire.
- Type de produit : un outil CLI et une bibliothèque Python, pas une application grand public à télécharger — installation via
pip install openllm - Créateur : BentoML, l'entreprise derrière le framework de serving de modèles BentoML et le produit d'hébergement géré BentoCloud
- Dépôt : github.com/bentoml/OpenLLM, créé le 19 avril 2023
- Licence : Apache-2.0, confirmée via les métadonnées de licence du dépôt
- Échelle : environ 12 535 étoiles GitHub et 842 forks en septembre 2026
- Projet compagnon : bentoml/openllm-models, un dépôt séparé contenant les définitions de dépôt de modèles utilisées par la CLI d'OpenLLM
Historique du projet OpenLLM et jalons de versions
Le dépôt GitHub d'OpenLLM a été créé le 19 avril 2023, et le projet a connu une réécriture majeure explicitement qualifiée de rupture de compatibilité mi-2024, qui l'a recentré d'une boîte à outils de serving hautement personnalisable vers une CLI plus simple, orientée déploiement cloud — la forme de l'outil telle qu'elle existe aujourd'hui.
- 1v0.1.0 — 12 juin 2023 : première version taguée
Why it matters: La CLI, à ce stade, s'articulait autour de `openllm start <model-name>`, une syntaxe de commande plus ancienne que le projet a depuis remplacée par `openllm serve` et `openllm run`. - 2v0.5.0 — 27 mai 2024 : architecture d'avant la réécriture
Why it matters: Selon l'historique officiel des versions, la dernière version mineure avant le plus grand changement structurel d'OpenLLM. - 3v0.6.0 — 11 juillet 2024 : réécriture déclarée comme rupture de compatibilité
Why it matters: Les notes de version d'OpenLLM décrivent cette version comme « a significant shift in our project's philosophy » — un éloignement de la personnalisation poussée du déploiement, jugée source de dérive de périmètre par les mainteneurs, vers un outil plus simple, centré sur le déploiement cloud. La CLI actuelle (`openllm serve`, `openllm deploy`) repose sur cette architecture. - 4Dépôt compagnon openllm-models créé — 18 mai 2024
Why it matters: BentoML a extrait les définitions de modèles dans un dépôt séparé ([bentoml/openllm-models](https://github.com/bentoml/openllm-models)), que la CLI d'OpenLLM utilise pour résoudre des noms de modèles comme `llama3.2:1b`, et qui prend en charge des dépôts personnalisés auto-hébergés. - 5v0.6.30 — 21 avril 2025 : version taguée la plus récente
Why it matters: La version actuellement répertoriée comme la plus récente sur [PyPI](https://pypi.org/project/openllm/) au moment de cette review.
Que pouvez-vous faire avec OpenLLM ?
Les fonctionnalités d'OpenLLM tournent autour de la transformation d'un modèle à poids ouverts choisi en un serveur API compatible OpenAI opérationnel, avec une couche de gestion pour les modèles, les dépôts et le déploiement cloud par-dessus. Voici ce que fait réellement chaque partie, selon le README GitHub d'OpenLLM.
- API compatible OpenAI — chaque modèle servi par OpenLLM est accessible via le même format de requête/réponse que l'API OpenAI, si bien que du code client OpenAI existant peut pointer vers OpenLLM à la place
- Interface de chat intégrée — une interface de chat web est disponible sur le point de terminaison
/chatdu serveur local (par défauthttp://localhost:3000), pour tester un modèle sans écrire de code client - Large support de modèles — 15+ familles de modèles à poids ouverts selon le README, dont Llama (3.1, 3.2, 3.3, 4), Mistral (8B et Large 123B), Qwen (2.5 et 2.5-Coder), Gemma (2 et 3), Phi (4), DeepSeek (R1), Pixtral, Jamba et QwQ
- Backend d'inférence vLLM — OpenLLM intègre vLLM comme backend d'inférence disponible, selon sa propre documentation, plutôt que de ne fournir qu'une implémentation d'inférence développée entièrement en interne
- Système de dépôt de modèles — la CLI résout les noms de modèles par défaut via bentoml/openllm-models, avec prise en charge de dépôts de modèles personnalisés auto-hébergés via
openllm repo update - Gestion des modèles en CLI —
openllm model listetopenllm model get <name>affichent les modèles disponibles et leurs détails sans quitter le terminal - Déploiement Docker et Kubernetes — la documentation d'OpenLLM couvre des chemins de déploiement conteneurisé et Kubernetes pour l'auto-hébergement, en plus de l'option BentoCloud
- Déploiement BentoCloud optionnel —
openllm deploy <model> --env HF_TOKENpousse un modèle vers BentoCloud, le produit d'hébergement géré séparément payant de BentoML, pour un hébergement de production à mise à l'échelle automatique
Exemples d'utilisation : trois façons d'utiliser OpenLLM
Voici des workflows concrets construits à partir des commandes CLI documentées d'OpenLLM ci-dessus — pas des cas d'usage hypothétiques.
Installer OpenLLM
OpenLLM s'installe gratuitement via pip, et son code source est sur GitHub. En tant qu'outil CLI et bibliothèque Python — pas une application grand public à télécharger — il n'y a pas d'installeur par OS ; le tableau ci-dessous présente la commande d'installation et des liens de référence, le schéma utilisé par ce site pour les sujets de type framework/CLI.
Commande d'installation (pip)
- Lien:
pip install openllm
Commande de démarrage rapide
- Lien:
openllm hello
Dépôt GitHub (code source, Apache-2.0)
Paquet PyPI
Dépôt de modèles (bentoml/openllm-models)
Documentation officielle et BentoCloud
- Lien:
- bentoml.com
OpenLLM nécessite un terminal et un environnement Python (via pip) — il n'y a pas d'installeur graphique. Les modèles à accès restreint sur Hugging Face nécessitent une variable d'environnement HF_TOKEN pour le téléchargement.
OpenLLM est-il gratuit ? OpenLLM vs. prix de BentoCloud
Oui — le logiciel OpenLLM lui-même est gratuit. Il est sous licence Apache-2.0, n'a pas de palier payant propre et n'impose aucune limite d'usage ; le dépôt GitHub est public et installable via pip sans compte requis.
- Aucun abonnement, aucun palier payant, aucune limite d'usage imposée par le projet open source OpenLLM lui-même
- Aucun compte ni inscription requis pour installer ou exécuter OpenLLM localement
- Faire tourner OpenLLM sur votre propre matériel (ordinateur portable, serveur GPU sur site, ou VM cloud que vous gérez vous-même) ne coûte que ce que ce matériel ou ce calcul cloud vous coûte
- BentoCloud, le produit d'hébergement géré séparé de BentoML, est payant — son site marketing ne publie pas de tarifs en libre-service et oriente les clients potentiels vers une démo à réserver ; confirmez donc tout coût BentoCloud précis directement auprès de BentoML plutôt que de vous fier à une estimation tierce
- Choisir BentoCloud est optionnel : seule la commande
openllm deployy fait appel, et toute autre commande OpenLLM (serve,run,model list) fonctionne entièrement sur une infrastructure que vous contrôlez
OpenLLM vs. vLLM
OpenLLM et vLLM sont souvent mentionnés ensemble, mais se situent à des niveaux différents de la même pile — OpenLLM peut utiliser vLLM comme backend d'inférence, plutôt que les deux soient de purs substituts. vLLM est un moteur/bibliothèque d'inférence à haut débit axé sur la vitesse de serving et l'efficacité mémoire ; OpenLLM est un framework de serving de plus haut niveau qui enveloppe un backend d'inférence (dont vLLM) avec gestion des modèles, une API compatible OpenAI, une interface de chat intégrée, et un chemin optionnel vers un déploiement cloud géré.
Rôle principal
- OpenLLM:
- Framework de serving de plus haut niveau : gestion de modèles + API OpenAI + déploiement cloud optionnel
- vLLM:
- Moteur/bibliothèque d'inférence à haut débit, autonome ou intégré à d'autres serveurs
Backend d'inférence
- OpenLLM:
- Intègre vLLM comme l'un des backends disponibles, selon sa documentation
- vLLM:
- Est lui-même le moteur d'inférence, bâti autour de la gestion mémoire PagedAttention
Gestion de modèles en CLI
- OpenLLM:
openllm model list,openllm repo update, raccourcis de noms de modèles- vLLM:
- Principalement une commande de serving (
vllm serve <model>), moins d'outillage de catalogue intégré
Interface de chat intégrée
- OpenLLM:
- Oui, sur le point de terminaison
/chat - vLLM:
- Aucune interface de chat intégrée ; généralement associé à un frontend séparé
Chemin cloud géré
- OpenLLM:
openllm deployoptionnel vers BentoCloud (BentoML, payant)- vLLM:
- Aucun produit cloud géré propriétaire dédié
Mainteneur
- OpenLLM:
- BentoML
- vLLM:
- Le projet open source vLLM — voir l'explication vLLM pour les détails
Si votre priorité est le débit d'inférence brut le plus élevé possible comme brique dans votre propre pile, évaluez vLLM directement. Si votre priorité est un serveur de plus haut niveau, compatible OpenAI, avec gestion des modèles et un chemin optionnel de déploiement cloud géré, les fonctionnalités d'OpenLLM sont les plus larges des deux — et les deux ne s'excluent pas mutuellement, puisqu'OpenLLM peut fonctionner au-dessus de vLLM comme backend.
Pour qui OpenLLM est-il fait ?
La pertinence d'OpenLLM dépend du fait que vous vouliez une couche de serving gratuite, auto-hébergeable, compatible OpenAI, avec une issue de secours optionnelle vers un cloud géré, plutôt qu'une simple bibliothèque d'inférence ou une application de chat à télécharger.
Concurrents et alternatives
OpenLLM est l'un des nombreux outils qui enveloppent l'inférence de modèles à poids ouverts derrière une API compatible OpenAI. Voici comment il se situe face à d'autres options du segment des serveurs d'inférence — voir l'annuaire de logiciels LLM locaux pour le catalogue complet, et le comparatif dédié OpenLLM vs. vLLM ci-dessus pour le face-à-face le plus direct.
- vLLM — le moteur d'inférence à haut débit qu'OpenLLM peut utiliser comme backend ; à évaluer directement si le débit brut de serving est votre priorité. Voir la section de comparaison dédiée ci-dessus.
- SGLang — un autre moteur d'inférence et framework de serving haute performance, souvent comparé à vLLM sur le débit et les fonctionnalités de génération structurée.
- LocalAI — un serveur d'inférence local gratuit, open source, compatible OpenAI, avec un focus plus large sur plusieurs types de modèles (texte, image, audio) derrière une seule API.
- LiteLLM — un proxy/SDK qui offre une interface unifiée compatible OpenAI sur de nombreux fournisseurs LLM différents et backends auto-hébergés, y compris OpenLLM lui-même.
Erreurs courantes en évaluant OpenLLM
La plupart des confusions autour d'OpenLLM viennent de sa relation avec BentoCloud, de sa relation avec vLLM, ou de l'hypothèse que sa dernière version taguée reflète le code le plus récent.
Questions fréquemment posées
Qu'est-ce qu'OpenLLM ?
OpenLLM (github.com/bentoml/OpenLLM) est un serveur d'inférence gratuit, open source, sous licence Apache-2.0, développé par BentoML, qui transforme un LLM à poids ouverts en point de terminaison API compatible OpenAI avec une seule commande CLI.
OpenLLM est-il gratuit ?
Oui. Le logiciel OpenLLM est gratuit et open source, sans palier payant propre. BentoCloud, le produit d'hébergement géré séparé de BentoML, est payant, mais son usage est optionnel — chaque commande principale d'OpenLLM fonctionne sur une infrastructure que vous contrôlez.
Quelle licence utilise OpenLLM ?
Apache-2.0, confirmée via les métadonnées de licence du dépôt GitHub.
OpenLLM nécessite-t-il BentoCloud ?
Non. openllm serve, openllm run et openllm model list fonctionnent entièrement sur votre propre matériel. BentoCloud n'entre en jeu que si vous exécutez openllm deploy, un chemin de déploiement optionnel et séparément payant.
Quels modèles OpenLLM prend-il en charge ?
Selon son propre README, OpenLLM prend en charge 15+ familles de modèles à poids ouverts, dont Llama (3.1, 3.2, 3.3, 4), Mistral (8B et Large 123B), Qwen (2.5 et 2.5-Coder), Gemma (2 et 3), Phi (4), DeepSeek (R1), Pixtral, Jamba et QwQ, résolus via le dépôt compagnon openllm-models.
Comment installer OpenLLM ?
Exécutez pip install openllm, puis essayez openllm hello pour un démarrage interactif rapide, ou openllm serve <model-name> pour lancer un serveur local compatible OpenAI.
OpenLLM utilise-t-il vLLM ?
Il le peut. OpenLLM intègre vLLM comme backend d'inférence disponible, selon sa propre documentation, plutôt que de ne fournir qu'une implémentation d'inférence développée entièrement en interne.
Quelle est la différence entre OpenLLM et vLLM ?
vLLM est un moteur/bibliothèque d'inférence à haut débit ; OpenLLM est un framework de serving de plus haut niveau qui enveloppe un backend d'inférence (dont vLLM) avec gestion des modèles, une API compatible OpenAI, une interface de chat intégrée, et un chemin optionnel de déploiement cloud géré. Voir le comparatif dédié OpenLLM vs. vLLM ci-dessus.
Qui développe OpenLLM ?
BentoML, l'entreprise qui développe aussi le framework de serving de modèles BentoML et le produit d'hébergement géré BentoCloud. L'organisation GitHub hébergeant le code d'OpenLLM est bentoml.
OpenLLM est-il activement maintenu ?
Le dépôt a été créé le 19 avril 2023, et selon l'API GitHub, son dernier push date du 14 septembre 2026, ce qui indique un développement continu. Sa dernière version taguée est v0.6.30 (21 avril 2025) — un écart que cette review signale ; vérifiez le statut actuel des versions directement sur GitHub ou PyPI.