Points clés
- 46 outils, trois types : moteurs d'inférence (30), runtimes et gestionnaires (13), routeurs et passerelles (4). Ollama apparaît dans deux groupes, car il est à la fois un moteur et un runtime.
- Le tableau est généré à partir de la fiche de chaque outil et vérifié par rapport à son README ou à son site officiel ; un tiret signifie « non indiqué dans la documentation », jamais « non ». Pour certains outils très connus, la documentation citée ici est muette sur une fonctionnalité donnée, et leurs cellules affichent donc un tiret.
- Chaque nom d'outil du tableau renvoie vers son propre avis PromptQuorum, où sont traités les étapes d'installation et les limites.
📍 En une phrase
Exécuter des modèles en local fait intervenir trois types d'outils — moteurs d'inférence, runtimes et gestionnaires, routeurs et passerelles — de sorte que les 46 outils du répertoire PromptQuorum sont comparés au sein de chaque type, à l'aide d'un tableau généré à partir des mêmes données que l'avis de chaque outil.
💬 En termes simples
Un moteur est la partie qui exécute réellement le modèle, un runtime ou gestionnaire télécharge et lance les modèles pour vous, et une passerelle achemine les requêtes entre eux. Comparer un moteur et une passerelle sur la prise en charge des GPU n'aurait aucun sens : ce guide compare donc des outils comparables.
Notre méthode de comparaison
Les informations de chaque outil — prix, licence, plateformes, besoins matériels et attributs propres à la catégorie — sont enregistrées une seule fois, dans la fiche du répertoire de cet outil. Le tableau comparatif ci-dessous est généré à partir de ces fiches, et l'avis de l'outil s'appuie sur la même fiche : les deux ne peuvent donc pas indiquer des valeurs différentes.
Les attributs propres à la catégorie (par exemple l'API compatible OpenAI ou la prise en charge des GPU AMD) ont été relevés dans le README ou sur le site officiel de chaque projet, puis vérifiés par rapport à la formulation exacte qui s'y trouve. Lorsque la documentation est muette, le tableau affiche un tiret plutôt que de deviner ; lorsqu'une affirmation est nuancée (expérimentale, prévue, ou disponible uniquement via un projet distinct), l'attribut est retiré du tableau et traité dans l'avis de l'outil.
Seuls les outils disposant de leur propre avis PromptQuorum figurent dans le tableau. Les outils listés uniquement comme serveurs d'API (h2oGPT, Tabby et OpenAI Edge TTS) sont comparés dans leurs propres catégories. Ce comparatif recense des outils qui s'exécutent sur votre propre matériel ; il ne les classe pas, car le bon choix dépend de votre contrainte.
Tableau comparatif
Choisissez ci-dessous un type d'outil, puis lisez le tableau ligne par ligne. Cliquez sur le nom d'un outil pour ouvrir son avis PromptQuorum complet.
| Outil | Prix | Licence | Plateformes | Exécution | Matériel | Version | API compatible OpenAI | GPU NVIDIA | Apple Silicon | GPU AMD | Inférence CPU | Multi-GPU / multi-nœuds | Avis | lien produit · divulgué |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| candle-vllm | Gratuit | MIT | macOS, Windows, Linux | Local | Variable selon le modèle | v0.9.1 | Oui | Oui | Oui | — | — | Oui | Lire l'avis → | candle-vllm |
| claude-code-local | Gratuit | MIT | macOS | Local | Variable selon le modèle | v0.3.0 | — | — | Oui | — | — | — | Lire l'avis → | claude-code-local |
| ExLlamaV2 | Gratuit | MIT | Windows, Linux | Local | 8 Go de VRAM | v0.3.2 | — | Oui | — | — | — | Oui | Lire l'avis → | ExLlamaV2 |
| exo | Gratuit | Apache-2.0 | macOS, Linux | Local | Variable selon le modèle | — | Oui | — | Oui | — | Oui | Oui | Lire l'avis → | exo |
| KoboldCpp | Gratuit | AGPL-3.0 | Windows, Linux, macOS | Local | Variable selon le modèle | v1.121 | Oui | Oui | Oui | Oui | Oui | — | Lire l'avis → | KoboldCpp |
| KServe | Gratuit | Apache-2.0 | Linux | Local | Un CPU suffit | v0.20.0 | Oui | — | — | — | — | Oui | Lire l'avis → | KServe |
| llama.cpp | Gratuit | MIT | macOS, Windows, Linux | Local | Variable selon le modèle | v0.4.1 | Oui | Oui | Oui | Oui | Oui | — | Lire l'avis → | llama.cpp |
| Llamafile | Gratuit | Apache-2.0 | macOS, Windows, Linux | Local | Variable selon le modèle | 0.10.6 | — | — | — | — | — | — | Lire l'avis → | Llamafile |
| LMDeploy | Gratuit | Apache-2.0 | Linux | Local | Variable selon le modèle | v0.17.0 | — | Oui | — | — | — | Oui | Lire l'avis → | LMDeploy |
| LocalAI | Gratuit | MIT | macOS, Windows, Linux | Local | Variable selon le modèle | — | Oui | Oui | Oui | Oui | Oui | Oui | Lire l'avis → | LocalAI |
| LoRAX | Gratuit | Apache-2.0 | Linux | Local | Variable selon le modèle | v0.12.1 | Oui | Oui | — | — | — | Oui | Lire l'avis → | LoRAX |
| Lucebox | Gratuit | Apache-2.0 | Linux | Local | Variable selon le modèle | — | Oui | Oui | — | Oui | — | Oui | Lire l'avis → | Lucebox |
| MLC LLM | Gratuit | Apache-2.0 | macOS, Windows, Linux, iOS, Android | Local | Variable selon le modèle | — | Oui | Oui | Oui | Oui | — | — | Lire l'avis → | MLC LLM |
| MLX-LM | Gratuit | MIT | macOS | Local | Variable selon le modèle | — | — | — | Oui | — | — | Oui | Lire l'avis → | MLX-LM |
| mlx-serve | Gratuit | MIT | macOS | Local | Variable selon le modèle | v26.9.4 | Oui | — | Oui | — | — | — | Lire l'avis → | mlx-serve |
| mlxcel | Gratuit | Apache-2.0 | macOS, Linux | Local | Variable selon le modèle | v0.7.0 | Oui | Oui | Oui | — | — | Oui | Lire l'avis → | mlxcel |
| NVIDIA Dynamo | Gratuit | Apache-2.0 | Linux | Local | Variable selon le modèle | v1.4–v1.6 | Oui | — | — | — | — | Oui | Lire l'avis → | NVIDIA Dynamo |
| Ollama | Gratuit | MIT | macOS, Windows, Linux | Local | Variable selon le modèle | — | — | — | — | — | — | — | Lire l'avis → | Ollama |
| OlliteRT | Gratuit | Apache-2.0 | Android | Local | Un CPU suffit | — | Oui | — | — | — | Oui | — | Lire l'avis → | OlliteRT |
| oMLX | Gratuit | Apache-2.0 | macOS | Local | Variable selon le modèle | v0.6.4 | Oui | — | Oui | — | — | Oui | Lire l'avis → | oMLX |
| OpenLLM | Gratuit | Apache-2.0 | — | Hybride | Variable selon le modèle | — | Oui | — | — | — | — | — | Lire l'avis → | OpenLLM |
| Rapid-MLX | Gratuit | Apache-2.0 | macOS | Local | 8 Go de RAM | — | Oui | — | Oui | — | — | — | Lire l'avis → | Rapid-MLX |
| SGLang | Gratuit | Apache-2.0 | Linux | Local | Variable selon le modèle | — | — | Oui | — | Oui | Oui | Oui | Lire l'avis → | SGLang |
| Shimmy | Gratuit | Apache-2.0 | macOS, Windows, Linux | Local | Variable selon le modèle | — | Oui | Oui | Oui | Oui | — | — | Lire l'avis → | Shimmy |
| SwiftLM | Gratuit | MIT | macOS, iOS | Local | Variable selon le modèle | — | Oui | — | Oui | — | — | — | Lire l'avis → | SwiftLM |
| TensorRT-LLM | Gratuit | Apache-2.0 | Windows, Linux | Local | Variable selon le modèle | — | — | Oui | — | — | — | — | Lire l'avis → | TensorRT-LLM |
| text-generation-webui | Gratuit | AGPL-3.0 | Windows, Linux, macOS | Local | Variable selon le modèle | — | Oui | Oui | Oui | Oui | Oui | — | Lire l'avis → | text-generation-webui |
| TurboFieldfare | Gratuit | Apache-2.0 | macOS | Local | 2 Go de RAM | — | — | — | Oui | — | — | — | Lire l'avis → | TurboFieldfare |
| vLLM | Gratuit | Apache-2.0 | Linux | Local | Variable selon le modèle | — | Oui | Oui | — | Oui | Oui | Oui | Lire l'avis → | vLLM |
| vllm-mlx | Gratuit | Apache-2.0 | macOS | Local | Variable selon le modèle | — | Oui | — | Oui | — | — | — | Lire l'avis → | vllm-mlx |
« — » signifie que la documentation du projet ne le précise pas, et non que la fonctionnalité est absente. Les valeurs proviennent du README ou du site officiel de chaque projet et sont revérifiées lors de la mise à jour de l'avis d'un outil.
Moteurs d'inférence : ce qui les distingue
- API compatible OpenAI. candle-vllm, NVIDIA Dynamo, exo, KoboldCpp, KServe, llama.cpp, LocalAI, LoRAX, Lucebox, MLC LLM, mlx-serve, mlxcel, OlliteRT, oMLX, OpenLLM, Rapid-MLX, Shimmy, SwiftLM, text-generation-webui, vllm-mlx et vLLM documentent une API HTTP compatible OpenAI, ce qui permet aux applications écrites pour l'API d'OpenAI de les utiliser comme cible.
- GPU NVIDIA. candle-vllm, ExLlamaV2, KoboldCpp, llama.cpp, LMDeploy, LocalAI, LoRAX, Lucebox, MLC LLM, mlxcel, SGLang, Shimmy, TensorRT-LLM, text-generation-webui et vLLM documentent la prise en charge des GPU NVIDIA (CUDA).
- Apple Silicon. candle-vllm, claude-code-local, exo, KoboldCpp, llama.cpp, LocalAI, MLC LLM, MLX-LM, mlx-serve, mlxcel, oMLX, Rapid-MLX, Shimmy, SwiftLM, text-generation-webui, TurboFieldfare et vllm-mlx documentent la prise en charge d'Apple Silicon, de Metal ou de MLX.
- GPU AMD. KoboldCpp, llama.cpp, LocalAI, Lucebox, MLC LLM, SGLang, Shimmy, text-generation-webui et vLLM documentent la prise en charge des GPU AMD.
- Inférence sur CPU. exo, KoboldCpp, llama.cpp, LocalAI, OlliteRT, SGLang, text-generation-webui et vLLM documentent l'exécution de l'inférence sur un CPU.
- Multi-GPU et multi-nœuds. candle-vllm, NVIDIA Dynamo, ExLlamaV2, exo, KServe, LMDeploy, LocalAI, LoRAX, Lucebox, MLX-LM, mlxcel, oMLX, SGLang et vLLM documentent l'inférence multi-GPU, en parallélisme tensoriel ou multi-nœuds.
- Licence. La plupart des moteurs présentés ici sont sous Apache-2.0 (19 outils) ou MIT (9) ; KoboldCpp et text-generation-webui sont sous AGPL-3.0. Les licences copyleft soumettent la distribution de versions modifiées à des conditions — voir Les licences des outils d'IA expliquées.
Runtimes et gestionnaires : ce qui les distingue
- API compatible OpenAI. Docker Model Runner, Foundry Local, GPUStack, Jan, Lemonade et Osaurus documentent une API compatible OpenAI.
- Application de bureau. GPT4All, Jan, LM Studio, Osaurus et Ypipe documentent une application de bureau installable.
- Bibliothèque de modèles intégrée. Foundry Local, GPUStack, Jan, Lemonade, LM Studio et Ollama documentent un moyen intégré de trouver et de télécharger des modèles.
- Mode sans interface ou serveur. DreamServer, GPUStack, Lemonade et Osaurus documentent un fonctionnement en service d'arrière-plan ou en serveur, sans interface graphique.
- Licence et prix. Quatre des runtimes présentés ici sont sous Apache-2.0 et quatre sous MIT. LM Studio et Docker Model Runner sont propriétaires (LM Studio est gratuit à l'usage ; Docker Model Runner est fourni avec Docker Desktop), Msty est à code fermé avec une offre gratuite, et RunAnywhere et YPipe appliquent leurs propres conditions ou des conditions non documentées — consultez chaque avis.
Routeurs et passerelles : ce qui les distingue
- Point d'accès compatible OpenAI. AIClient2API et litellm documentent un point d'accès compatible OpenAI.
- Routage vers des modèles locaux. litellm documente les modèles locaux ou auto-hébergés (comme Ollama) parmi les fournisseurs qu'il prend en charge.
- Basculement et répartition de charge. AIClient2API, ClawRouter et litellm documentent le basculement, les nouvelles tentatives ou la répartition de charge entre modèles ou fournisseurs.
- Licence. Deux des quatre sont sous MIT, un sous GPL-3.0 et un sous Apache-2.0.
Ce que ce comparatif ne peut pas vous dire
- Il compare des capacités documentées, pas des performances. Il ne dit rien des jetons par seconde, de la consommation de mémoire ou de la latence — PromptQuorum ne les a pas mesurés pour ces outils, et ils dépendent fortement de votre matériel et de votre modèle.
- Les tirets correspondent à des lacunes de la documentation que nous avons consultée, pas à des constats négatifs. Certains outils peuvent prendre en charge une fonctionnalité que leur README ne mentionne pas ; c'est particulièrement visible pour quelques outils très répandus dont les README, courts, en disent peu (par exemple les fonctionnalités de moteur d'Ollama).
- La prise en charge matérielle correspond à ce qu'indique la documentation, pas à la garantie d'une bonne expérience sur ce matériel ; lisez l'avis de l'outil pour connaître les prérequis réels.
- Les outils évoluent vite. L'avis de chaque outil indique la version par rapport à laquelle il a été vérifié, et ce guide est actualisé lorsqu'un avis l'est.
Questions fréquentes
Quelle est la différence entre un moteur d'inférence, un runtime et une passerelle ?
Un moteur d'inférence exécute le modèle sur votre matériel (par exemple llama.cpp ou vLLM). Un runtime ou gestionnaire télécharge les modèles et les lance pour vous, souvent avec une application de bureau ou une bibliothèque de modèles (par exemple Ollama ou LM Studio). Un routeur ou une passerelle se place devant un ou plusieurs modèles ou fournisseurs et leur transmet les requêtes. Ils remplissent des fonctions différentes, c'est pourquoi ils sont comparés séparément.
Que signifie un tiret dans le tableau comparatif ?
Cela signifie que la documentation du projet n'indique pas cet attribut. Cela ne veut pas dire que la fonctionnalité est absente ; consultez l'avis de l'outil ou son dépôt.
Pourquoi Ollama figure-t-il dans deux groupes ?
Ollama est à la fois un moteur d'inférence et un runtime qui gère les modèles ; il est donc listé dans les deux. Son README indique peu des attributs comparés ici, si bien que beaucoup de ses cellules affichent un tiret.
L'un de ces outils a-t-il un lien d'affiliation ?
Non. PromptQuorum n'a, à la date de rédaction, aucune relation d'affiliation avec les outils de ce comparatif, et aucun lien présenté ici ne rapporte de commission.
À quelle fréquence ce comparatif est-il mis à jour ?
Il est actualisé deux fois par an, ainsi que chaque fois que l'avis de l'un des outils listés est mis à jour, car le tableau est généré à partir des mêmes données que ces avis.
Sources
- Le README ou le site officiel de chaque outil, indiqué dans l'avis PromptQuorum correspondant (accessible depuis le tableau comparatif).
- Répertoire PromptQuorum des applications d'IA locales — la fiche à partir de laquelle chaque ligne du tableau est générée.
- Les licences des outils d'IA expliquées — ce que signifient les familles de licences citées ci-dessus.