Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Moteurs d'inférence, runtimes et passerelles locaux : comparatif (2026) pour exécuter et servir des modèles
Overview & Reference

Moteurs d'inférence, runtimes et passerelles locaux : comparatif (2026) pour exécuter et servir des modèles

·10 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Les 46 outils locaux d'exécution et de service du répertoire PromptQuorum se répartissent en trois types, à comparer séparément : les moteurs d'inférence (30 outils), les runtimes et gestionnaires (13) et les routeurs et passerelles (4). Parmi les moteurs, 15 documentent la prise en charge des GPU NVIDIA, 17 celle d'Apple Silicon et 21 une API compatible OpenAI ; parmi les runtimes, 6 documentent une API compatible OpenAI. Servez-vous du tableau comparatif ci-dessous et lisez l'avis de chaque outil avant de l'installer.

Exécuter un modèle sur votre propre matériel fait intervenir trois types d'outils différents — des moteurs d'inférence qui exécutent le modèle, des runtimes et gestionnaires qui téléchargent et lancent les modèles à votre place, et des routeurs et passerelles placés devant eux — et aucune liste de fonctionnalités unique ne les compare équitablement. Ce guide compare 46 outils gratuits et freemium, un type à la fois, à l'aide d'un tableau comparatif généré à partir des mêmes données que l'avis PromptQuorum de chaque outil : le tableau et les avis ne peuvent donc pas se contredire.

Cette page contient des liens de référence vers des produits tiers. PromptQuorum n'est inscrit à aucun programme d'affiliation — ce sont de simples liens qui ne génèrent aucune commission. Cliquer sur les liens et vos prochaines étapes relèvent entièrement de votre responsabilité. Ces liens ne représentent aucune approbation ou vérification par PromptQuorum.

Points clés

  • 46 outils, trois types : moteurs d'inférence (30), runtimes et gestionnaires (13), routeurs et passerelles (4). Ollama apparaît dans deux groupes, car il est à la fois un moteur et un runtime.
  • Le tableau est généré à partir de la fiche de chaque outil et vérifié par rapport à son README ou à son site officiel ; un tiret signifie « non indiqué dans la documentation », jamais « non ». Pour certains outils très connus, la documentation citée ici est muette sur une fonctionnalité donnée, et leurs cellules affichent donc un tiret.
  • Chaque nom d'outil du tableau renvoie vers son propre avis PromptQuorum, où sont traités les étapes d'installation et les limites.

📍 En une phrase

Exécuter des modèles en local fait intervenir trois types d'outils — moteurs d'inférence, runtimes et gestionnaires, routeurs et passerelles — de sorte que les 46 outils du répertoire PromptQuorum sont comparés au sein de chaque type, à l'aide d'un tableau généré à partir des mêmes données que l'avis de chaque outil.

💬 En termes simples

Un moteur est la partie qui exécute réellement le modèle, un runtime ou gestionnaire télécharge et lance les modèles pour vous, et une passerelle achemine les requêtes entre eux. Comparer un moteur et une passerelle sur la prise en charge des GPU n'aurait aucun sens : ce guide compare donc des outils comparables.

Notre méthode de comparaison

Les informations de chaque outil — prix, licence, plateformes, besoins matériels et attributs propres à la catégorie — sont enregistrées une seule fois, dans la fiche du répertoire de cet outil. Le tableau comparatif ci-dessous est généré à partir de ces fiches, et l'avis de l'outil s'appuie sur la même fiche : les deux ne peuvent donc pas indiquer des valeurs différentes.

Les attributs propres à la catégorie (par exemple l'API compatible OpenAI ou la prise en charge des GPU AMD) ont été relevés dans le README ou sur le site officiel de chaque projet, puis vérifiés par rapport à la formulation exacte qui s'y trouve. Lorsque la documentation est muette, le tableau affiche un tiret plutôt que de deviner ; lorsqu'une affirmation est nuancée (expérimentale, prévue, ou disponible uniquement via un projet distinct), l'attribut est retiré du tableau et traité dans l'avis de l'outil.

Seuls les outils disposant de leur propre avis PromptQuorum figurent dans le tableau. Les outils listés uniquement comme serveurs d'API (h2oGPT, Tabby et OpenAI Edge TTS) sont comparés dans leurs propres catégories. Ce comparatif recense des outils qui s'exécutent sur votre propre matériel ; il ne les classe pas, car le bon choix dépend de votre contrainte.

Tableau comparatif

Choisissez ci-dessous un type d'outil, puis lisez le tableau ligne par ligne. Cliquez sur le nom d'un outil pour ouvrir son avis PromptQuorum complet.

OutilPrixLicencePlateformesExécutionMatérielVersionAPI compatible OpenAIGPU NVIDIAApple SiliconGPU AMDInférence CPUMulti-GPU / multi-nœudsAvislien produit · divulgué
candle-vllmGratuitMITmacOS, Windows, LinuxLocalVariable selon le modèlev0.9.1OuiOuiOuiOuiLire l'aviscandle-vllm
claude-code-localGratuitMITmacOSLocalVariable selon le modèlev0.3.0OuiLire l'avisclaude-code-local
ExLlamaV2GratuitMITWindows, LinuxLocal8 Go de VRAMv0.3.2OuiOuiLire l'avisExLlamaV2
exoGratuitApache-2.0macOS, LinuxLocalVariable selon le modèleOuiOuiOuiOuiLire l'avisexo
KoboldCppGratuitAGPL-3.0Windows, Linux, macOSLocalVariable selon le modèlev1.121OuiOuiOuiOuiOuiLire l'avisKoboldCpp
KServeGratuitApache-2.0LinuxLocalUn CPU suffitv0.20.0OuiOuiLire l'avisKServe
llama.cppGratuitMITmacOS, Windows, LinuxLocalVariable selon le modèlev0.4.1OuiOuiOuiOuiOuiLire l'avisllama.cpp
LlamafileGratuitApache-2.0macOS, Windows, LinuxLocalVariable selon le modèle0.10.6Lire l'avisLlamafile
LMDeployGratuitApache-2.0LinuxLocalVariable selon le modèlev0.17.0OuiOuiLire l'avisLMDeploy
LocalAIGratuitMITmacOS, Windows, LinuxLocalVariable selon le modèleOuiOuiOuiOuiOuiOuiLire l'avisLocalAI
LoRAXGratuitApache-2.0LinuxLocalVariable selon le modèlev0.12.1OuiOuiOuiLire l'avisLoRAX
LuceboxGratuitApache-2.0LinuxLocalVariable selon le modèleOuiOuiOuiOuiLire l'avisLucebox
MLC LLMGratuitApache-2.0macOS, Windows, Linux, iOS, AndroidLocalVariable selon le modèleOuiOuiOuiOuiLire l'avisMLC LLM
MLX-LMGratuitMITmacOSLocalVariable selon le modèleOuiOuiLire l'avisMLX-LM
mlx-serveGratuitMITmacOSLocalVariable selon le modèlev26.9.4OuiOuiLire l'avismlx-serve
mlxcelGratuitApache-2.0macOS, LinuxLocalVariable selon le modèlev0.7.0OuiOuiOuiOuiLire l'avismlxcel
NVIDIA DynamoGratuitApache-2.0LinuxLocalVariable selon le modèlev1.4–v1.6OuiOuiLire l'avisNVIDIA Dynamo
OllamaGratuitMITmacOS, Windows, LinuxLocalVariable selon le modèleLire l'avisOllama
OlliteRTGratuitApache-2.0AndroidLocalUn CPU suffitOuiOuiLire l'avisOlliteRT
oMLXGratuitApache-2.0macOSLocalVariable selon le modèlev0.6.4OuiOuiOuiLire l'avisoMLX
OpenLLMGratuitApache-2.0HybrideVariable selon le modèleOuiLire l'avisOpenLLM
Rapid-MLXGratuitApache-2.0macOSLocal8 Go de RAMOuiOuiLire l'avisRapid-MLX
SGLangGratuitApache-2.0LinuxLocalVariable selon le modèleOuiOuiOuiOuiLire l'avisSGLang
ShimmyGratuitApache-2.0macOS, Windows, LinuxLocalVariable selon le modèleOuiOuiOuiOuiLire l'avisShimmy
SwiftLMGratuitMITmacOS, iOSLocalVariable selon le modèleOuiOuiLire l'avisSwiftLM
TensorRT-LLMGratuitApache-2.0Windows, LinuxLocalVariable selon le modèleOuiLire l'avisTensorRT-LLM
text-generation-webuiGratuitAGPL-3.0Windows, Linux, macOSLocalVariable selon le modèleOuiOuiOuiOuiOuiLire l'avistext-generation-webui
TurboFieldfareGratuitApache-2.0macOSLocal2 Go de RAMOuiLire l'avisTurboFieldfare
vLLMGratuitApache-2.0LinuxLocalVariable selon le modèleOuiOuiOuiOuiOuiLire l'avisvLLM
vllm-mlxGratuitApache-2.0macOSLocalVariable selon le modèleOuiOuiLire l'avisvllm-mlx

« — » signifie que la documentation du projet ne le précise pas, et non que la fonctionnalité est absente. Les valeurs proviennent du README ou du site officiel de chaque projet et sont revérifiées lors de la mise à jour de l'avis d'un outil.

Moteurs d'inférence : ce qui les distingue

Runtimes et gestionnaires : ce qui les distingue

  • API compatible OpenAI. Docker Model Runner, Foundry Local, GPUStack, Jan, Lemonade et Osaurus documentent une API compatible OpenAI.
  • Application de bureau. GPT4All, Jan, LM Studio, Osaurus et Ypipe documentent une application de bureau installable.
  • Bibliothèque de modèles intégrée. Foundry Local, GPUStack, Jan, Lemonade, LM Studio et Ollama documentent un moyen intégré de trouver et de télécharger des modèles.
  • Mode sans interface ou serveur. DreamServer, GPUStack, Lemonade et Osaurus documentent un fonctionnement en service d'arrière-plan ou en serveur, sans interface graphique.
  • Licence et prix. Quatre des runtimes présentés ici sont sous Apache-2.0 et quatre sous MIT. LM Studio et Docker Model Runner sont propriétaires (LM Studio est gratuit à l'usage ; Docker Model Runner est fourni avec Docker Desktop), Msty est à code fermé avec une offre gratuite, et RunAnywhere et YPipe appliquent leurs propres conditions ou des conditions non documentées — consultez chaque avis.

Routeurs et passerelles : ce qui les distingue

  • Point d'accès compatible OpenAI. AIClient2API et litellm documentent un point d'accès compatible OpenAI.
  • Routage vers des modèles locaux. litellm documente les modèles locaux ou auto-hébergés (comme Ollama) parmi les fournisseurs qu'il prend en charge.
  • Basculement et répartition de charge. AIClient2API, ClawRouter et litellm documentent le basculement, les nouvelles tentatives ou la répartition de charge entre modèles ou fournisseurs.
  • Licence. Deux des quatre sont sous MIT, un sous GPL-3.0 et un sous Apache-2.0.

Ce que ce comparatif ne peut pas vous dire

  • Il compare des capacités documentées, pas des performances. Il ne dit rien des jetons par seconde, de la consommation de mémoire ou de la latence — PromptQuorum ne les a pas mesurés pour ces outils, et ils dépendent fortement de votre matériel et de votre modèle.
  • Les tirets correspondent à des lacunes de la documentation que nous avons consultée, pas à des constats négatifs. Certains outils peuvent prendre en charge une fonctionnalité que leur README ne mentionne pas ; c'est particulièrement visible pour quelques outils très répandus dont les README, courts, en disent peu (par exemple les fonctionnalités de moteur d'Ollama).
  • La prise en charge matérielle correspond à ce qu'indique la documentation, pas à la garantie d'une bonne expérience sur ce matériel ; lisez l'avis de l'outil pour connaître les prérequis réels.
  • Les outils évoluent vite. L'avis de chaque outil indique la version par rapport à laquelle il a été vérifié, et ce guide est actualisé lorsqu'un avis l'est.

Questions fréquentes

Quelle est la différence entre un moteur d'inférence, un runtime et une passerelle ?

Un moteur d'inférence exécute le modèle sur votre matériel (par exemple llama.cpp ou vLLM). Un runtime ou gestionnaire télécharge les modèles et les lance pour vous, souvent avec une application de bureau ou une bibliothèque de modèles (par exemple Ollama ou LM Studio). Un routeur ou une passerelle se place devant un ou plusieurs modèles ou fournisseurs et leur transmet les requêtes. Ils remplissent des fonctions différentes, c'est pourquoi ils sont comparés séparément.

Que signifie un tiret dans le tableau comparatif ?

Cela signifie que la documentation du projet n'indique pas cet attribut. Cela ne veut pas dire que la fonctionnalité est absente ; consultez l'avis de l'outil ou son dépôt.

Pourquoi Ollama figure-t-il dans deux groupes ?

Ollama est à la fois un moteur d'inférence et un runtime qui gère les modèles ; il est donc listé dans les deux. Son README indique peu des attributs comparés ici, si bien que beaucoup de ses cellules affichent un tiret.

L'un de ces outils a-t-il un lien d'affiliation ?

Non. PromptQuorum n'a, à la date de rédaction, aucune relation d'affiliation avec les outils de ce comparatif, et aucun lien présenté ici ne rapporte de commission.

À quelle fréquence ce comparatif est-il mis à jour ?

Il est actualisé deux fois par an, ainsi que chaque fois que l'avis de l'un des outils listés est mis à jour, car le tableau est généré à partir des mêmes données que ces avis.

Sources

← Retour aux LLM locaux avancés