Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/TensorRT-LLM expliqué : le moteur d'inférence optimisé GPU de NVIDIA (2026)
Overview & Reference

TensorRT-LLM expliqué : le moteur d'inférence optimisé GPU de NVIDIA (2026)

·13 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

TensorRT-LLM est une bibliothèque gratuite et open source (Apache 2.0) publiée par NVIDIA qui compile de grands modèles de langage en « moteurs » d'inférence optimisés, construits spécifiquement pour les GPU NVIDIA. Construit sur le SDK d'inférence deep learning TensorRT de NVIDIA, il ajoute des techniques spécifiques aux LLM, dont le batching continu (« in-flight »), un cache KV paginé, des noyaux d'attention personnalisés et une prise en charge de la quantification jusqu'à FP8 et INT4, afin de pousser le débit d'inférence aussi loin que la génération de GPU cible le permet. Le compromis déterminant est cette étape de compilation en amont : un modèle doit être construit en un moteur spécifique au GPU avant de pouvoir servir du trafic, contrairement à llama.cpp ou vLLM, qui chargent un modèle directement sans étape de compilation séparée. En production, TensorRT-LLM est le plus souvent utilisé via NVIDIA Triton Inference Server ou intégré dans des microservices NVIDIA NIM, et vise un débit maximal par GPU sur du matériel NVIDIA dans des déploiements de datacenter et d'entreprise — pas le chat de bureau pour un seul utilisateur.

TensorRT-LLM est une bibliothèque open source publiée par NVIDIA sous licence Apache 2.0, destinée à compiler et optimiser l'inférence de grands modèles de langage spécifiquement pour les GPU NVIDIA. Plutôt que de charger un modèle et de l'exécuter directement comme le font llama.cpp ou vLLM, TensorRT-LLM compile un modèle à l'avance en un « moteur » optimisé, construit à partir de noyaux CUDA personnalisés réglés pour une génération précise de GPU NVIDIA. Cette étape de compilation est au cœur de toute sa conception : en échange de cette étape de build supplémentaire et de l'exigence de matériel exclusivement NVIDIA, il vise la performance d'inférence la plus élevée possible sur GPU NVIDIA, et c'est le moteur derrière les microservices NIM de NVIDIA ainsi qu'un backend courant pour NVIDIA Triton Inference Server.

TensorRT-LLM expliqué : le moteur d'inférence optimisé GPU de NVIDIA (2026)

Points clés

  • Gratuit et open source sous licence Apache 2.0, publié par NVIDIA sur GitHub
  • Construit sur le SDK d'inférence deep learning TensorRT de NVIDIA, étendu avec des optimisations spécifiques aux LLM
  • Compile un modèle à l'avance en un moteur optimisé pour un GPU précis — une étape que vLLM et llama.cpp n'exigent pas
  • Utilise le batching continu (« in-flight ») et un cache KV paginé pour maintenir une utilisation élevée du GPU sous trafic concurrent
  • Prend en charge la quantification incluant FP8, INT8, INT4, AWQ et GPTQ ; les formats les plus récents nécessitent du matériel NVIDIA actuel
  • Fonctionne uniquement sur GPU NVIDIA — aucune prise en charge CPU, AMD, Apple Silicon ou autre constructeur
  • Couramment déployé via NVIDIA Triton Inference Server ou intégré dans des microservices NVIDIA NIM
  • Conçu pour le service en production dans les datacenters et l'entreprise, pas pour le chat de bureau mono-utilisateur

📍 En une phrase

TensorRT-LLM est la bibliothèque gratuite et open source (Apache 2.0) de NVIDIA qui compile les LLM en moteurs d'inférence optimisés pour un GPU spécifique, via le batching continu, un cache KV paginé et la quantification, dans le but d'un débit maximal sur GPU NVIDIA.

💬 En termes simples

Au lieu de simplement charger un modèle et l'exécuter, TensorRT-LLM ajoute une étape de « build » : on compile le modèle une fois pour son propre GPU NVIDIA, et le moteur obtenu tourne plus vite sur ce GPU qu'un chargeur générique — mais il ne fonctionne que sur du matériel NVIDIA et doit être recompilé en cas de changement de génération de GPU ou de modèle.

📌Remarque: Cet article s'appuie sur le dépôt GitHub officiel de TensorRT-LLM de NVIDIA et sa documentation publique, pas sur des benchmarks indépendants. Les chiffres précis de débit ou de latence ne sont pas inclus car ils n'ont pas été mesurés indépendamment pour cet article et varient fortement selon la génération de GPU, le modèle, la composition des lots et la version de TensorRT-LLM. Cet article décrit TensorRT-LLM de façon factuelle en tant que tiers ; il n'est ni affilié à NVIDIA ni approuvé par NVIDIA.

Qu'est-ce que TensorRT-LLM ?

TensorRT-LLM est une bibliothèque open source publiée par NVIDIA pour optimiser et exécuter l'inférence de grands modèles de langage sur GPU NVIDIA. Elle est construite au-dessus de TensorRT, le SDK d'inférence deep learning généraliste de NVIDIA, et y ajoute une couche de fonctionnalités d'exécution spécifiques aux LLM ainsi qu'une API Python pour définir et compiler des modèles en moteurs optimisés.

  • Publiée et maintenue par NVIDIA, distribuée en open source sous licence Apache 2.0 sur GitHub
  • Étend le SDK d'inférence TensorRT généraliste de NVIDIA avec des optimisations spécifiques aux transformeurs et aux LLM
  • Fournit une API Python (tensorrt_llm.LLM) ainsi qu'un workflow en ligne de commande trtllm-build pour compiler les modèles
  • Inclut une commande trtllm-serve pour déployer directement un point de terminaison compatible OpenAI à partir d'un moteur construit
  • Prend en charge de nombreuses familles de modèles ouverts populaires, bien que le support exact par modèle et les étapes de conversion nécessaires varient selon la version de TensorRT-LLM — vérifiez la documentation des modèles pris en charge du projet avant de choisir un modèle

Pourquoi TensorRT-LLM est-il rapide ?

L'approche de performance de TensorRT-LLM combine une étape de compilation en amont avec plusieurs optimisations d'exécution spécifiques aux LLM, plutôt que de s'appuyer sur une seule technique.

  • Batching continu (« in-flight », le terme de NVIDIA) : de nouvelles requêtes peuvent rejoindre un lot en cours d'exécution et des requêtes terminées peuvent le quitter sans attendre la fin du lot entier, ce qui maintient le GPU occupé sous un trafic réel et irrégulier
  • Cache KV paginé : le cache clé-valeur d'attention est géré en blocs de taille fixe plutôt qu'en une grande allocation par requête, réduisant le gaspillage de mémoire GPU — un concept proche de l'approche de pagination popularisée par PagedAttention de vLLM
  • Noyaux d'attention et GEMM personnalisés : des noyaux CUDA finement réglés pour les opérations les plus exécutées par les LLM, compilés et sélectionnés pour le GPU cible pendant l'étape de compilation du moteur
  • Compilation du moteur en amont : le graphe du modèle, la précision choisie et les sélections de noyaux sont figés dans un seul fichier de moteur optimisé avant le démarrage du service, plutôt que décidés dynamiquement au chargement
  • Prise en charge du décodage spéculatif : NVIDIA documente des techniques de modèle brouillon (« draft model ») et d'autres méthodes de décodage spéculatif pour générer plusieurs jetons candidats par étape et les vérifier en parallèle

Quel matériel TensorRT-LLM nécessite-t-il ?

TensorRT-LLM fonctionne exclusivement sur GPU NVIDIA — il n'existe aucun backend CPU seul, AMD, Intel ou Apple Silicon. Au sein même de la gamme de GPU NVIDIA, les optimisations disponibles dépendent de la génération d'architecture du GPU.

Blackwell (ex. B200)

Détails:
L'architecture prise en charge la plus récente au moment de la rédaction. Ajoute une prise en charge matérielle FP4 (NVFP4) en plus de FP8, selon la documentation de NVIDIA.

Hopper (ex. H100, H200)

Détails:
Prise en charge matérielle FP8 ; documentée par NVIDIA comme l'une des voies les plus mûres pour les optimisations de quantification et d'attention les plus récentes de TensorRT-LLM.

Ada Lovelace (ex. L4, L40S)

Détails:
Prise en charge, avec INT8 (y compris SmoothQuant) couramment utilisé comme solution de repli là où la prise en charge complète des outils FP8 est plus limitée que sur Hopper/Blackwell.

Architectures plus anciennes (ex. Ampere)

Détails:
Une compatibilité plus large existe pour certains GPU de datacenter NVIDIA antérieurs, mais les formats de quantification et optimisations de noyaux les plus récents ciblent le matériel actuel — consultez les notes de version de NVIDIA pour la matrice exacte GPU/fonctionnalité de la version envisagée.

Pour exécuter un modèle sur un ordinateur portable, un Mac ou un GPU non NVIDIA, TensorRT-LLM n'est pas l'outil conçu pour cela — llama.cpp et les outils construits dessus, comme Ollama et LM Studio, ciblent directement le matériel CPU et Apple Silicon et conviennent mieux à ce scénario.

Quels formats de quantification TensorRT-LLM prend-il en charge ?

TensorRT-LLM permet d'exécuter des modèles à précision numérique réduite pour diminuer l'usage mémoire et augmenter le débit, les formats disponibles dépendant de la génération de GPU cible.

FP8

Détails:
Virgule flottante 8 bits accélérée matériellement sur les GPU Hopper et Blackwell ; NVIDIA documente ce format comme généralement le meilleur compromis précision/débit sur ces générations.

FP4 (NVFP4)

Détails:
Un format virgule flottante 4 bits exclusif à Blackwell, documenté par NVIDIA pour les GPU de génération Blackwell et les versions actuelles de la chaîne d'outils TensorRT/CUDA.

INT8 / INT4

Détails:
Chemins de quantification entière incluant SmoothQuant, documentés comme solution de repli sur les générations de GPU (comme Ada) où la couverture complète des outils FP8 est plus limitée.

AWQ / GPTQ

Détails:
Méthodes de quantification des poids en 4 bits établies par la communauté, que TensorRT-LLM prend en charge en complément de ses propres options de précision.

Cet article ne présente pas de chiffres de perte de qualité mesurés indépendamment pour chaque format sur chaque génération de GPU — ces valeurs varient selon l'architecture du modèle et la tâche ; comparer les sorties de plusieurs formats sur vos propres prompts et votre propre matériel reste la méthode la plus fiable pour évaluer le compromis.

Comment TensorRT-LLM est-il déployé ?

TensorRT-LLM peut être exécuté directement via son propre runtime Python/C++, mais en production il est le plus souvent utilisé via l'une de deux couches de déploiement NVIDIA construites autour de lui.

  • trtllm-serve : une commande incluse avec TensorRT-LLM qui déploie un point de terminaison API compatible OpenAI directement à partir d'un moteur construit, sans framework de service séparé
  • NVIDIA Triton Inference Server : une plateforme de service de modèles généraliste avec un backend TensorRT-LLM, ajoutant la mise en file d'attente des requêtes, l'orchestration multi-modèles et des fonctionnalités de déploiement de niveau production comme l'intégration Kubernetes
  • NVIDIA NIM : des microservices conteneurisés prêts à l'emploi, vendus dans le cadre d'un abonnement NVIDIA AI Enterprise, qui intègrent un backend optimisé par TensorRT-LLM derrière une API standardisée avec support constructeur — voir la comparaison des serveurs d'inférence d'entreprise pour un examen plus approfondi de la licence et du support de NIM

Comment construire et exécuter un moteur TensorRT-LLM ?

TensorRT-LLM nécessite un GPU NVIDIA, un pilote CUDA correspondant, et généralement l'image de conteneur officielle de NVIDIA pour éviter les incompatibilités de dépendances, car il dépend étroitement de versions précises de la chaîne d'outils CUDA et TensorRT.

  1. 1
    Vérifiez que vous disposez d'un GPU NVIDIA pris en charge (génération Hopper, Ada ou Blackwell pour les optimisations les plus récentes) avec un pilote CUDA à jour installé.
  2. 2
    Récupérez l'image de conteneur officielle TensorRT-LLM de NVIDIA, ou installez le paquet Python tensorrt_llm dans un environnement CUDA correspondant — la voie conteneurisée évite la plupart des incompatibilités de dépendances.
  3. 3
    Convertissez ou chargez votre checkpoint de modèle source (par exemple depuis Hugging Face) via l'API Python de TensorRT-LLM ou les scripts de conversion d'exemple pour cette famille de modèles.
  4. 4
    Construisez le moteur optimisé pour votre GPU spécifique avec la commande trtllm-build, en choisissant une précision (FP16, FP8, INT4/INT8, ou FP4 sur Blackwell) et une configuration de batching au moment de la construction.
  5. 5
    Lancez le moteur construit, soit directement avec trtllm-serve pour un point de terminaison compatible OpenAI, soit en pointant le backend TensorRT-LLM de NVIDIA Triton Inference Server vers le répertoire du moteur.
  6. 6
    Envoyez une requête de test au point de terminaison déployé (curl ou tout client compatible avec l'API OpenAI) pour confirmer que le moteur se charge et génère correctement avant d'y router du trafic de production.
  7. 7
    Relancez l'étape de construction chaque fois que vous changez de génération de GPU, de modèle, ou souhaitez adopter une nouvelle version de TensorRT-LLM — un moteur construit pour une génération de GPU n'est pas garanti de fonctionner de façon optimale, ni même de fonctionner, sur une génération différente.

Dois-je reconstruire le moteur pour chaque GPU ?

Généralement oui pour des résultats optimaux — un moteur est compilé avec des sélections de noyaux et des optimisations pour une génération d'architecture GPU précise, donc passer à une autre génération nécessite typiquement une reconstruction.

Puis-je utiliser un modèle pré-quantifié avec TensorRT-LLM ?

Oui — TensorRT-LLM prend en charge la construction de moteurs à partir de modèles quantifiés avec AWQ ou GPTQ, en plus de sa propre quantification FP8/INT8/INT4/FP4 appliquée lors de l'étape de construction.

Comment TensorRT-LLM se compare-t-il à vLLM et llama.cpp ?

TensorRT-LLM, vLLM et llama.cpp exécutent tous de l'inférence LLM, mais se positionnent différemment entre performance et flexibilité.

TensorRT-LLM

Détails:
Exclusivement NVIDIA, sous licence Apache 2.0. Nécessite une étape de compilation en amont par génération de GPU ; vise le débit le plus élevé possible sur ce matériel NVIDIA précis, en échange de l'étape de build et d'un verrouillage constructeur.

vLLM

Détails:
Sous licence Apache 2.0, charge directement les modèles compatibles Hugging Face Transformers sans étape de compilation. Les GPU NVIDIA sont sa cible principale, avec des backends AMD, Intel et TPU documentés (plus restreints).

llama.cpp

Détails:
Moteur C/C++ sous licence MIT, fonctionnant sur CPU, Apple Silicon et un large éventail de fabricants de GPU via le format de modèle GGUF — le plus flexible des trois côté matériel, mais pas conçu pour l'échelle multi-GPU haute concurrence des datacenters que visent TensorRT-LLM et vLLM.

Cet article n'a pas comparé ces trois moteurs par des benchmarks indépendants et ne prétend pas que l'un soit universellement plus rapide — le débit dépend fortement du modèle, de la génération de GPU, des caractéristiques du lot et de la version de chaque moteur. L'avantage réel de TensorRT-LLM est la performance de pointe spécifiquement sur du matériel NVIDIA actuel, au prix de l'étape de compilation et d'un support exclusivement NVIDIA ; vLLM échange une partie de cette optimisation de pointe spécifique au GPU contre un workflow plus simple sans compilation et une couverture matérielle plus large (bien que toujours principalement NVIDIA) ; llama.cpp échange davantage de débit de pointe contre la capacité de fonctionner sur du matériel que ni l'un ni l'autre ne cible, y compris les CPU et les Mac.

Quelle relation entre TensorRT-LLM, NVIDIA NIM et Triton ?

TensorRT-LLM, NVIDIA NIM et NVIDIA Triton Inference Server ne sont pas concurrents — ce sont différentes couches de la même pile d'inférence NVIDIA, et comprendre la différence compte pour planifier un déploiement.

TensorRT-LLM

Détails:
Le moteur et le compilateur : transforme un modèle en un moteur d'inférence optimisé et spécifique au GPU. Gratuit et open source (Apache 2.0) ; exploité par vous-même.
Articles sur TensorRT-LLM (5)

Également mentionné dans :

NVIDIA Triton Inference Server

Détails:
Une plateforme de service de modèles généraliste, gratuite et open source, avec un backend TensorRT-LLM, ajoutant routage des requêtes, hébergement multi-modèles et orchestration de production autour d'un ou plusieurs moteurs.

NVIDIA NIM

Détails:
Une couche de microservices prêts à l'emploi et payante, vendue dans le cadre d'un abonnement NVIDIA AI Enterprise, qui intègre un backend optimisé par TensorRT-LLM derrière une API standardisée avec support constructeur — échangeant l'effort de configuration manuelle contre un conteneur pris en charge et prêt à déployer.

Un chemin courant : compiler le modèle en moteur TensorRT-LLM, puis le servir via Triton pour un déploiement en production auto-géré, ou sauter entièrement l'étape de compilation en utilisant un conteneur NIM prêt à l'emploi si l'abonnement payant et le support constructeur en valent la peine pour votre équipe. Voir la comparaison des serveurs d'inférence d'entreprise pour les compromis de licence et de coût entre NIM, vLLM et TGI.

À qui s'adresse TensorRT-LLM ?

TensorRT-LLM convient aux équipes qui se sont engagées sur du matériel GPU NVIDIA et qui ont besoin du débit d'inférence le plus élevé possible à partir de celui-ci, pas aux personnes cherchant le moyen le plus simple d'exécuter un modèle.

TensorRT-LLM vs. alternatives en un coup d'œil

Ces outils se positionnent différemment entre complexité de mise en place et performance de pointe.

TensorRT-LLM

Mise en place:
Compiler un moteur spécifique au GPU avec trtllm-build, puis le servir avec trtllm-serve ou Triton. GPU NVIDIA et CUDA requis.
Idéal pour:
Débit maximal par GPU sur matériel NVIDIA en production, au prix d'une étape de compilation.

vLLM

Mise en place:
Paquet Python via pip ; serveur compatible OpenAI démarré avec vllm serve. Pas d'étape de compilation ; cible principale GPU NVIDIA.
Idéal pour:
Service haut débit multi-utilisateurs avec un workflow plus simple sans compilation.

llama.cpp

Mise en place:
CLI, interface web intégrée et API compatible OpenAI via llama-server. Fonctionne sur CPU ou un large éventail de fabricants de GPU.
Idéal pour:
Flexibilité matérielle, déploiement embarqué/en périphérie, et usage CPU ou Apple Silicon.

NVIDIA NIM

Mise en place:
Conteneur prêt à l'emploi, déployé avec un abonnement payant NVIDIA AI Enterprise. Aucune étape de build pour l'utilisateur final.
Idéal pour:
Équipes voulant la performance de TensorRT-LLM sans exploiter le pipeline de build elles-mêmes.

Cet article n'a pas comparé indépendamment la vitesse ou la qualité de sortie de ces outils et ne prétend pas que l'un soit techniquement supérieur pour toutes les charges de travail — la comparaison ci-dessus couvre uniquement des faits documentés d'architecture, de mise en place et de licence. Voir le guide des serveurs d'inférence d'entreprise pour une comparaison plus approfondie de licence et de déploiement.

Que ne couvre pas cet article ?

Ceci est un article explicatif construit à partir de la documentation publique et du dépôt de NVIDIA, pas un rapport de benchmark pratique.

  • Aucun chiffre de débit, de latence ou de requêtes par seconde mesuré indépendamment — ces valeurs dépendent fortement de la génération de GPU, du modèle, de la composition des lots et de la version de TensorRT-LLM
  • Aucun pourcentage de perte de qualité vérifié indépendamment pour des formats de quantification spécifiques sur des GPU spécifiques — ces valeurs varient selon l'architecture du modèle et la tâche
  • Aucune couverture complète de chaque architecture de modèle prise en charge, option de noyau ou fonctionnalité avancée (service désagrégé, parallélisme d'experts, LoRA) — cet article se concentre sur les concepts que la plupart des équipes évaluent en premier
  • Aucune couverture des tarifs de NVIDIA AI Enterprise ou NIM, les tarifs d'abonnement entreprise n'étant pas publiés comme ceux d'un produit grand public — vérifiez les tarifs actuels directement auprès de NVIDIA
  • Aucune revendication d'approbation ou de partenariat NVIDIA — cet article décrit TensorRT-LLM de façon factuelle en tant qu'explication indépendante et tierce basée sur des sources publiques

Erreurs courantes en essayant TensorRT-LLM

La plupart des difficultés avec TensorRT-LLM viennent d'une sous-estimation de l'étape de build/compilation ou d'une attente qu'il se comporte comme un moteur à chargement direct.

Questions fréquemment posées

Qu'est-ce que TensorRT-LLM ?

TensorRT-LLM est une bibliothèque gratuite et open source (Apache 2.0) publiée par NVIDIA qui compile de grands modèles de langage en moteurs d'inférence optimisés construits spécifiquement pour les GPU NVIDIA, bâtie sur le SDK d'inférence deep learning TensorRT de NVIDIA.

TensorRT-LLM est-il gratuit ?

Oui. TensorRT-LLM lui-même est un logiciel gratuit et open source publié sous licence Apache 2.0. NVIDIA NIM, une couche de microservices payante distincte qui intègre un backend TensorRT-LLM, nécessite un abonnement NVIDIA AI Enterprise.

TensorRT-LLM fonctionne-t-il sur des GPU AMD ou Apple ?

Non. TensorRT-LLM fonctionne exclusivement sur GPU NVIDIA — il n'existe aucun backend CPU seul, AMD, Intel ou Apple Silicon, contrairement à vLLM ou llama.cpp, qui prennent en charge un matériel plus large.

Pourquoi TensorRT-LLM exige-t-il de compiler un modèle d'abord ?

TensorRT-LLM construit un modèle à l'avance en un moteur avec des sélections de noyaux et des optimisations figées pour une génération d'architecture GPU précise, ce qui lui permet d'atteindre son objectif de performance. Cela échange une étape de build et moins de flexibilité multi-matériel contre un débit de pointe plus élevé sur ce GPU NVIDIA précis, comparé à des moteurs qui décident de tout dynamiquement au chargement.

Quels formats de quantification TensorRT-LLM prend-il en charge ?

TensorRT-LLM prend en charge FP8 et FP4 (FP4 exclusif aux GPU de génération Blackwell), INT8 et INT4 incluant SmoothQuant, ainsi que des formats communautaires comme AWQ et GPTQ, la disponibilité exacte dépendant de la génération de GPU cible.

TensorRT-LLM est-il meilleur que vLLM ?

« Meilleur » dépend de l'usage : TensorRT-LLM vise le débit par GPU le plus élevé possible spécifiquement sur matériel NVIDIA, au prix d'une étape de compilation en amont et d'un support exclusivement NVIDIA. vLLM charge les modèles directement sans étape de compilation et documente une prise en charge de backends au-delà des seuls GPU NVIDIA. Aucun des deux n'est universellement plus rapide — voir le tableau comparatif ci-dessus.

Quelle est la différence entre TensorRT-LLM et NVIDIA NIM ?

TensorRT-LLM est le moteur et le compilateur gratuits et open source que vous exploitez vous-même. NVIDIA NIM est une couche de microservices payante distincte qui intègre un backend optimisé par TensorRT-LLM derrière une API standardisée avec support constructeur, vendue dans le cadre d'un abonnement NVIDIA AI Enterprise.

TensorRT-LLM peut-il servir des modèles sur plusieurs GPU ?

Oui. NVIDIA documente une prise en charge du service multi-GPU et multi-nœud dans TensorRT-LLM pour les modèles trop grands pour tenir sur un seul GPU, généralement déployée via NVIDIA Triton Inference Server pour l'orchestration en production.

Sources

← Retour aux LLM locaux avancés