Skip to main content
PromptQuorum
Início/LLMs locais avançados/TensorRT-LLM explicado: o motor de inferência otimizado para GPU da NVIDIA (2026)
Overview & Reference

TensorRT-LLM explicado: o motor de inferência otimizado para GPU da NVIDIA (2026)

·13 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

TensorRT-LLM é uma biblioteca gratuita e de código aberto (Apache 2.0) publicada pela NVIDIA que compila grandes modelos de linguagem em "motores" de inferência otimizados, construídos especificamente para GPUs da NVIDIA. Construído sobre o SDK de inferência de deep learning TensorRT da NVIDIA, ele adiciona técnicas específicas para LLMs, incluindo batching contínuo ("in-flight"), um cache KV paginado, kernels de atenção personalizados e suporte a quantização até FP8 e INT4, para elevar o throughput de inferência tanto quanto a geração de GPU alvo permitir. O trade-off definidor é a etapa de compilação antecipada: um modelo precisa ser construído em um motor específico para a GPU antes de poder atender tráfego, ao contrário do llama.cpp ou do vLLM, que carregam um modelo diretamente sem uma etapa de compilação separada. Em produção, o TensorRT-LLM é usado com mais frequência via NVIDIA Triton Inference Server ou empacotado dentro de microsserviços NVIDIA NIM, e visa o máximo throughput por GPU em hardware NVIDIA em implantações de datacenter e empresariais — não o chat de desktop para um único usuário.

O TensorRT-LLM é uma biblioteca de código aberto publicada pela NVIDIA sob a licença Apache 2.0 para compilar e otimizar a inferência de grandes modelos de linguagem especificamente em GPUs da NVIDIA. Em vez de carregar um modelo e executá-lo diretamente como fazem o llama.cpp ou o vLLM, o TensorRT-LLM compila um modelo antecipadamente em um "motor" otimizado, construído a partir de kernels CUDA personalizados ajustados para uma geração específica de GPU da NVIDIA. Essa etapa de compilação é a base de todo o seu design: em troca da etapa extra de build e da exigência de hardware exclusivamente NVIDIA, ele busca o máximo desempenho de inferência possível em GPUs NVIDIA, e é o motor por trás dos próprios microsserviços NIM da NVIDIA e um backend comum para o NVIDIA Triton Inference Server.

TensorRT-LLM explicado: o motor de inferência otimizado para GPU da NVIDIA (2026)

Principais conclusões

  • Gratuito e de código aberto sob licença Apache 2.0, publicado pela NVIDIA no GitHub
  • Construído sobre o SDK de inferência de deep learning TensorRT da NVIDIA, estendido com otimizações específicas para LLMs
  • Compila um modelo antecipadamente em um motor otimizado para uma GPU específica — uma etapa que vLLM e llama.cpp não exigem
  • Usa batching contínuo ("in-flight") e cache KV paginado para manter a utilização da GPU alta sob tráfego concorrente
  • Suporta quantização incluindo FP8, INT8, INT4, AWQ e GPTQ; os formatos mais novos exigem hardware NVIDIA atual
  • Roda apenas em GPUs NVIDIA — sem suporte a CPU, AMD, Apple Silicon ou outros fabricantes
  • Comumente implantado via NVIDIA Triton Inference Server ou empacotado dentro de microsserviços NVIDIA NIM
  • Construído para atendimento em produção em datacenters e empresas, não para chat de desktop de um único usuário

📍 Em uma frase

TensorRT-LLM é a biblioteca gratuita e de código aberto (Apache 2.0) da NVIDIA que compila LLMs em motores de inferência otimizados para uma GPU específica usando batching contínuo, cache KV paginado e quantização, visando throughput máximo em GPUs NVIDIA.

💬 Em termos simples

Em vez de simplesmente carregar um modelo e executá-lo, o TensorRT-LLM tem uma etapa extra de "build": você compila o modelo uma vez para sua GPU NVIDIA específica, e o motor resultante roda mais rápido nessa GPU do que um carregador genérico — mas só funciona em hardware NVIDIA e precisa ser reconstruído se você mudar de geração de GPU ou de modelo.

📌Nota: Este artigo é baseado no repositório oficial do GitHub do TensorRT-LLM da NVIDIA e em sua documentação pública, não em benchmarks independentes. Números específicos de throughput ou latência não são incluídos porque não foram medidos de forma independente para este artigo e variam muito conforme a geração da GPU, o modelo, a composição do batch e a versão do TensorRT-LLM. Este artigo descreve o TensorRT-LLM de forma factual como terceiro; não é afiliado nem endossado pela NVIDIA.

O que é o TensorRT-LLM?

TensorRT-LLM é uma biblioteca de código aberto publicada pela NVIDIA para otimizar e executar inferência de grandes modelos de linguagem em GPUs NVIDIA. Ela é construída sobre o TensorRT, o SDK geral de inferência de deep learning da NVIDIA, e adiciona uma camada de recursos de runtime específicos para LLMs e uma API Python para definir e compilar modelos em motores otimizados.

  • Publicada e mantida pela NVIDIA, distribuída como código aberto sob a licença Apache 2.0 no GitHub
  • Estende o SDK geral de inferência TensorRT da NVIDIA com otimizações específicas para transformers e LLMs
  • Oferece uma API Python (tensorrt_llm.LLM) e um fluxo de trabalho de linha de comando trtllm-build para compilar modelos
  • Inclui um comando trtllm-serve para levantar diretamente um endpoint compatível com OpenAI a partir de um motor já construído
  • Suporta muitas famílias populares de modelos abertos, embora o suporte exato por modelo e as etapas de conversão necessárias variem conforme a versão do TensorRT-LLM — verifique a documentação de modelos suportados do projeto antes de escolher um modelo

O que torna o TensorRT-LLM rápido?

A abordagem de desempenho do TensorRT-LLM combina uma etapa de compilação antecipada com várias otimizações de runtime específicas para LLMs, em vez de depender de uma única técnica.

  • Batching in-flight (o termo da NVIDIA para batching contínuo): novas requisições podem entrar em um batch em execução e requisições concluídas podem sair dele sem esperar o batch inteiro terminar, mantendo a GPU ocupada sob tráfego real e irregular
  • Cache KV paginado: o cache de chave-valor de atenção é gerenciado em blocos de tamanho fixo em vez de uma grande alocação por requisição, reduzindo o desperdício de memória de GPU — conceitualmente semelhante à abordagem de paginação popularizada pelo PagedAttention do vLLM
  • Kernels personalizados de atenção e GEMM: kernels CUDA ajustados manualmente para as operações que os LLMs mais executam, compilados e selecionados para a GPU alvo durante a etapa de build do motor
  • Compilação antecipada do motor: o grafo do modelo, a precisão escolhida e as seleções de kernel são fixados em um único arquivo de motor otimizado antes do início do atendimento, em vez de decididos dinamicamente no carregamento
  • Suporte a decodificação especulativa: a NVIDIA documenta técnicas de modelo rascunho e outros métodos de decodificação especulativa para gerar vários tokens candidatos por etapa e verificá-los em paralelo

Que hardware o TensorRT-LLM exige?

O TensorRT-LLM roda exclusivamente em GPUs NVIDIA — não existe backend somente CPU, AMD, Intel ou Apple Silicon. Dentro da própria linha de GPUs da NVIDIA, quais otimizações estão disponíveis depende da geração de arquitetura da GPU.

Blackwell (ex.: B200)

Detalhes:
A arquitetura suportada mais recente no momento desta redação. Adiciona suporte a FP4 (NVFP4) acelerado por hardware junto com o FP8, segundo a documentação da NVIDIA.

Hopper (ex.: H100, H200)

Detalhes:
Suporte a FP8 por hardware; documentado pela NVIDIA como um dos caminhos mais maduros para as otimizações mais novas de quantização e atenção do TensorRT-LLM.

Ada Lovelace (ex.: L4, L40S)

Detalhes:
Suportado, com INT8 (incluindo SmoothQuant) comumente usado como alternativa onde o suporte completo de ferramentas FP8 é mais restrito do que em Hopper/Blackwell.

Arquiteturas mais antigas (ex.: Ampere)

Detalhes:
Existe compatibilidade mais ampla para algumas GPUs de datacenter NVIDIA anteriores, mas os formatos de quantização e otimizações de kernel mais novos visam o hardware atual — consulte as notas de versão da NVIDIA para a matriz exata GPU/recurso da versão que você planeja usar.

Se o objetivo é rodar um modelo em um notebook, um Mac ou qualquer GPU que não seja NVIDIA, o TensorRT-LLM não é a ferramenta feita para isso — o llama.cpp e ferramentas construídas sobre ele, como Ollama e LM Studio, visam diretamente hardware CPU e Apple Silicon e são a opção melhor para esse cenário.

Quais formatos de quantização o TensorRT-LLM suporta?

O TensorRT-LLM suporta a execução de modelos com precisão numérica reduzida para diminuir o uso de memória e aumentar o throughput, com os formatos disponíveis dependendo da geração de GPU alvo.

FP8

Detalhes:
Ponto flutuante de 8 bits acelerado por hardware em GPUs Hopper e Blackwell; a NVIDIA documenta isso como geralmente o melhor equilíbrio entre precisão e throughput nessas gerações.

FP4 (NVFP4)

Detalhes:
Um formato de ponto flutuante de 4 bits exclusivo do Blackwell, documentado pela NVIDIA para GPUs de geração Blackwell e versões atuais da cadeia de ferramentas TensorRT/CUDA.

INT8 / INT4

Detalhes:
Caminhos de quantização inteira incluindo SmoothQuant, documentados como alternativa em gerações de GPU (como Ada) onde a cobertura completa de ferramentas FP8 é mais restrita.

AWQ / GPTQ

Detalhes:
Métodos estabelecidos pela comunidade de quantização de pesos em 4 bits, que o TensorRT-LLM suporta junto com suas próprias opções de precisão.

Este artigo não inclui números de perda de qualidade medidos de forma independente para cada formato em cada geração de GPU — isso varia conforme a arquitetura do modelo e a tarefa, então comparar saídas de alguns formatos com seus próprios prompts e hardware é a forma mais confiável de avaliar o trade-off.

Como o TensorRT-LLM é implantado?

O TensorRT-LLM pode ser executado diretamente por meio de seu próprio runtime Python/C++, mas em produção é mais comumente usado através de uma de duas camadas de implantação da NVIDIA construídas ao seu redor.

  • trtllm-serve: um comando incluído com o TensorRT-LLM que levanta um endpoint de API compatível com OpenAI diretamente a partir de um motor construído, sem um framework de atendimento separado
  • NVIDIA Triton Inference Server: uma plataforma de atendimento de modelos de propósito geral com um backend TensorRT-LLM, adicionando fila de requisições, orquestração multi-modelo e recursos de implantação de nível produção como integração com Kubernetes
  • NVIDIA NIM: microsserviços em contêiner já prontos, vendidos como parte de uma assinatura NVIDIA AI Enterprise, que empacotam um backend otimizado pelo TensorRT-LLM atrás de uma API padronizada com suporte do fabricante — veja a comparação de servidores de inferência empresariais para um olhar mais profundo sobre licenciamento e suporte do NIM

Como construir e executar um motor TensorRT-LLM?

O TensorRT-LLM requer uma GPU NVIDIA, um driver CUDA compatível e, tipicamente, a própria imagem de contêiner da NVIDIA para evitar incompatibilidades de versões de dependências, já que depende estreitamente de versões específicas da cadeia de ferramentas CUDA e TensorRT.

  1. 1
    Confirme que você tem uma GPU NVIDIA suportada (geração Hopper, Ada ou Blackwell para as otimizações mais novas) com um driver CUDA atual instalado.
  2. 2
    Baixe a imagem de contêiner oficial do TensorRT-LLM da NVIDIA, ou instale o pacote Python tensorrt_llm em um ambiente CUDA compatível — o caminho em contêiner evita a maioria das incompatibilidades de dependências.
  3. 3
    Converta ou carregue seu checkpoint de modelo de origem (por exemplo, do Hugging Face) usando a API Python do TensorRT-LLM ou scripts de conversão de exemplo para aquela família de modelo.
  4. 4
    Construa o motor otimizado para sua GPU específica com o comando trtllm-build, escolhendo uma precisão (FP16, FP8, INT4/INT8, ou FP4 no Blackwell) e uma configuração de batching no momento da construção.
  5. 5
    Inicie o motor construído, seja diretamente com trtllm-serve para um endpoint compatível com OpenAI, ou apontando o backend TensorRT-LLM do NVIDIA Triton Inference Server para o diretório do motor.
  6. 6
    Envie uma requisição de teste para o endpoint implantado (curl ou qualquer cliente compatível com a API OpenAI) para confirmar que o motor carrega e gera corretamente antes de rotear tráfego de produção para ele.
  7. 7
    Execute novamente a etapa de build sempre que mudar de geração de GPU, de modelo, ou quiser adotar uma nova versão do TensorRT-LLM — um motor construído para uma geração de GPU não tem garantia de funcionar de forma ideal, nem sequer de funcionar, em uma geração diferente.

Preciso reconstruir o motor para cada GPU?

Geralmente sim para resultados ideais — um motor é compilado com seleções de kernel e otimizações para uma geração de arquitetura de GPU específica, então mudar para outra geração de GPU tipicamente exige reconstruí-lo.

Posso usar um modelo pré-quantizado com o TensorRT-LLM?

Sim — o TensorRT-LLM suporta construir motores a partir de modelos quantizados com AWQ ou GPTQ, além de sua própria quantização FP8/INT8/INT4/FP4 aplicada durante a etapa de build.

Como o TensorRT-LLM se compara ao vLLM e ao llama.cpp?

TensorRT-LLM, vLLM e llama.cpp executam inferência de LLM, mas se posicionam em pontos diferentes do espectro entre desempenho e flexibilidade.

TensorRT-LLM

Detalhes:
Exclusivo da NVIDIA, licenciado sob Apache 2.0. Requer uma etapa de compilação antecipada por geração de GPU; visa o maior throughput possível naquele hardware NVIDIA específico em troca da etapa de build e de um lock-in de fabricante.

vLLM

Detalhes:
Licenciado sob Apache 2.0, carrega modelos compatíveis com Hugging Face Transformers diretamente sem etapa de compilação. GPUs NVIDIA são seu alvo principal, com backends AMD, Intel e TPU documentados (mais restritos).

llama.cpp

Detalhes:
Motor C/C++ licenciado sob MIT que roda em CPU, Apple Silicon e uma ampla gama de fabricantes de GPU via o formato de modelo GGUF — o mais flexível em hardware dos três, mas não construído para a escala multi-GPU de alta concorrência de datacenter que TensorRT-LLM e vLLM visam.

Este artigo não comparou de forma independente esses três motores entre si e não afirma que um seja universalmente mais rápido — o throughput depende muito do modelo, da geração de GPU, das características do batch e da versão de cada motor. A vantagem real do TensorRT-LLM é o desempenho de pico especificamente em hardware NVIDIA atual, ao custo da etapa de compilação e do suporte exclusivo à NVIDIA; o vLLM troca parte desse ajuste específico de pico por GPU por um fluxo de trabalho mais simples sem compilação e uma cobertura de hardware mais ampla (embora ainda majoritariamente NVIDIA); o llama.cpp troca ainda mais throughput de pico pela capacidade de rodar em hardware que nenhum dos outros dois atende, incluindo CPUs e Macs.

Como o TensorRT-LLM se relaciona com o NVIDIA NIM e o Triton?

TensorRT-LLM, NVIDIA NIM e NVIDIA Triton Inference Server não são concorrentes — são camadas diferentes da mesma stack de inferência da NVIDIA, e entender a diferença importa ao planejar uma implantação.

TensorRT-LLM

Detalhes:
O motor e o compilador: transforma um modelo em um motor de inferência otimizado e específico para a GPU. Gratuito e de código aberto (Apache 2.0); você mesmo opera.
Artigos sobre TensorRT-LLM (5)

Também mencionado em:

NVIDIA Triton Inference Server

Detalhes:
Uma plataforma de atendimento de modelos de propósito geral, gratuita e de código aberto, com um backend TensorRT-LLM, adicionando roteamento de requisições, hospedagem multi-modelo e orquestração de produção ao redor de um ou mais motores.

NVIDIA NIM

Detalhes:
Uma camada de microsserviços pagos e já construídos, vendida como parte de uma assinatura NVIDIA AI Enterprise, que empacota um backend otimizado pelo TensorRT-LLM atrás de uma API padronizada com suporte do fabricante — trocando o esforço de configuração própria por um contêiner com suporte e pronto para implantar.

Um caminho comum é: compilar o modelo em um motor TensorRT-LLM e depois servi-lo via Triton para uma implantação de produção autogerenciada, ou pular a etapa de compilação inteiramente usando um contêiner NIM já pronto se a assinatura paga e o suporte do fabricante valerem a pena para sua equipe. Veja a comparação de servidores de inferência empresariais para os trade-offs de licenciamento e custo entre NIM, vLLM e TGI.

Para quem é o TensorRT-LLM?

O TensorRT-LLM se encaixa em equipes que já se comprometeram com hardware GPU NVIDIA e precisam do máximo throughput de inferência possível dele, não em pessoas procurando a forma mais simples de rodar um modelo.

TensorRT-LLM vs. alternativas em resumo

Essas ferramentas se posicionam em pontos diferentes do espectro entre complexidade de configuração e desempenho de pico.

TensorRT-LLM

Configuração:
Compilar um motor específico para a GPU com trtllm-build, depois servi-lo com trtllm-serve ou Triton. GPU NVIDIA e CUDA exigidos.
Ideal para:
Throughput máximo por GPU em hardware NVIDIA em produção, ao custo de uma etapa de compilação.

vLLM

Configuração:
Pacote Python via pip; servidor compatível com OpenAI iniciado com vllm serve. Sem etapa de compilação; alvo principal GPU NVIDIA.
Ideal para:
Atendimento multiusuário de alto throughput com um fluxo de trabalho mais simples sem compilação.

llama.cpp

Configuração:
CLI, interface web integrada e API compatível com OpenAI via llama-server. Roda em CPU ou uma ampla gama de fabricantes de GPU.
Ideal para:
Flexibilidade de hardware, implantação embarcada/de borda, e uso em CPU ou Apple Silicon.

NVIDIA NIM

Configuração:
Contêiner já pronto, implantado com uma assinatura paga do NVIDIA AI Enterprise. Sem etapa de build para o usuário final.
Ideal para:
Equipes que querem o desempenho do TensorRT-LLM sem operar o pipeline de build por conta própria.

Este artigo não comparou de forma independente a velocidade ou a qualidade de saída dessas ferramentas e não afirma que uma seja tecnicamente superior para toda carga de trabalho — a comparação acima cobre apenas fatos documentados de arquitetura, configuração e licenciamento. Veja o guia de servidores de inferência empresariais para uma comparação mais profunda de licenciamento e implantação.

O que este artigo não cobre?

Este é um artigo explicativo construído a partir da documentação pública e do repositório da NVIDIA, não um relatório de benchmark prático.

  • Nenhum número de throughput, latência ou requisições por segundo medido de forma independente — esses dependem muito da geração de GPU, do modelo, da composição do batch e da versão do TensorRT-LLM
  • Nenhum percentual de perda de qualidade verificado de forma independente para formatos de quantização específicos em GPUs específicas — isso varia conforme a arquitetura do modelo e a tarefa
  • Nenhuma cobertura completa de cada arquitetura de modelo suportada, opção de kernel ou recurso avançado (atendimento desagregado, paralelismo de especialistas, LoRA) — este artigo foca nos conceitos que a maioria das equipes avalia primeiro
  • Nenhuma cobertura de preços do NVIDIA AI Enterprise ou NIM, já que preços de assinatura empresarial não são publicados como os de um produto de varejo — confirme preços atuais diretamente com a NVIDIA
  • Nenhuma alegação de endosso ou parceria com a NVIDIA — este artigo descreve o TensorRT-LLM de forma factual como uma explicação independente de terceiro baseada em fontes públicas

Erros comuns ao experimentar o TensorRT-LLM

A maior parte do atrito com o TensorRT-LLM vem de subestimar a etapa de build/compilação ou esperar que ele se comporte como um motor de carregamento direto.

Perguntas frequentes

O que é o TensorRT-LLM?

TensorRT-LLM é uma biblioteca gratuita e de código aberto (Apache 2.0) publicada pela NVIDIA que compila grandes modelos de linguagem em motores de inferência otimizados construídos especificamente para GPUs NVIDIA, sobre o SDK de inferência de deep learning TensorRT da NVIDIA.

O TensorRT-LLM é gratuito?

Sim. O TensorRT-LLM em si é software gratuito e de código aberto lançado sob a licença Apache 2.0. O NVIDIA NIM, uma camada de microsserviços paga separada que empacota um backend TensorRT-LLM, exige uma assinatura NVIDIA AI Enterprise.

O TensorRT-LLM roda em GPUs AMD ou Apple?

Não. O TensorRT-LLM roda exclusivamente em GPUs NVIDIA — não existe backend somente CPU, AMD, Intel ou Apple Silicon, ao contrário do vLLM ou do llama.cpp, que suportam hardware mais amplo.

Por que o TensorRT-LLM exige compilar um modelo primeiro?

O TensorRT-LLM constrói um modelo antecipadamente em um motor com seleções de kernel e otimizações fixadas para uma geração de arquitetura de GPU específica, que é como ele atinge sua meta de desempenho. Isso troca uma etapa de build e menos flexibilidade entre hardware por maior throughput de pico naquela GPU NVIDIA específica, comparado a motores que decidem tudo dinamicamente no carregamento.

Quais formatos de quantização o TensorRT-LLM suporta?

O TensorRT-LLM suporta FP8 e FP4 (FP4 exclusivo de GPUs de geração Blackwell), INT8 e INT4 incluindo SmoothQuant, e formatos da comunidade como AWQ e GPTQ, com a disponibilidade exata dependendo da geração de GPU alvo.

O TensorRT-LLM é melhor que o vLLM?

"Melhor" depende do uso: o TensorRT-LLM visa o máximo throughput por GPU possível especificamente em hardware NVIDIA, ao custo de uma etapa de compilação antecipada e suporte exclusivo à NVIDIA. O vLLM carrega modelos diretamente sem etapa de compilação e documenta suporte a backends além das GPUs NVIDIA. Nenhum é universalmente mais rápido — veja a tabela comparativa acima.

Qual a diferença entre o TensorRT-LLM e o NVIDIA NIM?

O TensorRT-LLM é o motor e compilador gratuito e de código aberto que você mesmo opera. O NVIDIA NIM é uma camada de microsserviços paga separada que empacota um backend otimizado pelo TensorRT-LLM atrás de uma API padronizada com suporte do fabricante, vendida como parte de uma assinatura NVIDIA AI Enterprise.

O TensorRT-LLM pode atender modelos em várias GPUs?

Sim. A NVIDIA documenta suporte a atendimento multi-GPU e multi-nó no TensorRT-LLM para modelos grandes demais para caber em uma única GPU, tipicamente implantado via NVIDIA Triton Inference Server para a orquestração em produção.

Fontes

← Voltar para LLMs locais avançados