Conclusiones clave
- Gratuito y de código abierto bajo licencia Apache 2.0, publicado por NVIDIA en GitHub
- Construido sobre el SDK de inferencia de aprendizaje profundo TensorRT de NVIDIA, extendido con optimizaciones específicas para LLM
- Compila un modelo por adelantado en un motor optimizado para una GPU específica — un paso que vLLM y llama.cpp no requieren
- Usa batching continuo ("en vuelo") y una caché KV paginada para mantener alta la utilización de la GPU bajo tráfico concurrente
- Admite cuantización incluyendo FP8, INT8, INT4, AWQ y GPTQ; los formatos más nuevos requieren hardware NVIDIA actual
- Solo funciona en GPU de NVIDIA — sin soporte para CPU, AMD, Apple Silicon u otros fabricantes
- Se despliega comúnmente mediante NVIDIA Triton Inference Server o empaquetado dentro de microservicios NVIDIA NIM
- Construido para servicio de producción en centros de datos y empresas, no para chat de escritorio de un solo usuario
📍 En una frase
TensorRT-LLM es la biblioteca gratuita y de código abierto (Apache 2.0) de NVIDIA que compila LLM en motores de inferencia optimizados para una GPU específica mediante batching continuo, caché KV paginada y cuantización, con el objetivo de un rendimiento máximo en GPU de NVIDIA.
💬 En términos simples
En lugar de simplemente cargar un modelo y ejecutarlo, TensorRT-LLM añade un paso de "compilación": se compila el modelo una vez para tu GPU de NVIDIA específica, y el motor resultante corre más rápido en esa GPU que un cargador genérico — pero solo funciona en hardware NVIDIA y necesita recompilarse si cambias de generación de GPU o de modelo.
📌Nota: Este artículo se basa en el repositorio oficial de GitHub de TensorRT-LLM de NVIDIA y su documentación pública, no en pruebas de rendimiento independientes. No se incluyen cifras específicas de rendimiento o latencia porque no se midieron de forma independiente para este artículo y varían mucho según la generación de GPU, el modelo, la composición del lote y la versión de TensorRT-LLM. Este artículo describe TensorRT-LLM de forma objetiva como un tercero; no está afiliado ni respaldado por NVIDIA.
¿Qué es TensorRT-LLM?
TensorRT-LLM es una biblioteca de código abierto publicada por NVIDIA para optimizar y ejecutar inferencia de modelos de lenguaje grandes en GPU de NVIDIA. Está construida sobre TensorRT, el SDK general de inferencia de aprendizaje profundo de NVIDIA, y añade una capa de funciones de tiempo de ejecución específicas para LLM y una API de Python para definir y compilar modelos en motores optimizados.
- Publicada y mantenida por NVIDIA, distribuida como código abierto bajo licencia Apache 2.0 en GitHub
- Extiende el SDK general de inferencia TensorRT de NVIDIA con optimizaciones específicas para transformadores y LLM
- Ofrece una API de Python (
tensorrt_llm.LLM) y un flujo de trabajo de línea de comandostrtllm-buildpara compilar modelos - Incluye un comando
trtllm-servepara levantar directamente un endpoint compatible con OpenAI a partir de un motor ya construido - Admite muchas familias populares de modelos abiertos, aunque el soporte exacto por modelo y los pasos de conversión necesarios varían según la versión de TensorRT-LLM — revisa la documentación de modelos soportados del proyecto antes de elegir un modelo
¿Qué hace rápido a TensorRT-LLM?
El enfoque de rendimiento de TensorRT-LLM combina un paso de compilación previa con varias optimizaciones de tiempo de ejecución específicas para LLM, en lugar de depender de una sola técnica.
- Batching en vuelo (el término de NVIDIA para batching continuo): las solicitudes nuevas pueden unirse a un lote en ejecución y las solicitudes terminadas pueden salir de él sin esperar a que todo el lote termine, manteniendo la GPU ocupada bajo tráfico real e irregular
- Caché KV paginada: la caché clave-valor de atención se gestiona en bloques de tamaño fijo en lugar de una gran asignación por solicitud, reduciendo el desperdicio de memoria de GPU — conceptualmente similar al enfoque de paginación que popularizó PagedAttention de vLLM
- Kernels personalizados de atención y GEMM: kernels CUDA ajustados a mano para las operaciones que más ejecutan los LLM, compilados y seleccionados para la GPU objetivo durante el paso de compilación del motor
- Compilación anticipada del motor: el grafo del modelo, la precisión elegida y las selecciones de kernel se fijan en un único archivo de motor optimizado antes de iniciar el servicio, en lugar de decidirse dinámicamente al cargar
- Soporte de decodificación especulativa: NVIDIA documenta técnicas de modelo borrador y otros métodos de decodificación especulativa para generar varios tokens candidatos por paso y verificarlos en paralelo
¿Qué hardware necesita TensorRT-LLM?
TensorRT-LLM funciona exclusivamente en GPU de NVIDIA — no existe backend de solo CPU, AMD, Intel o Apple Silicon. Dentro de la propia gama de GPU de NVIDIA, qué optimizaciones están disponibles depende de la generación de arquitectura de la GPU.
Blackwell (p. ej. B200)
- Detalles:
- La arquitectura más reciente soportada al momento de escribir esto. Añade soporte de FP4 (NVFP4) acelerado por hardware junto con FP8, según la documentación de NVIDIA.
Hopper (p. ej. H100, H200)
- Detalles:
- Soporte de FP8 por hardware; documentado por NVIDIA como una de las rutas más maduras para las optimizaciones más nuevas de cuantización y atención de TensorRT-LLM.
Ada Lovelace (p. ej. L4, L40S)
- Detalles:
- Compatible, con INT8 (incluido SmoothQuant) usado comúnmente como respaldo donde el soporte completo de herramientas FP8 es más limitado que en Hopper/Blackwell.
Arquitecturas más antiguas (p. ej. Ampere)
- Detalles:
- Existe compatibilidad más amplia para algunas GPU de centro de datos de NVIDIA anteriores, pero los formatos de cuantización y optimizaciones de kernel más nuevos apuntan al hardware actual — consulta las notas de la versión de NVIDIA para la matriz exacta GPU/función de la versión que planeas usar.
Si tu objetivo es ejecutar un modelo en un portátil, un Mac o cualquier GPU que no sea de NVIDIA, TensorRT-LLM no es la herramienta hecha para eso — llama.cpp y herramientas construidas sobre él, como Ollama y LM Studio, apuntan directamente a hardware CPU y Apple Silicon y son mejor opción para ese escenario.
¿Qué formatos de cuantización admite TensorRT-LLM?
TensorRT-LLM admite ejecutar modelos con precisión numérica reducida para reducir el uso de memoria y aumentar el rendimiento, con los formatos disponibles dependiendo de la generación de GPU objetivo.
FP8
- Detalles:
- Punto flotante de 8 bits acelerado por hardware en GPU Hopper y Blackwell; NVIDIA documenta esto como generalmente el mejor equilibrio precisión/rendimiento en esas generaciones.
FP4 (NVFP4)
- Detalles:
- Un formato de punto flotante de 4 bits exclusivo de Blackwell, documentado por NVIDIA para GPU de generación Blackwell y versiones actuales de la cadena de herramientas TensorRT/CUDA.
INT8 / INT4
- Detalles:
- Rutas de cuantización entera, incluido SmoothQuant, documentadas como respaldo en generaciones de GPU (como Ada) donde la cobertura completa de herramientas FP8 es más limitada.
AWQ / GPTQ
- Detalles:
- Métodos establecidos de cuantización de pesos de 4 bits de la comunidad, que TensorRT-LLM admite junto a sus propias opciones de precisión.
Este artículo no incluye cifras de pérdida de calidad medidas de forma independiente para cada formato en cada generación de GPU — estas varían según la arquitectura del modelo y la tarea, así que comparar salidas de un par de formatos con tus propios prompts y tu propio hardware es la forma más fiable de evaluar el equilibrio.
¿Cómo se despliega TensorRT-LLM?
TensorRT-LLM puede ejecutarse directamente a través de su propio runtime de Python/C++, pero en producción se suele usar a través de una de dos capas de despliegue de NVIDIA construidas a su alrededor.
trtllm-serve: un comando incluido con TensorRT-LLM que levanta un endpoint de API compatible con OpenAI directamente a partir de un motor ya construido, sin un framework de servicio aparte- NVIDIA Triton Inference Server: una plataforma de servicio de modelos de propósito general con un backend de TensorRT-LLM, que añade cola de solicitudes, orquestación multimodelo y funciones de despliegue de nivel producción como integración con Kubernetes
- NVIDIA NIM: microservicios en contenedores ya construidos, vendidos como parte de una suscripción a NVIDIA AI Enterprise, que empaquetan un backend optimizado con TensorRT-LLM detrás de una API estandarizada con soporte del fabricante — ver la comparación de servidores de inferencia empresarial para un análisis más profundo de la licencia y el soporte de NIM
¿Cómo se construye y ejecuta un motor TensorRT-LLM?
TensorRT-LLM requiere una GPU de NVIDIA, un controlador CUDA compatible y, normalmente, la propia imagen de contenedor de NVIDIA para evitar desajustes de versiones de dependencias, ya que depende estrechamente de versiones específicas de la cadena de herramientas CUDA y TensorRT.
- 1Confirma que tienes una GPU de NVIDIA compatible (generación Hopper, Ada o Blackwell para las optimizaciones más nuevas) con un controlador CUDA actual instalado.
- 2Descarga la imagen de contenedor oficial de TensorRT-LLM de NVIDIA, o instala el paquete de Python
tensorrt_llmen un entorno CUDA compatible — la ruta en contenedor evita la mayoría de los desajustes de dependencias. - 3Convierte o carga tu checkpoint de modelo de origen (por ejemplo, desde Hugging Face) usando la API de Python de TensorRT-LLM o scripts de conversión de ejemplo para esa familia de modelos.
- 4Construye el motor optimizado para tu GPU específica con el comando
trtllm-build, eligiendo una precisión (FP16, FP8, INT4/INT8, o FP4 en Blackwell) y una configuración de batching en el momento de la construcción. - 5Lanza el motor construido, ya sea directamente con
trtllm-servepara un endpoint compatible con OpenAI, o apuntando el backend de TensorRT-LLM de NVIDIA Triton Inference Server al directorio del motor. - 6Envía una solicitud de prueba al endpoint desplegado (
curlo cualquier cliente compatible con la API de OpenAI) para confirmar que el motor carga y genera correctamente antes de dirigirle tráfico de producción. - 7Vuelve a ejecutar el paso de construcción cada vez que cambies de generación de GPU, de modelo, o quieras adoptar una nueva versión de TensorRT-LLM — un motor construido para una generación de GPU no está garantizado a funcionar de forma óptima, ni siquiera a funcionar, en una generación diferente.
¿Tengo que reconstruir el motor para cada GPU?
Generalmente sí para resultados óptimos — un motor se compila con selecciones de kernel y optimizaciones para una generación de arquitectura de GPU específica, así que pasar a otra generación de GPU normalmente requiere reconstruirlo.
¿Puedo usar un modelo pre-cuantizado con TensorRT-LLM?
Sí — TensorRT-LLM admite construir motores a partir de modelos cuantizados con AWQ o GPTQ, además de su propia cuantización FP8/INT8/INT4/FP4 aplicada durante el paso de construcción.
¿Cómo se compara TensorRT-LLM con vLLM y llama.cpp?
TensorRT-LLM, vLLM y llama.cpp ejecutan inferencia de LLM, pero se ubican en distintos puntos del espectro entre rendimiento y flexibilidad.
TensorRT-LLM
- Detalles:
- Exclusivo de NVIDIA, con licencia Apache 2.0. Requiere un paso de compilación previa por generación de GPU; apunta al mayor rendimiento posible en ese hardware específico de NVIDIA a cambio del paso de compilación y una dependencia del fabricante.
vLLM
- Detalles:
- Con licencia Apache 2.0, carga directamente modelos compatibles con Hugging Face Transformers sin paso de compilación. Las GPU de NVIDIA son su objetivo principal, con backends de AMD, Intel y TPU documentados (más limitados).
llama.cpp
- Detalles:
- Motor C/C++ con licencia MIT que funciona en CPU, Apple Silicon y una amplia gama de fabricantes de GPU mediante el formato de modelo GGUF — el más flexible en hardware de los tres, pero no diseñado para la escala multi-GPU de alta concurrencia de centro de datos que buscan TensorRT-LLM y vLLM.
Este artículo no ha comparado estos tres motores de forma independiente y no afirma que uno sea universalmente más rápido — el rendimiento depende en gran medida del modelo, la generación de GPU, las características del lote y la versión de cada motor. La ventaja real de TensorRT-LLM es el rendimiento máximo específicamente en hardware NVIDIA actual, a costa del paso de compilación y el soporte exclusivo de NVIDIA; vLLM cambia parte de ese ajuste específico de GPU de máximo rendimiento por un flujo de trabajo más simple sin compilación y una cobertura de hardware más amplia (aunque sigue siendo principalmente NVIDIA); llama.cpp cambia más rendimiento máximo por funcionar en hardware que ninguno de los otros dos aborda, incluyendo CPU y Mac.
¿Cómo se relaciona TensorRT-LLM con NVIDIA NIM y Triton?
TensorRT-LLM, NVIDIA NIM y NVIDIA Triton Inference Server no son competidores — son distintas capas de la misma pila de inferencia de NVIDIA, y entender la diferencia importa a la hora de planificar un despliegue.
TensorRT-LLM
- Detalles:
- El motor y el compilador: convierte un modelo en un motor de inferencia optimizado y específico de GPU. Gratuito y de código abierto (Apache 2.0); lo operas tú mismo.
Artículos sobre TensorRT-LLM (5)
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)Actualizado 6 de septiembre de 2026
- TensorRT-LLM Explained: NVIDIA's GPU-Optimized Inference Engine (2026)Actualizado 6 de septiembre de 2026
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)Actualizado 6 de septiembre de 2026
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"Actualizado 5 de septiembre de 2026
- Enterprise LLM Inference Servers 2026: vLLM vs TGI vs NVIDIA NIM vs OllamaActualizado 2 de septiembre de 2026
También mencionado en:
- Running LLMs and VLA Models On-Robot 2026: What Fits, What Doesn'tActualizado 2 de septiembre de 2026
- Apple MLX vs NVIDIA CUDA for Local LLMs: Which System Should You Choose in 2026?Actualizado 29 de agosto de 2026
NVIDIA Triton Inference Server
- Detalles:
- Una plataforma de servicio de modelos de propósito general, gratuita y de código abierto, con un backend de TensorRT-LLM, que añade enrutamiento de solicitudes, alojamiento multimodelo y orquestación de producción alrededor de uno o más motores.
NVIDIA NIM
- Detalles:
- Una capa de microservicios de pago, ya construidos, vendida como parte de una suscripción a NVIDIA AI Enterprise, que empaqueta un backend optimizado con TensorRT-LLM detrás de una API estandarizada con soporte del fabricante — cambiando la configuración manual por un contenedor con soporte y listo para desplegar.
Un camino habitual es: compilar el modelo en un motor TensorRT-LLM y luego servirlo mediante Triton para un despliegue de producción autogestionado, o saltarse por completo el paso de compilación usando un contenedor NIM ya construido si la suscripción de pago y el soporte del fabricante valen la pena para tu equipo. Ver la comparación de servidores de inferencia empresarial para las compensaciones de licencia y costo entre NIM, vLLM y TGI.
¿Para quién es TensorRT-LLM?
TensorRT-LLM encaja con equipos que ya se han comprometido con hardware GPU de NVIDIA y necesitan el máximo rendimiento de inferencia posible de él, no con personas que buscan la forma más simple de ejecutar un modelo.
TensorRT-LLM frente a alternativas de un vistazo
Estas herramientas se ubican en distintos puntos del espectro entre complejidad de configuración y rendimiento máximo.
TensorRT-LLM
- Configuración:
- Compilar un motor específico de GPU con
trtllm-build, luego servirlo contrtllm-serveo Triton. Requiere GPU de NVIDIA y CUDA. - Ideal para:
- Máximo rendimiento por GPU en hardware NVIDIA en producción, a costa de un paso de compilación.
vLLM
- Configuración:
- Paquete de Python vía pip; servidor compatible con OpenAI iniciado con
vllm serve. Sin paso de compilación; GPU de NVIDIA como objetivo principal. - Ideal para:
- Servicio de alto rendimiento multiusuario con un flujo de trabajo más simple sin compilación.
llama.cpp
- Configuración:
- CLI, interfaz web integrada y API compatible con OpenAI vía llama-server. Funciona en CPU o una amplia gama de fabricantes de GPU.
- Ideal para:
- Flexibilidad de hardware, despliegue embebido/en el borde, y uso en CPU o Apple Silicon.
NVIDIA NIM
- Configuración:
- Contenedor ya construido, desplegado con una suscripción de pago a NVIDIA AI Enterprise. Sin paso de compilación para el usuario final.
- Ideal para:
- Equipos que quieren el rendimiento de TensorRT-LLM sin operar ellos mismos la canalización de compilación.
Este artículo no ha comparado de forma independiente la velocidad ni la calidad de salida de estas herramientas y no afirma que una sea técnicamente superior para toda carga de trabajo — la comparación anterior cubre solo hechos documentados de arquitectura, configuración y licencia. Ver la guía de servidores de inferencia empresarial para una comparación más profunda de licencia y despliegue.
¿Qué no cubre este artículo?
Este es un artículo explicativo elaborado a partir de la documentación pública y el repositorio de NVIDIA, no un informe de pruebas de rendimiento práctico.
- Sin cifras de rendimiento, latencia o solicitudes por segundo medidas de forma independiente — estas dependen en gran medida de la generación de GPU, el modelo, la composición del lote y la versión de TensorRT-LLM
- Sin porcentajes de pérdida de calidad verificados de forma independiente para formatos de cuantización específicos en GPU específicas — estos varían según la arquitectura del modelo y la tarea
- Sin cobertura completa de cada arquitectura de modelo soportada, opción de kernel o función avanzada (servicio desagregado, paralelismo de expertos, LoRA) — este artículo se centra en los conceptos que la mayoría de los equipos evalúan primero
- Sin cobertura de los precios de NVIDIA AI Enterprise o NIM, ya que los precios de suscripción empresarial no se publican como los de un producto minorista — confirma los precios actuales directamente con NVIDIA
- Sin afirmación de respaldo o asociación con NVIDIA — este artículo describe TensorRT-LLM de forma objetiva como una explicación independiente de terceros basada en fuentes públicas
Errores comunes al probar TensorRT-LLM
La mayor parte de la fricción con TensorRT-LLM viene de subestimar el paso de compilación o de esperar que se comporte como un motor de carga directa.
Preguntas frecuentes
¿Qué es TensorRT-LLM?
TensorRT-LLM es una biblioteca gratuita y de código abierto (Apache 2.0) publicada por NVIDIA que compila modelos de lenguaje grandes en motores de inferencia optimizados construidos específicamente para GPU de NVIDIA, sobre el SDK de inferencia de aprendizaje profundo TensorRT de NVIDIA.
¿Es gratuito TensorRT-LLM?
Sí. TensorRT-LLM en sí es software gratuito y de código abierto publicado bajo la licencia Apache 2.0. NVIDIA NIM, una capa de microservicios de pago independiente que empaqueta un backend de TensorRT-LLM, requiere una suscripción a NVIDIA AI Enterprise.
¿Funciona TensorRT-LLM en GPU de AMD o de Apple?
No. TensorRT-LLM funciona exclusivamente en GPU de NVIDIA — no existe backend de solo CPU, AMD, Intel o Apple Silicon, a diferencia de vLLM o llama.cpp, que admiten hardware más amplio.
¿Por qué TensorRT-LLM requiere compilar un modelo primero?
TensorRT-LLM construye un modelo por adelantado en un motor con selecciones de kernel y optimizaciones fijadas para una generación de arquitectura de GPU específica, que es como logra su objetivo de rendimiento. Esto cambia un paso de compilación y menos flexibilidad entre hardware por un mayor rendimiento máximo en esa GPU de NVIDIA específica, comparado con motores que deciden todo dinámicamente al cargar.
¿Qué formatos de cuantización admite TensorRT-LLM?
TensorRT-LLM admite FP8 y FP4 (FP4 exclusivo de GPU de generación Blackwell), INT8 e INT4 incluyendo SmoothQuant, y formatos de la comunidad como AWQ y GPTQ, con la disponibilidad exacta dependiendo de la generación de GPU objetivo.
¿Es TensorRT-LLM mejor que vLLM?
"Mejor" depende del uso: TensorRT-LLM apunta al máximo rendimiento por GPU posible específicamente en hardware NVIDIA, a costa de un paso de compilación previo y soporte exclusivo de NVIDIA. vLLM carga los modelos directamente sin paso de compilación y documenta soporte de backends más allá de las GPU de NVIDIA. Ninguno es universalmente más rápido — ver la tabla comparativa anterior.
¿Cuál es la diferencia entre TensorRT-LLM y NVIDIA NIM?
TensorRT-LLM es el motor y compilador gratuito y de código abierto que operas tú mismo. NVIDIA NIM es una capa de microservicios de pago independiente que empaqueta un backend optimizado con TensorRT-LLM detrás de una API estandarizada con soporte del fabricante, vendida como parte de una suscripción a NVIDIA AI Enterprise.
¿Puede TensorRT-LLM servir modelos en varias GPU?
Sí. NVIDIA documenta soporte de servicio multi-GPU y multi-nodo en TensorRT-LLM para modelos demasiado grandes para caber en una sola GPU, normalmente desplegado mediante NVIDIA Triton Inference Server para la orquestación en producción.
