핵심 요점
- 무료이자 Apache 2.0 라이선스 오픈소스, NVIDIA가 GitHub에 공개
- NVIDIA의 TensorRT 딥러닝 추론 SDK를 기반으로 LLM 전용 최적화를 확장
- 모델을 특정 GPU용 최적화 엔진으로 사전 컴파일 — vLLM과 llama.cpp에는 필요 없는 단계
- 인플라이트(연속) 배칭과 페이지 기반 KV 캐시로 동시 트래픽 상황에서도 GPU 활용률을 높게 유지
- FP8, INT8, INT4, AWQ, GPTQ를 포함한 양자화 지원; 최신 포맷은 현행 세대 NVIDIA GPU가 필요
- NVIDIA GPU에서만 작동 — CPU, AMD, Apple Silicon 또는 다른 제조사 지원 없음
- NVIDIA Triton Inference Server를 통해, 또는 NVIDIA NIM 마이크로서비스에 패키징되어 일반적으로 배포됨
- 데이터센터 및 엔터프라이즈 프로덕션 서빙을 위해 구축되었으며, 단일 사용자 데스크톱 채팅용이 아님
📍 한 문장으로
TensorRT-LLM은 인플라이트 배칭, 페이지 기반 KV 캐시, 양자화를 활용해 LLM을 GPU 전용 최적화 추론 엔진으로 컴파일하는 NVIDIA의 무료 Apache 2.0 라이선스 라이브러리로, NVIDIA GPU에서의 최대 처리량을 목표로 한다.
💬 쉽게 말하면
모델을 단순히 로드해서 실행하는 대신, TensorRT-LLM에는 추가적인 "빌드" 단계가 있다. 자신의 특정 NVIDIA GPU에 맞춰 모델을 한 번 컴파일하면, 결과로 나온 엔진이 범용 로더보다 해당 GPU에서 더 빠르게 실행된다 — 다만 NVIDIA 하드웨어에서만 작동하며 GPU 세대나 모델을 바꾸면 재빌드가 필요하다.
📌참고: 이 글은 NVIDIA의 공식 TensorRT-LLM GitHub 저장소와 공개 문서를 기반으로 작성되었으며, 독립적인 벤치마크가 아닙니다. 구체적인 처리량이나 지연 시간 수치는 이 글을 위해 독립적으로 측정되지 않았고 GPU 세대, 모델, 배치 구성, TensorRT-LLM 버전에 따라 크게 달라지기 때문에 포함하지 않았습니다. 이 글은 제3자로서 TensorRT-LLM을 사실에 기반해 설명하는 것이며, NVIDIA와 제휴하거나 NVIDIA의 승인을 받은 것이 아닙니다.
TensorRT-LLM이란?
TensorRT-LLM은 NVIDIA GPU에서 대규모 언어 모델 추론을 최적화하고 실행하기 위해 NVIDIA가 공개한 오픈소스 라이브러리입니다. NVIDIA의 범용 딥러닝 추론 SDK인 TensorRT 위에 구축되었으며, LLM 전용 런타임 기능 계층과 모델을 정의하고 최적화된 엔진으로 빌드하기 위한 Python API를 추가로 제공합니다.
- NVIDIA가 공개하고 유지 관리하며, GitHub에서 Apache 2.0 라이선스로 오픈소스 배포
- NVIDIA의 범용 TensorRT 추론 SDK를 트랜스포머 및 LLM 전용 최적화로 확장
- 모델을 컴파일하기 위한 Python API(
tensorrt_llm.LLM)와trtllm-build명령줄 워크플로 제공 - 빌드된 엔진에서 곧바로 OpenAI 호환 엔드포인트를 실행할 수 있는
trtllm-serve명령 포함 - 많은 인기 오픈 모델 계열을 지원하지만, 모델별 정확한 지원 범위와 필요한 변환 단계는 TensorRT-LLM 릴리스에 따라 다름 — 모델을 정하기 전에 프로젝트의 지원 모델 문서를 확인할 것
TensorRT-LLM이 빠른 이유는?
TensorRT-LLM의 성능 접근 방식은 단일 기술에 의존하는 대신 사전 컴파일 단계와 여러 LLM 전용 런타임 최적화를 결합합니다.
- 인플라이트 배칭(NVIDIA가 연속 배칭을 지칭하는 용어): 새 요청이 실행 중인 배치에 합류할 수 있고 완료된 요청은 전체 배치가 끝나기를 기다리지 않고 빠져나갈 수 있어, 실제로 불균일한 트래픽 상황에서도 GPU를 계속 바쁘게 유지함
- 페이지 기반 KV 캐시: 어텐션 키-값 캐시를 요청당 하나의 큰 연속 할당 대신 고정 크기 블록으로 관리해 GPU 메모리 낭비를 줄임 — vLLM의 PagedAttention이 대중화한 페이징 방식과 개념적으로 유사
- 커스텀 어텐션 및 GEMM 커널: LLM이 가장 많이 실행하는 연산에 맞춰 수작업으로 튜닝된 CUDA 커널로, 엔진 빌드 단계에서 대상 GPU에 맞춰 컴파일 및 선택됨
- 사전 엔진 컴파일: 모델 그래프, 선택된 정밀도, 커널 선택이 서빙 시작 전에 하나의 최적화된 엔진 파일로 고정됨 — 로드 시점에 동적으로 결정되는 것이 아님
- 추측 디코딩 지원: NVIDIA는 드래프트 모델 등 여러 추측 디코딩 기법을 문서화하고 있으며, 이는 단계당 여러 후보 토큰을 생성해 병렬로 검증하는 방식임
TensorRT-LLM에 필요한 하드웨어는?
TensorRT-LLM은 NVIDIA GPU에서만 작동합니다 — CPU 전용, AMD, Intel, Apple Silicon용 백엔드는 존재하지 않습니다. NVIDIA 자체 GPU 라인업 내에서도 사용 가능한 최적화는 GPU의 아키텍처 세대에 따라 달라집니다.
Blackwell(예: B200)
- 세부 내용:
- 이 글 작성 시점 기준 가장 최신으로 지원되는 아키텍처. NVIDIA 문서에 따르면 FP8과 더불어 하드웨어 가속 FP4(NVFP4) 지원이 추가됨.
Hopper(예: H100, H200)
- 세부 내용:
- 하드웨어 FP8 지원; NVIDIA가 TensorRT-LLM의 최신 양자화 및 어텐션 최적화에서 가장 성숙한 경로 중 하나로 문서화함.
Ada Lovelace(예: L4, L40S)
- 세부 내용:
- 지원됨. 완전한 FP8 툴링 지원이 Hopper/Blackwell만큼 넓지 않은 경우, SmoothQuant를 포함한 INT8이 대체 수단으로 흔히 사용됨.
이전 아키텍처(예: Ampere)
- 세부 내용:
- 일부 이전 세대 NVIDIA 데이터센터 GPU에 대해 더 폭넓은 호환성이 존재하지만, 최신 양자화 포맷과 커널 최적화는 현행 세대 하드웨어를 대상으로 함 — 사용할 버전의 정확한 GPU별 기능 매트릭스는 NVIDIA의 릴리스 노트를 확인할 것.
노트북, Mac, 또는 NVIDIA가 아닌 GPU에서 모델을 실행하는 것이 목표라면, TensorRT-LLM은 그런 용도로 만들어진 도구가 아닙니다 — llama.cpp와 이를 기반으로 한 Ollama, LM Studio 같은 도구는 CPU와 Apple Silicon 하드웨어를 직접 대상으로 하며 해당 시나리오에 더 적합합니다.
TensorRT-LLM이 지원하는 양자화 포맷은?
TensorRT-LLM은 메모리 사용량을 줄이고 처리량을 높이기 위해 낮은 수치 정밀도로 모델을 실행하는 것을 지원하며, 사용 가능한 구체적인 포맷은 대상 GPU 세대에 따라 달라집니다.
FP8
- 세부 내용:
- Hopper 및 Blackwell GPU에서 하드웨어 가속되는 8비트 부동소수점; NVIDIA는 이를 해당 세대에서 일반적으로 정밀도/처리량 균형이 가장 좋은 방식으로 문서화함.
FP4(NVFP4)
- 세부 내용:
- Blackwell 전용 4비트 부동소수점 포맷으로, NVIDIA가 Blackwell 세대 GPU 및 현행 TensorRT/CUDA 툴체인 버전에 대해 문서화함.
INT8 / INT4
- 세부 내용:
- SmoothQuant를 포함한 정수 양자화 경로로, 완전한 FP8 툴링 지원 범위가 좁은 GPU 세대(예: Ada)에서 대체 수단으로 문서화됨.
AWQ / GPTQ
- 세부 내용:
- 커뮤니티에서 확립된 4비트 가중치 양자화 방식으로, TensorRT-LLM은 자체 정밀도 옵션과 함께 이 포맷들을 지원함.
이 글에는 GPU 세대별 각 포맷의 품질 저하에 대해 독립적으로 측정한 수치가 포함되어 있지 않습니다 — 이는 모델 아키텍처와 작업에 따라 달라지므로, 자신의 프롬프트와 하드웨어에서 몇 가지 포맷의 출력을 비교해 보는 것이 트레이드오프를 판단하는 가장 신뢰할 수 있는 방법입니다.
TensorRT-LLM은 어떻게 배포되나요?
TensorRT-LLM은 자체 Python/C++ 런타임을 통해 직접 실행할 수 있지만, 프로덕션 환경에서는 그 주변에 구축된 두 가지 NVIDIA 배포 계층 중 하나를 통해 사용되는 경우가 가장 흔합니다.
trtllm-serve: TensorRT-LLM에 포함된 명령으로, 별도의 서빙 프레임워크 없이 빌드된 엔진에서 곧바로 OpenAI 호환 API 엔드포인트를 실행함- NVIDIA Triton Inference Server: TensorRT-LLM 백엔드를 갖춘 범용 모델 서빙 플랫폼으로, 요청 큐잉, 멀티모델 오케스트레이션, Kubernetes 통합 같은 프로덕션급 배포 기능을 추가함
- NVIDIA NIM: NVIDIA AI Enterprise 구독의 일부로 판매되는 사전 구축된 컨테이너화 마이크로서비스로, TensorRT-LLM 최적화 백엔드를 표준화된 API 뒤에 패키징하고 제조사 지원을 제공함 — NIM의 라이선스와 지원 모델에 대해 더 자세히 알아보려면 엔터프라이즈 추론 서버 비교를 참고
TensorRT-LLM 엔진은 어떻게 구축하고 실행하나요?
TensorRT-LLM은 특정 CUDA 및 TensorRT 툴체인 버전에 밀접하게 의존하기 때문에, NVIDIA GPU와 이에 맞는 CUDA 드라이버, 그리고 일반적으로 종속성 버전 불일치를 피하기 위한 NVIDIA 자체 컨테이너 이미지가 필요합니다.
- 1지원되는 NVIDIA GPU(최신 최적화를 위해서는 Hopper, Ada, Blackwell 세대)와 최신 CUDA 드라이버가 설치되어 있는지 확인합니다.
- 2NVIDIA의 공식 TensorRT-LLM 컨테이너 이미지를 가져오거나, 맞는 CUDA 환경에
tensorrt_llmPython 패키지를 설치합니다 — 컨테이너화 경로가 대부분의 종속성 버전 불일치를 피할 수 있습니다. - 3TensorRT-LLM Python API나 해당 모델 계열용 예제 변환 스크립트를 사용해 소스 모델 체크포인트(예: Hugging Face에서)를 변환하거나 로드합니다.
- 4
trtllm-build명령으로 특정 GPU에 맞춘 최적화 엔진을 구축하며, 빌드 시점에 정밀도(FP16, FP8, INT4/INT8, 또는 Blackwell의 FP4)와 배칭 구성을 선택합니다. - 5빌드된 엔진을 실행합니다. OpenAI 호환 엔드포인트를 위해 직접
trtllm-serve로 실행하거나, NVIDIA Triton Inference Server의 TensorRT-LLM 백엔드를 엔진 디렉터리로 지정합니다. - 6프로덕션 트래픽을 라우팅하기 전에, 배포된 엔드포인트로 테스트 요청(
curl또는 임의의 OpenAI API 호환 클라이언트)을 보내 엔진이 올바르게 로드되고 생성되는지 확인합니다. - 7GPU 세대나 모델을 변경하거나 새로운 TensorRT-LLM 릴리스를 반영하고 싶을 때마다 빌드 단계를 다시 실행합니다 — 한 GPU 세대용으로 빌드된 엔진이 다른 세대에서 최적으로, 혹은 아예 작동한다는 보장은 없습니다.
GPU마다 엔진을 다시 빌드해야 하나요?
최적의 결과를 위해서는 일반적으로 그렇습니다 — 엔진은 특정 GPU 아키텍처 세대에 맞춘 커널 선택과 최적화로 컴파일되므로, 다른 GPU 세대로 옮기려면 보통 다시 빌드해야 합니다.
TensorRT-LLM에서 사전 양자화된 모델을 사용할 수 있나요?
네 — TensorRT-LLM은 빌드 단계에서 적용되는 자체 FP8/INT8/INT4/FP4 양자화 외에도, AWQ나 GPTQ로 양자화된 모델로부터 엔진을 구축하는 것을 지원합니다.
TensorRT-LLM은 vLLM, llama.cpp와 비교해 어떤가요?
TensorRT-LLM
- 세부 내용:
- NVIDIA 전용, Apache 2.0 라이선스. GPU 세대마다 사전 컴파일 단계가 필요함; 빌드 단계와 벤더 종속을 감수하는 대가로 특정 NVIDIA 하드웨어에서 달성 가능한 최고의 처리량을 목표로 함.
vLLM
- 세부 내용:
- Apache 2.0 라이선스로, Hugging Face Transformers 호환 모델을 컴파일 단계 없이 직접 로드함. NVIDIA GPU가 주요 대상이며, (더 제한적인) AMD, Intel, TPU 백엔드도 문서화되어 있음.
llama.cpp
- 세부 내용:
- MIT 라이선스 C/C++ 엔진으로, GGUF 모델 포맷을 통해 CPU, Apple Silicon, 그리고 폭넓은 GPU 제조사에서 작동함 — 셋 중 하드웨어 유연성이 가장 높지만, TensorRT-LLM과 vLLM이 목표로 하는 멀티 GPU, 고동시성 데이터센터 규모를 위해 만들어진 것은 아님.
이 글은 이 세 엔진을 독립적으로 벤치마크 비교하지 않았으며, 어느 하나가 보편적으로 더 빠르다고 주장하지 않습니다 — 처리량은 모델, GPU 세대, 배치 특성, 각 엔진의 버전에 크게 좌우됩니다. TensorRT-LLM의 실질적인 강점은 빌드 단계와 NVIDIA 전용 지원이라는 비용을 감수하는 대가로 특히 현행 세대 NVIDIA 하드웨어에서의 최고 성능에 있습니다. vLLM은 그런 GPU 특화 최고 성능 최적화의 일부를 컴파일이 필요 없는 더 단순한 워크플로와 더 폭넓은(여전히 NVIDIA가 주된) 하드웨어 커버리지와 맞바꿉니다. llama.cpp는 최고 처리량을 더 희생하는 대신 다른 두 엔진이 다루지 않는 하드웨어(CPU와 Mac 포함)에서 작동할 수 있는 능력을 얻습니다.
TensorRT-LLM은 NVIDIA NIM, Triton과 어떤 관계인가요?
TensorRT-LLM, NVIDIA NIM, NVIDIA Triton Inference Server는 서로 경쟁 관계가 아닙니다 — 이들은 동일한 NVIDIA 추론 스택의 서로 다른 계층이며, 배포를 계획할 때 이 차이를 이해하는 것이 중요합니다.
TensorRT-LLM
- 세부 내용:
- 엔진이자 컴파일러: 모델을 최적화된 GPU 전용 추론 엔진으로 변환함. 무료이자 오픈소스(Apache 2.0)이며, 직접 운영함.
TensorRT-LLM 관련 문서 (5개)
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)업데이트 2026년 9월 6일
- TensorRT-LLM Explained: NVIDIA's GPU-Optimized Inference Engine (2026)업데이트 2026년 9월 6일
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)업데이트 2026년 9월 6일
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"업데이트 2026년 9월 5일
- Enterprise LLM Inference Servers 2026: vLLM vs TGI vs NVIDIA NIM vs Ollama업데이트 2026년 9월 2일
기타 언급:
NVIDIA Triton Inference Server
- 세부 내용:
- TensorRT-LLM 백엔드를 갖춘 범용 무료 오픈소스 모델 서빙 플랫폼으로, 하나 이상의 엔진 주위에 요청 라우팅, 멀티모델 호스팅, 프로덕션 오케스트레이션을 추가함.
NVIDIA NIM
- 세부 내용:
- NVIDIA AI Enterprise 구독의 일부로 판매되는 사전 구축된 유료 마이크로서비스 계층으로, 표준화된 API 뒤에 TensorRT-LLM 최적화 백엔드를 패키징하고 제조사 지원을 제공함 — 직접 설정하는 수고를, 지원되고 바로 배포 가능한 컨테이너와 맞바꿈.
흔한 경로는 다음과 같습니다: 모델을 TensorRT-LLM 엔진으로 빌드한 다음 Triton을 통해 서빙하여 자체 관리형 프로덕션 배포를 구성하거나, 유료 구독과 제조사 지원이 팀에 가치가 있다면 빌드 단계를 완전히 건너뛰고 사전 구축된 NIM 컨테이너를 사용하는 것입니다. NIM, vLLM, TGI 사이의 라이선스 및 비용 트레이드오프에 대해서는 엔터프라이즈 추론 서버 비교를 참고하세요.
TensorRT-LLM은 누구에게 적합한가요?
TensorRT-LLM은 이미 NVIDIA GPU 하드웨어에 투자했고 그로부터 달성 가능한 최고의 추론 처리량이 필요한 팀에 적합하며, 모델을 실행하는 가장 간단한 방법을 찾는 사람에게는 적합하지 않습니다.
TensorRT-LLM과 대안 한눈에 비교
이 도구들은 설정 복잡성과 최고 성능 사이의 스펙트럼에서 서로 다른 위치에 있습니다.
TensorRT-LLM
- 설정:
trtllm-build로 GPU 전용 엔진을 컴파일한 뒤trtllm-serve나 Triton으로 서빙함. NVIDIA GPU와 CUDA 필요.- 적합한 용도:
- 컴파일 단계라는 비용을 감수하고 프로덕션 환경에서 NVIDIA 하드웨어의 GPU당 최대 처리량을 얻고 싶은 경우.
vLLM
- 설정:
- pip으로 설치하는 Python 패키지;
vllm serve로 시작하는 OpenAI 호환 서버. 컴파일 단계 없음; 주요 대상은 NVIDIA GPU. - 적합한 용도:
- 컴파일이 필요 없는 더 단순한 워크플로로 고처리량 멀티유저 서빙을 하고 싶은 경우.
llama.cpp
- 설정:
- CLI, 내장 웹 UI, llama-server를 통한 OpenAI 호환 API. CPU 또는 폭넓은 GPU 제조사에서 작동.
- 적합한 용도:
- 하드웨어 유연성, 임베디드/엣지 배포, CPU 또는 Apple Silicon 사용.
NVIDIA NIM
- 설정:
- 사전 구축된 컨테이너로, 유료 NVIDIA AI Enterprise 구독을 통해 배포함. 최종 사용자에게 빌드 단계 없음.
- 적합한 용도:
- 빌드 파이프라인을 직접 운영하지 않고 TensorRT-LLM 수준의 성능을 원하는 팀.
이 글은 이 도구들 간의 속도나 출력 품질을 독립적으로 벤치마크 비교하지 않았으며, 모든 워크로드에서 어느 하나가 기술적으로 우월하다고 주장하지 않습니다 — 위 비교는 문서화된 아키텍처, 설정, 라이선스 관련 사실만 다룹니다. 더 깊이 있는 라이선스 및 배포 비교는 엔터프라이즈 추론 서버 가이드를 참고하세요.
이 글이 다루지 않는 내용은?
이 글은 NVIDIA의 공개 문서와 저장소를 바탕으로 작성된 설명 글이며, 실측 벤치마크 보고서가 아닙니다.
- GPU 세대, 모델, 배치 구성, TensorRT-LLM 버전에 크게 좌우되는 처리량, 지연 시간, 초당 요청 수에 대한 독립적인 측정 수치가 없음
- 특정 GPU에서 특정 양자화 포맷에 대해 독립적으로 검증된 품질 저하 비율이 없음 — 이는 모델 아키텍처와 작업에 따라 달라짐
- 지원되는 모든 모델 아키텍처, 커널 옵션, 고급 기능(분리형 서빙, 전문가 병렬화, LoRA)을 전부 다루지는 않음 — 이 글은 대부분의 팀이 가장 먼저 평가하는 개념들에 초점을 맞춤
- NVIDIA AI Enterprise나 NIM의 가격에 대한 내용은 다루지 않음 — 엔터프라이즈 구독 가격은 일반 소비자 제품처럼 공개되지 않으므로 최신 가격은 NVIDIA에 직접 확인할 것
- NVIDIA의 승인이나 파트너십을 주장하지 않음 — 이 글은 공개된 출처를 바탕으로 한 독립적인 제3자 설명으로서 TensorRT-LLM을 사실에 기반해 다룸
TensorRT-LLM을 시도할 때 흔한 실수
TensorRT-LLM에서 겪는 마찰은 대부분 빌드/컴파일 단계를 과소평가하거나 직접 로드형 엔진처럼 작동하기를 기대하는 데서 비롯됩니다.
자주 묻는 질문
TensorRT-LLM이란 무엇인가요?
TensorRT-LLM은 NVIDIA가 공개한 무료 오픈소스(Apache 2.0) 라이브러리로, NVIDIA의 TensorRT 딥러닝 추론 SDK 위에 구축되어 대규모 언어 모델을 NVIDIA GPU 전용으로 구축된 최적화 추론 엔진으로 컴파일합니다.
TensorRT-LLM은 무료인가요?
네. TensorRT-LLM 자체는 Apache 2.0 라이선스로 배포되는 무료 오픈소스 소프트웨어입니다. TensorRT-LLM 백엔드를 패키징한 별도의 유료 마이크로서비스 계층인 NVIDIA NIM은 NVIDIA AI Enterprise 구독이 필요합니다.
TensorRT-LLM은 AMD나 애플 GPU에서 작동하나요?
아니요. TensorRT-LLM은 NVIDIA GPU에서만 작동합니다 — 더 폭넓은 하드웨어를 지원하는 vLLM이나 llama.cpp와 달리 CPU 전용, AMD, Intel, Apple Silicon용 백엔드는 존재하지 않습니다.
왜 TensorRT-LLM은 먼저 모델을 컴파일해야 하나요?
TensorRT-LLM은 특정 GPU 아키텍처 세대에 맞춰 커널 선택과 최적화를 고정한 엔진으로 모델을 사전에 빌드하며, 이것이 성능 목표를 달성하는 방식입니다. 이는 로드 시점에 모든 것을 동적으로 결정하는 엔진에 비해, 빌드 단계와 낮은 하드웨어 간 유연성을 대가로 해당 특정 NVIDIA GPU에서 더 높은 최고 처리량을 얻는 방식입니다.
TensorRT-LLM은 어떤 양자화 포맷을 지원하나요?
TensorRT-LLM은 FP8과 FP4(FP4는 Blackwell 세대 GPU 전용), SmoothQuant를 포함한 INT8과 INT4, 그리고 AWQ와 GPTQ 같은 커뮤니티 포맷을 지원하며, 정확한 지원 여부는 대상 GPU 세대에 따라 다릅니다.
TensorRT-LLM이 vLLM보다 나은가요?
"더 낫다"는 것은 용도에 따라 다릅니다: TensorRT-LLM은 사전 컴파일 단계와 NVIDIA 전용 지원이라는 비용을 감수하며 특히 NVIDIA 하드웨어에서 달성 가능한 최고의 GPU당 처리량을 목표로 합니다. vLLM은 컴파일 단계 없이 모델을 직접 로드하며 NVIDIA GPU를 넘어서는 백엔드 지원을 문서화하고 있습니다. 어느 쪽도 모든 경우에 보편적으로 더 빠르지는 않습니다 — 위 비교표를 참고하세요.
TensorRT-LLM과 NVIDIA NIM의 차이는 무엇인가요?
TensorRT-LLM은 직접 운영하는 무료 오픈소스 엔진이자 컴파일러입니다. NVIDIA NIM은 표준화된 API 뒤에 TensorRT-LLM 최적화 백엔드를 패키징하고 제조사 지원을 제공하는 별도의 유료 마이크로서비스 계층으로, NVIDIA AI Enterprise 구독의 일부로 판매됩니다.
TensorRT-LLM은 여러 GPU에 걸쳐 모델을 서빙할 수 있나요?
네. NVIDIA는 단일 GPU에 들어가지 않는 모델을 위한 TensorRT-LLM의 멀티 GPU 및 멀티 노드 서빙 지원을 문서화하고 있으며, 일반적으로 프로덕션 오케스트레이션을 위해 NVIDIA Triton Inference Server를 통해 배포됩니다.
