النقاط الرئيسية
- مجانية ومفتوحة المصدر بترخيص Apache 2.0، نشرتها NVIDIA على GitHub
- مبنية على حزمة أدوات الاستدلال للتعلم العميق TensorRT من NVIDIA، ومُوسَّعة بتحسينات خاصة بنماذج اللغة الكبيرة
- تجمّع النموذج مسبقًا في محرك مُحسَّن مخصص لوحدة GPU معينة — وهي خطوة لا تحتاجها vLLM ولا llama.cpp
- تستخدم التجميع المستمر أثناء التشغيل وذاكرة تخزين مؤقت KV المُقسَّمة إلى صفحات للحفاظ على استغلال عالٍ لوحدة GPU تحت حِمل متزامن
- تدعم التكميم بما يشمل FP8 وINT8 وINT4 وAWQ وGPTQ؛ وتحتاج الصيغ الأحدث إلى وحدات GPU من الجيل الحالي من NVIDIA
- تعمل فقط على وحدات GPU من NVIDIA — لا يوجد دعم لوحدة المعالجة المركزية (CPU) أو AMD أو Apple Silicon أو أي مورّد آخر
- تُنشر عادة عبر NVIDIA Triton Inference Server أو مُضمَّنة داخل خدمات NIM المصغّرة من NVIDIA
- مبنية لخدمة الإنتاج في مراكز البيانات والمؤسسات، وليس لدردشة سطح المكتب لمستخدم واحد
📍 في جملة واحدة
TensorRT-LLM هي مكتبة NVIDIA المجانية بترخيص Apache 2.0 التي تجمّع نماذج اللغة الكبيرة في محركات استدلال مُحسَّنة مخصصة لوحدة GPU معينة باستخدام التجميع المستمر أثناء التشغيل وذاكرة تخزين مؤقت KV المُقسَّمة إلى صفحات والتكميم، بهدف تحقيق أقصى إنتاجية على وحدات GPU من NVIDIA.
💬 بعبارات بسيطة
بدلًا من مجرد تحميل نموذج وتشغيله، تضيف TensorRT-LLM خطوة "بناء" إضافية: تقوم بتجميع النموذج مرة واحدة خصيصًا لوحدة GPU الخاصة بك من NVIDIA، فيعمل المحرك الناتج بسرعة أكبر على تلك الوحدة مقارنة بمُحمِّل عام الغرض — لكنه يعمل فقط على عتاد NVIDIA ويحتاج إلى إعادة بناء إذا غيّرت جيل وحدة GPU أو النموذج.
📌ملاحظة: يستند هذا المقال إلى مستودع GitHub الرسمي لـ TensorRT-LLM من NVIDIA وإلى وثائقها العامة، وليس إلى اختبارات أداء مستقلة. ولم تُدرَج أرقام محددة للإنتاجية أو زمن الاستجابة لأنها لم تُقَس بشكل مستقل لهذا المقال، وتتفاوت بشدة حسب جيل وحدة GPU والنموذج وتركيبة الدُفعات وإصدار TensorRT-LLM. يصف هذا المقال TensorRT-LLM بشكل واقعي كطرف ثالث؛ وهو غير تابع لـ NVIDIA ولا معتمَد منها.
ما هو TensorRT-LLM؟
TensorRT-LLM هي مكتبة مفتوحة المصدر نشرتها NVIDIA لتحسين وتشغيل استدلال نماذج اللغة الكبيرة على وحدات GPU من NVIDIA. وهي مبنية فوق TensorRT، حزمة أدوات الاستدلال العامة للتعلم العميق من NVIDIA، وتضيف طبقة من ميزات وقت التشغيل الخاصة بنماذج اللغة الكبيرة وواجهة برمجة تطبيقات بلغة Python لتعريف النماذج وتجميعها في محركات مُحسَّنة.
- نشرتها وتصونها NVIDIA، وتُوزَّع كمصدر مفتوح بترخيص Apache 2.0 على GitHub
- توسِّع حزمة أدوات الاستدلال العامة TensorRT من NVIDIA بتحسينات خاصة بمحولات Transformer ونماذج اللغة الكبيرة
- توفر واجهة برمجة تطبيقات بلغة Python (
tensorrt_llm.LLM) بالإضافة إلى سير عمل عبر سطر الأوامرtrtllm-buildلتجميع النماذج - تتضمن أمر
trtllm-serveلإنشاء نقطة نهاية متوافقة مع OpenAI مباشرة من محرك تم بناؤه - تدعم العديد من عائلات النماذج المفتوحة الشائعة، رغم أن الدعم الدقيق لكل نموذج وخطوات التحويل اللازمة تختلف بحسب إصدار TensorRT-LLM — يُنصح بمراجعة وثائق النماذج المدعومة الخاصة بالمشروع قبل الالتزام بنموذج معين
ما الذي يجعل TensorRT-LLM سريعًا؟
يجمع نهج الأداء في TensorRT-LLM بين خطوة تجميع مسبقة وعدة تحسينات وقت تشغيل خاصة بنماذج اللغة الكبيرة، بدلًا من الاعتماد على تقنية واحدة فقط.
- التجميع المستمر أثناء التشغيل (in-flight batching، وهو مصطلح NVIDIA للتجميع المستمر): يمكن لطلبات جديدة الانضمام إلى دُفعة قيد التشغيل، ويمكن للطلبات المكتملة مغادرتها دون انتظار انتهاء الدُفعة بأكملها، مما يبقي وحدة GPU مشغولة تحت حِمل حقيقي وغير منتظم
- ذاكرة تخزين مؤقت KV مُقسَّمة إلى صفحات: تُدار ذاكرة القيم-المفاتيح الخاصة بالانتباه في كتل ثابتة الحجم بدلًا من تخصيص كبير واحد لكل طلب، مما يقلل هدر ذاكرة GPU — وهو مفهوم مشابه لأسلوب التقسيم إلى صفحات الذي شاع بفضل PagedAttention في vLLM
- نوى انتباه وGEMM مخصصة: نوى CUDA مضبوطة يدويًا للعمليات الأكثر تنفيذًا في نماذج اللغة الكبيرة، تُجمَّع وتُختار لوحدة GPU المستهدفة أثناء خطوة بناء المحرك
- تجميع المحرك مسبقًا: يُثبَّت رسم بياني النموذج والدقة المختارة واختيارات النوى في ملف محرك مُحسَّن واحد قبل بدء الخدمة، بدلًا من تحديدها ديناميكيًا عند التحميل
- دعم فك التشفير التخميني: توثِّق NVIDIA تقنيات نموذج مسودة وأساليب أخرى لفك التشفير التخميني تُنتج عدة رموز مرشحة في كل خطوة ويتم التحقق منها بالتوازي
ما العتاد الذي يحتاجه TensorRT-LLM؟
يعمل TensorRT-LLM حصريًا على وحدات GPU من NVIDIA — ولا توجد خلفية مخصصة لوحدة المعالجة المركزية وحدها أو AMD أو Intel أو Apple Silicon. وضمن تشكيلة وحدات GPU الخاصة بـ NVIDIA نفسها، تعتمد التحسينات المتاحة على جيل بنية وحدة GPU.
Blackwell (مثل B200)
- التفاصيل:
- أحدث بنية مدعومة حتى وقت كتابة هذا المقال. تضيف دعمًا لصيغة FP4 (NVFP4) بتسريع عتادي إلى جانب FP8، وفقًا لوثائق NVIDIA.
Hopper (مثل H100 وH200)
- التفاصيل:
- دعم عتادي لصيغة FP8؛ وتوثِّقه NVIDIA كأحد أنضج المسارات لتحسينات التكميم والانتباه الأحدث في TensorRT-LLM.
Ada Lovelace (مثل L4 وL40S)
- التفاصيل:
- مدعومة، مع استخدام INT8 (بما في ذلك SmoothQuant) عادةً كبديل حيث يكون الدعم الكامل لأدوات FP8 أضيق مما هو عليه في Hopper/Blackwell.
بنى أقدم (مثل Ampere)
- التفاصيل:
- توجد توافقية أوسع مع بعض وحدات GPU الأقدم الخاصة بمراكز بيانات NVIDIA، لكن صيغ التكميم وتحسينات النوى الأحدث تستهدف العتاد من الجيل الحالي — يُنصح بمراجعة ملاحظات الإصدار من NVIDIA لمعرفة مصفوفة الميزات الدقيقة لكل وحدة GPU بالإصدار الذي تنوي استخدامه.
إذا كان هدفك تشغيل نموذج على حاسوب محمول أو جهاز Mac أو أي وحدة GPU ليست من NVIDIA، فإن TensorRT-LLM ليست الأداة المصمَّمة لذلك — فـllama.cpp والأدوات المبنية عليها، مثل Ollama وLM Studio، تستهدف عتاد وحدة المعالجة المركزية وApple Silicon مباشرة وهي الأنسب لهذا السيناريو.
ما صيغ التكميم التي تدعمها TensorRT-LLM؟
تدعم TensorRT-LLM تشغيل النماذج بدقة رقمية مخفَّضة لتقليل استهلاك الذاكرة وزيادة الإنتاجية، مع اعتماد الصيغ المتاحة تحديدًا على جيل وحدة GPU المستهدفة.
FP8
- التفاصيل:
- فاصلة عائمة بـ8 بتات بتسريع عتادي على وحدات GPU من Hopper وBlackwell؛ وتوثِّق NVIDIA هذا عمومًا كأفضل موازنة بين الدقة والإنتاجية على هذين الجيلين.
FP4 (NVFP4)
- التفاصيل:
- صيغة فاصلة عائمة بـ4 بتات حصرية لـBlackwell، توثِّقها NVIDIA لوحدات GPU من جيل Blackwell وإصدارات حديثة من سلسلة أدوات TensorRT/CUDA.
INT8 / INT4
- التفاصيل:
- مسارات تكميم بأعداد صحيحة تشمل SmoothQuant، موثَّقة كبديل على أجيال وحدات GPU (مثل Ada) حيث تكون تغطية أدوات FP8 الكاملة أضيق.
AWQ / GPTQ
- التفاصيل:
- أساليب راسخة من المجتمع لتكميم الأوزان بـ4 بتات، وتدعمها TensorRT-LLM إلى جانب خيارات الدقة الخاصة بها.
لا يتضمن هذا المقال أرقامًا مقيسة بشكل مستقل لفقدان الجودة لكل صيغة على كل جيل من وحدات GPU — فهذه الأرقام تختلف حسب بنية النموذج والمهمة، لذا فإن مقارنة مخرجات بضع صيغ باستخدام موجّهاتك (prompts) وعتادك الخاص هي الطريقة الأكثر موثوقية للحكم على المقايضة.
كيف يُنشر TensorRT-LLM؟
يمكن تشغيل TensorRT-LLM مباشرة عبر بيئة تشغيله الخاصة بلغتي Python/C++، لكن في بيئات الإنتاج غالبًا ما يُستخدم عبر إحدى طبقتي نشر من NVIDIA مبنيتين حوله.
trtllm-serve: أمر مضمَّن مع TensorRT-LLM ينشئ نقطة نهاية واجهة برمجة تطبيقات متوافقة مع OpenAI مباشرة من محرك تم بناؤه، دون إطار خدمة منفصل- NVIDIA Triton Inference Server: منصة خدمة نماذج عامة الغرض بخلفية TensorRT-LLM، تضيف قوائم انتظار الطلبات، وتنسيق نماذج متعددة، وميزات نشر على مستوى الإنتاج مثل التكامل مع Kubernetes
- NVIDIA NIM: خدمات مصغّرة جاهزة ومُحوسبة (containerized) تُباع كجزء من اشتراك NVIDIA AI Enterprise، وتُغلِّف خلفية مُحسَّنة بواسطة TensorRT-LLM خلف واجهة برمجة تطبيقات موحّدة مع دعم من المورّد — راجع مقارنة خوادم الاستدلال المؤسسية لمزيد من التفاصيل حول ترخيص NIM ونموذج الدعم الخاص بها
كيف تبني وتشغّل محرك TensorRT-LLM؟
تحتاج TensorRT-LLM إلى وحدة GPU من NVIDIA، وتعريف CUDA مطابق، وعادةً إلى صورة الحاوية الرسمية من NVIDIA لتجنب تعارضات إصدارات الاعتماديات، نظرًا لاعتمادها الوثيق على إصدارات محددة من سلسلة أدوات CUDA وTensorRT.
- 1تأكد من امتلاكك وحدة GPU مدعومة من NVIDIA (جيل Hopper أو Ada أو Blackwell للحصول على أحدث التحسينات) مع تعريف CUDA حديث مثبَّت.
- 2اسحب صورة الحاوية الرسمية لـ TensorRT-LLM من NVIDIA، أو ثبّت حزمة Python باسم
tensorrt_llmفي بيئة CUDA مطابقة — يتجنب المسار المُحوسَب (containerized) معظم تعارضات الإصدارات. - 3حوِّل أو حمِّل نقطة تفتيش النموذج المصدر (على سبيل المثال من Hugging Face) باستخدام واجهة برمجة تطبيقات TensorRT-LLM بلغة Python أو نصوص التحويل النموذجية الخاصة بتلك العائلة من النماذج.
- 4ابنِ المحرك المُحسَّن لوحدة GPU المحددة الخاصة بك باستخدام أمر
trtllm-build، واختر دقة (FP16 أو FP8 أو INT4/INT8 أو FP4 على Blackwell) وتهيئة تجميع دفعات وقت البناء. - 5شغّل المحرك المبني، إما مباشرة باستخدام
trtllm-serveللحصول على نقطة نهاية متوافقة مع OpenAI، أو بتوجيه خلفية TensorRT-LLM في NVIDIA Triton Inference Server إلى دليل المحرك. - 6أرسل طلبًا اختباريًا إلى نقطة النهاية المنشورة (
curlأو أي عميل متوافق مع واجهة برمجة تطبيقات OpenAI) للتأكد من أن المحرك يُحمَّل ويولّد بشكل صحيح قبل توجيه حركة إنتاج فعلية إليه. - 7أعِد تشغيل خطوة البناء كلما غيّرت جيل وحدة GPU أو النموذج، أو أردت اعتماد إصدار جديد من TensorRT-LLM — فالمحرك المبني لجيل معين من وحدات GPU ليس مضمونًا أن يعمل بشكل مثالي، أو حتى أن يعمل إطلاقًا، على جيل مختلف.
هل عليّ إعادة بناء المحرك لكل وحدة GPU؟
عمومًا نعم للحصول على أفضل النتائج — يُجمَّع المحرك مع اختيارات نوى وتحسينات مخصصة لجيل بنية معين من وحدات GPU، لذا فإن الانتقال إلى جيل مختلف يتطلب عادة إعادة بنائه.
هل يمكنني استخدام نموذج مُكمَّم مسبقًا مع TensorRT-LLM؟
نعم — تدعم TensorRT-LLM بناء المحركات من نماذج مُكمَّمة بواسطة AWQ أو GPTQ، إضافة إلى تكميمها الخاص بصيغ FP8/INT8/INT4/FP4 المطبَّق أثناء خطوة البناء.
كيف تقارَن TensorRT-LLM بـvLLM وllama.cpp؟
تُشغِّل TensorRT-LLM وvLLM وllama.cpp جميعها استدلال نماذج اللغة الكبيرة، لكنها تقع في نقاط مختلفة على طيف الأداء مقابل المرونة.
TensorRT-LLM
- التفاصيل:
- حصرية لـNVIDIA، بترخيص Apache 2.0. تتطلب خطوة تجميع مسبقة لكل جيل من وحدات GPU؛ تستهدف أعلى إنتاجية ممكنة على ذلك العتاد المحدد من NVIDIA مقابل خطوة البناء والارتباط بمورّد واحد.
vLLM
- التفاصيل:
- بترخيص Apache 2.0، تحمّل النماذج المتوافقة مع Hugging Face Transformers مباشرة دون خطوة تجميع. وحدات GPU من NVIDIA هي هدفها الأساسي، مع خلفيات موثَّقة (أضيق) لـAMD وIntel وTPU أيضًا.
llama.cpp
- التفاصيل:
- محرك C/C++ بترخيص MIT يعمل على وحدة المعالجة المركزية وApple Silicon ومجموعة واسعة من مورّدي وحدات GPU عبر صيغة نموذج GGUF — الأكثر مرونة من حيث العتاد بين الثلاثة، لكنه غير مصمَّم لمقياس مراكز البيانات متعددة وحدات GPU وعالية التزامن التي تستهدفها TensorRT-LLM وvLLM.
لم يقارن هذا المقال هذه المحركات الثلاثة ببعضها بشكل مستقل، ولا يدّعي أن أحدها أسرع بشكل شامل — تعتمد الإنتاجية بشدة على النموذج وجيل وحدة GPU وخصائص الدُفعات وإصدار كل محرك. تكمن الميزة الحقيقية لـTensorRT-LLM في أعلى أداء تحديدًا على عتاد NVIDIA من الجيل الحالي، مقابل تكلفة خطوة التجميع والدعم الحصري لـNVIDIA؛ بينما تتنازل vLLM عن جزء من ذلك الضبط الدقيق الخاص بوحدة GPU مقابل سير عمل أبسط دون تجميع وتغطية عتاد أوسع (وإن ظلت NVIDIA هي الأساس)؛ في حين تتنازل llama.cpp عن مزيد من الإنتاجية القصوى مقابل القدرة على العمل على عتاد لا يستهدفه أيٌّ من الآخرين، بما في ذلك وحدات المعالجة المركزية وأجهزة Mac.
كيف ترتبط TensorRT-LLM بـNVIDIA NIM وTriton؟
ليست TensorRT-LLM وNVIDIA NIM وNVIDIA Triton Inference Server متنافسات — بل هي طبقات مختلفة من نفس مكدس الاستدلال الخاص بـNVIDIA، وفهم الفرق مهم عند التخطيط لعملية نشر.
TensorRT-LLM
- التفاصيل:
- المحرك والمُجمِّع: يحوّل النموذج إلى محرك استدلال مُحسَّن مخصص لوحدة GPU. مجاني ومفتوح المصدر (Apache 2.0)؛ تشغّله بنفسك.
مقالات حول TensorRT-LLM (5)
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)محدَّث ٦ سبتمبر ٢٠٢٦
- TensorRT-LLM Explained: NVIDIA's GPU-Optimized Inference Engine (2026)محدَّث ٦ سبتمبر ٢٠٢٦
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)محدَّث ٦ سبتمبر ٢٠٢٦
- text-generation-webui in 2026: How Oobabooga's Local LLM UI Became "TextGen"محدَّث ٥ سبتمبر ٢٠٢٦
- Enterprise LLM Inference Servers 2026: vLLM vs TGI vs NVIDIA NIM vs Ollamaمحدَّث ٢ سبتمبر ٢٠٢٦
مذكور أيضًا في:
- Running LLMs and VLA Models On-Robot 2026: What Fits, What Doesn'tمحدَّث ٢ سبتمبر ٢٠٢٦
- Apple MLX vs NVIDIA CUDA for Local LLMs: Which System Should You Choose in 2026?محدَّث ٢٩ أغسطس ٢٠٢٦
NVIDIA Triton Inference Server
- التفاصيل:
- منصة خدمة نماذج عامة الغرض، مجانية ومفتوحة المصدر، بخلفية TensorRT-LLM، تضيف توجيه الطلبات واستضافة نماذج متعددة وتنسيق الإنتاج حول محرك واحد أو أكثر.
NVIDIA NIM
- التفاصيل:
- طبقة خدمات مصغّرة جاهزة ومدفوعة، تُباع كجزء من اشتراك NVIDIA AI Enterprise، تُغلِّف خلفية مُحسَّنة بواسطة TensorRT-LLM خلف واجهة برمجة تطبيقات موحّدة مع دعم من المورّد — وتستبدل جهد الإعداد الذاتي بحاوية مدعومة وجاهزة للنشر.
من المسارات الشائعة: بناء النموذج في محرك TensorRT-LLM ثم خدمته عبر Triton من أجل نشر إنتاج مُدار ذاتيًا، أو تخطي خطوة البناء بالكامل باستخدام حاوية NIM جاهزة إذا كان الاشتراك المدفوع ودعم المورّد يستحقان ذلك بالنسبة لفريقك. راجع مقارنة خوادم الاستدلال المؤسسية للاطلاع على المقايضات في الترخيص والتكلفة بين NIM وvLLM وTGI.
لمن يناسب TensorRT-LLM؟
تناسب TensorRT-LLM الفرق التي التزمت بعتاد GPU من NVIDIA وتحتاج إلى أعلى إنتاجية استدلال ممكنة منه، وليس الأشخاص الباحثين عن أبسط طريقة لتشغيل نموذج.
TensorRT-LLM مقابل البدائل بلمحة سريعة
تقع هذه الأدوات في نقاط مختلفة على طيف تعقيد الإعداد مقابل أقصى أداء.
TensorRT-LLM
- الإعداد:
- تجميع محرك مخصص لوحدة GPU باستخدام
trtllm-build، ثم خدمته بـtrtllm-serveأو Triton. مطلوب وحدة GPU من NVIDIA وCUDA. - الأنسب لـ:
- أقصى إنتاجية لكل وحدة GPU على عتاد NVIDIA في بيئة الإنتاج، مقابل تكلفة خطوة تجميع.
vLLM
- الإعداد:
- حزمة Python عبر pip؛ خادم متوافق مع OpenAI يُشغَّل بأمر
vllm serve. لا توجد خطوة تجميع؛ الهدف الأساسي وحدات GPU من NVIDIA. - الأنسب لـ:
- خدمة عالية الإنتاجية لمستخدمين متعددين بسير عمل أبسط دون تجميع.
llama.cpp
- الإعداد:
- واجهة سطر أوامر، وواجهة ويب مضمَّنة، وواجهة برمجة تطبيقات متوافقة مع OpenAI عبر llama-server. تعمل على وحدة المعالجة المركزية أو مجموعة واسعة من مورّدي وحدات GPU.
- الأنسب لـ:
- مرونة العتاد، والنشر المدمج/على الحافة، والاستخدام على وحدة المعالجة المركزية أو Apple Silicon.
NVIDIA NIM
- الإعداد:
- حاوية جاهزة، تُنشر عبر اشتراك مدفوع في NVIDIA AI Enterprise. لا توجد خطوة بناء للمستخدم النهائي.
- الأنسب لـ:
- الفرق التي تريد أداء بمستوى TensorRT-LLM دون تشغيل خط أنابيب البناء بنفسها.
لم يقارن هذا المقال بشكل مستقل السرعة أو جودة المخرجات بين هذه الأدوات، ولا يدّعي أن إحداها أفضل تقنيًا لكل حِمل عمل — تغطي المقارنة أعلاه فقط الحقائق الموثَّقة المتعلقة بالبنية والإعداد والترخيص. راجع دليل خوادم الاستدلال المؤسسية لمقارنة أعمق حول الترخيص والنشر.
ما الذي لا يغطيه هذا المقال؟
هذا مقال تفسيري مبني على الوثائق العامة ومستودع NVIDIA، وليس تقرير اختبار أداء عملي.
- لا توجد أرقام مقيسة بشكل مستقل للإنتاجية أو زمن الاستجابة أو الطلبات في الثانية — فهذه تعتمد بشدة على جيل وحدة GPU والنموذج وتركيبة الدُفعات وإصدار TensorRT-LLM
- لا توجد نسب فقدان جودة مُتحقَّق منها بشكل مستقل لصيغ تكميم محددة على وحدات GPU محددة — فهذه تختلف حسب بنية النموذج والمهمة
- لا تغطية شاملة لكل بنية نموذج مدعومة أو خيار نواة أو ميزة متقدمة (الخدمة المُجزَّأة، توازي الخبراء، LoRA) — يركّز هذا المقال على المفاهيم التي تقيّمها معظم الفرق أولًا
- لا تغطية لأسعار NVIDIA AI Enterprise أو NIM، إذ لا تُنشر أسعار اشتراكات المؤسسات كما يُنشر سعر منتج للتجزئة — يُنصح بتأكيد الأسعار الحالية مباشرة مع NVIDIA
- لا ادّعاء بوجود اعتماد أو شراكة من NVIDIA — يصف هذا المقال TensorRT-LLM بشكل واقعي كشرح مستقل من طرف ثالث مبني على مصادر عامة
أخطاء شائعة عند تجربة TensorRT-LLM
معظم الاحتكاك مع TensorRT-LLM ينشأ من التقليل من شأن خطوة البناء/التجميع أو توقّع أن تتصرف مثل محرك تحميل مباشر.
الأسئلة الشائعة
ما هو TensorRT-LLM؟
TensorRT-LLM هي مكتبة مجانية ومفتوحة المصدر (Apache 2.0) نشرتها NVIDIA، تقوم بتجميع نماذج اللغة الكبيرة في محركات استدلال مُحسَّنة مبنية خصيصًا لوحدات GPU من NVIDIA، وهي مبنية فوق حزمة أدوات الاستدلال للتعلم العميق TensorRT من NVIDIA.
هل TensorRT-LLM مجانية؟
نعم. TensorRT-LLM نفسها برمجية مجانية ومفتوحة المصدر مُصدَرة بموجب ترخيص Apache 2.0. أما NVIDIA NIM، وهي طبقة خدمات مصغّرة مدفوعة ومنفصلة تُغلِّف خلفية TensorRT-LLM، فتتطلب اشتراكًا في NVIDIA AI Enterprise.
هل تعمل TensorRT-LLM على وحدات GPU من AMD أو Apple؟
لا. تعمل TensorRT-LLM حصريًا على وحدات GPU من NVIDIA — ولا توجد خلفية مخصصة لوحدة المعالجة المركزية وحدها أو AMD أو Intel أو Apple Silicon، على عكس vLLM أو llama.cpp اللذين يدعمان عتادًا أوسع.
لماذا تتطلب TensorRT-LLM تجميع النموذج أولًا؟
تبني TensorRT-LLM النموذج مسبقًا في محرك تُثبَّت فيه اختيارات النوى والتحسينات لجيل بنية معين من وحدات GPU، وهذه هي الطريقة التي تحقق بها هدف الأداء. وهذا يقايض خطوة بناء ومرونة أقل بين أنواع العتاد مقابل إنتاجية قصوى أعلى على تلك الوحدة المحددة من NVIDIA، مقارنة بالمحركات التي تحدد كل شيء ديناميكيًا عند التحميل.
ما صيغ التكميم التي تدعمها TensorRT-LLM؟
تدعم TensorRT-LLM صيغتي FP8 وFP4 (FP4 حصرية لوحدات GPU من جيل Blackwell)، وINT8 وINT4 بما في ذلك SmoothQuant، وصيغًا من المجتمع مثل AWQ وGPTQ، مع اعتماد التوافر الدقيق على جيل وحدة GPU المستهدفة.
هل TensorRT-LLM أفضل من vLLM؟
"الأفضل" يعتمد على الاستخدام: تستهدف TensorRT-LLM أعلى إنتاجية ممكنة لكل وحدة GPU تحديدًا على عتاد NVIDIA، مقابل تكلفة خطوة تجميع مسبقة ودعم حصري لـNVIDIA. أما vLLM فتحمّل النماذج مباشرة دون خطوة تجميع وتوثِّق دعمًا لخلفيات تتجاوز وحدات GPU من NVIDIA وحدها. ولا تُعد أيٌّ منهما أسرع بشكل شامل — راجع جدول المقارنة أعلاه.
ما الفرق بين TensorRT-LLM وNVIDIA NIM؟
TensorRT-LLM هي المحرك والمُجمِّع المجاني ومفتوح المصدر الذي تشغّله بنفسك. أما NVIDIA NIM فهي طبقة خدمات مصغّرة مدفوعة ومنفصلة تُغلِّف خلفية مُحسَّنة بواسطة TensorRT-LLM خلف واجهة برمجة تطبيقات موحّدة مع دعم من المورّد، وتُباع كجزء من اشتراك NVIDIA AI Enterprise.
هل يمكن لـTensorRT-LLM خدمة نماذج عبر وحدات GPU متعددة؟
نعم. توثِّق NVIDIA دعم الخدمة عبر وحدات GPU متعددة وعبر عُقد متعددة في TensorRT-LLM للنماذج الكبيرة جدًا بحيث لا تتسع في وحدة GPU واحدة، ويُنشر ذلك عادة عبر NVIDIA Triton Inference Server لتنسيق الإنتاج.
