TensorRT-LLM
TensorRT-LLM е специализирана библиотека с отворен код, разработена от NVIDIA, за компилиране и оптимизиране на големи езикови модели (LLMs) за високоскоростна инференция върху графични процесори (GPUs) на NVIDIA. Базирана на компилатора TensorRT, тя включва усъвършенствани оптимизации като PagedAttention, In-Flight Batching и квантуване (FP8, INT8/INT4), но изисква предварителен процес на компилация за конкретен хардуер.