Triton Inference Server
Triton Inference Server (по-рано TensorRT Inference Server) е софтуер с отворен код от NVIDIA за оптимизиране и обслужване на модели за машинно обучение при инференция (inference). Той поддържа множество фреймуоркове като TensorFlow, PyTorch, TensorRT, vLLM и ONNX, позволявайки паралелно изпълнение на модели на CPU и GPU, динамично групиране на заявки (dynamic batching) и ефективно управление на графичната памет.