Gisting
Gisting е специализирана техника за компресиране на системни промптове и контекст при големите езикови модели (LLM). Методът компресира дълги текстови инструкции в компактна последователност от специални обучени вектори (gist tokens) чрез дестилация на знание. При инференция тези виртуални токени напълно заместват оригиналния текст на промпта, запазвайки функционалното поведение на модела, като същевременно драстично съкращават времето до първия генериран токен (TTFT) и натоварването върху графичната памет.