Prefix Caching

Prefix Caching (кеширане на префикси) е архитектурен механизъм за оптимизация на инференцията при големите езикови модели, при който Key-Value (KV) тензорите на повтарящи се начални сегменти от контекста (като системни инструкции или диалогови шаблони) се запазват в графичната памет. При последващи заявки със същия префикс системата извлича готовите състояния, вместо да ги преизчислява. Въпреки че елиминира етапа на предварително изчисление (prefill), генерирането на всеки нов токен продължава да чете целия кеширан обем от паметта.

Споменавания в статии