Контекстно кеширане (Context Caching)
Контекстното кеширане (Context Caching) е оптимизационен механизъм в съвременните AI приложни интерфейси, който запазва междинните изчислени ключови и стойностни матрици (KV Cache) на дълги префикси в паметта на ускорителя.
Това позволява многократни повторни запитвания към големи кодови бази и масиви от документи с драстично намалени разходи и минимално закъснение за първия токен.