FourierQK: Филтрирането в честотната област намалява KV кеша на трансформаторите с 80%

Публикувано от Svetni.me Editorial на 3 октомври 2026 г.

FourierQK: Филтрирането в честотната област намалява KV кеша
Снимка: ArXiv / Machine Brief Archive

Изследователи в областта на дълбокото обучение публикуваха революционна научна разработка, представяща архитектурата „FourierQK“ – радикално преосмисляне на класическия механизъм за внимание (Attention Mechanism) в невронните мрежи [1].

Чрез пренасяне на изчисленията за корелация между токените от пространствената област в честотната област чрез бързи преобразувания на Фурие (FFT), новата техника постига смайващо 80% свиване на размера на KV кеша (Key-Value Cache), без да влошава способността на модела да намира критични детайли в контекст от милиони токени.

Проклятието на квадратичната памет в съвременния Transformer

Класическото скаларно внимание (Softmax Dot-Product Attention), формулирано в епохалния труд „Attention Is All You Need“, страда от фундаментално физическо ограничение:

  • Квадратична сложност и глад за памет: За да разбере връзката между думите, моделът трябва да изчисли матрица от взаимодействия с размер $N imes N$. При прозорец от 1 милион токена размерът на KV кеша надхвърля десетки гигабайти, което прави невъзможно обслужването на заявки на потребителски хардуер.
  • Честотен излишък в естествения език: Повечето семантични връзки в един текст имат ниска вариация – граматическите структури и контекстните теми се повтарят периодично. Класическият трансформатор обаче преизчислява всяко едно взаимодействие наново в пространствената област.

FourierQK решава този парадокс чрез теоремата за конволюцията: вместо матрично умножение в реално пространство, системата преобразува проекциите на запитванията и ключовете (Query и Key) в честотни спектри, извършва поелементно филтриране и връща резултата чрез обратна трансформация.

Математически пробив и емпирични резултати

Резултатите от новата архитектура показват качествено нови хоризонти за скалиране на моделите:

  1. 80% компресия на VRAM паметта: Чрез запазване само на доминиращите нискочестотни коефициенти и разредени високочестотни пикове, модел с прозорец от 1 милион токена се побира в едва 6.4 GB VRAM вместо досегашните 32 GB.
  2. Точност „игла в купа сено“ над 99.4%: В стандартизираните тестове за извличане на специфичен факт, скрит в огромни книги или кодови хранилища, FourierQK напълно запазва прецизността на класическия трансформатор.
  3. Линейно-логаритмична сложност $O(N \log N)$: Времето за обработка расте плавно с увеличаване на текста, премахвайки латентния шок при дълги диалози.

Дълбок инженерен анализ

Значението на FourierQK надхвърля чистата академична математика. През последните две години индустрията се опитваше да реши проблема с дългия контекст чрез изграждане на гигантски центрове за данни с колосално количество графична памет. Този подход обаче бе икономически неустойчив.

FourierQK доказва, че истинският прогрес идва не от грубото наливане на още силиций, а от елегантната математика. Възможността пълни софтуерни хранилища и стотици книги да се обработват директно в паметта на обикновен лаптоп с 16GB RAM отваря пътя към истински персонализирани, локални и независими AI асистенти за всеки човек на планетата.

Инфографика: Архитектура на механизма FourierQK
Инфографика: Математическо преобразуване на Фурие в механизма за внимание, компресия на KV кеша и разход на памет

Източници

  1. Machine Brief - FourierQK: Filter Shape, Admissibility and the Leakage-Coverage Law (2026-10-03)
  2. ArXiv Preprint - Frequency-Domain Attention: Compressing Key-Value Memory for Infinite-Context Transformers