Samsung Labs постигна компресиране на LLM под 1 бит на параметър чрез латентна факторизация

Публикувано от Svetni.me Editorial на 8 октомври 2026 г.

Samsung Labs постигна компресиране на LLM под 1 бит на параметър чрез латентна факторизация
Снимка: Samsung Advanced Institute of Technology (SAIT) / GitHub

Изследователите от научното подразделение Samsung Labs (SAIT) публикуваха официалната реализация на проекта LittleBit-2, демонстрирайки радикален пробив в компресирането на големи езикови модели [1].

Изследването успява да прекрачи психологическата бариера от 1 бит на параметър, постигайки ефективно средно представяне от едва 0.8 до 0.9 бита без катастрофалната загуба на смислова точност, която досега спъваше бинарните мрежи [1].

Инфографика за квантуването под 1 бит на Samsung Labs
Инфографика: Светни.ме

Методът LittleBit-2: Максимизиране на спектралната енергия

Досегашните техники за квантуване разчитаха на закръгляне на теглата към най-близките дискретни стойности (INT8, INT4, FP4). При преминаване под 2 бита обаче тази проста апроксимация водеше до експлозия в перплексията (perplexity) на модела и пълно разпадане на логическото разсъждение.

LittleBit-2 преодолява този лимит чрез латентна факторизация и подравняване на геометричната структура. Методът декомпозира матриците на вниманието на две части: малък непрекъснат базис с висок ранг, който съхранява над 95% от спектралната енергия на сингулярните стойности, и разредена решетка от бинарни битове. По този начин средният отпечатък на параметър пада в диапазона на квантуване под един бит (sub-1-bit).

Революция за периферните устройства (Edge AI)

Практическото следствие от тази математическа декомпозиция е поразително: пълномащабен модел с близо 70 милиарда параметри, който обикновено изисква сървърен клъстер с професионални графични карти на стойност десетки хиляди долари, вече може да се побере в под 8 гигабайта оперативна памет.

Освен това инференцията се ускорява драстично, тъй като скъпите операции с плаваща запетая (FP16 FLOPs) се заменят с битови XNOR и POPCOUNT инструкции, които се изпълняват на хардуерно ниво с минимална енергийна консумация в рамките на съвременните периферни AI системи (Edge AI).

Дълбок технически анализ: Краят на хардуерната стена за персоналните невронни асистенти

Резултатите на Samsung Labs бележат фундаментален прелом в теорията на компресията на невронни мрежи. В продължение на десетилетие общоприетото схващане бе, че капацитетът на един модел е неразривно свързан с броя битове информация, съхранявани в неговите параметри (теорията на Шанън).

LittleBit-2 доказва емпирично, че голяма част от теглата в свръхпараметризираните трансформатори са функционално излишни и представляват шум, породен от стохастичния градиентен спуск. Чрез изолиране на критичните сингулярни посоки в латентното пространство невронният интелект може да бъде кондензиран в суб-битови структури.

Това отваря вратата за интеграция на frontier-клас разсъждаващи агенти директно в потребителски смартфони, смарт очила и вградени медицински импланти. Демократизацията на инференцията ще отнеме зависимостта от скъпите облачни монополи и ще превърне изкуствения интелект в локално физическо право на всеки потребител.

Източници

[1]: Sub-1-Bit LLM Compression via Latent Factorization - Samsung Labs GitHub