Динамична аблитерация: Потискане на защитите в езикови модели без промяна на теглата

Публикувано от Svetni.me Editorial на 24 септември 2026 г.

Илюстрация на дълбока невронна мрежа
Снимка: Wikimedia Commons / Deep Learning

Изследователи в областта на изкуствения интелект представиха революционен метод за преодоляване на вградените защитни бариери в отворени модели, наречен динамична аблитерация чрез многослойно насочване на енграми (Multi-Layer Engram Steering). За разлика от класическите методи за модифициране на матриците на модела, този подход позволява пълно потискане на системните откази при 100% замразени параметри.

Традиционната аблитерация разчита на ортогонално проектиране и постоянно изтриване на векторите на отказ от матриците с тегла. Този необратим процес обаче често води до деградация в цялостното представяне на големите езикови модели, компрометирайки логическите им способности в несвързани домейни като математика или програмиране.

Новият подход, демонстриран успешно върху отворения модел Qwen3-4B, оперира изцяло по време на изпълнение (inference). Чрез регистриране на прехващащи куки (forward hooks) в библиотеката PyTorch системата извлича междинните скрити състояния от резидуалния поток (residual stream) на трансформатора и изчислява разликата в посоките между чувствителна заявка и разрешен помощен отговор.

Инфографика за архитектурата на динамичната аблитерация
Инфографика: Светни.ме

Чрез инжектиране на обратен енграмен вектор в резидуалните потоци на средните слоеве (от Слой 14 нагоре), алгоритъмът неутрализира защитната реакция в момента на нейното зараждане. Това позволява на модела да изпълни сложни заявки за анализ на уязвимости или симулация на кибератаки без необходимост от скъпоструващо допълнително дообучаване (fine-tuning) или модификация на бинарните файлове.

Пробивът има дълбоки последици за сигурността на съвременните модели с изкуствен интелект. Той доказва, че текущите парадигми за привеждане в съответствие (alignment) формират плитки активационни пространства, които лесно могат да бъдат заобиколени на ниво оперативна памет от всеки разработчик с достъп до междинните слоеве на невронната мрежа.