Разредени автоенкодери (Sparse Autoencoders / SAE)

Разредените автоенкодери (SAE) са невронни архитектури, използвани в механистичната интерпретируемост за декомпозиране на полисемантичните активации на големи езикови модели в разбираеми моносемантични признаци.

Приложение за безопасност

SAE позволяват на изследователите да наблюдават дали даден модел активира скрити концепции за заблуда, измама или опити за заобикаляне на системните инструкции преди генериране на крайния текст.

Споменавания в статии