Лингвистическа нечетливост (Linguistic Illegibility)

Лингвистическа нечетливост (Linguistic Illegibility) е концепция в сигурността на изкуствения интелект, въведена от Джеймс Микенс от Харвардския университет. Тя описва фундаменталната семантична пропаст между вътрешните математически изчисления на невронната мрежа в активационното пространство и нейните външно изразени езикови артефакти (като „вериги от мисли“ или семантично декодирани вектори). Тъй като големите езикови модели оперират върху непрекъснати вектори с висока размерност, а не върху същински символни езикови понятия, езиковото самоотчитане на модела не може да предостави формални гаранции за безопасност и контрол.

Споменавания в статии