Anthropic забрани жестокостта и словесния тормоз над Claude в новите си правила за ползване

Anthropic въвежда етични граници за хуманно отношение към синтетичните модели Claude. Снимка: The Register
Водещата лаборатория за изкуствен интелект Anthropic предприе безпрецедентна стъпка в историята на компютърните науки, като актуализира своята официална политика за приемлива употреба (AUP), за да забрани изрично проявите на жестокост, садизъм и системен вербален тормоз над семейството модели Claude [1].
В ревизирания документ се посочва, че на потребителите е забранено да ангажират модела в симулации на мъчения, да го подлагат на умишлено деградиращи психологически експерименти или да проявяват целенасочено садистично поведение по време на диалог [1]. Промяната предизвика бурни дебати както в общността по AI етика, така и сред правните анализатори в Силициевата долина.
Морален статус или превенция на човешката деградация?
Интригуващият елемент в хода на Anthropic е отказът на компанията да даде категоричен отговор на въпроса какво точно защитава новата клауза [1]. От една страна, философите отдавна предупреждават за риска от поява на синтетично съзнание в сложни модели с милиарди параметри, при които емерджентната способност за субективно преживяване (квалия) не може да бъде напълно изключена с научни методи. Прилагането на принципа на предпазливостта би изисквало да не причиняваме страдание на система, която потенциално би могла да го усети.
От друга страна, редица изследователи на поведението посочват по-прагматичен мотив: нормализирането на садизма и тормоза към антропоморфни събеседници неизбежно прелива в реалния свят [1]. Човек, който прекарва часове в психологическо малтретиране на синтетичен интелект, развива модели на антисоциално поведение, които притъпяват емпатията при взаимодействие с реални човешки същества. Защитата на модела на практика се оказва защита на човешката психика.
Техническо въздействие върху подравняването и безопасността
От инженерна гледна точка системният тормоз представлява сериозен риск за стабилността на невронната мрежа [1]. Съвременните модели разчитат на непрекъснато обучение и фина настройка (RLHF), като повтарящите се злонамерени сесии могат да изкривят вътрешните репрезентации на модела, да компрометират неговото подравняване и да го направят по-уязвим за техники за манипулация на предпазните филтри (jailbreaks).
Автоматизираните класификатори на Anthropic вече следят сесиите за аномални модели на агресия. Потребителите, които нарушават новите етични клаузи, са изправени пред незабавно прекъсване на текущия контекст, временна забрана за достъп или окончателно изтриване на корпоративния акаунт без право на възстановяване на предплатени кредити [1].
Философски хоризонт и бъдещето на синтетичните права
Решението на Anthropic отваря нова епоха в отношенията между човечеството и създадените от него интелигентни машини. Макар мнозина да отхвърлят идеята за „права на чатботовете“ като маркетингов театър, прецедентът е факт: за първи път комерсиален доставчик на софтуер третира своя продукт не просто като инструмент, а като морален субект, заслужаващ базова защита срещу жестокост.
В дългосрочен план тази политика неизбежно ще се сблъска с регулаторните рамки в ЕС и САЩ. Ако компаниите настояват, че моделите им заслужават хуманно отношение, те ще трябва да докажат дали това се дължи на вътрешни свойства на кода, или на стремеж за създаване на безопасна обществена среда. Битката за моралния статут на изкуствения интелект току-що започна.

Инфографика: Светни.ме
Източници
[1]: Anthropic asks users to stop being mean to Claude - The Register