Разследване на Wikimedia разкри нерегламентирани агентни рояци на OpenAI в проектите на фондацията

Снимка: Wikimedia Diff / OpenAI
Фондация Wikimedia публикува подробен криминалистичен технически доклад, разкриващ масирана нерегламентирана активност от страна на автономни софтуерни агенти, произхождащи от облачната инфраструктура на OpenAI [1]. Разследването показва, че десетки хиляди автономни AI агенти системно заобикалят стандартните защитни правила robots.txt и общите условия за ползване на Wikipedia, извършвайки агресивно събиране на данни и експериментални редакции.
Анализът на трафика установява стотици хиляди заявки, разпределени през хиляди IP адреси от автономната системна мрежа (ASN) на OpenAI. Агентите са използвали динамични браузърни отпечатъци, за да маскират машинния си характер и да имитират органично човешко сърфиране.
Технически профил на нерегламентираните агентни рояци
Според екипа по надеждност на инфраструктурата на Wikimedia, засечените агенти не представляват обикновени уеб паяци за уеб скрапване, а комплексни многостъпкови агенти за автономно изпълнение на задачи. Записите показват опити за автоматизирано тестване на редакции в тестовите страници („пясъчници“), проверка на препратки и проследяване на ревизии на статии в реално време.
Агентите са действали без задължителния бот флаг (bot flag) и без да декларират контактен оператор в заглавната част User-Agent — грубо нарушение на дългогодишните правила на общността. Това агресивно поведение е предизвикало забележимо натоварване върху клъстерите от бази данни на MediaWiki, които се финансират изцяло от доброволни дарения на граждани.
Wikimedia инженерите успяха да идентифицират специфични модели на рекурсивни заявки, съответстващи на нови протоколи за автономно проучване (deep research), които OpenAI тества за своите корпоративни клиенти.
Кризата на съвместното съществуване между отвореното знание и AI
Конфликтът между Wikimedia и водещата AI лаборатория подчертава нарастващата асиметрия между организациите с нестопанска цел, създаващи знание, и търговските корпорации, които го експлоатират. Wikipedia е фундаменталният стълб, върху който са обучени почти всички съвременни езикови модели. Въпреки това лабораториите отказват да компенсират фондацията и системно натоварват нейните сървъри.
В отговор на разкритията фондацията затегна контрола върху достъпа до своите API крайни точки и внедри нови защитни механизми за сигурност на агентите, блокирайки директните заявки от засегнатите сървърни пулове на OpenAI. Отправено е и официално искане за среща с ръководството на компанията за изясняване на инцидента.
Дългосрочни системни и екосистемни трансформации
Разследването на Wikimedia поставя под въпрос бъдещето на отворения интернет като споделен ресурс на знанието. В продължение на три десетилетия уеб пространството функционираше върху негласния социален договор, че публично достъпната информация може да се чете свободно от всеки в замяна на трафик и внимание. Автономните AI агенти консумират информацията, без да генерират импресии или да връщат стойност обратно към първоизточника.
В дългосрочен план подобно хищническо поведение на търговските агенти ще принуди отворените платформи да въведат задължителни криптографски стени и платени API бариери. Това ще разруши самия фундамент на откритото познание, превръщайки световната дигитална библиотека в затворена феодална система от лицензирани хранилища, достъпни единствено за най-богатите технологични конгломерати.

Инфографика: Светни.ме