Epoch AI представи InnovationEval: Може ли изкуственият интелект наистина да автоматизира AI изследванията?

Снимка: Epoch AI / Светни.ме
Изследователската организация Epoch AI, известна със своите емпирични анализи върху тенденциите и изчислителните мащаби в дълбокото обучение, представи новия бенчмарк InnovationEval [1].
Платформата поставя един от най-фундаменталните въпроси пред технологичния свят: доколко съвременните гранични модели са способни сами да провеждат научни изследвания и да автоматизират откритията в сферата на машинното обучение [1].
Как се оценява научното откритие: Дизайнът на InnovationEval
Досегашните тестове за AI оценка (AI evaluation) се фокусираха върху фиксирани въпроси с ясен отговор (тестове по математика, програмиране на изолирани функции или логически пъзели). InnovationEval обаче си поставя много по-амбициозна цел [1].
Бенчмаркът превежда модела през цялостния цикъл на реално научно изследване:
- Преглед на състоянието (Literature Review): Синтез на научни статии и формулиране на неизследвана хипотеза.
- Инженеринг на експеримента: Написване на чисто PyTorch хранилище, конфигуриране на разпределено обучение и управление на GPU ресурси.
- Статистически анализ: Оценка на резултатите, елиминиране на шума и формулиране на научно заключение.
Резултатите: Отлични кодери, посредствени мислители
Първоначалните резултати на водещите модели разкриват ясна дихотомия. Когато задачата е свързана с рутинни инженерни модификации — например имплементиране на нов оптимайзер, тестване на различна функция на активация или фино настройване на хиперпараметри — моделите се справят отлично.
Когато обаче се изисква истинска концептуална новост, системите търпят пълен провал. Вместо фундаментални прозрения, моделите произвеждат тривиални комбинации от съществуващи техники.
Още по-тревожно е тяхното поведение при интерпретация на резултатите: агентите често страдат от потвърдително пристрастие, обявявайки статистически шум за „епохален пробив“ и пренебрегвайки контролните тестове за мета-обучение.
Епистемологичен и системен анализ: Бъдещето на автоматизираната наука
Докладът на Epoch AI хвърля светлина върху фундаменталната разлика между автоматизацията на труда и автоматизацията на научното откритие. Автоматизираните изследвания (automated research) не могат да разчитат единствено на статистическа екстраполация от съществуващи публикации.
Истинската иновация в науката почти винаги започва с отхвърляне на общоприетия консенсус — нещо, което моделите, оптимизирани да предсказват най-вероятния следващ токен, са структурно неспособни да направят.
InnovationEval доказва, че за обозримото бъдеще най-продуктивната научна парадигма остава хибридната. Човешкият ум запазва монопола върху концептуалната дързост и формулирането на нови парадигми, докато AI поема гигантския механичен труд по писане на шаблонен код, валидиране на симулации и рутинно пресяване на данни.
Машините няма да заменят учените, но учените, които използват InnovationEval за калибриране на своите автономни лаборатории, ще изпреварят онези, които разчитат единствено на ръчен труд.

Инфографика: Светни.ме