Уменията, които носят отлични оценки, са тези, които ИИ имитира най-добре
В съвместно рандомизирано проучване изследователи от италианския Университет „Бокони“ и звеното за икономически изследвания на OpenAI [1], анализирано и от The Decoder [2], изследват ефекта от използването на изкуствен интелект и обучението по причинно-следствена логика върху академичните постижения. В експеримента участват 1053 първокурсници по въвеждащ мениджмънт, разделени на четири контролни и тестови групи, за да разработя маркетингови препоръки за университетския магазин [1].

Авторско изображение: Svetni.me / ИИ генерирано изображение
Резултатите показват ясно разграничение: достъпът до ChatGPT повишава традиционните оценки с близо цяла единица по петобалната скала, като придава на студентските трудове експертна структура и полираност [1]. В същото време краткото обучение по критично мислене стимулира генерирането на по-разнообразни и неконвенционални идеи, които обаче остават невъзнаградени от стандартните академични критерии [1].

Авторско изображение: Svetni.me / ИИ генерирана инфографика
Скок в оценките чрез имитация на експертен стил
В рамките на експеримента студентите получават за задача да напишат маркетингови препоръки с обем до 180 думи за увеличаване на разпознаваемостта и посещаемостта на университетския магазин [1]. Участниците са разпределени на четири групи: контролна група без допълнителни ресурси, група с достъп до модела GPT-4o, група с преминато кратко упражнение по причинно-следствена логика и комбинирана група [1].
Оценяването се извършва по петстепенна скала от независими човешки оценители, които не знаят към коя група принадлежи всеки текст [1]. Студентите с достъп до GPT-4o постигат средно с почти цяла единица по-висок резултат, като техните отговори съдържат средно с две идеи повече и показват значително по-високо съответствие с препоръките на трима независими експерти в областта [1].
Статистическият анализ потвърждава, че предимството на GPT-4o се запазва дори след контролиране на фактори като аргументация, брой идеи и текстови характеристики [2]. Авторите подчертават, че този скок се дължи на високото качество на съдържанието и ясната логическа структура, осигурени от езиковия модел, а не на по-дълбоки реални знания на самите студенти [2].
Критичното мислене насърчава оригиналност, но остава невъзнаградено
Обучението по причинно-следствена логика запознава студентите с механизмите за формулиране на проверими хипотези, взаимовръзката между предложени мерки и крайни резултати, както и условията, при които дадена стратегия може да се провали [1].
Студентите от тази група показват по-задълбочена аргументация и по-често обясняват контекста на своите предложения [1]. Въпреки това техните традиционни оценки не само не нарастват, но в някои случаи са незначително по-ниски от тези на контролната група [2].
Автоматизираният текстов анализ, проведен с модели на OpenAI и Anthropic, разкрива съществена полза, която стандартната скала пропуска: тези студенти генерират значително по-широк спектър от уникални идеи, които се различават от предложенията на техните състуденти [1]. Комбинираната група, съчетаваща достъп до GPT-4o и обучение по критично мислене, постига едновременно високи академични оценки и висока степен на идейно разнообразие [1].
Парадоксът на традиционните критерии за оценяване
Изследването разкрива сериозен структурен проблем в начина, по който се оценяват студентските работи [2]. Стандартните академични критерии възнаграждават добре форматирани, логически свързани и предвидими отговори, които се вписват в очакваното поле на решенията [2].
За сметка на това по-силната фалсифицируемост, подробните обяснения на възможните дефекти в плана и отклоненията от общоприетите отговори корелират с по-ниски крайни оценки [2]. Това прави съвременните ИИ системи перфектен инструмент за симулиране на високи постижения, тъй като моделите са оптимизирани именно за гладък, правдоподобен и конвенционален изказ [2].
Разликата между подобрен резултат и реално обучение
Авторите на изследването изрично отбелязват, че експериментът измерва качеството на крайния предаден текст, а не трайно усвоените знания [2]. В рамките на опита не е проведен последващ изпит без достъп до ChatGPT, за да се установи дали студентите са разбрали материята [2].
Редица други мащабни академични изследвания подчертават рисковете от безкритичното делегиране на интелектуален труд на ИИ [2]:
Проучване на над 500 000 студентски оценки в американски колежи показва, че ръстът на отличните оценки след появата на ChatGPT е концентриран предимно в дисциплини с голям дял домашни работи [2].
Контролирани експерименти установяват, че при отнемане на достъпа до ИИ студентите, които са използвали генеративни модели за директно получаване на готови отговори, се справят значително по-зле от контролните групи [2].
30-месечно изследване сред над 26 000 ученици в Китай разкрива, че докато домашните работи стават по-бързи и по-качествени с ИИ, резултатите на по-късни самостоятелни приемни изпити спадат с между 18% и 24% [2].
Предизвикателството пред образователните институции
Ако генеративните модели могат с лекота да произвеждат текстове на ниво експерт, оценяването единствено на крайния продукт губи своята диагностична стойност [1]. Изследователите настояват образователните критерии да бъдат адаптирани така, че изрично да поощряват оригиналността, поставянето под въпрос на предварителни предположения и разглеждането на алтернативни подходи [1].
Истинската стойност на технологиите в образованието се крие не в механичното заместване на мисловния процес, а в синергията между аналитичното мислене на ученика и възможностите на ИИ за структуриране на информацията [1].
Източници:
[2]: The skills that earn top grades are the ones AI can fake best - The Decoder