„Бързо и бавно мислене“ в изкуствения интелект: Ролята на метапознанието в съвременните когнитивни архитектури

Cognitive Systems & Metacognition Research Archive
Повече от десетилетие след като психологическият бестселър на Даниел Канеман „Мисленето“ преобрази поведенческата икономика, неговите концепции се превръщат в основополагащ теоретичен фундамент за когнитивните архитектури в изкуствения интелект [1]. Фундаментално научно изследване дефинира ролята на метапознанието (способността на една система да наблюдава собствените си мисловни процеси) за преодоляване на границите на невронните мрежи [1].
Авторите посочват, че стандартното авторегресивно генериране на токени функционира изцяло като „Система 1“: бързо, интуитивно и асоциативно предсказване, което обаче е крайно уязвимо към логически капани и халюцинации [1].
Метапознавателният превключвател
За да постигнат надеждни логически разсъждения от тип „Система 2“, съвременните архитектури се нуждаят от отделен управляващ контур за метапознание [1]. Този модул непрекъснато оценява степента на несигурност на модела по време на самото разсъждение [1].
Когато задачата е рутинна, системата използва бързата и енергийно ефективна Система 1 [1]. В момента, в който метапознавателният слой регистрира логическо противоречие или ниска увереност, той автоматично задейства Система 2: спира директния отговор, активира разклонено дървовидно търсене (Tree-of-Thoughts) и извършва кръстосана проверка на аргументите [1].
Край на фалшивата самоувереност
Един от най-важните изводи в изследването е свързан с елиминирането на прекомерната самоувереност на моделите [1]. В експерименти с комплексни логически и математически задачи, добавянето на метапознавателен филтър съкращава фаталните грешки със 70% и кара модела открито да признава границите на знанията си, вместо да измисля убедително звучащи, но грешни факти [1].
Преодоляване на стената на мащабирането чрез алгоритмичен самоконтрол
Теоретичните открития относно ролята на метапознанието в съвременните когнитивни архитектури предлагат елегантен научен отговор на нарастващите опасения за достигане на „стена на мащабирането“ (scaling wall) при предварителното обучение на невронни мрежи [1]. Опитът да се постигне универсална надеждност единствено чрез увеличаване на обема на параметрите и захранване с трилиони токени вече показва затихваща възвръщаемост спрямо колосалните финансови и енергийни разходи [1].
Вместо да се разчита на груба сила по време на обучението, бъдещето принадлежи на динамичното разпределение на изчислителните ресурси по време на самите логически разсъждения (inference-time compute) [1]. Чрез въвеждане на метапознавателен контур, който оценява собствената си сигурност и активира задълбочено търсене само при необходимост, компактните модели постигат аналитична точност, надминаваща монолитните мрежи, спестявайки милиони долари за инфраструктура [1].

Инфографика: Анализ на Svetni.me
Източници
[1]: Thinking Fast and Slow in AI: The Role of Metacognition - arXiv