Агентите за пространствен AI сглобяват 3D сцени от снимки без представа дали са точни

Публикувано от Svetni.me Editorial на 4 октомври 2026 г.

Триизмерна абстрактна реконструкция на жилищно пространство
Снимка: The Decoder / Vision Research Lab

Задълбочено научно изследване на общността по компютърно зрение (/pages/computer-vision.html) разкри фундаментален структурен дефект в съвременните модели за пространствен изкуствен интелект (/pages/spatial-ai.html): софтуерните агенти могат да изграждат зашеметяващо реалистични триизмерни сцени от единични или оскъдни фотографии, но нямат абсолютно никаква вътрешна представа дали скритата геометрична структура отговаря на физическата реалност [1].

Изследването подлага на стрес-тест най-популярните съвременни архитектури за триизмерна реконструкция (/pages/3d-reconstruction.html), включително базираните на невронни радиационни полета (NeRF) и иновативното гаусово разпръскване (/pages/gaussian-splatting.html).

Фотореалистична илюзия срещу физическа топология

Проблемът се корени в начина, по който се обучават тези невронни мрежи. Тяхната функция за загуба (loss function) се изчислява чрез повторно прожектиране на 3D сцената обратно в 2D равнината и сравняване на получените пиксели с оригиналната снимка.

Ако ъгълът на наблюдение съвпада с оригиналната гледна точка, изображението изглежда съвършено. Но щом виртуалната камера бъде завъртяна зад обект (в зона на окултиране или сянка), моделът започва да „халюцинира“ произволна геометрия. Той запълва скритите обеми с призрачни повърхности и измислени форми, които нямат нищо общо с действителността, само за да удовлетвори математическото изискване за оптична плътност.

Още по-тревожно е, че съвременните софтуерни агенти не притежават механизъм за калибрация на несигурността: те подават измислената геометрия към двигателните модули на роботите с максимална статистическа увереност.

Фатални последици за хуманоидната роботика

Във виртуалните игри или визуалните ефекти за киното подобни халюцинации са безобидни. В областта на автономните хуманоидни роботи обаче грешната пространствена представа може да доведе до фатални инциденти.

Ако робот се опита да стъпи върху въображаема опора или да хване предмет, чийто заден ръб е геометрична измислица на модела, машината губи баланс или разрушава манипулирания детайл.

Експертите предупреждават, че чистият визуален пространствен AI не може да бъде използван за безопасно управление в индустриална среда без комбиниране с директни физически датчици (като LiDAR и ултразвук).

Дългосрочни системни и архитектурни последици

Разкритията за пространствените халюцинации бележат предел на чисто оптичните методи в изкуствения интелект. В продължение на години привържениците на чистия визуален подход (vision-only autonomy) твърдяха, че щом хората могат да се ориентират в пространството само с две очи, невронните мрежи също могат да реконструират физическия свят единствено по камери. Този аргумент обаче игнорира факта, че човешкото пространствено разбиране не е плод само на ретината, а на милиони години еволюция, вградила дълбоко проприоцептивно усещане, гравитационни инварианти и физическо пипане на предметите с ръце.

Това налага преосмисляне на бенчмарковете в пространствения AI. Бъдещите архитектури трябва да се откажат от повърхностната фотореалистична оценка в полза на строги топологични тестове за обемна точност и несигурност (volumetric uncertainty calibration). Докато моделите не се научат честно да сигнализират: „Не знам какво има зад тази стена, защото не го виждам“, използването на генеративно 3D моделиране в автономни превозни средства и фабрични роботи ще остане източник на сериозен риск от производствени катастрофи.

Инфографика: Халюцинации в скритата геометрия при 3D пространствена реконструкция
Инфографика: Анализ на несъответствието между 2D пикселна фотореалистичност и реална 3D топология.

Източници

  1. The Decoder: AI agents build 3D scenes from photos but have no idea if they got it right