Reka AI представи Rho-1: 19-милиарден мултимодален модел, обединяващ език, зрение и управление на роботи

Снимка: The Decoder / Reka AI
Изследователската лаборатория Reka AI направи фундаментален архитектурен пробив с представянето на Rho-1 — 19-милиарден компактен омнимадел, способен да обработва и генерира текст, изображения, видео и директни команди за управление на роботи в рамките на единна невронна мрежа [1]. Разработката преодолява традиционното фрагментиране, при което визуалното възприятие и контролът на двигателните механизми се управляват от отделни специализирани модели.
Вместо да превежда изображенията в междинен текст и след това да подава инструкции към роботизиран контролер, Rho-1 генерира непрекъснати кинематични траектории директно от визуално-пространствения вход, намалявайки латентността при вземане на физически решения до милисекунди.
Архитектурна интеграция на пространствени и кинематични токени
Сърцевината на Rho-1 е нова схема за съвместна токенизация, която третира 3D координатите, ъгловите скорости на ставите на робота и пикселите на видеокадрите като равнопоставени елементи в общо векторно пространство на мултимодалния изкуствен интелект. Моделът използва оптимизиран енкодер, който компресира видеопотока с висока кадрова честота без загуба на пространствено-времева кохерентност.
По време на обучението изследователите са комбинирали огромни корпуси от мултимодални уеб данни с десетки хиляди часове симулационни и реални телеоперационни записи на роботизирани манипулатори. Специализираният слой за действие (action head) предвижда директно 7-степенни вектори на свобода на движение (7-DoF), позволявайки на физическия робот да извършва фини манипулации — като сортиране на чупливи обекти или сглобяване на електронни компоненти — водено единствено от визуалното наблюдение.
В бенчмарковете моделът изпреварва значително по-големи системи с 70 милиарда параметри в задачи за видео анализ и пространствено логическо мислене.
Преодоляване на фрагментацията във физическия изкуствен интелект
Досега индустрията на въплътения изкуствен интелект разчиташе на сложни йерархични архитектури: голям езиков модел планираше стъпките, зрителен модел откриваше обектите, а локален PID контролер движеше моторите. Тази модулност страдаше от сериозно забавяне и риск от каскадни грешки при погрешна интерпретация между слоевете.
Rho-1 доказва, че унификацията в един компактен 19-милиарден модел осигурява много по-гладко и интуитивно поведение на машината. Тъй като моделът се побира на единична работна станция с потребителски клас графични карти, той е идеален за директно вграждане в автономни мобилни роботи и фабрични коботи без постоянна връзка с отдалечен облак.
Дългосрочни системни и инженерни трансформации
Успехът на Rho-1 сигнализира за настъпването на ерата на „енд-ту-енд“ физическите модели, които ще променят из основи индустрията на роботиката. Когато сетивното възприятие и физическото действие се обучават съвместно в общ градиентен поток, роботът придобива интуитивно разбиране за законите на нютоновата физика — триене, маса, инерция и еластичност — по начин, непостижим чрез чисто текстово обучение.
В дългосрочен план отпадането на сложните софтуерни междинни слоеве (middleware) ще демократизира роботизираната автоматизация. Вместо месеци скъпо програмиране на специфични траектории, инженерите ще могат да инструктират промишлените роботи с глас или видео демонстрация. Това ще ускори сливането между дигиталния софтуер и физическия свят, превръщайки автономните манипулатори в естествено продължение на генеративния интелект.

Инфографика: Светни.ме