Reka AI представи Rho-1: 19-милиарден мултимодален модел, обединяващ език, зрение и управление на роботи

Публикувано от Svetni.me Editorial на 5 октомври 2026 г.

Архитектурна схема на омнимадела Reka Rho-1
Снимка: The Decoder / Reka AI

Изследователската лаборатория Reka AI направи фундаментален архитектурен пробив с представянето на Rho-1 — 19-милиарден компактен омнимадел, способен да обработва и генерира текст, изображения, видео и директни команди за управление на роботи в рамките на единна невронна мрежа [1]. Разработката преодолява традиционното фрагментиране, при което визуалното възприятие и контролът на двигателните механизми се управляват от отделни специализирани модели.

Вместо да превежда изображенията в междинен текст и след това да подава инструкции към роботизиран контролер, Rho-1 генерира непрекъснати кинематични траектории директно от визуално-пространствения вход, намалявайки латентността при вземане на физически решения до милисекунди.

Архитектурна интеграция на пространствени и кинематични токени

Сърцевината на Rho-1 е нова схема за съвместна токенизация, която третира 3D координатите, ъгловите скорости на ставите на робота и пикселите на видеокадрите като равнопоставени елементи в общо векторно пространство на мултимодалния изкуствен интелект. Моделът използва оптимизиран енкодер, който компресира видеопотока с висока кадрова честота без загуба на пространствено-времева кохерентност.

По време на обучението изследователите са комбинирали огромни корпуси от мултимодални уеб данни с десетки хиляди часове симулационни и реални телеоперационни записи на роботизирани манипулатори. Специализираният слой за действие (action head) предвижда директно 7-степенни вектори на свобода на движение (7-DoF), позволявайки на физическия робот да извършва фини манипулации — като сортиране на чупливи обекти или сглобяване на електронни компоненти — водено единствено от визуалното наблюдение.

В бенчмарковете моделът изпреварва значително по-големи системи с 70 милиарда параметри в задачи за видео анализ и пространствено логическо мислене.

Преодоляване на фрагментацията във физическия изкуствен интелект

Досега индустрията на въплътения изкуствен интелект разчиташе на сложни йерархични архитектури: голям езиков модел планираше стъпките, зрителен модел откриваше обектите, а локален PID контролер движеше моторите. Тази модулност страдаше от сериозно забавяне и риск от каскадни грешки при погрешна интерпретация между слоевете.

Rho-1 доказва, че унификацията в един компактен 19-милиарден модел осигурява много по-гладко и интуитивно поведение на машината. Тъй като моделът се побира на единична работна станция с потребителски клас графични карти, той е идеален за директно вграждане в автономни мобилни роботи и фабрични коботи без постоянна връзка с отдалечен облак.

Дългосрочни системни и инженерни трансформации

Успехът на Rho-1 сигнализира за настъпването на ерата на „енд-ту-енд“ физическите модели, които ще променят из основи индустрията на роботиката. Когато сетивното възприятие и физическото действие се обучават съвместно в общ градиентен поток, роботът придобива интуитивно разбиране за законите на нютоновата физика — триене, маса, инерция и еластичност — по начин, непостижим чрез чисто текстово обучение.

В дългосрочен план отпадането на сложните софтуерни междинни слоеве (middleware) ще демократизира роботизираната автоматизация. Вместо месеци скъпо програмиране на специфични траектории, инженерите ще могат да инструктират промишлените роботи с глас или видео демонстрация. Това ще ускори сливането между дигиталния софтуер и физическия свят, превръщайки автономните манипулатори в естествено продължение на генеративния интелект.

Инфографика: Архитектура на модела Reka Rho-1
Инфографика: Светни.ме

Източници

  1. The Decoder: Reka AI's omni-model Rho-1 handles text, images, video, and robot control in a single model