Модели зрение-език-действие (VLA Models)

Моделите зрение-език-действие (Vision-Language-Action Models - VLA) са гранични невронни архитектури за роботика, които приемат като вход визуални кадри и текстови инструкции, генерирайки директно нискостепенни двигателни команди (токени за действие).

VLA моделите позволяват преход от твърдо кодирана роботика към обобщено адаптивно поведение във физическия свят без предварително програмирани кинематични траектории.

Споменавания в статии