Модели зрение-език-действие (VLA Models)
Моделите зрение-език-действие (Vision-Language-Action Models - VLA) са гранични невронни архитектури за роботика, които приемат като вход визуални кадри и текстови инструкции, генерирайки директно нискостепенни двигателни команди (токени за действие).
VLA моделите позволяват преход от твърдо кодирана роботика към обобщено адаптивно поведение във физическия свят без предварително програмирани кинематични траектории.