VLA
Модель Vision-Language-Action — фундаментальная модель, которая принимает визуальные наблюдения и инструкции на естественном языке в качестве входа и напрямую выводит действия робота. VLA объединяют восприятие, понимание языка и управление в единой нейронной сети. Примеры включают RT-2, OpenVLA, Octo и π0. VLA представляют текущий рубеж обобщённого обучения роботов, стремясь стать «GPT моментом» для робототехники.







