VLA (модель Vision-Language-Action)
Модель Vision-Language-Action — нейронная сеть, которая совместно обрабатывает визуальные наблюдения (RGB-изображения), инструкции на естественном языке и проприоцепцию робота для выведения действий. VLA расширяют большие модели зрения-языка (VLM такие как PaLM-E, LLaVA или Gemini) добавлением головы действия — обучая модель выводить позиции суставов робота или дельты конечного эффектора наряду с её языковыми предсказаниями. Заметные VLA включают RT-2 (токенизирует действия как текстовые токены и дообучает VLM), OpenVLA (открытый исходный код, 7B параметров, обученная на Open X-Embodiment) и pi0 (VLA с потоковым сопоставлением от Physical Intelligence). См. статью VLA и VLM и каталог моделей RCSV. Посмотрите это в действии: наши оценки в реальном мире →







