VLA
시각-언어-행동 모델 — 시각 관찰과 언어 지시를 입력으로 받아 로봇 행동을 직접 출력하는 기초 모델입니다. VLA는 인식, 언어 이해, 제어를 단일 신경망으로 통합합니다. RT-2, OpenVLA, Octo, π0이 그 예입니다. VLA는 현재 일반화된 로봇 학습의 최전선을 나타내며, 로보틱스의 'GPT 모멘트'를 목표로 합니다.
시각-언어-행동 모델 — 시각 관찰과 언어 지시를 입력으로 받아 로봇 행동을 직접 출력하는 기초 모델입니다. VLA는 인식, 언어 이해, 제어를 단일 신경망으로 통합합니다. RT-2, OpenVLA, Octo, π0이 그 예입니다. VLA는 현재 일반화된 로봇 학습의 최전선을 나타내며, 로보틱스의 'GPT 모멘트'를 목표로 합니다.