엔드-투-엔드 학습
원시 센서 입력(이미지, 고유감각)에서 로봇 액션으로 직접 매핑하는 단일 신경망을 학습하되, 손으로 설계한 중간 표현이나 모듈식 파이프라인 없이 수행한다. 엔드-투-엔드 학습은 모듈식 시스템의 정보 병목을 피하지만 더 많은 학습 데이터가 필요하고 해석이 어렵다. VLA 모델은 엔드-투-엔드 로봇 학습의 최전선을 나타낸다.
원시 센서 입력(이미지, 고유감각)에서 로봇 액션으로 직접 매핑하는 단일 신경망을 학습하되, 손으로 설계한 중간 표현이나 모듈식 파이프라인 없이 수행한다. 엔드-투-엔드 학습은 모듈식 시스템의 정보 병목을 피하지만 더 많은 학습 데이터가 필요하고 해석이 어렵다. VLA 모델은 엔드-투-엔드 로봇 학습의 최전선을 나타낸다.