조건부 모방 학습
행동 복제의 확장으로, 정책이 관찰에 추가하여 고수준 명령이나 목표에 조건화되는 방식입니다. 예를 들어, 네비게이션 정책은 현재 카메라 프레임과 함께 목표 이미지나 언어 지시를 입력으로 받을 수 있습니다. 이를 통해 단일 정책이 조건화 신호에 따라 여러 행동을 실행할 수 있습니다.
행동 복제의 확장으로, 정책이 관찰에 추가하여 고수준 명령이나 목표에 조건화되는 방식입니다. 예를 들어, 네비게이션 정책은 현재 카메라 프레임과 함께 목표 이미지나 언어 지시를 입력으로 받을 수 있습니다. 이를 통해 단일 정책이 조건화 신호에 따라 여러 행동을 실행할 수 있습니다.