선호도 학습
명시적 보상 신호나 시연이 아닌 인간의 비교 판단(예: '궤적 A가 궤적 B보다 낫다')으로부터 학습. 보상 모델은 인간의 선호도와 일치하도록 훈련되고, RL을 통해 제어 정책을 최적화하는 데 사용된다. 이 접근 방식(로보틱스에 적용된 RLHF)은 정확한 스칼라 보상 엔지니어링의 필요성을 피하고 미묘한 인간의 의도를 포착할 수 있다.
명시적 보상 신호나 시연이 아닌 인간의 비교 판단(예: '궤적 A가 궤적 B보다 낫다')으로부터 학습. 보상 모델은 인간의 선호도와 일치하도록 훈련되고, RL을 통해 제어 정책을 최적화하는 데 사용된다. 이 접근 방식(로보틱스에 적용된 RLHF)은 정확한 스칼라 보상 엔지니어링의 필요성을 피하고 미묘한 인간의 의도를 포착할 수 있다.