보상 모델
상태-행동 쌍 또는 궤적 세그먼트로부터 스칼라 보상 값을 예측하도록 훈련된 신경망으로, 일반적으로 인간의 선호도 또는 전문가 시연으로부터 훈련됩니다. 보상 모델은 손으로 설계한 보상 함수를 학습된 함수로 대체합니다. RLHF 스타일 훈련의 중심이며 로봇공학에서 수학적으로 형식화하기 어려운 복잡한 작업 목표를 지정하는 데 사용됩니다.
상태-행동 쌍 또는 궤적 세그먼트로부터 스칼라 보상 값을 예측하도록 훈련된 신경망으로, 일반적으로 인간의 선호도 또는 전문가 시연으로부터 훈련됩니다. 보상 모델은 손으로 설계한 보상 함수를 학습된 함수로 대체합니다. RLHF 스타일 훈련의 중심이며 로봇공학에서 수학적으로 형식화하기 어려운 복잡한 작업 목표를 지정하는 데 사용됩니다.