보상 엔지니어링
RL 훈련을 위해 원하는 로봇 행동을 인코딩하는 스칼라 보상 함수를 설계하는 과정. 좋은 보상 엔지니어링은 의도하지 않은 지름길을 도입하지 않으면서 학습을 안내하는 밀집 피드백을 제공합니다. 일반적인 함정: 보상 해킹(의도한 행동이 아닌 보상 프록시를 최적화하는 것)과 희소 보상(학습 신호가 너무 드문 경우).
RL 훈련을 위해 원하는 로봇 행동을 인코딩하는 스칼라 보상 함수를 설계하는 과정. 좋은 보상 엔지니어링은 의도하지 않은 지름길을 도입하지 않으면서 학습을 안내하는 밀집 피드백을 제공합니다. 일반적인 함정: 보상 해킹(의도한 행동이 아닌 보상 프록시를 최적화하는 것)과 희소 보상(학습 신호가 너무 드문 경우).