Glossary(으)로 돌아가기

보상 엔지니어링

Robot LearningRL

RL 훈련을 위해 원하는 로봇 행동을 인코딩하는 스칼라 보상 함수를 설계하는 과정. 좋은 보상 엔지니어링은 의도하지 않은 지름길을 도입하지 않으면서 학습을 안내하는 밀집 피드백을 제공합니다. 일반적인 함정: 보상 해킹(의도한 행동이 아닌 보상 프록시를 최적화하는 것)과 희소 보상(학습 신호가 너무 드문 경우).

Related terms