Glossary(으)로 돌아가기

보상 형성

Robot LearningRL

최적 정책을 변경하지 않으면서 더 밀집하고 더 정보성 있는 학습 신호를 제공하도록 보상 함수를 수정합니다. 예를 들어, 목표에 더 가까워지는 것에 대해 부분 점수를 주는 포텐셜 기반 형성 보상을 추가합니다. 보상 형성은 희소 보상 환경에서 RL 훈련을 극적으로 가속화하지만 의도하지 않은 국소 최적값을 도입하지 않도록 주의가 필요합니다.

Related terms