보상 형성
최적 정책을 변경하지 않으면서 더 밀집하고 더 정보성 있는 학습 신호를 제공하도록 보상 함수를 수정합니다. 예를 들어, 목표에 더 가까워지는 것에 대해 부분 점수를 주는 포텐셜 기반 형성 보상을 추가합니다. 보상 형성은 희소 보상 환경에서 RL 훈련을 극적으로 가속화하지만 의도하지 않은 국소 최적값을 도입하지 않도록 주의가 필요합니다.
최적 정책을 변경하지 않으면서 더 밀집하고 더 정보성 있는 학습 신호를 제공하도록 보상 함수를 수정합니다. 예를 들어, 목표에 더 가까워지는 것에 대해 부분 점수를 주는 포텐셜 기반 형성 보상을 추가합니다. 보상 형성은 희소 보상 환경에서 RL 훈련을 극적으로 가속화하지만 의도하지 않은 국소 최적값을 도입하지 않도록 주의가 필요합니다.