Glossary(으)로 돌아가기

보상 함수

Reinforcement LearningCore Concept

강화학습 에이전트의 학습 목표를 정의하는 보상 함수: 각 (상태, 행동, 다음 상태) 전이에 스칼라 보상 신호 r(s, a, s')를 할당하여 에이전트에게 그 행동이 얼마나 좋거나 나쁜지 알려줍니다. 보상 함수 설계는 RL을 로봇공학에 적용할 때 가장 어려운 부분 중 하나입니다: 희소 보상(성공 시 1, 그 외 0)은 깔끔하지만 학습이 느립니다. 밀집 보상(예: 목표까지의 음의 거리)은 학습을 안내하지만 예상치 못한 방식으로 악용될 수 있습니다(보상 해킹). 대안으로는 시연으로부터의 보상 학습(IRL, RLHF), 작업별 시뮬레이션 메트릭, 학습된 선호도 모델이 있습니다. 모방 학습은 시연으로부터 직접 학습함으로써 보상 설계 문제를 완전히 우회합니다. 실제 사례 참조: 우리의 실제 평가 →

Related terms