Glossary(으)로 돌아가기

역강화학습

Robot LearningRL

전문가 시연으로부터 보상 함수를 학습하며, 전문가가 (대략적으로) 그 보상을 최적으로 최대화하고 있다고 가정합니다. IRL은 보상 함수를 수동으로 설계할 필요를 피하고, 대신 보상을 추론한 후 표준 강화학습으로 제어정책을 훈련합니다. 최대 엔트로피 IRL과 적대적 IRL(AIRL)이 인기 있는 공식화입니다. IRL은 GAIL과 밀접한 관련이 있습니다.

Related terms