返回Glossary

逆强化学习

Robot LearningRL

从专家演示中学习奖励函数,假设专家(大约)最优地最大化该奖励。逆强化学习避免了手工设计奖励函数的需要——相反,奖励被推断出来,然后用于通过标准强化学习训练策略。最大熵IRL和对抗IRL(AIRL)是流行的公式。逆强化学习与GAIL密切相关。

Related terms