返回Glossary

稀疏奖励

Robot LearningRL

仅在任务完成时(成功/失败)提供信号的奖励函数,中间步骤的奖励为零。稀疏奖励是最自然的规范(二元成功),但对强化学习来说最难学习——智能体必须通过随机探索发现成功行为。HER、课程学习和奖励塑形可以解决稀疏奖励学习问题。

Related terms