返回Glossary

奖励塑形

Robot LearningRL

修改奖励函数以提供更密集、更信息丰富的学习信号,而不改变最优控制策略。例如,添加基于势函数的塑形奖励,为接近目标提供部分奖励。奖励塑形在稀疏奖励环境中能显著加速强化学习训练,但需要谨慎以避免引入意外的局部最优。

Related terms