奖励函数
奖励函数为强化学习智能体定义学习目标:它为每个(状态、动作、下一状态)转移分配标量奖励信号 r(s, a, s'),告诉智能体其动作的好坏程度。奖励函数设计是将强化学习应用于机器人学最困难的部分之一:稀疏奖励(成功时为 1,否则为 0)很清晰但导致学习缓慢;密集奖励(例如,到目标的负距离)指导学习但可能以意外方式被利用(奖励黑客)。替代方案包括从演示中学习奖励(IRL、RLHF)、特定任务的仿真指标和学习的偏好模型。模仿学习通过直接从演示中学习完全绕过奖励设计问题。 参见实践应用:我们的真实世界评估 →







