学习奖励函数
从数据(人类偏好、演示或语言描述)学习的奖励函数,而非手工设计。奖励学习方法包括逆强化学习、从人类比较的奖励建模(RLHF 风格)和基于 VLM 的奖励评分(使用 CLIP 相似度或 LLM 评估)。学习奖励函数解决了这一挑战:对于复杂操纵任务,精心设计的手工奖励函数往往难以指定。
从数据(人类偏好、演示或语言描述)学习的奖励函数,而非手工设计。奖励学习方法包括逆强化学习、从人类比较的奖励建模(RLHF 风格)和基于 VLM 的奖励评分(使用 CLIP 相似度或 LLM 评估)。学习奖励函数解决了这一挑战:对于复杂操纵任务,精心设计的手工奖励函数往往难以指定。