返回Glossary

奖励模型

MLRL

一个神经网络,用于从状态-动作对或轨迹段预测标量奖励值,通常基于人类偏好或专家演示进行训练。奖励模型用学习的奖励函数替代手工设计的奖励函数。它们是RLHF风格训练的核心,在机器人学中用于指定难以数学形式化的复杂任务目标。

Related terms