Glossaryに戻る

報酬モデル

MLRL

状態行動ペアまたは軌跡セグメントからスカラー報酬値を予測するために訓練されたニューラルネットワーク。通常、人間の選好または専門家デモンストレーションで訓練されます。報酬モデルは手作業で設計された報酬関数を学習されたものに置き換えます。これらはRLHFスタイルの訓練の中心であり、ロボット工学で数学的に形式化するのが難しい複雑なタスク目的を指定するために使用されます。

Related terms