Glossaryに戻る

学習された報酬関数

Robot LearningRL

手作業で設計されるのではなく、データ(人間の選好、デモンストレーション、言語記述)から学習される報酬関数。報酬学習の方法には逆強化学習、人間の比較からの報酬モデリング(RLHFスタイル)、VLMベースの報酬スコアリング(CLIP類似度またはLLM評価を使用)が含まれます。学習された報酬は、複雑なマニピュレーションタスクに対して適切に設計された手作業の報酬関数を指定することが難しいという課題に対処します。

Related terms