Glossaryに戻る

報酬シェーピング

Robot LearningRL

最適制御方針を変更することなく、より密で有益な学習信号を提供するために報酬関数を修正します。例えば、目標に近づくことに対して部分的なクレジットを与えるポテンシャルベースのシェーピング報酬を追加します。報酬シェーピングは疎な報酬環境でRL訓練を劇的に加速しますが、意図しないローカル最適値の導入を避けるために注意が必要です。

Related terms