Glossaryに戻る

報酬エンジニアリング

Robot LearningRL

RL訓練のためにロボットの望ましい動作を符号化するスカラー報酬関数を設計するプロセス。優れた報酬エンジニアリングは、意図しないショートカットを導入することなく学習を導く密な反応を提供します。一般的な落とし穴:報酬ハッキング(意図した動作ではなく報酬プロキシを最適化する)と疎な報酬(学習信号が不頻繁)。

Related terms