Glossaryに戻る

スパース報酬

Robot LearningRL

タスク完了時(成功/失敗)のみに信号を提供し、すべての中間ステップで報酬がゼロの報酬関数。スパース報酬は最も自然な仕様(二値成功)だが、強化学習にとって最も学習が難しい — エージェントはランダム探索を通じて成功した動作を発見する必要がある。HER、カリキュラム学習、報酬形成がスパース報酬学習に対処する。

Related terms