Glossaryに戻る

後知恵経験リプレイ

Robot LearningRL

目標条件付きRLのデータ拡張技術で、失敗した軌跡を実際に到達した状態を目標として再ラベル付けする。ロボットがブロックを位置Aに配置しようとしたが位置Bに到達した場合、HERはBが目標であり軌跡が成功である追加の訓練例を作成する。これにより、スパース報酬の目標到達タスクのサンプル効率が劇的に向上する。

Related terms