ゴール条件付き制御ポリシー
任意のゴール状態に到達するように訓練された制御ポリシー。ゴールは現在の観測と共に入力として提供される。ゴールはターゲット画像、座標、オブジェクト構成、または言語説明として指定できる。ゴール条件付き制御ポリシーは、タスクごとに個別の制御ポリシーを訓練するのではなく、ゴールを変更することで単一のモデルが多くのタスクを実行できるようにする。
任意のゴール状態に到達するように訓練された制御ポリシー。ゴールは現在の観測と共に入力として提供される。ゴールはターゲット画像、座標、オブジェクト構成、または言語説明として指定できる。ゴール条件付き制御ポリシーは、タスクごとに個別の制御ポリシーを訓練するのではなく、ゴールを変更することで単一のモデルが多くのタスクを実行できるようにする。