ハイブリッド模倣強化学習
模倣学習(デモンストレーションから)と強化学習(環境相互作用から)を組み合わせて、デモンストレーションのサンプル効率を活用しながら、RLが専門家のパフォーマンスを超えて改善することを可能にする訓練パラダイム。方法にはDAPG(ポリシー勾配の事前分布としてのデモンストレーション)、IRL+RL、Demo-Augmented PPOが含まれる。
模倣学習(デモンストレーションから)と強化学習(環境相互作用から)を組み合わせて、デモンストレーションのサンプル効率を活用しながら、RLが専門家のパフォーマンスを超えて改善することを可能にする訓練パラダイム。方法にはDAPG(ポリシー勾配の事前分布としてのデモンストレーション)、IRL+RL、Demo-Augmented PPOが含まれる。