GAIL
生成的敵対的模倣学習(Generative Adversarial Imitation Learning)— 模倣学習と敵対的訓練を組み合わせたアルゴリズム。判別器は専門家のデモンストレーションとポリシーロールアウトを区別することを学習し、ポリシーはRLを介して判別器を騙すように訓練される。GAILは報酬関数を暗黙的に学習し、手設計された報酬なしで専門家レベルのパフォーマンスを達成する。
生成的敵対的模倣学習(Generative Adversarial Imitation Learning)— 模倣学習と敵対的訓練を組み合わせたアルゴリズム。判別器は専門家のデモンストレーションとポリシーロールアウトを区別することを学習し、ポリシーはRLを介して判別器を騙すように訓練される。GAILは報酬関数を暗黙的に学習し、手設計された報酬なしで専門家レベルのパフォーマンスを達成する。