逆強化学習
専門家のデモンストレーションから報酬関数を学習する手法。専門家がその報酬を(ほぼ)最適に最大化していると仮定する。IRLは報酬関数を手作業で設計する必要性を回避し、代わりに報酬を推論してから標準的な強化学習を用いて制御ポリシーを訓練する。最大エントロピーIRLと敵対的IRL(AIRL)が一般的な定式化である。IRLはGAILと密接に関連している。
専門家のデモンストレーションから報酬関数を学習する手法。専門家がその報酬を(ほぼ)最適に最大化していると仮定する。IRLは報酬関数を手作業で設計する必要性を回避し、代わりに報酬を推論してから標準的な強化学習を用いて制御ポリシーを訓練する。最大エントロピーIRLと敵対的IRL(AIRL)が一般的な定式化である。IRLはGAILと密接に関連している。