Aprendizado por Reforço Inverso
Aprender uma função de recompensa a partir de demonstrações de especialistas, sob a suposição de que o especialista está (aproximadamente) maximizando otimamente essa recompensa. IRL evita a necessidade de engenharia manual de funções de recompensa — em vez disso, a recompensa é inferida e então usada para treinar uma política de controle via aprendizado por reforço padrão. Maximum Entropy IRL e Adversarial IRL (AIRL) são formulações populares. IRL está intimamente relacionado a GAIL.







