Aprendizaje por Refuerzo Inverso
Aprender una función de recompensa a partir de demostraciones de expertos, bajo el supuesto de que el experto está (aproximadamente) maximizando óptimamente esa recompensa. IRL evita la necesidad de diseñar manualmente funciones de recompensa — en su lugar, la recompensa se infiere y luego se utiliza para entrenar una política de control mediante aprendizaje por refuerzo estándar. IRL de máxima entropía e IRL adversarial (AIRL) son formulaciones populares. IRL está estrechamente relacionado con GAIL.







