Inverse RL
Lernen einer Belohnungsfunktion aus Expertendemonstrationen unter der Annahme, dass der Experte diese Belohnung (näherungsweise) optimal maximiert. IRL vermeidet die Notwendigkeit, Belohnungsfunktionen manuell zu konstruieren — stattdessen wird die Belohnung hergeleitet und dann verwendet, um eine Kontrollpolitik mittels Standard-RL zu trainieren. Maximum-Entropie-IRL und adversariales IRL (AIRL) sind populäre Formulierungen. IRL ist eng mit GAIL verwandt.







