GAIL
Generative Adversarial Imitation Learning — ein Algorithmus, der Imitationslernen mit adversarialem Training kombiniert. Ein Diskriminator lernt, Experten-Demonstrationen von Policy-Rollouts zu unterscheiden; die Policy wird dann trainiert, den Diskriminator durch RL zu täuschen. GAIL lernt Belohnungsfunktionen implizit und erreicht Experten-Leistung ohne handgestaltete Belohnungen.







