GAIL
Generative Adversarial Imitation Learning — алгоритм, который объединяет обучение имитации с состязательным обучением. Дискриминатор учится различать демонстрации эксперта от развертываний политики; затем политика обучается обманывать дискриминатор через RL. GAIL неявно изучает функции вознаграждения и достигает производительности уровня эксперта без ручного проектирования вознаграждений.







