GAIL
Generative Adversarial Imitation Learning — خوارزمية تجمع بين تعلم المحاكاة والتدريب الخصومي. يتعلم المميز التمييز بين عروض الخبراء وعمليات تشغيل السياسة؛ ثم يتم تدريب السياسة على خداع المميز عبر التعلم المعزز. يتعلم GAIL دوال المكافأة بشكل ضمني ويحقق أداء على مستوى الخبير دون مكافآت مصممة يدويًا.







