GAIL
Generative Adversarial Imitation Learning — एक एल्गोरिदम जो अनुकरण सीखने को प्रतिकूल प्रशिक्षण के साथ जोड़ता है। एक discriminator विशेषज्ञ प्रदर्शनों को नीति rollouts से अलग करना सीखता है; नीति को तब RL के माध्यम से discriminator को मूर्ख बनाने के लिए प्रशिक्षित किया जाता है। GAIL निहित रूप से पुरस्कार कार्य सीखता है और हाथ से डिज़ाइन किए गए पुरस्कारों के बिना विशेषज्ञ-स्तर का प्रदर्शन प्राप्त करता है।







