व्युत्क्रम RL
विशेषज्ञ प्रदर्शनों से पुरस्कार फ़ंक्शन सीखना, इस धारणा के तहत कि विशेषज्ञ (लगभग) इष्टतम रूप से उस पुरस्कार को अधिकतम कर रहा है। IRL हाथ से तैयार किए गए पुरस्कार फ़ंक्शन की आवश्यकता को दूर करता है — इसके बजाय, पुरस्कार का अनुमान लगाया जाता है और फिर मानक RL के माध्यम से एक नीति को प्रशिक्षित करने के लिए उपयोग किया जाता है। Maximum entropy IRL और adversarial IRL (AIRL) लोकप्रिय सूत्रीकरण हैं। IRL GAIL से निकटता से संबंधित है।







