Glossary पर वापस जाएं

व्युत्क्रम RL

Robot LearningRL

विशेषज्ञ प्रदर्शनों से पुरस्कार फ़ंक्शन सीखना, इस धारणा के तहत कि विशेषज्ञ (लगभग) इष्टतम रूप से उस पुरस्कार को अधिकतम कर रहा है। IRL हाथ से तैयार किए गए पुरस्कार फ़ंक्शन की आवश्यकता को दूर करता है — इसके बजाय, पुरस्कार का अनुमान लगाया जाता है और फिर मानक RL के माध्यम से एक नीति को प्रशिक्षित करने के लिए उपयोग किया जाता है। Maximum entropy IRL और adversarial IRL (AIRL) लोकप्रिय सूत्रीकरण हैं। IRL GAIL से निकटता से संबंधित है।

Related terms