Glossary पर वापस जाएं

वरीयता सीखना

Robot LearningRL

मानव तुलनात्मक निर्णयों (जैसे, 'प्रक्षेपवक्र A, प्रक्षेपवक्र B से बेहतर है') से सीखना, न कि स्पष्ट पुरस्कार संकेत या प्रदर्शन से। एक पुरस्कार मॉडल को मानव वरीयताओं के अनुरूप होने के लिए प्रशिक्षित किया जाता है, फिर RL के माध्यम से नीति को अनुकूलित करने के लिए उपयोग किया जाता है। यह दृष्टिकोण (रोबोटिक्स पर लागू RLHF) सटीक अदिश पुरस्कार इंजीनियरिंग की आवश्यकता से बचता है और सूक्ष्म मानव इरादे को पकड़ सकता है।

Related terms