वरीयता सीखना
मानव तुलनात्मक निर्णयों (जैसे, 'प्रक्षेपवक्र A, प्रक्षेपवक्र B से बेहतर है') से सीखना, न कि स्पष्ट पुरस्कार संकेत या प्रदर्शन से। एक पुरस्कार मॉडल को मानव वरीयताओं के अनुरूप होने के लिए प्रशिक्षित किया जाता है, फिर RL के माध्यम से नीति को अनुकूलित करने के लिए उपयोग किया जाता है। यह दृष्टिकोण (रोबोटिक्स पर लागू RLHF) सटीक अदिश पुरस्कार इंजीनियरिंग की आवश्यकता से बचता है और सूक्ष्म मानव इरादे को पकड़ सकता है।







