सीखी गई पुरस्कार
एक पुरस्कार फ़ंक्शन जो डेटा (मानव वरीयताएं, प्रदर्शन, या भाषा विवरण) से सीखा जाता है न कि हाथ से इंजीनियर किया गया हो। पुरस्कार सीखने की विधियों में व्युत्क्रम RL, मानव तुलनाओं से पुरस्कार मॉडलिंग (RLHF-शैली), और VLM-आधारित पुरस्कार स्कोरिंग (CLIP समानता या LLM मूल्यांकन का उपयोग करके) शामिल हैं। सीखी गई पुरस्कार इस चुनौती को संबोधित करती हैं कि अच्छी तरह से आकार की मैनुअल पुरस्कार फ़ंक्शन अक्सर जटिल हेराफेरी कार्यों के लिए निर्दिष्ट करना मुश्किल होता है।







