Glossary पर वापस जाएं

सीखी गई पुरस्कार

Robot LearningRL

एक पुरस्कार फ़ंक्शन जो डेटा (मानव वरीयताएं, प्रदर्शन, या भाषा विवरण) से सीखा जाता है न कि हाथ से इंजीनियर किया गया हो। पुरस्कार सीखने की विधियों में व्युत्क्रम RL, मानव तुलनाओं से पुरस्कार मॉडलिंग (RLHF-शैली), और VLM-आधारित पुरस्कार स्कोरिंग (CLIP समानता या LLM मूल्यांकन का उपयोग करके) शामिल हैं। सीखी गई पुरस्कार इस चुनौती को संबोधित करती हैं कि अच्छी तरह से आकार की मैनुअल पुरस्कार फ़ंक्शन अक्सर जटिल हेराफेरी कार्यों के लिए निर्दिष्ट करना मुश्किल होता है।

Related terms