Glossary पर वापस जाएं

पुरस्कार मॉडल

MLRL

एक तंत्रिका नेटवर्क जो अवस्था-क्रिया जोड़ी या प्रक्षेपवक्र खंडों से अदिश पुरस्कार मान की भविष्यवाणी करने के लिए प्रशिक्षित है, आमतौर पर मानव वरीयताओं या विशेषज्ञ प्रदर्शन पर प्रशिक्षित। पुरस्कार मॉडल हाथ से इंजीनियर किए गए पुरस्कार फलन को सीखे गए लोगों से बदलते हैं। वे RLHF-शैली प्रशिक्षण के लिए केंद्रीय हैं और जटिल कार्य उद्देश्यों को निर्दिष्ट करने के लिए रोबोटिक्स में उपयोग किए जाते हैं जो गणितीय रूप से औपचारिक करना कठिन है।

Related terms