पुरस्कार मॉडल
एक तंत्रिका नेटवर्क जो अवस्था-क्रिया जोड़ी या प्रक्षेपवक्र खंडों से अदिश पुरस्कार मान की भविष्यवाणी करने के लिए प्रशिक्षित है, आमतौर पर मानव वरीयताओं या विशेषज्ञ प्रदर्शन पर प्रशिक्षित। पुरस्कार मॉडल हाथ से इंजीनियर किए गए पुरस्कार फलन को सीखे गए लोगों से बदलते हैं। वे RLHF-शैली प्रशिक्षण के लिए केंद्रीय हैं और जटिल कार्य उद्देश्यों को निर्दिष्ट करने के लिए रोबोटिक्स में उपयोग किए जाते हैं जो गणितीय रूप से औपचारिक करना कठिन है।







