पुरस्कार फलन
पुरस्कार फलन एक सुदृढ़ीकरण सीखने वाले एजेंट के लिए सीखने का उद्देश्य परिभाषित करता है: यह प्रत्येक (अवस्था, क्रिया, अगली-अवस्था) संक्रमण को एक अदिश पुरस्कार संकेत r(s, a, s') निर्दिष्ट करता है, एजेंट को बताता है कि इसकी क्रियाएं कितनी अच्छी या बुरी हैं। पुरस्कार फलन डिजाइन रोबोटिक्स में RL लागू करने के सबसे कठिन भागों में से एक है: विरल पुरस्कार (सफलता पर 1, अन्यथा 0) स्वच्छ हैं लेकिन धीमी सीखने की ओर ले जाते हैं; सघन पुरस्कार (जैसे, लक्ष्य तक नकारात्मक दूरी) सीखने को निर्देशित करते हैं लेकिन अप्रत्याशित तरीकों से खेले जा सकते हैं (पुरस्कार हैकिंग)। विकल्प में प्रदर्शन से पुरस्कार सीखना (IRL, RLHF), कार्य-विशिष्ट सिमुलेशन मेट्रिक्स, और सीखे गए वरीयता मॉडल शामिल हैं। अनुकरण सीखना पुरस्कार डिजाइन समस्या को पूरी तरह से दरकिनार करता है प्रदर्शन से सीधे सीखकर। व्यवहार में देखें: हमारे वास्तविक-विश्व मूल्यांकन →







