Glossary पर वापस जाएं

पुरस्कार फलन

Reinforcement LearningCore Concept

पुरस्कार फलन एक सुदृढ़ीकरण सीखने वाले एजेंट के लिए सीखने का उद्देश्य परिभाषित करता है: यह प्रत्येक (अवस्था, क्रिया, अगली-अवस्था) संक्रमण को एक अदिश पुरस्कार संकेत r(s, a, s') निर्दिष्ट करता है, एजेंट को बताता है कि इसकी क्रियाएं कितनी अच्छी या बुरी हैं। पुरस्कार फलन डिजाइन रोबोटिक्स में RL लागू करने के सबसे कठिन भागों में से एक है: विरल पुरस्कार (सफलता पर 1, अन्यथा 0) स्वच्छ हैं लेकिन धीमी सीखने की ओर ले जाते हैं; सघन पुरस्कार (जैसे, लक्ष्य तक नकारात्मक दूरी) सीखने को निर्देशित करते हैं लेकिन अप्रत्याशित तरीकों से खेले जा सकते हैं (पुरस्कार हैकिंग)। विकल्प में प्रदर्शन से पुरस्कार सीखना (IRL, RLHF), कार्य-विशिष्ट सिमुलेशन मेट्रिक्स, और सीखे गए वरीयता मॉडल शामिल हैं। अनुकरण सीखना पुरस्कार डिजाइन समस्या को पूरी तरह से दरकिनार करता है प्रदर्शन से सीधे सीखकर। व्यवहार में देखें: हमारे वास्तविक-विश्व मूल्यांकन →

Related terms