Glossary पर वापस जाएं

मूल्य फलन

Robot LearningRL

एक फलन जो किसी दिए गए स्थिति (स्थिति-मूल्य फलन V) या स्थिति-कार्य जोड़ी (कार्य-मूल्य फलन Q) से अपेक्षित संचयी पुरस्कार का अनुमान लगाता है। मूल्य फलन सुदृढ़ सीखने के लिए केंद्रीय हैं — वे कार्य चयन और नीति सुधार का मार्गदर्शन करते हैं। गहन सुदृढ़ सीखन मूल्य फलन को अनुमानित करने के लिए तंत्रिका नेटवर्क का उपयोग करता है। रोबोटिक्स में, सीखे गए मूल्य फलन योजना के लिए लागत-से-जाना अनुमान के रूप में और सुरक्षा आलोचक के रूप में काम कर सकते हैं।

Related terms