मूल्य फलन
एक फलन जो किसी दिए गए स्थिति (स्थिति-मूल्य फलन V) या स्थिति-कार्य जोड़ी (कार्य-मूल्य फलन Q) से अपेक्षित संचयी पुरस्कार का अनुमान लगाता है। मूल्य फलन सुदृढ़ सीखने के लिए केंद्रीय हैं — वे कार्य चयन और नीति सुधार का मार्गदर्शन करते हैं। गहन सुदृढ़ सीखन मूल्य फलन को अनुमानित करने के लिए तंत्रिका नेटवर्क का उपयोग करता है। रोबोटिक्स में, सीखे गए मूल्य फलन योजना के लिए लागत-से-जाना अनुमान के रूप में और सुरक्षा आलोचक के रूप में काम कर सकते हैं।







