Glossary पर वापस जाएं

मार्कोव निर्णय प्रक्रिया

MathRL

अनिश्चितता के तहत अनुक्रमिक निर्णय लेने के लिए एक गणितीय ढांचा: राज्यों, कार्यों, संक्रमण संभावनाओं, पुरस्कार फलन और छूट कारक का एक टपल (S, A, P, R, γ)। RL एल्गोरिदम नीतियां सीखते हैं जो MDP में अपेक्षित छूट प्राप्ति को अधिकतम करती हैं। रोबोट हेरफेर और गतिविधि को MDPs के रूप में मॉडल किया जाता है, जहां नीति राज्यों को कार्यों से मैप करती है।

Related terms