मार्कोव निर्णय प्रक्रिया
अनिश्चितता के तहत अनुक्रमिक निर्णय लेने के लिए एक गणितीय ढांचा: राज्यों, कार्यों, संक्रमण संभावनाओं, पुरस्कार फलन और छूट कारक का एक टपल (S, A, P, R, γ)। RL एल्गोरिदम नीतियां सीखते हैं जो MDP में अपेक्षित छूट प्राप्ति को अधिकतम करती हैं। रोबोट हेरफेर और गतिविधि को MDPs के रूप में मॉडल किया जाता है, जहां नीति राज्यों को कार्यों से मैप करती है।







