Glossary पर वापस जाएं

स्टोकेस्टिक नीति

Robot LearningRLPolicy

एक नीति जो क्रियाओं पर संभाव्यता वितरण आउटपुट करती है (एकल नियतात्मक क्रिया के बजाय), जिससे अन्वेषण और अनिश्चितता को संभालना संभव होता है। गॉसियन नीतियां (माध्य + विकर्ण सहप्रसरण) नीति ग्रेडिएंट RL में मानक हैं। Diffusion Policy और सामान्यीकृत प्रवाह नीतियां अधिक जटिल क्रिया वितरण तक विस्तारित होती हैं। स्टोकेस्टिक नीतियां अधिकतम एंट्रॉपी RL (SAC) के लिए आवश्यक हैं।

Related terms