Glossary पर वापस जाएं

नीति प्रवणता

Robot LearningRL

RL एल्गोरिदम का एक परिवार जो नीति मापदंडों के संबंध में अपेक्षित रिटर्न की प्रवणता का अनुमान लगाकर नीति मापदंडों को सीधे अनुकूलित करता है। REINFORCE, PPO, TRPO और SAC सभी इस परिवार से संबंधित हैं। नीति प्रवणता विधियां निरंतर कार्रवाई स्थान के साथ काम करती हैं (DQN जैसी मूल्य-आधारित विधियों के विपरीत) और रोबोट नियंत्रण कार्यों के लिए मानक RL दृष्टिकोण हैं।

Related terms