नीति प्रवणता
RL एल्गोरिदम का एक परिवार जो नीति मापदंडों के संबंध में अपेक्षित रिटर्न की प्रवणता का अनुमान लगाकर नीति मापदंडों को सीधे अनुकूलित करता है। REINFORCE, PPO, TRPO और SAC सभी इस परिवार से संबंधित हैं। नीति प्रवणता विधियां निरंतर कार्रवाई स्थान के साथ काम करती हैं (DQN जैसी मूल्य-आधारित विधियों के विपरीत) और रोबोट नियंत्रण कार्यों के लिए मानक RL दृष्टिकोण हैं।







