DDPG
डीप डिटर्मिनिस्टिक पॉलिसी ग्रेडिएंट — एक ऑफ-पॉलिसी RL एल्गोरिदम जो निरंतर क्रिया स्थानों के लिए है जो एक निर्धारक नीति और Q-फ़ंक्शन का उपयोग करता है, जिसे निर्धारक नीति ग्रेडिएंट प्रमेय के माध्यम से प्रशिक्षित किया जाता है। DDPG स्थिरता के लिए अनुभव रीप्ले और लक्ष्य नेटवर्क का उपयोग करता है। इसे रोबोट नियंत्रण कार्यों पर व्यापक रूप से लागू किया गया है लेकिन हाइपरपैरामीटर के प्रति संवेदनशील हो सकता है। TD3 (ट्विन डिलेड DDPG) इसके अधिमूल्यांकन पूर्वाग्रह को संबोधित करता है।







