Glossary पर वापस जाएं

DDPG

RL

डीप डिटर्मिनिस्टिक पॉलिसी ग्रेडिएंट — एक ऑफ-पॉलिसी RL एल्गोरिदम जो निरंतर क्रिया स्थानों के लिए है जो एक निर्धारक नीति और Q-फ़ंक्शन का उपयोग करता है, जिसे निर्धारक नीति ग्रेडिएंट प्रमेय के माध्यम से प्रशिक्षित किया जाता है। DDPG स्थिरता के लिए अनुभव रीप्ले और लक्ष्य नेटवर्क का उपयोग करता है। इसे रोबोट नियंत्रण कार्यों पर व्यापक रूप से लागू किया गया है लेकिन हाइपरपैरामीटर के प्रति संवेदनशील हो सकता है। TD3 (ट्विन डिलेड DDPG) इसके अधिमूल्यांकन पूर्वाग्रह को संबोधित करता है।

Related terms