TD3
Twin Delayed DDPG — एक ऑफ-पॉलिसी RL एल्गोरिदम जो DDPG के अधिमूल्यांकन पूर्वाग्रह को संबोधित करता है: (1) दो Q-नेटवर्क का उपयोग करके न्यूनतम लेना, (2) Q-नेटवर्क अपडेट के सापेक्ष नीति अपडेट में देरी करना, और (3) सुचारु लक्ष्य नीति शोर जोड़ना। TD3 DDPG की तुलना में अधिक स्थिर है और निरंतर-नियंत्रण रोबोट सीखने के कार्यों के लिए एक मानक आधार है।







