PPO
Proximal Policy Optimization — एक नीति ग्रेडिएंट RL एल्गोरिदम जो एक क्लिप किए गए सरोगेट उद्देश्य का उपयोग करके नीति अपडेट को एक विश्वास क्षेत्र तक सीमित करता है। PPO पैर वाले रोबोट, मानवरूप और सिम-टू-रीयल स्थानांतरण के लिए डिफ़ॉल्ट RL एल्गोरिदम है क्योंकि इसकी स्थिरता, सरलता, और नमूना दक्षता। यह TRPO की बाधित अनुकूलन की कम्प्यूटेशनल लागत के बिना अन्वेषण और शोषण को संतुलित करता है।







