Glossary पर वापस जाएं

PPO

Robot LearningRL

Proximal Policy Optimization — एक नीति ग्रेडिएंट RL एल्गोरिदम जो एक क्लिप किए गए सरोगेट उद्देश्य का उपयोग करके नीति अपडेट को एक विश्वास क्षेत्र तक सीमित करता है। PPO पैर वाले रोबोट, मानवरूप और सिम-टू-रीयल स्थानांतरण के लिए डिफ़ॉल्ट RL एल्गोरिदम है क्योंकि इसकी स्थिरता, सरलता, और नमूना दक्षता। यह TRPO की बाधित अनुकूलन की कम्प्यूटेशनल लागत के बिना अन्वेषण और शोषण को संतुलित करता है।

Related terms