Glossary पर वापस जाएं

SAC

Robot LearningRL

सॉफ्ट एक्टर-क्रिटिक — एक ऑफ-पॉलिसी RL एल्गोरिदम जो अपेक्षित रिटर्न और नीति एंट्रॉपी दोनों को अधिकतम करता है, अन्वेषण को प्रोत्साहित करते हुए स्थिरता बनाए रखता है। SAC सिमुलेशन में रोबोट मैनिपुलेशन के लिए लोकप्रिय है इसके नमूना दक्षता और हाइपरपैरामीटर के प्रति मजबूती के कारण। एंट्रॉपी नियमितकरण निर्धारक नीति में समय से पहले अभिसरण को रोकता है और पर्यावरण भिन्नताओं के प्रति मजबूती में सुधार करता है।

Related terms