SAC
सॉफ्ट एक्टर-क्रिटिक — एक ऑफ-पॉलिसी RL एल्गोरिदम जो अपेक्षित रिटर्न और नीति एंट्रॉपी दोनों को अधिकतम करता है, अन्वेषण को प्रोत्साहित करते हुए स्थिरता बनाए रखता है। SAC सिमुलेशन में रोबोट मैनिपुलेशन के लिए लोकप्रिय है इसके नमूना दक्षता और हाइपरपैरामीटर के प्रति मजबूती के कारण। एंट्रॉपी नियमितकरण निर्धारक नीति में समय से पहले अभिसरण को रोकता है और पर्यावरण भिन्नताओं के प्रति मजबूती में सुधार करता है।







