Glossary पर वापस जाएं

सुरक्षा बाधा RL

Robot LearningRLSafety

विवश सुदृढ़ीकरण सीखना जो सुरक्षा बाधाओं को संतुष्ट करते हुए रिटर्न को अनुकूलित करता है (जैसे, टकराव संभावना < 0.01, संयुक्त टॉर्क सीमा)। विवश नीति अनुकूलन (CPO), लैग्रेंजियन विधियां, और नियंत्रण बाधा कार्य सामान्य दृष्टिकोण हैं। सुरक्षा RL वास्तविक दुनिया के रोबोट तैनाती के लिए महत्वपूर्ण है जहां बाधा उल्लंघन हार्डवेयर को नुकसान पहुंचा सकता है या लोगों को नुकसान पहुंचा सकता है।

Related terms