सुरक्षा बाधा RL
विवश सुदृढ़ीकरण सीखना जो सुरक्षा बाधाओं को संतुष्ट करते हुए रिटर्न को अनुकूलित करता है (जैसे, टकराव संभावना < 0.01, संयुक्त टॉर्क सीमा)। विवश नीति अनुकूलन (CPO), लैग्रेंजियन विधियां, और नियंत्रण बाधा कार्य सामान्य दृष्टिकोण हैं। सुरक्षा RL वास्तविक दुनिया के रोबोट तैनाती के लिए महत्वपूर्ण है जहां बाधा उल्लंघन हार्डवेयर को नुकसान पहुंचा सकता है या लोगों को नुकसान पहुंचा सकता है।







