स्व-खेल
एक प्रशिक्षण प्रतिमान जहाँ एजेंट अपनी प्रतियों के साथ प्रतिस्पर्धा या सहयोग करके सुधार करते हैं, अपनी स्वयं की अंतःक्रियाओं के माध्यम से प्रशिक्षण डेटा उत्पन्न करते हैं। रोबोटिक्स में, स्व-खेल बहु-एजेंट कार्यों (प्रतिस्पर्धी वस्तु हेरफेर, विरोधी दृढ़ता) के लिए और विविध व्यवहारिक रणनीतियों को उत्पन्न करने के लिए उपयोग किया जाता है। एजेंट मजबूत नीतियाँ सीखता है क्योंकि इसके प्रशिक्षण प्रतिद्वंद्वी लगातार सुधार करते हैं।







