कार्रवाई स्पेस
कार्रवाई स्पेस प्रत्येक समय चरण पर एक रोबोट नीति द्वारा उत्पादित आउटपुट का पूर्ण सेट है। एक रोबोट भुजा के लिए इसमें आमतौर पर संयुक्त स्थिति, संयुक्त वेग या अंत-प्रभावक poses (कार्टेशियन स्थिति + quaternion) शामिल हैं; एक मोबाइल रोबोट के लिए इसमें पहिया वेग या स्टीयरिंग कमांड शामिल हैं। कार्रवाई स्पेस को असतत (कार्रवाई का एक सीमित मेनू) या निरंतर (वास्तविक-मूल्य वाले वेक्टर) के रूप में वर्णित किया जाता है। कार्रवाई स्पेस की आयामीता और प्रतिनिधित्व दृढ़ता से प्रभावित करता है कि एक स्थिर नीति को प्रशिक्षित करना कितना आसान है: अंत-प्रभावक delta-pose स्पेस अक्सर अनुकरण सीखने के लिए आसान होते हैं, जबकि संयुक्त-टॉर्क स्पेस बेहतर बल नियंत्रण देते हैं लेकिन अधिक सावधान सामान्यीकरण की आवश्यकता होती है। इसे व्यवहार में देखें: हमारे वास्तविक-विश्व मूल्यांकन →







