न्यूरल नीति
एक न्यूरल नीति एक रोबोट नियंत्रण नीति है जो एक न्यूरल नेटवर्क द्वारा पैरामीटर की जाती है जो अवलोकन (छवियां, प्रोप्रिओसेप्शन, भाषा) को सीधे कार्यों (संयुक्त स्थिति, कार्टेशियन डेल्टा, ग्रिपर कमांड) में मैप करती है। शास्त्रीय गति योजना पाइपलाइन के विपरीत, न्यूरल नीतियां हाथ से इंजीनियर किए गए मध्यवर्ती प्रतिनिधित्व के बिना डेटा से अंत-से-अंत मैपिंग सीखती हैं। आधुनिक न्यूरल नीतियां दृष्टि के लिए कनवोल्यूशनल एनकोडर, अनुक्रम मॉडलिंग के लिए Transformer, और कार्य जनरेशन के लिए ACT, Diffusion Policy, या VLA बैकबोन जैसी आर्किटेक्चर का उपयोग करती हैं। न्यूरल नीतियों की एक मुख्य संपत्ति यह है कि उन्हें प्रदर्शन या पुरस्कार संकेत से प्रशिक्षित किया जा सकता है, जिससे वे हाथ से कोडित नियंत्रकों के लिए बहुत जटिल कार्यों को संभालने में सक्षम होते हैं। व्यवहार में देखें: हमारे वास्तविक-विश्व मूल्यांकन →







