Glossary पर वापस जाएं

नीति (रोबोट)

Core ConceptDeep Learning

रोबोट सीखने में, एक नीति (π द्वारा निरूपित) एक फ़ंक्शन है जो अवलोकन को कार्यों में मैप करता है: π(o) → a। नीति रोबोट का सीखा हुआ "मस्तिष्क" है जो यह निर्धारित करता है कि प्रत्येक समय चरण पर क्या करना है जो यह देखता है। नीतियों को तंत्रिका नेटवर्क (तंत्रिका नीतियों), निर्णय वृक्ष, गाऊसी प्रक्रियाओं या लुकअप तालिकाओं के रूप में प्रतिनिधित्व किया जा सकता है। वे नियतात्मक (प्रति अवलोकन एक कार्रवाई) या स्टोकेस्टिक (कार्यों पर एक वितरण) हो सकते हैं। नीति गुणवत्ता को विविध स्थितियों में कार्य सफलता दर द्वारा मापा जाता है, केवल प्रशिक्षण प्रदर्शन पर नहीं। रोबोट सीखने की मूल चुनौती प्रशिक्षण वितरण से परे विश्वसनीय रूप से सामान्यीकृत नीतियों को प्रशिक्षित करना है। व्यवहार में देखें: हमारे वास्तविक दुनिया के मूल्यांकन →

Related terms