Glossary पर वापस जाएं

नीति रोलआउट

EvaluationPolicy

एक नीति रोलआउट रोबोट पर (या सिमुलेशन में) एक प्रशिक्षित नीति को प्रारंभिक स्थिति से कार्य पूर्ण या समय समाप्त तक निष्पादित करने का एक एकल एपिसोड है। रोलआउट का उपयोग नीति प्रदर्शन का मूल्यांकन करने के लिए, आगे के प्रशिक्षण के लिए नए डेटा एकत्र करने के लिए (DAgger या RL सूक्ष्म-ट्यूनिंग में), और विफलता मोड को डीबग करने के लिए किया जाता है। विश्वसनीय प्रदर्शन अनुमान के लिए आवश्यक रोलआउट की संख्या कार्य परिवर्तनशीलता पर निर्भर करती है — उच्च-विचरण कार्यों को स्थिर सफलता दर अनुमान प्राप्त करने के लिए 50+ रोलआउट की आवश्यकता हो सकती है। अनुसंधान में, रोलआउट को अक्सर प्रारंभिक स्थिति (वितरण में बनाम वितरण से बाहर की वस्तुएं/दृश्य) द्वारा वर्गीकृत किया जाता है सामान्यीकरण को चिह्नित करने के लिए। व्यवहार में देखें: हमारे वास्तविक दुनिया के मूल्यांकन →

Related terms