नीति रोलआउट
एक नीति रोलआउट रोबोट पर (या सिमुलेशन में) एक प्रशिक्षित नीति को प्रारंभिक स्थिति से कार्य पूर्ण या समय समाप्त तक निष्पादित करने का एक एकल एपिसोड है। रोलआउट का उपयोग नीति प्रदर्शन का मूल्यांकन करने के लिए, आगे के प्रशिक्षण के लिए नए डेटा एकत्र करने के लिए (DAgger या RL सूक्ष्म-ट्यूनिंग में), और विफलता मोड को डीबग करने के लिए किया जाता है। विश्वसनीय प्रदर्शन अनुमान के लिए आवश्यक रोलआउट की संख्या कार्य परिवर्तनशीलता पर निर्भर करती है — उच्च-विचरण कार्यों को स्थिर सफलता दर अनुमान प्राप्त करने के लिए 50+ रोलआउट की आवश्यकता हो सकती है। अनुसंधान में, रोलआउट को अक्सर प्रारंभिक स्थिति (वितरण में बनाम वितरण से बाहर की वस्तुएं/दृश्य) द्वारा वर्गीकृत किया जाता है सामान्यीकरण को चिह्नित करने के लिए। व्यवहार में देखें: हमारे वास्तविक दुनिया के मूल्यांकन →







