सशर्त अनुकरण सीखना
व्यवहार क्लोनिंग का विस्तार जहाँ नीति अवलोकनों के अतिरिक्त उच्च-स्तरीय आदेशों या लक्ष्यों पर निर्भर होती है। उदाहरण के लिए, एक नेविगेशन नीति वर्तमान कैमरा फ्रेम के साथ-साथ एक लक्ष्य छवि या भाषा निर्देश को इनपुट के रूप में ले सकती है। यह एक एकल नीति को कंडीशनिंग सिग्नल के आधार पर कई व्यवहार निष्पादित करने में सक्षम बनाता है।







