व्यवहार क्लोनिंग (BC)
व्यवहार क्लोनिंग अनुकरण सीखने का सबसे सरल रूप है: एक पर्यवेक्षित प्रतिगमन समस्या जहां नीति प्रत्येक अवलोकित अवस्था में नीति के आउटपुट और विशेषज्ञ के कार्य के बीच भविष्यवाणी त्रुटि को कम करके विशेषज्ञ प्रदर्शन की नकल करने के लिए प्रशिक्षित होती है। BC को लागू करना आसान है और डेटा के साथ अच्छी तरह से स्केल करता है, लेकिन वितरणात्मक बदलाव से ग्रस्त है — क्योंकि इसे कभी सुधारात्मक प्रतिक्रिया नहीं मिलती है, छोटी त्रुटियां रोबोट को प्रशिक्षण डेटा में मौजूद नहीं अवस्थाओं में जाने का कारण बनती हैं, जो कार्य विफलता में बढ़ सकती है। DAgger (Dataset Aggregation) और GAIL जैसी तकनीकें विशेष रूप से BC की यौगिक-त्रुटि समस्या को संबोधित करने के लिए विकसित की गई थीं। इसे व्यवहार में देखें: हमारी डेटा संग्रह सेवा →







