पूर्वदृष्टि अनुभव पुनरावृत्ति
लक्ष्य-सशर्त RL के लिए एक डेटा संवर्धन तकनीक जो विफल प्रक्षेपवक्र को वास्तव में प्राप्त अवस्थाओं के साथ लक्ष्य के रूप में पुनः लेबल करती है। यदि रोबोट किसी ब्लॉक को स्थिति A पर रखने का प्रयास करता है लेकिन स्थिति B तक पहुंचता है, तो HER एक अतिरिक्त प्रशिक्षण उदाहरण बनाता है जहां B लक्ष्य है और प्रक्षेपवक्र सफल है। यह विरल-पुरस्कार लक्ष्य-पहुंचने वाले कार्यों के लिए नमूना दक्षता में नाटकीय रूप से सुधार करता है।







