संकर अनुकरण RL
एक प्रशिक्षण प्रतिमान जो अनुकरण सीखने (प्रदर्शन से) और सुदृढीकरण सीखने (पर्यावरण अंतःक्रिया से) को जोड़ता है ताकि प्रदर्शन की नमूना दक्षता का लाभ उठाया जा सके जबकि RL को विशेषज्ञ के प्रदर्शन से परे सुधार करने की अनुमति दी जा सके। विधियों में DAPG (नीति ग्रेडिएंट के लिए प्रदर्शन के रूप में पूर्व), IRL+RL, और Demo-Augmented PPO शामिल हैं।







