ऑफलाइन RL
पहले से एकत्र किए गए संक्रमणों के एक निश्चित डेटासेट से सुदृढ़ीकरण सीखना, पर्यावरण के साथ किसी भी अतिरिक्त ऑनलाइन इंटरैक्शन के बिना। ऑफलाइन RL एल्गोरिदम (CQL, IQL, TD3+BC) डेटा एकत्र करने वाली नियंत्रण नीति और सीखी गई नीति के बीच वितरण बदलाव को संबोधित करते हैं। ऑफलाइन RL रोबोटिक्स के लिए आकर्षक है क्योंकि यह ऑनलाइन अन्वेषण की सुरक्षा चिंताओं और लागत से बचता है।







