ऑनलाइन RL
सुदृढ़ीकरण सीखना जहां एजेंट सक्रिय रूप से पर्यावरण के साथ इंटरैक्ट करता है, नए संक्रमण एकत्र करता है और वास्तविक समय में अपनी नीति को अपडेट करता है। ऑनलाइन RL ऑफलाइन RL की तुलना में सुरक्षित अन्वेषण तंत्र के माध्यम से उच्च प्रदर्शन प्राप्त कर सकता है, लेकिन भौतिक रोबोट सेटिंग्स में सुरक्षित अन्वेषण तंत्र की आवश्यकता होती है। सिम-टू-रीयल स्थानांतरण अक्सर सिमुलेशन में ऑनलाइन RL चरण को सुरक्षित रूप से संचालित करने के लिए उपयोग किया जाता है।







