व्यवहार नियमितकरण
ऑफलाइन RL विधियों का एक परिवार जो सीखी गई नीति को डेटा एकत्र करने वाली व्यवहार नीति के करीब रहने के लिए बाध्य करता है, वितरण-बाहर कार्यों के शोषण को रोकता है। विधियों में शामिल हैं: नीति बाधा (TD3+BC), KL विचलन दंड, और समर्थन बाधा (BEAR)। व्यवहार नियमितकरण स्थिर ऑफलाइन RL सक्षम करने की मुख्य तंत्र है।







