Glossary पर वापस जाएं

व्यवहार नियमितकरण

Robot LearningRL

ऑफलाइन RL विधियों का एक परिवार जो सीखी गई नीति को डेटा एकत्र करने वाली व्यवहार नीति के करीब रहने के लिए बाध्य करता है, वितरण-बाहर कार्यों के शोषण को रोकता है। विधियों में शामिल हैं: नीति बाधा (TD3+BC), KL विचलन दंड, और समर्थन बाधा (BEAR)। व्यवहार नियमितकरण स्थिर ऑफलाइन RL सक्षम करने की मुख्य तंत्र है।

Related terms