Glossary पर वापस जाएं

CQL

RL

कंजरवेटिव क्यू-लर्निंग — एक ऑफलाइन RL एल्गोरिदम जो आउट-ऑफ-डिस्ट्रिब्यूशन एक्शन्स पर Q-वैल्यूज के लिए पेनल्टी जोड़कर एक कंजरवेटिव (निराशावादी) Q-फंक्शन सीखता है। यह ओवरएस्टिमेशन समस्या को रोकता है जो ऑफलाइन RL नीतियों को डेटा द्वारा समर्थित नहीं उच्च-मूल्य क्षेत्रों का दुरुपयोग करने के लिए प्रेरित करती है। CQL रोबोट मैनिपुलेशन के लिए सबसे व्यापक रूप से उपयोग की जाने वाली ऑफलाइन RL विधियों में से एक है।

Related terms