CQL
कंजरवेटिव क्यू-लर्निंग — एक ऑफलाइन RL एल्गोरिदम जो आउट-ऑफ-डिस्ट्रिब्यूशन एक्शन्स पर Q-वैल्यूज के लिए पेनल्टी जोड़कर एक कंजरवेटिव (निराशावादी) Q-फंक्शन सीखता है। यह ओवरएस्टिमेशन समस्या को रोकता है जो ऑफलाइन RL नीतियों को डेटा द्वारा समर्थित नहीं उच्च-मूल्य क्षेत्रों का दुरुपयोग करने के लिए प्रेरित करती है। CQL रोबोट मैनिपुलेशन के लिए सबसे व्यापक रूप से उपयोग की जाने वाली ऑफलाइन RL विधियों में से एक है।







