रीप्ले बफर
एक रीप्ले बफर (या अनुभव रीप्ले मेमोरी) पिछले (स्थिति, क्रिया, पुरस्कार, अगली स्थिति, पूर्ण) संक्रमणों का एक डेटासेट है जो एक RL एजेंट द्वारा पर्यावरण इंटरैक्शन के दौरान एकत्र किया गया है। प्रत्येक प्रशिक्षण चरण पर, बफर से यादृच्छिक मिनी-बैच को मूल्य फलन या नीति को प्रशिक्षित करने के लिए नमूना किया जाता है, अस्थायी सहसंबंधों को तोड़ते हुए जो ग्रेडिएंट अपडेट को अस्थिर करेंगे। ऑफलाइन RL और रोबोट सीखने में, रीप्ले बफर को मानव प्रदर्शन या पहले से एकत्र किए गए रोलआउट के एक निश्चित डेटासेट द्वारा प्रतिस्थापित किया जाता है। प्राथमिकता प्राप्त अनुभव रीप्ले सूचनात्मक संक्रमणों पर प्रशिक्षण पर ध्यान केंद्रित करने के लिए अस्थायी-अंतर त्रुटि द्वारा नमूनाकरण को भारित करता है। व्यवहार में यह देखें: हमारे वास्तविक-विश्व मूल्यांकन →







