Glossary पर वापस जाएं

रीप्ले बफर

Reinforcement LearningData

एक रीप्ले बफर (या अनुभव रीप्ले मेमोरी) पिछले (स्थिति, क्रिया, पुरस्कार, अगली स्थिति, पूर्ण) संक्रमणों का एक डेटासेट है जो एक RL एजेंट द्वारा पर्यावरण इंटरैक्शन के दौरान एकत्र किया गया है। प्रत्येक प्रशिक्षण चरण पर, बफर से यादृच्छिक मिनी-बैच को मूल्य फलन या नीति को प्रशिक्षित करने के लिए नमूना किया जाता है, अस्थायी सहसंबंधों को तोड़ते हुए जो ग्रेडिएंट अपडेट को अस्थिर करेंगे। ऑफलाइन RL और रोबोट सीखने में, रीप्ले बफर को मानव प्रदर्शन या पहले से एकत्र किए गए रोलआउट के एक निश्चित डेटासेट द्वारा प्रतिस्थापित किया जाता है। प्राथमिकता प्राप्त अनुभव रीप्ले सूचनात्मक संक्रमणों पर प्रशिक्षण पर ध्यान केंद्रित करने के लिए अस्थायी-अंतर त्रुटि द्वारा नमूनाकरण को भारित करता है। व्यवहार में यह देखें: हमारे वास्तविक-विश्व मूल्यांकन →

Related terms