पुरस्कार आकार देना
इष्टतम नीति को बदले बिना सघन, अधिक सूचनात्मक सीखने के संकेत प्रदान करने के लिए पुरस्कार फलन को संशोधित करना। उदाहरण के लिए, एक संभावित-आधारित आकार देने वाला पुरस्कार जोड़ना जो लक्ष्य के करीब आने के लिए आंशिक क्रेडिट देता है। पुरस्कार आकार देना विरल-पुरस्कार वातावरण में RL प्रशिक्षण को नाटकीय रूप से तेज करता है लेकिन अनपेक्षित स्थानीय इष्टतम पेश करने से बचने के लिए सावधानी की आवश्यकता है।







