पुरस्कार इंजीनियरिंग
एक अदिश पुरस्कार फलन डिजाइन करने की प्रक्रिया जो RL प्रशिक्षण के लिए वांछित रोबोट व्यवहार को एन्कोड करता है। अच्छी पुरस्कार इंजीनियरिंग सघन प्रतिक्रिया प्रदान करती है जो सीखने को निर्देशित करती है बिना अनपेक्षित शॉर्टकट पेश किए। सामान्य समस्याएं: पुरस्कार हैकिंग (पुरस्कार प्रॉक्सी को अनुकूलित करना बजाय इच्छित व्यवहार के) और विरल पुरस्कार (सीखने का संकेत बहुत कम बार)।







