هندسة المكافأة
عملية تصميم دالة مكافأة عددية تشفر السلوك المرغوب للروبوت لتدريب التعلم المعزز. تقدم هندسة المكافأة الجيدة تغذية راجعة كثيفة توجه التعلم دون إدخال اختصارات غير مقصودة. المشاكل الشائعة: اختراق المكافأة (تحسين بديل المكافأة بدلاً من السلوك المقصود) والمكافآت النادرة (إشارة التعلم نادرة جداً).







