العودة إلى Glossary

هندسة المكافأة

Robot LearningRL

عملية تصميم دالة مكافأة عددية تشفر السلوك المرغوب للروبوت لتدريب التعلم المعزز. تقدم هندسة المكافأة الجيدة تغذية راجعة كثيفة توجه التعلم دون إدخال اختصارات غير مقصودة. المشاكل الشائعة: اختراق المكافأة (تحسين بديل المكافأة بدلاً من السلوك المقصود) والمكافآت النادرة (إشارة التعلم نادرة جداً).

Related terms