دالة المكافأة
تحدد دالة المكافأة الهدف التعليمي لوكيل التعلم المعزز: تعين إشارة مكافأة عددية r(s, a, s') لكل انتقال (حالة، إجراء، حالة تالية)، مما يخبر الوكيل بمدى جودة أو سوء إجراءاته. تصميم دالة المكافأة هو أحد أصعب أجزاء تطبيق التعلم المعزز على الروبوتات: المكافآت النادرة (1 عند النجاح، 0 وإلا) نظيفة لكنها تؤدي إلى تعلم بطيء؛ المكافآت الكثيفة (مثل المسافة السالبة إلى الهدف) توجه التعلم لكن يمكن التلاعب بها بطرق غير متوقعة (اختراق المكافأة). تشمل البدائل تعلم المكافأة من العروض التوضيحية (IRL، RLHF)، مقاييس المحاكاة الخاصة بالمهام، والنماذج المفضلة المتعلمة. يتجنب التعلم بالمحاكاة مشكلة تصميم المكافأة تماماً بالتعلم مباشرة من العروض التوضيحية. انظر هذا عملياً: تقييماتنا في العالم الحقيقي →







