הנדסת תגמול
תהליך עיצוב פונקציית תגמול סקלרית המקודדת את ההתנהגות הרצויה של הרובוט לאימון RL. הנדסת תגמול טובה מספקת משוב צפוף המנחה את הלמידה ללא הצגת קיצורי דרך בלתי מכוונים. מלכודות נפוצות: reward hacking (אופטימיזציה של פרוקסי התגמול במקום ההתנהגות המיועדת) ותגמולים דלים (אות למידה נדיר מדי).







