Inverse RL
למידת פונקציית תגמול מהדגמות של מומחים, בהנחה שהמומחה ממקסם (בקירוב) את התגמול באופן אופטימלי. IRL מונע את הצורך בהנדסה ידנית של פונקציות תגמול — במקום זאת, התגמול מסוקק ואז משמש לאימון מדיניות דרך RL סטנדרטי. Maximum entropy IRL ו-AIRL (Adversarial IRL) הן ניסוחים פופולריים. IRL קשור קשר הדוק ל-GAIL.







