לימוד העדפות
לימוד מהשוואות אנושיות (למשל, 'מסלול A טוב יותר ממסלול B') במקום אותות תגמול מפורשים או הדגמות. מודל תגמול מאומן להיות עקבי עם העדפות אנושיות, ואז משמש לאופטימיזציה של מדיניות הבקרה דרך RL. גישה זו (RLHF המיושמת לרובוטיקה) מונעת את הצורך בהנדסת תגמול סקלרית מדויקת ויכולה ללכוד כוונה אנושית עדינה.







