חזרה לGlossary

פונקציית תגמול

Reinforcement LearningCore Concept

פונקציית התגמול מגדירה את מטרת הלמידה לסוכן reinforcement learning: היא מקצה אות תגמול סקלרי r(s, a, s') לכל מעבר (state, action, next-state), ומודיעה לסוכן כמה טובות או רעות הפעולות שלו. עיצוב פונקציית התגמול הוא אחד החלקים הקשים ביותר בהחלת RL על רובוטיקה: תגמולים דלים (1 בהצלחה, 0 אחרת) נקיים אך מובילים ללמידה איטית; תגמולים צפופים (למשל, מרחק שלילי למטרה) מנחים את הלמידה אך יכולים להיות מנוצלים בדרכים בלתי צפויות (reward hacking). חלופות כוללות reward learning מהדגמות (IRL, RLHF), מדדי סימולציה ספציפיים למשימה, ומודלי העדפות למדים. Imitation learning עוקף את בעיית עיצוב התגמול לחלוטין על ידי למידה ישירה מהדגמות. ראה זאת בפועל: ההערכות שלנו בעולם האמיתי →

Related terms