חזרה לGlossary

פונקציית תגמול למדה

Robot LearningRL

פונקציית תגמול הנלמדת מנתונים (העדפות אנושיות, הדגמות או תיאורים בשפה) ולא מעוצבת ידנית. שיטות למידת תגמול כוללות RL הפוך, מודלינג תגמול מהשוואות אנושיות (בסגנון RLHF), וניקוד תגמול מבוסס VLM (תוך שימוש בדמיון CLIP או הערכת LLM). תגמולים למדים מטפלים באתגר שפונקציות תגמול ידניות מעוצבות היטב לעתים קרובות קשה לציין עבור משימות מניפולציה מורכבות.

Related terms