חזרה לGlossary

דילמת חקר-ניצול

Robot LearningRL

הדילמה הבסיסית בלמידת חיזוק: הסוכן חייב לאזן בין ניצול פעולות ידועות בעלות תגמול גבוה לבין חקר פעולות לא ידועות שעלולות להניב תגמולים גבוהים יותר. ניצול טהור מוביל לאופטימום מקומי; חקר טהור אינו יעיל. שיטות כמו ε-greedy, UCB, Thompson sampling וחקר מונע-סקרנות מנהלות את הדילמה הזו. ברובוטיקה, אילוצי חקר בטוח הופכים את הדילמה לקשה יותר.

Related terms