הרצת מדיניות
הרצת מדיניות היא אפיזודה יחידה של הפעלת מדיניות מאומנת על הרובוט (או בסימולציה) מממצב התחלתי להשלמת משימה או timeout. הרצות משמשות להערכת ביצועי המדיניות, איסוף נתונים חדשים להדרכה נוספת (כמו ב-DAgger או RL fine-tuning), וניפוי באגים של מצבי כשל. מספר ההרצות הנדרש להערכת ביצועים אמינה תלוי בשונות המשימה — משימות בעלות שונות גבוהה עשויות להדרוש 50+ הרצות כדי לקבל הערכת שיעור הצלחה יציבה. במחקר, הרצות מסווגות לעתים קרובות לפי תנאי התחלתי (אובייקטים/סצנות בהתפלגות לעומת מחוץ להתפלגות) כדי לאפיין הכללה. ראה זאת בפועל: ההערכות שלנו בעולם האמיתי →







