מדיניות (רובוט)
בלימוד רובוט, מדיניות (מסומנת π) היא פונקציה הממפה תצפיות לפעולות: π(o) → a. המדיניות היא ה"מוח" הלמוד של הרובוט שקובע מה לעשות בכל timestep בהתאם למה שהוא תופס. מדיניות יכולה להיות מיוצגת כרשתות עצביות (מדיניות עצביות), עצי החלטה, תהליכים גאוסיים, או טבלאות חיפוש. הן יכולות להיות דטרמיניסטיות (פעולה אחת לכל תצפית) או סטוכסטיות (התפלגות על פעולות). איכות המדיניות נמדדת לפי שיעור הצלחת משימה בתנאים מגוונים, לא רק בהדגמות הדרכה. האתגר הליבה של לימוד רובוט הוא הדרכת מדיניות שמכללות בצורה אמינה מעבר להתפלגות ההדרכה שלהן. ראה זאת בפועל: ההערכות שלנו בעולם האמיתי →







