לימוד רב-משימתי
לימוד רב-משימתי מאמן מדיניות יחידה על הדגמות מ-משימות מובחנות מרובות בו-זמנית, בציפייה שייצוגים משותפים הנלמדים על פני משימות משפרים ביצועים בכל משימה בודדת ומאפשרים הכללה למשימות חדשות. ברובוטיקה, זה לעתים קרובות אומר הדרכה על מאות משימות עם עצמים, יעדים וסביבות מגוונים. האתגר העיקרי הוא איזון תרומות הגרדיאנט של משימות שונות (הפרעת גרדיאנט) והבטחת שהמדיניות יכולה להבחין בין משימות בזמן הסקה — בדרך כלל דרך conditioning לשוני או מזהי משימה one-hot. מדיניות רב-משימתית היא תנאי הכרחי לעוזרים רובוטיים למטרות כלליות. ראה זאת בפועל: ההערכות שלנו בעולם האמיתי →







