Hybrid Imitation RL
פרדיגמת הדרכה המשלבת imitation learning (מהדגמות) ו-reinforcement learning (מאינטראקציה עם הסביבה) כדי לנצל את יעילות הדגימה של הדגמות תוך אפשרות ל-RL להשתפר מעבר לביצוע המומחה. שיטות כוללות DAPG (demonstrations כprior עבור policy gradient), IRL+RL, ו-Demo-Augmented PPO.







