PPO
Proximal Policy Optimization — אלגוריתם RL של שיפוע מדיניות המגביל עדכוני מדיניות לאזור אמון באמצעות יעד תחליף מחוזק. PPO הוא אלגוריתם RL ברירת המחדל לתנועת רובוט (רובוטים רגליים, הומנואידים) והעברת sim-to-real בגלל היציבות, הפשטות ויעילות הדגימה שלו. הוא מאזן בין חקר וניצול ללא עלות חישובית של אופטימיזציה מוגבלת של TRPO.







