PPO
تحسين السياسة القريبة — خوارزمية تدرج السياسة في التعلم المعزز التي تقيد تحديثات السياسة إلى منطقة ثقة باستخدام هدف بديل مقطوع. PPO هي خوارزمية التعلم المعزز الافتراضية لحركة الروبوت (الروبوتات ذات الأرجل والإنسانيات) ونقل المحاكاة إلى الواقع بسبب استقرارها وبساطتها وكفاءة العينة. وهي توازن بين الاستكشاف والاستغلال دون التكلفة الحسابية لتحسين TRPO المقيد.







