TRPO
Trust Region Policy Optimization — خوارزمية تدرج سياسة التعلم المعزز التي تقيد كل تحديث سياسة إلى منطقة ثقة (تُقاس بتباعد KL) لمنع التحديثات الكبيرة والمدمرة. توفر TRPO ضمانات تحسن رتيب لكنها مكلفة حسابياً بسبب التحسين المقيد. تقرب PPO فوائد TRPO بهدف بديل مقطوع أبسط.







