TRPO
Trust Region Policy Optimization – ein Policy-Gradient-RL-Algorithmus, der jede Richtlinienaktualisierung auf eine Vertrauensregion (gemessen durch KL-Divergenz) beschränkt, um große, destruktive Aktualisierungen zu verhindern. TRPO bietet monotone Verbesserungsgarantien, ist aber rechnerisch teuer aufgrund der eingeschränkten Optimierung. PPO approximiert TRPOs Vorteile mit einem einfacheren abgeschnittenen Surrogate-Ziel.







