TRPO
Trust Region Policy Optimization — un algorithme d'apprentissage par renforcement basé sur le gradient de contrôle qui contraint chaque mise à jour de contrôle à une région de confiance (mesurée par la divergence KL) pour éviter les mises à jour importantes et destructrices. TRPO fournit des garanties d'amélioration monotone mais est coûteux en calcul en raison de l'optimisation contrainte. PPO approxime les avantages de TRPO avec un objectif de substitution écrêté plus simple.







