PPO
Proximal Policy Optimization — un algorithme d'apprentissage par renforcement basé sur le gradient de politique qui contraint les mises à jour de politique à une région de confiance en utilisant un objectif de substitution écrêté. PPO est l'algorithme d'apprentissage par renforcement par défaut pour la locomotion robotique (robots à pattes, humanoïdes) et le transfert sim-vers-réel en raison de sa stabilité, sa simplicité et son efficacité en termes d'échantillons. Il équilibre l'exploration et l'exploitation sans le coût de calcul de l'optimisation contrainte de TRPO.







