Retour à Glossary

PPO

Robot LearningRL

Proximal Policy Optimization — un algorithme d'apprentissage par renforcement basé sur le gradient de politique qui contraint les mises à jour de politique à une région de confiance en utilisant un objectif de substitution écrêté. PPO est l'algorithme d'apprentissage par renforcement par défaut pour la locomotion robotique (robots à pattes, humanoïdes) et le transfert sim-vers-réel en raison de sa stabilité, sa simplicité et son efficacité en termes d'échantillons. Il équilibre l'exploration et l'exploitation sans le coût de calcul de l'optimisation contrainte de TRPO.

Related terms