Gradient de politique
Une famille d'algorithmes RL qui optimisent directement les paramètres de la politique en estimant le gradient du rendement attendu par rapport aux paramètres de la politique. REINFORCE, PPO, TRPO et SAC appartiennent tous à cette famille. Les méthodes de gradient de politique fonctionnent avec des espaces d'actions continus (contrairement aux méthodes basées sur la valeur comme DQN) et sont l'approche RL standard pour les tâches de contrôle de robot.







