DDPG
Deep Deterministic Policy Gradient — un algorithme RL hors-politique pour les espaces d'action continus qui utilise une politique déterministe et une fonction Q, entraînées via le théorème du gradient de politique déterministe. DDPG utilise la relecture d'expérience et les réseaux cibles pour la stabilité. Il a été largement appliqué aux tâches de contrôle robotique mais peut être sensible aux hyperparamètres. TD3 (Twin Delayed DDPG) résout son biais de surestimation.







