Retour à Glossary

TD3

RL

Twin Delayed DDPG — un algorithme RL hors-politique qui résout le biais de surestimation de DDPG en : (1) utilisant deux réseaux Q et prenant le minimum, (2) retardant les mises à jour de politique par rapport aux mises à jour du réseau Q, et (3) ajoutant du bruit de politique cible lissé. TD3 est plus stable que DDPG et constitue une référence standard pour les tâches d'apprentissage de contrôle continu de robots.

Related terms