TD3
Twin Delayed DDPG — un algoritmo de RL fuera de política que aborda el sesgo de sobreestimación de DDPG mediante: (1) usar dos redes Q y tomar el mínimo, (2) retrasar actualizaciones de política relativas a actualizaciones de red Q, y (3) agregar ruido de política objetivo suavizado. TD3 es más estable que DDPG y es una línea base estándar para tareas de aprendizaje de control continuo en robots.







