TD3
Twin Delayed DDPG — um algoritmo de RL off-policy que aborda o viés de superestimação do DDPG por: (1) usar duas redes Q e tomar o mínimo, (2) atrasar atualizações de política em relação a atualizações de rede Q, e (3) adicionar ruído de política alvo suavizado. TD3 é mais estável que DDPG e é uma linha de base padrão para tarefas de aprendizado de controle contínuo em robôs.







