Voltar para Glossary

DDPG

RL

Deep Deterministic Policy Gradient — um algoritmo de RL off-policy para espaços de ação contínuos que usa uma política determinística e uma função Q, treinadas via o teorema do gradiente de política determinística. DDPG usa replay de experiência e redes alvo para estabilidade. Tem sido amplamente aplicado a tarefas de controle de robô, mas pode ser sensível a hiperparâmetros. TD3 (Twin Delayed DDPG) aborda seu viés de superestimação.

Related terms