DDPG
Deep Deterministic Policy Gradient — un algoritmo de RL fuera de política para espacios de acciones continuas que utiliza una política determinista y una función Q, entrenadas mediante el teorema del gradiente de política determinista. DDPG utiliza reproducción de experiencia y redes objetivo para estabilidad. Ha sido ampliamente aplicado a tareas de control de robots pero puede ser sensible a hiperparámetros. TD3 (Twin Delayed DDPG) aborda su sesgo de sobreestimación.







