DDPG
深度确定性策略梯度——一种用于连续动作空间的离策略强化学习算法,使用确定性策略和Q函数,通过确定性策略梯度定理训练。DDPG使用经验回放和目标网络以保证稳定性。它已广泛应用于机器人控制任务,但对超参数可能敏感。TD3(Twin Delayed DDPG)解决了其高估偏差问题。
深度确定性策略梯度——一种用于连续动作空间的离策略强化学习算法,使用确定性策略和Q函数,通过确定性策略梯度定理训练。DDPG使用经验回放和目标网络以保证稳定性。它已广泛应用于机器人控制任务,但对超参数可能敏感。TD3(Twin Delayed DDPG)解决了其高估偏差问题。