TD3
Twin Delayed DDPG — 一种离策略强化学习算法,通过以下方式解决DDPG的高估偏差:(1)使用两个Q网络并取最小值,(2)延迟策略更新相对于Q网络更新,(3)添加平滑的目标策略噪声。TD3比DDPG更稳定,是连续控制机器人学习任务的标准基准。
Twin Delayed DDPG — 一种离策略强化学习算法,通过以下方式解决DDPG的高估偏差:(1)使用两个Q网络并取最小值,(2)延迟策略更新相对于Q网络更新,(3)添加平滑的目标策略噪声。TD3比DDPG更稳定,是连续控制机器人学习任务的标准基准。