返回Glossary

策略梯度

Robot LearningRL

一类强化学习算法,通过估计期望回报相对于策略参数的梯度来直接优化策略参数。REINFORCE、PPO、TRPO 和 SAC 都属于这一类。策略梯度方法适用于连续动作空间(不同于基于价值的方法如 DQN),是机器人控制任务的标准强化学习方法。

Related terms