随机策略
输出动作概率分布(而非单一确定性动作)的策略,能够实现探索并处理随机不确定性。高斯策略(均值+对角协方差)是策略梯度强化学习的标准方法。Diffusion Policy 和归一化流策略扩展到更复杂的动作分布。随机策略对于最大熵强化学习(SAC)是必需的。
输出动作概率分布(而非单一确定性动作)的策略,能够实现探索并处理随机不确定性。高斯策略(均值+对角协方差)是策略梯度强化学习的标准方法。Diffusion Policy 和归一化流策略扩展到更复杂的动作分布。随机策略对于最大熵强化学习(SAC)是必需的。