返回Glossary

SAC

Robot LearningRL

软演员-评论家算法——一种离策略强化学习算法,同时最大化期望回报和策略熵,鼓励探索同时保持稳定性。SAC因其样本效率高和对超参数的鲁棒性而在模拟环境中的机器人操纵任务中很受欢迎。熵正则化防止过早收敛到确定性控制策略,并提高对环境变化的鲁棒性。

Related terms