返回Glossary

行为正则化

Robot LearningRL

一类离线强化学习方法,通过约束学习策略与收集数据的行为策略保持接近,防止对分布外动作的利用。方法包括:策略约束(TD3+BC)、KL散度惩罚和支撑约束(BEAR)。行为正则化是实现稳定离线强化学习的关键机制。

Related terms