返回Glossary

CQL

RL

保守Q学习——一种离线强化学习算法,通过对分布外动作的Q值添加惩罚来学习保守的(悲观的)Q函数。这防止了导致离线强化学习控制策略利用数据不支持的虚假高价值区域的高估问题。CQL是机器人操纵中最广泛使用的离线强化学习方法之一。

Related terms