Glossaryに戻る

CQL(Conservative Q-Learning)

RL

Conservative Q-Learning — オフラインRL アルゴリズムで、分布外アクションのQ値にペナルティを追加することで、保守的(悲観的)なQ関数を学習します。これにより、データに支持されていない疑似的な高値領域を悪用するオフラインRL制御ポリシーの過大評価問題を防ぎます。CQLはロボット操作用のオフラインRL手法の中で最も広く使用されている方法の1つです。

Related terms