CQL
Conservative Q-Learning — 분포 외 행동에 대한 Q-값에 페널티를 추가하여 보수적(비관적) Q-함수를 학습하는 오프라인 RL 알고리즘입니다. 이는 오프라인 RL 정책이 데이터로 뒷받침되지 않는 거짓 고가치 영역을 악용하도록 하는 과대평가 문제를 방지합니다. CQL은 로봇 조작을 위한 가장 널리 사용되는 오프라인 RL 방법 중 하나입니다.
Conservative Q-Learning — 분포 외 행동에 대한 Q-값에 페널티를 추가하여 보수적(비관적) Q-함수를 학습하는 오프라인 RL 알고리즘입니다. 이는 오프라인 RL 정책이 데이터로 뒷받침되지 않는 거짓 고가치 영역을 악용하도록 하는 과대평가 문제를 방지합니다. CQL은 로봇 조작을 위한 가장 널리 사용되는 오프라인 RL 방법 중 하나입니다.