CQL
Conservative Q-Learning — алгоритм обучения без учителя (offline RL), который обучает консервативную (пессимистичную) Q-функцию путём добавления штрафа за Q-значения на действия вне распределения данных. Это предотвращает проблему переоценки, которая заставляет политики offline RL эксплуатировать ложные области высокой стоимости, не поддерживаемые данными. CQL — один из наиболее широко используемых методов offline RL для манипуляции роботами.







