Volver a Glossary

CQL

RL

Conservative Q-Learning — un algoritmo de aprendizaje por refuerzo offline que aprende una función Q conservadora (pesimista) añadiendo una penalización para valores Q en acciones fuera de la distribución. Esto previene el problema de sobreestimación que causa que las políticas de aprendizaje por refuerzo offline exploten regiones espurias de alto valor no respaldadas por los datos. CQL es uno de los métodos de aprendizaje por refuerzo offline más ampliamente utilizados para manipulación robótica.

Related terms