RL Offline
Aprendizaje por refuerzo a partir de un conjunto de datos fijo de transiciones previamente recopiladas, sin interacción adicional en línea con el entorno. Los algoritmos de RL offline (CQL, IQL, TD3+BC) abordan el cambio de distribución entre la política de comportamiento que recopiló los datos y la política aprendida. RL offline es atractivo para robótica porque evita las preocupaciones de seguridad y el costo de la exploración en línea.







