IQL
Implicit Q-Learning — un algoritmo de aprendizaje por refuerzo offline que evita consultar la función Q en acciones fuera de distribución mediante un objetivo de regresión de expectiles. IQL logra un desempeño sólido en aprendizaje por refuerzo offline sin el conservadurismo explícito de CQL, lo que lo hace más simple de implementar y ajustar. Se ha vuelto popular para tareas de manipulación robótica entrenadas con datos de demostración.







