IQL
Implicit Q-Learning — um algoritmo de aprendizado por reforço offline que evita consultar a função Q em ações fora da distribuição usando um objetivo de regressão expectil. IQL alcança forte desempenho em aprendizado por reforço offline sem o conservadorismo explícito de CQL, tornando-o mais simples de implementar e ajustar. Tornou-se popular para tarefas de manipulação robótica treinadas em dados de demonstração.







