IQL
Implicit Q-Learning — алгоритм автономного обучения с подкреплением, который избегает запроса Q-функции на действиях вне распределения, используя цель регрессии ожидаемого значения. IQL достигает сильной производительности в автономном обучении с подкреплением без явного консерватизма CQL, что делает его проще в реализации и настройке. Он стал популярным для задач манипуляции роботом, обученных на данных демонстраций.







