Q-функция (функция стоимости действия)
Q-функция Q(s, a) оценивает ожидаемое кумулятивное дисконтированное вознаграждение, которое агент получит, выполнив действие a в состоянии s и затем следуя заданной политике управления. Q-функции являются центральными в алгоритмах обучения с подкреплением, таких как DQN (дискретные действия) и SAC, TD3, DDPG (непрерывные действия). В робототехническом RL обучение точных Q-функций для долгосрочных задач манипуляции сложно, поскольку вознаграждения разреженные, а пространство состояний-действий высокомерно. Недавние работы в автономном RL (IQL, CQL) используют Q-функции для извлечения политик управления из фиксированных наборов данных без онлайн-взаимодействия, преодолевая разрыв между обучением подражанием и RL. Смотрите это на практике: наши оценки в реальном мире →







