Градиент политики
Семейство алгоритмов обучения с подкреплением, которые напрямую оптимизируют параметры политики путем оценки градиента ожидаемого вознаграждения относительно параметров политики. REINFORCE, PPO, TRPO и SAC все принадлежат к этому семейству. Методы градиента политики работают с непрерывными пространствами действий (в отличие от методов, основанных на значениях, таких как DQN) и являются стандартным подходом обучения с подкреплением для задач управления роботом.







