Функция вознаграждения
Функция вознаграждения определяет цель обучения для агента обучения с подкреплением: она присваивает скалярный сигнал вознаграждения r(s, a, s') каждому переходу (состояние, действие, следующее состояние), сообщая агенту, насколько хороши или плохи его действия. Проектирование функции вознаграждения — одна из самых сложных частей применения обучения с подкреплением к робототехнике: разреженные вознаграждения (1 при успехе, 0 иначе) чисты, но приводят к медленному обучению; плотные вознаграждения (например, отрицательное расстояние до цели) направляют обучение, но могут быть использованы неожиданным образом (взлом вознаграждения). Альтернативы включают обучение вознаграждению из демонстраций (IRL, RLHF), метрики моделирования, специфичные для задачи, и изученные модели предпочтений. Обучение имитации полностью обходит проблему проектирования вознаграждения, обучаясь непосредственно из демонстраций. Смотрите это на практике: наши оценки в реальном мире →







