Модель вознаграждения
Нейронная сеть, обученная предсказывать скалярные значения вознаграждения из пар состояние-действие или сегментов траектории, обычно обученная на предпочтениях человека или экспертных демонстрациях. Модели вознаграждения заменяют ручно спроектированные функции вознаграждения на изученные. Они являются центральными для обучения в стиле RLHF и используются в робототехнике для задания сложных целей задач, которые трудно формализовать математически.







