Обученная функция вознаграждения
Функция вознаграждения, которая обучается на данных (предпочтения человека, демонстрации или описания на естественном языке) вместо ручного проектирования. Методы обучения функции вознаграждения включают обратное обучение с подкреплением, моделирование вознаграждения из сравнений человека (в стиле RLHF) и оценку вознаграждения на основе VLM (используя сходство CLIP или оценку LLM). Обученные функции вознаграждения решают проблему того, что хорошо сформированные ручные функции вознаграждения часто сложно задать для сложных задач манипуляции.







