Назад к Glossary

Обученная функция вознаграждения

Robot LearningRL

Функция вознаграждения, которая обучается на данных (предпочтения человека, демонстрации или описания на естественном языке) вместо ручного проектирования. Методы обучения функции вознаграждения включают обратное обучение с подкреплением, моделирование вознаграждения из сравнений человека (в стиле RLHF) и оценку вознаграждения на основе VLM (используя сходство CLIP или оценку LLM). Обученные функции вознаграждения решают проблему того, что хорошо сформированные ручные функции вознаграждения часто сложно задать для сложных задач манипуляции.

Related terms