Назад к Glossary

Обратное обучение с подкреплением

Robot LearningRL

Обучение функции вознаграждения на основе демонстраций экспертов с предположением, что эксперт (приблизительно) оптимально максимизирует это вознаграждение. Обратное обучение с подкреплением избегает необходимости ручного проектирования функций вознаграждения — вместо этого вознаграждение выводится и затем используется для обучения управляющей политики с помощью стандартного обучения с подкреплением. Обратное обучение с максимальной энтропией и состязательное обратное обучение (AIRL) — популярные формулировки. Обратное обучение с подкреплением тесно связано с GAIL.

Related terms