Назад к Glossary

Обучение на основе предпочтений

Robot LearningRL

Обучение на основе сравнительных суждений человека (например, «траектория A лучше, чем траектория B») вместо явных сигналов вознаграждения или демонстраций. Модель вознаграждения обучается быть согласованной с предпочтениями человека, затем используется для оптимизации управляющей политики через обучение с подкреплением. Этот подход (RLHF, применённый к робототехнике) избегает необходимости точной инженерии скалярного вознаграждения и может захватить тонкие намерения человека.

Related terms