Retour à Glossary

Apprentissage par préférences

Robot LearningRL

Apprentissage à partir de jugements comparatifs humains (par exemple, « la trajectoire A est meilleure que la trajectoire B ») plutôt que de signaux de récompense explicites ou de démonstrations. Un modèle de récompense est entraîné pour être cohérent avec les préférences humaines, puis utilisé pour optimiser la politique de contrôle via RL. Cette approche (RLHF appliquée à la robotique) évite le besoin d'une ingénierie précise de récompense scalaire et peut capturer l'intention humaine nuancée.

Related terms