Fonction de récompense apprise
Une fonction de récompense qui est apprise à partir de données (préférences humaines, démonstrations ou descriptions en langage naturel) plutôt que conçue manuellement. Les méthodes d'apprentissage de récompense incluent l'RL inverse, la modélisation de récompense à partir de comparaisons humaines (style RLHF), et le scoring de récompense basé sur VLM (utilisant la similarité CLIP ou l'évaluation par LLM). Les récompenses apprises répondent au défi que les fonctions de récompense manuelles bien formées sont souvent difficiles à spécifier pour les tâches de manipulation complexes.







