Fonction de récompense
La fonction de récompense définit l'objectif d'apprentissage pour un agent d'apprentissage par renforcement : elle assigne un signal de récompense scalaire r(s, a, s') à chaque transition (état, action, état suivant), indiquant à l'agent la qualité de ses actions. La conception de la fonction de récompense est l'une des parties les plus difficiles de l'application du RL à la robotique : les récompenses éparses (1 en cas de succès, 0 sinon) sont propres mais conduisent à un apprentissage lent ; les récompenses denses (par exemple, distance négative à l'objectif) guident l'apprentissage mais peuvent être exploitées de manière inattendue (exploitation de récompense). Les alternatives incluent l'apprentissage de récompense à partir de démonstrations (IRL, RLHF), les métriques de simulation spécifiques à la tâche et les modèles de préférence appris. L'apprentissage par imitation contourne entièrement le problème de conception de récompense en apprenant directement à partir de démonstrations. Voir cela en pratique : nos évaluations en monde réel →







