Façonnage de récompense
Modification de la fonction de récompense pour fournir des signaux d'apprentissage plus denses et plus informatifs sans modifier la politique optimale. Par exemple, ajouter une récompense de façonnage basée sur le potentiel qui donne un crédit partiel pour s'être rapproché de l'objectif. Le façonnage de récompense accélère dramatiquement l'entraînement par RL dans les environnements à récompenses éparses mais nécessite de la prudence pour éviter d'introduire des optima locaux involontaires.







