Ingénierie de la récompense
Le processus de conception d'une fonction de récompense scalaire qui encode le comportement souhaité du robot pour l'entraînement par RL. Une bonne ingénierie de la récompense fournit un retour dense qui guide l'apprentissage sans introduire de raccourcis involontaires. Pièges courants : l'exploitation de récompense (optimiser le proxy de récompense plutôt que le comportement visé) et les récompenses éparses (signal d'apprentissage trop peu fréquent).







