Retour à Glossary

Mémoire tampon de relecture

Reinforcement LearningData

Une mémoire tampon de relecture (ou mémoire de relecture d'expérience) est un ensemble de transitions passées (état, action, récompense, état suivant, terminé) collectées par un agent RL pendant l'interaction avec l'environnement. À chaque étape d'entraînement, des mini-lots aléatoires sont échantillonnés à partir de la mémoire tampon pour entraîner la fonction de valeur ou la politique de contrôle, cassant les corrélations temporelles qui déstabiliseraient les mises à jour de gradient. En RL hors ligne et en apprentissage robotique, la mémoire tampon est remplacée par un ensemble fixe de démonstrations humaines ou de trajectoires collectées précédemment. La relecture d'expérience priorisée pondère l'échantillonnage par l'erreur de différence temporelle pour concentrer l'entraînement sur les transitions informatives. Voir cela en pratique : nos évaluations en monde réel →

Related terms