Zurück zu Glossary

Wiederholungspuffer

Reinforcement LearningData

Ein Wiederholungspuffer (oder Experience-Replay-Speicher) ist ein Datensatz von vergangenen (Zustand, Aktion, Belohnung, nächster Zustand, fertig) Übergängen, die von einem RL-Agenten während der Umgebungsinteraktion gesammelt werden. Bei jedem Trainingsschritt werden zufällige Mini-Batches aus dem Puffer entnommen, um die Wertfunktion oder Kontrollpolitik zu trainieren, wodurch zeitliche Korrelationen unterbrochen werden, die Gradientenaktualisierungen destabilisieren würden. In Offline-RL und Roboterlernen wird der Wiederholungspuffer durch einen festen Datensatz von menschlichen Demonstrationen oder zuvor gesammelten Rollouts ersetzt. Priorisiertes Experience Replay gewichtet die Stichprobenentnahme nach Temporal-Difference-Fehler, um das Training auf informative Übergänge zu konzentrieren. Siehe dies in der Praxis: unsere realen Evaluierungen →

Related terms