Буфер воспроизведения
Буфер воспроизведения (или память воспроизведения опыта) — это набор данных прошлых переходов (состояние, действие, награда, следующее состояние, завершение), собранных агентом обучения с подкреплением во время взаимодействия с окружающей средой. На каждом шаге обучения случайные мини-пакеты выбираются из буфера для обучения функции ценности или управляющей политики, разрывая временные корреляции, которые могли бы дестабилизировать обновления градиента. В автономном обучении с подкреплением и обучении роботов буфер воспроизведения заменяется фиксированным набором данных человеческих демонстраций или ранее собранных траекторий. Приоритизированное воспроизведение опыта взвешивает выборку по ошибке временной разности, чтобы сосредоточить обучение на информативных переходах. Смотрите это на практике: наши оценки в реальном мире →







