Voltar para Glossary

Buffer de Reprodução

Reinforcement LearningData

Um buffer de reprodução (ou memória de reprodução de experiência) é um conjunto de dados de transições passadas (estado, ação, recompensa, próximo estado, concluído) coletadas por um agente de RL durante a interação com o ambiente. A cada passo de treinamento, mini-lotes aleatórios são amostrados do buffer para treinar a função de valor ou a política de controle, quebrando correlações temporais que desestabilizariam as atualizações de gradiente. Em RL offline e aprendizado robótico, o buffer de reprodução é substituído por um conjunto de dados fixo de demonstrações humanas ou rollouts coletados anteriormente. A reprodução de experiência priorizada pondera a amostragem por erro de diferença temporal para focar o treinamento em transições informativas. Veja isso na prática: nossas avaliações em mundo real →

Related terms