Voltar para Glossary

Modelagem de Recompensa

Robot LearningRL

Modificar a função de recompensa para fornecer sinais de aprendizado mais densos e informativos sem alterar a política ótima. Por exemplo, adicionar uma recompensa de modelagem baseada em potencial que fornece crédito parcial por se aproximar do objetivo. A modelagem de recompensa acelera dramaticamente o treinamento com RL em ambientes com recompensas esparsas, mas requer cuidado para evitar introduzir ótimos locais não intencionais.

Related terms