Engenharia de Recompensa
O processo de projetar uma função de recompensa escalar que codifica o comportamento desejado do robô para treinamento com RL. Uma boa engenharia de recompensa fornece feedback denso que guia o aprendizado sem introduzir atalhos não intencionais. Armadilhas comuns: exploração de recompensa (otimizar o proxy de recompensa em vez do comportamento pretendido) e recompensas esparsas (sinal de aprendizado muito infrequente).







