Função de Recompensa
A função de recompensa define o objetivo de aprendizado para um agente de aprendizado por reforço: atribui um sinal de recompensa escalar r(s, a, s') a cada transição (estado, ação, próximo-estado), informando ao agente quão boas ou ruins são suas ações. O design da função de recompensa é uma das partes mais difíceis de aplicar RL à robótica: recompensas esparsas (1 no sucesso, 0 caso contrário) são limpas mas levam a aprendizado lento; recompensas densas (por exemplo, distância negativa até o objetivo) guiam o aprendizado mas podem ser exploradas de formas inesperadas (exploração de recompensa). Alternativas incluem aprendizado de recompensa a partir de demonstrações (IRL, RLHF), métricas de simulação específicas da tarefa e modelos de preferência aprendidos. O aprendizado por imitação contorna o problema de design de recompensa inteiramente aprendendo diretamente a partir de demonstrações. Veja isso na prática: nossas avaliações em mundo real →







