Função de Valor
Uma função que estima a recompensa cumulativa esperada a partir de um estado dado (função de valor de estado V) ou par estado-ação (função de valor de ação Q). Funções de valor são centrais em RL — elas guiam a seleção de ações e melhoria de política. RL profundo utiliza redes neurais para aproximar funções de valor. Em robótica, funções de valor aprendidas podem servir como estimativas de custo-até-o-objetivo para planejamento e como críticos de segurança.







