Función de Valor
Una función que estima la recompensa acumulada esperada desde un estado dado (función de valor de estado V) o un par estado-acción (función de valor de acción Q). Las funciones de valor son centrales en RL — guían la selección de acciones y la mejora de políticas. El RL profundo utiliza redes neuronales para aproximar funciones de valor. En robótica, las funciones de valor aprendidas pueden servir como estimaciones de costo-a-meta para planificación y como críticos de seguridad.







