Función Q (Función de Valor de Acción)
La función Q Q(s, a) estima la recompensa acumulada descontada esperada que un agente recibirá al tomar la acción a en el estado s y luego seguir una política dada. Las funciones Q son centrales en algoritmos de aprendizaje por refuerzo como DQN (acciones discretas) y SAC, TD3 y DDPG (acciones continuas). En RL robótico, aprender funciones Q precisas para tareas de manipulación de horizonte largo es desafiante porque las recompensas son escasas y el espacio estado-acción es de alta dimensionalidad. Trabajos recientes en RL offline (IQL, CQL) utilizan funciones Q para extraer políticas de conjuntos de datos fijos sin interacción en línea, cerrando la brecha entre aprendizaje por imitación y RL. Ver esto en práctica: nuestras evaluaciones en el mundo real →







