Voltar para Glossary

Função Q (Função de Valor de Ação)

Reinforcement LearningValue Function

A função Q Q(s, a) estima a recompensa cumulativa descontada esperada que um agente receberá ao tomar a ação a no estado s e depois seguir uma política dada. As funções Q são centrais para algoritmos de aprendizado por reforço como DQN (ações discretas) e SAC, TD3 e DDPG (ações contínuas). Em RL robótico, aprender funções Q precisas para tarefas de manipulação de longo horizonte é desafiador porque as recompensas são esparsas e o espaço estado-ação é de alta dimensionalidade. Trabalhos recentes em RL offline (IQL, CQL) usam funções Q para extrair políticas de conjuntos de dados fixos sem interação online, fechando a lacuna entre aprendizado por imitação e RL. Veja isso na prática: nossas avaliações em mundo real →

Related terms