Retour à Glossary

Fonction Q (Fonction de valeur d'action)

Reinforcement LearningValue Function

La fonction Q Q(s, a) estime la récompense cumulative actualisée attendue qu'un agent recevra en prenant l'action a dans l'état s et en suivant ensuite une politique donnée. Les fonctions Q sont centrales aux algorithmes d'apprentissage par renforcement tels que DQN (actions discrètes) et SAC, TD3 et DDPG (actions continues). En RL robotique, apprendre des fonctions Q précises pour les tâches de manipulation à long horizon est difficile car les récompenses sont rares et l'espace état-action est de haute dimension. Les travaux récents en RL hors ligne (IQL, CQL) utilisent les fonctions Q pour extraire des politiques de contrôle à partir de datasets fixes sans interaction en ligne, comblant le fossé entre l'apprentissage par imitation et le RL. Voir cela en pratique : nos évaluations en monde réel →

Related terms