Retour à Glossary

Processus de décision markovien

MathRL

Un cadre mathématique pour la prise de décision séquentielle sous incertitude : un tuple (S, A, P, R, γ) d'états, d'actions, de probabilités de transition, de fonction de récompense et de facteur d'actualisation. Les algorithmes d'apprentissage par renforcement apprennent des politiques de contrôle qui maximisent le rendement actualisé attendu dans un MDP. La manipulation et la locomotion robotiques sont modélisées comme des MDP, où la politique de contrôle mappe les états aux actions.

Related terms