Volver a Glossary

Proceso de Decisión de Markov

MathRL

Un marco matemático para toma de decisiones secuencial bajo incertidumbre: una tupla (S, A, P, R, γ) de estados, acciones, probabilidades de transición, función de recompensa y factor de descuento. Los algoritmos de aprendizaje por refuerzo aprenden políticas de control que maximizan el retorno esperado descontado en un MDP. La manipulación y locomoción robótica se modelan como MDPs, donde la política de control mapea estados a acciones.

Related terms