返回Glossary

马尔可夫决策过程

MathRL

用于不确定性下序列决策的数学框架:一个由状态、动作、转移概率、奖励函数和折扣因子组成的元组 (S, A, P, R, γ)。强化学习算法学习在 MDP 中最大化期望折扣回报的控制策略。机器人操纵和运动被建模为 MDP,其中控制策略将状态映射到动作。

Related terms