Glossaryに戻る

マルコフ決定過程

MathRL

不確実性下での逐次意思決定のための数学的フレームワーク:状態、行動、遷移確率、報酬関数、割引係数のタプル(S, A, P, R, γ)。強化学習アルゴリズムはMDPで期待割引リターンを最大化する制御方針を学習します。ロボット操作と移動は制御方針が状態を行動にマッピングするMDPとしてモデル化されます。

Related terms