Glossaryに戻る

制御ポリシ勾配法

Robot LearningRL

制御ポリシパラメータに関する期待リターンの勾配を推定することで、制御ポリシパラメータを直接最適化するRL アルゴリズムのファミリー。REINFORCE、PPO、TRPO、SACはすべてこのファミリに属します。制御ポリシ勾配法は連続行動空間で機能し(DQNのような価値ベース手法とは異なり)、ロボット制御タスクの標準的なRL アプローチです。

Related terms