制御ポリシ勾配法
制御ポリシパラメータに関する期待リターンの勾配を推定することで、制御ポリシパラメータを直接最適化するRL アルゴリズムのファミリー。REINFORCE、PPO、TRPO、SACはすべてこのファミリに属します。制御ポリシ勾配法は連続行動空間で機能し(DQNのような価値ベース手法とは異なり)、ロボット制御タスクの標準的なRL アプローチです。
制御ポリシパラメータに関する期待リターンの勾配を推定することで、制御ポリシパラメータを直接最適化するRL アルゴリズムのファミリー。REINFORCE、PPO、TRPO、SACはすべてこのファミリに属します。制御ポリシ勾配法は連続行動空間で機能し(DQNのような価値ベース手法とは異なり)、ロボット制御タスクの標準的なRL アプローチです。