정책 그래디언트
정책 파라미터에 대한 예상 반환의 그래디언트를 추정하여 정책 파라미터를 직접 최적화하는 RL 알고리즘 계열. REINFORCE, PPO, TRPO, SAC는 모두 이 계열에 속합니다. 정책 그래디언트 방법은 연속 행동 공간에서 작동하며(DQN 같은 가치 기반 방법과 달리) 로봇 제어 작업을 위한 표준 RL 접근법입니다.
정책 파라미터에 대한 예상 반환의 그래디언트를 추정하여 정책 파라미터를 직접 최적화하는 RL 알고리즘 계열. REINFORCE, PPO, TRPO, SAC는 모두 이 계열에 속합니다. 정책 그래디언트 방법은 연속 행동 공간에서 작동하며(DQN 같은 가치 기반 방법과 달리) 로봇 제어 작업을 위한 표준 RL 접근법입니다.