Glossary(으)로 돌아가기

정책 그래디언트

Robot LearningRL

정책 파라미터에 대한 예상 반환의 그래디언트를 추정하여 정책 파라미터를 직접 최적화하는 RL 알고리즘 계열. REINFORCE, PPO, TRPO, SAC는 모두 이 계열에 속합니다. 정책 그래디언트 방법은 연속 행동 공간에서 작동하며(DQN 같은 가치 기반 방법과 달리) 로봇 제어 작업을 위한 표준 RL 접근법입니다.

Related terms