Glossary(으)로 돌아가기

PPO

Robot LearningRL

근접 정책 최적화(Proximal Policy Optimization) — 클리핑된 대리 목적함수를 사용하여 정책 업데이트를 신뢰 영역으로 제한하는 정책 경사 강화학습 알고리즘입니다. PPO는 안정성, 단순성, 샘플 효율성으로 인해 로봇 보행(다리 로봇, 휴머노이드) 및 시뮬레이션-투-리얼 전이를 위한 기본 강화학습 알고리즘입니다. TRPO의 제약 최적화의 계산 비용 없이 탐색과 활용의 균형을 맞춥니다.

Related terms