Glossary(으)로 돌아가기

TRPO

RL

신뢰 영역 정책 최적화 — 각 정책 업데이트를 신뢰 영역(KL 발산으로 측정)으로 제한하여 크고 파괴적인 업데이트를 방지하는 정책 그래디언트 강화학습 알고리즘입니다. TRPO는 단조 개선 보장을 제공하지만 제약 최적화로 인해 계산 비용이 많이 듭니다. PPO는 더 간단한 클리핑된 대리 목적함수로 TRPO의 이점을 근사합니다.

Related terms