Glossary(으)로 돌아가기

확률적 제어정책

Robot LearningRLPolicy

단일 결정론적 행동이 아닌 행동에 대한 확률 분포를 출력하는 제어정책으로, 탐색과 우연적 불확실성 처리를 가능하게 합니다. 가우시안 제어정책(평균 + 대각 공분산)은 정책 그래디언트 강화학습의 표준입니다. Diffusion Policy와 정규화 흐름 제어정책은 더 복잡한 행동 분포로 확장됩니다. 확률적 제어정책은 최대 엔트로피 강화학습(SAC)에 필수적입니다.

Related terms