Glossary(으)로 돌아가기

SAC

Robot LearningRL

Soft Actor-Critic — 예상 수익과 제어정책 엔트로피를 모두 최대화하는 오프-정책 RL 알고리즘으로, 탐색을 장려하면서 안정성을 유지합니다. SAC는 샘플 효율성과 하이퍼파라미터에 대한 견고성으로 인해 시뮬레이션에서의 로봇 조작에 인기가 있습니다. 엔트로피 정규화는 결정론적 제어정책으로의 조기 수렴을 방지하고 환경 변화에 대한 견고성을 개선합니다.

Related terms