행동 정규화
오프라인 강화학습 방법의 한 계열로, 학습된 제어 정책이 데이터를 수집한 행동 정책에 가깝게 유지되도록 제약하여 분포 외 행동의 악용을 방지한다. 방법에는 다음이 포함된다: 제어 정책 제약(TD3+BC), KL 발산 페널티, 그리고 지지 제약(BEAR). 행동 정규화는 안정적인 오프라인 강화학습을 가능하게 하는 핵심 메커니즘이다.
오프라인 강화학습 방법의 한 계열로, 학습된 제어 정책이 데이터를 수집한 행동 정책에 가깝게 유지되도록 제약하여 분포 외 행동의 악용을 방지한다. 방법에는 다음이 포함된다: 제어 정책 제약(TD3+BC), KL 발산 페널티, 그리고 지지 제약(BEAR). 행동 정규화는 안정적인 오프라인 강화학습을 가능하게 하는 핵심 메커니즘이다.