온라인 강화학습
에이전트가 환경과 적극적으로 상호작용하여 새로운 전이를 수집하고 정책을 실시간으로 업데이트하는 강화학습. 온라인 강화학습은 정적 데이터셋에서 다루지 않은 영역을 탐색함으로써 오프라인 강화학습보다 높은 성능을 달성할 수 있지만, 물리적 로봇 설정에서 안전한 탐색 메커니즘이 필요함. 시뮬레이션-현실 이전(sim-to-real transfer)은 온라인 강화학습 단계를 안전하게 시뮬레이션에서 수행하기 위해 자주 사용됨.
에이전트가 환경과 적극적으로 상호작용하여 새로운 전이를 수집하고 정책을 실시간으로 업데이트하는 강화학습. 온라인 강화학습은 정적 데이터셋에서 다루지 않은 영역을 탐색함으로써 오프라인 강화학습보다 높은 성능을 달성할 수 있지만, 물리적 로봇 설정에서 안전한 탐색 메커니즘이 필요함. 시뮬레이션-현실 이전(sim-to-real transfer)은 온라인 강화학습 단계를 안전하게 시뮬레이션에서 수행하기 위해 자주 사용됨.