오프라인 강화학습
이전에 수집한 고정된 전이(transition) 데이터셋으로부터의 강화학습으로, 환경과의 추가적인 온라인 상호작용이 없음. 오프라인 강화학습 알고리즘(CQL, IQL, TD3+BC)은 데이터를 수집한 행동 정책과 학습된 정책 간의 분포 이동(distribution shift)을 다룸. 오프라인 강화학습은 온라인 탐색의 안전 문제와 비용을 피할 수 있어 로봇공학에서 매력적임.
이전에 수집한 고정된 전이(transition) 데이터셋으로부터의 강화학습으로, 환경과의 추가적인 온라인 상호작용이 없음. 오프라인 강화학습 알고리즘(CQL, IQL, TD3+BC)은 데이터를 수집한 행동 정책과 학습된 정책 간의 분포 이동(distribution shift)을 다룸. 오프라인 강화학습은 온라인 탐색의 안전 문제와 비용을 피할 수 있어 로봇공학에서 매력적임.