Glossaryに戻る

オフラインRL

Robot LearningRL

以前に収集された遷移の固定データセットから強化学習を行い、環境との追加的なオンライン相互作用を行わない。オフラインRLアルゴリズム(CQL、IQL、TD3+BC)は、データを収集した行動方針と学習された制御方針の間の分布シフトに対処する。オフラインRLはロボット工学にとって魅力的である。なぜなら、オンライン探索の安全上の懸念とコストを回避できるからである。

Related terms