動作正則化
オフライン強化学習の手法群。学習された制御ポリシーをデータ収集に使用された動作ポリシーの近くに保つよう制約し、分布外行動の悪用を防止します。手法には以下が含まれます:制御ポリシー制約(TD3+BC)、KL ダイバージェンスペナルティ、サポート制約(BEAR)。動作正則化はオフライン強化学習の安定性を実現する主要なメカニズムです。
オフライン強化学習の手法群。学習された制御ポリシーをデータ収集に使用された動作ポリシーの近くに保つよう制約し、分布外行動の悪用を防止します。手法には以下が含まれます:制御ポリシー制約(TD3+BC)、KL ダイバージェンスペナルティ、サポート制約(BEAR)。動作正則化はオフライン強化学習の安定性を実現する主要なメカニズムです。