安全制約強化学習
安全制約(例:衝突確率 < 0.01、関節トルク制限)を満たしながらリターンを最適化する制約付き強化学習。制約付き制御則最適化(CPO)、ラグランジュ法、制御バリア関数が一般的なアプローチです。安全RLは、制約違反がハードウェアを損傷したり人に危害を加える可能性がある実世界のロボット展開に不可欠です。
安全制約(例:衝突確率 < 0.01、関節トルク制限)を満たしながらリターンを最適化する制約付き強化学習。制約付き制御則最適化(CPO)、ラグランジュ法、制御バリア関数が一般的なアプローチです。安全RLは、制約違反がハードウェアを損傷したり人に危害を加える可能性がある実世界のロボット展開に不可欠です。