確率的制御則
単一の決定論的アクションではなく、アクション上の確率分布を出力する制御則で、探索と不確実性の処理を可能にします。ガウス制御則(平均と対角共分散)は方策勾配強化学習の標準です。Diffusion Policyと正規化フロー制御則はより複雑なアクション分布に拡張されます。確率的制御則は最大エントロピー強化学習(SAC)に必要です。
単一の決定論的アクションではなく、アクション上の確率分布を出力する制御則で、探索と不確実性の処理を可能にします。ガウス制御則(平均と対角共分散)は方策勾配強化学習の標準です。Diffusion Policyと正規化フロー制御則はより複雑なアクション分布に拡張されます。確率的制御則は最大エントロピー強化学習(SAC)に必要です。