Glossaryに戻る

TRPO

RL

信頼領域ポリシー最適化 — 各ポリシー更新を信頼領域(KL発散で測定)に制約する制御ポリシー勾配強化学習アルゴリズムで、大きな破壊的な更新を防ぎます。TRPOは単調改善保証を提供しますが、制約付き最適化のため計算コストが高くなります。PPOはより単純なクリップされたサロゲート目的関数でTRPOの利点を近似します。

Related terms