Glossaryに戻る

PPO

Robot LearningRL

近接方針最適化 — クリップされた代理目的を使用して信頼領域に方針更新を制約するポリシー勾配RLアルゴリズム。PPOは安定性、シンプルさ、およびサンプル効率のため、脚ロボットと人型ロボットの運動学習およびシミュレーション・ツー・リアル転移のためのデフォルトRLアルゴリズムである。TRPOの制約付き最適化の計算コストなしに、探索と搾取のバランスを取る。

Related terms