Zurück zu Glossary

PPO

Robot LearningRL

Proximal Policy Optimization — ein Policy-Gradient-RL-Algorithmus, der Policy-Updates auf eine Vertrauensregion mit einem abgeschnittenen Surrogate-Objective beschränkt. PPO ist der Standard-RL-Algorithmus für Roboter-Lokomotion (beinige Roboter, Humanoide) und Sim-to-Real-Transfer aufgrund seiner Stabilität, Einfachheit und Stichprobeneffizienz. Er balanciert Exploration und Exploitation ohne die Rechenkosten von TRPOs eingeschränkter Optimierung.

Related terms