Volver a Glossary

PPO

Robot LearningRL

Proximal Policy Optimization — un algoritmo de RL de gradiente de política que restringe las actualizaciones de política a una región de confianza usando un objetivo sustituto recortado. PPO es el algoritmo de RL predeterminado para locomoción robótica (robots con patas, humanoides) y transferencia sim-a-real debido a su estabilidad, simplicidad y eficiencia de muestreo. Equilibra exploración y explotación sin el costo computacional de la optimización restringida de TRPO.

Related terms