PPO
Proximal Policy Optimization — um algoritmo de RL com gradiente de política que restringe atualizações de política a uma região de confiança usando um objetivo substituto recortado. PPO é o algoritmo de RL padrão para locomoção robótica (robôs com pernas, humanoides) e transferência sim-para-real devido à sua estabilidade, simplicidade e eficiência amostral. Equilibra exploração e exploração sem o custo computacional da otimização restrita do TRPO.







