PPO
Proximal Policy Optimization — алгоритм обучения с подкреплением на основе градиента политики, который ограничивает обновления политики доверительной областью, используя обрезанную суррогатную целевую функцию. PPO — алгоритм обучения с подкреплением по умолчанию для локомоции роботов (шагающие роботы, гуманоиды) и трансфера из симуляции в реальность благодаря его стабильности, простоте и эффективности по выборкам. Он балансирует исследование и эксплуатацию без вычислительных затрат на ограниченную оптимизацию TRPO.







