Назад к Glossary

TRPO

RL

Trust Region Policy Optimization — алгоритм градиента политики обучения с подкреплением, который ограничивает каждое обновление политики доверительной областью (измеряемой дивергенцией KL) для предотвращения больших разрушительных обновлений. TRPO обеспечивает гарантии монотонного улучшения, но вычислительно дорог из-за ограниченной оптимизации. PPO аппроксимирует преимущества TRPO с более простой обрезанной суррогатной целевой функцией.

Related terms