Volver a Glossary

TRPO

RL

Trust Region Policy Optimization — un algoritmo de gradiente de política de aprendizaje por refuerzo que restringe cada actualización de política a una región de confianza (medida por divergencia KL) para prevenir actualizaciones grandes y destructivas. TRPO proporciona garantías de mejora monótona pero es computacionalmente costoso debido a la optimización restringida. PPO aproxima los beneficios de TRPO con un objetivo sustituto recortado más simple.

Related terms