Volver a Glossary

Gradiente de Política

Robot LearningRL

Una familia de algoritmos de aprendizaje por refuerzo que optimizan directamente los parámetros de la política estimando el gradiente del retorno esperado con respecto a los parámetros de la política. REINFORCE, PPO, TRPO y SAC pertenecen todos a esta familia. Los métodos de gradiente de política funcionan con espacios de acciones continuas (a diferencia de métodos basados en valor como DQN) y son el enfoque estándar de aprendizaje por refuerzo para tareas de control de robots.

Related terms