Voltar para Glossary

Gradiente de Política

Robot LearningRL

Uma família de algoritmos de RL que otimiza diretamente os parâmetros da política estimando o gradiente do retorno esperado com respeito aos parâmetros da política. REINFORCE, PPO, TRPO e SAC pertencem todos a esta família. Os métodos de gradiente de política funcionam com espaços de ação contínuos (diferentemente de métodos baseados em valor como DQN) e são a abordagem padrão de RL para tarefas de controle de robôs.

Related terms