TRPO
Trust Region Policy Optimization — um algoritmo de gradiente de controle de aprendizado por reforço que restringe cada atualização de controle a uma região de confiança (medida por divergência KL) para evitar atualizações grandes e destrutivas. TRPO fornece garantias de melhoria monotônica, mas é computacionalmente caro devido à otimização restrita. PPO aproxima os benefícios de TRPO com um objetivo substituto recortado mais simples.







