Normalização do Espaço de Ação
Escalar valores de ação do robô para um intervalo padrão (tipicamente [-1, 1]) antes de treinar uma política. A normalização garante que todas as dimensões de ação contribuam igualmente à função de perda e impede que dimensões com valores grandes dominem as atualizações de gradiente. A desnormalização converte saídas de política de volta para unidades físicas (radianos, metros/s) no tempo de execução.







