Voltar para Glossary

Normalização do Espaço de Ação

DataRobot Learning

Escalar valores de ação do robô para um intervalo padrão (tipicamente [-1, 1]) antes de treinar uma política. A normalização garante que todas as dimensões de ação contribuam igualmente à função de perda e impede que dimensões com valores grandes dominem as atualizações de gradiente. A desnormalização converte saídas de política de volta para unidades físicas (radianos, metros/s) no tempo de execução.

Related terms