Glossaryに戻る

アクション空間の正規化

DataRobot Learning

ポリシーを訓練する前に、ロボットアクション値を標準範囲(通常は[-1, 1])にスケーリングする。正規化により、すべてのアクション次元が損失関数に等しく寄与し、大きな値の次元が勾配更新を支配するのを防ぐ。逆正規化は実行時にポリシー出力を物理単位(ラジアン、メートル/秒)に変換する。

Related terms