그래디언트 클리핑
학습 중 그래디언트의 크기를 제한하여 최적화를 불안정하게 할 수 있는 폭발적 그래디언트를 방지합니다. 그래디언트 노름은 최대값(일반적으로 1.0–10.0)으로 클리핑됩니다. 그래디언트 클리핑은 Transformer, RNN, 그리고 보상 분산이 큰 그래디언트 스파이크를 유발할 수 있는 RL 제어 정책을 학습할 때 표준 관행입니다.
학습 중 그래디언트의 크기를 제한하여 최적화를 불안정하게 할 수 있는 폭발적 그래디언트를 방지합니다. 그래디언트 노름은 최대값(일반적으로 1.0–10.0)으로 클리핑됩니다. 그래디언트 클리핑은 Transformer, RNN, 그리고 보상 분산이 큰 그래디언트 스파이크를 유발할 수 있는 RL 제어 정책을 학습할 때 표준 관행입니다.