시간적 앙상블
액션 청킹 정책(ACT 같은)과 함께 사용되는 추론 시간 기법으로, 연속된 타임스텝의 겹치는 액션 예측을 평균화하여 더 부드럽고 일관된 동작을 생성합니다. 정책이 각 스텝에서 50개의 미래 액션을 예측하고 스텝이 40개 액션만큼 겹칠 때, 40개의 겹치는 예측이 지수 가중치로 평균화됩니다. 이는 지터를 줄이고 실행 품질을 향상시킵니다.
액션 청킹 정책(ACT 같은)과 함께 사용되는 추론 시간 기법으로, 연속된 타임스텝의 겹치는 액션 예측을 평균화하여 더 부드럽고 일관된 동작을 생성합니다. 정책이 각 스텝에서 50개의 미래 액션을 예측하고 스텝이 40개 액션만큼 겹칠 때, 40개의 겹치는 예측이 지수 가중치로 평균화됩니다. 이는 지터를 줄이고 실행 품질을 향상시킵니다.