Glossary(으)로 돌아가기

정책 롤아웃

EvaluationPolicy

정책 롤아웃은 훈련된 정책을 로봇(또는 시뮬레이션)에서 초기 상태부터 작업 완료 또는 타임아웃까지 실행하는 단일 에피소드입니다. 롤아웃은 정책 성능 평가, 추가 훈련을 위한 새로운 데이터 수집(DAgger 또는 RL 미세 조정에서처럼), 실패 모드 디버깅에 사용됩니다. 안정적인 성공률 추정을 위해 필요한 롤아웃 수는 작업 변동성에 따라 다릅니다 — 높은 분산 작업은 안정적인 성공률 추정을 위해 50회 이상의 롤아웃이 필요할 수 있습니다. 연구에서 롤아웃은 종종 초기 조건(분포 내 vs. 분포 외 객체/장면)으로 분류되어 일반화를 특성화합니다. 실제 적용 사례: 우리의 실제 평가 →

Related terms