Research(으)로 돌아가기

실제 세상 에서 로봇 정책 을 어떻게 평가 할 수 있습니까?

실제 로봇 정책 평가에 대한 실용적인 프레임워크: 측정, 에피소드 수, 환경 변동 및 통계적 중요성

왜 시프 측정 기구가 충분하지 않은지

시뮬레이션 성공률은 종종 실제 세계 성능으로 옮겨지지 않습니다. 조명 변화, 객체 변동, 캘리브레이션 파동, 센서 소음 모두 실제 성능에 영향을 미칩니다. 출판 가능한 결과와 배포 결정에 엄격한 실제 평가 프로토콜이 필수적입니다.

평가 프로토콜

조건마다 최소 50개의 테스트를 실행 (100개는 긴밀한 신뢰 간격으로 선호한다). 다양한 객체 인스턴스, 위치, 조명 조건 및 운영자. 윌슨 점수를 사용하여 95%의 신뢰 간격으로 성공률을 보고하십시오. 모든 실패 에피소드를 기록하고 검토하십시오. 재생가능성을 위한 환경 조건을 문서화하십시오.

  • 각 조건에 50+개의 시험
  • 적어도 3개의 객체 변동
  • 2+ 조명 조건
  • 윌슨 점수 신뢰 간격
  • 모든 시험 을 비디오 로 녹음 하는 것

흔히 발생하는 함정

리-픽팅은 쉬운 시작 구성, 실패 모드를 보고하지 않고, 모든 테스트에 동일한 객체 인스턴스를 사용하여, 조정 후 즉시 평가 (현재 조건에 적합) 를 실행합니다. RCSV의 평가 서비스는 표준화되고 재생 가능한 테스트 환경을 제공합니다.

왜 시프 측정 기구가 충분하지 않은지

시뮬레이션 성공률은 종종 실제 세계 성능으로 옮겨지지 않습니다. 조명 변화, 객체 변동, 캘리브레이션 파동, 센서 소음 모두 실제 성능에 영향을 미칩니다. 출판 가능한 결과와 배포 결정에 엄격한 실제 평가 프로토콜이 필수적입니다.

평가 프로토콜

조건마다 최소 50개의 테스트를 실행 (100개는 긴밀한 신뢰 간격으로 선호한다). 다양한 객체 인스턴스, 위치, 조명 조건 및 운영자. 윌슨 점수를 사용하여 95%의 신뢰 간격으로 성공률을 보고하십시오. 모든 실패 에피소드를 기록하고 검토하십시오. 재생가능성을 위한 환경 조건을 문서화하십시오.

  • 각 조건에 50+개의 시험
  • 적어도 3개의 객체 변동
  • 2+ 조명 조건
  • 윌슨 점수 신뢰 간격
  • 모든 시험 을 비디오 로 녹음 하는 것

흔히 발생하는 함정

리-픽팅은 쉬운 시작 구성, 실패 모드를 보고하지 않고, 모든 테스트에 동일한 객체 인스턴스를 사용하여, 조정 후 즉시 평가 (현재 조건에 적합) 를 실행합니다. RCSV의 평가 서비스는 표준화되고 재생 가능한 테스트 환경을 제공합니다.