로봇 조작 정책 평가: 엄격한 방법론 가이드
로봇 조작 정책을 엄격하게 평가하는 방법 <unk> 테스트 세트 설계, 측정기준, 환경 통제 및 통계적 중요성
[← 연구]
엄격한 평가 는 실제 진전을 실험실 과장 장비 로부터 분리 한다. 이 가이드 는 실험 집합 설계, 측정, 통계 요구 사항 및 조작 정책 에 대한 보고 표준 을 다루고 있다.
평가 하는 것 이 어려운 이유
조작 정책 평가는 속임수적으로 어렵습니다. 정책은 훈련받은 정확한 객체와 조명 조건에서 95%의 성공을 달성 할 수 있지만, 하나의 변수가 ** 실험실 과잉 부착**이라는 현상을 변화시키면 완전히 실패합니다. 정책은 일반화하는 것을 배우는 것이 아니라 테스트 환경을 기억합니다.
핵심 문제는 연구자들이 훈련과 평가 모두 동안 너무 많은 변수를 제어한다는 것입니다. 같은 카메라 위치, 같은 테이블 높, 같은 방향의 동일한 객체
엄격한 평가에는 의도적으로 수립된 조건이 필요합니다. 훈련 중에 볼 수 없는 물체, 데이터 수집 중에 사용되지 않은 조명, 훈련 설정과 의도적으로 다른 테이블 높이가 있습니다. 이러한 조건에서 귀하의 정책이 크게 저하되면, 당신은 능력을 측정하지 않고 기억력을 측정했습니다.
평가 차원
완전한 조작 평가에는 3가지 주요 차원이 포함됩니다.
- ** 성공률**
바이너리 (task completed/not complete) 와 부분 신용 모두. 바이너리 성공은 계산하기 쉽지만 정보를 버리는 것입니다. 신뢰성 있는 방법으로 올바르게 파악하지만 전송 중에 떨어지는 정책은 안정적인 파악을 달성하지 못하는 것과는 다른 점수를 얻습니다. 테스트를 실행하기 전에 부분적인 신용 항목을 정의하십시오. - ** 효율성**
작업 완료 시간 (초), 인적 개입이 필요한 수, 재취득 시도의 수. 45 초에 성공한 정책은 3 분에 성공한 정책보다 더 성공합니다. 개입은 특히 중요합니다. 작업에 2 번의 개입이 필요한 정책은 90%의 성공에도 적용되지 않습니다. - ** 강도**
시험 간 차이는 (차원의 변수), 새로운 조건 (새로운 물체, 새로운 조명, 새로운 오더러) 와 우아한 퇴화. 80%의 평균 성공, 40%의 표준차이는 75%의 평균과 5%의 표준차이는 보다 덜 유용하다.
시험 세트 설계
테스트 세트 설계는 대부분의 평가 프로토콜이 실패하는 곳입니다. 선택과 장소 작업에 대한 엄격한 최소:
3 새로운 조명 조건 × 2 테이블 높이가 × 5 새로운 물체 × 3 디스트랙터 구성 = 90 시험 조건 최소.
신규 조명은 훈련 데이터 수집 중 사용되지 않는 조명 설정을 의미합니다.
각 테스트 조건에 대해, 각 조건에 대한 성공률을 추정하기 위해 최소 5개의 테스트를 실행하십시오. 이것은 90 조건 매트릭스에서 총 450개의 테스트를 제공합니다. 모든 테스트를 기록합니다.
메트릭스 테이블
| Metric | Definition | How to Measure | Deployment Threshold |
|---|---|---|---|
| Binary success rate | Task completed without intervention (%) | Human observer scores each trial | ≥ 80% on novel objects |
| Partial credit score | Weighted sub-task completion (0–1) | Rubric-based scoring per phase | ≥ 0.85 mean score |
| Time to completion | Wall-clock seconds from start signal | Automated timer, log per trial | ≤ 2× human baseline |
| Intervention rate | Human resets per 100 trials | Count interventions per session | ≤ 5 per 100 trials |
| Novel object transfer | Success on held-out object set (%) | Separate test set, never in training | ≥ 60% (generalization) |
| Robustness variance | Std dev of success across conditions | Per-condition trial average | CV ≤ 0.20 |
통계적 요구 사항
한 번의 실험은 아무것도 증명하지 않습니다. 통계적으로 의미있는 결과를 위한 최소한의 실험은
N = 100개의 실험 성공률에 대한 ±10퍼센트 포인트 신뢰 간격 (95% 신뢰, 쌍명 분포) 에 대해.
알고리즘 비교 (예를 들어, "우리 방법 vs ACT 기본 라인") 를 위해, 일치하는 시험 조건에서 쌍 t 테스트를 사용하십시오. 같은 날, 같은 환경에서 동일한 조건에서 두 알고리즘을 실행하십시오. p 값, 효과 크기와 신뢰 간격 (코헨의 d) 을보고합니다.
다 조건 평가에서, 무작위 효과로 조건이 있는 혼합 효과 모델을 사용하십시오. 이것은 모든 실험을 독립적으로 취급하는 대신 조건 간 체계적인 변이를 설명합니다.
환경 통제
물리학은 일정하지 않습니다. 작은 환경 변화는 대부분의 연구자들이 가정하는 것보다 더 반복성에 영향을 미칩니다.
- ** 카메라 위치 로그**
테이프 또는 고정된 브래크셋으로 정확한 마운팅 포인트를 표시합니다. 2cm 카메라 시퀀스는 입력 분포를 측정할 정도로 변화시킵니다. - 광기록
각 세션 전 작업 공간 표면에서 광의 수준을 기록합니다. 창문 통한 자연광은 하루 동안 5000~10000 광의 조명을 변경합니다. 블랙아웃 커튼을 사용하거나 인공 조명에서만 테스트를 실행하십시오. - 온도 로그
고무 잡기 표면은 온도와 함께 딱딱함을 변화시킨다. 18°C 대 28°C에서, 같은 잡기 손가락은 측정 가능한 다른 접촉력을 생성한다. - 물질 배치 프로토콜
정확한 배치 영역을 정의합니다 (예를 들어, "표준된 목표의 반경 5cm 이내에 있는 객체 중심, 무작위 방향"). 무작위 배치는 변형을 도입하고, 배치-무한 프로토콜은 실험을 비교할 수 없습니다.
평가를 하는 데 있어서 흔히 발생하는 실수
- ** 훈련 객체에서 테스트**
가장 흔한 오류. 훈련 데이터 ( 같은 SKU, 같은 색상) 에 어떤 시험 객체가 나타났다면, 성공률은 기억을 측정합니다. 데이터 수집 시작부터 엄격한 유지된 객체 집합을 유지하십시오. - ** 단일 조명 상태**
거의 모든 출판된 조작 결과들은 단일 조명 설정을 사용한다. 이것은 정책들이 실제보다 훨씬 강해 보이게 한다. - 20건 이하의 실험**** 통계적으로 의미가 없는 정책. 4/5번 성공한 정책과 14/20번 성공한 정책은 초복되는 신뢰 간격이 있습니다.
- **
리 선택된 시범법** 보고해야 하는 실험을 선택하거나 결과가 좋은 것처럼 보이는 경우 일찍 중단합니다. 실험을 실행하기 전에 평가 프로토콜을 미리 등록하십시오. - 평가자 편견
실험을 수행하는 연구자는 어떤 조건이 "더 나은" 알고리즘인지 알고 있습니다. 가능한 경우 맹인 평가 또는 최소한의 자동 성공 검출을 사용합니다.
보고기준
완전한 조작 평가 보고서는 다음과 같다: (1) 객체 사진과 상태 매트릭스와 함께 테스트 집합의 완전한 설명, (2) 조건별 실험 수, (3) 보고된 모든 측정값에 대한 신뢰 간격, (4) 비교를 위한 통계적인 테스트 결과, (5) 환경 조건의 기록, (6) 대표적인 성공 및 실패 사례의 비디오, (7) 실패 모드 분류.
평가 데이터와 코드를 공유하세요. 조작 연구에서는 재현 가능성은 낮습니다. 원료 시험 로그와 평가 스크립트를 제공하면 다른 사람들이 처음부터 재시행하는 대신 여러분의 작업에 기반을 둔다.
RCSV 데이터 플랫폼 는 구조화된 평가 기록, 자동화된 시험 점수 및 조작 정책 벤치마킹을 위한 표준화된 보고서 템플릿을 제공합니다.
RCSV 인프라에 대한 엄격한 평가 수행
표준화된 평가 환경, 자동화된 시험 기록 및 통계 보고 도구에 액세스하십시오. 공유 테스트 세트에 게시된 기본 라인들에 대한 정책 비교를하십시오.
[수입 평가 플랫폼]







