측정 로봇 시범 데이터 품질: 주요 매트릭 및 임계
훈련 전에 로봇 원격 조작 시범의 질을 평가하는 방법 <unk> 성공률, 부드러움, 커버리지 및 다양성 측정
[← 연구]
정책 성과를 예측하는 데이터 품질 측정
양보다 질
지난 3년간 대규모 모방 학습 연구에서 가장 중요한 통찰은 데이터 품질이 약 10,000 개의 시범까지 정책 수행에 대한 데이터 양을 지배한다는 것입니다. 1,000 개의 고품질 시범의 큐레이션 데이터 세트는 행동 복제, ACT 또는 전파 정책을 훈련시키는 데 있어서 지속적으로 5,000 개의 노이즈 시범보다 더 나은 결과를 제공합니다.
이에도 불구하고 대부분의 데이터 수집 프로그램은 공식적인 품질 측정값이 없습니다.
작업 성공률
작업 성공률은 가장 중요한 단일 측정값입니다. 그것은 데이터 세트의 시범의 분량의 단지 완료된 동작이 아닌 실제로 성공적인 작업 완료를 나타내는 것을 측정합니다.
- ** 바이너리 성공:** 금 표준
인간 평론가가 각 에피소드를 보고 작성된 라브리크에 비해 통과/실패를 표시합니다. 규모가 비싸 (예산 0.10$~0.25$/ 에피소드) 하지만 가장 신뢰할 수있는 신호입니다. - 부정신용분자: 복잡한 다단계 작업에 있어서, 바이너리 레이블은 정보를 잃는다. 5점분자 (0: 완전 실패, 1: 작업 시작, 2: 핵심 중간 달성, 3: 거의 완료, 4: 완전한 성공) 은 미분 데이터 세트 구리 기능을 허용한다. 훈련 세트에 3
4 점수를 얻는 데모를만 포함한다. - ** 자동 성공 분류자:** 스케일을 위해, 500
1,000 에피소드의 수동적으로 라벨링 된 씨드 세트에 ResNet-18 또는 CLIP 기반 분류자를 훈련하십시오. 나머지 모든 에피소드에 적용하십시오. 잘 정의된 작업에 85 92%의 정확성을 달성합니다. 항상 새로운 인간 라벨링 세트에 비해 분류자의 성능을 검증하십시오.
궤도 순조함
부드러운 시범은 보다 부드러운 정책을 훈련시킵니다. 터무니없는 시범은 운영자 경험 부족, 텔레오퍼레이션 지연 또는 기계적 결합으로 인해 발생합니다.
- Jerk 메트릭: 시간적 관점에서의 위치의 세 번째 파생물. 각 궤도에 대한 RMS
을 계산하십시오. 좋은 운영자 데모는 테이블탑 조작을 위해 RMS < 2 m/s3을 가지고 있습니다. 인간 검토를 위해 RMS > 5 m/s3를 가진 플래그 에피소드. - ** 속도 변수는:** 최종 효과자 속도의 높은 변수는 (행행진 경로에 대한
의 변수로 측정) 의 의 의거와 수정을 나타냅니다. 생산 품질의 데모를 위한 목표 CV < 0.6입니다. - 공동 속도 제한: 어떤 결합이 최대 명단 속도 80%를 초과하는 에피소드를 거부합니다. 속도 제한 근처의 시범은 운영자 과잉 반응 또는 하드웨어 문제점을 나타냅니다.
작업 공간의 커버리지는
모든 사람들이 같은 길을 따르는 시위에 대한 훈련 정책은 초기 조건이 약간 다를 때 실패합니다. 작업 공간의 커버리는 해당 국가 공간을 얼마나 잘 뻗어 있는지 측정합니다.
- ** 최종 효과자 구상 껍질 부피:** 데이터 세트 전체의 모든 최종 효과자 위치의 3D 구상 껍질을 계산하십시오. 이론적 작업 작업 공간에 비교하십시오. 초기 상태의 변동이 높은 작업에 대한 커버리지는 60% 이상으로 목표로합니다.
- ** 객체 위치 커버리:** 수집 중에 객체 배치가 무작위로 이루어지면 데이터 세트의 객체 시작 위치의 분포가 의도된 범위 전체에 균일하다는 것을 확인합니다. 커버리지 히트맵 (start positions의 2D grid) 는 간격을 즉시 볼 수 있습니다.
- ** 궤도 길이의 분포:** 각 에피소드 궤도 길이의 히스토그램을 (단계로) 그려내야 한다. 분포는 유모달이어야 하며 너무 넓지 않아야 한다 (CV < 0.4).
행동 다양성
행동 다양성은 데이터 세트가 다양한 조작 전략을 포함하는지 여부를 측정합니다. 이는 예상치 못한 상태를 처리할 수 있는 교육 정책에 중요합니다.
- **행동 엔트로피:**행동 공간을 배분하고 행동 소재 배포의 엔트로피를 계산한다. 낮은 엔트로피는 대부분의 시범이 거의 동일한 행동 순서들을 따르는 것을 나타냅니다.
- 운동자별 다양성: 동일한 사업자 대 다른 사업자 사이의 모든 궤도 쌍들 사이의 쌍형 DTW 거리의 행렬을 계산한다.
- Grasp 포즈 다양성: 포착 작업에 있어서 각 디모에 대한 포착 접촉에서 포착 지향을 추출하십시오. SO (SO) (3) 영역에 대한 분포를 그려보세요. 좋은 데이터 세트는 하나의 카논िकल 톱다운 포착이 아니라 다양한 접근 각도를 포함합니다.
인간 일관성 점수
이 측정값은 사업자들 간의 시범이 얼마나 재생 가능한지 측정합니다.
- ** 사업자 간 협정:** 각 사업자별로 성공률을 계산한다. 사업자 간 차이는 (σ2의 사업자 당 성공률) 은 낮아야 한다. 높은 차이는 (σ > 0.15) 는 작업 지침이 모호하거나 일부 사업자가 재교육을 필요로 한다는 것을 의미한다.
- ** 금 표준 유사성:** 공동 궤도에서 DTW를 이용한 각 사업자의 데모를 금 표준 세트와 비교하십시오. 평균 DTW 거리가 > 2x 금 표준 중반은 재교육 후보입니다.
자동화된 품질 파이프라인 건축물
규모로 품질 평가는 자동화되어야 합니다. 권장되는 파이프라인은 각 섭취 에피소드를 네 개의 연속적인 게이트를 통해 실행합니다.
- ** 게이트 1
스케마 및 센서 검증:** HDF5 스케마를 확인하고 카메라 프레임이 비공백하다는 것을 확인하고, 자기 수용 데이터 범위를 검증합니다. 기술 결함으로 ~2 5%의 에피소드를 거부합니다. - ** 게이트 2
운동 필터:** 공동 제한 검사, 속도 제한 검사, 기간 제한. ~ 5 10%을 거부합니다. - ** 게이트 3
부드러움 필터:** RMS 크 및 속도 변동 문턱. 운영자 경험에 따라 ~5 15%를 거부합니다. - ** 게이트 4
성공 분류자:** ML 기반의 성공 예측. 전형적인 작업에 ~15 25%을 거부합니다. 분류자에 의해 표시된 모든 에피소드는 자동으로 삭제되는 대신 인간 검토 줄을 보내집니다.
알고리즘에 의한 품질 문턱
| Algorithm | Min. Success Rate | Max. Jerk (RMS) | Min. Demos (typical task) | Sensitivity to Noise |
|---|---|---|---|---|
| 행동 복제 | >85% | <3 m/s³ | 500–2,000 | High — averages modes |
| ACT (Action Chunking) | >80% | <4 m/s³ | 200–1,000 | Medium — CVAE handles multimodality |
| Diffusion Policy | >70% | <5 m/s³ | 300–1,500 | Low — diffusion models multi-modality |
| IBC (Implicit BC) | >80% | <4 m/s³ | 1,000–5,000 | Medium |
| GAIL / adversarial IL | >75% | <5 m/s³ | 500–3,000 | Low |
이러한 임계점은 보수적인 출발점입니다. 특정 작업, 로봇 플랫폼 및 환경은 경험적 캘리브레이션이 필요합니다. 품질 매트릭과 정책 성과를 함께 기록하여 어떤 매트릭이 실제로 사용 사례에 예측되는지를 식별할 수 있습니다.
RCSV 데이터 플랫폼 는 모든 섭취된 에피소드에서 이러한 품질 파이프라인을 자동으로 실행하고 데이터 세트를 검토하기 위해 매트릭 패시보드를 제공합니다.
품질 보장된 시범 자료
모든 RCSV 데이터 세트는 완전한 품질 보고서를







