실제 로봇 데이터 플라이휠: 실제 세계 사례 연구
로봇 데이터 플라이휠이 정책 성능을 어떻게 변화시키는가? <unk> 500개의 붐드 디모에서 실제 메트릭을 통해 지속적으로 개선되는 파이프라인으로
[← 연구]
72%에서 93%까지의 성공률은 초기 컬렉션보다 53% 적은 시범을 이용한
로봇 데이터 플라이휠 은 무엇 입니까?
로봇 데이터 플라이휠은 복합 피드백 루프입니다. 시범을 수집하고, 정책을 훈련시키고, 배치하고, 실패를 수집하고, 재 훈련하고 반복합니다. 각 사이클은 마지막보다 더 적은 소외적인 노력으로 더 강력한 정책을 생성합니다. 왜냐하면 당신은 현재 정책이 보여주는 실패 모드를 정확히 목표로 하고 있기 때문에 가능한 모든 로봇 행동에서 무작위로 샘플링하지 않기 때문입니다.
네 단계가 연속적으로 반복된다: (1) ** 수집**
이 사례 연구에서는 비행륜의 5 단계를 거쳐 실행되는 실제 픽 앤 플레이 작업이 기록되어 있습니다. 로봇: 6DOF 팔과 병렬 턱잡기. 작업: 고정된 위치에서 작은 스팀 블록을 선택하고 40cm 떨어진 버진에 배치합니다. 객체의 배치는 10cm 반경 내에 다양합니다. 모든 데이터는 [RCSV 텔레오퍼레이션 인프라] (
1단계 부트스트랩: 500개의 디모, 72%의 기본
우리는 3명의 사업자가 2일 동안 수집한 500개의 원격 시범을 시작하였습니다. 에피소드는 평균 8초였습니다. 이 데이터는 ResNet-18 시각 코더를 사용하여 전파 정책 점검점을 처음부터 훈련시키는 데 사용되었습니다.
평가 프로토콜: 허용된 반경 내에서 무작위로 표본을 배치한 100개의 실험. 블록이 완전히 버그 안에 배치되면만 실험이 성공적이라고 간주됩니다.
| Phase | Total Demos | New Demos Added | Success Rate |
|---|---|---|---|
| Phase 1 — Bootstrap | 500 | 500 | 72% |
| Phase 3 — Failure Retrain | 640 | 140 | 88% |
| Phase 5 — Active Learning Retrain | 940 | 300 | 93% |
간단한 픽 앤 플레이 작업에서 72%의 성공률은 낮다고 들린다. 실제에서는 현실적인 출발점이다. 실제 환경은 조명 변동, 지갑 착용 및 시뮬레이션 사전 훈련이 포착하지 않는 객체 표면 변동이 있습니다.
2단계 실패 광산: 140 에피소드, 두 가지 실패 유형
1단계 정책이 테스트 환경에서 1주 동안 (자동적인 출범, 인간 출현이 없다) 배치된 후, 기록된 500개의 에피소드 중 28%는 결과 분류자에 의해 실패로 분류되었다.
140개의 실패 에피소드 중 양성적 검토 후 두 개의 클러스터가 나타났습니다.
- ** 거의 놓친 (80 에피소드):** 로봇은 블록을 성공적으로 잡았고, 쓰레기통으로 이동했지만 너무 일찍 또는 잘못된 각도로 풀어 놓았으며 블록이 부풀어 오게 되었습니다.
- ** 완전 미스 (60 에피소드):** 로봇은 전혀 잡지 못했다
손가락 배치는 허용 반경의 극단에 블록이 배치되었을 때 일반적으로 3 5mm로 중앙에서 떨어져 있었다.
운영자는 RCSV 인적 검토 줄을 통해 140개의 실패 에피소드를 검토하였다. 각 실패에 대해 운영자는 실패 에피소드를 시청하고, 같은 초기 객체 위치에서 시작하여 교정 시범을 기록하였다. 이는 정책의 가장 약한 점을 직접적으로 해결하는 140개의 목표형 데모를 생산하였다.
3단계 부트스트랩 재훈련 + 실패: 88% 성공률
640개의 디모 데이터 세트를 재 훈련 (원본 500개 + 실패를 목표로 140개) 로 결합하여 성공률을 88%로 끌어올렸습니다. 140개의 새로운 디모에서 16점의 향상입니다. 비교하기 위해, 우리는 1단계에서만 88%를 달성하는 데서 관찰된 학습 곡선 기울기를 기반으로 약 400개의 추가 무작위로 수집된 디모가 필요했을 것이라고 추정했습니다.
실패를 목표로 하는 접근법은 무작위 수집보다 약 2.9배 더 샘플 효율적이어서 72%에서 88%까지의 격차를 좁혔습니다.
4단계 적극적인 학습: 불확실성 표지 모집
4 단계에서는 불확실성을 인식하는 정책으로 전환했습니다. 방출 정책은 집단 의견 충돌을 통해 암시적인 불확실성을 생성합니다.
1000 개 이상의 자동화된 출시를 통해 20% (200 에피소드) 가 높은 불확실성으로 표시되었다. 사업자들은 표시된 세트를 검토하고 추가 200 에피소드 동안 수정 시범을 수집했다. 활성 학습 기준은 이러한 디모가 실제 분포 격차를 덮어주었다.
5단계 최종 재훈련: 93%의 성공률
940개의 디모 (500개의 부트스트랩 + 140개의 실패 대상 + 200개의 활성 학습) 에서 재훈련을 실시한 결과 93%의 성공률을 달성하였다. 학습 곡선은 경험적으로 가시적으로 평평화되었다. 이 작업은 적지 않은 환경 소음 (광등 깜빡이는 것, 시간이 지남에 따라 지갑 착용) 때문에 95%에 가까운 천장을 달성하는 것으로 보인다.
비행륜 을 운행 하기 위해 필요한 인프라
플라이휠은 순전히 ML 문제일 뿐 아니라 인프라 문제입니다. 루프를 안정적으로 닫기 위해서는 다음 구성 요소가 필요합니다.
- ** 배포 로그:** 모든 로봇 에피소드는 RGB, proprioception, 그리고 결과 메타데이터와 동기화 되어 기록되어야 합니다. 완전한 로그 없이 실패 마이닝은 불가능합니다.
- ** 결과 분류자:** 에피소드를 자동으로 성공 또는 실패로 표시하는 빠르고 신뢰할 수 있는 분류자. 스케일에서 수동적으로 표시하는 것은 병목이다. 몇 백 개의 라벨 프레임에 훈련된 간단한 CNN조차도 많은 작업에 충분합니다.
- 인력 검토열: 운영자 들 이 실패 한 에피소드를 시청하고 수정 시범 을 기록 할 수 있는 UI. 대기열 은 운영자 들 에게 수정 시범 시범 을 시작 하는 초기 상태 를 보여 주어야 한다. RCSV 의 [데이터 수집 플랫폼]
T2 ) 는 이 대기열 을 표준 기능 으로 포함 한다. - ** 자동 훈련 트리거:** 대기열에 충분한 수의 새로운 데모가 축적되면 훈련이 자동으로 시작되어야 합니다. 수동 오케스트레이션은 루프 순차기를 깨고 있습니다.
- ** 롤백과 함께 모델 레지스트리:** 새로운 체크포인트들은 프로모션 전에 이전 배치와 비교하여 버전을 만들어야 한다. 성공률의 회귀는 자동으로 롤백을 유발해야 한다.
주요 매트릭: 데모 효율성 곡선
이 작업 유형에서, 전체 데모와 성공률 사이의 경험적 관계는 로가리듬 곡선을 따르고 있습니다. 가장자리 수익이 급격히 떨어지는
이 휘두르는 이 곡선의 형태를 바꾸지 않습니다. 그것은 항상 곡선의 가장
ROI 비교: 플라이휠 vs. 오프라인 컬렉션
순전히 사전 무작위 수집을 통해 93%의 성공률을 달성하기 위해, 학습 곡선에서 우리의 추출은 약 2,000 개의 디모가 필요하다고 제안합니다. 플라이휠 접근법은 93%에 도달했습니다. 전체 디모 940 개 ** 53% 더 효율적입니다**.
RCSV의 표준 수집률은 4
RCSV가 [데이터 수집 서비스] (
데이터 플라이휠을 시작
RCSV는 초기 시범 수집부터 자동화된 실패 채굴 및 재교육 파이프라인을 위한 종합 데이터 플라이휠 인프라를 제공합니다.
[데이터 서비스를 탐구]







