Research(으)로 돌아가기

실제 로봇 데이터 플라이휠: 실제 세계 사례 연구

로봇 데이터 플라이휠이 정책 성능을 어떻게 변화시키는가? <unk> 500개의 붐드 디모에서 실제 메트릭을 통해 지속적으로 개선되는 파이프라인으로

[← 연구]

72%에서 93%까지의 성공률은 초기 컬렉션보다 53% 적은 시범을 이용한

로봇 데이터 플라이휠 은 무엇 입니까?

로봇 데이터 플라이휠은 복합 피드백 루프입니다. 시범을 수집하고, 정책을 훈련시키고, 배치하고, 실패를 수집하고, 재 훈련하고 반복합니다. 각 사이클은 마지막보다 더 적은 소외적인 노력으로 더 강력한 정책을 생성합니다. 왜냐하면 당신은 현재 정책이 보여주는 실패 모드를 정확히 목표로 하고 있기 때문에 가능한 모든 로봇 행동에서 무작위로 샘플링하지 않기 때문입니다.

네 단계가 연속적으로 반복된다: (1) ** 수집** 목표 작업에 대한 인간 시범 데이터를 수집한다; (2) ** 트레이인** 수집된 데이터에 대한 정책을 훈련하거나 정비한다; (3) ** 배포** 실제 또는 반 실제 환경에서 정책을 실행하고 모든 에피소드를 기록한다; (4) ** 내 실패** 어떤 에피소드가 실패했는지 확인하고, 교정 시범을 수집하고 훈련에 복귀한다.

이 사례 연구에서는 비행륜의 5 단계를 거쳐 실행되는 실제 픽 앤 플레이 작업이 기록되어 있습니다. 로봇: 6DOF 팔과 병렬 턱잡기. 작업: 고정된 위치에서 작은 스팀 블록을 선택하고 40cm 떨어진 버진에 배치합니다. 객체의 배치는 10cm 반경 내에 다양합니다. 모든 데이터는 [RCSV 텔레오퍼레이션 인프라] (T1) 를 통해 수집됩니다.

1단계 부트스트랩: 500개의 디모, 72%의 기본

우리는 3명의 사업자가 2일 동안 수집한 500개의 원격 시범을 시작하였습니다. 에피소드는 평균 8초였습니다. 이 데이터는 ResNet-18 시각 코더를 사용하여 전파 정책 점검점을 처음부터 훈련시키는 데 사용되었습니다.

평가 프로토콜: 허용된 반경 내에서 무작위로 표본을 배치한 100개의 실험. 블록이 완전히 버그 안에 배치되면만 실험이 성공적이라고 간주됩니다.

Phase Total Demos New Demos Added Success Rate
Phase 1 — Bootstrap 500 500 72%
Phase 3 — Failure Retrain 640 140 88%
Phase 5 — Active Learning Retrain 940 300 93%

간단한 픽 앤 플레이 작업에서 72%의 성공률은 낮다고 들린다. 실제에서는 현실적인 출발점이다. 실제 환경은 조명 변동, 지갑 착용 및 시뮬레이션 사전 훈련이 포착하지 않는 객체 표면 변동이 있습니다.

2단계 실패 광산: 140 에피소드, 두 가지 실패 유형

1단계 정책이 테스트 환경에서 1주 동안 (자동적인 출범, 인간 출현이 없다) 배치된 후, 기록된 500개의 에피소드 중 28%는 결과 분류자에 의해 실패로 분류되었다.

140개의 실패 에피소드 중 양성적 검토 후 두 개의 클러스터가 나타났습니다.

  • ** 거의 놓친 (80 에피소드):** 로봇은 블록을 성공적으로 잡았고, 쓰레기통으로 이동했지만 너무 일찍 또는 잘못된 각도로 풀어 놓았으며 블록이 부풀어 오게 되었습니다.
  • ** 완전 미스 (60 에피소드):** 로봇은 전혀 잡지 못했다 손가락 배치는 허용 반경의 극단에 블록이 배치되었을 때 일반적으로 35mm로 중앙에서 떨어져 있었다.

운영자는 RCSV 인적 검토 줄을 통해 140개의 실패 에피소드를 검토하였다. 각 실패에 대해 운영자는 실패 에피소드를 시청하고, 같은 초기 객체 위치에서 시작하여 교정 시범을 기록하였다. 이는 정책의 가장 약한 점을 직접적으로 해결하는 140개의 목표형 데모를 생산하였다.

3단계 부트스트랩 재훈련 + 실패: 88% 성공률

640개의 디모 데이터 세트를 재 훈련 (원본 500개 + 실패를 목표로 140개) 로 결합하여 성공률을 88%로 끌어올렸습니다. 140개의 새로운 디모에서 16점의 향상입니다. 비교하기 위해, 우리는 1단계에서만 88%를 달성하는 데서 관찰된 학습 곡선 기울기를 기반으로 약 400개의 추가 무작위로 수집된 디모가 필요했을 것이라고 추정했습니다.

실패를 목표로 하는 접근법은 무작위 수집보다 약 2.9배 더 샘플 효율적이어서 72%에서 88%까지의 격차를 좁혔습니다.

4단계 적극적인 학습: 불확실성 표지 모집

4 단계에서는 불확실성을 인식하는 정책으로 전환했습니다. 방출 정책은 집단 의견 충돌을 통해 암시적인 불확실성을 생성합니다.

1000 개 이상의 자동화된 출시를 통해 20% (200 에피소드) 가 높은 불확실성으로 표시되었다. 사업자들은 표시된 세트를 검토하고 추가 200 에피소드 동안 수정 시범을 수집했다. 활성 학습 기준은 이러한 디모가 실제 분포 격차를 덮어주었다.

5단계 최종 재훈련: 93%의 성공률

940개의 디모 (500개의 부트스트랩 + 140개의 실패 대상 + 200개의 활성 학습) 에서 재훈련을 실시한 결과 93%의 성공률을 달성하였다. 학습 곡선은 경험적으로 가시적으로 평평화되었다. 이 작업은 적지 않은 환경 소음 (광등 깜빡이는 것, 시간이 지남에 따라 지갑 착용) 때문에 95%에 가까운 천장을 달성하는 것으로 보인다.

비행륜 을 운행 하기 위해 필요한 인프라

플라이휠은 순전히 ML 문제일 뿐 아니라 인프라 문제입니다. 루프를 안정적으로 닫기 위해서는 다음 구성 요소가 필요합니다.

  • ** 배포 로그:** 모든 로봇 에피소드는 RGB, proprioception, 그리고 결과 메타데이터와 동기화 되어 기록되어야 합니다. 완전한 로그 없이 실패 마이닝은 불가능합니다.
  • ** 결과 분류자:** 에피소드를 자동으로 성공 또는 실패로 표시하는 빠르고 신뢰할 수 있는 분류자. 스케일에서 수동적으로 표시하는 것은 병목이다. 몇 백 개의 라벨 프레임에 훈련된 간단한 CNN조차도 많은 작업에 충분합니다.
  • 인력 검토열: 운영자 들 이 실패 한 에피소드를 시청하고 수정 시범 을 기록 할 수 있는 UI. 대기열 은 운영자 들 에게 수정 시범 시범 을 시작 하는 초기 상태 를 보여 주어야 한다. RCSV 의 [데이터 수집 플랫폼]T2) 는 이 대기열 을 표준 기능 으로 포함 한다.
  • ** 자동 훈련 트리거:** 대기열에 충분한 수의 새로운 데모가 축적되면 훈련이 자동으로 시작되어야 합니다. 수동 오케스트레이션은 루프 순차기를 깨고 있습니다.
  • ** 롤백과 함께 모델 레지스트리:** 새로운 체크포인트들은 프로모션 전에 이전 배치와 비교하여 버전을 만들어야 한다. 성공률의 회귀는 자동으로 롤백을 유발해야 한다.

주요 매트릭: 데모 효율성 곡선

이 작업 유형에서, 전체 데모와 성공률 사이의 경험적 관계는 로가리듬 곡선을 따르고 있습니다. 가장자리 수익이 급격히 떨어지는 곡선의 "목"은 간단한 픽 앤 플레이스 데모를 위해 600800 데모에 걸쳐 나타납니다. 무릎을 넘어, 추가 5%의 개선은 이전 5%의 개선만큼 35x의 데모를 필요로합니다.

이 휘두르는 이 곡선의 형태를 바꾸지 않습니다. 그것은 항상 곡선의 가장 한 부분에서 작동하는지 확인합니다. 실패 모드를 직접적으로 목표로 하는 대신, 불필요한 쉬운 시범으로 새로운 데이터를 희석합니다.

ROI 비교: 플라이휠 vs. 오프라인 컬렉션

순전히 사전 무작위 수집을 통해 93%의 성공률을 달성하기 위해, 학습 곡선에서 우리의 추출은 약 2,000 개의 디모가 필요하다고 제안합니다. 플라이휠 접근법은 93%에 도달했습니다. 전체 디모 940 개 ** 53% 더 효율적입니다**.

RCSV의 표준 수집률은 48달러 (사업 복잡성에 따라) 이며, 하나의 작업에 대한 절약은 4,240달러 (약 8,480달러) 이다. 10개의 다른 로봇 행동을 배포하는 조직에서, 플라이휠 접근법은 플라이휠 배포 후 생산되는 지속적인 개선에 대한 회계를 하기 전에 정책 발생 당 데이터 수집 비용에서 42만 달러 (약 85,000달러) 를 절약한다.

RCSV가 [데이터 수집 서비스] (T3) 또는 [Fearless Platform] (T4) 를 통해 자율 관리 데이터 파이프라인을 통해 로봇 프로그램에서 데이터 플라이휠을 구현할 수 있는 방법을 알아보세요.

데이터 플라이휠을 시작

RCSV는 초기 시범 수집부터 자동화된 실패 채굴 및 재교육 파이프라인을 위한 종합 데이터 플라이휠 인프라를 제공합니다.

[데이터 서비스를 탐구]