Research(으)로 돌아가기

로봇 데이터 수집을 10,000+ 시위에 확장하는 방법

수백에서 수천 개의 시범에서 로봇의 텔레오퍼레이션 데이터 수집을 확장하기 위한 엔지니어링 과제와 솔루션

[← 연구]

단일 역 파일럿에서 다중 실험실 함대까지 대규모 정책 훈련 데이터를 수집하기 위해 필요한 인프라, 사업자 관리 및 품질 시스템.

왜 규모 를 측정 하는 것 이 어려운 일 입니까?

200개의 시범을 수집하는 것은 공학 프로젝트입니다. 10,000개의 시범을 수집하는 것은 운영 문제입니다. 단점들은 완전히 바뀌고 있습니다. 작은 규모에서 하드웨어와 작업 규정을 디버깅하고, 큰 규모에서 운영자 처리량, 데이터 파이프라인 신뢰성, 그리고 랩 간 일관성을 관리하고 있습니다.

로봇 커뮤니티는 DROID (76,000 궤도, 22 로봇, 13 실험실) 및 Open X-Embodiment (1M+ 에피소드, 22 로봇 유형) 와 같은 데이터 세트를 구축하는 데 어려움을 겪으며 이것을 배웠습니다. 이 프로젝트들 각각은 설계에 몇 달이 걸린 특수 인프라가 필요했습니다. 이 문서에서는 작동하는 패턴을 기록합니다.

운영자 통출량 병목

데이터 수집 속도에서 가장 큰 한계점은 운영자 처리량입니다. 중간 복잡성 과제를 수행하는 숙련된 운영자 (L2L3 [기난성 스케일]T1)) 는 하루에 3080 개의 시범을 완료합니다. 8 주 (40 일일) 에 10,000 개의 시범을 달성하려면:

  • 50개의 시연/운영자/일: 5개의 사업자가 40일 동안 동시에 실행된다
  • 30개의 디모/운영자/일 (더 어려운 작업): 9개의 사업자 40일 동안
  • QA 거부에 대한 2030% 더 많은 버퍼: 12 더 많은 운영자를 추가합니다

512개의 동시 운영자를 확보하고 훈련시키고 유지하면서 품질을 높게 유지하는 것이 핵심 과제입니다. 운영자들은 기능성이 없습니다.

분산 컬렉션 아키텍처

단일 연구소 규모 (주당 200개) 를 넘어 여러 방송국이나 연구소에서 분산된 수집이 필요합니다. DROID 데이터 세트는 13개의 학술 연구소에서 동시에 실행되었습니다. 주요 건축 결정은:

  • ** 공유 데이터 호수:** 모든 연구소는 표준화된 HDF5 스키마를 사용하여 일반적인 S3 버킷에 에피소드 파일을 작성합니다. 에피소드 메타데이터 (운전자 ID, 로봇 시리즈, 시간표, 작업 ID, 성공 레이블) 는 에피소드 완료 시 원자적으로 작성됩니다. 포스트-하크 정상화를 필요로 하는 실험실 각 스키마를 피하십시오.
  • ** 하드웨어 표준화:** 모든 사이트에서 동일한 카메라 모델, 설치 위치 및 로봇 구성을 사용하십시오. 카메라 위치의 작은 차이도 (510cm) 는 사이트 간 정책 교육을 저하합니다. 캘리브레이션 프로토콜 문서를 게시하고 원격 검증 세션을 실행하십시오.
  • ** 작업 명령 프로토콜:** 사진, 객체 배치 템플릿 (라저로 잘 잘 잘 된 아크리릭 트레이) 및 올바른 & 잘못된 실행의 비디오 예제와 함께 표준화된 작업 카드.
  • ** 실시간 모니터링 대시보드:** 공유 대시보드 상의 사이트별 디모/시간, 성공률, 활성 운영자를 추적합니다. 이는 상당한 예산을 소비하기 전에 사이트 수준의 문제를 (하드웨어 오류, 운영자 혼란) 적으로 드러냅니다.

사업자 품질 관리

품질 관리는 작동 정책을 훈련시키는 데이터 세트와 그렇지 않은 데이터 세트 사이의 차이입니다. 규모로, 당신은 수동적으로 모든 에피소드를 검토 할 수 없습니다.

  • ** 금 표준 시범:** 최고의 사업자로부터 작업당 2050 "금" 디모를 수집하십시오. 이를 품질 참조로 사용하십시오. 새로운 사업자 시범 및 금 표준 사이에 자동적으로 유사점 점수를 계산합니다.
  • 간 평가 신뢰성: 주관적 성공 레이블을 위해 두 명의 리뷰어가 10%의 에피소드를 독립적으로 레이블하도록하십시오. 코헨의 카파를 측정하십시오. 목표 κ > 0.8.
  • 운영자 점수표: 주간 운영자 개개인의 성공률, 거부율 및 처리량을 추적합니다. 지속적인 거부율 > 35%의 사업자들은 재교육 또는 재임이 필요합니다.
  • 추진 구조: 품질별 보너스 (약량별 보너스) 는 운영자 들 이 급행 하는 것을 막는다. 승인 된 데모에 0.10$~0.25$의 보너스 (품질 문턱 이상) 는 데이터 품질에 대한 시간적 보상 을 능가 한다.

데이터 파이프라인 인프라

10,000+ 에피소드에서 수동적인 데이터 처리가 불가능합니다. 에피소드 캡처에서 훈련 준비된 텐서까지 자동화된 파이프라인이 필요합니다.

  • ** 에피소드 형식:** 표준화된 스키마 (관측 그룹: 카메라 이미지, 자체 수용; 행동 그룹: 공동 속도 또는 최종 효과 델타; 메타 데이터 그룹: 작업, 운영자, 시간표) 를 가진 HDF5.
  • ** 자동 검증:** 입는 순간: (1) 스케마 검증, (2) 기간 검증 (대부분의 작업에 <2s 또는 >120s 에피소드를 거부), (3) 공동 제한 위반 검증, (4) 카메라 드롭아웃 검출 (흑 프레임) 를 실행하십시오. 자동으로 거부 및 플래그.
  • ** 버전:** 데이터 세트 버전을 태그하는 데 DVC (데이터 버전 제어) 또는 사용자 지정 매니페스트 시스템을 사용하십시오. 훈련 실행은 변경되지 않는 데이터 세트 버전을 참조해야합니다.
  • ** 사전 처리:** 훈련 시는 화상 크기를 변경하고 정상화하고 증강을 원료 HDF5에서 적용해야 하며, 저장된 데이터에 넣지 않아야 합니다.

질적 필터링

좋은 운영자 관리에도 불구하고, 훈련 세트에 들어가지 않는 에피소드 중 20~40%가 있을 것입니다. 수동 검토는 몇 천 에피소드를 넘어서는 것은 아닙니다.

  • ** 성공 분류자:** 최종 프레임에서 성공/실패를 예측하기 위해 손쉽게 라벨된 5001,000 에피소드 하위 집합에 가벼운 바이너리 분류자를 (ResNet-18 또는 유사한) 훈련하십시오. 나머지 모든 에피소드에 적용하십시오. 긍정적 클래스에서 90% 이상의 정확성을 목표로합니다.
  • ** 궤도 배타자 검출:** 에피소드별 통계를 계산 (최고 관절 속속, 궤도 길, 행동 엔트로피). 배타자 표시를 위해 격리 숲이나 간단한 임계 규칙을 사용하십시오. 배타자 는 비례적으로 오류 에피소드입니다.
  • ** 다양성 샘플링:** 필터링 후, 훈련 세트가 모든 작업 변종, 객체 위치 및 운영체 스타일에서 커버리를 가지고 있는지 확인하십시오. 에피소드 임베디션에 k-미디어 클러스터를 사용하여 미흡한 지역을 식별하고 더 많은 데이터를 수집하십시오.

산업 에서 실제 숫자

Dataset Trajectories Labs / Sites Robot Types Collection Period
DROID (Stanford) 76,000 13 labs 1 (Franka) ~8 months
Open X-Embodiment 1,000,000+ 22 institutions 22 types Aggregated 2016–2023
ALOHA-2 (Stanford) 1,500 1 lab 1 (ALOHA-2) 3 months
BridgeData V2 60,000 4 lab configs 1 (WidowX) ~12 months
RoboSet (UT Austin) 20,000 1 lab 1 (Franka) 4 months

DROID 데이터 세트는 분산 데이터 수집의 금 표준 참조입니다. 그들의 [기술 보고] (T2) 는 캘리브레이션 프로토콜, 데이터 형식 및 품질 필터링 파이프라인을 상세히 기록합니다. 다중 연구소 프로그램을 구축하는 팀에서는 반드시 읽어야 합니다.

RCSV의 데이터 수집 플랫폼 는 이 문서에서 설명된 아키텍처를 구현합니다 에피소드 스트리밍, 자동화된 QA, 운영자 대시보드 및 S3 지원 버전 저장 관리 서비스로 사용할 수 있습니다.

데이터 수집 프로그램을 확장

RCSV는 50명 이상의 훈련된 운영자, 자동화된 QA 파이프라인과 관리된 인프라를 갖춘 분산 데이터 수집 함대를 운영하고 있습니다. 우리는 4~8주 안에 10K+ 시범을 제공합니다.

데이터 서비스를 탐구 →