Datasets(으)로 돌아가기

브리지데이터 V2: 버클리의 확장 가능한 조작 코퍼스

BridgeData V2: 60,096 24개의 환경과 13개의 기술을 통해 WidowX 궤도를 다운로드 합니다. 언어 조건 정책 및 벤치마킹 일반화를 1일 이하에서 훈련합니다.

브리지데이터 V2에 대한 실무자의 가이드 UC 버클리의 RAIL 연구소에서 60,096 궤도 WidowX 데이터 세트에서 브리지 훈련 VLA, 오크토 미세조음, 그리고 오픈X 믹스를 작동시킵니다.

TL;DR

Metric Value
Task count 13 skills across ~100 task variants
Robots WidowX 250 6DOF arm (consumer-grade, ~$6K)
Modalities RGB-D (Intel RealSense), proprioception, gripper, language instruction
License CC-BY 4.0
Size 60,096 trajectories, ~400 GB raw
Environments 24 scenes including toy kitchens, sinks, and tabletops

브리지데이터 V2는 무엇입니까?

브리지데이터 V2는 UC 버클리의 로봇 인공지능 및 학습 연구소 (RAIL) 에서 2021년 개봉한 BridgeData의 후속이다. 호머 워크, 프라나브 아트레야, 그리고 세르게이 레바인의 공동작가들에 의해 만들어졌으며, 이 질문의 답은 매우 간단합니다. 하나의 조작 정책은 환경 특유의 조정이 없이 수십 개의 환경과 기술을 통해 자연어 지침을 따르도록 배울 수 있을까요? 이에 대한 답변을 위해 RAIL 팀은 24개의 장면에서 60 096개의 시범을 통해 저렴한 비용의 WidowX 250 6DOF 팔을 원격으로 작동시켰으며, 픽 앤 플레이스, 푸싱, 스파이닝, 스택링, 폴딩, 드래저 오픈, 그리고 다른 여러 기술을 포함했습니다.

브리지데이터 V2가 비례적으로 영향력을 행사한 두 가지 설계 결정. 첫째, 모든 궤도는 크라우드소싱 자연어 명령어와 해고되어 있습니다. 고정 작업 ID가 아닙니다. 즉 브리지에서 훈련된 정책은 추론 시 자유 형태의 텍스트에 조건화 될 수 있습니다. 둘째, 6,000달러의 WidowX 팔 (프랑카나 UR5) 를 선택하면 하드웨어 비용이 충분히 낮아 수십 개의 후속 연구소가 설정을 재현할 수 있게 되었으며, 데이터는 저렴한 조작 연구의 실질적인 표준이 되었습니다.

브리지데이터 V2는 현재 오픈 X-Embodiment 믹스에 가장 큰 개인 기여 중 하나이며, 산업 하드웨어를 소유하지 않고 실제 결과를 보여주고 싶은 논문에서 가장 인기있는 미세 조정 목표입니다. OpenVLA, Octo 및 여러 디스푸전스 정책 변종은 브리지데이터 V2 번호를 실제 실제 결과로 발표합니다.

다운로드 및 로딩 방법

데이터 세트는 버클리에서 NumPy 셔드와 오픈 X-Embodiment 버킷을 통해 Google 클라우드 스토리지에서 RLDS로 배포됩니다.

# Raw NumPy shards (~400 GB)
wget -r https://rail.eecs.berkeley.edu/datasets/bridge_release/data/demos_8_17.zip
unzip demos_8_17.zip

# Or stream the RLDS copy from OXE (recommended for VLA training)
pip install tensorflow_datasets
import tensorflow_datasets as tfds
ds = tfds.load("bridge", data_dir="gs://gresearch/robotics", split="train")
for ep in ds.take(1):
    for step in ep["steps"]:
        print(step["observation"]["image_0"].shape,
              step["observation"]["state"].shape,
              step["action"].shape,
              step["language_instruction"])

# Install the reference training stack
git clone https://github.com/rail-berkeley/bridge_data_v2.git
cd bridge_data_v2 && pip install -e .

OpenVLA 또는 Octo를 정렬하려면 OpenX 믹스에서 T1로 구성을 가리키고, 하나의 8xA100 노드에 게시된 결과를 재생할 수 있습니다.

일반적인 사용 사례 및 모델 조화를

  • 저비용 VLA 평가. BridgeData V2는 OpenVLA와 Octo 에 대한 기본 실제 세계 정형 조율입니다. 새로운 VLA는 Bridge 번호를 공개해야 심각하게 받아들여야 합니다.
  • 언어 조건 정책. 자유형 명령어 해설은 명령어를 따르는 연구의 데이터 세트를 이용하는 데 도움이 됩니다.
  • ** 일반화 연구.** 같은 기술이 24개의 환경에서 반복되기 때문에, 장면을 쉽게 내세워서 무사한 장면을 일반화하는 것을 측정할 수 있습니다.
  • 방송 정책 기본 라인. ~ 4,000 에피소드 한 기술 지도는 교육과정 트릭 없이 방송 및 변환 정책에 깔끔하게 적용됩니다.

벤치마크 & 랭킹보드

브리지데이터 V2 평가는 일반적으로 유지된 언어 명령어 집합에 내포된 성공률, 그리고 새로운 객체 / 신작 장면 조합의 집합에서 내포된 성공률으로 보고된다. OpenVLA는 내포된 70%와 40-50% OOD 성공률을 보고한다. Code BridgeData V2 항목을 가진 문서RAIL Lab 프로젝트 페이지 를 참조하여 정통적 평가 프로토콜을 참조하십시오.

기술 깊은 다이빙: 스케마 및 행동 공간

브리지데이터 V2 에피소드는 각 궤도 디렉토리로 저장되며, 각에서는 파이썬의 관찰 조각과 각 단계 RGB 프레임과 언어 지침이 포함되어 있습니다. 관측은 5 Hz (WidowX 텔레오퍼레이션 루프 속도) 에서 기록되며 두 개의 RGB 스트림 3인 장면 카메라 및 어깨 위에 손목 카메라 와 함께 인텔 리얼센스 깊이 ( 장면의 하위 집합), WidowX 6 차원 최종 효과자 포지 및 바이너리 지잡기 상태를 포함한다.

액션은 7차원: 카르테시아 델타 최종 효과자 위치 (xyz), 카르테시아 델타 지향 (rpy), 그리고 기 가동자 개/폐지. 액션 주파수가 5 Hz이기 때문에 BridgeData V2 정책은 4-8 단계의 액션 덩어리 훈련이 되어 있으며, 이는 디스포지션 정책의 표준 덩어리 크기에 잘 맞습니다. 낮은 제어율은 데이터 수집에 대한 축복 (텔레오퍼레이터들은 느린 속도로 더 높은 성공률을 달성) 그리고 역동적인 작업에 대한 가벼운 저주 (데이터셋은 100ms 이하의 반응적 제어가 필요한 모든 것에 적합하지 않습니다).

언어 지침은 아마존 메카니컬 터크를 통해 크라우드소싱됩니다. 작업자들은 각 궤도를 관찰하고 작업의 자연어 설명을 작성했습니다. 즉 명령에는 타이퍼, 동의어 및 변구들이 포함됩니다. 이 노이스는 실제로 기능입니다.

알려진 한계

  • ** 단일 실시예.*** 모든 60K 궤도는 WidowX 250에 있습니다. 브릿지 훈련 정책을 프랭카 또는 UR5로 전송하려면 크로스 실시예 정교화가 필요합니다.
    • 테이블 표 편향.** 각본 은 모두 대략 세탁, 오븐, 또는 책상 높이 의 테이블 표 입니다. 바닥 조작, 수직 표면, 이동식 조작 은 분포 되지 않습니다.
  • 저한 동작 속도. 5 Hz는 준정형 조작에 적합하지만 붓거나 잡는 것과 같은 역동적인 작업에 충분하지 않습니다.
  • ** 성공 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피소드 에피가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가가

FAQ

** BridgeData V2를 사용하기 위해 WidowX가 필요합니까?** 단지 폐쇄적 실체 평가를 하고 싶다면만. 많은 그룹은 브리지에서 훈련하고 시뮬레이션 또는 다른 팔에서 크로스 인체 전송을 통해 평가합니다.

BridgeData V2는 BridgeData V1과 어떻게 관련되어 있습니까? V2는 대략 4배 더 크고, 12개의 새로운 장면을 추가하고, 더 깨끗한 설정으로 대부분의 V1 작업을 다시 원격으로 처리하고, 각 에피소드마다 언어 해설을 전송합니다 (V1는 단지 하위 집합에만 가지고있었습니다).

** BridgeData V2를 내 WidowX 데이터와 결합할 수 있나요?** 네 이 스키마는 잘 문서화되어 있으며, 여러 제3자 교육 파이프라인은 드롭-인 믹싱을 지원합니다.