Datasets(으)로 돌아가기

오픈 엑스체체: 크로스 로봇 훈련 데이터셋

오픈 X-Embodiment: 22개의 로봇 구현과 527개의 기술에서 1M+의 궤도를 탐구. RT-X 데이터를 다운로드하고, VLA를 정렬하고, 시간 내에 크로스-인체 전송을 기준으로 한다.

오픈 X-Embodiment (OXE) 에 대한 실무자의 가이드 1M 궤도, 22 개체, 60 데이터 세트 코퍼스

TL;DR

Metric Value
Task count 160,000 tasks spanning 527 distinct skills
Robots 22 embodiments (Franka, UR5, WidowX, xArm, Google Robot, Sawyer, Kuka iiwa, and 15 more)
Modalities RGB (1-4 cameras), depth (subset), proprioception, gripper state, natural language
License Apache 2.0 for most contributions (per-subset licenses vary)
Size 1,000,000+ real-robot episodes, ~4 TB RLDS
Hosting Google Cloud Storage (gs://gresearch/robotics) and HuggingFace

오픈 X-체체란 무엇인가요?

오픈 엑스 임보디먼트 (OXE) 는 실제 로봇 시범 데이터의 분해된 세계를 하나의 훈련 전용으로 통합하는 첫 번째 진지한 시도입니다. 2023년 말 구글 딥마인드와 33개의 학술 및 산업 연구소 연합이 발표한 데이터 세트는 기존의 60개의 로봇 학습 데이터 세트를 집계하고, 모든 궤도를 표준화된 RLDS (Reinforcement Learning Data Sets) 형식으로 다시 암호화하고, 하나의 다운로드 엔드포인트 뒤에 전송합니다. 헤드라인 숫자는 1,000,000+의 로봇 궤도, 22개의 로봇 구현, 527개의 기술, 160,000개의 다른 작업입니다.

OXE의 지적 주장은 로봇은 "실험실, 로봇당" 훈련 데이터 규모에 갇혀있으며, 시각과 언어 모델은 인터넷 전체에 확장되었습니다. 구현형의 행동 및 관찰 공간을 정상화함으로써 협업은 단일 트랜스포머 RT-1-X 및 나중에 RT-2-X 이 전체 코퍼스에서 미리 훈련되어 긍정적 전송으로 새로운 로봇에 0 샷으로 전송될 수 있음을 보여주었습니다. 이것은 결국 OpenVLA, Octo, 그리고 현재 세대 VLA 기반 모델들을 생산한 결과입니다. 이 모든 모델들은 OXE (또는 _OpenX mix_라는 큐레이션 하위 집합) 를 훈련 전기 기초로 사용한다.

OXE는 단일 깨끗한 데이터 세트 (Clean Data Set) 이 아닙니다. 그것은 브리지데이터 V2 및 RT-1와 같은 대규모 텔레오퍼레이션 코퍼레이션에서 Jaco Play 및 NYU 프랭카 플레이와 같은 실험실 규모의 데이터 세트까지 다양한 소스의 조합입니다. 각 기여는 원래 라이선스를 유지합니다 (대부분은 Apache 2.0 또는 CC-BY이며, 일부는 연구용으로만 사용되며), 연구자들은 일반적으로 원본 조합에 대한 훈련보다는 실험에 따라 혼합물을 필터링합니다.

다운로드 및 로딩 방법

OXE는 Google 클라우드 스토리지에서 RLDS 셔드로 배포됩니다. 전체 4 TB를 다운로드하지 않고 개별 하위 데이터 세트를 스트리밍 할 수 있습니다.

# Install the RLDS/TFDS tooling
pip install tensorflow_datasets rlds

# List the available sub-datasets
python -c "from tensorflow_datasets.robotics import rtx; print(rtx.RTX_BUILDERS)"

# Stream the BridgeData V2 subset directly from GCS
import tensorflow_datasets as tfds
ds = tfds.load(
    "bridge",
    data_dir="gs://gresearch/robotics",
    split="train[:1000]",
)
for ep in ds.take(1):
    for step in ep["steps"]:
        print(step["observation"]["image"].shape, step["action"].shape)

# Or use the HuggingFace Parquet mirror
pip install datasets
python -c "from datasets import load_dataset; ds = load_dataset('jxu124/OpenX-Embodiment', 'fractal20220817_data', split='train', streaming=True)"

VLA를 훈련시키기 위해 대부분의 팀은 OpenVLA repo에서 가장 낮은 품질의 기여를 줄이고 배포를 재균형화하는 OpenX mix 필터 목록을 재사용합니다. 필터링 된 혼합물을 OpenVLA 또는 Octo 훈련 스크립트에 연결하면 1주 이내에 8xH100에서 공개된 체크포인트들을 재생할 수 있습니다.

일반적인 사용 사례 및 모델 조화를

  • VLA 사전 훈련. OpenVLA, RT-2-X, Octo, 그리고 Pi-0는 모두 LIBERO나 사용자 지정 컬렉션과 같은 목표 데이터 세트에 정렬하기 전에 OpenX 믹스에 사전 훈련합니다.
  • 체육 간 전송 연구. OXE는 통계적 힘으로 21개의 로봇에 훈련하고 22번째로 0샷을 평가할 수 있는 유일한 데이터 세트입니다.
  • ** 액션 공간 정상화 연구.** 최종 효과자 제어 모드의 (카르테시아 델타, 관절 속도, 지갑 바이너리) 이 다양성 때문에 OXE는 통일된 액션 토큰 시범시설이 된다.
  • ** 데이터 스케일링 법 실험.** 하위 데이터 세트가 크기가 4 순위 크기이기 때문에 OXE는 새로운 데이터를 수집하지 않고도 깨끗한 스케일링 곡선을 맞출 수 있습니다.

벤치마크 & 랭킹보드

OXE 자체는 폐쇄적인 기준이 아니라 훈련용 자료이기 때문에 하류 스위트에서 평가가 이루어진다. 이길 수 있는 정통적인 숫자는 RT-X 논문의 분포 및 크로스 인체화 성공률입니다. 구글 로봇과 와이도우X 평가 스플릿, 그리고 OpenVLA LIBERO 정밀 조정 숫자. 참고 매트릭을 위해 Code Open X-Embodiment entry, 공식 RT-X 프로젝트 페이지 및 [RT-X 문서 (arXiv:2310.08864)](T6을 참조하십시오.

기술 깊은 다이빙: RLDS 행동 공간

오픈 X-Embodiment과 작업하는 가장 어려운 부분 중 하나는 모든 기여하는 연구소가 로봇 행동을 표현하기 위해 자체 컨벤션을 가지고 있다는 것입니다. 일부 데이터 세트는 절대 공동 목표를 기록하고, 다른 사람들은 카르테시아 최종 효과 델타를 기록하고, 일부 기록 속도 명령어 및 몇 개의 기록 토크를 기록합니다. OXE 팀은 RLDS 스키마에 표준화하여 이를 해결했습니다. 각각의 에피소드는 T2 튜플의 순서이며, 각 서브 데이터셋은 자신의 T3 필드 의미론을 문서화했습니다. 일반적으로 6DoF 팔과 바이너리 지잡이 또는 2동기 기기 14 차원에서 7 차원을 가지고 있습니다.

대부분의 현대 VLA 훈련 레시피 (OpenVLA, Octo, RT-2-X) 는 데이터 세트당 정상화 및 통일된 7 차원 카르테시아 델타 액션 출력을 학습하여 이러한 이 heterogeneity를 처리하고, 평가 시정으로 네이티브 공간으로 다시 프로젝합니다. 정상화 통계는 OpenX 믹스와 함께 전송되며, 즉 새로운 하위 데이터 세트를 도입하지 않으면 직접 다시 계산할 필요가 없습니다.

관찰은 비슷하게 일률적이지 않습니다. 일부 데이터 세트는 4 개의 카메라를 가지고 있고 일부는 하나 가지고 있으며 이미지 해상도는 128x128에서 640x480까지입니다. 표준 사전 처리 트릭은 224x224로 크기를 변경하고 훈련 중에 한 단계에 한 카메라를 무작위로 선택합니다. 일부 정보를 희생하지만 훈련 파이프라인을 크게 단순화하고 단일 트랜스포머가 어떤 구현을 섭취 할 수 있도록합니다.

알려진 한계

  • ** 품질 변동.** 모든 하위 데이터 세트는 전문가의 텔레오퍼레이션이 아닙니다. 일부 기여는 혼합된 성공을 가진 자율적으로 생성된 스크립트 데이터입니다. OpenVLA 필터 목록은 품질 층에 대한 커뮤니티의 최고의 시도입니다.
  • 언어 해설 빈틈. 에피소드의 약 30%는 자연어 지침이 부족하며 VLA 사전 훈련은 일반적으로 장소 보유 토큰으로 뒤집어집니다.
  • ** 깊이의 커버리는 희소하다.** 일부 하위 데이터 세트만 깊이를 포함하고 있어 전체 3D 정책에 OXE의 유용성을 제한한다.
  • ** 라이선스 분분화.** 대부분의 기여는 Apache 2.0이지만 일부는 연구용입니다. OXE에서 상업용 제품을 정비할 계획이라면 데이터 세트 라이선스 테이블을 감사하십시오.

FAQ

OXE 전체에 훈련해야 하는가 또는 OpenX 믹스에만 훈련해야 하는가? OpenX 믹스에서 시작하면 가장 큰 소음의 기여를 줄이고 계산의 일부에서 강력한 기본선을 제공합니다. 마지막 1-2 점의 성공률을 추구하고 있다면 전 corpus를 추가하십시오.

** 훈련 전까지 얼마나 걸리나요?** OpenVLA-7B 스캔 모델에 대해 8xH100에서 약 4~7일, 또는 작은 Octo- 스캔 모델에 대해서는 1-2일.

OXE 없이도 OpenVLA를 제 데이터에 미세하게 조정할 수 있나요? OpenVLA는 미리 훈련된 체크포인트를 보내므로 처음부터 미리 훈련을 다시 실행하려면 OXE만 필요합니다.