Datasets(으)로 돌아가기

로보넷: 오리지널 크로스 로봇 비디오 코퍼스

로보넷을 탐험하세요: 7개의 로봇과 4개의 실험실에서 15M의 비디오 프레임을 다운로드하여 비디오 예측과 시각적 예시 모델을 훈련하고 1 주말에 크로스-로봇 전송을 기준으로 합니다.

로보네트의 실무자 가이드 15백만 프레임, 7 로봇, 4 연구소 데이터 세트

TL;DR

Metric Value
Frame count ~15,000,000 RGB video frames
Robots 7 (Sawyer, Baxter, WidowX, Kuka iiwa, Franka, Fetch, Widow200)
Modalities RGB video (1-4 cameras), Cartesian delta action, proprioception, gripper
License MIT
Institutions 4 labs (Penn, Stanford, UC Berkeley, CMU)
Original paper CoRL 2019 (Dasari et al.)

로보넷이란 무엇인가?

로보네트는 매우 구체적인 질문에 답하는 첫 번째 진지한 시도였습니다. 여러 연구소가 자율적으로 수집된 로봇 비디오를 공유한다면, 하나의 비디오 예측 모델이 로봇과 환경에 걸쳐 일반화될 수 있을까요? 수디프 다사리와 펜실베니아, 스탠퍼드, UC 버클리, CMU의 협력자들은 7개의 다양한 로봇 플랫폼에서 15백만개의 비디오 프레임을 합쳐 통합된 HDF5 스키마를 사용해서 2019년에 주목할 만한 성과를 거두었습니다.

중요한 것은 RoboNet은 언어 조건으로 조작된 데이터 세트가 아니라 video prediction 데이터 세트입니다. 대부분의 에피소드는 자율적으로 수집됩니다. 그 디자인 선택은 로보넷을 수년간 스토카스틱 비디오 모델 (SVG, SVP, SV2P), 시각적 예시 계획자 및 세계 모델 기반 제어의 기준 기준으로 만들었습니다. 그리고 그것은 현재 분야가 크로스 로봇 액션 조건 예측에 대해 생각하는 방식을 형성했습니다.

로보넷은 이후 오픈 X-Embodiment과 DROID가 원자 크기로 을 치르지만, 여전히 가장 깨끗하고 가장 작고 교육적으로 가장 유용한 크로스 로봇 데이터 세트이다. 그 스케마 카르테시아 델타 액션, 각 로봇 구현 태그, 64x64 또는 128x128 RGB 은 여전히 단일 GPU에서 크로스 로봇 비디오 예측 기반을 세우는 가장 쉬운 것입니다.

다운로드 및 로딩 방법

카논िकल 배포는 RoboNet 위키에 있는 HDF5 셔드의 집합으로, 참조 GitHub 레포를 통해 TFRecord 거울을 전송한다:

# Pull the reference code
git clone https://github.com/SudeepDasari/RoboNet.git
cd RoboNet && pip install -e .

# Download the HDF5 shards (see https://www.robonet.wiki/ for bucket URLs)
python robonet/datasets/download_robonet.py --output_dir ./data

# Load episodes with the built-in reader
from robonet.datasets.robonet_dataset import RoboNetDataset
ds = RoboNetDataset(
    batch_size=32,
    dataset_files=["./data/*.hdf5"],
    hparams={"img_size": [64, 64], "load_random_cam": True},
)
for batch in ds:
    print(batch["images"].shape, batch["actions"].shape, batch["states"].shape)

프레임이 작기 때문에 (64x64 또는 128x128) 그리고 액션 벡터는 짧기 때문에 RoboNet은 단일 소비자 GPU에서 의미있는 실험을 실행할 수 있는 드문 로봇 데이터 집합 중 하나입니다.

일반적인 사용 사례 및 모델 조화를

  • ** 비디오 예측 기본 라인.** SVG, SVP, FitVid 및 원래의 시각 예측 스택은 모두 로봇 간 참조로 RoboNet을 사용합니다.
  • 세계 모델 기반 제어. 쌍용 액션/관측 순서로, 그것은 다체체 설정에서 드레머 스타일의 세계 모델에 대한 자연적인 시험용판이 된다.
  • 신체 인코더 연구. 모든 은 로봇 ID로 표시되어 있기 때문에, RoboNet은 새로운 팔에 전송되는 인체 인코더를 학습하는 깨끗한 목표입니다.
  • 교통/과정 작업. 작은 프레임 크기와 깨끗한 HDF5 스키마는 RoboNet를 대학원 로봇 학습 수업의 기본 데이터 세트로 만듭니다.

벤치마크 & 랭킹보드

폐쇄된 순위표가 없지만, 표준 평가는 PSNR/SSIM/LPIPS입니다. 10 단계 미래 프레임 예측은 수직한 액션 순서로 조건화되어 있으며, 보이는 로봇과 보이지 않는 로봇에 대해 별도로 보고됩니다. 참조 번호를 위해 [Code RoboNet 항목을 가진 문서] (T1), [공식 위키] (T2), [다사리 et al. CoRL 2019 문서] (T3) 를 참조하십시오.

기술 깊은 다이빙: 카르테시아 델타 액션 및 실시예 ID

로보네트의 액션 표현은 2019년에 비정상적으로 야심찬 것이었다. 원료 공동 목표 또는 모터 명령어를 기록하기보다는 (모든 로봇마다 차이가 있을 것) 작가는 모든 액션을 5차원 카르테시아 델타에 지도했습니다. xyz 번역과 yaw 회전과 바이너리 지리퍼 비트. 피치 앤 롤은 대부분의 기여 로봇이 컬렉션 설정에서 위에서 아래로만 잡을 수 있었기 때문에 고정되었습니다. 이 정상화는 단일 비디오 예측 모델을 일곱 가지 다른 팔의 행동에 조건화 할 수 있게 해줍니다.

각 궤도는 정책이 무시할 수 있는 정수 실시예 ID로 표시되어 있습니다 (일반적인 크로스 로봇 모델을 배우기 위해) 또는 조건 (로봇 특정 동적을 활용하기 위해). 후자의 접근 방식은 학습된 실시예 임베디션 이 후속 문학에서 지배적인 패턴 중 하나가 되었고 Octo에서 사용되는 데이터 세트 임베디션과 OpenVLA에서 동작 정상화 계획에 직접적으로 영감을 주었다.

비디오 프레임은 낮은 해상도 (64x64 또는 128x128 분자에 따라) 를 저장하여 비디오 예측 기본 라인이 원료 하드웨어에서 실행될 수 있도록 특별히 저장됩니다. 더 높은 해상도 영상이 필요한 경우, 오픈 X-Embodiment 및 DROID은 모두 완전한 해상도 RGB를 선보이며 현대 비전 중력 파이프라인을 선호해야합니다.

알려진 한계

  • 저 해상도. 64x64 또는 128x128 프레임은 현대 픽셀 기반 정책에 사용할 수 없습니다. 로보넷은 생산 시스템 훈련 대상이 아니라 역사적 참조입니다.
  • 자동적인 (전문가 아닌) 데이터. 대부분의 궤도는 무작위 탐구이기 때문에, 로보네트는 모방 학습에 적합하지 않습니다.
  • ** 위에서 아래로 동작 공간만.** 5DoF 정상화는 윙크와 롤을 떨어뜨립니다.
  • 언어 해설이 없습니다. 에피소드는 로봇 및 환경 ID로 태그되어 있지만 자연어에는 없습니다. 따라서 RoboNet은 언어 조건 정책을 미리 훈련시킬 수 없습니다.

FAQ

RoboNet은 2026년에 여전히 사용이 가치가 있습니까? 네, 두 가지 이유로: 그것은 여전히 크로스-임체 비디오 예측을 위한 최고의 교육 데이터 세트이며, 그 작은 크기는 오픈 X-임체에서 너무 비싸게 될 수 있는 압축 연구에 이상적입니다.

RoboNet은 오픈 X-Embodiment과 어떻게 비교할 수 있습니까? OXE는 50-100배 더 크고 전문가의 시범을 포함하고 언어 해설을 배포합니다.

현대 액션 레이블 데이터 세트와 로보넷을 결합할 수 있습니까? 실시예 태그된 액션 스키마는 대부분의 현대 VLA 훈련 스택과 소형 어댑터 코드와 호환됩니다.