DROID: 분산 로봇 상호 작용 데이터셋
DROID: 76K 궤도, 350시간, 86개의 작업, 564개의 실제 장면에서 프랑카 파ண்டா에서 다운로드 TFDS/HuggingFace를 통해 하룻밤 사이에 OpenVLA를 정렬합니다.
564 장면을 통해 76,000개의 실제 세계 텔레오프 궤도
TL;DR
| Metric | Value |
|---|---|
| Task count | 86 distinct task descriptions (open vocabulary language) |
| Robots | Franka Emika Panda with parallel-jaw gripper |
| Modalities | 2x Zed 2 stereo RGB-D + 1x Zed Mini wrist + language + 7-DoF joints |
| License | CC-BY 4.0 |
| Size | 76K trajectories, 350 hours, ~1.7 TB RLDS |
| Scenes | 564 real-world environments across 18 institutions |
DROID란 무엇인가?
DROID (분산 로봇 상호작용 데이터 세트) 는 스탠퍼드와 UC 버클리 주도의 18개 기관의 컨소시엄의 결과물입니다. 2024년 초에 발표된 데이터 발표는 564개의 실제 현장에서 76,000 에피소드를
DROID를 이전 실제 데이터 세트에서 구별하는 주요 설계 선택은 작업 깊이에 대한 장면 다양성에 대한 의지가 있습니다. 소규모 조작 원시물들의 수천 개의 실험을 기록하기보다는 DROID는 수백 개의 독특한 배경에서 86개의 다른 작업 설명 ( "밀을 그릇에 뿌리거나, 파묻은 커피를 지워라"와 같은 개방된 어휘어) 의 긴 꼬리를 수집했습니다. 그 결과 분포는 정책들이 기억하기 훨씬 더 어렵고 실제 배포 조건에 훨씬 더 반영됩니다.
모든 DROID 에피소드는 세 개의 스테레오 RGB-D 카메라와 함께
다운로드 및 로딩 방법
# Install TFDS + the DROID spec
pip install tensorflow_datasets rlds tensorflow
python -c "
import tensorflow_datasets as tfds
ds = tfds.load('droid', data_dir='gs://gresearch/robotics/droid/1.0.0')['train']
for ep in ds.take(1):
print(ep.keys())"
# Or stream via LeRobot
pip install lerobot
python -c "
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
d = LeRobotDataset('KarlP/droid', streaming=True)
print(next(iter(d)))"
전체 거울은 Google 클라우드 스토리지에서
일반적인 사용 사례 및 결합
- VLA 사전 훈련. OpenVLA, π0, Octo, 그리고 RT-2-X 가족 모두 훈련 전 혼합물에 DROID를 포함합니다.
- ** 단일 장면에서 정밀 조정.** 팀들은 종종 DROID에 미리 훈련하고 자신의 실험실에서 수집된 목표 작업의 ~ 50 개의 디모에 정밀 조정합니다.
- 언어 지형. 작업은 개방된 어휘 영어로 설명되기 때문에, DROID는 실제 로봇 데이터에 기반한 CLIP/VLM 지형을 평가하는 가장 좋은 공공 데이터 세트입니다.
- ** 스케일링 법 연구.** DROID의 큰 크기는 연구자들이 더 작은 데이터 세트에서 사용할 수 없는 신호인 데이터 세트 분자에 따라 성공률이 어떻게 향상되는지를 특징화 할 수 있습니다.
벤치마크 & 랭킹보드
DROID는 고정 기준이 아닌 사전 훈련 데이터로 주로 사용되지만 정책 학습 저장소는 DROID-100 분할에 대한 참조 방급 정책 및 ACT 번호를 게시합니다. 현재 결과를 위해 [DROID 코드 문서 페이지]







