DROID: Verteilte Roboterinteraktionsdatenmenge
DROID: 76K-Trajektorien, 350 Stunden, 86 Aufgaben in 564 echten Szenen auf Franka Panda.
76.000 Teleop-Trajektorien in 564 Szenen
TL;DR
| Metric | Value |
|---|---|
| Task count | 86 distinct task descriptions (open vocabulary language) |
| Robots | Franka Emika Panda with parallel-jaw gripper |
| Modalities | 2x Zed 2 stereo RGB-D + 1x Zed Mini wrist + language + 7-DoF joints |
| License | CC-BY 4.0 |
| Size | 76K trajectories, 350 hours, ~1.7 TB RLDS |
| Scenes | 564 real-world environments across 18 institutions |
Was ist DROID?
DROID (Distributed Robot Interaction Dataset) ist das Ergebnis eines von Stanford und UC Berkeley geleiteten Konsortiums von 18 Institutionen, die zusammen den größten öffentlich verfügbaren Datensatz für die Manipulation von Roboter im Wild gesammelt haben. Die Datenveröffentlichung wurde Anfang 2024 angekündigt und erfasst 350 Stunden teleoperativer Interaktion mit Franka Emika Panda, die sich auf 76.000 Episoden in 564 verschiedenen Szenen der realen Welt erstreckt.
Die entscheidende Designwahl, die DROID von früheren realen Datensätzen unterscheidet, ist sein Engagement für die Szenevielfalt über die Aufgabentiefe. Anstatt Tausende von Versuchen einer kleinen Reihe von Manipulationsprimitiven aufzuzeichnen, sammelte DROID einen langen Schwanz von 86 verschiedenen Aufgabenbeschreibungen (offener Wortschatzsprache wie "Gefühl das Getreide in die Schüssel" oder "Wühlen den ausgegossenen Kaffee") über Hunderte einzigartiger Hintergründe hinweg. Die daraus resultierende Verteilung ist für die Politik viel schwieriger zu erfassen und spiegelt die tatsächlichen Einsatzbedingungen viel wider.
Jede DROID-Episode wird mit drei stereo-RGB-D-Kameras verschifft
Wie man herunterlädt und lädt
# Install TFDS + the DROID spec
pip install tensorflow_datasets rlds tensorflow
python -c "
import tensorflow_datasets as tfds
ds = tfds.load('droid', data_dir='gs://gresearch/robotics/droid/1.0.0')['train']
for ep in ds.take(1):
print(ep.keys())"
# Or stream via LeRobot
pip install lerobot
python -c "
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
d = LeRobotDataset('KarlP/droid', streaming=True)
print(next(iter(d)))"
Der vollständige Spiegel wird auf Google Cloud Storage unter
Häufige Anwendungsfälle und Paare
- VLA-Vorbildung. OpenVLA, π0, Octo und die RT-2-X-Familie enthalten alle DROID in ihrer Vorbildungssammelung
es bietet die Langschwanzszenevielfalt, die die Daten über Kreuzkörper nicht alleine liefern können. - Feinabstimmung auf einer einzelnen Szene. Teams üben häufig vorentrainings auf DROID und feine-Tuning auf ~ 50 Demo-Demos ihrer Ziel-Tasche, die in ihrem eigenen Labor gesammelt wurden.
- Sprach-Geworfen. Da Aufgaben in offenem Vokabular Englisch beschrieben werden, ist DROID der beste öffentliche Datensatz für die Bewertung von CLIP / VLM-Geworfen auf realen Roboterdaten.
- Skaling-Rechtsstudien. Die große Größe von DROID ermöglicht es den Forschern, zu charakterisieren, wie sich die Erfolgsrate mit dem Datenbestand
- einem Signal, der in kleineren Datensätzen nicht verfügbar ist - verbessert.
Benchmarks & Leaderboards
DROID wird hauptsächlich als Vor-Trainingsdaten verwendet, anstatt als festgelegte Benchmark, aber das Politisches Lernen-Repository veröffentlicht Referenz-Difusion Policy und ACT-Nummern auf der DROID-100-Spaltung. Siehe die [Papiere mit Code DROID-Seite]







