返回Datasets

机器人互动数据集

通过TFDS/HuggingFace下载,并在一个下午内调整OpenVLA.

现实世界76,000个视频轨迹在564场景中 最大的单臂操纵数据集和OpenVLA, π0,和Octo的正规预训练体.

Metric Value
Task count 86 distinct task descriptions (open vocabulary language)
Robots Franka Emika Panda with parallel-jaw gripper
Modalities 2x Zed 2 stereo RGB-D + 1x Zed Mini wrist + language + 7-DoF joints
License CC-BY 4.0
Size 76K trajectories, 350 hours, ~1.7 TB RLDS
Scenes 564 real-world environments across 18 institutions

DROID 是什么?

机器人交互数据集 (DROID) 是由斯坦福和UC伯克利领导的18个机构的联盟的产品,它们共同收集了最大的公开可用的野生机器人操纵数据集. 据悉,该数据发布于2024年初, 记录了350小时的远程操作的弗兰卡·艾米卡·潘达互动, 跨越了564个不同的现实场景,

区分DROID与以前的现实数据集的关键设计选择是它对场景多样性而言的承诺. 没有记录一组小的操纵原始的数千次试验,DROID收集了长尾的86个不同的任务描述 (开放的词汇语言,如"将谷物倒入碗里"或"擦掉流出的咖啡") 政策将更难记住,并且更能反映实际部署条件.

每个DROID集都配有三台立体RGB-D摄像头,两个外部安装的Zed 2单元,加上一个Zed Mini,安装在手腕上,在一致的15Hz速度下,以及Franka的7DoF联合状态,终端效果器姿势,抓住器宽度和自然语言指令. 该数据集分布在Open X-Embodiment使用的RLDS/TFDS格式中,并被在 Hugging Face上视为LeRobot格式的Parquet.

如何下载和加载

# Install TFDS + the DROID spec
pip install tensorflow_datasets rlds tensorflow
python -c "
import tensorflow_datasets as tfds
ds = tfds.load('droid', data_dir='gs://gresearch/robotics/droid/1.0.0')['train']
for ep in ds.take(1):
    print(ep.keys())"

# Or stream via LeRobot
pip install lerobot
python -c "
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
d = LeRobotDataset('KarlP/droid', streaming=True)
print(next(iter(d)))"

完全镜子在 Google 云存储器中设置在 T1下,并且可以免费输出. 100 集中的"DROID-100"样本被包装在 Hugging Face 上进行快速实验,并适合笔记本电脑.

常见使用情况和配对

  • **VLA预训练.**OpenVLA, π0,Octo和RT-2-X家族都包括DROID在他们的预训练混合物中.
  • 在一个场景上进行精细调节. 团队经常在DROID上进行预训练,并在自己的实验室收集的目标任务的约50个演示中进行精细调节.
  • **语言定位.**由于任务以开放词汇英语描述,DROID是评估基于实际机器人数据的CIP/VLM定位的最佳公共数据集.
  • ** 规模化法学研究.** DROID的巨大尺寸使研究人员能够描述数据集分数的成功率如何改善,一个信号在较小的数据集中无法获得.

基准和排名表

虽然DROID主要用于预训数据而不是固定基准,但政策学习库在DROID-100分区上发布了参考传播政策和ACT号码.查看[DROID代码的文件页面]T2) 和[项目网站]T3) 查看当前的结果.