Datasetsに戻る

DROID: 分布されたロボットインタラクションデータセット

フランカ・パンダの 564 つの実際のシーンで 76Kの軌跡,350時間,866のタスク. TFDS/HuggingFace を介してダウンロードし,午後でOpenVLA を細かく調節します.

564シーンで76,000のリアルワールドのテレオプ軌跡 最大の単腕操纵データセットとOpenVLA, π0,Octoの定例的な予備訓練コープス.

TL;DR

Metric Value
Task count 86 distinct task descriptions (open vocabulary language)
Robots Franka Emika Panda with parallel-jaw gripper
Modalities 2x Zed 2 stereo RGB-D + 1x Zed Mini wrist + language + 7-DoF joints
License CC-BY 4.0
Size 76K trajectories, 350 hours, ~1.7 TB RLDS
Scenes 564 real-world environments across 18 institutions

DROIDとは何か?

DROID (Distributed Robot Interaction Dataset) は,スタンフォード大学とUCバークレー大学が率いる18の機関によるコンソーシアムの成果で,野生のロボット操作データセットが公開されている最大規模のデータを集めました. 2024年初旬に発表されたデータリリースでは, 564つの異なる現実世界のシーンにわたる 76,000エピソードをカバーする 350時間の遠隔操作のフランカ・エミカ・パンダのインタラクションを記録しています

DROIDを以前の現実データセットから区別する主要なデザイン選択は,作業深度よりもシーン多様性へのコミットメントです. 操作原始的な小さな一連の数千の試みを記録する代わりに,DROIDは何百ものユニークな背景を介して,86の異なるタスク説明 (開かれた語彙言語"穀物を鉢に注ぐ"または"注ぐコーヒーを拭く"のような) の長い尾を集めました. 政策が記憶する方がはるかに困難で,実際の展開条件をはるかに反映する分布が生まれます.

各DROIDエピソードは3つのステレオRGB-Dカメラを搭載し 外部に搭載されたZed 2ユニットと,腕に搭載されたZed Mini1枚を15Hzの速さで配備し,フランカの7DoFの関節状態,エンドエフェクターポーズ,グリッパー幅,自然言語指示とともに搭載しています. データは,Open X-Embodimentで使用する RLDS/TFDS 形式で配布され,LeRobot 形式のパルケートとして Hugging Face に映っています.

ダウンロードと読み込み方法

# Install TFDS + the DROID spec
pip install tensorflow_datasets rlds tensorflow
python -c "
import tensorflow_datasets as tfds
ds = tfds.load('droid', data_dir='gs://gresearch/robotics/droid/1.0.0')['train']
for ep in ds.take(1):
    print(ep.keys())"

# Or stream via LeRobot
pip install lerobot
python -c "
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
d = LeRobotDataset('KarlP/droid', streaming=True)
print(next(iter(d)))"

完全鏡は Google Cloud Storage で T1 の下に置き換えられ,出出場無料です. 迅速な実験のためにHugging Face に100エピソードの"DROID-100"サンプルがパッケージ化され,ラップトップに収まる.

共通用例&ペアリング

  • VLAプレトレーニング. OpenVLA, π0, Octo,およびRT-2-Xファミリーはすべての訓練前混合物に DROID を含みます 横体体データだけでは提供できない長尾シーン多様性を提供します.
  • 単一のシーンでの精準調節* チームはしばしばDROIDで訓練し,自分の研究室で収集された目標作業の約50のデモで精準調節します.
  • 言語の基礎* 作業はオープンな語彙英語で記述されているため,DROIDは実際のロボットデータに基づいて CLIP/VLMの基礎を評価するための最良の公開データセットです.
  • スケーリング法研究. DROIDの大きさは,データセットの割れ目で データの成功率がどのように改善されるかを特徴付けることができます 信号はより小さなデータセットで利用できない.

ランキングとランキング

DROIDは,固定基準ではなく,主に訓練前データとして使用されますが,政策学習レポジトリは,DROID-100分割のDifusion PolicyとACT番号を参照して公開します.現在の結果については, Papers with Code DROID pageプロジェクトサイト を参照してください.