Datasetsに戻る

オープンX-エンボディメント対ドロイド:どのロボットデータセットを使用すべきか

オープンX-Embodiment vs DROID:軌道のスケール,実施形態,データフォーマット,ライセンス,トレーニング計算を比較する. 2026年に適切な基礎モデルロボットデータセットを選択します.

オープンX-EmbodimentとDROIDは2026年に最大規模のオープンロボット学習データセットである.設計スペクトルの反対端に位置する:オープンX-Embodimentは,異なるロボットタイプ22の33の研究ラボから組み立てられた連邦メガコープです. 調整を調整する際の 調整を調整する際の 調整を調整する際の 調整を

TL;DR

  • 原軌跡数: オープンX-エボディメントは1M+エピソードとDROIDの76Kを勝ち取った.
  • 体体多様性: オープンX-Embodimentは 22種類のロボットと DROIDのシングルフランカ・パンダとの対戦で勝利.
  • 軌道の様相多様性: DROIDは一貫したセンサーを搭載した13の機関で 564枚のシーンを獲得しました.
  • データ一貫性: DROIDは大きな差で勝利します hardware,カメラリグ,エピソード形式が同じです.
  • 政策の訓練の容易さ: DROIDは勝利する 異体化行動の正常化は必要ありません.
  • **基礎モデルを簡単に訓練する:**オープンX-Embodiment RT-Xが構築されたものです.

比較表

Attribute Open X-Embodiment DROID
Released Oct 2023 (Google DeepMind + 33 partners) Mar 2024 (Stanford / UC Berkeley / TRI + 13 partners)
Trajectories 1,000,000+ episodes ~76,000 trajectories (~350 hours)
Embodiments 22 robot types (Franka, Google Robot, xArm, WidowX, UR5, etc.) 1 (Franka Emika Panda with parallel-jaw gripper)
Scenes / environments Mix of labs and uncontrolled environments 564 scenes across 13 institutions
Collection duration Aggregate of many prior datasets (years) ~18 months of coordinated collection
Cameras Varies by source dataset 2x ZED 2 stereo + 1x ZED Mini wrist (consistent)
Format Unified RLDS (TensorFlow Datasets) RLDS + HDF5; also on HuggingFace / LeRobot
Approx. size on disk Multiple TB (varies by component) ~1.7 TB raw
License Per-component (mostly CC-BY and Apache-2.0) MIT + CC-BY-4.0
Reference models RT-1-X, RT-2-X, OpenVLA, Octo DROID diffusion policies; used by pi0, OpenVLA fine-tunes
Paper arXiv:2310.08864 arXiv:2403.12945

デザイン哲学のギャップ

オープンXエンボディメント (OXE) はスケーリング実験として考案されました. オープンXエンボディメント (OXE) のすべての操作データセットを標準化されたフォーマットにまとめると,22種類のロボットに転送する単一のポリシーを訓練できますか? RT-1-Xと RT-2-Xが示すように,答えは慎重にイエスでした.OXEは,クレーティング基準ではなく _pretraining corpus_として最もよく理解されます. 軌跡は質量,カメラリグ,照明,アクション周波数,グリッパーコンベンションに大きく異なる.それらを消費するには,共有されたRLDSスキーマを通じて注意深く正常化する必要があります.

DROIDは異なったデータを集めるのではなく,単一のハードウェアリグを標準化した (フランカ・パンダ,シーンのためのZED2カメラ,2手首に搭載されたZEDミニ) を13の研究機関に送った.約18ヶ月間,これらの研究室はオフィス,キッチン,ラボ,廊下,家庭で約76,000の野生の軌道を収集した. 軌道各には同じ観測形,同じ行動コンベンション,同じ言語の注釈形式があります.これは DROIDをOXEよりも訓練するのがはるかに簡単で,よりクリーンな細かな音で報いします.

訓練する時間

OXE の 訓練 初期 訓練 は,単一の実施データ セット が 解き放つ 行動 を 証明 する 存在 証拠 の 証拠 です.

** DROID に 精準な調節を施す.もし**あなたのターゲットハードウェアが Franka Panda またはほぼ相当の7DoF 腕である場合,またはあなたが拡散ポリシーを訓練している場合,一貫したグリッパーセマニクスを持つ高品質のアクションラベルを希望します.

計算能力があれば両方してください. 現在標準的なレシピは"OXEプレトレイン,DROIDフィーナティューン,タスクデモフィーナティューン-2." これは[pi0と数 2025の人類型の政策]T4) が使用したもので,2026年に標準を設定し続けています.

訓練に必要な計算

OXEのプレトレーニングは,OvenVLAスケール (7Bパラメータ) で最初64 A100 GPUを約2週間使用した.これは,公のクラウドで$100Kの順序で実際の資本コストです.プレトレーニングされたチェックポイントを調整したい場合は,一日または2日間,単一の8xA100または8xH100ノードが典型的です. DROIDのフィーナティューンは1~4GPUで実行できる.データセットがはるかに小さいため,多くのチームは単一の8x3090作業台で完全な DROIDの拡散ポリシーを訓練します.

結論として,両方のデータセットは消費者のGPUで快適に実行されるポリシーを生成します.特定の研究理由がない限り,データセットの両方でゼロからトレーニングすることをお勧めしません. HuggingFaceの予備訓練されたチェックポイントは非常に強力な出発点です.

ライセンス:細かい文字を読む

OXEは単一のライセンスではありません.各項目のコンポーネントデータセットのレジストリです.ほとんどのコンポーネントはCC-BY-4.0またはApache-2.0です.つまり,商業モデルを訓練し,衍生品の重荷を輸送することができます.いくつかのコンポーネントは研究目的のみです.製品を作っている場合は,法的姿勢に応じてコンポーネントリストを監査してください. DROIDはデータに直接的な MIT + CC-BY-4.0 であり,商業用使用を許可し,属性があります.ライセンスクリーンなことは,あなたの展開にとって重要な場合,DROIDはより安全な選択です.

データフォーマットとツール

両データセットはRLDSを定式形式として使用し,どちらもLeRobotエコシステムを通じてHuggingFace Hubに反映されています.2026年に新しくスタートしている場合は,LeRobotは最小抵抗の経路です.両方で均一なPyTorchインターフェースを提供します.オリジナルTFDSベースのパイプラインを希望する場合は,両方のデータセットが再生可能なダウンロードスクリプトを送信します. [データプラットフォーム] T5) は両方のフォーマットを吸収し,また自分の収集したデモを OXE対応の RLDS に変換することもサポートします.

知っている価値のある物

**OXE アクション スペースは同一ではありません.**RLDS 共有スキーマ内でも,異なるコンポーネントは異なるアクションコンベンションを使用します (エンドエフェクター対関節,デルタ対絶対,グリッパーコードが異なる).OXE チームは標準化レイヤを公開しましたが,完璧ではありません. 純粋なトレーニングランスを始める前に,実用的なエンジニアリング時間をプリプロセッシングに費やすることを計画します.

**DROID腕カメラは低解像度です.**腕部ZED Miniは720pステレオを提供し,シーンカメラは1080pを提供します.ほとんどの現代VLAアーキテクチャはとにかく下標ですが,高解像度認識モデルを訓練している場合は,天井を注意してください.

両者とも階級の不均衡があります. OXEは数々の大きな構成要素 (特にGoogle Robotのデータセット) によって支配されています. DROIDは数々の機関によって支配されています.

評価: 各分野に訓練された政策はどのように比較されるのか

OpenVLAがリリースされたとき,そのアブラーションにはOXEのみ,DROIDのみ,OXE+DROIDのみで訓練されたチェックポイントが含まれていた.DROIDのみの配布中にDROIDのみの作業では,DROIDのみのチェックポイントはOXEのみと競争力があり,時にはよりよい.OXEのみの評価 (未見のシーンまたはオブジェクト) では,OXEのみのチェックポイントはさらに一般化した.OXE+DROIDのみのチェックポイントは両者よりも厳格に優れていた. これは現在標準化された"OXEプレトレーン,DROIDフィーナチューン"レシピの経験的基盤であり,2025年および2026年まで追跡作業を継続しています

差は長尾の行動において特に顕著である.DROID単独では標準のピックアンドプレイスを信頼に適した方法で処理するが,分布の外では何でも苦労する.OXE単独ではより幅広い作業を処理するが,基本的なアクション分布が構成要素間で正常化されていないため,より大きなアクション痕跡を生成する.両方を組み合わせることで,両方の故障モードを平滑にします.

保存,ストリーミング,および実践的なダウンロード

OXE Corpus をダウンロードすることは,多テラバイトの操作です.ほとんどのチームは気にしません. TFDS を介して大切なコンポーネントをストリームします.またはストリーミングモードで HuggingFace ミラーを使用します.DROID は ~1.7 TB 原材料でより管理可能です. 生産訓練のために,データローカル リモートストリーミングを導入することで,トレーニング通路を損なう遅延が加えられます.

推奨する内容

2026年に導入可能な操作ポリシーを構築するほとんどのチームにとって,私たちのアドバイスは:OXEで訓練されたOpenVLAまたはpi0チェックポイントからスタートし,アクション分布を安定させるために DROIDを細かく調整し,その後,タスク特定のテレオペレーションデータで再び細かく調整します.タスク特定のデータはまだ持っていない場合は,私たちの [カスタムデータ収集]T6) は数週間で起動できます. ハードウェアを選択している場合は,DROID対応の際にはフランカ・パンダが明らかな選択ですが,WidowX腕も BridgeDataに頼る場合は,その経路については,私たちの [BridgeData vs RoboMimic比較] (T7) を参照してください.

関連資源

  • [X-Embodymentデータセットページを開く]
  • [DROIDデータセットページ]
  • [LIBERO vs.CALVIN基準値比較]
  • ブリッジデータとロボミミック
  • [2026年のベストロボット学習データセット]
  • [VLAと政策モデルカタログ]
  • [ロボット学会教程]