Datasetsに戻る

ブリッジデータ V2: バークレーのスケーラブル操作コープス

言語条件のポリシーを訓練し, 1 日以内でのベンチマーク一般化を行います.

ブリッジデータV2の実践者のガイド UCバークレーのRAILラボから60096の軌道のWidowXデータセットでブリッジ訓練されたVLA,Octoフィーナチューン,OpenXミックスを動かす.

TL;DR

Metric Value
Task count 13 skills across ~100 task variants
Robots WidowX 250 6DOF arm (consumer-grade, ~$6K)
Modalities RGB-D (Intel RealSense), proprioception, gripper, language instruction
License CC-BY 4.0
Size 60,096 trajectories, ~400 GB raw
Environments 24 scenes including toy kitchens, sinks, and tabletops

BridgeData V2とは何か

BridgeData V2はUCバークレーのロボットAI&学習ラボ (RAIL) からオリジナルの2021年の BridgeDataリリースの後継である. 操作策は 特定の環境の調整なしに 自然言語の指示に従うことを学べるでしょうか? 操作策は 単純な質問に答えます 回答するためにRAILチームは低コストのWidowX 250 6DOF腕を 24 つのシーンで 60 096 回のデモで遠隔操作しました ピックアンドプレス,プッシュ,スワイプ,スタッキング,折り畳み,ドラフト開き,および他のいくつかのスキルをカバーしました

ブリッジデータ V2 において,デザイン決定が2つに比例して影響を与えた.一つは,各軌跡はクラウドソーシングの自然言語指示で注釈されている. 固定タスクIDではなく,結論時にブリッジで訓練されたポリシーがフリー形式のテキストに条件付けられるということです. 2つ目は ウォードー・エックス (フランカや UR5) の代わりに 6,000ドルという 腕を選び ハードウェアコストが 十分低くなって 追跡研究室が 設定を再現できるようになったことであり データが 低コストの操作研究のための 標準となったこと

ブリッジデータV2は,現在Open X-Embodimentミックスに最大規模の個人貢献の一つであり,産業用ハードウェアを所有することなく実世界の結果を示したい論文にとって最も人気のある細かな調整対象である.OpenVLA,Octo,およびいくつかの拡散政策バリエーションは,ブリッジデータV2番号を現実世界の定番結果として公開する.

ダウンロードと読み込み方法

データセットは,バークレーからのNumPy ショートとして,Google Cloud Storage でRLDS として,Open X-Embodiment バケットを通じて配布されています.

# Raw NumPy shards (~400 GB)
wget -r https://rail.eecs.berkeley.edu/datasets/bridge_release/data/demos_8_17.zip
unzip demos_8_17.zip

# Or stream the RLDS copy from OXE (recommended for VLA training)
pip install tensorflow_datasets
import tensorflow_datasets as tfds
ds = tfds.load("bridge", data_dir="gs://gresearch/robotics", split="train")
for ep in ds.take(1):
    for step in ep["steps"]:
        print(step["observation"]["image_0"].shape,
              step["observation"]["state"].shape,
              step["action"].shape,
              step["language_instruction"])

# Install the reference training stack
git clone https://github.com/rail-berkeley/bridge_data_v2.git
cd bridge_data_v2 && pip install -e .

OpenVLA または Octo を細かく調整するには,OpenX 混合体内の T1 に設定を指し,単一の 8xA100 ノードで公開された結果を再現できます.

共通用例とモデルペアリング

  • 低コストVLA評価. BridgeData V2は,OpenVLAとOctoのデフォルトリアルなフィニティューンです.
  • 言語条件のポリシー. 免費形式の指示注釈により,指示をフォローする研究のためのデータセットに利用できます.
  • 一般化研究. 同じスキルが24の環境で繰り返されるので,シーンを広げ,ゼロショットシーン一般化を測定することは簡単です.
  • ディフュージョン・ポリシーのベースライン* 技能マップごとに ~4,000エピソードがカリキュラムのトリックなしでディフュージョン・トランスフォーマー政策に完全に組み込まれています.

ランキングとランキング

BridgeData V2 評価は,通常,言語指示の連続したセットで配布中の成功率と,新しいオブジェクト/新しいシーン組み合わせのセットで配布外の成功率として報告されます.OpenVLA は約70%の配布中の成功と40%〜50%のOODの成功率を報告します. コードBridgeData V2入力のある文書RAIL Labプロジェクトページ を参照してください.

テクニカル・ディープダイビング:スケーマとアクションスペース

BridgeData V2 エピソードは,それぞれの軌跡のディレクトリとして保存され,それぞれに観察のPythonのピクルとステップごとにRGBフレームと言語指示が含まれています. 観測は5Hz (WidowXの遠隔操作ループ速率) で記録され,RGBストリーム2つ,第三者シーンカメラと肩の上腕カメラを搭載し,Intel RealSense深度 (シーンサブセット),WidowXの6次元エンドエフェクターポーズ,バイナリーグリッパー状態を含む.

動作は7次元である.カーテジアンデルタエンドエフェクター位置 (xyz),カーテジアンデルタ方向 (rpy),グリッパー開閉.動作周波数は5Hzのみであるため,ブリッジデータV2ポリシーは4-8ステップのアクションチャンキングで訓練されています.これは拡散ポリシーの標準的なチャンサイズにうまく一致します. 制御速度は低いのはデータ収集の恩恵 (テレオペレーターが遅い速度でより高い成功率を記録する) と動力的なタスクの軽い呪い (データセットは100ms未満の反応制御を必要とするものには適していない).

言語指示はAmazon Mechanical Turkを通じてクラウドソーシングされています.従業員はそれぞれの軌道を観察し,タスクの自然言語説明を書きました.つまり指示には字体誤差,同義語,パラフラゼが含まれています.この騒音は実際には機能です.

既知の制限

  • 単体実施形態* 60Kの軌跡はすべてWidowX 250で行われている.ブリッジ訓練されたポリシーをフランカまたはUR5に移行するには,クロス実施形態の微調整が必要です.
  • テーブルトップバイアス** シーンはほぼ洗面台,炉台,またはデスクの高さのテーブルトップです.床操作,垂直表面,移動操作は分散していません.
  • 低動作速さ. 5 Hzは準静的操作には適しているが,倒すか捕まえるかのような動的な作業には十分ではない.
  • 成功のラベルはユリスティックです. 遠隔操作者の判断は成功の基本真実でした. 成功とラベル付けされたエピソードのわずかな一部は実際には部分的な失敗です.

常識問題

** BridgeData V2 を使用するには,WidowX が必要ですか?** 閉ループ現実世界の評価を行う場合のみ.多くのグループは Bridge で訓練し,シミュレーションや異なった腕で,横体化転送を通じて評価します.

BridgeData V2 は BridgeData V1 とどのように関係しているのでしょうか? V2 は大約4倍大きいので,12つの新しいシーンを追加し,クリーンな設定でほとんどの V1 作業を再操作し,各エピソードに言語注釈を送信します (V1 はそれらをサブセットにのみ持っていました).

** BridgeData V2 を自分のWidowX データと組み合わせることができるか?** はい 計画がよく文書化されており,いくつかの第三者のトレーニングパイプラインはドロップインミックスをサポートしています.