Blogに戻る

オープンX-エンボディメント: すべてを変えたロボットデータセット

オープンX-Embodimentは 22つのロボット実施形態,1M+軌跡 RT-Xからの異体転送証拠 データセットへのアクセスと使用方法,制限,そして次に何が起こるかを説明しました

[←ブログ]

Open X-Embodimentは,最大規模のオープンコラボレーティングロボット学習データセットです. 多くの異なるロボットからのデータでトレーニングが単ロボットのトレーニングよりも新しいロボットにより良いポリシーを生成するという最初の厳密な証拠を提供しました.

オープンX体体とは

オープンX-エボディメント (OXE) は,フランカ・エミカ,トロッセン・ロボティクス (ウィドウックス,バイパーX),ユニバーサル・ロボット (UR5),KUKA,Googleのロボット艦隊など,22種類以上のロボット化演示の統一データセットです. 数字集は100万回以上で 数百の異なる操作作業をカバーしています 抽出しやキャビネットを開く 液体を注ぐ 表面を拭く 積み重ねする 物品などです

このプロジェクトは,スタンフォード,UCバークレー,カーネギー・メロン,MIT,コロンビア,ETHチューリッヒなどから大きな貢献をしたGoogleDeepMindが主導した30以上の研究機関による協力であった.各研究室は既存のデモデータセットを寄与し,RLDS (Robot Learning Dataset Specification) 形式に標準化された. 完全なデータセットは Google Cloud Storage でホストされており,研究用として無料で利用できます.

OXEの定義的な野心は,大規模なデータセットを作成するだけでなく,さまざまなロボットからのデータへのトレーニングが,単一のロボットからデータへのトレーニングよりもより良いポリシーを生むことを示すことです.この仮説は正しいことが判明し,証拠はロボットデータについて分野がどう考えるかを再構築しました.

なぜ 重要 な の か:RT-X の 結果

OXE論文 (Padalkar et al., 2023) の重要な発見は,RT-Xモデル,特にRT-1-XとRT-2-Xの性能であり,完全な多体体データセットで訓練された.

OXEデータで訓練されたRT-1-X (より小さい効率的なモデル) は,複数のロボットプラットフォームで実施された評価作業で,単ロボットの専門のRT-1モデルを約50%上回った.これが主な結果でした.22種類のロボットのデータで訓練された単一の汎用モデルが,そのロボットのデータだけで訓練されたモデルよりも個々のロボットでより良いパフォーマンスを発揮しました. 仕組みは,交代体体化データによってモデルが体現-無知的な操作表現を学ぶことを強要し,視覚的理解とタスク概念の強力な先駆けを提供しているということです.

RT-2-X (はるかに大きい PaLM-E視言語モデルに基づいて構築) は,訓練セットに存在していないロボット実施形態に特に印象的なゼロショット一般化により,さらに強力なクロスエンボディメント転送を示した. 作業の完成率を 微調整なしで達成することが RT-2-Xは 持続可能なロボット型で評価され 単一のロボットデータで訓練されたモデルでは不可能だった.

これらの結果は,ロボット操作の知識は部分的に体現無知であるという核心仮説を検証した.フランカ腕がドラフトを開き,ウィドウX腕がカップを拾った政策は, UR5に転送するドラフトやカップについて何かを学んだ. UR5にはまったく異なるシナメティックがあるにもかかわらず,

論文 の 重要な 結論

**実施形態の間で何が移転する:**視覚シーン理解 (オブジェクト認識,空間関係を理解) は最も強く移転した.高レベルのタスクセマニック ("ピックアップ","オープン","場所") の概念は良好に移転した.プレグラスプアプローチ経路 (接触前にオブジェクトに向かって移動) は適度に移転した.

**うまく転送できないもの:**正確な握手配置 (物体の表面に対して指の正確な位置) は実施体特定データが必要でした.接触動力 (握手力調節,挿入力) は転送されていません.細かいモーター制御 (サブセンチメートル精度運動) は,実施体ごとに細かい調節が必要でした.

データ配分問題: OXEデータセットは実施形態とタスクに均等に分布されていない.一部のラボは数千回のエピソード,他のものは数百回のエピソードを貢献した.タスク配分はテーブルトップのピックアンドプレスに大きく偏っている. この不均衡にもかかわらず,クロス・インボディメントの利益は強かったが,最も大きな利益は,強い専門家を訓練するための十分なデータを持っていた (支配的な実施形態よりも,クロス・インボディメントの転送から最も多く得た) にあった.

スケールが役立つが,多様性はさらに役立つ: 訓練セットの実施形態数を変化させながら,総エピソード数値を常数にしておくアブレーション研究は,すでに表現された実施形態より多くのエピソードを追加することで,より少ないエピソードを持つ新しい実施形態を追加することが一貫して優れていることを示した. 機械学習における最も引用され,実際で最も重要な成果の一つとなった.

データベースにアクセスし使用する方法

OXEはGoogle Cloud Storageでホストされており, tensorflow_datasets (TFDS) APIを使用してダウンロードできます.データセットはRLDSフォーマットを使用しており,各エピソードは観察辞書 (画像,関節状態,グリッパー状態),アクションベクトル,報酬信号,自然言語タスク注釈を含むステップの連続です.

スタート:

  • tensorflow_data sets をインストールする: T4
  • OXE GitHub リポジトリまたはTFDS カタログで利用可能なサブデータセットを閲覧する
  • 特定サブデータセットを読み込み: T5 (RT-1 フレクタルデータセットにとって,最大の構成要素の一つ)
  • PyTorch ユーザ: RLDS データを LeRobot Parquet フォーマットに変換するために LeRobot の変換ユーティリティを使用するか,直接 PyTorch 読み込みのために oxe_torch_dataloader を使用します

実用的な使用パターン:

  • 基礎モデルを予備訓練: OXE データセットをダウンロードする (または10以上の実施形態をカバーする多様なサブセット).このデータでモデルを訓練して,一般的な操作表現を学ぶ.次にタスク特定データに細かく調整する.これは,ゼロからトレーニングよりもタスク特定示範を5〜10倍少なくする必要があります.
  • 小さなデータセットの拡張: 特定のロボットで100~200のデモを用意している場合は,関連するOXEサブデータセットをトレーニングミックスに追加します.類似した実施形態 (同じグリッパータイプ,同様の腕の幾何学) および類似したタスクカテゴリからのサブデータセットに焦点を当ててください.
  • クロス・エンボディメント転送の評価: OXEの標準評価プロトコルと,実行されたタスクセットを使用して,公開されたベースラインと比較してモデルの概括能力を基準にします.

制限: OXE が 適用 し ない 内容

OXEは変革的なものですが チームが信頼する前に 理解すべき 限界があります

タスクの多様性は歪んでいる. ほとんどのエピソードはテーブルタスクで作られ,小部分ではドラフト/キャビネットを開く,拭く,倒す.複雑な多段階のタスク,双手作業,移動操作作業は不足している.OXEのタスク配分によって部署タスクが十分に覆われていない場合,訓練前の利点は限られている.

ハードウェアは時代遅れです. 多くの研究室は2020~2023年に現在のハードウェアを使用したが,現在時代遅れである:低解像度カメラ,古いRealSenseモデル,および2026年に最も一般的に使用されているViperX/Frankaセットアップとは異なる腕配置.古いカメラの視覚機能は,現代のカメラセットアップの視覚分布と完全に一致しない可能性があります.

**Dexterityは限られています.**OXEのデータではほとんどすべてのOXEは平行爪のグリッパーを使用しています.多指の手によるデクステルスな操作は基本的にデータセットに欠けている.アプリケーションに手によるデクステルスな操作が含まれている場合,OXEは直接的な利益が限られているが,視覚理解のコンポーネントは依然として転送します.

アノテーションの質は異なります. 言語アノテーションは,注意深く具体的な記述 ("テーブル左側から赤いカップを拾い上げ") から,一般的なラベル ("オブジェクトを拾い上げ") までです.この不一致性は,処理後なしの原材料データセットでの言語条件のトレーニングの有効性を制限します.

**力・トルクデータはありません.**OXEエピソードの大部分は,関節位置とカメラ画像のみを含みます.接触型作業に不可欠な力・トルクセンサーデータは,ほとんどのサブデータセットに欠けている.これは,握力力調節または適合するオブジェクトを操作する必要がある訓練政策のOXEの有用性を制限します.

LeRobot (Python) でOXEデータをロードする

# Load an OXE sub-dataset via LeRobot's HuggingFace integration
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset

# Load the Bridge V2 subset (WidowX data, 60K+ episodes)
dataset = LeRobotDataset("lerobot/bridge_orig")

# Inspect dataset structure
print(f"Number of episodes: {dataset.num_episodes}")
print(f"Keys per frame: {dataset[0].keys()}")
# Typical keys: observation.images.image_0, observation.state, action, ...

# Load a specific episode
episode = dataset.filter(lambda x: x["episode_index"] == 42)
for frame in episode:
    obs_image = frame["observation.images.image_0"]  # PIL Image or tensor
    state = frame["observation.state"]  # joint positions
    action = frame["action"]  # action vector
    # Process as needed for your training pipeline

# For TFDS-native loading (alternative):
# import tensorflow_datasets as tfds
# ds = tfds.load('fractal20220817_data', split='train')
# for episode in ds.take(10):
#     steps = episode['steps']
#     for step in steps:
#         image = step['observation']['image']
#         action = step['action']

OXE + あなたのデータにおける基礎モデルを細かく調整する

作業特有の政策を改善するためにOXEデータを利用するための標準パイプラインは,3つの段階を構成します

**第1段階:関連するOXEサブデータセットを選択します.**すべてのOXEデータは同じくらい役に立たない.類似したロボットタイプ (同じグリッパータイプが同じ腕の運動よりも重要) をベースにサブデータセットを選択します. WidowXベースのピックプレスプロジェクトでは,ブリッジV2とバークレーケーブルルーティングデータセットが最も関連している.フランカベースのプロジェクトでは,FractalとTOTOデータセットが最も強い.

ステージ2: プリトレーニングまたはプリトレーニングされた重量を使用する. Octoまたは OpenVLA を使用する場合,プリトレーニングされた重量には既に OXE データが含まれています.これらの重量からスタートして細かな調整を進めます. カスタムアーキテクチャを訓練する場合,選択した OXE サブデータセットを100~200期間に (通常は 4x A100 GPU で4x A100 GPU に関して) プリトレーニングしてください. 対象タスクの犠牲に OXE 配分に過度に適合することを検出するために,タスクの特定データの一部の検証損失を監視します.

**ステージ3:タスク特別のデータに精準調整する.**より低い学習率 (通常は,前訓練より10倍低い: 1e-5はOcto, 5e-6はOpenVLA) を使用して,より関連するOXEデータの1020%の混合を使用して,一般的な操作知識の壊滅的な忘れを防ぐ. 精細調整には通常50200時間 (2~8時間) の時間が必要である. 一つのA100で10時間ごとに実行されたタスク特別のテストエピソードを評価し,最高のチェックポイントを選択する.

基準結果:OXE訓練を受けたモデル対専門家の

Model 事前学習 Data Fine-Tune Data In-Dist. Success Novel Object Success
ACT (from scratch) None 200 task demos 82% 28%
RT-1-X Full OXE 200 task demos 88% 52%
Octo (fine-tuned) Full OXE 200 task demos 86% 48%
OpenVLA (fine-tuned) Full OXE 200 task demos 90% 58%

パターンは一貫している:OXE前訓練は,分散の微小な改善 (5-10%) と新型オブジェクトの汎用化改善 (20-30パーセントポイント) を提供している.分散の利点は,より細かな調整データにより狭くなっているが,OODの利点は,500以上のタスク特有の示範でも持続する.

OXEデータセット統計: 数字によって

OXE の 構成 を 理解 する こと は,チーム が 活用 ケース に 関する 最も 関連 的 な サブデータセット を 選択 する こと に 役立ち ます.

Statistic Value Notes
Total episodes ~1.1 million Growing as labs continue to contribute
Robot embodiments 22+ Franka, WidowX, UR5, KUKA, Google fleet, etc.
Contributing institutions 33 Led by Google DeepMind, Stanford, UC Berkeley
Distinct task categories ~500 Heavily skewed toward pick-place (~60% of episodes)
Total storage size ~12 TB (raw) Most sub-datasets are 5-200 GB individually
Largest sub-dataset Fractal (RT-1): ~130K episodes Google's proprietary robot fleet data
Bridge V2 (WidowX) ~60K episodes 24 environments; most popular for WidowX fine-tuning
Language annotations ~70% of episodes Quality varies significantly across sub-datasets
Camera resolution range 128x128 to 640x480 Most sub-datasets standardize to 256x256 or 224x224
Force-torque data < 5% of episodes Major gap; limits contact-learning applications

RCSVデータフォーマット互換性

RCSV データ収集出力は,OXEと主要なトレーニングフレームワークと互動可能になるように設計されています.

  • ネイティブフォーマット: HDF5 (レロボット互換性). RCSVの主要な出力フォーマットは,レロボットのエピソード構造に組織された HDF5です.各エピソードには: T6 (RGB, 640x480, 30fps), T7 (RGB, 640x480, 30fps), T8 (関節位置 + 速度 + 握手), T9 (力トルク, 6軸, 500Hzを30Hzに減少させ), T10 (関節位置目標またはデルタ EEF),と T11 (自然言語文字列).
  • RLDS輸出. OXE 互換性およびTFDS ベースのトレーニングパイプラインでは,RCSV は,標準化された観測,アクション,言語フィールドを使用して HDF5 エピソードをRLDS フォーマットにマッピングする単コマンド RLDS変換を提供します.この輸出は,RCSV で収集されたデータを OXE に提供するために必要なものまたは既存の OXE サブデータセットと混合するために必要です.
  • LeRobot Parquet輸出. ハグジング・フェイスネイティブワークフローでは,RCSVは関連メタデータ YAMLを LeRobot Parquet フォーマットに輸出します.これはACT,Difusion Policy,VLAトレーニングのT12と直接統合します.
  • **Raw video + CSV.**カスタマイズされたパイプラインでは,RCSVは,カメラごとに原始 MP4ビデオと CSVファイルをタイムスタンプ付きの関節状態,F/T読み値,グリッパー状態で輸出できます.これは最も柔軟なフォーマットですが,チームに独自のデータロードコードを書く必要があります.

RCSVデータと典型的な OXEサブデータセットの主要な区別は:RCSVエピソードごとに同期力・トークデータ (F/Tセンサーがハードウェアに存在している場合),校正されたカメラ内側と外側,標準化されたプロトコルに従って言語注釈が含まれます.これらの機能により,RCSVデータはOXE前訓練に加えて,高品質の細かな調整データとして特に価値があります.

RCSV データが OXE を 補完する 方法

OXEは幅広い範囲を提供しており,多くの実施形態,多くのタスク,多くの環境です.特定の領域における深さとデータ品質の一貫性が欠けている. RCSVデータ収集は,すべてのエピソードで内在と外在を校準した一貫したカメラセットアップ,視覚と自感性ストリームと同期されたフォーストークセンサーデータ (ほぼすべてのOXEデータから欠けている),ターゲットタスクカテゴリー内の有系統なオブジェクト多様性 (カテゴリーごとに30以上のオブジェクト,OXEサブデータセットでは典型的5〜10ではなく) と,標準化されたプロトコルに従って言語注釈,OXEサブデータセットの間で変数品質ではなく,提供することによってこの空白を満たします.

特定の部署目標を持つチームに推奨されるアプローチは,視覚の背骨と一般的な操作知識のためにOXEで訓練された基礎モデルの重みを使用し,部署レベルの信頼性に必要な深さと質を提供するRCSVで収集されたタスク特別のデータで細かく調整します.

データセット構成 深層ダイビング:OXEには何が含まれているのか

OXE のサブデータセットは全て同じではありません.構成を理解することで,チームは訓練前での適切なサブセットを選択し,無関係データで計算を無駄にしないようにします.

Sub-Dataset Robot Episodes Tasks Best For
Fractal (RT-1) Google Everyday Robot ~130K Kitchen manipulation, pick-place Visual diversity, mobile manipulation
Bridge V2 WidowX 250 ~60K 24 environments, pick-place, sweeping WidowX fine-tuning, env diversity
TOTO Franka Panda ~1K Tabletop manipulation Franka fine-tuning baseline
Kuka KUKA IIWA ~3K Grasping, stacking Industrial arm benchmarks
BC-Z Google Robot ~25K 100+ tasks with language Language conditioning, multi-task
Cable Routing WidowX / Franka ~2K Deformable object manipulation Contact-rich, deformable tasks
Jaco Play Kinova Jaco ~1K Pick-place, drawer open Kinova fine-tuning, 3-finger gripper data

OpenArm 1 (6-DOF並行マハグリッパー) を使用するRCSV顧客にとって,訓練前混合物のための最も関連するOXEサブデータセットは,ブリッジV2 (類似のエンドエフェクタータイプ) とBC-Z (言語条件のポリシーのための言語注釈) です. フレクタルデータを追加することで,ロボット形態が大きく異なるものの,追加の視覚的多様性が生まれる.

実践的なデータ混合:OXEとタスク特別のデータをバランスする

OXE 訓練前データとタスク特別の微調整データを組み合わせるとき,ミックス比は重要である.微調整中に OXE データの過剰な量はタスク特別の学習を稀化させる.あまりにも少ないことは,一般的な操作知識を壊滅的な忘れを可能にする.

推奨する混合スケジュール:

  • フェーズ1 (epochs 1-50): 80% OXE,20%タスク特異.モデルは適応を開始する間,一般知識を維持します.
  • 第2段階 (時代51~150年): 40%OXE,60%タスク特異性.モデルは幅広い視覚的特性を維持しながら専門化しています.
  • フェーズ3 (epochs 151-200): 10% OXE,90%タスク特異性.目標タスクの最終的な精錬,最小の OXEが調節剤として使用されます.

この段階的なスケジュールでは,新しいオブジェクト概括において固定比混合を5-8%に一貫して上回る. 3 段階のOXEデータは,タスク特有のアクション学習に干渉せずに,細かな調整分布に過剰なフィットを防ぐ規制器として機能します.

# Graduated data mixing for OXE + task-specific fine-tuning
from torch.utils.data import ConcatDataset, WeightedRandomSampler

def get_sampler(epoch, oxe_dataset, task_dataset, total_epochs=200):
    """Returns a weighted sampler with epoch-dependent mixing ratio."""
    progress = epoch / total_epochs
    if progress < 0.25:
        oxe_weight, task_weight = 0.8, 0.2
    elif progress < 0.75:
        oxe_weight, task_weight = 0.4, 0.6
    else:
        oxe_weight, task_weight = 0.1, 0.9

    weights = ([oxe_weight / len(oxe_dataset)] * len(oxe_dataset) +
               [task_weight / len(task_dataset)] * len(task_dataset))
    combined = ConcatDataset([oxe_dataset, task_dataset])
    sampler = WeightedRandomSampler(weights, num_samples=len(combined))
    return combined, sampler

データをどう提供するか

OXEへの貢献は,コミュニティデータセットを強化し,あなたのデータをより広範な研究コミュニティに引用し利用するためのメカニズムを提供します.貢献プロセスはいくつかのステップを含む.

  • ** RLDS にデータ を フォーマット する.** 各 編 程 に RLDS 計画 に 関する 観測 (画像 と 素 接) や 行動, 言語 注釈 が 含まれ て いる の です. rlds_creator 図書館 は 変換 ユーティリティ を 提供 する.
  • ステップごとに言語注釈を追加する.* 各ステップには,現在の作業の自然言語説明が含まれる必要があります.これらの注釈は,言語条件付きモデルで使用され,含まれている必要があります.
  • データセットを文書化. データセットカードを提供する:ロボットタイプと構成,カメラの仕様と配置,収集環境説明,タスク説明,オペレーター数とトレーニング,タスクごとにエピソード数.
  • ** pull リクエストを提出する.** OXE GitHub リポジトリは pull リクエストを通じてデータセットの貢献を受け入れます.レビュープロセスはフォーマットのコンプライアンス,データ品質 (破損したエピソード,極端な異常値がない) およびドキュメントの完全性をチェックします.

RCSVの [データサービス] (T18) を通じてあなたのデモが収集された場合,当社のプラットフォームは標準化されたメタデータを使用してRLDS対応の輸出を生成することができ,貢献プロセスを簡素化します. OXEの提出のためにあなたのデータを準備するガイドラインのために [RCSVチーム] (T19) に連絡してください.

OXE データ の 使い方 に 関する 常識 の 罠

OXE を 初めて採用するチームは,廃棄物計算を頻繁に経験し,最適でない結果を出します.

  • **OXE は,フィルタリングなしで全データセットのトレーニングをします.**OXE には,M1M以上のエピソードが含まれています.多くのエピソードが,あなたの特定のタスクに無関係です.すべての作業のトレーニングは,騒音を加え,同比的な利益なしにトレーニング時間を10-50倍増やします.常に最初に関連するサブデータセットにフィルタリングします.良い出発点:類似したグリッパータイプとタスクカテゴリーを持つ3〜5つのサブデータセットを選択し,合計50K〜200Kエピソードです.
  • アクションスペースの正常化を無視する. OXEサブデータセットは,異なるアクション表示を使用します.絶対関数位置,デルタ関数位置,絶対エンドエフェクターポーズ,デルタエンドエフェクターポーズ,およびさまざまなグリッパーアクションフォーマット.共通のアクションスペースに正常化せずに複数のサブデータセットをロードするとゴミポリシーが生じます. OXEアクション正常化ユーティリティや LeRobotの内蔵変換レイヤを使用します
  • **カメラの配置が均一であることを前提とする.**OXEサブデータセットに合わせてカメラの位置,角度,解像度は劇的に異なります.ブリッジV2 (上下カメラ,256x256) で訓練されたモデルは,腕カメラに640x480でうまく転送されない可能性があります.訓練前のサブデータセットを部署カメラの構成にできるだけ近いようにマッチしてください.
  • ** 最大のサブデータセットを過重化.** OXE の 量ではFractal (130K エピソード) が優位.エピソードごとに均一にサンプルを採取すると,あなたの訓練の60%以上は,あなたの腕に関連のないユニークなモバイル操作装置を使用するGoogleのロボット艦隊からのFractal データになります. 目標実施形態により関連のあるサブデータセットまたはアップ重量より小さなデータセットのバランス取材を使用します.
  • **言語注釈品質問題を無視する.**OXEエピソードの約30%には,一般的な言語注釈または欠落した言語注釈 ("左側から赤いカップを拾う"ではなく,オブジェクトを拾う) が含まれています.言語条件のポリシーについては,高品質の注釈 (ブリッジV2,BC-Z) またはLLM再標識ステップでポストプロセスの注釈を含むサブデータセットにフィルタしてください.

行動空間正常化: 実践的なガイド

OXEサブデータセットにおけるアクションスペースの不一致性は,最も大きな実用的な課題の一つです.

# Action space normalization for mixed OXE training
import numpy as np

class ActionNormalizer:
    """Normalize actions from different OXE sub-datasets to a common space."""

    def __init__(self, target_space="delta_eef_6d"):
        self.target_space = target_space
        # Per-dataset statistics (computed from dataset metadata)
        self.stats = {}

    def register_dataset(self, dataset_name, action_mean, action_std, action_type):
        """Register per-dataset normalization statistics."""
        self.stats[dataset_name] = {
            "mean": np.array(action_mean),
            "std": np.array(action_std),
            "type": action_type,  # "abs_joint", "delta_joint", "abs_eef", "delta_eef"
        }

    def normalize(self, action, dataset_name):
        """Normalize action to zero-mean, unit-variance in target space."""
        s = self.stats[dataset_name]
        # Step 1: Convert to target action type (if needed)
        converted = self._convert_action_type(action, s["type"], self.target_space)
        # Step 2: Standardize using per-dataset statistics
        normalized = (converted - s["mean"]) / (s["std"] + 1e-8)
        return np.clip(normalized, -5.0, 5.0)  # Clip outliers

    def _convert_action_type(self, action, source_type, target_type):
        """Convert between action representations using FK/IK."""
        if source_type == target_type:
            return action
        # Conversion requires robot-specific FK/IK -- use URDF-based solver
        # This is dataset-specific and must be implemented per-embodiment
        raise NotImplementedError(
            f"Conversion from {source_type} to {target_type} "
            f"requires robot-specific FK/IK model"
        )

Octoや OpenVLAのような基礎モデルが非常に価値ある主な理由の一つは,アクション正常化課題です. ネットワーク上のアクション正常化作業を内部で処理し,チームをゼロから実行することから省きます. オーダーメイドアーキテクチャを原材料のOXEデータで訓練している場合は,適切なアクションスペース処理のために 1-2週間のエンジニアリング時間を予算します.

評価プロトコル:OXE基線に対する基準基準の設定方法

出版されたOXE基線と 微調整されたモデルを 意義ある方法で比較するには RT-X論文から標準化された評価プロトコルを使用してください.

  1. 10〜20の評価構成を定義する 配布中の (訓練の場での訓練対象) と配布外の (新規の場での新しい対象) を対象とする.これらの評価をすべてのモデル評価において固定する.
  2. スタカスティックな政策行動と環境騒音を考慮するために,構成ごとに3つの試験を実行する.平均と標準偏差を報告する.
  3. 標準的な成功基準を使用する 対象はピックアップ場所の作業の目標位置から3cm以内に,抽出し/キャビネット角度は,関節作業の目標から10度以内に,作業が完成したのは,人間の平均示範期間が2倍です.
  4. **分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分別で分
  5. 公開されたベースラインと比較する ACTはゼロから (下限),Octoは細かな調整 (中級) と OpenVLAは細かな調整 (現在のモデルでは上限)

RCSVは,物理的な物体,位置テンプレート,スコアリング rubricsを含む一般的なタスクカテゴリー (テーブルテーブルピック・プレス,ドラフト開き,スタッキング) に対して標準化された評価セットを提供しています. RCSVインフラストラクチャを使用する他のチームとリンゴ対リンゴ比較を希望する場合は,これらの評価セットにアクセスするために,私たちと連絡してください.

OXE に 互換 的 な データセット を 構築 する

OXE エコシステムにデータを貢献する (または OXE 訓練されたモデルに互換性のあるデータセットを構築する) は,特定のデータフォーマットとメタデータ基準に適合する必要があります.OXE 互換性チェックリストはこちらです.

  1. **RLDS形式を使用.**OXEはTensorFlow Datasets (TFDS) に基づいたRLDS (補強学習データセット) 形式を使用します.各エピソードには:観測 (カメラ画像,プロピオセプティブ状態),アクション (エンドエフェクターポーズデルタまたは関節角),言語指示 (自然言語文字列),報酬/成功信号が含まれます.RCSVのデータ輸出パイプラインは,デフォルトでRLDS対応の出力を生成します.
  2. カメラの設定を標準化する. OXE モデルは特定のカメラフィールドを期待する. T13,T14などという名前を持つRGB画像の1つまたは複数の画像は,少なくとも 256x256 (320x240最小) の解析度でなければならない. 深い再構築でデータを利用したいチームのためにデータセットのメタデータにカメラ内部のおよび外部のデータを含みます.
  3. ** 動作を共通の空間に正常化します.** 7Dエンドエフェクターデルタとして動作を報告します: [dx, dy, dz,droll, dpitch, dyaw, gripper_open]. メーターで位置デルタ,ラディアンで回転デルタ.データセット文書にロボットのネイティブアクション空間 (関節角,絶対位置,など) から変換を含みます.
  4. 豊かなメタデータを含みます. 各データセット:ロボットモデル,グリッパータイプ,カメラモデル,作業空間の次元,作業説明.各エピソード:言語指示,成功/失敗ラベル,収集日期,オペレーター ID (匿名化).このメタデータは,OXEトレーニングを有効にするデータ混合戦略を可能にします.
  5. リリース前に品質ゲート. 失敗したデモを削除する (否定的な例訓練の失敗と特別に標識されていない場合を除く). モダリティ間のタイムスタンプ同期を確認する.アクションラベルが観察された動きに正しく対応していることを確認する.第二の注釈者による5%のスポットチェックは,体系的な問題を捉える.

RCSVは,すべてのデータ収集の業務のための標準輸出としてOXE対応データ輸出を提供します.RCSVデータを利用するチームは,フォーマット変換なしでOXE訓練されたモデル (Octo, OpenVLA) に即座に統合できます.クライアントが選択すると,すべての方に利益をもたらすコミュニティリソースを拡大し,公開OXEリポジトリに匿名化されたデータセットも提供します.

細かな調節する OXE モデル: ステップバイ・ステップガイド

OXE の 最も実践的な利用方法は,作業特有のデータに OXE を 訓練したモデルを細かく調整することです.

# fine_tune_octo.py -- Fine-tune OXE-pretrained Octo on task-specific data
from octo.model.octo_model import OctoModel
from octo.data import make_single_dataset

# Step 1: Load OXE-pretrained checkpoint
model = OctoModel.load_pretrained("hf://rail-berkeley/octo-base")

# Step 2: Prepare your task-specific dataset (RLDS format)
dataset = make_single_dataset(
    dataset_kwargs={
        "name": "my_robot_pick_place",
        "data_dir": "/data/my_dataset/1.0.0",
        "image_obs_keys": {"primary": "image_0", "wrist": "image_1"},
        "state_obs_keys": ["state"],
        "language_key": "language_instruction",
    },
    train=True,
)

# Step 3: Fine-tune with reduced learning rate
# Key: use 10x lower LR than pre-training to avoid catastrophic forgetting
model = model.finetune(
    dataset,
    learning_rate=3e-5,     # Pre-training used 3e-4
    batch_size=256,
    num_steps=10000,        # 50-200 demos typically need 5K-20K steps
    freeze_transformer=False,
)

# Step 4: Evaluate on held-out conditions
model.save_pretrained("/models/my_task_octo_finetuned")

** 微妙な調整の重要なヒント:**

  • T15 (93Mパラム) から始めましょう. 4+ A100 GPUがない限り,この場合,T16は計算価値があります.
  • 単一のA100では10Kステップのための100のデモで2時間ほど時間をかけて 精細調整します 500のデモでは8-12時間くらいです
  • 訓練損失と実世界の評価の両方を監視する.実世界のパフォーマンスレベルが平原化または低下する間に,細かな調整損失が減少する (小小細な調整セットにオーバーフィットする).
  • OXEの他の機器よりも異なるグリッパーやカメラの設定がある場合は,新しい実施形態の特性をモデルに教えるために,追加的な微調整データ (200+ デモ) を予算してください.

次はドロイド,ブリッジV2 そしてそれ以上の

OXEはこの原則を確立し,次の世代のデータセットは,特定の方向に拡張しています.

DROID (Khazatsky et al., 2024) は環境多様性に焦点を当てています. 564 つの環境と 86 つのラボで 76,000 件のデモが行われ,環境多様性は政策一般化に影響を与えるかをテストするために特別に設計されています. DROID は OXE に補完します:OXE はロボット体現の多様性を最大化します. DROID はシーンと環境の多様性を最大化します.

Bridge V2 (Walke et al., 2023) は,WidowXベースの操作のための集中的で高品質のデータセットを提供します. 24 つの環境で 6万以上のデモを精密な品質管理で行う. Bridge V2 は,WidowX ハードウェアに展開するチームにとって,特に1 つの実施形態のために必要な量と環境多様性を提供するため,細かな調整データセットです.

**Open-Anythingデータセット.**コミュニティは,現在あまり代表されていないドメインのOXEスタイルの統合に向けて取り組んでいます. 多指手による巧妙な操作,双手作業,モバイル操作,屋外/フィールドロボット工学. RCSVは,双手および巧妙な操作収集キャンペーンからのデータをこれらの新興の統合活動に積極的に貢献しています.

ウェブスケールテキストコーポレーションのロボット化等価に相当するより広範な軌跡です.OXEは大きな言語モデルを可能にしました.概念の証明でした.現在,コミュニティは真に一般主義的なロボット基盤モデルを訓練するのに必要な多様性と規模を達成できるか,そしてそれがどれくらいかかるのかという疑問です. RCSVの [データ収集インフラストラクチャ] (T20) は,現在のロボットシステムを構築するチームに即座に実用的な価値を提供しながら,この取り組みに貢献するように設計されています.

関連 読書

  • [ロボット学習のスケーリング法:2026年に知られるもの]
  • [LeRobot フレームワーク: スタートガイド]
  • [一般化課題:なぜロボット政策はまだ失敗している]
  • [ロボット学習ビデオ:2026年の最新技術]
  • [ロボットのための模倣学習:デモから部署まで]
  • [RCSVデータ収集サービス]
  • [RCSVデータセット]

OXE-対応データ収集

RCSV データ収集は,OXE対応で,標準化カメラ,RLDS準備の輸出,品質の注釈をはじめ,直接私たちのデータを訓練前のために使用するか,コミュニティに貢献してください.

[データサービスを探求]