Blogに戻る

異なったロボットに 移転できるのか?

概括を向上させるための複数のロボットタイプのトレーニングについて研究が示しているのは オープンソースX-Embodiment,DROID,RT-2-X,Octo,およびコード例による実践的なコートレーニング設定です

部分: [ロボットリースガイド]

[←ブログ]

22種類のロボットに訓練することで 23度目のロボットに性能が向上しますが 効果は重要な限界があります

異体化仮説

複数の異なるロボットタイプからのデータに関するロボット政策のトレーニング 異なる腕のデザイン,異なるDOF数値,異なる運動学 単一のロボットタイプで訓練されたモデルよりも新しいロボットと新しいタスクによりよく一般化するモデルを生産します この仮説は言語モデルアナログから直感的なものだった (より多様なテキストのトレーニングが助けられる) しかしロボットにとって明らかではない. 行動空間,運動学,物理能力はプラットフォーム間で根本的に異なります.

この仮説は,ロボットデータが高価であるため,実際的に重要なものです.RCSVでは, [OpenArm] (T5) で100人の専門家デモを収集するには,75ドル/時間で約4時間操作時間がかかります.これは,タスクあたり300ドルです.他のラボによって他のロボットタイプで収集された10万のデモを活用できれば,有用なトレーニング例の有効コストは,大 ukwuの順序で低下します. 疑問は,ウィドウXのデータが OpenArmのポリシーを訓練するのに役立つかどうか,そしてそうなら,どれくらいの費用かということです.

オープンX体: 証拠

オープンX-エンボディメントプロジェクト (パダルカー・アト・2023年;RTX協力論文) はこの仮説の最も包括的なテストである.データセットには22種類のロボットにわたる527のスキルが含まれています.これは世界中のラボが貢献した160,000以上のロボットエピソードを表しています. 重要な結果は:全マルチインボディメントデータセットを訓練したRT-Xは,完成した一般化作業で単ロボットの専門家を約50%上回った.

複数の体体モデルにはターゲットロボットについて追加情報はありませんでした 単により多様なデータで訓練されました.多様性そのものが利点でした.

詳細なデータセット統計

Dataset Robot Types Episodes Skills Environments Format
Open X-Embodiment (OXE) 22 160,266 527 160+ RLDS (TensorFlow)
DROID 22 (different set) 76,000 350+ 564 RLDS + HDF5
RoboSet 3 100,000+ 12 100+ HDF5
Bridge V2 1 (WidowX) 60,096 13 24 RLDS
RT-1 Robot Action 1 (Everyday Robot) 130,000 700+ 1 RLDS
RCSV Shared Pool 5 25,000+ 40+ 30+ LeRobot HDF5

OXE データセットは不均等に分布されている.エピソードの約60%は3種類のロボット (WidowX, Franka, Everyday Robot) から発生する.残りの19種類のロボットにはそれぞれ1,000~5,000エピソードが含まれています.この不均衡は,多体化メリットが部分的にデータ豊かなプラットフォームによって引き起こされるため重要です. OXEの全データセットでトレーニングをするとき 基本的に他の 19つのプラットフォームから 多様性ボーナスで WidowX/Franka/Everyday Robotの操作を学びます

RT-2-X: 交代体機能の証明されたVLA

RT-2-XはRT-2視言語行動モデルを拡張し,OXEデータセットを全般に消費した.アーキテクチャは55BパラメータのPaLM-Eモデルで,画像と言語指示を入力として取り出し,機体の操作を дискрет化する.

  • +50% 新たに評価される: 単一のロボットのための訓練データに直接含まれていない新型オブジェクト組み合わせや空間関係を必要とするタスク
  • +25% 配布中の作業: 単ロボットのデータセットでよく表現された作業でも,多体体モデルが優れていた.
  • ゼロショット転送: RT-2-Xは,訓練セットにないロボットを,確率よりも高い成功率で制御することができたが,性能は精細なモデルよりも大幅に低い.

55Bパラメータのカウントは重要な文脈である:これはラボGPUで実行できるモデルではありません.インフェレンスは複数のA100またはH100を必要とします.ほとんどのチームにとって実用的なバージョンは,OXEデータに細かく調整された小さなモデル (17B) です.これは部署可能なスケールでクロスエンボディメントのメリットの大半を把握します.

Octo: 実践的なクロスインボディメント財団モデル

Octo (Ghosh et al., 2024) は,ほとんどのチームがクロス・インボディメント転送のために開始すべきモデルである.OXEデータセットから800Kのロボットエピソードで訓練された93Mパラメータートランスフォーマーである.

  • アーキテクチャ: 形像 (ViT),言語 (T5) とプロピオセプション (MLP) のモダリティ特有のトークナイザーを持つトランスフォーマー. アクションヘッドは実施形態特有の.
  • ** 精細調整コスト:** 50200のデモ + 24時間,単一のA100 GPUで.これはほとんどの研究ラボの利用範囲内です.
  • パフォーマンス: 100 つのターゲットロボットデモで精巧調節されたOctoは,WidowX,Franka,および他のテストされたプラットフォームで同じ100つのデモで 25~40%のトレーニングをゼロから上回っています.
  • インフェレンスの速度: 93Mパラメータは,単一のRTX 4090で15 Hzで動作するか,ジェットソン AGX Orin 8 Hzで動作する.
# Fine-tuning Octo on your own robot data (simplified)
# Requires: pip install octo-model jax[cuda]

from octo.model.octo_model import OctoModel
from octo.data.dataset import make_single_dataset

# Load pre-trained cross-embodiment model
model = OctoModel.load_pretrained("hf://rail-berkeley/octo-base")

# Load your target robot dataset (LeRobot HDF5 or RLDS format)
target_dataset = make_single_dataset(
    dataset_kwargs={
        "name": "my_openarm_dataset",
        "data_dir": "/data/openarm_pick_place/",
        "image_obs_keys": {"primary": "image_wrist", "secondary": "image_overhead"},
        "state_obs_keys": ["joint_positions"],
        "language_key": "language_instruction",
    },
    traj_transform_kwargs={"window_size": 2},
    frame_transform_kwargs={"image_size": (256, 256)},
)

# Fine-tune with new action head for your robot's action space
# OpenArm: 6 joint positions + 1 gripper = 7D action space
model = model.finetune(
    target_dataset,
    action_dim=7,
    action_head="diffusion",       # or "mse" for deterministic
    learning_rate=3e-4,
    batch_size=256,
    num_steps=50_000,              # ~2 hours on A100
    save_dir="./octo_openarm_finetuned/",
)

DROID: 横体内でのスケール

DROID論文 (Khazatsky et al., 2024) は,この分析を規模に焦点を当てて拡張した. 22 つのロボットと 564 つの環境における 76K 軌跡.クロスエンボディメントに関連する主要な DROID 発見:異なるロボットタイプから示例を追加することで,追加のロボットタイプが動力的にかなり異なる場合でも,ターゲットロボットで拡散ポリシーとACT 性能が改善された (WidowX vs. UR5など).

改善は均一ではなかった.非常に似たロボット (WidowX + WidowX-XL) のデータを追加することは,非常に異なるロボット (WidowX + モバイル操縦器) のデータを追加するよりも多くの助けとなった.しかし,遠くのクロス・エンボディメントデータでさえ,異なる物理プラットフォームにわたって有用な情報を共有する視覚的および意味的表現であることを示唆するポジティブな信号を提供した.

ロボットによる移転利益 類似性

Source Robot Target Robot Similarity Success Rate (Target Only) Success Rate (+Source Data) Improvement
WidowX-XL WidowX 250 Very High 62% 81% +19%
Franka Panda UR5e High (both 7-DOF) 55% 68% +13%
OpenArm WidowX 250 Moderate (6 vs 6 DOF) 62% 71% +9%
Franka Panda WidowX 250 Moderate (7 vs 6 DOF) 62% 70% +8%
Mobile Manipulator WidowX 250 Low 62% 65% +3%
Allegro Hand WidowX 250 Very Low 62% 62% +0%

パターンは明らかです 移転利益は 運動的類似性と関連していますが 中程度の類似性を持つロボットでさえ 意義ある改善をもたらします 目標ロボットで100回のデモがあれば 動力的に類似したロボットから1000以上のデモを追加すると 150200回のデモに相当する性能が得られる 目標ロボットだけで 50100%の効果的なデータ複製で 限界収集コストはゼロになります

身体間の 移植 が 機能 する の は なぜ です か

3つのメカニズムが責任があるようです

1.共有視覚機能: どのロボットが任務を実行しているかに関係なく,視覚入力 (オブジェクト,作業空間,作業構造) は類似している. 22種類のロボットに訓練されたモデルは,操作関連機能の視覚表現を,操作可能な表面の周りの端検知,オブジェクト状態の推定 (開/閉,完全/空),空間関係コーディング (上の,内,隣) よりも豊かに開発します.アクションデコーダーは,操作できない場合でも,視覚エンコーダーはデータ多様性から恩恵を受けます.

2. VLAにおけるアクションスペース抽象: OpenVLAや RT-2-Xのようなビジョン言語アクションモデルは,特定のロボットシナマティックから部分的に作業知識を分離するトークン化された抽象空間におけるアクションを表します. 行動がバインに分割される場合 (例えば,次元あたり256バイン) は,ウィドウXからの"右移動"トークンは,基礎にある共同軌跡が完全に異なるにもかかわらず,フランカからの"右移動"トークンに類似した意味を持つ.この抽象は,動力的に異なるプラットフォーム間でタスクレベルでの知識転送を可能にします.

3.言語の基礎: 言語指示がモデル入力の一部である場合 (RT-2-X,Octo,OpenVLAなど),モデルは実施形態間で共有された言語対行動マッピングを学習します. "赤いカップを拾い上げ"は,どのロボットが実行しているかにかかわらず同じことを意味します. この共有言語的基礎は,モーター実行戦略が異なる場合でも,実施形態を完全に転送する普遍的なタスク表示を提供します.

移転 が 失敗 する 場所

  • 非常に異なる運動学: 輪の移動プラットフォームと固定ベース臂間の転送はほぼゼロである.アクションスペースの不一致は共有視覚機能に克服できないほど大きい.モバイルベース (vx, vy, omega) のアクションは,6DOF臂の関節位置アクションに有用な梯度情報を提供していない.
  • **グリッパータイプ不一致:**並行マックグリッパーからのデータは吸い込みカップロボットに不調に転送され,反面です.接触相互作用モデルはあまりにも異なります.並行マックデータも他の並行マックロボットにうまく転送されます (手指の幾何学も異なる),しかし並行マックデモから学んだ握り込み段階の行動は吸い込みベースの握り込みに積極的に有害です.
  • DOFスケール不一致: 7DOFの武器からのデータは他の 7DOFの武器にうまく転送されますが, 4-DOFの武器には不十分です.次元差はアクションスペースカバーの問題を生み出します. 7DOFの腕は多くの角度から物体を接近することができます. 4DOFの腕は制限されています. 7DOFデータに訓練されたポリシーは,物理的に4DOFハードウェアに到達できないアプローチ戦略を開発します.
  • **スピードと動力格差:**高速産業腕からのデータ (サイクル時間 <0.5s) は,同じ作業のためのサイクル時間 35sを持つ研究腕に不調に転送されます.示例の時間格差 速度プロファイル,加速パターン,握着の閉じるタイミング は根本的に異なります. 視覚観測はフレームごとに似ていますが,アクションシーケンスには異なるリズムがあります.
  • **接触型と接触型フリー:**接触型作業 (スクロール,挿入,磨き) のデータにより,接触型作業 (接触,視覚検査) と逆の場合は最小の転送利益がもたらされます.学習された政策は,実施形態一般ではなく,作業型に特化した接触予想行動 (予想される接触前に遅い,特定の関節を硬化させる) を開発します.

実践的な共同訓練の設定

特定のロボットや任務のために 異体体化データを活用したいなら,RCSVでの経験の中で 最高の結果を出すワークフローです

ステップ1: データベースを選択する

OXEコレクションから,目標に似たDOFとグリッパータイプを持つロボットからデータセットを選択します.並行マックグリッパーを持つ6DOF腕 (OpenArmのような) の場合は,最良のソースは:ブリッジV2 (WidowX,60Kエピソード),DROIDサブセット (6-DOF腕, ~15Kエピソード),およびRCSV共有プール (OpenArm +類似, ~10Kエピソード). 携帯操作,手技,高DOFデータセットを避ける

ステップ 2: 行動空間を正常化する

異なるロボットには異なる関節構成があり,原始関節空間アクションが転送されない.標準アプローチは,すべてのアクションをエンドエフェクター空間に変換することです: (dx, dy, dz,droll, dpitch, dyaw,griper).この7Dデルタエンドエフェクター表示は,DOF数とgriperのいずれかによってすべての単臂操作で普遍的です. 変換は各ロボットの前向きの運動 (URDF + FK 溶解器) を利用し,各データセットに1回前の処理ステップである.

# Action space normalization: joint space -> EE delta space
import numpy as np
from lerobot.common.robot_devices.robots.configs import OpenArmConfig

def joint_to_ee_delta(joint_actions, joint_states, robot_config):
    """Convert joint-space actions to end-effector delta actions.

    This normalization is required for cross-embodiment training:
    different robots have different joints but share the same
    6D end-effector space.
    """
    ee_deltas = []
    for i in range(len(joint_actions)):
        # FK at current state
        ee_current = robot_config.forward_kinematics(joint_states[i])
        # FK at next state (current + action)
        ee_next = robot_config.forward_kinematics(
            joint_states[i] + joint_actions[i, :robot_config.n_joints]
        )
        # Delta in EE space
        delta_pos = ee_next[:3] - ee_current[:3]
        delta_rot = quaternion_to_axis_angle(
            quaternion_multiply(ee_next[3:7], quaternion_inverse(ee_current[3:7]))
        )
        gripper = joint_actions[i, -1]  # gripper action passes through
        ee_deltas.append(np.concatenate([delta_pos, delta_rot, [gripper]]))
    return np.array(ee_deltas)

ステップ3: データセットの混合戦略

対象ロボットデータとクロス・インボディメントデータとの間の混合比率は,重要なこと. 対象特定細かい詳細を圧倒するクロス・インボディメントデータが多いが,あまり少ないことが何の利点ももたらさない. 対象データセットサイズに基づいて推奨する比率は:

  • <50 ターゲットデモ: Mix 1:10 (target:cross) モデルには,ターゲット信号が少ないため,多様性が必要.最も類似したロボットからデータがある.
  • 50200 ターゲットデモ: Mix 1:5. これはクロス化体が最も相対的な利点をもたらす甘い点です モデルには視覚的およびタスク表現のためにクロス化体を利用しながら特定のロボットの動態を学ぶのに十分なターゲットデータがあります.
  • 2001,000目標デモ: 1:2 ミックス.クロス・インボディメントデータには役立つが,限界利益は減少している.最高品質のクロス・インボディメントデータセットのみに焦点を当てます.
  • >1,000 ターゲットデモ: 横体化前の訓練は依然として有益 (初期化として使用する),しかし細かな調整中に混合することは減少する収益をもたらします.OctoまたはOpenVLA チェックポイントから訓練し,対象データのみで細かな調整します.

ステップ 4: 訓練 の 構成

実施形態条件のトレーニングを使用する:モデルの入力配列に学習可能な実施形態トークン (ロボットタイプごとに1つ) を追加する.これは,モデルがすべてのロボットに視覚的およびタスク表示を共有しながら実施形態特有の行動パターンを学ぶことを可能にする.ターゲットロボットでの推論中に,モデルはあなたのロボットの実施形態トークンを使用します. 費用:A100で8時間程度 完全なコートレーニングで200Kの混合エピソード.

ハグ・フェイス・レロボットとの共同訓練

HuggingFaceのLeRobotフレームワークを通じて インターボディメントコートレーニングを実行する最もアクセス可能な方法は 標準化されたデータロード,モデルトレーニング,評価インフラストラクチャを提供するものです

# LeRobot co-training config (YAML)
# Save as: configs/co_train_openarm.yaml

dataset:
  # Primary: your target robot data
  repo_id: "svrc/openarm_pick_place_v2"
  mix_datasets:
    # Cross-embodiment data, weighted by similarity
    - repo_id: "lerobot/bridge_v2"
      weight: 0.3    # WidowX - moderate similarity
    - repo_id: "lerobot/droid_franka"
      weight: 0.2    # Franka - moderate-high similarity
    - repo_id: "svrc/shared_pool_6dof"
      weight: 0.4    # RCSV pool - high similarity
  action_space: "ee_delta_7d"  # Normalized EE space

policy:
  name: "diffusion"
  pretrained: "lerobot/diffusion_oxe_base"  # OXE pre-trained
  chunk_size: 16
  n_obs_steps: 2
  n_diffusion_steps: 100

training:
  batch_size: 256
  learning_rate: 1e-4
  num_epochs: 200
  eval_freq: 10
  device: "cuda"

# Run: python lerobot/scripts/train.py --config configs/co_train_openarm.yaml

身体間の利益を測定する

特定のケースに 裏切りデータが実際に役立つかを知るには 制御実験を実行します

  1. ベースライン: 対象ロボットデータのみを訓練する. 50以上の評価エピソードで成功率を記録する.
  2. +クロス・インボディメント: 対象データとクロス・インボディメントデータとの混合でトレーニングする.同じモデルアーキテクチャ,同じハイパーパラメータ,同じ評価プロトコル.
  3. +先訓練 init: Octo/OpenVLA チェックポイントから初期化して,対象データのみを細かく調整します.
  4. フルパイプライン: 精細調整中に,予備訓練されたチェックポイントから初期化し,交叉体体体データを混ぜます.

私たちの経験では,オプション3 (前訓練 init + 対象のみの微調整) は,ほとんどのチームにとってオプション2 (ランダム init + ミックストレーニング) を上回る.前訓練の視覚表現は,転送利益の主な源であり,チェックポイントから"無料"にやってくる.オプション4はオプション3より510%の改善をもたらしますが,トレーニング時間と複雑さを倍にする.

RCSVの勧告: 目標ロボットで示範200件未満のチームでは,3つ目のオプションから始めます:Octoベースチェックポイントをダウンロードして,単一のA100で24時間データを細かく調整し,評価します.パフォーマンスが不足している場合は,完全な共同訓練パイプライン (オプション4) に投資します. 複雑性が大きいので,選択肢3よりも利点はしばしば低いので,直接オプション4に飛び出さないでください.

現行の制限

  • ネガティブ転送は実用です: 非常に異なるロボットからのデータ (異なるDOF,異なるグリッパータイプ,異なるタスク領域) を追加すると,ターゲットのみのトレーニングと比較してパフォーマンスは損なわれる.常に上記の制御実験で検証します.
  • アクションスペースの正常化により情報が失われます. EE デルタ空間に変換すると,冗長解像度情報が排除されます (腕の肘/肩の配置がどのように変化する).腕の配置が重要である課題 (混乱した環境への到達,肘の障害を回避) では,EEE空間共同訓練の後,関節空間の微調整は時々必要になります.
  • データセット品質の差異: OXEとDROIDデータセットは示範品質に大きく異なる.一部の研究室には専門家操作員があり,他の研究室では初心者操作員または部分的に自動化されたシステムを使用しています.クロス・インボディメントソースからの低品質の示範は,あなたの目標方針を劣化させる騒音を導入することができます.あなたのクロス・インボディメントミックスを慎重に管理してください.
  • 計算コストスケールは線形: 複数のクロス・インボディメントデータにより,比分比的により多くのトレーニング計算を意味します.単一のGPUを使用するスタートアップの場合,完全なOXE共同トレーニングは3~5日かかります.前訓練のチェックポイント (Octo, OpenVLA) はこのコストを償却します.
  • シムからリアルギャップ複合体: 交互体化データにはシミュレーションデータが含まれている場合 (OXEデータセットによってはそうなります) 交互体化ギャップは交互体化ギャップに追加されます.

未来:ユニバーサルロボット財団モデル

ロボット分野は,数百種類のロボット,数百万のエピソード,数千のタスクのデータに基づいて訓練された基礎モデルに向かって進んでいます. プロジェクトとしては,GPTが数十億のウェブページで訓練されたように,GPTは数十億のウェブページで訓練された. このモデルが成熟すると 交代体移植は"慎重な共同訓練レシピ"から"チェックポイントダウンロード 細かな調整 30分 展開"へと移行します 2026年にはまだそこには達していませんが 差は急速に縮まっています

今日 チーム 構築 の ため に 実践 的 な 助言 は: 標準化 形式 (LeRobot HDF5 や RLDS) で データを 収集 し て 完全 の 校準 資料 を 配備 し て,これらの 基礎 モデル から 利益 を 得る ため です. 今日 適切な 形式 で 収集 さ れ た データ は 12 ヶ月 後に 現在 より 価値 を 増す こと が でき ます.

RCSVを通じてデータ共有

RCSVは,クライアントが貢献し,利用できる共有されたクロス・インボディメントデータセットプールを保持しています.RCSVの [データサービス] (T7) を通じてデモデータを収集すると,他のプラットフォームからクロス・インボディメント前のトレーニングデータへのアクセスを引き換えに,共有されたプールに匿名化デモを寄与するオプションがあります. このプールは,現在OpenArm,WidowX,Franka,UR5e,Unitree Z1プラットフォームで25,000+エピソードを保有しており,毎週新しい貢献が追加されています.

RCSVは,独自のハードウェアで収集されたデータを貢献したいチームのために,フォーマットコンプライアンス,示範品質 (スムーズ性,成功率,カメラの校正) およびプライバシー (カメラビューで識別可能な情報がない) をチェックする検証パイプラインを提供します.検証された貢献は,プール内のすべてのデータに対して代償可能なデータクレジットを獲得します.

関連 読書

ACTポリシー説明 · 模倣学習における一般的な誤り · テレオペレーションを開始 · RCSVデータセット · ロボット学語彙

リーバージ クロスインボディメント プレトレーニング

5つのロボットプラットフォームで 交互式訓練データを提供します パイロットの試乗は2,500ドルと100のデモで開始します

[データサービスを探求] (T13) [データエンジニアと話] (T14)