Researchに戻る

多タスクロボット学習: よりよい政策のためのタスクを介してデータを共有する

多作業ロボット学習に関する調査 複数の作業,作業条件付け,作業共有が政策のパフォーマンスを害する対効果を及ぼすときの共同訓練

[←研究]

多重作業の共同訓練は,操作政策のパフォーマンスを向上させる最も信頼できる方法の一つです.この調査はアーキテクチャ,データミックス,そして分別と共有のタイミングをカバーします.

なぜ 多重 の 作業 を 学ぶ べき です か

単作業ロボット政策は根本的な制限があります:単作業のデータのみを訓練し,関連作業の間の視覚的理解の共有の可能性を無駄にします.赤カップを選べるだけ訓練された政策は,青いカップ,緑のボトル,金属缶に適用される一般的なスキルである"ピックリング"を決して学びません.

多重作業学習は,複数の関連作業の示範を同時に共同訓練することで,この課題に取り組んでいます.

  • 共有視覚機能 作業場を共有するタスクは視覚的意味を共有する. "ピックカップ", "ピックボトル", "ピックボウル"を訓練した表現は"捉えられるオブジェクト"を概念として学習します.シングルタスクトレーニングは"カップ"のみを学習します.
  • 訓練ランクごとにより多くのデータ 10つのタスク × 200 つのデモ = 2000 件のトレーニング例合計,すべて共有表現に貢献します.各個別のタスクは機能学習のためのすべての 2,000 つの事例にアクセスできます.
  • 新しいタスクのためのより良い基礎 多タスク政策は,単タスク政策よりも,真に新しいタスクに適応する.

任務の条件付け方法

多重作業政策は,どの作業を遂行するかを知らなければなりません.

  • 言語指示 柔軟性が高い.ポリシーは"赤いカップを拾ってゴミ箱に放す"のようなテキストを受け取ります.タスク埋め込みを作成するために言語エンコード (T5, CLIPテキストエンコード) を使用します.新しい指示にゼロショット通用化が可能です.OpenVLA,RT-2,SayCanによって使用されます.
  • ** One-hot task ID** シンプル.ポリシーはタスクインデックス (タスク 0,タスク 1, ...,タスク N) を受信します.言語理解は必要ありません.タスクセットが固定され,小さいとき (<20タスク) でうまく動作します.多くのオフライン RL 文書で使用されます.
  • 目標画像 政策は,望ましい最終状態のイメージを受け取ります.言語は必要ありません. 言葉で説明するのが難しいタスクで動作します.制限:目標画像を収集することは労働費がかかり,政策は,目標の外観ではなく,どのような行動が目標を生むかを推論する必要があります.

共同訓練の利点: 出版された著作からの証拠

多重作業共同訓練の経験的証拠は強くあります

  • Open X-Embodiment 完全多様なデータセット (22実施形態,527タスク) のトレーニングは,単一のデータセットが大きいタスクでも一貫して単一のデータセットのトレーニングを上回ります. 多様なタスク →よりよい一般化.鍵となる発見:多様なタスクが関係のないように見える場合でも,より多様な方が良い.
  • ALOHA双手作業 25つの双手作業 (折り畳み,パッケージ,組み立て) の共同訓練は,共有エンコーダーは,各タスクモデルに比べてすべてのタスクのパフォーマンスを向上させることを示した. 改善は,少数の示範を持つ稀なタスクにおいて最も大きい. 20つのデモを持つタスクは,多タスクトレーニングでは80のデモを持つタスクのように,単タスクトレーニングでは同様に機能する.
  • Bridge V2 +他のデータセット OpenVLAの微調整に Bridge V2データを追加することで,新オブジェクトの概括を1020パーセントポイントに改善し,ターゲットデータセットのみに微調整する.Bridge V2のタスクが目標タスクと異なる場合でも.

負の 移転: 作業 を 共有 する こと が 痛い 時

共有の恩恵はすべてのタスク組合に与えられない. 負の転送は,複数のタスクに関するトレーニングが一緒に,個々の単作業政策よりも劣る政策を生み出すとき起こります.

  • 対立するアクション分布 "擦りテーブル" (広い掃描動き) と "選択オブジェクト" (正確な位置付け) は,根本的に異なるアクション分布を持っています.共有の政策責任者はこれらの平均を試み,どちらも良い軌道を生み出します.
  • 矛盾する視覚表現 細粒質 (縫い,電子機器) に注意を払う必要のある作業は,グローバルなシーン理解を要求する作業 (ナビゲーション,ゴミ収集) と矛盾する.
  • 異なるハードウェア設定 複数の指の手からのデータと並行なマハグリッパーからのデータとのコートレーニングにより混乱したアクションシーケンスが生じます.ハードウェア特有のデータを別々に保持します.
  • 原則として,同じ最終効果を共有し,同じ作業場にある物体で動作する作業が2つの場合,ほぼ常に共同訓練から利益を得ます.

建築の選択

  • 単一の共有エンコーダー +タスク特定ヘッド 最も一般的な.共有レスネットまたはVITエンコーダーは視覚機能を抽出する.タスクごとにMLPヘッドはアクションを予測する.タスクが視覚的なコンテキストを共有するが,アクション分布に異なる場合は良い.
  • 専門家混ぜ合わせ 各に複数のタスクを専門とするN専門ネットワーク.ゲティングネットワークは適切な専門家への入力路由を移動します.矛盾するタスクの負の転送を減らす.いくつかの多タスクRL作業で使用されます.
  • ハイパーネットワーク/タスク条件による重量生成 超ネットワークがタスクを組み込むことでタスクに特有の政策重量を生成するメタ学習アプローチ.最も柔軟性のあるが訓練するのが最も複雑です.
  • ほとんどの実践的な多タスク操作作業では,言語タスクコンディショニングと拡散アクションヘッド (Octoのような) を共用した ViTエンコードが現在のベストプラクティスです.

データ 混合 戦略

  • タスク対比サンプル 各タスクをそのデータセットサイズに比例してサンプルする.最大のデータセットはトレーニングを支配する.リスク:少数のデモを持つ稀なタスクは,不足しており,改善しない可能性があります.
  • 稀な作業の過量 単一の作業のサンプル採取 (規模に関係なく,作業ごとに同じ確率) は稀な作業の過量採取を阻害し,それらを溺れさせることが多い.
  • カリキュラムミックス シンプルな作業から始め,徐々に難しい作業を導入する.人間の学習を反映する:複雑なスキルよりも基礎技能.特に課題の困難が幅広い範囲をカバーするときに有用です.
  • 困難度別サンプル 政策の現在の業績に逆比例したサンプルタスク. 低性能タスクはより多くのデータを得ます. 適応的で,収束を改善することができますが,オンラインでの業績推定が必要です.

多重作業政策の評価

** 完成した作業概括**は,金基準である. N の作業を訓練し,訓練中に見られなかった M の作業を評価する.

実施されたタスク概括に関する結果: 25以上のタスクで言語条件付けを訓練した政策は,通常,類似の手頃なところの真に新しいタスクで40~70%の成功を達成する.単作業政策は,同じ新しいタスクでほぼゼロを達成する.このギャップは,多作業訓練の価値を表しています.

実践 的 な 導き

  • 関連作業が3つ以上とハードウェア/エンドエフェクターが同じ場合,常にコートレーニングをします.
  • 言語のコンディショニングを使用する 部署時に言語を使用する意図がない場合でも 作業の表現を改善し,データ収集を簡素化します (各作業を口頭で説明するだけです).
  • 作業の表達が 作業の交差比一般化よりもはるかに高い場合,学習ではなく記憶をします.
  • 異なるモデルが正当化されるのは,本当に異なるハードウェア,センサー,または行動方式を必要とする作業だけである.

[RCSVデータサービス]T1) ページで多作業データ収集ツールを探索するか, [研究プラットフォーム]T2を通じて,以前に収集された多作業データセットにアクセスしてください.

RCSV データで多タスクポリシーを作成する

30以上のタスク,標準化された評価基準,および多タスクロボット学習のためのGPUトレーニングインフラストラクチャの多様な操作データセットにアクセスします.

[データサービスを探求]