Datasetsに戻る

ロボミミック: 規則的な模倣学習基準

Robomimic を 探求する: 6 つのタスク スイート, 1000 以上の デモをタスクごとに, robosuite と MuJoCo で構築する.

実践者のロボミミックガイド ARISEイニシアチブの6つのタスク・スーツの基準値でBC-RNN,BC-Transformer,および拡散政策評価の基準となる.

TL;DR

Metric Value
Task suites 6 (Lift, Can, Square, Transport, ToolHang, NutAssembly)
Robots Franka Emika Panda, Rethink Sawyer (simulated in robosuite)
Modalities Low-dim state, RGB (agent + wrist camera), object poses
License MIT
Size ~1,000 demonstrations per task × 3 data qualities (PH, MH, MG)
Simulator robosuite (MuJoCo)

ロボミミックは?

ロボミミックはスタンフォード大学のアリスイニシアチブ (Ajay Mandlekar, Danfei Xu, Josiah Wong, et al.) によって導入され,ロボット操作のための模倣学習で実際に何が機能するかを厳格な経験的研究として導入されました. チームは各タスクの示範の3バージョンを集めて,結果として18の組み合わせ (タスク,データ品質) を介して大規模なアルゴリズムスイープ (BC,BC-RNN,HBC,IRIS,BCQ,CQL(Conservative Q-Learning),およびいくつかのオフラインRLベースライン) を実行した. 論文の核心貢献は,歴史によるBC (BC-RNN) が非常に強い基軸であり,データ品質が高くなったとき,オフラインRLと模倣学習の間のギャップが崩壊することを示した.

紙の付随したソフトウェアリリース T1 Python パッケージ はベンチマーク自身よりも影響力が高くなりました.それはクリーンな HDF5 データフォーマット,統一トレーニングループ,構成可能なアルゴリズムクラス,そしてRobosuiteで決定的評価を配備しています.これは過去4年間の行動クローン紙を複製する最も速い方法です. 拡散政策,ACT,BeTは全てロボミミック数字を定例的なデータ基準として報告しています.

RobomimicはLibEROの直接的な知的祖先でもある.LibEROは,robosuiteシーン形式とHDF5コンベンションを保持し,生涯学習カリキュラムで拡張しています.Robomimicを理解しているなら,あなたはすでにLibEROの水道設備の80%を知っている.

ダウンロードと読み込み方法

スタンフォードの鏡から HDF5ファイルを取り出す 単行本ダウンロードスクリプトを ロボミミックが発送します

# Install the framework
pip install robomimic

# Download all task suites at PH, MH, and MG quality
python -m robomimic.scripts.download_datasets \
  --tasks lift can square transport tool_hang nut_assembly \
  --dataset_types ph mh mg \
  --hdf5_types image low_dim

# Train a Diffusion Policy baseline
python -m robomimic.scripts.train \
  --config configs/diffusion_policy.json \
  --dataset datasets/square/ph/low_dim_v141.hdf5

# Evaluate the trained checkpoint in robosuite
python -m robomimic.scripts.run_trained_agent \
  --agent trained_models/.../model_epoch_2000.pth \
  --n_rollouts 50 --video_path eval.mp4

HDF5 フォーマットは自定義しています 各軌道は観測,アクション,報酬,オブジェクトポーズを含みます ロボミミックトレーニングループを完全に回避し,エピソードを10行の粘着コードで自分のフレームワーク (レロボット,オクト,ディフューザー) にフィードすることができます.

共通用例とモデルペアリング

  • BC基線**BC-RNNとBC-Transformer on Robomimicは,すべての新しい模倣紙が打ち負かさなければならない.
  • 拡散政策評価. チェン・チの拡散政策論文では,Robomimicを主要基準として使用し,すべてのフォローアップ論文は同じタスクリストを維持しています.
  • オフラインRL比較. MG (機械生成) 分割は,オフラインRL研究のために特別に設計されたほんの数のロボット操作データセットの一つです.
  • ** Sim-to-realカリキュラム.** 課題は MuJoCo ベースなので,チームは現実データに切り替える前に,Robomimic Liftや Squareでリアルロボットフランカのポリシーを温め始める.

ランキングとランキング

ロボミミック・トラックは,タスクごとに50以上の展開を平均して成功率に記録している.ディフュージョン・ポリシーは,PH分割からリフトとカーン,スクエアで95%+,輸送とツールハングで80%+を報告している.参照番号については, [コードのロボミミック入力のある紙] (T5), [公式プロジェクトページ] (T6),および [マンデカール・コール・コール・コール2021紙] (T7) を参照してください.

技術的な深層潜水: PH vs MH vs MGデータ

ロボミミックの最も有用な設計決定は,すべてのタスクが3つのデータ品質システムで完成することです. **プロフェッショナル・ヒューマン (PH) **は,このタスクに関する広範な実践を持っていた1人の専門家テレオペレータによる200のデモです. **ミックス・ヒューマン (MH) **は,異なるスキルを持つ6人のテレオペレータに分かれて300のデモです.

CORL 2021 論文の経験的なポイントは,PH データにおけるBC-RNNは,すべてのタスクでテストされたすべてのオフライン RL 方法に一致するか,それを上回るということです.MH データではギャップが狭くなっているが,BC はまだ勝利する.MG データでは,オフライン RL 方法 (特に CQL(Conservative Q-Learning) と IRIS) が BC を上回っているため,BC がデータと同じくらい良いことができるという理論的期待に一致しています. この理由から,拡散政策とフォローアップ論文では PHと MHの数字がほとんど常に最初に報告されます.

細かなが重要なもう一つの詳細は, T2 vs T3観測分割である.低深度の観測には,真相物体ポーズが含まれ,ピクセルよりも学ぶことが容易である.常に両方の数字を報告する.

既知の制限

  • ** シミュレーションのみ.** すべてのデータは MuJoCo生成されています. Sim-to-real転送は直接サポートされていません.
  • タスクごとに小さなカバー.* 作業ごとに200-300のデモは現代VLA標準では小さく.ミミックジェンは特にロボミックシドをスケールするために設計されました.
  • 言語指示はありません. 作業は自然言語ではなく IDで識別されますので,Robomimicは言語条件のポリシーを直接訓練することはできません.
  • Franka/Sawyerのみ. 横体移植は,Open X-Embodimentまたは類似の組み合わせが必要です.

常識問題

LibEROが存在した現在,Robomimicは時代遅れになったのでしょうか? 違う Robomimicは依然として最もきれいな単作業 BC基準です. LIBEROは生涯学習の基準です.彼らは異なる目的を果たし,インフラを共有しています.

データのセットを使用せずに,Robomimicをトレーニングフレームワークとして使用できますか?

** 新しいアルゴリズムをベースラインに出す最も速い方法は?** 送信された設定で6つのタスクすべてでBC-RNNとPHデータでの拡散ポリシーを実行します.これは2GPU日かかります.そして再生可能な比較ポイントを提供します.