ロボミミック: 規則的な模倣学習基準
Robomimic を 探求する: 6 つのタスク スイート, 1000 以上の デモをタスクごとに, robosuite と MuJoCo で構築する.
実践者のロボミミックガイド ARISEイニシアチブの6つのタスク・スーツの基準値でBC-RNN,BC-Transformer,および拡散政策評価の基準となる.
TL;DR
| Metric | Value |
|---|---|
| Task suites | 6 (Lift, Can, Square, Transport, ToolHang, NutAssembly) |
| Robots | Franka Emika Panda, Rethink Sawyer (simulated in robosuite) |
| Modalities | Low-dim state, RGB (agent + wrist camera), object poses |
| License | MIT |
| Size | ~1,000 demonstrations per task × 3 data qualities (PH, MH, MG) |
| Simulator | robosuite (MuJoCo) |
ロボミミックは?
ロボミミックはスタンフォード大学のアリスイニシアチブ (Ajay Mandlekar, Danfei Xu, Josiah Wong, et al.) によって導入され,ロボット操作のための模倣学習で実際に何が機能するかを厳格な経験的研究として導入されました. チームは各タスクの示範の3バージョンを集めて,結果として18の組み合わせ (タスク,データ品質) を介して大規模なアルゴリズムスイープ (BC,BC-RNN,HBC,IRIS,BCQ,CQL(Conservative Q-Learning),およびいくつかのオフラインRLベースライン) を実行した. 論文の核心貢献は,歴史によるBC (BC-RNN) が非常に強い基軸であり,データ品質が高くなったとき,オフラインRLと模倣学習の間のギャップが崩壊することを示した.
紙の付随したソフトウェアリリース
RobomimicはLibEROの直接的な知的祖先でもある.LibEROは,robosuiteシーン形式とHDF5コンベンションを保持し,生涯学習カリキュラムで拡張しています.Robomimicを理解しているなら,あなたはすでにLibEROの水道設備の80%を知っている.
ダウンロードと読み込み方法
スタンフォードの鏡から HDF5ファイルを取り出す 単行本ダウンロードスクリプトを ロボミミックが発送します
# Install the framework
pip install robomimic
# Download all task suites at PH, MH, and MG quality
python -m robomimic.scripts.download_datasets \
--tasks lift can square transport tool_hang nut_assembly \
--dataset_types ph mh mg \
--hdf5_types image low_dim
# Train a Diffusion Policy baseline
python -m robomimic.scripts.train \
--config configs/diffusion_policy.json \
--dataset datasets/square/ph/low_dim_v141.hdf5
# Evaluate the trained checkpoint in robosuite
python -m robomimic.scripts.run_trained_agent \
--agent trained_models/.../model_epoch_2000.pth \
--n_rollouts 50 --video_path eval.mp4
HDF5 フォーマットは自定義しています
共通用例とモデルペアリング
- BC基線**BC-RNNとBC-Transformer on Robomimicは,すべての新しい模倣紙が打ち負かさなければならない.
- 拡散政策評価. チェン・チの拡散政策論文では,Robomimicを主要基準として使用し,すべてのフォローアップ論文は同じタスクリストを維持しています.
- オフラインRL比較. MG (機械生成) 分割は,オフラインRL研究のために特別に設計されたほんの数のロボット操作データセットの一つです.
- ** Sim-to-realカリキュラム.** 課題は MuJoCo ベースなので,チームは現実データに切り替える前に,Robomimic Liftや Squareでリアルロボットフランカのポリシーを温め始める.
ランキングとランキング
ロボミミック・トラックは,タスクごとに50以上の展開を平均して成功率に記録している.ディフュージョン・ポリシーは,PH分割からリフトとカーン,スクエアで95%+,輸送とツールハングで80%+を報告している.参照番号については, [コードのロボミミック入力のある紙] (
技術的な深層潜水: PH vs MH vs MGデータ
ロボミミックの最も有用な設計決定は,すべてのタスクが3つのデータ品質システムで完成することです. **プロフェッショナル・ヒューマン (PH) **は,このタスクに関する広範な実践を持っていた1人の専門家テレオペレータによる200のデモです. **ミックス・ヒューマン (MH) **は,異なるスキルを持つ6人のテレオペレータに分かれて300のデモです.
CORL 2021 論文の経験的なポイントは,PH データにおけるBC-RNNは,すべてのタスクでテストされたすべてのオフライン RL 方法に一致するか,それを上回るということです.MH データではギャップが狭くなっているが,BC はまだ勝利する.MG データでは,オフライン RL 方法 (特に CQL(Conservative Q-Learning) と IRIS) が BC を上回っているため,BC がデータと同じくらい良いことができるという理論的期待に一致しています. この理由から,拡散政策とフォローアップ論文では PHと MHの数字がほとんど常に最初に報告されます.
細かなが重要なもう一つの詳細は,
既知の制限
- ** シミュレーションのみ.** すべてのデータは MuJoCo生成されています. Sim-to-real転送は直接サポートされていません.
- タスクごとに小さなカバー.* 作業ごとに200-300のデモは現代VLA標準では小さく.ミミックジェンは特にロボミックシドをスケールするために設計されました.
- 言語指示はありません. 作業は自然言語ではなく IDで識別されますので,Robomimicは言語条件のポリシーを直接訓練することはできません.
- Franka/Sawyerのみ. 横体移植は,Open X-Embodimentまたは類似の組み合わせが必要です.
常識問題
LibEROが存在した現在,Robomimicは時代遅れになったのでしょうか? 違う
データのセットを使用せずに,Robomimicをトレーニングフレームワークとして使用できますか?
** 新しいアルゴリズムをベースラインに出す最も速い方法は?** 送信された設定で6つのタスクすべてでBC-RNNとPHデータでの拡散ポリシーを実行します.これは2GPU日かかります.そして再生可能な比較ポイントを提供します.







