Blogに戻る

ロボミミック: ロボット模倣学習基準の完全なガイド (2026)

RoboMimicは説明しました:データセット,BC/offline-RLアルゴリズム,ロボット操作のための標準評価プロトコル <unk> 合成デモのためのMimicGen.

RoboMimicは,ロボット操作作業における模倣学習とオフラインRLアルゴリズムを評価するための標準基準である.新しい政策学習方法を開発または評価している場合は,あなたの結果は RoboMimicに対して報告する必要があります.このガイドはデータセット,アルゴリズム,実験を実行する方法,およびRCSVハードウェアを使用して新しいRoboMimic互換性データ収集する方法について説明します.

ロボミミックは 何ですか?

ロボミミックは,スタンフォード大学でAjay Mandlekar et al.によって開発され,CoRL 2021で公開された,デモからロボット学習のためのフレームワークとベンチマークです. 操作者の質が異なる デモンストレーションデータセットのキュレーティングコレクション 模倣学習とオフライン RLアルゴリズム実装のセット そして 標準化された評価プロトコルで 紙面比較を意味のあるものにする

RoboMimic以前は,模倣学習論文を比較することは困難でした. 各グループは異なるオペレーター,異なる品質基準,異なる評価プロトコルで独自のデータセットを収集したからです. 論文で80%の成功率を主張した論文は専門家からの簡単な示範を使用しているかもしれないし,別の論文では60%が新手からの混乱した示範を使用しているかもしれない. 数字は比較できない. RoboMimicは,誰もが訓練する固定的な公共データセットを提供することで,基準数字を直接文書や実装間で比較できるようにしました.

RoboMimicは評価のためにrobosuite シミュレーション環境 (MuJoCo上で構築) を使用し,物理的なハードウェアなしで結果を正確に再生できます.

ロボミミックデータセット

RoboMimicには4つのタスクが含まれ,それぞれは異なるスキルレベルのオペレーターから収集された複数のデータセット変数があります.この多品質構造はベンチマークの最も重要なデザイン決定です. データのセット品質に対するアルゴリズムの強度をテストすることができます. 現実世界のデータ収集が混ざった品質の示範を生むため,これは実践で非常に重要です.

任務

Task Description Difficulty Demo Count
Lift Pick a small cube off a table and raise it above a height threshold Easy 200 per variant
Can Pick a soda can from a bin and place it in a designated target region Medium 200 per variant
Square Pick a square nut and fit it onto a peg — requires precise insertion alignment Hard 200 per variant
Transport Two-arm task: pick a hammer from a closed bin, transfer between arms, place in target bin Very Hard 200 per variant

データセット バリアント

各タスクには,異なるレベルの操作者の一貫性を反映する4つのデータセット変数があります.

  • PH (Proficient-Human): 連続で滑らかな動きですべての試験を成功に完了した高度な操作者の示例.これは低変異性,高品質のデータセットから学ぶ最も簡単なデータセットです.
  • MH (Multi-Human): 技能レベルが異なる6人のオペレーターによる実証:1人の"劣悪"オペレーター,3人の"大丈夫"オペレーター,2人の"より良い"オペレーター (PHの熟練した人間) 操作者は異なる戦略を使用し,成功率も異なります.これは最も現実的なデータセットです.
  • MHサブセット: MHの劣悪/良好/良くないサブセットを別々にダウンロードし,品質フィルターがパフォーマンスに影響する方法を研究することができます.
  • RH (Rendered-Human): 視覚政策の評価のために,状態に基づく観察ではなく画像観察で示した示例.

ほとんどの研究目的では,MHデータセットは最も情報提供的な基準であり,アルゴリズムの騒音の示例をフィルタする能力とマルチモダルのデータから学ぶ能力の両方をテストしている.MHでPHが高く,MHでははるかに低いアルゴリズムは,クリーンデータに過剰な問題がある.

ファイルフォーマットとダウンロード

RoboMimic のデータセットは標準的なスケーマで HDF5 形式で保存されます.各ファイルはタスクとオペレーター品質によって命名されます.

単一のロボミミックデモファイルリフト_ph__dim.hdf5 /data/ demo_0/ /obs/ robot0_eef_pos # (T, 3) 終効果位置ロボット0_eef_quat # (T, 4) 終効果方向ロボット0_gripper_qpos # (T, 2) 握手関数位置 対象 # (T, 14) 対象ポーズ + その他のエンv obs /アクション # (T, 7) デルタ EEF pos + ori + gripper /rewards # (T,) ステップごとに成功 (sparse 1.0 で) /ドーンズ # (T,終了フラグ demo_1/ ... /mask/ train # train 分割指数 適用 # 分割の有効なポイント)

公式のロボミミックウェブサイトからデータセットを T0でダウンロードする.ファイルは50MB (lift_ph_low_dim) から14GB (transport_mh_image) までです.低次元変数は (状態観測のみ) より速くトレーニングされ,アルゴリズム開発に十分です.視覚的政策評価のために画像変数は必要です.

アルゴリズム:BC,BC-RNN,HBC,IRIS

ロボミミックは4つのアルゴリズムを基準基線として実装しています.どのアルゴリズムを訓練するか選択する前に,それぞれが何をしているか,いつ働いているかを理解することが不可欠です.

BC (行動クローン)

基本線:予測された行動と実証された行動間のMSEを最小限に抑えるフィードバック・フードワードMLPポリシー.観測:現在のロボット状態 (および/または画像).アクション:デルタエンドエフェクターポーズ.現在のフレームを超えた時間的な文脈はありません. BCは,リフト (簡単作業,低多動性) で合理的なパフォーマンスを発揮するが,最近の軌道の歴史を記憶していないため,示例変異性を処理できないため,カーンとスクエアで大幅に低下する.

動作する時: 低変数示範,短視野 (単発把握),多段階調整の要求がない作業.

失敗時: ロボットが今やったことを覚えておく必要がある任務 (複数ステップでの作業ではよくある) または戦略の示範が異なる場合.

BC-RNN (リクリカルなネットワークによる行動クローン)

BCは,MLPではなくLSTMの背骨を持つ.LSTMはタイムステップを通して隠された状態を維持し,政策タイムメモリーを与えます.これは,次に何をすべきかを決定するために腕の動きの歴史を知ることが不可欠であるキャンと輸送のような多段階のタスクでのパフォーマンスを大幅に改善します. 2層 LSTM (400 層あたり隠された単位) の BC-RNN は,最も強い標準 BC ベースラインであり,模倣学習論文で最も一般的に報告されている数字です.

動作する時: 多段階のタスク,時間依存性のあるタスク,ロボットが以前の接触状態を記憶する必要があるタスク.

失敗すると: 高多動性 (複数の有効戦略) のタスク LSTM は隠れた状態で戦略の間で平均を設定し,MHデータセット上のモード平均的なアーテファクトにつながります.

HBC (階層的な行動クローン)

レベル2階層階層階層の政策:高レベルの"プランナー"はサブゴール状態を予測する (例えばロボットの中間配置) と低レベルの"コントローラー"は各サブゴールに到達することを学ぶ.階層階層は,長視線作業に役立つ誘導構造を提供します. HBCは通常,輸送と広場 (長平線作業) で BC-RNN を上回るが,特にサブゴール平線長さの際には,より注意深くハイパーパラメータの調節が必要である.

IRIS (サブゴールを持つ模倣のための暗示表現)

IRISは,HBCを改良したサブゴール表示学習で拡張します.原始ロボット状態サブゴールを予測する代わりに,IRISはワークスペースステートの暗示表現を学習します.それは計画者がより抽象的で作業に容易です.それはVAE(変分オートエンコーダ)を使用して,デモデータからサブゴール暗示空間を学習します. IRISは,全般的な RoboMimic 基準値で,特にそのサブ目標構造が示範変性に強度を与えるMH (混合人質) データセットで,4つの参照アルゴリズムの最も強力な結果を達成します.

ロボミミクに外部アルゴリズムを追加する

RoboMimicのフレームワークにより,新しい"algo"クラスとして独自のアルゴリズムを追加することが簡単になります.拡散ポリシー,ACT,および最新の模倣学習方法は,Robomimicデータフォーマットと評価プロトコルを使用するために適応されています. 統合の主要な要件は,標準化された観測ディクトを採用し,デルタエンドエフェクターアクションを返す T1インターフェイス T2方法を実装することです.RCSVは,内部プラットフォームで拡散ポリシーとACTの両方のためのロボミミック包装を保持します.

ロボミミック実験の実行方法

ローボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミミック・パイプをインストールする ロボミックス・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイプ・パイ・パイプ・パイ・パイ・パイ・・パイ・パイ・・パイ・・パイ・パイ・・・・パイ・パイ・・・パイ・パイ・・・・・・・・・・・・・・・・・・・・・・・・・・・

ライト PH低濃度でのBC-RNN訓練は,単一のRTX 3090で約30分かかります.画像観測の訓練は同じ作業で4~6時間かかります.輸送MH画像は,GPUメモリに応じて最も長いトレーニングランです.

構成の主要パラメータ

Parameter Default Notes
train.num_epochs 2000 200 demos × 2000 epochs = ~400k gradient steps; sufficient for low-dim tasks
train.batch_size 100 Increase to 256 or 512 for image tasks if VRAM allows
algo.rnn.hidden_dim 400 For BC-RNN; larger values help on complex tasks but slow training
observation.encoder.core_kwargs.feature_dim 64 For image tasks; feature dimension from ResNet encoder
experiment.rollout.n 50 Number of evaluation rollouts — 50 is the standard; do not reduce below 20

参照基準結果

次の成功率は,オリジナルのロボミミック論文 (マンデレカー等,2021年) と後のコミュニティ更新から得られます.これらの数字は,あなたのアルゴリズムが測定されるべき数字です.

Task / Split BC BC-RNN HBC IRIS
Lift PH (low-dim) 100% 100% 100% 100%
Lift MH (low-dim) 98% 100% 100% 100%
Can PH (low-dim) 92% 100% 100% 100%
Can MH (low-dim) 12% 48% 36% 74%
Square PH (low-dim) 70% 80% 100% 98%
Square MH (low-dim) 0% 2% 10% 50%
Transport PH (low-dim) 0% 22% 88% 98%
Transport MH (low-dim) 0% 6% 22% 58%

最も説明的な比較は,Can MH:BCは 92% (PH) から 12% (MH) に低下し,IRISは100%から74%に低下する.この差は"MH degradation"の鍵となるベンチマーク信号である.MHでのパフォーマンスを維持するアルゴリズムは,低品質のデモをフィルタリングし,マルチモダルのデータを処理することを学び,操作者の品質を保証できない現実世界のパフォーマンスを直接予測する.

RCSV ハードウェアの互換性

RoboMimicのシミュレーションタスクでは,Robosuiteのフランカパンダ腕 (7-DOF) を使用します.物理的なロボット転送のために,RCSVは,RoboMimic参照実装として同じ7DOFデルタエンドエフェクターアクションスペースを使用する [OpenArm Base]T9) とAgileX PiPER腕のRoboMimicフォーマットデータ収集をサポートします.

RoboMimicにおける物理からシミュレーションまでの差はよく理解されています. シミュレーションされたロボミックデータ転送を物理ロボットにシミュレーションしたシステムでは,そのシミュレーションの成功率の約60~75%で,作業に応じて訓練されています.精度挿入作業 (スクエア) 移転は最悪;ピックアンドプレス作業 (キャナ,リフト) 移転は最悪です. RCSVのアプローチはアルゴリズム選択とハイパーパラメータ検索のために,ロボミミックシム実験を使用し,最終部署ポリシーのために物理的示範を収集することです.

オーダーメイドのロボットミミック対応データセットを収集する

標準作業 (デフォルト作業の4つではない) にアルゴリズムをベンチマークしたい場合は,RoboMimicのデータ収集フレームワークは,robosuiteで新しいタスクを作成し,スペースマウスのテレオペレーションを通じてデモを収集することができます.HDF5のスキーマは文書化されており,物理的なロボットデモをRoboMimicフォーマットにも変換できます.

RCSVの [データ収集サービス] (T10) は,カスタムロボミミックタスク作成とデモ収集をサポートしています.我々は製薬ラボクライアント (精密液処理,サンプル分類),電子機器組み立てクライアント (コネクタ挿入,PCB処理) および学術ラボ (アルゴリズム開発のためのカスタム操作シナリオ) のカスタムロボミミックベンチマークタスクを実行しました. データベースは,RoboMimicのトレーニングスクリプトと互換性のあるHDF5フォーマットで提供され,フォーマット変換は必要ありません.

定番のRoboMimicタスクのための標準RCSVデータセットパッケージには:訓練を受けたオペレーターから200のPH示例,異なるスキルレベルを持つ3のオペレーターから200のMH示例 (MH基準を有効にする) と,物理的なタスクの幾何学に適合する定番のロボスイート環境定義が含まれます. ターン・アワー・アウトは通常2~3週間です.

関連 読書

  • [分散政策ガイド] T12) 多くのロボットミミックタスクでIRISを上回るアルゴリズム
  • ACTポリシー説明 ALOHAのアルゴリズム; アダプターでロボミミックでベンチマークできます
  • [模倣学習のためのベストロボット]T14) RoboMimic対応ハードウェアのプラットフォーム比較
  • 機械ミミック物理実験のための 主要RCSVプラットフォーム
  • RCSVデータサービス 定番のロボミミックデータセット収集
  • RCSVベンチマーク RCSVのカスタム評価とともにロボミミックの結果