Researchに戻る

リアル に シンム 転送: 実践 的 な ガイド

ロボットポリシーをシミュレーションから現実世界へ ランダム化,システム識別,フィニットチューニング戦略を成功に転送する方法

真実 の ギャップ

モデルにおける95%の成功を達成する政策は,現実世界では30~50%に低下する.この"現実差"は視覚的差異 (レンダリング対リアル画像),物理的差異 (接触モデル不正確性) とセンサーノイズパターンから生じる.この差距を体系的に埋めることはロボット学習における最も重要な実践的なスキルの一つです.

3つの戦略

ドメインランダム化: 広いパラメータ分布を横断して訓練するので,現実世界は"ただ別のサンプル"である.システム識別:現実に適合するシミュレーションパラメータを慎重に測定し,校正する. 精細調整:シミュレーションを訓練し,その後,小さな実世界のデータセット (50200エピソード) を収集し,精細調整する.最も成功した展開は,これら3つの組み合わせ.

  • ドメインのランダム化:視覚的ポリシーに最適
  • システム識別:接触型作業に最適
  • リアルワールドの細かな調節: ほぼ常にパフォーマンスを向上させる
  • 推奨: 3つを組み合わせる

実践 的 な 助言

MuJoCoまたはIsaac Sim (どちらも良い接触モデルを持っています) を使用して開始します.カメラの位置,照明,オブジェクトのテクスチャを攻撃的にランダム化します.実際の関節摩擦とダッミングを測定します.複雑な作業を試みる前にシンプルな作業でシムからリアルに検証します.RCSVはOpenArmのための校正式シミュレーションモデルを提供しています.

真実 の ギャップ

モデルにおける95%の成功を達成する政策は,現実世界では30~50%に低下する.この"現実差"は視覚的差異 (レンダリング対リアル画像),物理的差異 (接触モデル不正確性) とセンサーノイズパターンから生じる.この差距を体系的に埋めることはロボット学習における最も重要な実践的なスキルの一つです.

3つの戦略

ドメインランダム化: 広いパラメータ分布を横断して訓練するので,現実世界は"ただ別のサンプル"である.システム識別:現実に適合するシミュレーションパラメータを慎重に測定し,校正する. 精細調整:シミュレーションを訓練し,その後,小さな実世界のデータセット (50200エピソード) を収集し,精細調整する.最も成功した展開は,これら3つの組み合わせ.

  • ドメインのランダム化:視覚的ポリシーに最適
  • システム識別:接触型作業に最適
  • リアルワールドの細かな調節: ほぼ常にパフォーマンスを向上させる
  • 推奨: 3つを組み合わせる

実践 的 な 助言

MuJoCoまたはIsaac Sim (どちらも良い接触モデルを持っています) を使用して開始します.カメラの位置,照明,オブジェクトのテクスチャを攻撃的にランダム化します.実際の関節摩擦とダッミングを測定します.複雑な作業を試みる前にシンプルな作業でシムからリアルに検証します.RCSVはOpenArmのための校正式シミュレーションモデルを提供しています.