Researchに戻る

操作のための Sim-to-Real 転送:2025年に何が機能するか

ロボット操作のための Sim-to-Real 転送の現在の状態 域のランダム化,ダイナミック・ランダム化,そして実際に機能するハイブリッドアプローチ

[←研究]

リアルシム・トゥ・リアル転送が機能する場所,まだ失敗している場所,コスト効率的なハイブリッドシム+リアルデータ戦略を構築する方法についての誠実な評価.

シンとリアルとの差距

模擬はロボット学習に魅力的:安価で並行可能でリスクフリーです. しかし,シムからリアルとの差異は,模擬と現実世界の物理と認識の違いです. 模擬は,研究文献が時々示唆するより狭いシナリオに操作するための実用的な有用性を制限しています.

ギャップは3つの異なる源があり,それぞれには異なる緩和戦略が必要である.

  • 視覚的ギャップ: シミュレーションされた画像は,ラスター化されたテクスチャー,合成照明,理想化された材料特性を使用します.実際の画像には複雑なグローバル照明,鏡像反射,塵,動きの模糊,深さの騒音があり,シミュレーターは正確に再現できません.
  • ダイナミックギャップ: 硬体シミュレーター (MuJoCo,Isaac Lab,PyBullet) は,現実の世界での摩擦,コンプライアンス,および接触動態を正確に把握できない簡素化された接触モデルを使用します.このギャップは接触豊富な操作作業 (ペグ挿入,組み立て,変形可能なオブジェクト処理) に最も深刻です.
  • **センサーノイズギャップ:**リアルディープカメラ (RealSense D435i, ZED 2) は構造的なノイズ,輝く/暗い表面の落下,シミュレーションで複製するのが難しい時間フラッキングを生成します.RGBカメラには固定パターンノイズ,レンズ歪み,ISPアーテファクトがあります.

ドメインのランダム化

ドメインランダム化 (DR) は,シミュレーションされた環境の大きな分布を政策に訓練することによって,視覚と動力学のギャップを解決する.現実の世界がこの分布に該当することを希望する.政策は,単一のシミュレーションされた環境を記憶するよりもランダム化された要因を一般化することを学ばなければならない.

  • 視覚 DR: 対象のテクスチャ (均一色のノイズ,ランダム イメージネットテクスチャ),照明 (ランダムな位置,色,強度),背景 (ウェブデータセットからランダムな画像) とカメラポーズ (名前の周りの小さな乱れ) をランダム化します.標準範囲:照明強度 ±50%,カメラ位置 ±3cm,背景:ランダムな10K画像.
  • ダイナミック DR: ランダム化物体質 (±30%の名乗),摩擦系数 (±50%),ロボット関節縮 (±20%),接触硬度 (±40%).これらの範囲は経験的に決定される 太広いので,政策は過度に保守的になり,太狭になり,名乗のシミュレーションに超えます.
  • 握手作業のための質量ランダム化: 固体体握手作業のほとんどでは,質量 perturbation ±30% が十分である.慣性感 (投げ,動力操作) に敏感な作業では, mass ±20% と ±30% の慣性 tensor randomization が結合して,より適切である.

フォトリアリティなレンダリング

DRの代替は,光現実的なレンダリングで直接視覚差を埋める.NVIDIA 複製機 (アイザック・シム),Blender with Cycles,カスタム NeRF ベースのレンダーは,大きな分布を一般化する必要がないほどリアルに近い画像を生成することができます.

  • NVIDIA Isaac Lab / Replicator: PBR素材によるパース・トラセッドレンダリング. Isaac Lab RL フレームワークと統合される.レンダリングコスト:ラスター化よりも10100x遅い.大型のトレーニングセットよりも評価画像を生成するのに最適.
  • BlenderProc: パイソンベースのデータセット生成のBlenderパイプライン. 認識モデル (オブジェクト検出,ポーズ推定) のレーベル付き合成データセット生成に優れた. レンダリング速度によりエンドツーエンド政策トレーニングにあまり有用ではありません.
  • NeRFベースのレンダリング: ネRF (nerfstudio, ガウシアンスプラッティング) でリアル環境を捕捉し,新しいビューポイント/コンフィギュレーションをレンダリングする.現実的な現実世界外観とシミュレーションの柔軟性を組み合わせる.新興アプローチは,ほとんどのチームにとってまだ生産準備ができていない.

善と貧者を 引き継ぐもの

Task Category シミュレーション・トゥ・リアル転移 Why Mitigation If Needed
Free-space arm motion Excellent No contact, kinematics accurate None required
Coarse top-down grasping Good Large contact surfaces, forgiving Light visual DR
Pick-and-place (rigid, known objects) Good Low contact complexity Visual DR + pose randomization
精度(再現性) peg insertion (±2mm) Poor Contact model inaccuracy dominates Real data required
Deformable object manipulation Very poor FEM simulation errors large Mostly real data required
Bimanual coordination Moderate Timing depends on contact Hybrid: sim init + real fine-tune
Cloth/fabric folding Very poor Soft-body sim diverges quickly Real data required

効果 を 得る 混合 方法

ほとんどのチームにとって最も費用対効果の高いアプローチはハイブリッドです. シム転送が機能する作業の部分ではシミュレーションを使用し,接触に富んだまたは精度に敏感な部分では実際のデモを収集します.

  • Sim・プレトレーニング +実在のフィニックスチューニング: 作業行動の推定示範 (アプローチ,粗略把握) の1万個を模擬した示範に政策を予備訓練する.精度段階の実在示範の5001,000個を精密に調整する.この10:1の sim-to-real比率は操纵研究で最も広く検証されたアプローチです.
  • カリキュラムのシミュレーション: 訓練開始時に簡単なトレーニング例を生成するためにシミュレーションを使用します (直接握り付けされた対象,耐性が高い) そして徐々に困難を増加します.このカリキュラムは,早期の政策学習を加速させ,パフォーマンスしきりに到達するために必要な実際のデータを削減します.
  • データ拡張のためのシミュレーション: リアル示範データセットを補完する追加のビューポイント,照明条件,オブジェクト構成を生成するためにシミュレーションを使用します.特に実際の収集コストの追加なしに視覚的概括を改善するのに有効です.

シミュレーター比較

Simulator 物理エンジン Rendering Speed (FPS) Best For
Isaac Lab (NVIDIA) PhysX 5 RTX path-tracing 1,000–10,000 parallel RL at scale, GPU clusters
MuJoCo Custom Basic OpenGL 500–5,000 Research, accurate contact
PyBullet Bullet 3 Basic OpenGL 100–1,000 Easy setup, prototyping
Webots ODE Basic 100–500 Education, ROS integration
Gazebo / gz-sim ODE/Bullet/DART OGRE 50–200 ROS ecosystem integration

数百万の環境ステップを必要とするRLトレーニングを実行するチームにとって,複数のGPUクラスター上のアイザックラボは現在の標準である.学術研究またはデバッグングでは,Mujokoは接触豊富な操作のための最も引用されたシミュレーターであり続けています.

シミュレーションプログラムを補完するために実際の示範データが必要なら,RCSV [データサービスチーム]T1) はシミュレーションが失敗する作業の部分のために,標的型実態データ収集キャンペーンを展開することができます.

リアル・シム・トゥ・リアルギャップの実際の示例データ

模擬が十分でない場合,RCSVは空白を埋めるために リアルワールドの示範データ収集を目的としたものとして提供します.私たちは sim-to-realが失敗する接触豊富な作業に特化したものです.

[実データ →]