Blogに戻る

リアル・シム・トランスファー 説明:現実のギャップ,ドメイン適応,前進の道

ロボティクスにおけるシム・トゥ・リアル・トランスフォーマーについて 深く探求する:現実のギャップ,シミュレーションの忠誠度レベル,ドメイン適応方法,突破の歴史,そしてこの分野が2026年にどこへ向かっているのか

機械をシミュレーションに訓練し リアルハードウェアに展開することは ロボティクスで最も魅力的なアイデアの一つです 無制限データ 硬件の磨きもゼロ 千回数で並行訓練です しかしシミュレーションと現実の間のギャップは根深き 閉じ込められ 物理エンジン レンダリング マシン学習 システム識別における 進歩は数十年に渡り 求められました この記事では歴史を記し,理論を説明し,最新技術を地図に描いています.

リアルティギャップ: なぜ シミュレーション が 現実 で ない か

物理シミュレーターごとに近似が作られます 固体動態は 数値エラーを導入する 離散時間統合器でモデル化されます 接触力とは 罰金方法や制約解法を使って計算されます 侵入や震え リアルな復元など 現実世界では 対照のない 道具を生成します 材料の性質 (摩擦,硬さ, demping) は,複雑な非線形,状態に依存する物理現象を簡素化するスケラーパラメータとして指定されています.アクチュエーターは反射,ケーブルストレッチ,熱漂移,または着用のない理想的なトークスソースとしてモデル化されています.

視覚的な面では,レンダリング画像は,人間には見えないが神経ネットワークにとって重要な方法で実際のカメラ画像とは異なる.射線追跡された影は,実際の環境の微妙な環境遮蔽が欠けている.物質反射性は,実際の表面の完全な複雑さを捕捉できないBRDFモデルによって近似される. カメラのノイズモデルは,実際のセンサーのノイズ特性と完全に一致しない.これらの視覚的不一致は,学習した視覚的特性を使用するポリシーに特に問題がある.

これらの個々の近似の複合効果は 現実のギャップを生み出します シミュレーションで95%の成功率を達成する政策は リアルハードウェアで20%に低下します ギャップは単一のものではなく ダイナミックやセンサー,制御における数十の小さな不一致の累積効果です

シン-トゥ-リアル 研究 の 短い 歴史

シンフォレア・トゥ・リアル・トランスファー (SIM-to-Real) はロボット学習の初期から研究対象となっている.1990年代と2000年代,南カリフォルニア大学とドイツ航空宇宙センターのチームは,シミュレーションからリアルロボットへのシンプルなアクセスと把握の政策の転送を実証したが,結果は物理の正確なモデリングが重要ではない課題に限定された.

2017年にOpenAIがロボット操作の巧妙な作業のために ドメインランダム化を示したことで この分野は大きな前進を遂げました ロボット操作の巧妙な作業で ドメインランダム化を示したときに - シャドーハンドを完全にシミュレーションで使って ブロックをリオーヤメントする方針を訓練し 現実ハードウェアに展開しました 重要な革新は,訓練分布から現実世界が単なるサンプルになったほど幅広い範囲に シンミュレーションパラメータ (摩擦,質量,アクチュエーターの利益,視覚的外観) をランダム化することでした. この研究は"Tobin et al.による"Simulation からリアル世界へ深い神経ネットワークを転送するためのドメインランダム化"として発表された.

2019年にOpenAIは このアプローチを より複雑な作業に 拡張しました 巧妙な手でルービックキューブを解決するものです これは sim-to-real 転送の 最も引用された示例の一つです 訓練では,膨大なドメインランダム化,自動ドメインランダム化 (ADR) を利用し,訓練中にランダム化範囲を徐々に拡大し,特権情報を使用した教師-学生アーキテクチャを活用した数十億のシミュレーションステップを使用しました.

2020年から2024年まで,脚のロボットコミュニティはシム-トゥ-リアル転送で最も一貫した実用的な成功を収めた.ETHチューリッヒ (ANYmal),MIT,カーネギー・メロン,およびUnitreeとAgility Roboticsなどの商業企業では,さまざまな地形で実際の四肢と双脚で強力な移動を実行したシミュレーションに完全に訓練されたポリシーを実証した. これらの成功は特権情報訓練,注意深くシステム識別,そして標準的な硬体シミュレーターによって動力動力がよくモデル化されているという事実に基づいた.

シミュレーションの忠誠度レベル

シンミュレーションの信頼性はスペクトルで存在し シンミュレーターの落下地点を理解することは 転送がどれほど難しいかを予測するために不可欠です

低信頼性シミュレーションは,単純化動力 (点量モデル,映画化モデルのみ) と基本的なレンダリング (固い色,影なし) を利用する.これらはアルゴリズム開発とテストに役立つが,ほとんど転送可能なポリシーを生成しない.例:シンプルなOpenAIジム環境,調整されたパラメータのない基本的なPyBullet設定.

中等フィデリティシミュレーションでは,調整された接触パラメータと合理的な (しかし光現実的ではない) レンダリングで正確な硬い体動力を使用します.ここで最も成功したシム-トゥ-リアル転送が起こります.ドメインランダム化が残りのギャップを埋めることができるほどダイナミックは良好です. 例:システムで識別されたパラメータを持つ良好な配置されたMuJoCo環境,校正された物理学のGenesis環境.

高信頼性シミュレーションは,精密な物理モデリング,光現実的なレンダリング,および詳細なセンサーシミュレーションを通じて sim-to-realギャップを最小限に抑えることを目指しています.目標は,シミュレーションをドメインランダム化なしで横切れるほど精密なものにすることです.例:NVIDIA Isaac Simは校正資産,認証された接触モデルを持つカスタムシミュレーター. 高信頼性シミュレーションはドメインランダム化が必要性を軽減しますが,資産作成と物理校正に重要なエンジニアリング投資が必要です.

実践的には,ドメインランダム化による中度忠実性シミュレーションは,ほとんどのタスクに対して最も高いコスト・パフォーマンストレードオフのアプローチである.ドメインランダム化がギャップを埋めるためにタスクが敏感すぎる場合 (精度組み立て) または光現実的な視覚政策が必要である場合,高い誠実性シミュレーションは正当化されます.

ドメインの適応方法

**ドメインランダム化 (DR) **は依然として主宰的なアプローチである.核心洞察:現実世界はランダム化分布の中に存在するなら,政策は現実世界の条件に堅固である必要があります.DRは効果的で,実装が簡単で,現実世界のデータを必要としません. 制限は ランダム化が非常に広く 学習問題を難しくし 高いパフォーマンスを 減らすことです 政策は 絶対に 直面しない条件に 堅く対応しなければなりません これは 直面する特定の条件を 利用する能力を 制限します

**システム識別 (SysID) **は,対照的なアプローチをとる:パラメータをランダム化する代わりに,それらを正確に測定し,シミュレーションを現実に適合させる.SysIDは,それを許容するための政策を訓練するのではなく,直接差を軽減します. 限界は完璧なシステム識別が不実用であるということです いくつかのパラメータを測定することは困難または不可能であり 現実の世界の条件は時間とともに変化します 実際には SysIDは 独立した技術としてではなく ドメインランダム化分布の中心を設定するために使用されます

ドメイン適応は,機械学習を使用して,シミュレーション観測を実際の観測に (または逆) 変えており,通常は生成的対抗ネットワーク (GAN) や変異自動エンコード (VAE(変分オートエンコーダ)) を使用します.サイクリングGANベースのシム-トゥ-リアル視覚適応は,視覚差が主要な障壁である課題において有望な結果を示しています. 制限は ドメイン適応がモデル複雑性を増やし 文物も導入できるということです

**シミュレーションにおけるフィーナティューニングは,大部分のシミュレーションの方針を訓練し,その後,ほんの数量の実データにフィーナティューニングを行います.これは,シミュレーションのデータ効率性と実世界の相互作用の信頼性を組み合わせます.効率的なフィーナティューニング方法 (LoRA型アダプター,残留政策) が必要な実データ量を減少させたため,この技術はますます人気を得ています. シミュレーション前の訓練後 50~200の実演で精細調整は,シンフォギアのみと実演のみのトレーニングを上回る.

**特権情報 (教師-生徒) **は,基礎真実シミュレーション状態へのアクセスを持つ教師のポリシーを訓練し,その行動を実際のハードウェアで利用可能な観察のみを使用する学生に蒸留します.これは報酬のみよりも強力なトレーニング信号を提供し,移動転送の標準アプローチとなっています. 蒸留技術がより良くなるにつれて,操作の効果は増加しています.

域名ランダム化:何をランダム化するか

ドメインランダム化とは概念的にはシンプルですが,ランダム化するパラメータと範囲を慎重に選択する必要があります. ランダム化するのも少すぎるとギャップが広がります. ランダム化するのも多くで,学習問題は解決できないのです.

視覚的ランダム化

Parameter Randomization Range Impact on Transfer
Object textures and colors Random RGB values, random textures from ImageNet crops High — prevents color-based overfitting
Lighting direction and intensity 1-4 point lights, random position on hemisphere, 0.3-3.0x intensity High — shadow patterns differ between sim and real
Camera position perturbation +/- 2cm translation, +/- 3 degrees rotation Medium — handles calibration error
Background texture Random crops from texture datasets Medium — table and background appearance varies
Camera noise model Gaussian noise sigma 0-10, random cutout patches Low-Medium — real cameras are noisy

物理的なランダム化

Parameter Typical Range Critical For
Object mass 0.5x-2.0x nominal Grasping force, lifting dynamics
Friction coefficient 0.2-1.2 (uniform) Grasp stability, sliding tasks
アクチュエータ gains (Kp, Kd) 0.8x-1.2x nominal Joint tracking accuracy
Action delay 0-40ms random Communication latency mismatch
Joint damping 0.5x-2.0x nominal Arm dynamics accuracy
Contact stiffness 1e3-1e5 N/m Contact dynamics fidelity

シミュレーター比較: イサックシム vs ムジョコ vs 創世記

Feature NVIDIA IsaacSim/Lab MuJoCo (DeepMind) Genesis
License Free (NVIDIA Omniverse) Apache 2.0 Apache 2.0
GPU parallelization 4,096+ envs on A100 256-512 (MJX on GPU) 10,000+ envs on single GPU
Rendering quality Photorealistic (ray-traced) Basic (OpenGL rasterizer) Good (differentiable renderer)
Contact physics PhysX (good rigid body) Best-in-class contact solver Good (differentiable)
Differentiable Partial Yes (MJX) Yes (full pipeline)
Deformable objects FEM soft body, cloth Basic tendon/muscle model MPM, SPH, FEM
Community/ecosystem Large (NVIDIA-backed) Largest (research standard) Growing (open-source)
Best for Visual policies, industrial sim Locomotion, contact-rich tasks Differentiable sim, soft body

RCSVの RL環境サービス は, OpenArm 1, ALOHA,および [Unitree G1](T3を含む特定のハードウェアプラットフォームに校准された,先設定されたMuJoCoとIsaac Lab環境を提供します.システム識別されたパラメータは,あなたのシミュレーションは最初の日から私たちの物理的なハードウェアに一致します.

域間の差を測定する:量化方法

域適応に投資する前に,差を量的に測定してください.

分布シフトメトリック: シミュレーションと実際のハードウェアで同じ作業の100エピソードを記録する.画像機能分布 (凍結されたDINOv2脊髄を使用) とアクション軌跡分布 (DTW距離を使用) の間のフレッチェ距離を計算する. 50未満の視覚フレッシェ距離は典型的には橋渡し可能なギャップを示し,200以上は根本的な視覚的不一致を示します.

ポリシー転送テスト: ポリシーを純粋にシミュレーションで訓練し,実際のハードウェアに展開し,成功率差を測定する.ドメインランダム化による良好なキャリブレーションのシミュレーションでは,タスクタイプによって以下の差を予想します:

  • 地での移動: 515%の差 (sim 95% →実用8090%)
  • 固い物体ピック場所: 15-30%のギャップ (sim 90% →実 60-75%)
  • 精度挿入 (±1mm): 30-50%のギャップ (sim 85% →実 35-55%)
  • 変形可能な物体の操作: 40-60%のギャップ (sim 80% →実 20-40%)

最近の シム・トゥ・リアル 解析結果: 実際には何が効果的か

公開された論文とRCSV内部試験の結果は,2025~2026年の実績を表しています.

DexPBT (NVIDIA, 2023): IsaacGymで人口ベースの訓練で巧妙な操作を訓練した.様々なオブジェクトを再方向化するためにアレグロの手を訓練した. Sim-to-real成功率:既知のオブジェクトで78%,新しいオブジェクトで45% .キーテクニック:4,096の並行環境で大規模なドメインランダム化.

DexMV (UC サンディエゴ, 2023): 巧妙な操作のためのRL訓練を指導するために,人間の手によるビデオデモを使用した. 倒し,場所,再方向の作業における実世界の成功: 60-75%.

移動移動 (ETHチューリッヒ/ユニトリ, 2024-2025): Go2四重型のSim訓練された移動政策は平面地上で95%以上,適度地上で85%以上,挑戦的な地上で70%以上の成功を達成しています.

操縦のためのハイブリッドシムリアル (Physical Intelligence, 2025): pi0は,粗い運動スキルを訓練する前シミュレーションを使用して,作業ごとに50200の実演で細かな調節を行います.このハイブリッドアプローチは,実演技と比べて510倍減少した実データ要求により,シムのみまたは実演技よりも高い成功率を達成します.

シン・トゥ・リアル が 機能 する と 機能 し ない と

シム・トゥ・リアルは:

  • 移動とナビゲーション (固体体動力学はよくモデル化されています)
  • 空間自由の腕の動き計画 (kinematics transfer 完璧)
  • ドメインランダム化による固いオブジェクトの把握 (ギャップは橋渡し可能)
  • 基礎モデルの背骨で視覚予備訓練 (視覚的ギャップは抽象化されます)
  • リアルデータ細かな調整前に粗い行動初期化

シン-トゥ-リアルで 闘う

  • 変形可能な物体操作 (服,ケーブル,食品) 物理は正確にモデル化できないほど複雑
  • 厳密な許容量のある精密組成 (接触モデル不一致は致命的)
  • 複雑な接触動力 (スクロール,切断,拭き) の道具の使用
  • 材料の性質 (摩擦,硬さ,表面質) に依存する作業
  • 複雑な接触グラフとの多重オブジェクト相互作用

2026年の最新技術

2026年に sim-to-real 景観を定義する傾向はいくつかあります

GPU加速式シミュレーションをスケールで実施. NVIDIA Isaac Simと関連ツールにより,GPUクラスターで何千もの平行環境でトレーニングが可能になります.これは以前は禁止的な計算が必要だった課題にシミュレーションにおける強化学習を実用化しています.

** 異なるシミュレーション.** ジェネシスやブラックスのようなシミュレーションは物理エンジンを通じて梯度計算をサポートし,システム識別,軌道の最適化,政策学習のための梯度ベースの最適化が可能である.

生成式シミュレーション. 物理に基づくシミュレーションを補完する現実的な合成訓練データ - 異なる物体,テクスチャ,照明条件を持つ光現実的なレンダリング - を作成するために大規模な生成式モデルが使用されています. 1Xテクノロジーや物理知能のような企業は,生成式データ拡張が現実世界の政策パフォーマンスを大幅に向上させることを実証しています.

基礎モデル統合. Sim訓練の政策は,インターネット規模データで訓練された基礎モデル視覚の脊椎骨 (DINOv2, SigLIP) をますます利用しています.これらの脊椎骨は,視覚の simから現実の差を大きく埋めることができる強力な視覚機能を提供し,シミュレーション訓練は,視覚認識をゼロから学ぶよりも制御政策に焦点を当てることができます.

ハイブリッドシムリアルパイプライン** 2026年に最も成功したチームはシムリアルをバイナリー選択として扱わない.彼らは初期政策訓練のためのシミュレーション,シミュレーションを校化するためのシステム識別,残留不確実性を処理するためのドメインランダム化,そして最終的な微調整のために小さな実際のデータを使用する.このハイブリッドアプローチは,タスクタイプごとに一貫して最高の結果を生み出す.

方法 を 選ぶ

移動とナビゲーションの課題では,特権情報訓練とドメインランダム化によるシミュレーションが明確な勝者である.ダイナミクスがよくモデル化され,アプローチは複数のグループによって検証され,実際のハードウェアで近似シミュレーション性能が達成可能である.

硬いオブジェクト操作 (ピックアンド・プレス,プッシュ,基本アセンブリ) において,ハイブリッドアプローチは最もうまく機能します.ドメインランダム化による模擬前訓練,その後50-200の実際のデモで細かな調整が行われます.模擬は,さまざまなトレーニングデータを安価に提供し,実際のデータはコンタクトモデルの不一致を修正します.

接触型精密作業や変形可能なオブジェクトでは,実際のデータ収集を優先する.これらの作業のシムからリアルまでのギャップは大きく,現在のドメイン適応方法と橋渡しすることは困難です.初期行動探索と報酬形成のためにシミュレーションを使用しますが,実質的なデータ収集を計画します. RCSVの [データサービス] (T4) は,これらの困難なタスクドメインで大量の実データ収集を処理できます. 試行プログラムでは, 200回のデモで2,500ドルから開始します.

[RCSVハードウェア] (OpenArm 1, DK1, Unitree G1) で働くチームにとって, [RL環境サービス] (T6) は,システム識別の努力を数週に減らすためのプリキャリブレートシミュレーション環境を提供します. [連絡してください] (T7) シンからリアルへのパイプラインについて議論するために,または当社の同行記事を参照してください: [シミュレーション・トゥ・リアル転移: A Practitioner's Guide] (T8).

関連 読書

  • [なぜテレオペレーションデータがシミュレーションに勝っている]
  • ロボット学習の分散政策 --実用データとシミュレーションデータに関する訓練
  • [ロボット訓練データとは何か?] T11) - 文脈における合成データ
  • Unitree G1 Review - ロボット用のシム・トゥ・リアル
  • RCSV RL環境サービス -- 予校されたシミュレーション環境
  • RCSVデータサービス -- 細かな調整のための実世界のデータ収集
  • [語彙] 域をランダム化,システム識別,その他