返回Blog

现实转移解释:现实差距,域名适应和前进道路

深入深入了解机器人实体转移:现实差距,模拟效果水平,域调整方法,突破历史以及该领域将在2026年发展到哪里.

训练机器人模拟和部署在现实硬件上是机器人技术最具吸引力的想法之一 - - 无限数据,零硬件磨损,并行训练在数千个实例中. 这篇文章追踪历史,解释理论,并绘制了最新技术的地图.

现实差距:模拟为什么不是现实

每个物理模拟器都做了近似. 固体动态是用分离时间集成器进行模拟的,这些集成器引入数值错误. 接触力是使用惩罚方法或限制解决器计算的, 材料特性 (摩擦,硬度,缩) 作为简化复杂,非线性,依赖状态的物理现象的尺度参数.动力驱动器是没有反击,电缆拉伸,热漂移或磨损的理想扭矩源.

在视觉方面,染图像与真实摄像头图像以往常是人类看不见的,但对神经网络显著的方式不同.射线追踪的影子缺乏真实环境的微妙环境罩.物质反射率通过BRDF模型接近,无法捕捉真实表面的全部复杂性. 摄像头噪音模型并不完全匹配真实传感器的噪音特性.这些视觉差异对于使用学习视觉特性的政策来说尤其具有问题,因为这些功能对完全错误的分发性质敏感.

实际上,这种差距并不是单一的东西,而是数十个小错误的累积效果, 通过动态,传感和控制.

简短的真实模拟研究历史

自从机器人学习的早期,模拟到真实转移一直是研究主题.在90年代和2000年代,南加州大学和德国航空航天中心的团队展示了从模拟到真实机器人的简单接入和抓取政策的转移,但结果仅限于准确的物理建模不至关重要的任务.

在2017年,该领域取得了重大进展, OpenAI为机器人巧妙的操纵任务展示了域名随机化 - - 训练一个使用影子手完全在模拟中重新定向块的政策, 关键创新是随机化模拟参数 (摩擦,质量,动机增长,视觉外观) 在如此广泛的范围, 这项由托宾等人发表的"从模拟到现实世界转移深神经网络域名随机化"的研究, 确定了域名随机化作为未来几年默认方法.

在2019年,OpenAI将这种方法扩展到更复杂的任务, 通过巧妙的手来解决鲁比克立方体 - - 这是最受引用的Sim到真实转移示范之一. 训练使用了数十亿个模拟步骤,包括广泛的域随机化,自动域随机化 (ADR),在训练期间逐步扩大随机化范围,

从2020年到2024年,腿部机器人社区通过真实转移取得了最一致的实际成功.ETH苏黎世 (ANYmal),MIT,卡内基梅隆以及像Unitree和敏捷机器人这样的商业公司的小组展示了完全在模拟中训练有素的政策,在各种地形上执行了实用四脚和双脚的强大的运动. 这些成功依赖于特权信息培训,仔细识别系统,以及标准的硬体模拟器对动力动力进行了很好的模拟.

模拟忠诚度水平

模拟效果在频谱上存在, 了解模拟器落下的位置是预测传输难度的必不可少的:

低忠诚度模拟使用简化动态 (点质模型,仅有动态模型) 和基本染 (固体颜色,没有阴影).这些对于算法开发和测试有用,但很少产生可转移的政策.例如:简单的OpenAI健身房环境,基本的PyBullet设置,没有调节参数.

中度忠诚度模拟使用精确的硬体动态,配合接触参数和合理 (但不是光现实) 染.这是最成功的模拟到真实转移发生的地方.动态足够好,域间随机定位可以弥合剩余的差距. 例如:系统识别参数的配置良好的MuJoCo环境,校准物理的Genesis环境.

模拟器的高真度**通过精确的物理建模,光现实化染和详细的传感器模拟,实现最小的真实模拟差距.目标是使模拟器如此精确,以使差距足够小,无法在无域间随机化的情况下跨越. 高效度模拟减少了域间随机化的需求,但需要大量的工程投资,用于资产创建和物理校准.

在实践中,与域名随机化进行中度忠诚度模拟是大多数任务的成本效益交易最好的方法.高忠诚度模拟是合理的,当任务对域名随机化太敏感,无法弥合差距 (精确组装) 或需要光现实视觉政策时.

域名调整方法

**域名随机化 (DR) **仍然是主导方法.核心见解:如果真实世界 nằm在随机化分布范围内,则该政策必须适用于现实世界条件. 它的局限性是,非常广泛的随机化使学习问题变得更加困难,

**系统识别 (SysID) **采用相反的方法:而不是随机化参数,要精确测量它们,并将模拟设置为与现实相匹配. 局限性是完美的系统识别是不实用的 - - 有些参数难以测量或是不可能测量,而现实环境随着时间的推移而变化.

域名适应使用机器学习将模拟观测转化为真实观测 (或相反),通常使用生成对抗网络 (GAN) 或变化自动编码器 (VAE).基于CycleGAN的真实视觉适应已为视觉差距成为主要障碍的任务显示出有前途的结果. 局限性是,域调整增加了模型复杂性,

模拟到真实的细调训练了大部分的模拟政策,然后在少量的真实数据上进行细调. 这结合了模拟的数据效率与真实世界的互动的忠诚性. 模拟前训练后,50-200个实例演示的精细调度通常超过了仅进行模拟和实例训练的性能.

**特权信息 (老师-学生) **训练一个老师政策,并获得基础真相模拟状态,然后将其行为化成一个学生,只使用现实硬件上可用的观测. 这提供了比单独奖励更强大的训练信号,成为移动转移的标准方法. 随着更好的蒸技术的出现,它对操纵的效率正在增长.

域名随机化实践:如何随机化

域名随机化在概念上很简单,但需要仔细选择随机化哪些参数以及在哪些范围内.随机化太少会留下差距;随机化太多会使学习问题难以解决.

视觉随机化

Parameter Randomization Range Impact on Transfer
Object textures and colors Random RGB values, random textures from ImageNet crops High — prevents color-based overfitting
Lighting direction and intensity 1-4 point lights, random position on hemisphere, 0.3-3.0x intensity High — shadow patterns differ between sim and real
Camera position perturbation +/- 2cm translation, +/- 3 degrees rotation Medium — handles calibration error
Background texture Random crops from texture datasets Medium — table and background appearance varies
Camera noise model Gaussian noise sigma 0-10, random cutout patches Low-Medium — real cameras are noisy

物理随机化

Parameter Typical Range Critical For
Object mass 0.5x-2.0x nominal Grasping force, lifting dynamics
Friction coefficient 0.2-1.2 (uniform) Grasp stability, sliding tasks
执行器 gains (Kp, Kd) 0.8x-1.2x nominal Joint tracking accuracy
Action delay 0-40ms random Communication latency mismatch
Joint damping 0.5x-2.0x nominal Arm dynamics accuracy
Contact stiffness 1e3-1e5 N/m Contact dynamics fidelity

模拟器比较:伊萨克Sim vs MuJoCo vs 创世记

Feature NVIDIA IsaacSim/Lab MuJoCo (DeepMind) Genesis
License Free (NVIDIA Omniverse) Apache 2.0 Apache 2.0
GPU parallelization 4,096+ envs on A100 256-512 (MJX on GPU) 10,000+ envs on single GPU
Rendering quality Photorealistic (ray-traced) Basic (OpenGL rasterizer) Good (differentiable renderer)
Contact physics PhysX (good rigid body) Best-in-class contact solver Good (differentiable)
Differentiable Partial Yes (MJX) Yes (full pipeline)
Deformable objects FEM soft body, cloth Basic tendon/muscle model MPM, SPH, FEM
Community/ecosystem Large (NVIDIA-backed) Largest (research standard) Growing (open-source)
Best for Visual policies, industrial sim Locomotion, contact-rich tasks Differentiable sim, soft body

斯威尔士国家安全委员会 (RCSV) RL环境服务 提供预配置的MuJoCo和Isaac Lab环境,校准到特定硬件平台,包括OpenArm 1,Unitree G1.系统识别参数包括在内,因此您的模拟从第一天起与我们的物理硬件匹配.

测量域间隔:数量方法

在投资领域调整之前,量化测量差距.

分布转移指标: 在模拟和现实硬件上记录相同任务的100集.计算图像特征分布 (使用结的DINOv2脊椎) 和行动轨迹分布 (使用DTW距离) 之间的Frechet距离. 50以下的视觉Frechet距离通常表明可以弥合的差距;200以上表明基本的视觉不一致性.

政策转移测试: 训练一个政策纯粹在模拟中,部署在真实硬件上,并测量成功率差距.

  • 地上的移动:5-15%的差距 (sim 95% →真实80-90%)
  • 硬物体选择位置:15-30%的差距 (sim 90% →真实60-75%)
  • 精度插入 (±1mm): 30-50%的差距 (sim 85% →真实 35-55%)
  • 可变形物体操纵:40-60%的差距 (sim 80% →真实20-40%)

最近的真实模拟结果:实际上是什么

根据该报告的内容,RCSV的内部测试和研究结果显示了2025-2026年实践状况:

DexPBT (NVIDIA, 2023): IsaacGym 的人口培训,用于巧妙的操纵. 训练了阿莱格罗手来重新定向各种对象. 模拟到真实的成功率:已知对象的78%,新型对象的45%.关键技术:在4,096个平行环境中进行大规模域名随机定位.

DexMV (UC San Diego, 2023): 用人手视频演示来指导模拟中的RL训练.在倒,放置和重定向任务上现实世界取得成功:60-75%.

机场转移 (ETH苏黎世/Unitree, 2024-2025): Go2四次的Sim训练机场转移政策在平面地形上取得了95%以上的成功,在中度地形上达到85%,在具有挑战性的地形上达到70%.差距几乎完全在地形极端,模拟模型不良.

操纵的混合模拟实体 (物理智能, 2025): pi0使用模拟来预训练粗的运动技能,然后每任务进行50-200个实体示范调整.这种混合方法比仅进行模拟或实体训练更高的成功率,与实体训练相比,实际数据需求减少了5-10倍.

什么时候"真相"能发挥作用,什么时候不能

** 对于:**

  • 机动和导航 (固体动力学是很好的模型)
  • 无限空间手臂运动规划 (运动转移完美)
  • 随机域的抓住固体物体 (差距可以弥合)
  • 视觉预训练与基础模型背骨 (视觉差距被抽象化)
  • 在实际数据细节调整之前,粗略行为初始化

现在,我在做什么?

  • 变形物体操纵 (布料,电缆,食物) 物理太复杂以准确建模
  • 精密组件,宽度紧张 (接触模型不匹配是致命的)
  • 复杂接触动态的工具使用 (螺丝,切割,擦拭)
  • 根据材料特性 (摩擦,硬度,表面纹理) 任务
  • 多对象互动与复杂的接触图

2026年技术的发展

2026年,几个趋势将模拟到现实的景观定义为:

**GPU加速规模模拟.**NVIDIA Isaac Sim及相关工具可在单个GPU集群上使用数千个平行环境进行训练.这使得模拟中的强化学习在以前需要禁止计算的任务中成为实用.

**可分化模拟.**像Genesis和Brax这样的模拟器通过物理引擎支持梯度计算,从而实现系统识别,轨迹优化和政策学习的梯度基于优化.

生成模拟. 大型生成模型正在用于创建现实合成训练数据 - - 具有多种物体,纹理和照明条件的光现实成效的呈现 - - 补充基于物理的模拟.像1X技术和物理智能等公司已经证明,生成数据增强显著提高了现实政策的性能.

基础模型集成. 基于Sim训练的政策越来越多地使用基础模型视觉背骨 (DINOv2,SigLIP) 预训练在互联网规模数据上.这些背骨提供强大的视觉功能,弥合了视觉Sim与现实之间的差距,使模拟训练能够专注于学习控制政策而不是从零开始视觉感知.

混合实体管道. 2026年最成功的团队不会把真实实实体当作二进制选择.他们使用模拟来进行初步政策培训,系统识别来校准模拟,域名随机化来处理残余不确定性,以及少量的真实数据来进行最终细节调整.这种混合方法在任务类型中始终产生最佳结果.

选择自己的方法

在移动和导航任务中,使用特权信息培训和域名随机定位的模拟是明确的获胜者.动态是很好的建模,方法由多组验证,并且在实际硬件上几乎模拟性能是可实现的.

对于硬体操纵 (选择和放置,推力,基本组装),混合方法最好运行:模拟预训练与域随机化,随后在50-200个实例上进行细节调整.模拟提供各种训练数据廉价,实数据纠正了接触模型不匹配.

对于接触式精密任务和可变化的对象,优先考虑真实数据收集.这些任务的真实数据收集差距很大,并且很难与当前的域调整方法相结合.使用模拟来进行初始行为探索和奖励塑造,但计划大量的真实数据收集. 对于这些具有挑战性的任务域, RCSV的数据服务可以处理大量的实体数据收集, 试点项目为200个示范开始为2,500美元.

对于使用 [RCSV硬件] (OpenArm 1, DK1, Unitree G1) 的团队,我们的 [RL环境服务] (T6) 提供预定定制的模拟环境,可减少系统识别的费用数周. [联系我们] (T7) 讨论您的真实模拟管道,或查看我们的附属文章: [仿真到现实迁移: A Practitioner's Guide] (仿真到现实迁移: A Practitioner's Guide) (T8).

相关阅读