现实转移解释:现实差距,域名适应和前进道路
深入深入了解机器人实体转移:现实差距,模拟效果水平,域调整方法,突破历史以及该领域将在2026年发展到哪里.
训练机器人模拟和部署在现实硬件上是机器人技术最具吸引力的想法之一 - - 无限数据,零硬件磨损,并行训练在数千个实例中. 这篇文章追踪历史,解释理论,并绘制了最新技术的地图.
现实差距:模拟为什么不是现实
每个物理模拟器都做了近似. 固体动态是用分离时间集成器进行模拟的,这些集成器引入数值错误. 接触力是使用惩罚方法或限制解决器计算的, 材料特性 (摩擦,硬度,
在视觉方面,
实际上,这种差距并不是单一的东西,而是数十个小错误的累积效果, 通过动态,传感和控制.
简短的真实模拟研究历史
自从机器人学习的早期,模拟到真实转移一直是研究主题.在90年代和2000年代,南加州大学和德国航空航天中心的团队展示了从模拟到真实机器人的简单接入和抓取政策的转移,但结果仅限于准确的物理建模不至关重要的任务.
在2017年,该领域取得了重大进展, OpenAI为机器人巧妙的操纵任务展示了域名随机化 - - 训练一个使用影子手完全在模拟中重新定向块的政策, 关键创新是随机化模拟参数 (摩擦,质量,动机增长,视觉外观) 在如此广泛的范围, 这项由托宾等人发表的"从模拟到现实世界转移深神经网络域名随机化"的研究, 确定了域名随机化作为未来几年默认方法.
在2019年,OpenAI将这种方法扩展到更复杂的任务, 通过巧妙的手来解决鲁比克立方体 - - 这是最受引用的Sim到真实转移示范之一. 训练使用了数十亿个模拟步骤,包括广泛的域随机化,自动域随机化 (ADR),在训练期间逐步扩大随机化范围,
从2020年到2024年,腿部机器人社区通过真实转移取得了最一致的实际成功.ETH苏黎世 (ANYmal),MIT,卡内基梅隆以及像Unitree和敏捷机器人这样的商业公司的小组展示了完全在模拟中训练有素的政策,在各种地形上执行了实用四脚和双脚的强大的运动. 这些成功依赖于特权信息培训,仔细识别系统,以及标准的硬体模拟器对动力动力进行了很好的模拟.
模拟忠诚度水平
模拟效果在频谱上存在, 了解模拟器落下的位置是预测传输难度的必不可少的:
低忠诚度模拟使用简化动态 (点质模型,仅有动态模型) 和基本
中度忠诚度模拟使用精确的硬体动态,配合接触参数和合理 (但不是光现实)
模拟器的高真度**通过精确的物理建模,光现实化
在实践中,与域名随机化进行中度忠诚度模拟是大多数任务的成本效益交易最好的方法.高忠诚度模拟是合理的,当任务对域名随机化太敏感,无法弥合差距 (精确组装) 或需要光现实视觉政策时.
域名调整方法
**域名随机化 (DR) **仍然是主导方法.核心见解:如果真实世界 nằm在随机化分布范围内,则该政策必须适用于现实世界条件. 它的局限性是,非常广泛的随机化使学习问题变得更加困难,
**系统识别 (SysID) **采用相反的方法:而不是随机化参数,要精确测量它们,并将模拟设置为与现实相匹配. 局限性是完美的系统识别是不实用的 - - 有些参数难以测量或是不可能测量,而现实环境随着时间的推移而变化.
域名适应使用机器学习将模拟观测转化为真实观测 (或相反),通常使用生成对抗网络 (GAN) 或变化自动编码器 (VAE).基于CycleGAN的真实视觉适应已为视觉差距成为主要障碍的任务显示出有前途的结果. 局限性是,域调整增加了模型复杂性,
模拟到真实的细调训练了大部分的模拟政策,然后在少量的真实数据上进行细调. 这结合了模拟的数据效率与真实世界的互动的忠诚性. 模拟前训练后,50-200个实例演示的精细调度通常超过了仅进行模拟和实例训练的性能.
**特权信息 (老师-学生) **训练一个老师政策,并获得基础真相模拟状态,然后将其行为
域名随机化实践:如何随机化
域名随机化在概念上很简单,但需要仔细选择随机化哪些参数以及在哪些范围内.随机化太少会留下差距;随机化太多会使学习问题难以解决.
视觉随机化
| Parameter | Randomization Range | Impact on Transfer |
|---|---|---|
| Object textures and colors | Random RGB values, random textures from ImageNet crops | High — prevents color-based overfitting |
| Lighting direction and intensity | 1-4 point lights, random position on hemisphere, 0.3-3.0x intensity | High — shadow patterns differ between sim and real |
| Camera position perturbation | +/- 2cm translation, +/- 3 degrees rotation | Medium — handles calibration error |
| Background texture | Random crops from texture datasets | Medium — table and background appearance varies |
| Camera noise model | Gaussian noise sigma 0-10, random cutout patches | Low-Medium — real cameras are noisy |
物理随机化
| Parameter | Typical Range | Critical For |
|---|---|---|
| Object mass | 0.5x-2.0x nominal | Grasping force, lifting dynamics |
| Friction coefficient | 0.2-1.2 (uniform) | Grasp stability, sliding tasks |
| 执行器 gains (Kp, Kd) | 0.8x-1.2x nominal | Joint tracking accuracy |
| Action delay | 0-40ms random | Communication latency mismatch |
| Joint damping | 0.5x-2.0x nominal | Arm dynamics accuracy |
| Contact stiffness | 1e3-1e5 N/m | Contact dynamics fidelity |
模拟器比较:伊萨克Sim vs MuJoCo vs 创世记
| Feature | NVIDIA IsaacSim/Lab | MuJoCo (DeepMind) | Genesis |
|---|---|---|---|
| License | Free (NVIDIA Omniverse) | Apache 2.0 | Apache 2.0 |
| GPU parallelization | 4,096+ envs on A100 | 256-512 (MJX on GPU) | 10,000+ envs on single GPU |
| Rendering quality | Photorealistic (ray-traced) | Basic (OpenGL rasterizer) | Good (differentiable renderer) |
| Contact physics | PhysX (good rigid body) | Best-in-class contact solver | Good (differentiable) |
| Differentiable | Partial | Yes (MJX) | Yes (full pipeline) |
| Deformable objects | FEM soft body, cloth | Basic tendon/muscle model | MPM, SPH, FEM |
| Community/ecosystem | Large (NVIDIA-backed) | Largest (research standard) | Growing (open-source) |
| Best for | Visual policies, industrial sim | Locomotion, contact-rich tasks | Differentiable sim, soft body |
斯威尔士国家安全委员会 (RCSV) RL环境服务 提供预配置的MuJoCo和Isaac Lab环境,校准到特定硬件平台,包括OpenArm 1,Unitree G1.系统识别参数包括在内,因此您的模拟从第一天起与我们的物理硬件匹配.
测量域间隔:数量方法
在投资领域调整之前,量化测量差距.
分布转移指标: 在模拟和现实硬件上记录相同任务的100集.计算图像特征分布 (使用
政策转移测试: 训练一个政策纯粹在模拟中,部署在真实硬件上,并测量成功率差距.
地上的移动:5-15%的差距 (sim 95% →真实80-90%) - 硬物体选择位置:15-30%的差距 (sim 90% →真实60-75%)
- 精度插入 (±1mm): 30-50%的差距 (sim 85% →真实 35-55%)
- 可变形物体操纵:40-60%的差距 (sim 80% →真实20-40%)
最近的真实模拟结果:实际上是什么
根据该报告的内容,RCSV的内部测试和研究结果显示了2025-2026年实践状况:
DexPBT (NVIDIA, 2023): IsaacGym 的人口培训,用于巧妙的操纵. 训练了阿莱格罗手来重新定向各种对象. 模拟到真实的成功率:已知对象的78%,新型对象的45%.关键技术:在4,096个平行环境中进行大规模域名随机定位.
DexMV (UC San Diego, 2023): 用人手视频演示来指导模拟中的RL训练.在倒,放置和重定向任务上现实世界取得成功:60-75%.
机场转移 (ETH苏黎世/Unitree, 2024-2025): Go2四次的Sim训练机场转移政策在平面地形上取得了95%以上的成功,在中度地形上达到85%,在具有挑战性的地形上达到70%.差距几乎完全在地形极端,模拟模型不良.
操纵的混合模拟实体 (物理智能, 2025): pi0使用模拟来预训练粗
什么时候"真相"能发挥作用,什么时候不能
** 对于:**
- 机动和导航 (固体动力学是很好的模型)
- 无限空间手臂运动规划 (运动转移完美)
- 随机域的抓住固体物体 (差距可以弥合)
- 视觉预训练与基础模型背骨 (视觉差距被抽象化)
- 在实际数据细节调整之前,粗略行为初始化
现在,我在做什么?
- 变形物体操纵 (布料,电缆,食物)
物理太复杂以准确建模 - 精密组件,宽度紧张 (接触模型不匹配是致命的)
- 复杂接触动态的工具使用 (螺丝,切割,擦拭)
- 根据材料特性 (摩擦,硬度,表面纹理) 任务
- 多对象互动与复杂的接触图
2026年技术的发展
2026年,几个趋势将模拟到现实的景观定义为:
**GPU加速规模模拟.**NVIDIA Isaac Sim及相关工具可在单个GPU集群上使用数千个平行环境进行训练.这使得模拟中的强化学习在以前需要禁止计算的任务中成为实用.
**可分化模拟.**像Genesis和Brax这样的模拟器通过物理引擎支持梯度计算,从而实现系统识别,轨迹优化和政策学习的梯度基于优化.
生成模拟. 大型生成模型正在用于创建现实合成训练数据 - - 具有多种物体,纹理和照明条件的光现实成效的呈现 - - 补充基于物理的模拟.像1X技术和物理智能等公司已经证明,生成数据增强显著提高了现实政策的性能.
基础模型集成. 基于Sim训练的政策越来越多地使用基础模型视觉背骨 (DINOv2,SigLIP) 预训练在互联网规模数据上.这些背骨提供强大的视觉功能,弥合了视觉Sim与现实之间的差距,使模拟训练能够专注于学习控制政策而不是从零开始视觉感知.
混合实体管道. 2026年最成功的团队不会把真实实实体当作二进制选择.他们使用模拟来进行初步政策培训,系统识别来校准模拟,域名随机化来处理残余不确定性,以及少量的真实数据来进行最终细节调整.这种混合方法在任务类型中始终产生最佳结果.
选择自己的方法
在移动和导航任务中,使用特权信息培训和域名随机定位的模拟是明确的获胜者.动态是很好的建模,方法由多组验证,并且在实际硬件上几乎模拟性能是可实现的.
对于硬体操纵 (选择和放置,推力,基本组装),混合方法最好运行:模拟预训练与域随机化,随后在50-200个实例上进行细节调整.模拟提供各种训练数据廉价,实数据纠正了接触模型不匹配.
对于接触式精密任务和可变化的对象,优先考虑真实数据收集.这些任务的真实数据收集差距很大,并且很难与当前的域调整方法相结合.使用模拟来进行初始行为探索和奖励塑造,但计划大量的真实数据收集. 对于这些具有挑战性的任务域, RCSV的数据服务可以处理大量的实体数据收集, 试点项目为200个示范开始为2,500美元.
对于使用 [RCSV硬件] (OpenArm 1, DK1, Unitree G1) 的团队,我们的 [RL环境服务] (T6
相关阅读
- [为什么电话运营数据比模拟更好]
- 机器人学习的分散政策 --实体数据与模拟数据培训
- [机器人训练数据是什么?]
T12 - - 移动的真实Sim - RCSV RL环境服务 --预校准模拟环境
- RCSV数据服务 -- 为了调整,实时收集数据
- 词典 --域名随机化,系统识别等







