操作的真实转移:2025年将如何实现
机器人操作的现实转移状态:域的随机化,动态随机化和实际运行的混合方法.
诚实评估真实传输的效果,它仍然失败的地方以及如何构建成本效益高的混合真实传输+数据战略.
模拟与真实之间的差距
模拟对机器人学习有吸引力:它便宜,可并行,且没有风险.但模拟与现实之间的差距,模拟和现实世界的物理和感知之间的差异,使模拟对操纵的实用性有限,比研究文献有时建议的更窄的场景.
差距有三个不同的来源,每个都需要不同的减缓策略:
- **视觉差距:**模拟图像使用
纹纹理,合成照明和理想化材料性能.真实图像具有复杂的全球照明,镜像反射,尘埃,运动模糊和深度噪音,模拟器无法准确复制. - 动力差距: 固体模拟器 (MuJoCo,Isaac Lab,PyBullet) 使用简单的接触模型,无法准确捕捉现实世界的摩擦,合规性和接触动力.这种差距对于接触丰富的操纵任务 (
插,组装,变形物体处理) 最严重. - 传感器噪音差距: 实深摄像头 (RealSense D435i, ZED 2) 产生结构性噪音,在闪
/黑暗的表面上出现 落,以及在模拟中难以复制的时间闪 .RGB摄像头具有固定模式噪音,镜头扭曲和ISP文物.
域名随机定位
域名随机化 (DR) 通过培训对模拟环境的广泛分布进行政策来解决视觉和动态差距,希望现实世界属于这种分布.该政策必须学会在随机因素中概括,而不是记住任何单个模拟环境.
- 视觉DR: 随机定制对象纹理 (均
色噪音,随机图像网纹理),照明 (随机位置,颜色,强度),背景 (来自网络数据集的随机图像),和摄像头姿势 (名义周围的小扰乱).标准范围:照明强度 ±50%,摄像头位置 ±3cm,背景:随机10K图像. - 动力学DR: 随机定制物体质量 (±30%的名额),摩擦系数 (±50%),机器人关节
缩 (±20%),接触硬度 (±40%).这些范围经验上确定过于宽,政策变得过于保守,过于狭窄,超越了名额模拟. - **抓取任务的质量随机化:**大多数
体抓取任务中, ±30%的质量 乱是足够的.对于敏感惰性任务 (投射,动态操纵), ±20%的质量与 ±30%的惯性 子随机化更适合.
照片真实化
替代 DR 是通过光现实
- NVIDIA Isaac Lab / Replicator: 通过PBR材料进行路径追踪
染.与 Isaac Lab RL框架相结合. 染成本:比 化慢10 100倍.比大型培训组更适合生成评估图像. - **BlenderProc:**基于Python的Blender管道用于数据集生成.非常适合生成标记的合成数据集用于感知模型 (对象检测,姿势估计).由于
染速度,对端到端的政策培训不太有用. - **基于NeRF的
染:**用NeRF (nerfstudio,高斯泼溅) 捕捉现实环境并 染新的视角/配置.结合现实现实世界外观和模拟的灵活性.新兴方法 尚未为大多数团队生产准备好.
什么是好与穷人之间的转移
| Task Category | 仿真到现实迁移 | Why | Mitigation If Needed |
|---|---|---|---|
| Free-space arm motion | Excellent | No contact, kinematics accurate | None required |
| Coarse top-down grasping | Good | Large contact surfaces, forgiving | Light visual DR |
| Pick-and-place (rigid, known objects) | Good | Low contact complexity | Visual DR + pose randomization |
| 精度 peg insertion (±2mm) | Poor | Contact model inaccuracy dominates | Real data required |
| Deformable object manipulation | Very poor | FEM simulation errors large | Mostly real data required |
| Bimanual coordination | Moderate | Timing depends on contact | Hybrid: sim init + real fine-tune |
| Cloth/fabric folding | Very poor | Soft-body sim diverges quickly | Real data required |
有效的混合方法
对于大多数团队来说,最经济的方法是混合型:使用模拟对工作中移动模拟工作的一部分,并为接触丰富或精度敏感部分收集实际示范.
- **模拟预训练 +实际细调:**在1万个模拟的任务行为示范 (方法,粗略的把握) 上进行预训练.在500
1,000个精确阶段的实际示范上进行细调.这种10:1的模拟与真相比率是操纵研究中最广泛验证的方法. - **课程模拟:**使用模拟来在培训开始时生成简单的培训示例 (直接被抓住的对象,宽容性很大),并逐步增加难度.
- 用于数据增强的模拟: 使用模拟来生成额外的视角,照明条件和对象配置,这些配置补充了一个实际的示范数据集.
模拟器比较
| Simulator | 物理引擎 | Rendering | Speed (FPS) | Best For |
|---|---|---|---|---|
| Isaac Lab (NVIDIA) | PhysX 5 | RTX path-tracing | 1,000–10,000 parallel | RL at scale, GPU clusters |
| MuJoCo | Custom | Basic OpenGL | 500–5,000 | Research, accurate contact |
| PyBullet | Bullet 3 | Basic OpenGL | 100–1,000 | Easy setup, prototyping |
| Webots | ODE | Basic | 100–500 | Education, ROS integration |
| Gazebo / gz-sim | ODE/Bullet/DART | OGRE | 50–200 | ROS ecosystem integration |
对于运行数百万环境步骤的RL训练的团队来说,在多GPU集群上,Isaac Lab是当前的标准.对于学术研究或调试,MuJoCo仍然是接触丰富的操纵最受引用的模拟器.
如果您需要实实例数据来补充您的模拟程序,RCSV [数据服务团队]
实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实
当模拟不足时,RCSV提供了针对性的实体示范数据收集,以填补空白.我们专注于接触式任务,
现在,我们要做什么?







