为什么远程操作数据仍然超过训练机器人政策模拟
尽管模拟技术取得了进展,但实际的远程操作演示仍然是训练操纵政策的黄金标准.
部分: [电路操作指南]
[←博客]
虽然对真实相相相差越来越小,但它并未关闭,而对于接触丰富的任务,它可能永远不会完全关闭.
持续的真实与真实之间的差距
模拟已经走了很长的路. 艾萨克实验室以每秒数千个图像来呈现硬体物理. MuJoCo MPC在毫秒内关闭操纵循环. 然而,每一个试图运输纯粹训练在模拟的接触式政策的团队都遇到了相同的壁:现实世界不像模拟器预测的那样行为,
机器人手指接触到肥
接触财富:模拟无法捕获的东西
接触丰富的操纵任务
| Contact Property | Sim Fidelity | Real-World Complexity | Gap Severity |
|---|---|---|---|
| Static friction coefficient | Single scalar per pair | Varies with normal force, velocity, surface wear, moisture | High |
| Contact patch geometry | Point/line contact models | Deformable patch with pressure distribution | High |
| Surface micro-geometry | Not modeled | Micro-roughness, grain direction, surface coatings | Moderate |
| Soft body deformation | FEM or MPM (slow, approximate) | Viscoelastic, rate-dependent, non-linear | Very high |
| 执行器 dynamics | Idealized motor models | Backlash, cable stretch, thermal drift, gear wear | Moderate |
| Visual appearance under contact | PBR rendering (improving) | Specular reflections, shadows from gripper, occlusion | Low-moderate |
这些空白的复合效应使得接触任务的真实转移变得如此困难.每一个个人近似可能只会引入小错误,但摩擦,几何和动力学中的错误在多步的接触序列中复合多次. 通过一个10步插入任务,由于接触模型不准确性,每步错误5% 结果是0.95^10 = 60%的总成功
分布变化:数量证据
分配转移是指政策在培训期间看到的状态分布和部署期间遇到的状态分布之间的不匹配.
**视觉分布转移:**尽管域名随机化和神经
**动力分布转移:**即使视觉转移成功 (通过域随机化或真实图像
人类示威活动为什么能获得正确的分配
技术操作员在远程操作机器人手臂来接收肥
这意味着远程操作演示隐含地编码了两个模拟无法轻松提供的东西: 正确的任务分布 (对象的设置,抓取策略和实际在物理世界中工作的行动序列) 和 隐含的限制满意度 (一个熟练的操作员从来没有尝试理解他们的经验告诉他们将失败
操作员在调整抓力中轨道时,因为他们感觉到滑动,他们将实际摩擦系数编码到示范轨道中.当他们放缓接近时,因为对象的定位不好,他们正在编码实际动力限制. 动态信息是"免费的"
按任务类型的真实与真实差距:量化证据
根据任务类型,模拟到真实差距的大小会有很大的不同.以下数据是从多个硬件平台上发布的基准和RCSV内部评估中汇总的:
| Task Type | Sim Success | Real Success (Sim Policy) | Real Success (Teleop Data) | Demos Needed |
|---|---|---|---|---|
| Pick-place (rigid, top-down) | 95% | 75-85% | 90-95% | 100-200 |
| Peg-in-hole (1mm clearance) | 90% | 30-50% | 80-90% | 200-400 |
| Deformable manipulation (cloth) | 80% | 15-30% | 65-80% | 300-600 |
| Cable routing / insertion | 70% | 10-25% | 70-85% | 400-800 |
| Liquid pouring | 85% | 20-40% | 75-90% | 150-300 |
| Tool use (e.g., screwdriver) | 75% | 5-15% | 60-75% | 500-1000 |
模式很清楚:具有更丰富的接触动态的任务显示出更大的真实与真实之间的差距.对于上下硬的选择场,差距为10-20个百分点.
价格/质量-调试比较
实际数据方法的常见反对是成本.一旦环境得到了模拟数据,模拟数据就"免费"了;实际示范需要运营商,硬件和时间.
| Data Source | Cost/Demo | Demos for 80% Success | Total Cost to 80% | Time to 80% |
|---|---|---|---|---|
| Sim-only (Isaac Sim) | ~$0.001 | Often unreachable for contact tasks | N/A (ceiling ~50-60%) | 2-4 weeks sim engineering |
| Sim + domain rand (tuned) | ~$0.01 (compute) | 500K-1M episodes | $5K-10K compute + 4-8 weeks engineering | 4-8 weeks |
| Real teleop (in-house) | $15-30 | 200-400 | $3K-12K + hardware setup | 2-3 weeks |
| Real teleop (RCSV managed) | $8-16 | 200-400 | $2,500 pilot / $8,000 campaign | 1-2 weeks |
| Hybrid (sim pre-train + real fine-tune) | $0.01 sim + $10 real | 50K sim + 100-200 real | $2K-5K total | 3-4 weeks |
关键见解:对于接触丰富的任务,模拟本身不过不惜任何代价都无法达到目标成功率,因为性能上限由接触模型的忠诚度限制.实际数据更快,更可预测地达到目标,而管理收集路径 (RCSV的 [数据服务]
模拟失败的三个案例研究
- **
片抓:** 整个行业的六个团队报告说,在Iacac Sim中训练有素的政策,具有默认PBR摩擦参数,在模拟中取得了80%以上的成功,但在真实硬件上达到40%以上.接触硬度模型是错误的.转换到真实远程操作数据,在300次示范中,成功率超过85%. - 电缆插入: 变形几何在实时物理引擎中基本未解决. USB-C电缆在指触摸下变形取决于其特定的
接紧张,外套的 硬度和核心合规性. - **液体流出:**液体动力模拟在杯水的尺度上是通过SPH或基于电网的方法计算可处理的,但液体,杯边形几何学和表面电压之间的相互作用是足够复杂的,以至于模拟训练的政策系统地过度流出.一个200个示例的远程操作数据集产生了比模拟训练的50K步骤RL政策更好的政策.
模拟实际上是什么正确的
这不是对模拟的论点
- **自由空间运动规划:**已知环境中无碰撞轨迹生成从真实转移到真实.物质的物理 (硬体动力学) 精确地进行了建模.
- **多种场景生成:**模拟可以生成数千个对象姿势,表格配置和环境布局,物理设置需要数周的时间.
- ** 无限数据尺度用于粗
行为:** 让机器人大致地向目标方向,接近物体或导航走廊可以从数百万个模拟事件中启动. - 预训练视觉编码器: 训练视觉脊柱在数百万模拟场景上,具有多种物体外观,照明条件和摄像头的视角,产生了很好的演示,将其转移到真实摄像头.这可能是今天模拟的最高ROI使用.
模拟数据有什么帮助:预训练案例
模拟数据最强大的论点不是作为主要的培训来源,而是作为预训阶段.
**1.视觉表示预训练.**使用域名随机化进行1M模拟场景训练ResNet-50或ViT脊柱.结果编码器学习到实体摄像头中转移到物体级的特性 (边缘,形状,空间关系). 精细调节200个实例演示需要比从零开始训练少3-5倍的
**2.粗
3.失败模式发现. 在10K随机场景上运行sim政策,并对失败模式进行目录.使用此目录设计针对的真实数据收集
混合方法:实际的边界
现在,最有效的团队在2025年没有在真实和真实之间选择,他们正在使用结构化混合管道.
**Sim预训练+真实的细调 (标准方法):**训练在sim,对100-500个真实演示进行细调.适用于sim政策达到40-60%的真实成功的任务.预期的改进:20-40个百分点从细调. pi0,OpenVLA和大多数基于VLA的系统用于任务专业化.
真实脊柱+sim增强: 训练对真实数据进行主要政策,然后以真实:sim比率为 1:3至 1:5的sim数据增强.sim数据提供了几周的状态空间覆盖,实际收集可能需要数周的时间.
**模拟用于探索 + 精炼:**使用RL在模拟中发现难题的新解决方案 (例如工具使用策略,重新抓取序列).将发现的策略作为路线序列.然后收集这些策略的实实实例示范,并训练一个实践策略. 这种方法利用了Sim的探索数百万轨迹的能力,同时避免在部署期间接触模型问题.
斯威尔士国家安全委员会的远程操作方法
根据RCSV的数据收集方法,我们在实例示范数据中最大限度地提高信号与噪音比率.
- 结构化变化协议: 于是我们系统地在预定义的网格中对象位置,方向和场景背景进行变化,而不是将所有示范集合集成到单个场景配置中. 这确保数据集覆盖了对通用化的变化轴,而不是过度代表单个配置.
- 运营商级系统: 幼儿运营商 (培训1-2周) 收集L1任务 (简单的选择地点).高级运营商 (1个多月的经验) 处理L2任务 (多步操作).QA领导 (3个多月)处理L3任务 (精确插入,工具使用).这种对操作员技能和任务复杂性的匹配,在每个难度级别上最大化了演示质量.
- **三门质量管道:**每次示范都通过 (1) 自动测试 (速度限制,工作空间限制,剧集长度), (2) 基于ML的质量分类器,训练用50K+标记的剧集,以及 (3) 10%的样本检查率.拒绝率通常为15-25%,确保只有清洁的示范进入最终数据集.
- **硬件标准化:**所有采集都在使用 [OpenArm 1]
T3 ) ($4,500) 或 DK1双手设置和同步多摄像头录音的校准,标准化工作站上进行.这消除了硬件特定的噪音,从而降低了不同采集设置的政策培训.
结果:RCSV收集的数据集始终实现了比在专业设置中收集的相等规模数据集中15-25%较高的政策成功率,基于ACT和传播政策架构的12项任务的比较.
正确的心理模式:在西姆中粗,在真实中很好
我们所看到的最有效的方法是两阶段战略.第一阶段,使用模拟来训练一个广泛的前者:机器人学习接近物体,估计抓取候选人,并在数千个物体类别中执行粗略的选择运动.这个阶段可以在单一A100上一夜运行,并产生一个政策,在90%的时间内得到10厘米的正确抓取.
在第二阶段,收集200-500个具体任务的真实远程操作示范. 根据这些真实数据进行模拟训练的模型进行细节调整. 组合通常比仅仅是模拟或仅是真实方法更好,并且与从头开始训练相比,实际数据需求减少了5-10倍.
收集数据工作的RCSV观察
在RCSV的数十个数据收集项目中,我们一直观察到数据质量比数据量超过接触任务.从训练有素运营商的300个专家示范的集合比初学者运营商对接触,插入或接地任务的1500个示范更高. 专家运营商本能避免将政策混
我们还观察到,前200个示范显示,大多数L2复杂任务 (结构化选择场所) 的回报率下降.接下来的300个示范提高了对新物体姿势的强度.500个以上,进一步的改进需要引入新的物体实例和环境变化.
混合动力战略实践中
我们建议团队开始一个新的操纵任务的方法: (1) 建立或下载一个模拟环境进行粗
模拟混合管道 (pseudocode) # 阶段1: Sim预训练python train.py \ --data sim_dataset/ \ --epochs 100 \ --backbone resnet50 \ --domain-rand视觉+物理 \ --save checkpoint_sim.pt # 阶段2: 实际细调 python train.py \ --data real_teleop_dataset/ \ --epochs 50 \ --backbone resnet50 \ --resume checkpoint_sim.pt \ --lr 1e-4 \ # 低LR 细调 --freeze-backbone 10 # 结结视觉编码器在第10个阶段 # 3: 评估python.py 评估. \ ----checkpoint\fin_et. -- -- -- ----epoints \ \ 时代_scenes\ \ 时代_scenes\ \ 时代_scenes \ ----
对于那些想今天开始收集实实例数据的团队,RCSV的 [数据收集服务]
相关阅读
- 机器人训练数据指南
- 现在,我们需要一个新的技术.
- 机器人传播政策
- 根据"数据集团"的数据,
- 机器人数据注释
- [数据服务]
- 其他国家:
T13
开始收集真正的机器人示范
斯威尔士国家机器人管理局提供训练有素的操作员,OpenArm 1硬件,以及对机器人示范收集的完整质量管道.
[查看数据服务]







