返回Blog

为什么远程操作数据仍然超过训练机器人政策模拟

尽管模拟技术取得了进展,但实际的远程操作演示仍然是训练操纵政策的黄金标准.

部分: [电路操作指南]

[←博客]

虽然对真实相相相差越来越小,但它并未关闭,而对于接触丰富的任务,它可能永远不会完全关闭.

持续的真实与真实之间的差距

模拟已经走了很长的路. 艾萨克实验室以每秒数千个图像来呈现硬体物理. MuJoCo MPC在毫秒内关闭操纵循环. 然而,每一个试图运输纯粹训练在模拟的接触式政策的团队都遇到了相同的壁:现实世界不像模拟器预测的那样行为,

机器人手指接触到肥棒时,接触硬度,摩擦系数和表面微几何学都会相互作用,以确定棒是否滑动,滚动或保持.模拟引擎通过数小部分尺寸对此进行了近似测试. 实际上,在湿的ABS表面上使用的石肥具有摩擦系数,随着滑动速度,正常的力和表面湿度而变化,目前没有物理引擎能够精确地模拟.在模拟中训练有素的政策学会利用模拟的接触模型,而不是真正的模型.

接触财富:模拟无法捕获的东西

接触丰富的操纵任务 抓取,插入,组装,接下来的表面 涉及到物理相互作用,其中决定成功或失败的信息是编码在接触接口的力量,变形和摩擦动态.这种信息具有几个特性,使其基本难以模拟:

Contact Property Sim Fidelity Real-World Complexity Gap Severity
Static friction coefficient Single scalar per pair Varies with normal force, velocity, surface wear, moisture High
Contact patch geometry Point/line contact models Deformable patch with pressure distribution High
Surface micro-geometry Not modeled Micro-roughness, grain direction, surface coatings Moderate
Soft body deformation FEM or MPM (slow, approximate) Viscoelastic, rate-dependent, non-linear Very high
执行器 dynamics Idealized motor models Backlash, cable stretch, thermal drift, gear wear Moderate
Visual appearance under contact PBR rendering (improving) Specular reflections, shadows from gripper, occlusion Low-moderate

这些空白的复合效应使得接触任务的真实转移变得如此困难.每一个个人近似可能只会引入小错误,但摩擦,几何和动力学中的错误在多步的接触序列中复合多次. 通过一个10步插入任务,由于接触模型不准确性,每步错误5% 结果是0.95^10 = 60%的总成功 在视觉观测中分布转移之前.

分布变化:数量证据

分配转移是指政策在培训期间看到的状态分布和部署期间遇到的状态分布之间的不匹配.

**视觉分布转移:**尽管域名随机化和神经染技术取得了进展,但模拟图像的分布仍然与现实摄像头传输不同. 这种转变是可测量的:IsaacSim呈现的操纵场景和真实RealSense拍摄相同场景之间的FID (Frechet Inception Distance) 通常是80-120,而不同真实摄像头设置之间的20-40 .对于这种差距敏感的学习视觉编码器的政策显示,在没有细节调整的情况下,从sim转移到真实时,性能降低15-30%.

**动力分布转移:**即使视觉转移成功 (通过域随机化或真实图像染),动力不匹配在部署期间创造了政策从未在训练期间看到的状态轨迹.一个训练的Sim抓取政策通过模拟器的动力模型塑造的轨迹接近对象. 实际上,由于执行器建模错误,臂走路略有不同,导致了无法分配的抓取方法配置.这种动态转变难以测量,但占据了接触任务中大多数Sim-to-Real失败的原因.

人类示威活动为什么能获得正确的分配

技术操作员在远程操作机器人手臂来接收肥棒时,他们并不是遵循计算轨迹.他们使用了进化花了数百万年的时间来优化的相同的传感机观.他们在看到圆形表面时,直觉地调整了接近角.他们感觉 (通过触觉反或视觉信号) 当抓取不稳定和正确的失败之前. 它们发现了全球性最佳的配置,但在本地稳定的解决方案.

这意味着远程操作演示隐含地编码了两个模拟无法轻松提供的东西: 正确的任务分布 (对象的设置,抓取策略和实际在物理世界中工作的行动序列) 和 隐含的限制满意度 (一个熟练的操作员从来没有尝试理解他们的经验告诉他们将失败

操作员在调整抓力中轨道时,因为他们感觉到滑动,他们将实际摩擦系数编码到示范轨道中.当他们放缓接近时,因为对象的定位不好,他们正在编码实际动力限制. 动态信息是"免费的" 它随着每一个示范,嵌入在行动序列,

按任务类型的真实与真实差距:量化证据

根据任务类型,模拟到真实差距的大小会有很大的不同.以下数据是从多个硬件平台上发布的基准和RCSV内部评估中汇总的:

Task Type Sim Success Real Success (Sim Policy) Real Success (Teleop Data) Demos Needed
Pick-place (rigid, top-down) 95% 75-85% 90-95% 100-200
Peg-in-hole (1mm clearance) 90% 30-50% 80-90% 200-400
Deformable manipulation (cloth) 80% 15-30% 65-80% 300-600
Cable routing / insertion 70% 10-25% 70-85% 400-800
Liquid pouring 85% 20-40% 75-90% 150-300
Tool use (e.g., screwdriver) 75% 5-15% 60-75% 500-1000

模式很清楚:具有更丰富的接触动态的任务显示出更大的真实与真实之间的差距.对于上下硬的选择场,差距为10-20个百分点.

价格/质量-调试比较

实际数据方法的常见反对是成本.一旦环境得到了模拟数据,模拟数据就"免费"了;实际示范需要运营商,硬件和时间.

Data Source Cost/Demo Demos for 80% Success Total Cost to 80% Time to 80%
Sim-only (Isaac Sim) ~$0.001 Often unreachable for contact tasks N/A (ceiling ~50-60%) 2-4 weeks sim engineering
Sim + domain rand (tuned) ~$0.01 (compute) 500K-1M episodes $5K-10K compute + 4-8 weeks engineering 4-8 weeks
Real teleop (in-house) $15-30 200-400 $3K-12K + hardware setup 2-3 weeks
Real teleop (RCSV managed) $8-16 200-400 $2,500 pilot / $8,000 campaign 1-2 weeks
Hybrid (sim pre-train + real fine-tune) $0.01 sim + $10 real 50K sim + 100-200 real $2K-5K total 3-4 weeks

关键见解:对于接触丰富的任务,模拟本身不过不惜任何代价都无法达到目标成功率,因为性能上限由接触模型的忠诚度限制.实际数据更快,更可预测地达到目标,而管理收集路径 (RCSV的 [数据服务]T2)) 消除了建立自己的收集基础设施的总费用.

模拟失败的三个案例研究

  • ** 片抓:** 整个行业的六个团队报告说,在Iacac Sim中训练有素的政策,具有默认PBR摩擦参数,在模拟中取得了80%以上的成功,但在真实硬件上达到40%以上.接触硬度模型是错误的.转换到真实远程操作数据,在300次示范中,成功率超过85%.
  • 电缆插入: 变形几何在实时物理引擎中基本未解决. USB-C电缆在指触摸下变形取决于其特定的接紧张,外套的硬度和核心合规性.
  • **液体流出:**液体动力模拟在杯水的尺度上是通过SPH或基于电网的方法计算可处理的,但液体,杯边形几何学和表面电压之间的相互作用是足够复杂的,以至于模拟训练的政策系统地过度流出.一个200个示例的远程操作数据集产生了比模拟训练的50K步骤RL政策更好的政策.

模拟实际上是什么正确的

这不是对模拟的论点 这是对模拟的使用的论点.

  • **自由空间运动规划:**已知环境中无碰撞轨迹生成从真实转移到真实.物质的物理 (硬体动力学) 精确地进行了建模.
  • **多种场景生成:**模拟可以生成数千个对象姿势,表格配置和环境布局,物理设置需要数周的时间.
  • ** 无限数据尺度用于粗行为:** 让机器人大致地向目标方向,接近物体或导航走廊可以从数百万个模拟事件中启动.
  • 预训练视觉编码器: 训练视觉脊柱在数百万模拟场景上,具有多种物体外观,照明条件和摄像头的视角,产生了很好的演示,将其转移到真实摄像头.这可能是今天模拟的最高ROI使用.

模拟数据有什么帮助:预训练案例

模拟数据最强大的论点不是作为主要的培训来源,而是作为预训阶段.

**1.视觉表示预训练.**使用域名随机化进行1M模拟场景训练ResNet-50或ViT脊柱.结果编码器学习到实体摄像头中转移到物体级的特性 (边缘,形状,空间关系). 精细调节200个实例演示需要比从零开始训练少3-5倍的代,而结果的政策更适用于新型摄像头的视角和照明条件.

**2.粗运动技能启动.**预先训练100K模拟集中的政策来学习粗运动原始 (接近对象,方向抓住器,闭手指).这将实际数据需求从500个演示到100-200个演示对许多任务减少,因为真正的细节调整只需要纠正接触阶段行为而不是从头开始学习整个轨迹.

3.失败模式发现. 在10K随机场景上运行sim政策,并对失败模式进行目录.使用此目录设计针对的真实数据收集收集示范,特别是在sim政策失败的配置中.这种失败指导的方法产生一个数据集,最大的信息是为了缩小sim-to-real差距.

混合方法:实际的边界

现在,最有效的团队在2025年没有在真实和真实之间选择,他们正在使用结构化混合管道.

**Sim预训练+真实的细调 (标准方法):**训练在sim,对100-500个真实演示进行细调.适用于sim政策达到40-60%的真实成功的任务.预期的改进:20-40个百分点从细调. pi0,OpenVLA和大多数基于VLA的系统用于任务专业化.

真实脊柱+sim增强: 训练对真实数据进行主要政策,然后以真实:sim比率为 1:3至 1:5的sim数据增强.sim数据提供了几周的状态空间覆盖,实际收集可能需要数周的时间.

**模拟用于探索 + 精炼:**使用RL在模拟中发现难题的新解决方案 (例如工具使用策略,重新抓取序列).将发现的策略作为路线序列.然后收集这些策略的实实实例示范,并训练一个实践策略. 这种方法利用了Sim的探索数百万轨迹的能力,同时避免在部署期间接触模型问题.

斯威尔士国家安全委员会的远程操作方法

根据RCSV的数据收集方法,我们在实例示范数据中最大限度地提高信号与噪音比率.

  • 结构化变化协议: 于是我们系统地在预定义的网格中对象位置,方向和场景背景进行变化,而不是将所有示范集合集成到单个场景配置中. 这确保数据集覆盖了对通用化的变化轴,而不是过度代表单个配置.
  • 运营商级系统: 幼儿运营商 (培训1-2周) 收集L1任务 (简单的选择地点).高级运营商 (1个多月的经验) 处理L2任务 (多步操作).QA领导 (3个多月)处理L3任务 (精确插入,工具使用).这种对操作员技能和任务复杂性的匹配,在每个难度级别上最大化了演示质量.
  • **三门质量管道:**每次示范都通过 (1) 自动测试 (速度限制,工作空间限制,剧集长度), (2) 基于ML的质量分类器,训练用50K+标记的剧集,以及 (3) 10%的样本检查率.拒绝率通常为15-25%,确保只有清洁的示范进入最终数据集.
  • **硬件标准化:**所有采集都在使用 [OpenArm 1]T3) ($4,500) 或 DK1双手设置和同步多摄像头录音的校准,标准化工作站上进行.这消除了硬件特定的噪音,从而降低了不同采集设置的政策培训.

结果:RCSV收集的数据集始终实现了比在专业设置中收集的相等规模数据集中15-25%较高的政策成功率,基于ACT和传播政策架构的12项任务的比较.

正确的心理模式:在西姆中粗,在真实中很好

我们所看到的最有效的方法是两阶段战略.第一阶段,使用模拟来训练一个广泛的前者:机器人学习接近物体,估计抓取候选人,并在数千个物体类别中执行粗略的选择运动.这个阶段可以在单一A100上一夜运行,并产生一个政策,在90%的时间内得到10厘米的正确抓取.

在第二阶段,收集200-500个具体任务的真实远程操作示范. 根据这些真实数据进行模拟训练的模型进行细节调整. 组合通常比仅仅是模拟或仅是真实方法更好,并且与从头开始训练相比,实际数据需求减少了5-10倍.

收集数据工作的RCSV观察

在RCSV的数十个数据收集项目中,我们一直观察到数据质量比数据量超过接触任务.从训练有素运营商的300个专家示范的集合比初学者运营商对接触,插入或接地任务的1500个示范更高. 专家运营商本能避免将政策混的示范他们使用一致的,清洁的运动,

我们还观察到,前200个示范显示,大多数L2复杂任务 (结构化选择场所) 的回报率下降.接下来的300个示范提高了对新物体姿势的强度.500个以上,进一步的改进需要引入新的物体实例和环境变化.

混合动力战略实践中

我们建议团队开始一个新的操纵任务的方法: (1) 建立或下载一个模拟环境进行粗的行为预训练, (2) 运行50K-100K的模拟步骤来启动政策, (3) 通过结构化数据收集协议收集300-500个真实远程操作示范, (4) 进行细节调整, (5) 在 3个新条件中评估你没有训练. 这种管道通常在4-6周内制造出准备部署的政策,而不是仅仅在SIM的方法所需的3-6个月.

模拟混合管道 (pseudocode) # 阶段1: Sim预训练python train.py \ --data sim_dataset/ \ --epochs 100 \ --backbone resnet50 \ --domain-rand视觉+物理 \ --save checkpoint_sim.pt # 阶段2: 实际细调 python train.py \ --data real_teleop_dataset/ \ --epochs 50 \ --backbone resnet50 \ --resume checkpoint_sim.pt \ --lr 1e-4 \ # 低LR 细调 --freeze-backbone 10 # 结结视觉编码器在第10个阶段 # 3: 评估python.py 评估. \ ----checkpoint\fin_et. -- -- -- ----epoints \ \ 时代_scenes\ \ 时代_scenes\ \ 时代_scenes \ ----

对于那些想今天开始收集实实例数据的团队,RCSV的 [数据收集服务]T4) 提供训练有素的运营商,校准硬件和结构化的质量管道, 试点项目为200个示范项目开始,

相关阅读

  • 机器人训练数据指南
  • 现在,我们需要一个新的技术.
  • 机器人传播政策
  • 根据"数据集团"的数据,
  • 机器人数据注释
  • [数据服务]
  • 其他国家:
  • T13

开始收集真正的机器人示范

斯威尔士国家机器人管理局提供训练有素的操作员,OpenArm 1硬件,以及对机器人示范收集的完整质量管道.

[查看数据服务]