返回Research

机器人政策失败模式分析:训练有素机器人为什么失败部署

系统分析训练有素的机器人政策如何失败 <unk>分布转移,变化转移,模式崩<unk>和恢复策略.

机器人政策失败模式的分类,在实在环境中部署训练有素的政策之前,每个必要阅读的减轻策略.

为什么失败模式分析很重要

实验室评估中达到82%的成功的政策可能在部署中失败4050% . 差距并非随机 几乎总是由于特定的,可识别的故障模式导致,这些模式可能在部署之前被诊断和减轻.

下面的故障模式按根源组织,包括诊断信号 (如何确定这种模式是否导致故障) 和缓解策略 (如何通过数据,建筑变化或部署修改来解决问题).

失败模式1: 无法分配的视觉输入

症状: 实验室环境中,该政策表现良好,但在新位置,不同照明或稍微不同物体外观 (新颜色变体,磨损标签,不同表面成品) 部署时,它立即失败.

  • 根源原因: 训练数据是在狭窄的视觉条件下收集的.政策的视觉编码器已经适应了部署环境中缺失的特定纹理,照明模式或背景.
  • 诊断测试: 在3种不同的照明条件下 (上空光与自然光与淡光),2张桌高 (±10厘米) 和3个分散注意力的物体下载,收集20个测试集.如果任何条件下成功率下降到20%以上,OOD视觉输入可能是原因.
  • ** 调整 数据增强:** 随机增强训练图像 (亮度 ±30%,对比 ±30%,色调 ±20%),随机取代背景 (将工作空间粘贴到随机的图像网背景) 和随机照明模拟. 在训练时,从原始图像中应用增强,而不是.
  • **调整 多种数据收集:**在初步数据收集阶段收集多种照明条件,表面和背景配置的示范.
  • 调整 域调整: 在部署后,在部署环境中收集50100个示范集,并调整政策.即使是一个小的域特定的调整集也会大幅恢复性能.

失败模式2:复合错误 (BC 变量变量)

症状: 政策开始任务正确,但逐渐转向了不寻常的状态,然后在训练中没有看到,然后灾难性地失败. 失败在任务的早期越来越多,因为条件变得不太熟悉. 行为克隆政策的经典模式.

  • **根源原因:**行为克隆 (及其变体) 仅在分布状态 (在训练轨迹中出现的状态) 上运行.任何小的政策错误将机器人转移到不在训练分布状态,导致更大的错误,导致更远的状态,最终导致灾难性失败.
  • 诊断测试: 绘制任务时间表中出现失败的状态分布. 如果失败在任务的下半年群集,并且政策在更短的任务中更成功,则复合错误是原因.
  • **减缓 行动零碎 (ACT):**预测H未来的步骤迫使政策规划一致的轨迹而不是步骤反应. 显著减少复合.
  • **调解DAgger:**数据集集. 开始培训后,部署政策,并在政策犯错误时进行人体专家标签纠正. 将这些添加到培训组中,并重新培训. 人体专家能够有效地观察政策推广时,最有效.
  • 减排 扩散政策: 扩散的动作序列的反复否定对早期执行错误更强大,而不是单步预测,因为该过程隐含地重点转向可行的轨迹.

失败模式3:模式崩和模式平均

症状: 培训数据中存在多种有效的策略 (例如从左或右抓),但政策执行了一个混的中间轨迹,这既不是策略,也失败了两者.或者:政策始终执行相同的单一策略,无论任务状态如何,当该策略被阻止时失败.

  • 根原因: 确定性政策的标准平均平方错误训练将演示中平均预测错误降至最低.
  • 诊断测试: 检查所有训练示范,并手动确定是否存在多个不同的策略.如果运营商使用了质量不同的方法 (不同的方法角度,不同的抓取类型),则可能会进行模式平均.
  • 减缓 CVAE (ACT): ACT的条件 VAE将示范的"风格"编码成一个隐藏变量,使得政策在推断时承诺使用一个模式.需要对每个模式进行足够的示范 (2050每模式最低).
  • 扩散政策: 扩散自然处理多模式分布,通过学习从任何模式中调用,而不是平均它们.
  • **调整 数据策划:**如果一个策略是强烈偏好 (例如,在部署环境中总是从左边走向),则调整培训集,以过度代表该策略. 70/30的混合而不是50/50的混合将偏向政策向偏好模式.

失败模式4:接近接触时的精度降低

症状: 接近和粗定位时,政策表现良好,但接触时不稳定 在插入任务上错过25mm,转移时丢弃物体,或不能坐座连接器.

  • **根源原因:**基于相机的感知具有有限的分辨率.在工作空间的典型固定相机距离为6080厘米,1摄像头像素相当于工作空间位置的约0.51毫米.对于需要3mm精度的任务,像素噪音与所需的精度相比较.
  • ** 手腕相机:** 手腕安装相机 (距离接触点515厘米) 在关键精度阶段提供1020×更高的有效分辨率.查看[相机放置文章]T2) 详细分析.
  • 减轻 力/扭矩反: 加入手腕安装的F/T传感器 (ATI Mini45,OnRobot HEX) 提供了不依赖摄像头分辨率的接触检测.
  • 减排 两阶段政策: 分开任务为粗定位阶段 (基于摄像头,标准分辨率) 和精密接触阶段 (手腕摄像头或F/T反). 训练单独的政策或使用一个层次化方法,切换到接近接触的精密政策.

失败模式5:门处理

症状: 工作空间不被封闭时,操作系统表现良好,但当机器人臂或抓住器在相机与所感兴趣的物体之间出现故障时,失败会发生.

  • **根源原因:**固定摄像头无法通过机器人臂看到.机器人接近物体时,该臂遮住固定摄像头的视觉.如果训练数据未在相同的遮蔽条件下收集,则该政策在最需要精确的视觉反时就会收到无法分配的图像.
  • ** 减持 手腕摄像头:** 手腕部装摄像头不管手臂配置如何,保持着抓住器对象接口的一致视图.手腕摄像头的手臂被遮住是物理不可能的.
  • ** 调整 多视觉设置:** 添加第二个固定摄像头在不同的角度 (例如,上头 + 侧) 确保至少一个摄像头总是有清晰的视觉工作空间,即使在手臂罩期间.
  • **

失败模式评估协议

在实施政策之前,运行这个系统评估协议:

  • **名义条件:**30次实验室训练条件. 确定了基准成功率.
  • **照明变化:**每次10次试验在3种不同的照明条件下 (上面光,暖环境,).任何20%以上的成功率都显示了OD视觉输入.
  • 高度和位置变化: 10次试验在2台高度 (±10厘米从训练高度).
  • 分散器对象: 10次试验,工作场所中35个无关的对象.
  • 新型物体变体10次试验,目标物体的颜色或纹理变体不同.
  • 部署环境: 试验在实际部署环境中进行20次,

系统性政策评估

系统包括一个结构化评估框架,在模拟中自动执行您的违反故障模式协议的政策,并在现实世界中部署之前标记风险.

探索平台 →