返回Blog

机器人模仿学习中的10个常见错误 (以及如何纠正它们)

训练机器人政策时最常见的错误是模仿学习的数据质量,算法选择,评估和部署错误,每个机器人都有特定的修复.

部分: [模仿学习指南]

T2)

模仿学习失败的原因主要是数据问题,而不是算法问题. 以下是我们最常见的10个错误,每个错误都有具体的技术修正.

引言

模拟学习是令人欺骗的.算法简单,设置是标准的,并且对于 [ACT]T3),扩散政策和勒罗бот都有出色的开源实现.然而,大多数团队都会遇到相同的可避免错误 - - 错误可以浪费数周的工程时间并产生在部署时失败的政策. 本文列出了十种最常见的目录,每个目录都有具体的检测方法和修正.

错误1: 演示器太少,难以完成任务

团队读到ACT在一个简单的选项任务上取得了强大的成绩,并假设200个将足以完成他们的精确组装任务.

粗略的难度尺度: L1 (大物体开放循环接入和抓取): 50-200个演示. L2 (闭环选择地点,有多种物体姿势): 300-800个演示. L3 (接触丰富的插入,装配具有5mm耐受性): 1,000-5000个演示. L4 (色的手动操纵): 5,000-20,000个演示.

**如何检测:**培训损失趋近,但评估成功率低 (<60%).

修正: 开始收集之前,使用上述难度尺度作为预算估计. 如果估计成本超过您的预算,请考虑是否可以简化任务 (更大的容忍度,预定对象) 以降低一个难度水平.

错误2:收集和部署之间不一致的照明

照明变化对人类眼睛看起来很微不足道--从早晨到下午的太阳通过窗户移动,取代一个空头的光管,打开附近的门--可以改变像素值15-30%,导致视觉政策灾难性失败. 我们看到,在数据收集室中90%的成功率的政策在一个楼层上部署时达到20%的成功.

如何检测: 收集环境中的政策很好,但在部署中失败.

** 修复:** 在数据收集过程中控制照明 (黑幕或有固定色温的LED电池板,与5000K的白光平衡).在训练期间应用积极的色调升:亮度+/-30%,色调+/-20%,度+/-15%.在考虑它准备用于部署之前,在5种不同的照明条件下测试训练的政策.

错误3:不过错误的示例

新运营商的原始示范数据通常包含15-30%的失败事件.学习远程运营系统的运营商会乱抓,意外释放物体或中途任务.如果你将这些包含在训练集中,政策学会了模仿成功和失败行为 - - 这平均是中等的政策.

**如何检测:**政策显示犹,部分抓住或"混乱"行为,看起来像它是两个不同的策略之间的平均. 审查你的训练集:如果>5%的集段明显失败,你有这个问题.

** 修复:** 建立或使用简单的成功分类器.对于选用地点任务,这可以简单地如检查对象是否在集集结后的目标区. 在训练之前过失败的集. 在RCSV,我们运行自动成功分类以及在交付前对所有收集的数据进行人为审查.即使有10%的失败演示导致政策成功率下降20-30%.

错误第四:使用单摄像头

一台固定摄像头在接近时会造成遮蔽问题.当机器人臂进入工作空间时,它可以同时阻止对象和抓住器的视觉 - - 让政策没有视觉信息,正当它需要最详细的.这对于插入任务特别有害,最后5厘米的接近是关键的.

如何检测: 策略在预抓方法中成功,但在最后的2-5厘米接触阶段失败.

** 修复:** 作为基线,使用三部摄像头设置: (1) 工作场所概述的直观固定摄像头, (2) 侧角摄像头,用于手臂对象关系, (3) 接触区的手腕安装摄像头.手腕摄像头是唯一最具影响力的补充 - 它给政策直接的视觉反,任何外部摄像头都无法提供. 查看我们的 [远程操作指南]T5) 详细的摄像头配置.

错误5: 差的物体设置随机化

许多团队收集了几乎相同的起始位置的对象的示范--操作员在每个集前将对象放置在相同的地方. 这训练了一个政策,在这些位置上的对象工作,

**如何检测:**训练分布位置的成功率高 (>90%) 但即使是小位置扰乱,也会迅速降低. 绘制所有训练阶段的 (x,y) 起始位置 - - 如果它们紧密集成,则随机化不足.

** 修正:** 在每次剧集之前,将目标对象放置在可到达的工作空间内的随机位置.使用网格或标记区以确保系统覆盖.至少,训练集应覆盖80%的工作空间区域,该对象可能会在部署时出现. 对于方向敏感任务 (插入,组装),随机定向也可以:至少有8个不同的起始定向均分布.

错误6:缺失接触丰富的相数据

许多任务都有不同的阶段:接近,接触,操纵,释放.操作员经常通过接触阶段 (抓住器触摸物体时) 由于感觉直观.但这正是政策最需要数据的阶段. 只有在2到3个时间阶段,示威活动通过接触阶段,

如何检测: 政策正确执行方法 (移动到正确的位置),但在接触时失败 - 抓不稳定,插入错失,放置不稳定.检查示范时间:如果接触阶段 (从第一次触摸到稳定的抓) 在50Hz时是 <5个时间步骤,你就会遇到这个问题.

** 固定:** 指示操作员在接触阶段放缓. 有用的协议:在正常速度下接近,在抓住器距离物体3厘米不到时放缓到50%的速度,并在接触过程中保持缓慢的速度,直到实现稳定的抓住.这为政策提供了3-5倍的训练信号,对于关键阶段. 另外,收集从接触阶段前开始的额外示范 (抓住器已经在对象附近定位).

错误7:仅在培训分配上进行评估

只有在训练分布上进行评估,就能给你一个乐观的数字,而不会预测部署的性能.

**如何检测:**如果您没有在训练条件下进行评估,您就定义地存在这种问题.

修正: 在完成政策之前,在三个条件下进行评估: (1) 同类类的新物体实例 (不同颜色,尺寸,纹理), (2) 培训分布之外的新起始位置, (3) 不同背景/表面.要求政策在三个条件中实现您的成功目标.每条件30-50次评估集.

错误8:忽略复杂错误

行为克隆政策受到复杂的错误的影响:随着时间的推移,小错误积累,将机器人推进到训练期间从未见过的状态.该政策没有数据从这些新奇状态中恢复,因此它又做出了另一个错误的决定,导致一个更新奇的状态,等等. 在5到10秒以上的任务中,即使早期步骤看起来正确,这可能导致完全失败.

如何检测: 政策开始很好,但在一个集中随着时间的推移恶化.第一2-3秒看起来很好;在5-8秒钟,机器人处于无法恢复状态.较长的集比较短的集失败率更高.

修正: 两个具体方法. ** 行动分量** (如 [ACT]T6 里所使用) 预测一次20-100个未来的行动,并将它们执行在开放循环中,减少推理调用和限制复合. ** 时间组合** 平均预测从多个最近的行动分量进行更顺利执行. 对于非常长的任务 (>30s),考虑将任务分为3-5次子任务的等级政策,或者DAgger类型的在线数据收集以收集恢复示范.

错误9:错误的行动空间选择

行动空间 - - 实际上政策预测的 - - 对性能产生了惊人的影响.两个常见的选择是联合空间行动 (目标联合位置) 和卡特西亚空间行动 (目标最终效应器姿势).对你的任务的错误选择会给政策带来不必要的困难.

**如何检测:**政策训练良好 (损失较低),但在部署时产生动或物理上不可思议的运动.联合空间政策可能产生通过自我碰撞的配置;卡特西亚空间政策可能产生动态无法实现的目标.

** 修正:** 使用联合空间操作 (目标联合位置) 为领导者跟随者远程操作数据的默认,因为领导臂自然产生联合空间目标.只使用卡特西亚空间操作,如果你的任务具有强大的几何结构,更容易用卡特西亚坐标表达 (例如,绘制直线). 具体来说,对于ACT,最初的实施使用了联合空间操作,这是建议的默认.

# Joint-space vs Cartesian-space action -- use joint-space by default
# This is how RCSV records actions for ACT training:

# GOOD: Joint-space action (7-dim: 6 joints + gripper)
action = leader_arm.get_joint_positions()  # Direct from leader arm
# Stored as: [j1, j2, j3, j4, j5, j6, gripper_width]

# AVOID (unless you have a specific reason):
# Cartesian-space action (7-dim: xyz + quaternion)
# action = robot.get_ee_pose()  # Requires IK at deployment
# IK solutions may be non-unique, introducing discontinuities

错误10:跳过数据飞轮

具有最佳表现的政策的团队不是最多数据的队伍,而是那些根据观察到的故障模式不断改进的队伍.一次性收集加上一次性培训,产生了对初始数据集质量冷的政策.

**如何检测:**您培训了一个政策,它以X%的成功率运行,并且您自此没有收集额外的数据.

** 修复:** 从第一天起建立数据飞行车. 部署政策,记录每次故障,每周审查故障,确定前3种故障模式类别,收集涵盖这些故障模式的50-100个目标示范,重新训练.即使每次代50-100个目标故障恢复示范也可以显著提高强度. 系统的数据集成系统 (RCSV) 使此循环更有效:故障日志直接进入收集任务队列,运营商则对特定故障类别进行针对性示范.

数据集质量检查清单

在训练之前,请验证数据集通过了所有这些检查:

  • [ ] 剧情数量达到难度门 -- L1: 50+, L2: 300+, L3: 1000+, L4: 5000+
  • [ ] 过失败事件 -- 过后训练组中失败率为<5%
  • [ ] 对象呈现随机 -- 开始位置覆盖>80%的部署工作空间
  • [ ] 控制或增强的照明 - 收集期间的一致照明 OR 计划进行激进增强
  • [ ]多摄像头设置 - 最少有2部摄像头 (上头+手腕),理想情况下3部
  • [ ] 单调和同步的时间标签 -- 10ms内观察-行动对齐
  • [ ] 接触阶段充分采样 -- >5个时间步骤从第一次接触到稳定的抓住
  • [ ] 没有操作员发现的文物--查看10个随机事件,以发现犹,纠正或不寻常的模式
  • [ ] 轨道在边界内平滑 - 平均低于任务特定门
  • [ ] 预备了进行的评估集--30-50集,新条件为测试预留

对于收集自己的数据的团队,每次训练之前都应该审查这个检查列表.查看我们的 [词典]T8) 查看本检查列表中使用的技术术语的定义.

相关阅读

  • ACT政策解释 --最受欢迎的IL算法的架构细节
  • [开始电话操作] (T10) - - 如何正确设置收藏
  • [跨体训练]T11) --利用多机器人数据
  • RCSV数据服务 -- 通过过质量进行示范收集
  • RCSV数据平台 --数据集管理和质量跟踪

在修复算法之前,修复数据管道

根据RCSV的数据收集服务,可提供过的,多摄像头的质量示范,自动进行成功分类,并按默认执行完整的质量检查清单.

T14) [与工程师谈话]T15)