机器人模仿学习中的10个常见错误 (以及如何纠正它们)
训练机器人政策时最常见的错误是模仿学习的数据质量,算法选择,评估和部署错误,每个机器人都有特定的修复.
部分: [模仿学习指南]
模仿学习失败的原因主要是数据问题,而不是算法问题. 以下是我们最常见的10个错误,每个错误都有具体的技术修正.
引言
模拟学习是令人欺骗的.算法简单,设置是标准的,并且对于 [ACT]
错误1: 演示器太少,难以完成任务
团队读到ACT在一个简单的选项任务上取得了强大的成绩,并假设200个将足以完成他们的精确组装任务.
粗略的难度尺度: L1 (大物体开放循环接入和抓取): 50-200个演示. L2 (闭环选择地点,有多种物体姿势): 300-800个演示. L3 (接触丰富的插入,装配具有5mm耐受性): 1,000-5000个演示. L4 (
**如何检测:**培训损失趋近,但评估成功率低 (<60%).
修正: 开始收集之前,使用上述难度尺度作为预算估计. 如果估计成本超过您的预算,请考虑是否可以简化任务 (更大的容忍度,预定对象) 以降低一个难度水平.
错误2:收集和部署之间不一致的照明
照明变化对人类眼睛看起来很微不足道--从早晨到下午的太阳通过窗户移动,取代一个空头的
如何检测: 收集环境中的政策很好,但在部署中失败.
** 修复:** 在数据收集过程中控制照明 (黑幕或有固定色温的LED电池板,与5000K的白光平衡).在训练期间应用积极的色调
错误3:不过错误的示例
新运营商的原始示范数据通常包含15-30%的失败事件.学习远程运营系统的运营商会
**如何检测:**政策显示犹
** 修复:** 建立或使用简单的成功分类器.对于选用地点任务,这可以简单地如检查对象是否在集集结后的目标区. 在训练之前过
错误第四:使用单摄像头
一台固定摄像头在接近时会造成遮蔽问题.当机器人臂进入工作空间时,它可以同时阻止对象和抓住器的视觉 - - 让政策没有视觉信息,正当它需要最详细的.这对于插入任务特别有害,最后5厘米的接近是关键的.
如何检测: 策略在预抓方法中成功,但在最后的2-5厘米接触阶段失败.
** 修复:** 作为基线,使用三部摄像头设置: (1) 工作场所概述的直观固定摄像头, (2) 侧角摄像头,用于手臂对象关系, (3) 接触区的手腕安装摄像头.手腕摄像头是唯一最具影响力的补充 - 它给政策直接的视觉反
错误5: 差的物体设置随机化
许多团队收集了几乎相同的起始位置的对象的示范--操作员在每个集前将对象放置在相同的地方. 这训练了一个政策,在这些位置上的对象工作,
**如何检测:**训练分布位置的成功率高 (>90%) 但即使是小位置扰乱,也会迅速降低. 绘制所有训练阶段的 (x,y) 起始位置 - - 如果它们紧密集成,则随机化不足.
** 修正:** 在每次剧集之前,将目标对象放置在可到达的工作空间内的随机位置.使用网格或标记区以确保系统覆盖.至少,训练集应覆盖80%的工作空间区域,该对象可能会在部署时出现. 对于方向敏感任务 (插入,组装),随机定向也可以:至少有8个不同的起始定向均
错误6:缺失接触丰富的相数据
许多任务都有不同的阶段:接近,接触,操纵,释放.操作员经常通过接触阶段 (抓住器触摸物体时) 由于感觉直观.但这正是政策最需要数据的阶段. 只有在2到3个时间阶段,示威活动通过接触阶段,
如何检测: 政策正确执行方法 (移动到正确的位置),但在接触时失败 - 抓不稳定,插入错失,放置不稳定.检查示范时间:如果接触阶段 (从第一次触摸到稳定的抓) 在50Hz时是 <5个时间步骤,你就会遇到这个问题.
** 固定:** 指示操作员在接触阶段放缓. 有用的协议:在正常速度下接近,在抓住器距离物体3厘米不到时放缓到50%的速度,并在接触过程中保持缓慢的速度,直到实现稳定的抓住.这为政策提供了3-5倍的训练信号,对于关键阶段. 另外,收集从接触阶段前开始的额外示范 (抓住器已经在对象附近定位).
错误7:仅在培训分配上进行评估
只有在训练分布上进行评估,就能给你一个乐观的数字,而不会预测部署的性能.
**如何检测:**如果您没有在训练条件下进行评估,您就定义地存在这种问题.
修正: 在完成政策之前,在三个条件下进行评估: (1) 同类类的新物体实例 (不同颜色,尺寸,纹理), (2) 培训分布之外的新起始位置, (3) 不同背景/表面.要求政策在三个条件中实现您的成功目标.每条件30-50次评估集.
错误8:忽略复杂错误
行为克隆政策受到复杂的错误的影响:随着时间的推移,小错误积累,将机器人推进到训练期间从未见过的状态.该政策没有数据从这些新奇状态中恢复,因此它又做出了另一个错误的决定,导致一个更新奇的状态,等等. 在5到10秒以上的任务中,即使早期步骤看起来正确,这可能导致完全失败.
如何检测: 政策开始很好,但在一个集中随着时间的推移恶化.第一2-3秒看起来很好;在5-8秒钟,机器人处于无法恢复状态.较长的集比较短的集失败率更高.
修正: 两个具体方法. ** 行动分量** (如 [ACT]
错误9:错误的行动空间选择
行动空间 - - 实际上政策预测的 - - 对性能产生了惊人的影响.两个常见的选择是联合空间行动 (目标联合位置) 和卡特西亚空间行动 (目标最终效应器姿势).对你的任务的错误选择会给政策带来不必要的困难.
**如何检测:**政策训练良好 (损失较低),但在部署时产生
** 修正:** 使用联合空间操作 (目标联合位置) 为领导者跟随者远程操作数据的默认,因为领导臂自然产生联合空间目标.只使用卡特西亚空间操作,如果你的任务具有强大的几何结构,更容易用卡特西亚坐标表达 (例如,绘制直线). 具体来说,对于ACT,最初的实施使用了联合空间操作,这是建议的默认.
# Joint-space vs Cartesian-space action -- use joint-space by default
# This is how RCSV records actions for ACT training:
# GOOD: Joint-space action (7-dim: 6 joints + gripper)
action = leader_arm.get_joint_positions() # Direct from leader arm
# Stored as: [j1, j2, j3, j4, j5, j6, gripper_width]
# AVOID (unless you have a specific reason):
# Cartesian-space action (7-dim: xyz + quaternion)
# action = robot.get_ee_pose() # Requires IK at deployment
# IK solutions may be non-unique, introducing discontinuities
错误10:跳过数据飞轮
具有最佳表现的政策的团队不是最多数据的队伍,而是那些根据观察到的故障模式不断改进的队伍.一次性收集加上一次性培训,产生了对初始数据集质量冷
**如何检测:**您培训了一个政策,它以X%的成功率运行,并且您自此没有收集额外的数据.
** 修复:** 从第一天起建立数据飞行车. 部署政策,记录每次故障,每周审查故障,确定前3种故障模式类别,收集涵盖这些故障模式的50-100个目标示范,重新训练.即使每次
数据集质量检查清单
在训练之前,请验证数据集通过了所有这些检查:
- [ ] 剧情数量达到难度门
-- L1: 50+, L2: 300+, L3: 1000+, L4: 5000+ - [ ] 过
失败事件 -- 过后训练组中失败率为<5% - [ ] 对象呈现随机 -- 开始位置覆盖>80%的部署工作空间
- [ ] 控制或增强的照明 - 收集期间的一致照明 OR 计划进行激进增强
- [ ]多摄像头设置 - 最少有2部摄像头 (上头+手腕),理想情况下3部
- [ ] 单调和同步的时间标签 -- 10ms内观察-行动对齐
- [ ] 接触阶段充分采样 -- >5个时间步骤从第一次接触到稳定的抓住
- [ ] 没有操作员发现的文物--查看10个随机事件,以发现犹
,纠正或不寻常的模式 - [ ] 轨道在边界内平滑 - 平均
低于任务特定门 - [ ] 预备了进行的评估集--30-50集,新条件为测试预留
对于收集自己的数据的团队,每次训练之前都应该审查这个检查列表.查看我们的 [词典]
相关阅读
- ACT政策解释 --最受欢迎的IL算法的架构细节
- [开始电话操作] (
T10 ) - - 如何正确设置收藏 - [跨体训练]
T11 ) --利用多机器人数据 - RCSV数据服务 -- 通过过
质量进行示范收集 - RCSV数据平台 --数据集管理和质量跟踪
在修复算法之前,修复数据管道
根据RCSV的数据收集服务,可提供过







