测量机器人示范数据质量:关键指标和门<unk>
如何在培训前评估机器人远程操作示范的质量 <unk>成功率,顺利性,覆盖率和多样性指标.
预测政策绩效的数据质量指标
质量比数量
在过去三年中,从大型模仿学习研究中最重要的见解是,数据质量占据了政策执行量的统治地位,高达大约10,000次示范.在培训行为克隆,ACT或传播政策时,一个由1000次高质量的示范组成的数据集总是超过5000次噪音的示范.
尽管如此,大多数数据收集程序都没有正式的质量指标. 运营商收集到达目标数量之前,然后将数据交给培训团队. 本文定义了预测政策绩效的指标和每个主要算法所需的门
任务成功率
任务成功率是最重要的单个指标. 它衡量数据集中的示范的比例是真正成功完成任务的,而不仅仅是完成的运动.
- 二进制成功: 金标准
一个人评审者观看每一集,并将其通过/失败标签与书面标题. - **部分信用条款:**对于复杂的多步骤任务,二进制标签会丢失信息.一个5点条款 (0:完整失败,1:任务开始,2:实现关键中介,3:接近完成,4:完全成功) 允许细分数据集的策划. 仅包括3
4分的演示在培训集中. - 自动成功分类器: 为了达到尺度,将基于ResNet-18或CLIP的分类器训练在一个手动标记的种子集中,500
1,000集. 适用于所有剩余的集中. 实现了85 92%的精确度,用于精确的任务. 总是验证分类器的性能与一个新鲜的人类标记集.
轨道顺
滑稽的示范培训更滑动的政策. 由于操作员缺乏经验,远程运行迟缓或机械绑定而导致的荒谬的示范
- Jerk指标: 时间的位置的第三个衍生值.计算每个轨道上的RMS
动.好的操作员演示具有RMS 动 < 2 m/s3用于桌面操作. 标志节目RMS 动 > 5 m/s3用于人类审查. - **速度差异:**最终效应器速度的高差异 (以轨迹上的分别变化系数来测量) 表示犹
和修正. - 关联速度限制: 拒绝任何关联超过其最高名额速度的80%的事件. 接近速度限制的示范表明操作员过度反应或硬件问题.
工作场所覆盖范围
工作场所覆盖范围是衡量您的示范范围是否适合相关国家空间.
- **终端效应器
体体体积:**计算数据集中的所有终端效应器位置的3D 体体.与理论任务工作空间进行比较.目标>60%的覆盖率为初始条件差异高的任务. - 物体位置覆盖: 如果在收集过程中对象的放置是随机的,请检查对象开始位置分布在预期范围内的数据集均
. - 轨迹长度分布: 按节目轨迹长度的历史图 (步骤) 绘制.分布应单模,不过宽 (CV < 0.4).双模分布通常表明两个不同的解决方案策略
,必须明确处理.
行动多样性
行动多样性是衡量您的数据集是否包含多种操纵策略,这对于能够处理意想不到的状态的培训政策很重要.
- 行动
: 判断行动空间,计算行动边际分布的. 低 表示大多数示范都遵循几乎相同的行动序列. - **每运营商的多样性:**计算同一运营商对不同运营商的所有轨迹对象之间的双向DTW距离矩阵.
- Grasp pose diversity: 为了抓取任务,在每个演示中抓取点中提取抓取器的方向. 绘制分布在SO(3) 球体上.一个好的数据集涵盖了多种接近角度,而不是单一的正规的上下抓.
人类一致性分数
测量表表测量操作员之间示范的可复制性
- 运营商间协议: 单独计算每个运营商的成功率.运营商间的差异 (σ2个运营商的成功率) 应该低.高差异 (σ > 0.15) 意味着任务指令模糊或某些运营商需要重新训练.
- 黄金标准的相似性: 根据联合轨迹使用DTW的黄金标准组,对每个运营商的演示进行比较.平均DTW距离 > 2x黄金标准中位数的运营商是重新培训的候选人.
自动化质量管道架构
标准标准:在标准范围内,质量评估必须自动化.
- **Gate 1
方案和传感器验证:**检查HDF5方案,验证相机框架是否空,验证自录数据范围. 拒绝2 5%的剧情因技术缺陷. - 门2
动态过 联合限制检查,速度限制检查,持续时间限制. 拒绝~5器: 10%. - **门3
滑度过 :**RMS 动和速度变化门 . 根据操作员经验,拒绝~5 15%. - **Gate 4
成功分类器:**基于ML的成功预测. 对于典型任务,拒绝~15 25%.分类器标记的所有集都会被发送到人类评论队列,而不是自动删除.
根据算法的质量门
| Algorithm | Min. Success Rate | Max. Jerk (RMS) | Min. Demos (typical task) | Sensitivity to Noise |
|---|---|---|---|---|
| 行为克隆 | >85% | <3 m/s³ | 500–2,000 | High — averages modes |
| ACT (Action Chunking) | >80% | <4 m/s³ | 200–1,000 | Medium — CVAE handles multimodality |
| Diffusion Policy | >70% | <5 m/s³ | 300–1,500 | Low — diffusion models multi-modality |
| IBC (Implicit BC) | >80% | <4 m/s³ | 1,000–5,000 | Medium |
| GAIL / adversarial IL | >75% | <5 m/s³ | 500–3,000 | Low |
这些门
RCSV [数据平台]
质量保证的示范数据
每个RCSV数据集都提供完整的质量报告







