返回Research

机器人操纵政策评估:严格的方法指南

如何严格评估机器人操纵政策? 测试组设计,指标,环境控制和统计意义.

严格评估将实际进展与实验室过度装备分开. 本指南涵盖测试组设计,指标,统计要求和操纵政策报告标准.

为什么评估难

操纵政策评估是令人欺骗的.一个政策可以在训练的精确物体和照明条件上取得95%的成功,但当一个变量改变一个称为实验室过度配件的现象时,完全失败.该政策更记忆测试环境而不是学习将其概括.

核心问题是,研究人员在训练和评估期间控制了太多变量.同样的相机位置,同样的桌面高度,同样的物体在相同的方向每一个常数都变成.当你报告 "95%的成功率",读者认为一般化,但你可能已经测量了记忆.

严格的评估需要有意义地设置条件:训练中未见的物体,数据收集中未使用的照明,与训练设置故意不同的桌面高度.

评估尺寸

完全的操纵评估包括三个主要维度:

  • 成功率 双数 (任务完成/不完成) 和部分信用.双数成功很容易计算,但会丢弃信息.一个可靠地抓住正确的政策,但在转账期间下降的政策,应获得与一个从未实现稳定的把握的分数不同的分数.在运行试验之前定义部分信用分类.
  • 效率 任务完成时间 (秒),需要的人类干预次数和重复抓住次数.在45秒内成功的政策比在3分钟内成功的政策更好.干预特别重要:每任务需要2次干预的政策即使在90%的成功下也无法部署.
  • ** 强度** 测试中差异 (变化系数),新条件下的性能 (新物体,新照明,新乱) 和优雅的降解. 80% 的平均成功,但40% 的标准偏差的政策比 75% 的平均和5% 的标准偏差的政策更不有用.

测试组设计

测试组设计是大多数评估协议失败的地方.

3新型照明条件 × 2桌高度 × 5新型物体 × 3分心器配置 = 90试验条件最低.

新型照明是指在任何训练数据收集过程中不使用的照明设置. 新型物体是具有相似的价格,但不同的视觉外观的物品. 分散器配置测试该政策是否关注目标对象或被附近的物体混.

对于每一个测试条件,至少运行5次试验以估计每一个条件的成功率.这给你提供了90个条件矩阵的总试验450次.记录每一次试验 失败都与成功一样有信息.

计量表

Metric Definition How to Measure Deployment Threshold
Binary success rate Task completed without intervention (%) Human observer scores each trial ≥ 80% on novel objects
Partial credit score Weighted sub-task completion (0–1) Rubric-based scoring per phase ≥ 0.85 mean score
Time to completion Wall-clock seconds from start signal Automated timer, log per trial ≤ 2× human baseline
Intervention rate Human resets per 100 trials Count interventions per session ≤ 5 per 100 trials
Novel object transfer Success on held-out object set (%) Separate test set, never in training ≥ 60% (generalization)
Robustness variance Std dev of success across conditions Per-condition trial average CV ≤ 0.20

统计要求

只有一个试验证明了什么.

N = 100次试验对于成功率的 ±10个百分点信心间隔 (95%的信心,二项分布).

对于算法比较 (例如"我们的方法与 ACT基线"),在匹配的试验条件中使用对 t-测试.在同一天,在同一环境中,在相同条件下运行两个算法.报告p值,效果大小 (Cohen的d),以及信任间隔不仅是"我们的方法更好".

对于多条件评估,使用混合效应模型,条件是随机效应. 这解释了各种条件的系统变化,而不是把所有试验都视为独立.

环境控制

物理不是常态的. 环境中的小变化影响了重复性,

  • 摄像头位置记录 用带或固定支标记确切的安装点. 2厘米的摄像头转移改变了足够的输入分布,以可测量降低政策性能.
  • 照明日志 每次会议之前在工作场面上记录Lux水平.通过窗户的自然光在一天内改变照明500010000Lux.使用幕或仅在人工照明下进行试验.
  • 表面与温度相比变化.在18°C对28°C,同一手指产生可测量的不同接触力.记录环境温度并报告.
  • 物体放置协议 定义确切的放置区 (例如",在标记目标半径5cm内的物体中心,随机定向").随机放置引入变化;无放置协议使试验难以比拟.

常见的评估错误

  • 在训练对象上测试 最常见的错误. 如果任何测试对象出现在训练数据中 (相同的 SKU,相同的颜色),您的成功率测量了记忆. 从数据收集开始时保持一个严格的持久对象集合.
  • 单一的照明条件 几乎所有发表的操纵结果都采用单一的照明设置. 这使得政策比实际情况更强大.
  • 只有一个小组的研究人员可以在研究中发现,这些研究结果是非常重要的.
  • ** 桃选示** 选择哪些试验要报告,或者在结果看起来好时早点停止. 在进行试验之前预先注册评估协议.
  • 评价者偏见 运行试验的研究人员知道哪个条件是"更好的"算法. 尽可能使用盲目评估,或至少自动检测成功.

报告标准

完全的操纵评估报告包括: (1) 包含对象照片和条件矩阵的完整测试集描述, (2) 每个条件的测试数量, (3) 报告的所有指标的可信度间隔, (4) 对比的统计测试结果, (5) 记录环境条件, (6) 代表性成功和故障情况的视频, (7) 故障模式分类.

通过使用数据和代码来进行评估,您可以使用数据和代码.

系统的数据平台提供结构化评估记录,自动测试分数和标准化报告模板,用于操纵政策基准分析.

执行对RCSV基础设施的严格评估

访问标准化评估环境,自动测试记录和统计报告工具. 根据共享测试组的发布基线,比较您的政策.

[访问评估平台]