机器人操纵政策评估:严格的方法指南
如何严格评估机器人操纵政策? 测试组设计,指标,环境控制和统计意义.
严格评估将实际进展与实验室过度装备分开. 本指南涵盖测试组设计,指标,统计要求和操纵政策报告标准.
为什么评估难
操纵政策评估是令人欺骗的.一个政策可以在训练的精确物体和照明条件上取得95%的成功,但当一个变量改变一个称为实验室过度配件的现象时,完全失败.该政策更记忆测试环境而不是学习将其概括.
核心问题是,研究人员在训练和评估期间控制了太多变量.同样的相机位置,同样的桌面高度,同样的物体在相同的方向
严格的评估需要有意义地设置条件:训练中未见的物体,数据收集中未使用的照明,与训练设置故意不同的桌面高度.
评估尺寸
完全的操纵评估包括三个主要维度:
- 成功率
双数 (任务完成/不完成) 和部分信用.双数成功很容易计算,但会丢弃信息.一个可靠地抓住正确的政策,但在转账期间下降的政策,应获得与一个从未实现稳定的把握的分数不同的分数.在运行试验之前定义部分信用分类. - 效率 任务完成时间 (秒),需要的人类干预次数和重复抓住次数.在45秒内成功的政策比在3分钟内成功的政策更好.干预特别重要:每任务需要2次干预的政策即使在90%的成功下也无法部署.
- ** 强度**
测试中差异 (变化系数),新条件下的性能 (新物体,新照明,新 乱) 和优雅的降解. 80% 的平均成功,但40% 的标准偏差的政策比 75% 的平均和5% 的标准偏差的政策更不有用.
测试组设计
测试组设计是大多数评估协议失败的地方.
3新型照明条件 × 2桌高度 × 5新型物体 × 3分心器配置 = 90试验条件最低.
新型照明是指在任何训练数据收集过程中不使用的照明设置. 新型物体是具有相似的价格,但不同的视觉外观的物品. 分散器配置测试该政策是否关注目标对象或被附近的物体混
对于每一个测试条件,至少运行5次试验以估计每一个条件的成功率.这给你提供了90个条件矩阵的总试验450次.记录每一次试验
计量表
| Metric | Definition | How to Measure | Deployment Threshold |
|---|---|---|---|
| Binary success rate | Task completed without intervention (%) | Human observer scores each trial | ≥ 80% on novel objects |
| Partial credit score | Weighted sub-task completion (0–1) | Rubric-based scoring per phase | ≥ 0.85 mean score |
| Time to completion | Wall-clock seconds from start signal | Automated timer, log per trial | ≤ 2× human baseline |
| Intervention rate | Human resets per 100 trials | Count interventions per session | ≤ 5 per 100 trials |
| Novel object transfer | Success on held-out object set (%) | Separate test set, never in training | ≥ 60% (generalization) |
| Robustness variance | Std dev of success across conditions | Per-condition trial average | CV ≤ 0.20 |
统计要求
只有一个试验证明了什么.
N = 100次试验对于成功率的 ±10个百分点信心间隔 (95%的信心,二项分布).
对于算法比较 (例如"我们的方法与 ACT基线"),在匹配的试验条件中使用对 t-测试.在同一天,在同一环境中,在相同条件下运行两个算法.报告p值,效果大小 (Cohen的d),以及信任间隔
对于多条件评估,使用混合效应模型,条件是随机效应. 这解释了各种条件的系统变化,而不是把所有试验都视为独立.
环境控制
物理不是常态的. 环境中的小变化影响了重复性,
- 摄像头位置记录
用带或固定支 标记确切的安装点. 2厘米的摄像头转移改变了足够的输入分布,以可测量降低政策性能. - 照明日志
每次会议之前在工作场面上记录Lux水平.通过窗户的自然光在一天内改变照明5000 10000Lux.使用 幕或仅在人工照明下进行试验. 表面与温度相比变化.在18°C对28°C,同一 手指产生可测量的不同接触力.记录环境温度并报告. - 物体放置协议
定义确切的放置区 (例如",在标记目标半径5cm内的物体中心,随机定向").随机放置引入变化;无放置协议使试验难以比拟.
常见的评估错误
- 在训练对象上测试
最常见的错误. 如果任何测试对象出现在训练数据中 (相同的 SKU,相同的颜色),您的成功率测量了记忆. 从数据收集开始时保持一个严格的持久对象集合. - 单一的照明条件
几乎所有发表的操纵结果都采用单一的照明设置. 这使得政策比实际情况更强大. - 只有一个小组的研究人员可以在研究中发现,这些研究结果是非常重要的.
- **
桃选示** 选择哪些试验要报告,或者在结果看起来好时早点停止. 在进行试验之前预先注册评估协议. - 评价者偏见
运行试验的研究人员知道哪个条件是"更好的"算法. 尽可能使用盲目评估,或至少自动检测成功.
报告标准
完全的操纵评估报告包括: (1) 包含对象照片和条件矩阵的完整测试集描述, (2) 每个条件的测试数量, (3) 报告的所有指标的可信度间隔, (4) 对比的统计测试结果, (5) 记录环境条件, (6) 代表性成功和故障情况的视频, (7) 故障模式分类.
通过使用数据和代码来进行评估,您可以使用数据和代码.
系统的数据平台提供结构化评估记录,自动测试分数和标准化报告模板,用于操纵政策基准分析.
执行对RCSV基础设施的严格评估
访问标准化评估环境,自动测试记录和统计报告工具. 根据共享测试组的发布基线,比较您的政策.
[访问评估平台]







