返回Research

人在循环中作为一流的学习信号

为什么人类纠正,干预和操作员行为应被视为真正的机器人系统中的一流学习信号.

为什么操作员纠正,恢复和干预应塑造现代机器人数据管道的设计方式.

人类的投入变成监督

展示干预恢复火车

许多机器人学习系统仍然把人当作临时的架架构:它在开始时是有用的收集示范,但在培训过程中一旦一项政策被忽视.实际上,这是错误的抽象.人类行为不仅仅是一个启动工具.它往往是了解任务意图,失败界限和恢复策略的最丰富的信号之一.

信号的存在

值不仅仅限于成功的示范,它出现在暂停,轨道中调整,抓住调整,重新尝试行为以及操作员注意到任务即将失败,并在机器人犯错误行动之前改变策略的时刻.

为什么数据设计是如此重要的

如果团队只保存最后的成功轨迹,他们会抛弃大量的结构,解释了成功如何实现.那些缺失的时刻通常是帮助政策变得更强大的原因:如何从漂移中恢复,如何在接触之前放缓,如何在部分错误后重新接近,以及如何回应当国家估计略有错误时.

捕获什么

  • 干预 当一个人过失或推重任务时.
  • 修正 姿势,力量或序列的小变化反映了专家判断.
  • 退出 失败或部分尝试,揭示任务的真正困难.
  • ** 任务元数据** 操作员身份,难度标签和文本,解释选择为什么改变.

实际的结论

构建真正的机器人系统的团队应该停止将人类输入视为围绕"真实的"自主轨迹的噪音.这往往是他们真正想要的政策行为最明确的表达.好的数据集保存该信号,而不是将其分解成简单的成功重播.

最佳实践 与示范本身一起记录人类的纠正和恢复.

如何收集示范 数据收集指南 ←回到研究

设计更好的由人引导的数据循环

如果您正在构建操作员工作流程,远程操作循环或干预意识的数据集,

请求数据 联系我们 探索硬件