人在循环中作为一流的学习信号
为什么人类纠正,干预和操作员行为应被视为真正的机器人系统中的一流学习信号.
为什么操作员纠正,恢复和干预应塑造现代机器人数据管道的设计方式.
人类的投入变成监督
展示干预恢复火车
许多机器人学习系统仍然把人当作临时的架架构:它在开始时是有用的收集示范,但在培训过程中一旦一项政策被忽视.实际上,这是错误的抽象.人类行为不仅仅是一个启动工具.它往往是了解任务意图,失败界限和恢复策略的最丰富的信号之一.
信号的存在
值不仅仅限于成功的示范,它出现在暂停,轨道中调整,抓住调整,重新尝试行为以及操作员注意到任务即将失败,并在机器人犯错误行动之前改变策略的时刻.
为什么数据设计是如此重要的
如果团队只保存最后的成功轨迹,他们会抛弃大量的结构,解释了成功如何实现.那些缺失的时刻通常是帮助政策变得更强大的原因:如何从漂移中恢复,如何在接触之前放缓,如何在部分错误后重新接近,以及如何回应当国家估计略有错误时.
捕获什么
- 干预
当一个人过失或推重任务时. - 修正
姿势,力量或序列的小变化反映了专家判断. - 退出
失败或部分尝试,揭示任务的真正困难. - ** 任务元数据**
操作员身份,难度标签和文本,解释选择为什么改变.
实际的结论
构建真正的机器人系统的团队应该停止将人类输入视为围绕"真实的"自主轨迹的噪音.这往往是他们真正想要的政策行为最明确的表达.好的数据集保存该信号,而不是将其分解成简单的成功重播.
最佳实践
设计更好的由人引导的数据循环
如果您正在构建操作员工作流程,远程操作循环或干预意识的数据集,







