返回Research

实践中的机器人数据飞轮:现实情况研究

机器人数据飞行器如何将政策性能从500个启动演示转变为不断改善的管道,

通过比预先收集的53%少的示范, 在动作中进行了详细的飞行.

机器人数据飞行车是什么?

机器人数据飞行器是一个复合反循环:收集示范,训练一项政策,部署它,收集失败,重新训练和重复.每个周期产生一个更强大的政策,比上一个更少的边际努力,因为你正针对你目前的政策表现的失败模式,而不是随机从所有可能的机器人行为中抽取样本.

进行了四个阶段的连续重复: (1) 收集 收集人类示范数据用于目标任务; (2) 训练 训练或调整收集数据的政策; (3) 部署 在现实或半现实环境中运行政策并记录所有事件; (4) 矿山失败 确定哪些事件失败,收集纠正示范,然后回到训练.

本案研究记录了飞行车的五个阶段进行的真实选择和放置任务.机器人:一个6DOF臂,并行子抓住器.任务:从固定位置中挑选一个小的泡块,将其放置在40厘米的垃圾桶里.物体的放置在10厘米半径内变化.所有数据通过[RCSV电操作基础设施]T1收集.

阶段1 启动:500个示范,72%的基准

我们开始了500次远程操作演示,由三个运营商收集在两天内. 剧集平均为8秒.

评估协议:100次试验,对象放置在允许半径内随机采样.如果区块完全放置在垃圾桶内,试验只会被认为是成功的.

Phase Total Demos New Demos Added Success Rate
Phase 1 — Bootstrap 500 500 72%
Phase 3 — Failure Retrain 640 140 88%
Phase 5 — Active Learning Retrain 940 300 93%

简单的选择和放置任务的72%的成功率听起来很低.实际上这是一个现实的起点. 实际环境具有照明变化,抓住器磨损和对象表面变化,而模拟预训练没有捕获.

阶段2 失败矿业:140集,两种失败类型

在1期政策在测试环境中部署了一周后 (自动推出,没有人存在),500集中28%被记录为失败,

在140次失败中,在质量审查后出现了两个集群:

  • **近失 (80集):**机器人成功抓住了块,并移向垃圾桶,但释放过早或在错误的角度,导致块跳出.
  • **完全错过 (60集):**机器人完全没有抓住指的位置是35mm偏离中心,通常是区块被放置在允许半径的极端.

运营商通过RCSV的人类审查队列审查了140个失败事件.对于每个失败,一个运营商观看了失败事件,然后记录了从相同的最初对象位置开始的纠正演示.这产生了140个针对性的演示,直接解决了政策最弱点.

阶段3 重训在bootstrap+失败:88%的成功率

通过重新训练640个模拟数据集 (500个原始+140个失败目标) 推动成功率达到88% ,这在140个新模拟中提高了16点.为了比较,我们估计仅从第一阶段实现88%的结果,就需要根据观察到的学习曲线倾斜率收集约400个随机的模拟.

失败目标方法比随机收集大约2.9倍更有效,以缩小差距从72%到88%.

阶段4 积极学习:不确定性旗的收集

对于第四阶段,我们转向了对不确定性意识的政策变化. 传播政策通过集体不同意义产生隐含不确定性.

运营商审查了标记的集群,并收集了200个额外的集中的纠正演示. 积极学习标准确保了这些演示覆盖了真正的分布差距主要是不寻常的对象定向和工作场所边缘放置.

五阶段 最后的训练:93%的成功率

经过940个演示 (500个启动带+140个失败目标+200个活跃学习) 的重新训练取得了93%的成功率.学习曲线显然平坦化经验,由于环境噪音 (灯光闪,随着时间的推移,抓住器磨损) 这项任务似乎达到接近95%的天花板.

需要运行飞行车的基础设施

机轮不仅仅是ML问题,而是一个基础设施问题.

  • 部署记录: 每个机器人事件都必须以同步的RGB,自感和结果元数据记录.
  • **结果分类器:**一个快速可靠的分类器,自动标记事件为成功或失败.手动标记在规模是一个瓶.即使一个简单的CNN训练在几百个标记的框架是足够的许多任务.
  • 人检查队列: 操作员可以观看失败的剧集和记录纠正演示.队列必须显示操作员开始纠正演示的初始状态.RCSV的 [数据收集平台]T2) 包含该队列作为标准功能.
  • **自动训练触发器:**当排队中积累足够多的新演示时,训练应该自动启动.手动调整打破了循环节奏.
  • ** 随着推广前的新检查点必须进行版本和比较,成功率的回归应应引发自动推翻.

主要指标:演示效率曲线

在这个任务类型中,总演示和成功率之间的经验关系遵循一个符号曲线. 曲线的"膝盖",边际回报率大幅下降,在简单的选择和位置中出现了600800个演示.除了膝盖之外,每次额外的5%的改善需要35x与前5%的改善一样多的演示.

飞行车不会改变这个曲线的形状. 它确保您总是在曲线的最的部分上运行,直接针对故障模式,而不是通过冗余的简单示范来稀释新数据.

投资率比较:飞轮与前期收藏

为了通过纯粹的先前随机收集达到93%的成功率,我们从学习曲线的抽出表明需要大约2000个演示.飞轮方法达到93%,总演示量940个53%更高效.

在RCSV的标准收集率为48美元/示范 (取决于任务复杂性),单项任务的节省率为4240848美元.对于部署10种不同的机器人行为的组织,飞轮方法在部署后产生的持续改善之前节省42K85K美元的数据收集成本每政策生成.

探索RCSV如何通过我们的 [数据收集服务]T3 (或无畏平台) T4) 实现您的机器人程序的数据飞行器.

启动数据飞行器

根据RCSV的规定,RCSV提供了从初步的示范收集到自动故障挖掘和重训管道的端到端数据飞行器基础设施.

[查看数据服务]