实践中的机器人数据飞轮:现实情况研究
机器人数据飞行器如何将政策性能从500个启动演示转变为不断改善的管道,
通过比预先收集的53%少的示范,
机器人数据飞行车是什么?
机器人数据飞行器是一个复合反
进行了四个阶段的连续重复: (1) 收集
本案研究记录了飞行车的五个阶段进行的真实选择和放置任务.机器人:一个6DOF臂,并行
阶段1 启动:500个示范,72%的基准
我们开始了500次远程操作演示,由三个运营商收集在两天内. 剧集平均为8秒.
评估协议:100次试验,对象放置在允许半径内随机采样.如果区块完全放置在垃圾桶内,试验只会被认为是成功的.
| Phase | Total Demos | New Demos Added | Success Rate |
|---|---|---|---|
| Phase 1 — Bootstrap | 500 | 500 | 72% |
| Phase 3 — Failure Retrain | 640 | 140 | 88% |
| Phase 5 — Active Learning Retrain | 940 | 300 | 93% |
简单的选择和放置任务的72%的成功率听起来很低.实际上这是一个现实的起点. 实际环境具有照明变化,抓住器磨损和对象表面变化,而模拟预训练没有捕获.
阶段2 失败矿业:140集,两种失败类型
在1期政策在测试环境中部署了一周后 (自动推出,没有人存在),500集中28%被记录为失败,
在140次失败中,在质量审查后出现了两个集群:
- **近失 (80集):**机器人成功抓住了块,并移向垃圾桶,但释放过早或在错误的角度,导致块跳出.
- **完全错过 (60集):**机器人完全没有抓住
指的位置是3 5mm偏离中心,通常是区块被放置在允许半径的极端.
运营商通过RCSV的人类审查队列审查了140个失败事件.对于每个失败,一个运营商观看了失败事件,然后记录了从相同的最初对象位置开始的纠正演示.这产生了140个针对性的演示,直接解决了政策最弱点.
阶段3 重训在bootstrap+失败:88%的成功率
通过重新训练640个模拟数据集 (500个原始+140个失败目标) 推动成功率达到88%
失败目标方法比随机收集大约2.9倍更有效,以缩小差距从72%到88%.
阶段4 积极学习:不确定性旗的收集
对于第四阶段,我们转向了对不确定性意识的政策变化. 传播政策通过集体不同意义产生隐含不确定性.
运营商审查了标记的集群,并收集了200个额外的集中的纠正演示. 积极学习标准确保了这些演示覆盖了真正的分布差距
五阶段 最后的训练:93%的成功率
经过940个演示 (500个启动带+140个失败目标+200个活跃学习) 的重新训练取得了93%的成功率.学习曲线显然平坦化
需要运行飞行车的基础设施
- 部署记录: 每个机器人事件都必须以同步的RGB,自感和结果元数据记录.
- **结果分类器:**一个快速可靠的分类器,自动标记事件为成功或失败.手动标记在规模是一个瓶
.即使一个简单的CNN训练在几百个标记的框架是足够的许多任务. - 人检查队列: 操作员可以观看失败的剧集和记录纠正演示.队列必须显示操作员开始纠正演示的初始状态.RCSV的 [数据收集平台]
T2 ) 包含该队列作为标准功能. - **自动训练触发器:**当排队中积累足够多的新演示时,训练应该自动启动.手动调整打破了循环节奏.
- ** 随着推广前的新检查点必须进行版本和比较,成功率的回归应应引发自动推翻.
主要指标:演示效率曲线
在这个任务类型中,总演示和成功率之间的经验关系遵循一个符号曲线.
飞行车不会改变这个曲线的形状. 它确保您总是在曲线的最
投资率比较:飞轮与前期收藏
为了通过纯粹的先前随机收集达到93%的成功率,我们从学习曲线的抽出表明需要大约2000个演示.飞轮方法达到93%,总演示量940个53%更高效.
在RCSV的标准收集率为4
探索RCSV如何通过我们的 [数据收集服务]
启动数据飞行器
根据RCSV的规定,RCSV提供了从初步的示范收集到自动故障挖掘和重训管道的端到端数据飞行器基础设施.
[查看数据服务]







