返回Guides

构建机器人数据飞轮:从第一次演示到持续改进

如何建立数据飞行器? 收集,训练,部署,识别故障,收集更多.

机器人学习中获胜的团队不是拥有最多数据的团队,它们在部署失败和目标数据收集之间具有最快反循环的团队.

机器人数据飞行车是什么?

数据飞行器是一个自我增强的循环,在这种情况下,部署机器人产生了需要改进的数据,使机器人变得更有能力,产生了更多的部署机会,产生了更多的数据.

软件公司借来的这个概念 谷歌搜索变得更好,因为更多用户生成更多查询,从而提高了排名算法,吸引了更多用户.在机器人领域,飞轮运行在不同的货币上: 失败事件.每次你部署的政策失败,那个失败告诉你该政策的培训分布需要加强的地方.

2026年建造最有能力的机器人公司 (特斯拉 (优势),图 (图2) 物理智能 (pi0) 都运行数据飞轮.特斯拉在工厂运行数百个优势机器人,记录每次操纵尝试.当一个单元在特定任务变体中失败时,该失败被标记,一个人证明了纠正,数据进入下一个培训周期. 物理智能的 pi0模型通过不断摄入来自合作伙伴部署的远程操作数据来改进.

为什么大多数实验室都失败了飞行车

机器人实验室的大部分都在一次爆发中收集数据,训练一项政策,评估它,然后宣布成功或收集另一个不分辨的示范. 关键区别是目标:飞轮专门针对部署所显示的故障模式,而不是收集更多数据,

飞轮环

机器人数据飞行器由六个阶段组成,形成一个连续的周期:

1. 收藏

其他

列车

其他

3 部署

其他

4. 监控

其他

5. 检测故障

其他

6 收集更多

↑ 返回第二阶段:火车 连续重复 ↓

阶段13是每个团队所做的.阶段46是从第一套数据之后不断改善的团队分开的.

阶段1:种子数据集 (50200个示例)

种子数据集建立了您的基准政策.目标不是生产准备的政策,而是成功的政策 (4050%+) 足以使部署基础上的失败挖矿成为生产力.如果您的政策100%失败,挖矿没有什么好处.

"第一次训练"的样子

  • 任务范围: 开始从目标任务的最简单的有意义的版本. 如果最终目标是"分类混合物品成垃圾桶",开始从"选择一个已知物体,将其放在一个垃圾桶中". 删除变化性:固定位置,控制照明,单个物体类型.
  • ** 根据算法计算测试:** ACT:50200测试. 传播政策:100300. VLA细调 (OpenVLA/Octo):50100与预训练的基础.收集直到验证成功率高原,而不是直到你达到圆数.
  • **运营商一致性:**使用13训练有素的运营商,而不是多样化的众筹运营商.多样性帮助后者.在种子阶段,相同的战略的一致示范在相同的示范计数上超过多种战略.
  • 质量门: 在加入训练之前,检查每一集. 拒绝:操作员犹2秒,通过重新方法恢复的失败抓 (除非特别收集恢复数据),摄像头封闭操纵点或不完整的任务执行.查看我们的 [数据收集指南]T2) 查看完整的QA协议.

种子数据集时间表

经验丰富的运营商和验证的 [电操作设置] T3),每3小时会议预计4060个验证的集锦.一个200集的种子数据集需要35天的收集时间,包括设置,质量检查和培训.预算2周总共从"硬件准备"到"首次部署政策".

第二阶段:第一次部署和监测

在培训后,在测试环境中部署该政策. 这不是生产部署,而是仪器部署,旨在生成下一次飞轮旋转的故障数据.

远程操作的影子模式

在完全自主部署之前,运行政策在影子模式下:政策预测行动,但运营商保持远程操作过失.如果政策即将失败,运营商接管并完成任务.记录政策的预测行动和运营商的纠正行动这是高价值的DAgger类型数据.

影子模式有两个目的:它从政策的实际状态分布 (政策陷入困境的州) 生成训练数据,并在取消人类安全网之前提供安全评估政策行为.

绩效监测

在部署期间,记录每一集的下列内容:

  • 完整的集录音: 联合位置,摄像头图像,行动和时间格式与训练数据相同.
  • **结果标签:**成功,故障或操作员干预. 标签自动,如有可能 (例如,成功 = 目标区被空头摄像头检测到的对象).
  • 失败类别: 如果事件失败,将失败分类.类别:抓失,放置错误,碰撞,截止时间,恢复失败,离散状态.这些类别驱动阶段3.
  • 政策版本: 每个节目都用生成的模型检查点标记.

失败的登记基础设施

最低可行的故障记录系统是包含节目_id,时间标签,政策_版本,结果,故障_类别,注释的CSV文件. [RCSV数据平台]T4) 为节目标签,故障分类和趋势监测提供了视觉仪表板,但电子表格适用于早期阶段的团队.

阶段3:矿业失败

失败挖掘是使飞行车工作的核心创新. 代替广泛收集更多示范,你确定限制性能的特定失败模式,并收集直接处理这些模式的数据.

确定哪些问题是没有优先考虑的

在50100次部署后,您将获得故障分布.

  1. 如果40%的故障是抓错误,10%是放置错误,首先要修复抓错误.
  2. **可修复性:**一些故障可以通过数据解决 (政策从未见过这种状态).其他需要硬件更改 (机器人无法物理达到目标). 专注于更多示例可以修复的故障.
  3. 影响:100%对特定对象变体的尝试的故障模式优先于导致所有变体间歇性故障的模式.

标注策略

  • **时间标签注释:**对于每个失败事件,标记失败开始的时间标签. 这告诉政策培训员,该轨道的哪个部分需要加强.
  • **状态注释:**描述失败点状态:"物体转转45度,抓紧器从错误的角度接近.
  • 集群分析: 群组失败事件在失败点的视觉相似性.如果20个失败都显示机器人缺失对象的相同方式,那么该集群代表了训练分布中的一个可解决的差距.

期4:目标数据收集

在此,飞行车的效果是很大的.而不是收集200个更大的示范 (这提供了减少的回报),你收集3050个示范,专门针对3期中确定的最高故障模式.

收集特定故障模式

  • Grasp失败: 设置该规则失败的配置. 从这些特定状态进行成功的远程操作. 为了覆盖失败区域,改变接近角度和抓住器时间.
  • ** 位置错误:** 开始从物体已经抓住的状态开始演示 (跳过抓住阶段). 专注于位置轨迹,准确地对目标进行排列.
  • 恢复示范: 运行政策直到它达到接近失败状态 (例如,对象略有错误抓住).通过远程操作接管并证明恢复.这些"恢复示范"是每个集中最高价值的数据.
  • 边缘情况覆盖: 如果故障在特定对象位置或方向聚集,请收集专门覆盖这些位置的示范. 使用物理模板或格格,以确保故障区域的一致覆盖.

目标收藏与一般改进

总之,在一个特定地区,如果有30个示范,则会增加15~25%的失败率.飞轮取决于这种目标学科.

基础设施要求

运行的飞行车需要基础设施,而不仅仅是基本数据收集.

数据管道

  • **节目存储:**所有部署节目 (不仅仅是训练数据) 都必须存储完整的录音和元数据.
  • ** 节目标签:** 按类型标签节目: "种子"," "目标恢复","部署成功","部署失败","自动收集. "您的训练脚本应该支持按标签过.
  • 自动摄入: 新剧情应从收集或部署机器流向训练数据集,而不需要手动复制文件.使用rsync,共享NFS安装或云同步 (S3/GCS).

模型版本

  • 每个训练的政策检查点都用:数据集版本,超参数,训练日期和验证指标标标记.
  • 记录每个部署事件中产生哪种政策版本.这个链接对于调试性能回归至关重要 ("政策v3比v2更糟什么改变?").
  • 保持至少最后5个政策检查点可用于反弹. 存储成本是最低的 (100500 MB/检查点).

自动训练

  • 配置一个脚本,监视数据集目录的新集,并在新批 N集 (通常是2550) 时启动训练运行.
  • 使用一个工作安排器 (cron,Ray或Modal) 进行一夜间重训,以便新政策准备好下午部署.
  • 每次训练之后,自动执行标准化评估 (20次模拟或重播) 和记录结果.

监控仪表板

随着时间的推移,至少要追踪这些指标:

  • 政策版本的成功率 (飞轮是否真的改善?)
  • 按政策版本分配失败模式 (有针对性的修复是否有效?)
  • 每轮轮转收集的集集 (收集费用是否减少?)
  • 从故障识别到重新训练的政策的时间 (您的周期时间)

追踪的指标

Metric What It Measures Target Red Flag
Success rate % of deployment episodes that succeed Increasing each rotation Flat or decreasing after new data
泛化能力 score Success rate on unseen conditions vs. seen conditions >0.7 ratio <0.5 (severe overfitting)
Data efficiency curve Success rate improvement per N new episodes Diminishing returns curve visible No improvement despite more data
Cost per successful episode Total collection cost / number of new successes Decreasing each rotation Increasing (flywheel is stalling)
Cycle time Days from failure detection to retrained policy <1 week >2 weeks (pipeline bottleneck)
Failure mode coverage % of identified failure modes with targeted data >80% by rotation 3 Same failure mode persists after 2 targeted collections

常见的飞轮陷

1. 分布转变积累

发生什么: 每个飞轮旋转都会增加针对特定故障模式的目标数据.随着时间的推移,训练分布会对边缘情况和恢复情况产生严重偏见.该政策开始在它过去处理得很好的"容易"情况下失败.

** 修复:** 保持培训集中的6070%的基线示范与3040%的目标数据的比率.在添加目标数据时,不要删除基线数据.如果培训集变得太大,则均地减少基线数据,而不是完全放弃它.在轮换中监测固定的"基线评估集"上的性能.

2 标注不一致

**发生了什么:**不同团队成员不同地分类失败. 一个人将近失败的把握标记为"成功",另一个人将其标记为"抓失败".失败统计数据变得不可靠,目标收集被误导.

** 修正:** 写出明确的注释指南,以每个失败类别的示例图像. 作为主要标签使用二进制成功/失败 (难以不同意),而失败子类别作为次级标签. 每月进行注释者之间的协议检查. 要求90%以上的成功/失败标签.

3 硬件漂移

机器人的物理行为从训练数据分布中转移,导致逐步降低性能,看起来像是一个数据问题.

** 修正:** 每个部署周开始进行校准检查:命令机器人到5个已知配置,并验证在0.5度内的关节位置匹配.用力度测量器检查抓紧机的力量.用ArUco板检查摄像头的外层.记录校准结果与事件数据一起.当发生硬件维护时,收集2030个重校准事件.

4. 解决任务的更多数据收集

**发生了什么:**最常见的飞轮错误.团队收集了另外200个示范,以满足政策已经以90%以上的成功率来处理的条件,因为这些示范很容易收集.

** 修正:** 在每次收集会议之前,回答:"我针对哪个特定的失败模式?"如果您不能命名一个,首先运行10个政策推出并确定最常见的失败.

案例研究:从0到1万集的操纵初始

这项假设案例研究说明了创业公司建立垃圾选系统的现实飞轮进展:

个月1:种子数据集

团队使用单个ViperX-300S2带领者跟随者远程操作.一个经验丰富的操作员收集了200个清洁的示范,从垃圾桶中挑选一个已知对象并将其放置在运输器上.任务:控制照明,单个对象类型,固定垃圾桶位置.他们训练了ACT政策.结果:55%的成功率在控制的设置中.

两个月:第一次失败矿业转换

失败分布:45%的抓住失败 (对象导向比涉及的训练数据更为多),30%的放置错误 (输送带位置容忍度太紧),25%的时间延期 (政策在接近中住). 他们收集了60个针对性的演示:30个用于各种对象导向,20个用于精确的放置,10个用于方法恢复. 训练. 结果: 72%的成功率.

季度3:通用化扩张

它们引入了5种额外的对象类型 (不同形状,尺寸,重量).新对象的初始成功率下降到35%.它们在所有6个对象中收集150个演示,位置/导向变化.它们从ACT转换为扩散政策来处理多对象分布.结果:68%在所有对象中成功率.

第四个月:积极学习

它们实施了不确定性估计 (包括3种政策). 部署了不确定性记录.当不确定性超过门时,标记状态为人类示范.它们收集了80个不确定性目标演示,根据成功率的改善,相当于300个随机演示.结果: 82%的成功率.

五六个月:规模化和自动收集

现在的政策已经成功了,这足够多的时间用于自动收集.他们在一夜之间运行机器人8个小时,自动检测成功 (上头摄像头验证对象的放置).人类审查了20%的自动标记的集.自动收集每晚产生了200个验证的集.他们增加了第二个机器人站.总数据集:3,500集. 结果:已知物体的成功率为91%;新物体的成功率为78%.

七月12日:生产飞轮

两台机器人站在休息时间内进行连续收集.每周重新训练,以该周失败的目标数据.每月扩展到新物体类别.到月12日:超过10,000集,已知物体获得95%的成功,同类新物体获得85%.飞轮每周约5小时的人类监督.

什么时候使用RCSV与在家中建造

Scenario RCSV In-House
Seed dataset (first 200 demos) Faster — our operators are trained, hardware is calibrated Good if your team needs to learn the data collection process
Targeted failure-mode data Strong — we specialize in collecting edge-case data efficiently Requires operator training for each failure mode
Scaling to 1,000+ episodes Cost-effective — we provide shifts, QA, and infrastructure Good if you have dedicated operators and hardware
Hardware you don't own yet Lease from RCSV — try before buying Requires capital outlay upfront
Bimanual or dexterous data Specialized — we operate ALOHA and glove systems Significant hardware and operator investment
Continuous flywheel operation Hybrid: RCSV handles collection, you handle training/deployment Best if you have a dedicated data ops team

时间线:从起到自动驾驶飞轮

Month Phase Activity Expected Outcome
Month 1 Seed 200 clean demos, 3 training runs 40–60% success on controlled setup
Month 2 Failure mining 100 deployment episodes, 60 targeted demos 65–80% success, failure modes identified
Month 3 泛化能力 150 demos with object/position variation 70–80% success across 3x variation range
Month 4 Active learning 80 uncertainty-guided demos >80% success, equivalent to 300 random demos
Month 5 Auto-collection pilot Autonomous collection, 20% human review Validated auto-labeling; 200 episodes/day
Month 6+ Self-sustaining Continuous auto-collection + weekly retraining 90%+ success; continuous improvement

通过RCSV加速数据飞行器

为了帮助运行数据飞行车程序的团队,RCSV提供了针对性的数据收集,故障恢复示范,集集 QA和管道交付.

数据收集服务 数据平台