返回Learn

机器人数据收集管道:从远程操作到训练准备的数据集

机器人数据收集管道的端到端通行记录,质量过<unk>,注释,格式转换,版本化和培训.

[←学习]

没有使用的集团节目, 没有使用的集团节目, 没有设计的数据管道浪费了40%的集团预算.

管道设计为什么重要

机器人学习的数据收集成本高昂.操作员时间和实验室设备的每小时30美元50美元,仅直接成本为1000集的数据集成本5,000美元15,000美元.设计不良的管道组合了这一点:不一致的录音格式迫使手动转换;缺失的元数据使事件无法使用;没有质量过意味着3040%的收集数据训练政策失败.

精心设计的管道在使用的第一周就能自行支付. 本文描述了从原始的远程操作记录到准备训练的数据集的每个阶段,其中包括选和检查,以分离研究级数据和噪音.

阶段 1 同步录音

记录阶段在遥控操作期间捕获所有传感器流,并确保同步.

  • **什么要拍摄:**摄像头图像从所有视图 (30 Hz最小);关联状态位置,速度,扭矩 (100 Hz);命令操作 (与关联状态相同的速度);如果装备的力/扭矩 (1001000 Hz);抓住状态 (开放/关闭 + 电流).
  • 同步: 硬件摄像头触发器为 <1 ms图像同步.所有流程都以单个PTP同步时钟为时刻.记录触发器脉冲作为单独的频道,以验证同步后的质量.
  • **每集的元数据:**运营商ID,机器人ID (用于多机器人实验室),任务名称和变体,开始/结束时间标签,环境条件 (预设照明,表配置),可追踪性的独特集 UUID.
  • 存储格式: HDF5 含分块数据集 每集一个 HDF5 文件,每传感器流一个 HDF5 组.图像的JPEG压缩 (质量90);数量流的无损 float32.永远不要过度写:在删除原始数据之前,写入一个新的文件并验证.

阶段2 质量过

,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,

  • 自动成功分类: 训练一个轻量级的CNN在最后的相机框架上预测成功/失败. 手动标记500集,训练30分钟,达到92%的准确性.在添加数据集之前运行所有新集.
  • 轨道滑滑度过器: 计算每条联合轨道的绝对动 (位置的第三衍生值).超过90个百分比动门的事件可能包含操作员犹或纠正标志,以便手动审查或丢弃.
  • **时间异常过器:**对于每个任务,计算剧集时间的平均和标准偏差. 标志节目超过2σ的平均,它们可能是错误 (过长) 或不完整的剧集 (过短) 复苏尝试.
  • **碰撞检测标志:**机器人安全系统引发紧急停车的事件应自动被排除.
  • 典型的拒绝率: 2040%的原始剧情被自动过器拒绝.这是正常的,预期的.

阶段3 标注

标签可以通过结构化的标签丰富节目,使得培训和分析更好.

  • 语言指令: 描述任务的自然语言字符串. 标准化操作员中的词汇: "摘取并将其放置在 ." 应用于VLA模型 (视觉语言行动) 和多任务政策中的任务条件. ** 成功分数 (0100):** 自动分类器的持续质量分数,补充二进制成功标签. 适用于课程学习开始训练高分分的节目.
  • **阶段分类:**标签每个时间步骤的语义阶段:到达/抓住/运输/放置/释放. 允许阶段定制的政策和各阶段的故障模式分析.
  • **失败模式标签 (可选):**对于失败的事件:抓取_失败 / 放弃 /错误_对象 / 截止时间. 综合统计指导硬件和任务设计改进.

阶段4 格式转换

转换阶段产生标准化出口.

  • 真相来源: HDF5. 始终保持原始 HDF5 文件. 转换后永远不要删除它们.
  • RLDS (TensorFlow Datasets): 对于Octo,RT-X和Open X-Embodiment需要的格式.使用T0工具转换.每个集都会成为一个标准化的步骤结构的TFDS集.
  • **LeRobot (HuggingFace Parquet):**与HuggingFace数据集生态系统兼容的基于parquet的格式.
  • Zarr (散政策原生): 存储可用于原始散政策代码库的内存映射式阵列,以便在训练中快速随机访问.

第五阶段 版本和来源

数据集可复制性需要严格的版本化.模型应该仅仅从数据集版本标签中进行训练,而不是"现在这个文件中的文件".

  • ** 剧情不变性:** 一旦一个剧情通过了质量过,并被添加到数据集中,它永远不会被修改.
  • **基于哈什的节目ID:**计算原始 HDF5 文件的 SHA-256 .作为节目ID 使用确保该ID独特地识别内容,任何腐败都可检测.
  • 数据集表现: 每个数据集版本的JSON文件列出所有集集 ID,其元数据,分类分配 (train/val/test) 和过标准.查看该文件到 git以查看完整的来源.
  • **DVC (数据版本控制):**对于大型数据集,DVC跟踪哪些数据文件相应于哪些 git提交.

阶段6 培训集成

最后阶段将数据集有效地输入模型培训循环中.

  • ** 排列式样本:** 样本小批量,任务变体,对象类型和运营商均等. 防止模型过度适应多数类.
  • **在线增强:**在前传过程中应用数据增强 (未预计算) 保持可管理的存储要求:颜色 (±15%亮度/对比度/度),随机收获 (±10%图像大小),关联状态上的高斯噪音 (σ=0.001 rad).
  • ** 节目权重:** 按成功分数的重量 高质量的成功在训练期间获得更高的样本权重.

[RCSV数据平台]T2) 自动化了本管道的第2至第5阶段,为质量审查,注释和格式出口提供了网络接口.

继续循环

设置已关闭硬件,数据和分数的循环.

浏览硬件 → 完成训练? 评分 → 需要数据规模 →