返回Blog

机器人训练数据是什么?

机器人训练数据是物理人工智能的瓶<unk>. 了解机器人数据的类型,收集方法的比较,重要质量标准以及团队常犯的错误.

大型语言模型有互联网.自动驾驶汽车有数百万英里的记录驾驶.物理人工智能 - - 操纵物体,组装产品,与人类一起工作的机器人 - - 有数据问题.机器人训练数据同时是整个管道中最重要的输入和最困难的瓶. 这本指南将实际上是什么, 机器人训练数据, 存在的类型, 团队如何收集它,

定义机器人训练数据

机器人训练数据包括一个机器人执行任务的记录集.每个集都捕捉到同步的传感器数据流 - - 摄像头图像 (RGB 和深度),关联位置和速度,终端效应器姿势,抓住器状态,扭矩力读数,以及产生这些运动的控制输入. 一个事件通常持续10到60秒,代表一个完成任务的完整尝试: 达到一个对象,抓住它,将它移到目标位置,

通过研究成功的示范,这些数据作为[模仿学习] (T0) 的原材料,其中神经网络政策通过学习成功的示范学习将观察 (机器人看到和感觉) 映射到行动 (机器人应该接下来做什么).它还用于调整像 [RT-2和OpenVLA] (VLA) 等视觉语言行动模型 (VLA) 以及定义增强学习的奖励功能. 没有高质量的培训数据,这些方法都无法产生可实施的政策.

机器人训练数据是如此瓶的原因是,无法从互联网中删除.每个集都需要在物理环境中运行的物理硬件,需要一个熟练的人类操作员或一个精心编写的控制器.收集率是以每小时的集体而不是每秒的集体来测量的. 一套典型的研究数据集包含100到10,000个集 - - 比语言或视觉模型的数据集更小.

机器人训练数据类型

示范数据是最常见的类型.一个人类操作员通过远程操作或动力学教学控制机器人,机器人记录其传感器流和结果行动.示范数据直接捕捉了从观察到政策需要学习的行动的映射. 它是模仿学习的黄金标准,也是大多数数据收集程序的主要产品.

互动数据捕捉到机器人自主执行政策并记录结果.这些数据包括成功和失败,用于在线增强学习,DAgger式代改进和识别失败模式. 互动数据通常比每集的示范数据质量低,但由于不需要持续的人类关注,因此可以以更大的量收集.

物理引擎如NVIDIA Isaac Sim,MuJoCo和Genesis将虚拟环境呈现出来,在那里模拟机器人执行任务. 合成数据提供无限的体积和完美的注释,但受到了[sim-to-real gap]T2) - - 仅基于合成数据的政策在转移到现实硬件时经常失败,因为模拟物理和染并不完全匹配现实.

视频数据来自记录的人类活动 - - 视频,装配说明,操纵示范 - - 没有任何机器人.在互联网上,视频数据充足,但缺乏行动标签 (机器人需要执行机器人进行复制行为的命令). 它最有用的是 [预训练视觉表示]T3) 而不是直接训练机器人政策.

数据质量尺寸:可使用数据与噪音的区别

在RCSV与数十个数据收集活动合作后,我们确定了六个可测量的质量维度,

1. 演示一致性

连贯度测量在相同条件下相同任务的示范中行动轨迹有多相似.数学上,你可以通过计算一个条件中的所有事件对的最终效应轨迹之间的动态时间扭曲 (DTW) 距离来量化这一点,然后看变化系数. 对于对校准任务的运营商来说,一个低于0.15的简历表明了良好的一致性.

由于操作员技能差异和模糊的任务定义,不一致性来自两个来源.RCSV通过一个结构化的 [操作员培训计划]T4) 解决了第一个问题,每周进行校准. 第二个要求精确的书面成功标准-- 不是"把杯子放在盘上",而是"把杯子放在盘上,把手柄放在右边,中心在盘中心的2厘米内,从高度不超过1厘米.

2. 失败模式的覆盖

只有清洁,成功的示范的数据集产生了从未见过接近失败状态的政策,并且无法从中恢复.最好的数据集包括控制的恢复示范比例:操作员故意从略错的姿势开始,丢弃一个对象并重新抓住,或在任务中纠正错误的排列. 恢复示范的90/10分比是一个好的起始比率. 标记恢复事件的元数据,以便在训练中分别权重.

记录和标记实际失败同样重要.一个500次成功和100次标记失败的数据集比600次成功更有价值,因为失败事件可以训练二进制成功分类器,定义任务分配的边界,并为对比性学习方法提供负面的例子.

3.任务分配覆盖范围

任务分布是政策在部署时会遇到的所有起始条件,对象配置和环境变化的空间.数据集必须系统地采样这个空间,而不是专期.在收集之前明确定义变化轴:

Variation Axis Minimum Coverage Example Values
Object instances 10+ per category 10 different mugs, 12 different cans
Starting positions Full workspace coverage 5x5 grid across 40cm x 40cm workspace
Object orientations 4+ orientations per object 0, 90, 180, 270 degrees; upright and on side
Lighting conditions 3+ conditions Overhead fluorescent, side lamp, natural daylight
Background scenes 3+ backgrounds Clean table, cluttered workspace, different table color
Operators 3+ operators Distinct control styles, response speeds
Distractor objects Present in 30%+ of episodes Non-target objects in workspace

总集数从覆盖要求中得出结论:如果你需要每种独特条件的10集,并且有10个对象x5个位置x3个照明条件,最低数据集大小为1,500集.

4 时间质量

操作员在演示过程中犹,停顿和反转会将噪音带入行动分布.执行选定任务的熟练操作员产生了平稳的8秒轨迹.执行相同任务的初学者操作员可能会产生25秒轨迹,以3到4次停顿和方向反转. 初学者演示不仅会慢慢,它还会教导政策停止和逆转,这很少是理想的行为. 暂时质量过消除了总持续时间超过任务中位数的2倍的演示,或者速度配置文件显示了特征的犹模式 (任务中位数超过500ms的近零速度).

5.传感器同步质量

多摄像头设置和混合传感器流 (摄像头+关联状态+力/扭矩) 必须在紧张的宽容范围内同步.对于30Hz图像流,即使是单个落下的框架也会产生33ms的差距,使行动与观测不一致. 对于1kHz记录的力扭矩数据,F/T传感器和摄像头驱动器之间的时钟漂移可以在60秒的集中积累成数百毫秒.RCSV的收集管道使用硬件触发的同步 (Intel RealSense硬件同步) 并验证每个录音会话结束时的跨流时机. 超过10ms的同步错误的集集为重新收集.

6. 行动空间忠诚

记录的操作必须忠实地代表机器人实际做的事情,而不是控制器命令的.在领导跟踪者远程操作系统中,跟踪者臂可能会落后于领导者20-50ms,并且可能无法完美地跟踪领导者的轨迹,因为关节限制,扭矩限制或动态响应. 记录命令的行为 (来自领导人) 而不是执行的行动 (来自追随者) 引入了系统性的偏见. 始终记录追随者的实际联合状态和最终效果符作为行动标签,而不是领导的命令.

规模规则:你需要多少个示范?

数据集规模和政策绩效之间的关系遵循可预测的模式,尽管确切的数字取决于任务复杂性,政策架构和数据质量.根据公布的结果和RCSV内部基准,以下是实际指南:

Task Complexity Example Demos for 70% Success Demos for 90% Success Policy Architecture
Simple pick-place (1 object) Pick block, place in bin 30-50 100-200 ACT
Multi-object pick-place Sort 5 objects into bins 150-300 500-1,000 Diffusion Policy
Contact-rich single task Peg insertion, lid closing 100-200 300-500 Diffusion Policy + F/T
Bimanual coordination Fold towel, open bag 200-400 800-1,500 ACT (bimanual)
Language-conditioned multi-task "Pick the red cup," "stack blocks" 500-1,000 per task 2,000-5,000 per task VLA (OpenVLA, RT-2)
VLA fine-tuning (pre-trained) Adapt OpenVLA to new task 50-100 200-500 OpenVLA + LoRA

根据最近的扩展研究的关键见解:在保持多样性常态的同时,翻倍数据集规模会在最初200-300集后产生减少的回报.在总数持续的事件数量下,翻倍多样性 (更多对象,更多条件) 几乎总是提高了政策绩效,而不是翻倍量. 这就是为什么RCSV的 [数据收集协议]T5) 优先考虑结构化变化而不是原始事件数量.

数据飞行车:从收集到不断改进

最先进的团队不把数据收集视为一次性事件. 他们构建了一个数据飞轮 - - 一个连续的循环,

**第一阶段:种子数据集.**通过远程操作收集200-500个高质量的示范.训练一个初步政策.这是最低可行的数据集,使一个政策运行,即使不完美.

第二阶段:使用登记. 实现了全传感器登记的实际任务的初始政策.记录了所有自动执行,包括故障.人类操作员监测和干预该政策失败时 (DAgger式纠正).

**第三阶段:针对故障的收集.**分析记录的部署数据以确定系统性故障模式. 收集针对故障条件的额外示范. 如果政策失败于深色的物体,则收集50个示范与深色的物体. 如果目标接近工作空间边缘时失败,则收集50个示范在边缘位置. 这种目标收集比统一增强数据高效5到10倍.

第四阶段:重训和重复. 将目标数据与原始数据集结合起来,重训和重新部署.通过飞轮的每一个周期在性能最弱的区域中产生可测量的改善.在飞轮3-5次重复的团队通常比在一个大型初始数据集上训练一次的团队取得15-25%的成功率高.

建立数据飞行车需要基础设施,可持续记录,自动检测故障和快速重新训练.RCSV的 [数据平台]T6) 提供了在多个任务和机器人站中管理这种反复过程的工具.

收集方法的比较

电话操作是高质量的操纵数据的主要收集方法.操作员通过领导跟踪器设置,VR控制器,空间鼠标或数据手套远程控制机器人.机器人在记录所有传感器流时实时执行操作员的命令. 电话操作产生自然,流动的演示,这些演示很好,因为操作员可以实时调整其战略,以适应每个情况.根据任务复杂性和重置时间,收藏率在每小时30到120次之间.主要的缺点是操作员疲劳 - 长时间的会议后质量会下降,操作员需要培训.

** 炼教学** 涉及在机器人处于合适 (重力补偿) 模式下,在机器人在要求的运动中物理引导机器人臂.操作员抓住终端效应器或手柄,然后通过任务轨迹移动它. 这种方法是直观的,不需要外部控制硬件,但它具有显著的限制:操作员的手从摄像头视图中遮住工作空间,使用力是不自然的,因为操作员正在与机器人的惯性作斗争,并且该方法不扩展到双手动或移动操纵任务. 运动教学最适合简单单单臂的选择和位置任务,其中轨迹形状比精确的接触动态更重要.

** 脚本收集** 使用预定义的运动原始元素 - - 接近路线点,抓取模式和放置序列 - - 以随机参数执行.脚本编写可以生成大量的数据 (随着自动重置每小时数百集),但由于运动策略是固定的,因此产生低多样性的示范. 脚本数据是用于启动对已知物体的结构化任务的政策的有用性,例如使用已知物体来选择垃圾桶,但很少将其一般化为新情况.大多数生产数据集使用脚本收集用于任务的结构化部分,以及对接触丰富或未结构化的部分进行远程操作.

视频模仿使用手跟踪,姿势估计和转向机器人动力学提取了录制的人类视频的示范.这种方法仍然很大程度上是实验性的.它对粗臂运动工作得很好,但在精细的操纵方面却失败,因为手姿势估计不足够准确,而人与机器人体现的映射引入错误. 探索视频模仿的团队应将视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频

收集方法比较表

Method Throughput Data Quality Hardware Cost Best For
Leader-follower teleop 5-12 demos/hr (expert) Highest $4,500-32,000 Dexterous, contact-rich tasks
VR controller teleop 8-15 demos/hr High $500-1,500 Pick-place, general manipulation
Kinesthetic teaching 3-8 demos/hr Medium $0 (uses robot) Simple trajectories, prototyping
Scripted + randomized 60-200 demos/hr Low-medium $0 (software) Structured tasks, pre-training
Video retargeting N/A (post-hoc) Low $0-500 Visual pre-training only

实际上重要的是质量因素

差异性是最重要的单一质量因素. 200 个集体,涵盖15个对象实例,3个照明条件和3个操作员的数据集几乎总是会产生比2000个单个对象在统一条件下更好的政策. 强大的操纵数据集应至少包括每类别10个或多个不同的对象实例,3个或多个照明条件,整个工作空间的不同起始位置以及多个操作员.

一致性意味着所有集中成功标准,重置程序和任务定义均是一样的.如果一些集认为接近错误是成功的,而其他则需要精确的放置,则政策学习了一个模糊的目标. 一致性需要书面收集协议,明确的成功标准,操作员可以明确地应用,以及剧集之间标准化重置程序.

注释精度涵盖每个集附加的元数据:成功/失败标签,语言指令标签,任务阶段细分和对象身份标签.错误的注释破坏了训练信号.二进制成功标签应由第二个审查员对边界情况进行验证.语言指令应与实际任务行为进行检查. 斯威尔士国家安全委员会 (RCSV) 的管道包括自动成功分类,并对所有边境案件进行人为审查.

** 剧集完整性**意味着每个集集从最初的方法到最后的放置,所有的传感器流都同步,没有掉下来的框架.不完整的集 - - 录像开始在中拍,相机流下降,或相联状态记录在不同的频率比图像 - - 引入了破坏政策学习的噪音. 交配验证应在每一个收集管道中都是自动化步骤.

团队在收集他们的第一批数据集时犯的常见错误

** 收集过多节目,多样性过少.** 团队经常专注于节目数量目标 (1000节目) 而没有控制多样性. 首先设定多样性目标 - - 实体实例数,环境,运算者数 - - 并让这些目标的总数从每条件最小乘以来来计算出来 (通常每条件每种10-20个节目).

** 跳转操作员校准.** 未经过培训的操作员会产生令人尬,不一致的示范,这会积极损害政策性能. 在他们的示范计算数据集之前,每一个新运营商都需要从2到4小时练习远程操作接口. 追踪每个运营商的质量指标并提供反.

**不记录失败事件.**失败演示应记录和标记,而不是丢弃.失败数据对于训练恢复行为,构建分类器来检测即将发生失败,以及了解您任务最困难的地方很重要.

** 忽略重置一致性.** 如果节目之间的重置不顺利 - - 放置在大约相同的地方的对象,从前一次试验中留下了背景混乱 - - 数据集继承了系统性偏见. 投资于可重复的重置协议,包括在定义区域内随机放置对象,一致的背景状态,以及操作员在节目之间遵循的检查清单.

选择错误的格式. 存储数据在定制格式中会给每一个下游消费者造成摩擦.使用既定格式: HDF5或Zarr用于原始事件数据,LeRobot HuggingFace格式]T7)用于共享,以及Open X-Embodiment方案用于跨体格式研究.以后转换格式总是比先选择正确格式更难.

** 低于注释的投资.** 许多团队完全跳过语言注释或将相同的说明标签上写.如果你计划训练语言条件的政策或细节调整VLA,每个节目都需要一个独特的自然语言指令,准确描述发生的事情. "从桌子左边拿起红杯,把它放在蓝盘上"是一个有用的注释. "选择和放置"不是.查看我们的 [注释指南]T8) 详细标准.

数据格式和出口标准

选择合适的存储格式影响您的管道中每一步.

Format Strengths Weaknesses Best Use Case
HDF5 (.h5) Random access, chunked compression, metadata support, mature tooling Single-writer lock, poor cloud streaming, no built-in versioning Local collection, ACT/Diffusion Policy training
Zarr Cloud-native, concurrent writes, chunk-level access, S3/GCS compatible Less mature ecosystem, no single-file portability Large-scale cloud datasets, Diffusion Policy reference implementation
RLDS (TFRecord) Streaming, Open X-Embodiment standard, TF ecosystem integration TensorFlow dependency, no random access, sequential read only Cross-embodiment sharing, OXE compatibility
LeRobot (HuggingFace) Standardized schema, Hub integration, streaming via datasets library, growing community Parquet overhead for small datasets, Hub dependency for sharing Community sharing, LeRobot framework training, VLA fine-tuning
ROS bag (.bag / .db3) Native ROS logging, preserves topic structure, replay support ROS dependency, not ML-ready, needs conversion for training Raw collection on ROS2 systems, debug replay

根据RCSV的建议:在收集阶段,收集在HDF5或ROS袋中获得最大的灵活性,然后转换为LeRobot格式进行共享和培训.我们的 [数据平台]T9) 自动处理格式转换,并支持向上述五种格式出口. 在设计自己的收集之前,浏览现有 [公共数据集]T10) 了解数据结构.

政策类型的注释要求

其他政策体系结构需要不同的注释层. 低注释废物未来的机会;过度注释废物当前预算. 匹配您的注释投资与您计划的培训管道:

ACT / 传播政策 (单任务): 每集的二进制成功标志. 选项:任务阶段分类用于调试. 无需语言标签. 标注成本:每集0.02-0.05美元.

语言条件BC (BC-Z,RT-1): 双重成功旗加上每集的自然语言指令.指令必须区分任务变体.注释成本:每集0.10-0.25美元.

**VLA细调 (OpenVLA, RT-2):**二进制成功旗,自然语言指令,理想情况下任务阶段分类.语言指令应在表达式中变化 (不复印) 以教导模型语言通用化.注释成本:每集0.25-0.50美元.

** 层次性政策:** 任务阶段的完整细分,附加任务成功标志.每个阶段界限需要时间标签. 标注成本:每集0.50-2.00美元,具体取决于任务复杂性.

详细的注释指南和工具建议请参阅我们的 [机器人数据注释指南]T11.

开始使用RCSV数据服务

建立从零开始的机器人训练数据程序需要硬件,操作员,实验室环境,收集软件,质量保证工具和数据工程专业知识. 对于需要数据的团队, 速度比他们构建基础设施快, RCSV的 [数据服务] T12) 提供了完整的管道: 收集运营商训练有素在您的具体任务,

最快的方法是与数据服务团队联系,以提供您的任务描述,目标机器人平台和所需的集集数.RCSV处理收集协议设计,操作员培训,数据收集,质量保证,注释和您喜欢的格式出口. 您的设备使用RCSV租的硬件进行远程收集,也支持需要您的特定环境或物体的任务.

如果您计划首次收集数据活动,请从200-500集的试点开始,以验证您的任务定义和质量标准,然后扩大到数千个. 根据RCSV的试点计划,价格从2,500美元开始,包括协议设计,200次示范,质量报告和出口,

硬件选项包括[OpenArm 1]T13 (领导跟随者套件为4,500美元),[ALOHA类双手设置]T14),[Unitree G1]T15)用于移动操作.对于更喜欢租而不是购买的团队,我们的 [机器人租计划]T16) 每月可访问预定定位的收藏站.

相关阅读

  • [机器人数据注释指南]T17) -- 如何标签培训示范
  • 展现的时间从1万到100万次
  • 机器人摄像头设置数据收集 --手腕,上头和立体音频配置
  • [机器人学习的传播政策]T20) --数据要求和培训设置
  • VLA模型解释 --与示范数据进行精细调节
  • [为什么远程操作数据比模拟更好]
  • RCSV数据服务 --管理数据收集从$2,500
  • 浏览现有机器人数据集
  • [机器人租] ((T25) --月度访问收藏硬件