机器人训练数据是什么?
机器人训练数据是物理人工智能的瓶<unk>. 了解机器人数据的类型,收集方法的比较,重要质量标准以及团队常犯的错误.
大型语言模型有互联网.自动驾驶汽车有数百万英里的记录驾驶.物理人工智能 - - 操纵物体,组装产品,与人类一起工作的机器人 - - 有数据问题.机器人训练数据同时是整个管道中最重要的输入和最困难的瓶
定义机器人训练数据
机器人训练数据包括一个机器人执行任务的记录集.每个集都捕捉到同步的传感器数据流 - - 摄像头图像 (RGB 和深度),关联位置和速度,终端效应器姿势,抓住器状态,扭矩力读数,以及产生这些运动的控制输入. 一个事件通常持续10到60秒,代表一个完成任务的完整尝试: 达到一个对象,抓住它,将它移到目标位置,
通过研究成功的示范,这些数据作为[模仿学习] (
机器人训练数据是如此瓶
机器人训练数据类型
示范数据是最常见的类型.一个人类操作员通过远程操作或动力学教学控制机器人,机器人记录其传感器流和结果行动.示范数据直接捕捉了从观察到政策需要学习的行动的映射. 它是模仿学习的黄金标准,也是大多数数据收集程序的主要产品.
互动数据捕捉到机器人自主执行政策并记录结果.这些数据包括成功和失败,用于在线增强学习,DAgger式
物理引擎如NVIDIA Isaac Sim,MuJoCo和Genesis将虚拟环境呈现出来,在那里模拟机器人执行任务. 合成数据提供无限的体积和完美的注释,但受到了[sim-to-real gap]
视频数据来自记录的人类活动 - -
数据质量尺寸:可使用数据与噪音的区别
在RCSV与数十个数据收集活动合作后,我们确定了六个可测量的质量维度,
1. 演示一致性
连贯度测量在相同条件下相同任务的示范中行动轨迹有多相似.数学上,你可以通过计算一个条件中的所有事件对的最终效应轨迹之间的动态时间扭曲 (DTW) 距离来量化这一点,然后看变化系数. 对于对校准任务的运营商来说,一个低于0.15的简历表明了良好的一致性.
由于操作员技能差异和模糊的任务定义,不一致性来自两个来源.RCSV通过一个结构化的 [操作员培训计划]
2. 失败模式的覆盖
只有清洁,成功的示范的数据集产生了从未见过接近失败状态的政策,并且无法从中恢复.最好的数据集包括控制的恢复示范比例:操作员故意从略错的姿势开始,丢弃一个对象并重新抓住,或在任务中纠正错误的排列. 恢复示范的90/10分比是一个好的起始比率. 标记恢复事件的元数据,以便在训练中分别权重.
记录和标记实际失败同样重要.一个500次成功和100次标记失败的数据集比600次成功更有价值,因为失败事件可以训练二进制成功分类器,定义任务分配的边界,并为对比性学习方法提供负面的例子.
3.任务分配覆盖范围
任务分布是政策在部署时会遇到的所有起始条件,对象配置和环境变化的空间.数据集必须系统地采样这个空间,而不是专期.在收集之前明确定义变化轴:
| Variation Axis | Minimum Coverage | Example Values |
|---|---|---|
| Object instances | 10+ per category | 10 different mugs, 12 different cans |
| Starting positions | Full workspace coverage | 5x5 grid across 40cm x 40cm workspace |
| Object orientations | 4+ orientations per object | 0, 90, 180, 270 degrees; upright and on side |
| Lighting conditions | 3+ conditions | Overhead fluorescent, side lamp, natural daylight |
| Background scenes | 3+ backgrounds | Clean table, cluttered workspace, different table color |
| Operators | 3+ operators | Distinct control styles, response speeds |
| Distractor objects | Present in 30%+ of episodes | Non-target objects in workspace |
总集数从覆盖要求中得出结论:如果你需要每种独特条件的10集,并且有10个对象x5个位置x3个照明条件,最低数据集大小为1,500集.
4 时间质量
操作员在演示过程中犹
5.传感器同步质量
多摄像头设置和混合传感器流 (摄像头+关联状态+力/扭矩) 必须在紧张的宽容范围内同步.对于30Hz图像流,即使是单个落下的框架也会产生33ms的差距,使行动与观测不一致. 对于1kHz记录的力扭矩数据,F/T传感器和摄像头驱动器之间的时钟漂移可以在60秒的集中积累成数百毫秒.RCSV的收集管道使用硬件触发的同步 (Intel RealSense硬件同步) 并验证每个录音会话结束时的跨流时机. 超过10ms的同步错误的集集为重新收集.
6. 行动空间忠诚
记录的操作必须忠实地代表机器人实际做的事情,而不是控制器命令的.在领导跟踪者远程操作系统中,跟踪者臂可能会落后于领导者20-50ms,并且可能无法完美地跟踪领导者的轨迹,因为关节限制,扭矩限制或动态响应. 记录命令的行为 (来自领导人) 而不是执行的行动 (来自追随者) 引入了系统性的偏见. 始终记录追随者的实际联合状态和最终效果符作为行动标签,而不是领导的命令.
规模规则:你需要多少个示范?
数据集规模和政策绩效之间的关系遵循可预测的模式,尽管确切的数字取决于任务复杂性,政策架构和数据质量.根据公布的结果和RCSV内部基准,以下是实际指南:
| Task Complexity | Example | Demos for 70% Success | Demos for 90% Success | Policy Architecture |
|---|---|---|---|---|
| Simple pick-place (1 object) | Pick block, place in bin | 30-50 | 100-200 | ACT |
| Multi-object pick-place | Sort 5 objects into bins | 150-300 | 500-1,000 | Diffusion Policy |
| Contact-rich single task | Peg insertion, lid closing | 100-200 | 300-500 | Diffusion Policy + F/T |
| Bimanual coordination | Fold towel, open bag | 200-400 | 800-1,500 | ACT (bimanual) |
| Language-conditioned multi-task | "Pick the red cup," "stack blocks" | 500-1,000 per task | 2,000-5,000 per task | VLA (OpenVLA, RT-2) |
| VLA fine-tuning (pre-trained) | Adapt OpenVLA to new task | 50-100 | 200-500 | OpenVLA + LoRA |
根据最近的扩展研究的关键见解:在保持多样性常态的同时,翻倍数据集规模会在最初200-300集后产生减少的回报.在总数持续的事件数量下,翻倍多样性 (更多对象,更多条件) 几乎总是提高了政策绩效,而不是翻倍量. 这就是为什么RCSV的 [数据收集协议]
数据飞行车:从收集到不断改进
最先进的团队不把数据收集视为一次性事件. 他们构建了一个数据飞轮 - - 一个连续的循环,
**第一阶段:种子数据集.**通过远程操作收集200-500个高质量的示范.训练一个初步政策.这是最低可行的数据集,使一个政策运行,即使不完美.
第二阶段:使用登记. 实现了全传感器登记的实际任务的初始政策.记录了所有自动执行,包括故障.人类操作员监测和干预该政策失败时 (DAgger式纠正).
**第三阶段:针对故障的收集.**分析记录的部署数据以确定系统性故障模式. 收集针对故障条件的额外示范. 如果政策失败于深色的物体,则收集50个示范与深色的物体. 如果目标接近工作空间边缘时失败,则收集50个示范在边缘位置. 这种目标收集比统一增强数据高效5到10倍.
第四阶段:重训和重复. 将目标数据与原始数据集结合起来,重训和重新部署.通过飞轮的每一个周期在性能最弱的区域中产生可测量的改善.在飞轮3-5次重复的团队通常比在一个大型初始数据集上训练一次的团队取得15-25%的成功率高.
建立数据飞行车需要基础设施,可持续记录,自动检测故障和快速重新训练.RCSV的 [数据平台]
收集方法的比较
电话操作是高质量的操纵数据的主要收集方法.操作员通过领导跟踪器设置,VR控制器,空间鼠标或数据手套远程控制机器人.机器人在记录所有传感器流时实时执行操作员的命令. 电话操作产生自然,流动的演示,这些演示很好,因为操作员可以实时调整其战略,以适应每个情况.根据任务复杂性和重置时间,收藏率在每小时30到120次之间.主要的缺点是操作员疲劳 - 长时间的会议后质量会下降,操作员需要培训.
**
** 脚本收集** 使用预定义的运动原始元素 - - 接近路线点,抓取模式和放置序列 - - 以随机参数执行.脚本编写可以生成大量的数据 (随着自动重置每小时数百集),但由于运动策略是固定的,因此产生低多样性的示范. 脚本数据是用于启动对已知物体的结构化任务的政策的有用性,例如使用已知物体来选择垃圾桶,但很少将其一般化为新情况.大多数生产数据集使用脚本收集用于任务的结构化部分,以及对接触丰富或未结构化的部分进行远程操作.
视频模仿使用手跟踪,姿势估计和转向机器人动力学提取了录制的人类视频的示范.这种方法仍然很大程度上是实验性的.它对粗臂运动工作得很好,但在精细的操纵方面却失败,因为手姿势估计不足够准确,而人与机器人体现的映射引入错误. 探索视频模仿的团队应将视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频视频
收集方法比较表
| Method | Throughput | Data Quality | Hardware Cost | Best For |
|---|---|---|---|---|
| Leader-follower teleop | 5-12 demos/hr (expert) | Highest | $4,500-32,000 | Dexterous, contact-rich tasks |
| VR controller teleop | 8-15 demos/hr | High | $500-1,500 | Pick-place, general manipulation |
| Kinesthetic teaching | 3-8 demos/hr | Medium | $0 (uses robot) | Simple trajectories, prototyping |
| Scripted + randomized | 60-200 demos/hr | Low-medium | $0 (software) | Structured tasks, pre-training |
| Video retargeting | N/A (post-hoc) | Low | $0-500 | Visual pre-training only |
实际上重要的是质量因素
差异性是最重要的单一质量因素. 200 个集体,涵盖15个对象实例,3个照明条件和3个操作员的数据集几乎总是会产生比2000个单个对象在统一条件下更好的政策. 强大的操纵数据集应至少包括每类别10个或多个不同的对象实例,3个或多个照明条件,整个工作空间的不同起始位置以及多个操作员.
一致性意味着所有集中成功标准,重置程序和任务定义均是一样的.如果一些集认为接近错误是成功的,而其他则需要精确的放置,则政策学习了一个模糊的目标. 一致性需要书面收集协议,明确的成功标准,操作员可以明确地应用,以及剧集之间标准化重置程序.
注释精度涵盖每个集附加的元数据:成功/失败标签,语言指令标签,任务阶段细分和对象身份标签.错误的注释破坏了训练信号.二进制成功标签应由第二个审查员对边界情况进行验证.语言指令应与实际任务行为进行检查. 斯威尔士国家安全委员会 (RCSV) 的管道包括自动成功分类,并对所有边境案件进行人为审查.
** 剧集完整性**意味着每个集集从最初的方法到最后的放置,所有的传感器流都同步,没有掉下来的框架.不完整的集 - - 录像开始在中拍,相机流下降,或相联状态记录在不同的频率比图像 - - 引入了破坏政策学习的噪音. 交配验证应在每一个收集管道中都是自动化步骤.
团队在收集他们的第一批数据集时犯的常见错误
** 收集过多节目,多样性过少.** 团队经常专注于节目数量目标 (1000节目) 而没有控制多样性. 首先设定多样性目标 - - 实体实例数,环境,运算者数 - - 并让这些目标的总数从每条件最小乘以来来计算出来 (通常每条件每种10-20个节目).
** 跳转操作员校准.** 未经过培训的操作员会产生令人
**不记录失败事件.**失败演示应记录和标记,而不是丢弃.失败数据对于训练恢复行为,构建分类器来检测即将发生失败,以及了解您任务最困难的地方很重要.
** 忽略重置一致性.** 如果节目之间的重置不顺利 - - 放置在大约相同的地方的对象,从前一次试验中留下了背景混乱 - - 数据集继承了系统性偏见. 投资于可重复的重置协议,包括在定义区域内随机放置对象,一致的背景状态,以及操作员在节目之间遵循的检查清单.
选择错误的格式. 存储数据在定制格式中会给每一个下游消费者造成摩擦.使用既定格式: HDF5或Zarr用于原始事件数据,LeRobot HuggingFace格式]
** 低于注释的投资.** 许多团队完全跳过语言注释或将相同的说明标签上写.如果你计划训练语言条件的政策或细节调整VLA,每个节目都需要一个独特的自然语言指令,准确描述发生的事情. "从桌子左边拿起红杯,把它放在蓝盘上"是一个有用的注释. "选择和放置"不是.查看我们的 [注释指南]
数据格式和出口标准
选择合适的存储格式影响您的管道中每一步.
| Format | Strengths | Weaknesses | Best Use Case |
|---|---|---|---|
| HDF5 (.h5) | Random access, chunked compression, metadata support, mature tooling | Single-writer lock, poor cloud streaming, no built-in versioning | Local collection, ACT/Diffusion Policy training |
| Zarr | Cloud-native, concurrent writes, chunk-level access, S3/GCS compatible | Less mature ecosystem, no single-file portability | Large-scale cloud datasets, Diffusion Policy reference implementation |
| RLDS (TFRecord) | Streaming, Open X-Embodiment standard, TF ecosystem integration | TensorFlow dependency, no random access, sequential read only | Cross-embodiment sharing, OXE compatibility |
| LeRobot (HuggingFace) | Standardized schema, Hub integration, streaming via datasets library, growing community | Parquet overhead for small datasets, Hub dependency for sharing | Community sharing, LeRobot framework training, VLA fine-tuning |
| ROS bag (.bag / .db3) | Native ROS logging, preserves topic structure, replay support | ROS dependency, not ML-ready, needs conversion for training | Raw collection on ROS2 systems, debug replay |
根据RCSV的建议:在收集阶段,收集在HDF5或ROS袋中获得最大的灵活性,然后转换为LeRobot格式进行共享和培训.我们的 [数据平台]
政策类型的注释要求
其他政策体系结构需要不同的注释层. 低注释废物未来的机会;过度注释废物当前预算. 匹配您的注释投资与您计划的培训管道:
ACT / 传播政策 (单任务): 每集的二进制成功标志. 选项:任务阶段分类用于调试. 无需语言标签. 标注成本:每集0.02-0.05美元.
语言条件BC (BC-Z,RT-1): 双重成功旗
**VLA细调 (OpenVLA, RT-2):**二进制成功旗
** 层次性政策:** 任务阶段的完整细分,附加任务成功标志.每个阶段界限需要时间标签. 标注成本:每集0.50-2.00美元,具体取决于任务复杂性.
详细的注释指南和工具建议请参阅我们的 [机器人数据注释指南]
开始使用RCSV数据服务
建立从零开始的机器人训练数据程序需要硬件,操作员,实验室环境,收集软件,质量保证工具和数据工程专业知识. 对于需要数据的团队, 速度比他们构建基础设施快, RCSV的 [数据服务]
最快的方法是与数据服务团队联系,以提供您的任务描述,目标机器人平台和所需的集集数.RCSV处理收集协议设计,操作员培训,数据收集,质量保证,注释和您喜欢的格式出口. 您的设备使用RCSV租
如果您计划首次收集数据活动,请从200-500集的试点开始,以验证您的任务定义和质量标准,然后扩大到数千个. 根据RCSV的试点计划,价格从2,500美元开始,包括协议设计,200次示范,质量报告和出口,
硬件选项包括[OpenArm 1]
相关阅读
- [机器人数据注释指南]
T17 ) -- 如何标签培训示范 - 展现的时间从1万到100万次
- 机器人摄像头设置数据收集 --手腕,上头和立体音频配置
- [机器人学习的传播政策]
T20 ) --数据要求和培训设置 - VLA模型解释 --与示范数据进行精细调节
- [为什么远程操作数据比模拟更好]
- RCSV数据服务 --管理数据收集从$2,500
- 浏览现有机器人数据集
- [机器人租
] (( T25 ) --月度访问收藏硬件







