机器人数据收集: ML 团队的完整指南
如何收集高质量的机器人训练数据 <unk>远程操作方法,节目要求,数据格式以及如何从50到10,000多次示范进行扩展.
收集高质量的机器人示范数据的最终操作簿
为什么真正的机器人数据比模拟数据更好
机器人操作政策的最大瓶
模拟与真实的差距不够快
模拟布料与真实的棉巾不一样.模拟纸板盒在侧面压力下不会像真实的纸板盒一样
数字告诉故事. 在2025年,谷歌深度思维的RT-2在使用130万个实体演示的新物体操纵方面取得了62%的成功. 丰田研究院的传播政策仅仅通过200次示范完成训练任务,取得了94%的成功.但要求这些示范是高质量的,一致的,并根据部署所使用的硬件配置收集.
当你需要真正的数据时
如果您的任务涉及以下任何事情,则现实数据收集是合理的:
- **接触丰富的操纵:**插入,线程,组装,插孔,以及任何对力反
有意义的任务. - **可变形的物体:**布料,电缆,食品,袋子. 可变形的模拟正在改善,但仍然产生与实际材料不同质量的行为.
- 视觉多样性: 必须将政策普遍化到现实世界照明条件,物体纹理,背景和摄像头的视角上,而合成
染不能完全覆盖. - **硬件特定部署:**当您的政策将运行在特定的机器人臂上,特定的摄像头,收集有关该确切设置的数据完全消除了实施格差.
- **人与机器人互动:**任何涉及交付,协作组装或与人类共享工作空间的任务.人类行为不能被现实地模拟.
域名随机排序有局限性
域名随机化 模拟中的不同纹理,照明,物理参数和摄像头姿势 帮助弥合了模拟到真实的差距,但它有了文档化的限制.随机化物理参数在广泛的范围内产生了不现实的行为,这使得政策混乱. 随机化视觉属性而没有匹配现实世界分布,会产生"反向现实差距",该政策预计视觉噪音不存在.对于2026年大多数实际操纵任务,最有效的途径是:使用管理服务 (如RCSV) 来验证您的方法,然后使用模拟增强来扩展.
进行四种远程手术方法的比较
远程操作
方法1:领导跟随者的武器 (ACT/ALOHA风格)
**它如何工作:**运营商物理地移动轻量级"领袖"臂;更重量级"跟随者"臂通过直接USB动态素巴士在3-8ms延迟时实时复制领袖的联合位置.这是ALOHA,移动ALOHA和2026年大多数大学研究设置所使用的方法.
为什么它产生最好的数据: 运营商通过物理领袖臂具有自觉反
硬件成本:** 领袖手臂,加上追随者/生产手臂,每站的总成本包括摄像头和计算: $15,000-35,000.
**通过输出:**每小时20-35次示范,用于桌面操作任务.
最适合: 严
方法2:VR耳机 (Meta Quest 3)
**它如何工作:**操作员戴着VR耳机,看到机器人的相机传输或混合现实视图.手控制器的位置通过在工作站上运行的反动动态来映射到终端效应器的卡特西亚位置.
延迟: 15-40 ms端到端 (WiFi + IK计算 + 臂指令).适用于大多数操纵任务,但可见于精密工作.
机器人手臂,摄像头和计算以外的任何额外的硬件.
** 通过输出:** 每小时15-25次示范,用于桌面操作. 比领导跟随者略低,因为操作员缺乏自觉反
**操作员疲劳:**VR耳机在60-90分钟后会导致一些操作员恶心.每小时计划15分钟的休息.每天最多的实践会议:3-4小时.
**最适合:**预算的团队,不需要微毫米精度的任务,数据收集管道的快速原型制造,粗略操作 (采集,放置,排序).
方法3:SpaceMouse/键盘
**它如何工作:**操作员使用6轴SpaceMouse ($200) 或双模拟游戏板来控制终端效应器速度或联合速度.操作员通过显示器上的现场摄像头传输来观察机器人.
延迟: 1-5 ms (直接USB HID). 任何方法中最低的延迟,但控制带宽有限的超过抵消这一优势.
**通过输出:**每小时5-12次示范. 最慢的方法是因为运营商无法直接指定6DOF姿势,导致
**数据质量:**比其他方法低.操作员之间的示范不太一致,因为每个操作员都制定了自己的游乐杆控制策略.轨道包含更多的噪音和犹
最适合: 没有其他界面时快速原型设计,移动机器人导航数据,手臂轨迹顺
方法4: 触觉手套/外骨架
**它如何工作:**操作员穿着手部外骨架或触觉手套 (SenseGlove Nova 2价格为8,000美元/对或HaptX G1价格为20,000美元/对) 追踪指关节角并将它们映射到巧妙的机器人手.
由于它们涉及更复杂的序列 (多指抓,手中旋转,放置).
工作人员疲劳:**高.手套是身体要求的. 45 分钟的会议限量, 10 分钟的休息. 总日会议限量: 4-5 小时.
最适合: 精致的操纵研究,多指抓,手中旋转,工具使用,服装操纵,任何手指水平控制至关重要的任务.
较量表
| Method | 精度 | Operator Learning Curve | Setup Cost | Demos/Hour | Ideal Task Types |
|---|---|---|---|---|---|
| Leader-Follower | Highest | 1-2 hours | $15K-$35K | 20-35 | Contact-rich, insertion, bimanual, assembly |
| VR / Quest 3 | Good | 30 min - 1 hour | $5K-$12K | 15-25 | Pick-place, sorting, packing, gross manipulation |
| SpaceMouse | Moderate | 2-4 hours | $3K-$8K | 5-12 | Prototyping, navigation, simple manipulation |
| Haptic Gloves | High (dexterous) | 3-6 hours | $25K-$55K | 8-15 | Multi-finger grasping, in-hand rotation, tool use |
剧情设计原则
在收集一个单个示范之前,你需要定义什么构成一个好集.糟糕的集集设计是浪费数据收集工作的最常见来源.以下是五个设计决定,确定你的数据集是否会培养一个成功的政策.
任务规范
写一个精确,明确的任务描述,操作员可以持续执行. 坏:"拿起物体. "好:"用上下点点头抓住左桶中的红立方体,抬到桌子上15厘米,移到右桶中部,然后放下. 您的任务规范越具体,您的演示越一致,您的政策就越容易学习.
恢复一致性
定义场景的初始状态.表上有哪些物体?它们在哪里定位?可接受的随机定位范围是多少?每个集的开始时机器人臂如何定位?一个明确的重置程序应该在集中花费15-30秒. 如果重置时间超过60秒,或者需要模糊的放置,则您将失去输出力,并引入了破坏训练的分布噪音.
对于桌面任务,创建一个模板 (印刷纸有位置标记,或配列指南的固定) 操作员使用来重置场景.在定义的边界框中随机定制对象位置 (通常是15-25厘米方形) 记录准确的随机定制范围.
观察空间
确定政策在推断时将确切观察到什么,并记录收集过程中的信号.典型的观察空间包括:
- 摄像头图像: 2-4 个视图 (上头,手腕,侧面) 480x640 分辨率,30fps.使用英特尔RealSense D405/D455用于RGB-D或标准USB摄像头仅用于RGB.
- **关节位置 (qpos):**50Hz的关节角的浮动阵列. 作为最终尺寸包括抓住器的开口.
- **关节速度 (qvel):**50Hz的关节角速度浮动阵列.
- **终端效应器姿势:**可选的6DOF (位置+定向) 在50Hz.
- 抓住器状态: 双式 (开/关) 或连续 (开口宽) 时50 Hz.
没有使用的观察尺寸增加噪音和存储成本,而没有益处.
行动空间
对于2026年大多数操纵政策来说,行动是:
- 联合位置目标: ACT和传播政策最常见的选择. 记录领导部门的联合位置作为行动信号.
- 终端效应器速度: 用于一些卡特西亚空间政策. 从远程操作接口记录命令终端效应器速度.
- **绝对终端效应剂姿势:**不太常见,但有些VLA模型使用.记录目标终端效应剂6-DOF姿势.
重要: 尽可能多存储行动在联合空间中.大多数现代政策 (ACT,扩散政策, pi-0) 在联合空间中运行.作为行动存储卡特西亚姿势需要在训练时解决IK,这是容易出现错误的,并增加计算总费.
剧情长度
尽可能短短的节目,同时完成完整的任务.
- 简单的选择和位置: 3-8秒 (150-400次时段50Hz)
- 多步骤操作: 10-25秒 (500-1,250个时间步骤)
- **复杂组装:**30-90秒 (1,500-4,500时间步骤)
如果你的任务自然要长于60秒,请考虑将其分解为分任务,这些分类在推断过程中被链接.
你需要多少数据?
需要的示范数量取决于您的政策架构,任务复杂性和所需的成功率.
| Policy Type | Episodes Needed | Evidence | Notes |
|---|---|---|---|
| ACT(Action Chunking with Transformers) | 50 - 200 | ALOHA paper: 50 demos for simple tasks, 200 for bimanual | Most data-efficient architecture for manipulation. Quality matters more than quantity. |
| Diffusion Policy | 100 - 500 | TRI: 200 demos for 94% success on trained tasks | Handles multi-modal action distributions well. Benefits from diverse demonstrations. |
| VLA 微调 (pi-0, OpenVLA, RT-2) | 500 - 2,000 | OpenVLA: 1K demos for single-task fine-tuning | Pre-trained on large data, but fine-tuning still needs substantial task-specific data. |
| From-Scratch 基础模型 | 5,000 - 100,000+ | RT-2: 130K demos. Open X-Embodiment: 2.2M episodes across 22 robots. | Only relevant if building a generalist model. Most teams should fine-tune instead. |
关键见解: 50个高质量的示范每次都会超过500个低质量的示范.如果100个简单任务的示范不能达到70%以上的政策成功,问题是数据质量或管道错误,而不是数据量.
数据格式 深度潜水
早期选择正确的数据格式可以防止后来的痛苦迁移.机器人界已经聚合到三个主要格式.
标准数据表
HDF5是机器人示范数据最广泛使用的格式.它存储异质数据 (联合位置,图像,元数据) 在一个文件中,具有高效的随机访问.ACT和扩散政策代码库使用HDF5本地.
** 剧集结构:** 每个剧集都是包含观测,行动和元数据属性数据集的组.以下是标准的ACT/ALOHA布局:
/episode_0/
observations/
images/
cam_high # uint8 [T x 480 x 640 x 3]
cam_wrist_left # uint8 [T x 480 x 640 x 3]
cam_wrist_right # uint8 [T x 480 x 640 x 3]
qpos # float32 [T x 14] (7 joints per arm)
qvel # float32 [T x 14]
action # float32 [T x 14] (leader arm positions)
attrs:
task = "pick_cube_bimanual"
operator_id = "op_03"
success = True
timestamp = "2026-04-10T14:32:00Z"
robot_serial = "openarm_007"
**何时使用HDF5:**作为您的主要收集和存储格式. 根据需求转换到其他格式. HDF5是最适合检查的格式,具有成熟的Python工具 (h5py, HDFView),并支持任何集中的任何框架的高效随机访问.
强化学习数据集
谷歌的RLDS格式使用TFRecord文件,并采用标准化方案.它是Open X-Embodiment的原生格式 (2.2M+集在22种机器人类型中) 和Octo一般主义政策.
**强大点:**标准化方案可通过数据集进行跨数据集训,而无需每个数据集的适配器.通过 tf.data 通过云存储进行高效流媒体.社区规模:可用RLDS格式的50多个数据集.
缺点:
雷罗特格式 (拥抱面孔)
包容面的LeRobot格式使用Parquet文件用于表格数据和MP4视频用于摄像头观测.它旨在在包容面部中心共享,并与LeRobot培训库本地集成.
强大点: 单命令上传到 Hugging Face Hub.内置的网络可视化. 紧
缺点: MP4编码是损失的
我们的建议: 收集和存储在 HDF5. 使用
质量控制检查清单
收集1000个坏示例比收集50个好示例更糟糕.质量直接决定了政策的绩效.
- 任务成功验证: 每个集都必须成功完成完整任务.失败的示范 (丢弃的物体,错过的抓住,不完整的轨迹) 积极损害政策培训.实时质量审查:观察员立即在收集后将每个集标记为成功/失败.目标:最终数据集中的95%以上的成功率.
- **时间刻板同步:**所有传感器流 (摄像头,关联状态,操作) 都必须以时间刻板和同步为<5ms宽容.使用硬件触发摄像头 (从工作站的GPIO脉冲) 和共享时钟源 (慢性NTP或IEEE 1588 PTP).通过记录已知的事件 (臂接触表) 并检查所有流显示事件在5ms内.
- **轨迹一致性:**对于给定的任务,示范应遵循类似的策略.如果运营商A从左边选择,运营商B从右边选择,政策学习了模糊的双模分布,这在两种情况下都失败.在收集开始之前定义方法策略,抓住点和放置位置.每周审计轨迹分布.
- 场景多样性: 系统地变化对象位置 (在定义的界限框中随机),对象实例 (每个类别为 3-5),照明条件 (上头,角,淡色) 和背景混乱.记录每个收集会话的多样性参数.如果没有多样性,政策将超越您的实验室的精确场景布局.
- ** 监控
落:** 必须检查相机流是否丢掉 . 一个丢掉的 片会产生时间间断性,从而混 基于序列的政策.实时监测 落率. 拒绝超过2%的 落事件,并调查原因 (USB带宽,计算瓶 ). - 抓住器状态一致性: 根据相机证据验证抓住器的开/关信号. 幻影抓住器事件 (数据显示抓住器关闭,但相机显示没有) 惊人的常见,在噪音抓住器传感器. 标志和纠正或丢弃受影响的事件.
- ** 合并限制:** 无一集都不应包含机器人的安全操作范围之外的联合位置.近异性配置产生极端的联合速度,从而在行动分布中产生异常值.设置软件的联合限制在硬件限制内5度.
- ** 剧集长度限制:** 定义您的任务的最小和最大剧集长度. 比预期范围要短得多 (任务未完成) 或更长 (操作员犹
,从近失败中恢复) 的剧集应标记为审查. - **全文资料完整性:**每集都需要:任务名称,操作员身份证,时间
印,机器人序列号,摄像头配置,成功/失败标签,以及对异常的自由文本说明.不完整的元数据使数据集管理,质量分析和可复制性不可能. - **跨运营商一致性:**如果使用多个运营商,每周对比运营商之间的轨迹分布.一个显示明显偏离共识的运营商应重新训练或排除.使用动态时间扭曲 (DTW) 作为定量一致性指标.
从试点到生产的规模化
通过一个概念验证数据集到生产规模数据的路径,需要在每个阶段进行故意的基础设施投资.
阶段1:概念证明 (50集)
一个操作员,一个机器人,一个任务.目标是验证您的远程操作设置,数据管道和培训代码.根据这些数据训练一个ACT或扩散政策模型,并在真实机器人上进行评估.如果您不能通过50个简单任务的示范获得70%以上的成功,问题是数据质量或管道错误,而不是数据量.
时间: 1-3天. 运营时间: 200 美元至 500 美元.
阶段2:初级培训 (200集)
添加第二个运营商来验证您的收集协议是独立于运营商的. 实现自动质量检查: 节目长度限制,联合限度违规,成功/失败分类. 开始系统地跟踪质量指标. 这就是你应该看到80-90%以上的政策成功的阶段.
时间:1-2周. 运营时间600至1500美元.
阶段3:生产政策 (共1000集)
部署 2-4 个并行收集站,具有相同的硬件配置.使用一个中央数据管道,将所有站的集集集,运行质量检查,每晚生产准备训练的数据集.在这个规模上,运营商管理成为瓶
关键投资:
- 自动重置机制: 减少手动重置场景的15-60秒.即使在1000集中节省15秒,也节省了4+小时的操作时间.
- **实时质量仪表板:**每站的吞吐量,成功率和质量指标可见于运营商和监管人.
- **标准定位:**多个站点时,必须标准化摄像头外层和机器人基准.
时间线: 2个站的2周 ** 成本 (内部):** 3,000- $ 8,000 运营时间,30万- $ 100万 硬件.
第四阶段:基金会模型贡献 (10,000+集)
在这个规模上,你正在构建一个基础数据集.考虑为社区利益和引用影响做出开放数据集 (Open X-Embodiment,DROID) 的贡献.使用RLDS或LeRobot格式进行互操作性.投资任务解剖学和元数据标准,以便你的数据集能够在研究组中进行导航和重复使用.
时间线: 2-6个月,有4个站. 成本 (内部): 运营时间15000-50,000美元.
或: [請RCSV在任何一段時間收集]
成本计算器:内部对RCSV管理
了解数据收集的真正成本有助于团队做出有知识的构建与购买决策.
| Cost Category | In-House | RCSV Managed |
|---|---|---|
| Hardware (robot + teleop + cameras + compute) | $15,000 - $35,000 | $0 (included) |
| Infrastructure setup (workspace, calibration, software) | $2,000 - $5,000 | $0 (included) |
| Operator recruitment and training | $1,000 - $3,000 | $0 (included) |
| Operator labor (500 episodes at 20 demos/hr, $35/hr) | $875 | Included in campaign price |
| QA and quality review | $500 - $1,500 | $0 (included) |
| Engineer time (pipeline, debugging, monitoring) | $5,000 - $15,000 | $0 |
| Total | $24,375 - $60,375 | $8,000 - $15,000 |
| Effective cost per episode | $49 - $121 | $16 - $30 |
内部成本包括在一个500集的竞选中抵免的硬件.如果你计划在12个月内收集5000+集,内部规模将会更经济.对于一次性或初始竞选,管理收集通常在考虑工程师时间和机会成本时更具成本效益,比成本效益高2~4倍.
7个团队在收集第一批数据集时犯的常见错误
通过与数十个团队合作,我们会看到同样的错误,避免这些错误,
- ** 训练管道验证之前收集数据.** 团队购买硬件,收集500集,然后发现他们的训练代码有错误使所有数据不可用. 始终先训练10-20集试验. 验证您的管道在投资规模之前制定出一种政策,使机器人能够合理地移动 (即使它失败任务).
- **忽略操作员培训.**一个未经培训的操作员的数据比一个训练有素的操作员 3-5倍更差.新操作员的前20次示范应被视为校准数据,然后被抛弃.
- **不一致的重置.**如果场景在各集之间不一致地重置,则该政策学习包含任意的起始状态的分布.这显著增加了学习强大的政策所需的数据.在收集数据之前花时间构建可重复的重置程序.
- 不实时监测质量. 团队经常收集整个数据集,然后发现过去200集中有一个移动位置的摄像头,或者一个开始产生幻觉信号的抓住传感器.
- 在错误的行动空间中录制. 收集卡特西亚终效应表现时,您的政策预计将联合位置 (或相反) 进行重新处理或重新收集.
- **低估场景多样性.**在对象总是处于相同位置的示范中训练的策略将失败,当对象处于5厘米左右. 从第一集开始,系统地随机定制对象的位置,照明和对象实例.
- ** 省略元数据.** "我们会后面添加元数据"意味着"我们永远不会添加元数据".记录任务名称,操作员身份证,时间标签,机器人序列,摄像头配置和成功/失败标签在每个集中.这每集花费10秒,并节省了几天的混乱.
让RCSV收集您的培训数据
- **管理数据收集: ** 从50集试点到10,000+集活动.你指定任务;我们将数据集提供在HDF5,RLDS或LeRobot格式.
- **硬件包:**预先配置的数据收集站 (OpenArm + 摄像头 + 计算 + 软件) 准备部署在您的实验室.
- **开放数据集: **浏览我们的公开可用的机器人操纵数据集库.
- **数据平台: **通过RCSV无畏平台上传,可视化,质量检查和出口数据集.
需要收集机器人数据吗?
根据RCSV的数据收集计划,我们将提供一个数据收集活动.







