机器人数据注释:如何标记机器人示范进行训练
如何注释机器人演示数据用于培训:成功标志,语言标签,任务细分,质量标准,工具以及RCSV的注释管道.
部分: [机器人数据收集指南]
标注是机器人学习中最不迷人的部分,也是最有影响力的.一个由500个标注好的示范组成的数据集将培养出比2000个标记不好的政策更好的政策.
标注对机器人数据意味着什么
与图像分类不同,注释意味着绘制框或点击标签,机器人示范注释更丰富,更有结构. 一个机器人集集
标注通常由人类评论员在记录的剧集的视频重播旁边和关节状态和抓住器开口的插图一起进行.好的标注工具同时显示出多台摄像头的同步视频,使得很容易根据机器人的摄像头可能无法清楚地捕捉的角度判断成功.
标注类型:一个完整的类别
机器人示范数据支持各种注释类型,每个类型都为不同的下游目的提供服务.了解你需要哪些注释,而不需要哪些注释对于管理注释预算和时间表至关重要.
剧情级别注释
| Annotation Type | Format | Required For | Cost per 情节 |
|---|---|---|---|
| Binary success/failure | Boolean flag | All IL training (ACT, Diffusion Policy, VLA) | $0.05-0.10 |
| Language instruction | Free-text string | Language-conditioned policies, VLA fine-tuning | $0.10-0.25 |
| Task category ID | Integer enum | Multi-task policies, dataset organization | $0.02-0.05 |
| 示范 quality score | 1-5 integer scale | Quality-weighted training, dataset curation | $0.10-0.20 |
| Object instance IDs | List of string IDs | Object-centric policies, diversity analysis | $0.05-0.10 |
框架级注释
| Annotation Type | Format | Required For | Cost per Frame |
|---|---|---|---|
| Task phase segmentation | Timestamped phase boundaries | Hierarchical policies, sub-task analysis | $0.50-2.00/episode |
| Contact event labels | Timestamped contact start/end | Contact-aware policies, force control | $0.30-0.80/episode |
| Object bounding boxes | 2D bbox per frame per object | Object detection, visual grounding | $0.05-0.15/frame |
| Segmentation masks | Per-pixel object mask | Semantic segmentation, sim-to-real | $0.50-2.50/frame |
| Keypoint annotations | 2D pixel coordinates per keypoint | Keypoint-based policies, pose estimation | $0.10-0.30/frame |
| Frame exclusion flags | Boolean per frame | Removing hardware glitches, operator errors | $0.01-0.03/frame |
大多数模仿学习项目只需要第一两个节目级别的注释 (成功旗
成功旗:最重要的注释
机器人训练数据集中的每一集都必须标记一个双重成功标志:机器人是否成功完成任务.这听起来很简单,但在注释开始之前必须精确定义成功标准. "将杯子放在盘上"需要一个规格:杯子是否需要垂直,手柄的方向是否重要,可接受的位置错误是多少? 应用不同的隐含标准给同一数据集的注释符创造了低调标签,降低了训练性能.
在注释开始之前,写一页的成功规范文档,例如成功和失败情况的图像.使用此文档校准注释器.测量在共享小组节目中注释者之间的协议
实现自动化成功分类
对于1000多集的数据集,手动成功标签变得昂贵.自动分类器可以处理大部分标签,在不确定情况下进行人类审查.标准方法:
- ** 观测分类器:** 使用最后抓住器状态,终端效应器位置和力/扭矩读数的规则检查. 例如:在选择位置任务中,检查抓住器是否开放 (释放) 并且终端效应器是否在最终框架的目标位置以3厘米内. 覆盖60-70%的集,准确度为95%.
- ** 训练的分类器:** 训练一个轻量级的CNN (ResNet-18) 在手腕相机的最后10个框架预测成功/失败. 需要每项任务进行训练,需要200多个手动标记的例子. 处理剩余的模糊案例,具有85-92%的准确性.
- **人评测:**自动分类器不确定的10-15%的事件保留 (0.3至0.7之间的安全性).
语言标签
语言注释将自然语言描述添加到剧集或剧集段.这些是需要培训语言条件的政策
写出语言注释,具体的两个级别:简短任务名称 ("杯位") 和自然语言指令 ("拿起白杯并将其放在蓝板上").指令应该描述人类观察者看到的情况,而不是机器人的内部状态. 如果您的任务涉及任务变化
语言注释 VLA培训最佳实践
如果您计划像OpenVLA或RT-2这样调整 [VLA模型]
- ** 不同的语法:** 不要在所有节目中复制粘贴相同的指示. "拿起红杯"和"抓住红杯,抬起它"教模型不同的语法绘制到类似的行动. 每个任务的指示变化是5到10个.
- ** 包含引用的表达式:** "把物体拿起左边",而不是"拿起杯子". 这教导了空间推理.
- 描述全部操作:"从桌子上拿起红杯,把它放在蓝盘上"比"杯到盘"更好.
- 使用一致的物体名称: 确定它是"杯","
",或"玻璃",并将其粘在数据集中.不一致的命名使语言编码器混 .
警方警方的联系标签
接触标签可以通过使用力/扭矩传感器数据进行部分自动化:F/T信号上的门
任务分类
对于涉及多个连续子任务的长视野任务,分类标签标记了阶段之间的界限.设置表任务可以分为:达成杯,抓住杯,运输杯,放置杯,释放杯.分类可实现层次政策培训,子任务级成功指标和选择性数据增强. 部分标签可以测量次任务成功率,并将数据收集工作量定向到最需要的地方.
细分注释比成功标记更昂贵,并不总是必要. 优先考虑分分类为三个或多个语义上不同的阶段的任务,或者当你计划使用层次政策架构时.
标注工具的比较
| Tool | License | Video Support | Time-Series | Multi-Camera Sync | Best For |
|---|---|---|---|---|---|
| Label Studio | Apache 2.0 | Yes | Limited | No (single video) | General annotation, extensible via templates |
| V7 (Darwin) | Commercial | Yes | No | No | Auto-labeling with SAM, managed workforce |
| CVAT | MIT | Yes | No | No | Bounding boxes, segmentation masks on video |
| Custom Gradio/Streamlit | Custom | Full control | Yes | Yes (custom build) | Robot-specific workflows with joint state plots |
| RCSV Platform | SaaS | Yes | Yes | Yes (native) | Purpose-built for robot episodes with all sensors |
一般用途注释工具 (Label Studio, CVAT, V7) 的主要限制是它们是用于图像/视频注释,而不是同步的多模特节目注释. 审查机器人示范需要同时显示 2-4 个摄像头流,加上联合状态时间序列加上力/扭矩图,所有时间同步. 大多数构建严
标记成本基准
根据RCSV的注释操作,以下是不同注释配置的实际成本基准:
| Annotation Configuration | Cost per 情节 | Time per 情节 | Suitable For |
|---|---|---|---|
| Success flag only (automated + spot-check) | $0.05-0.10 | 5-10 sec | ACT, Diffusion Policy (single-task) |
| Success + language instruction | $0.15-0.35 | 20-40 sec | VLA fine-tuning, multi-task BC |
| Success + language + phase segmentation | $0.50-1.50 | 2-5 min | Hierarchical policies, detailed debugging |
| Full annotation (all above + bboxes) | $2.00-5.00 | 10-20 min | Object detection training, perception research |
| Segmentation masks (per frame, SAM-assisted) | $0.50-2.50/frame | 30-120 sec/frame | Sim-to-real domain adaptation, visual pre-training |
对于一个500集集的数据集,注释的成功标志和语言说明 (VLA细调最常见的配置),总注释成本约为75-175美元.这是数据收集成本的小部分,并且永远不应该被
质量控制:注释者间协议
对于机器人数据,相关的指标是科恩的卡帕 (两个注释符) 或弗莱斯的卡帕 (三个或更多).
机器人数据的目标IAA门
- 双重成功标签: kappa > 0.85 (可通过明确的成功标准文件获得)
- 任务阶段界限:卡帕>0.75 (有些界限含糊性是固有的)
- 展示质量分数:卡帕 > 0.65 (质量更主观;权重卡帕更合适)
如果您的IAA低于这些门
- 低成功标签协议: 加入成功标准文件中边缘案例的照片示例. 定义确切的位置容忍度 (例如",目标中心距离2厘米内的对象中心").
- 低细分协议: 定义相过渡以可观测的物理事件 ("抓住器关闭对象"而不是"接近相结束").时间标记应与事件发生的框架相符,而不是之前或之后的框架.
- 低质量评分协议: 缩小从5级到3级 (好/可接受/拒绝).对主观质量评判而言,较细的评分是不可靠的.
标注质量标准
根据RCSV的规定,所有数据集都具有三阶段的质量门:记录后立即进行操作员自动注释,由训练有素的注释员进行次次审查,并进行自动一致性检查,比较注释与联合状态统计数据 (例如,在抓住器未关闭的成功事件被标记为重新审查).
检查常见错误的自动一致性:
- 标签成功的事件,终端效应器从起始位置从未移动超过5厘米 → 旗
- 标签成功的集段时间比中段时间的50%短 → 标签
- 语言指令提到"左"但所有对象都在工作空间的右侧 → 旗
- 阶段分类,任何阶段都比0.5s短或比60s长 →标志
- 两个相邻的节目,具有相同的语言指令,但不同任务类别 → 标志
斯威尔士国家公开委员会注释管道
当您使用RCSV的 [数据收集服务]
对于带来自己的收集数据的团队,RCSV仅提供注释服务,在以下层次:
- **基本 (0.10美元/集):**成功地验证现有标签和清除标签
- **标准 ($0.30/集):**成功标志 +语言说明 +质量分数
- **完整 (每集1.50美元):**包括相段分类和接触标签的所有注释
我们可以处理已有的数据集,收集在任何支持的硬件平台 (ALOHA, OpenArm, Franka, UR, Unitree).数据集必须在HDF5或RLDS格式,视频流可供审查. [联系我们]







