返回Blog

机器人数据注释:如何标记机器人示范进行训练

如何注释机器人演示数据用于培训:成功标志,语言标签,任务细分,质量标准,工具以及RCSV的注释管道.

部分: [机器人数据收集指南]

标注是机器人学习中最不迷人的部分,也是最有影响力的.一个由500个标注好的示范组成的数据集将培养出比2000个标记不好的政策更好的政策.

标注对机器人数据意味着什么

与图像分类不同,注释意味着绘制框或点击标签,机器人示范注释更丰富,更有结构. 一个机器人集集 通常是20-200秒的操纵 需要在多个层面上标记:是否是成功或失败的集,该任务的语言描述了什么,在哪里开始和结束的语义分别阶段,是否有任何框架应该被排除在训练中由于硬件错误或操作员错误.

标注通常由人类评论员在记录的剧集的视频重播旁边和关节状态和抓住器开口的插图一起进行.好的标注工具同时显示出多台摄像头的同步视频,使得很容易根据机器人的摄像头可能无法清楚地捕捉的角度判断成功.

标注类型:一个完整的类别

机器人示范数据支持各种注释类型,每个类型都为不同的下游目的提供服务.了解你需要哪些注释,而不需要哪些注释对于管理注释预算和时间表至关重要.

剧情级别注释

Annotation Type Format Required For Cost per 情节
Binary success/failure Boolean flag All IL training (ACT, Diffusion Policy, VLA) $0.05-0.10
Language instruction Free-text string Language-conditioned policies, VLA fine-tuning $0.10-0.25
Task category ID Integer enum Multi-task policies, dataset organization $0.02-0.05
示范 quality score 1-5 integer scale Quality-weighted training, dataset curation $0.10-0.20
Object instance IDs List of string IDs Object-centric policies, diversity analysis $0.05-0.10

框架级注释

Annotation Type Format Required For Cost per Frame
Task phase segmentation Timestamped phase boundaries Hierarchical policies, sub-task analysis $0.50-2.00/episode
Contact event labels Timestamped contact start/end Contact-aware policies, force control $0.30-0.80/episode
Object bounding boxes 2D bbox per frame per object Object detection, visual grounding $0.05-0.15/frame
Segmentation masks Per-pixel object mask Semantic segmentation, sim-to-real $0.50-2.50/frame
Keypoint annotations 2D pixel coordinates per keypoint Keypoint-based policies, pose estimation $0.10-0.30/frame
Frame exclusion flags Boolean per frame Removing hardware glitches, operator errors $0.01-0.03/frame

大多数模仿学习项目只需要第一两个节目级别的注释 (成功旗+语言指导) 和可选的任务阶段分类. 框架级注释如分类面具和关键点是需要的特定政策架构或感知预训练.

成功旗:最重要的注释

机器人训练数据集中的每一集都必须标记一个双重成功标志:机器人是否成功完成任务.这听起来很简单,但在注释开始之前必须精确定义成功标准. "将杯子放在盘上"需要一个规格:杯子是否需要垂直,手柄的方向是否重要,可接受的位置错误是多少? 应用不同的隐含标准给同一数据集的注释符创造了低调标签,降低了训练性能.

在注释开始之前,写一页的成功规范文档,例如成功和失败情况的图像.使用此文档校准注释器.测量在共享小组节目中注释者之间的协议,如果协议低于90%,您的成功标准需要澄清. 在任何数据集准备进行培训之前,RCSV的注释管道需要明确的成功标准文件和注释者之间的协议检查.

实现自动化成功分类

对于1000多集的数据集,手动成功标签变得昂贵.自动分类器可以处理大部分标签,在不确定情况下进行人类审查.标准方法:

  • ** 观测分类器:** 使用最后抓住器状态,终端效应器位置和力/扭矩读数的规则检查. 例如:在选择位置任务中,检查抓住器是否开放 (释放) 并且终端效应器是否在最终框架的目标位置以3厘米内. 覆盖60-70%的集,准确度为95%.
  • ** 训练的分类器:** 训练一个轻量级的CNN (ResNet-18) 在手腕相机的最后10个框架预测成功/失败. 需要每项任务进行训练,需要200多个手动标记的例子. 处理剩余的模糊案例,具有85-92%的准确性.
  • **人评测:**自动分类器不确定的10-15%的事件保留 (0.3至0.7之间的安全性).

语言标签

语言注释将自然语言描述添加到剧集或剧集段.这些是需要培训语言条件的政策政策,这些政策遵循"取红块"这样的指示,而不是硬编码任务. 语言注释还能与视觉语言行动 (VLA) 模型兼容,并允许根据任务描述搜索和过数据集.

写出语言注释,具体的两个级别:简短任务名称 ("杯位") 和自然语言指令 ("拿起白杯并将其放在蓝板上").指令应该描述人类观察者看到的情况,而不是机器人的内部状态. 如果您的任务涉及任务变化 不同对象,不同目标位置 每个变化应有一个相应的指示,使其与其它区别.

语言注释 VLA培训最佳实践

如果您计划像OpenVLA或RT-2这样调整 [VLA模型]T1),您的语言注释需要比简单的任务标签更大的注意力:

  • ** 不同的语法:** 不要在所有节目中复制粘贴相同的指示. "拿起红杯"和"抓住红杯,抬起它"教模型不同的语法绘制到类似的行动. 每个任务的指示变化是5到10个.
  • ** 包含引用的表达式:** "把物体拿起左边",而不是"拿起杯子". 这教导了空间推理.
  • 描述全部操作:"从桌子上拿起红杯,把它放在蓝盘上"比"杯到盘"更好.
  • 使用一致的物体名称: 确定它是"杯","",或"玻璃",并将其粘在数据集中.不一致的命名使语言编码器混.

警方警方的联系标签

插入,组装,接下来的表面时间标记的接触事件标签提供了视觉注释无法捕获的关键信息. 接触标签标记着机器人与物体接触或断交的框架,接触的类型 (初始接触,持续抓住,插入接触,释放),以及手腕F/T传感器的接触力大小.

接触标签可以通过使用力/扭矩传感器数据进行部分自动化:F/T信号上的门检测器识别了接触开始 (强力大小超过基线的0.5N) 和释放 (强力下降于门值). 人类审查是必要的,以分类接触类型 (故意抓与碰撞) 和捕获 F/T 门误分类偶然接触为任务相关的情况.

任务分类

对于涉及多个连续子任务的长视野任务,分类标签标记了阶段之间的界限.设置表任务可以分为:达成杯,抓住杯,运输杯,放置杯,释放杯.分类可实现层次政策培训,子任务级成功指标和选择性数据增强. 部分标签可以测量次任务成功率,并将数据收集工作量定向到最需要的地方.

细分注释比成功标记更昂贵,并不总是必要. 优先考虑分分类为三个或多个语义上不同的阶段的任务,或者当你计划使用层次政策架构时.

标注工具的比较

Tool License Video Support Time-Series Multi-Camera Sync Best For
Label Studio Apache 2.0 Yes Limited No (single video) General annotation, extensible via templates
V7 (Darwin) Commercial Yes No No Auto-labeling with SAM, managed workforce
CVAT MIT Yes No No Bounding boxes, segmentation masks on video
Custom Gradio/Streamlit Custom Full control Yes Yes (custom build) Robot-specific workflows with joint state plots
RCSV Platform SaaS Yes Yes Yes (native) Purpose-built for robot episodes with all sensors

一般用途注释工具 (Label Studio, CVAT, V7) 的主要限制是它们是用于图像/视频注释,而不是同步的多模特节目注释. 审查机器人示范需要同时显示 2-4 个摄像头流,加上联合状态时间序列加上力/扭矩图,所有时间同步. 大多数构建严注释管道的团队最终使用了自定义的Gradio或Streamlit应用程序,直接阅读HDF5集.RCSV的 [数据平台]T2) 提供了与数据收集管道集成的基于网络的界面.

标记成本基准

根据RCSV的注释操作,以下是不同注释配置的实际成本基准:

Annotation Configuration Cost per 情节 Time per 情节 Suitable For
Success flag only (automated + spot-check) $0.05-0.10 5-10 sec ACT, Diffusion Policy (single-task)
Success + language instruction $0.15-0.35 20-40 sec VLA fine-tuning, multi-task BC
Success + language + phase segmentation $0.50-1.50 2-5 min Hierarchical policies, detailed debugging
Full annotation (all above + bboxes) $2.00-5.00 10-20 min Object detection training, perception research
Segmentation masks (per frame, SAM-assisted) $0.50-2.50/frame 30-120 sec/frame Sim-to-real domain adaptation, visual pre-training

对于一个500集集的数据集,注释的成功标志和语言说明 (VLA细调最常见的配置),总注释成本约为75-175美元.这是数据收集成本的小部分,并且永远不应该被低.注释的边际成本远低于对标签不良的数据进行重新训练的成本.

质量控制:注释者间协议

对于机器人数据,相关的指标是科恩的卡帕 (两个注释符) 或弗莱斯的卡帕 (三个或更多).

机器人数据的目标IAA门:

  • 双重成功标签: kappa > 0.85 (可通过明确的成功标准文件获得)
  • 任务阶段界限:卡帕>0.75 (有些界限含糊性是固有的)
  • 展示质量分数:卡帕 > 0.65 (质量更主观;权重卡帕更合适)

如果您的IAA低于这些门值,则在继续前,需要改进注释标准.

  • 低成功标签协议: 加入成功标准文件中边缘案例的照片示例. 定义确切的位置容忍度 (例如",目标中心距离2厘米内的对象中心").
  • 低细分协议: 定义相过渡以可观测的物理事件 ("抓住器关闭对象"而不是"接近相结束").时间标记应与事件发生的框架相符,而不是之前或之后的框架.
  • 低质量评分协议: 缩小从5级到3级 (好/可接受/拒绝).对主观质量评判而言,较细的评分是不可靠的.

标注质量标准

根据RCSV的规定,所有数据集都具有三阶段的质量门:记录后立即进行操作员自动注释,由训练有素的注释员进行次次审查,并进行自动一致性检查,比较注释与联合状态统计数据 (例如,在抓住器未关闭的成功事件被标记为重新审查).

检查常见错误的自动一致性:

  • 标签成功的事件,终端效应器从起始位置从未移动超过5厘米 → 旗
  • 标签成功的集段时间比中段时间的50%短 → 标签
  • 语言指令提到"左"但所有对象都在工作空间的右侧 → 旗
  • 阶段分类,任何阶段都比0.5s短或比60s长 →标志
  • 两个相邻的节目,具有相同的语言指令,但不同任务类别 → 标志

斯威尔士国家公开委员会注释管道

当您使用RCSV的 [数据收集服务]T3) 时,注释是可交付的部分.我们的运营商在录音会议期间以成功标志和语言标签注释每个集,我们的注释团队在数据集出口之前进行次次审查.您收到具有高度信心的注释,注释商协议分数和完整的质量报告的数据集.

对于带来自己的收集数据的团队,RCSV仅提供注释服务,在以下层次:

  • **基本 (0.10美元/集):**成功地验证现有标签和清除标签
  • **标准 ($0.30/集):**成功标志 +语言说明 +质量分数
  • **完整 (每集1.50美元):**包括相段分类和接触标签的所有注释

我们可以处理已有的数据集,收集在任何支持的硬件平台 (ALOHA, OpenArm, Franka, UR, Unitree).数据集必须在HDF5或RLDS格式,视频流可供审查. [联系我们]T4) 讨论您的数据集注释需求,或通过 [RCSV数据平台]T5探索我们的注释界面.

相关阅读