返回Blog

什么是使机器人训练数据好?

实用框架用于机器人训练数据质量:多样性,一致性,完整性,准确性,平衡和格式的6个维度 - - 加上10个点的检查清单.

[←博客]

差别是六个可测量的质量尺寸,每个团队都应该追踪.

机器人政策的垃圾排放问题

模仿学习是一个分布匹配问题:训练政策将近似其训练数据中的行为分布.如果这种分布包括失败的抓住,动的运动,不一致的策略和模糊的成功标准,则政策会忠诚地学习 reproducing所有这些. 与语言模型训练不同, 单个噪音的例子由数十亿的其他例子平衡, [机器人示范数据集]T1) 足够小,

通过500个精心控制的示范数据集,将产生比5000个不受控制的示范数据集更好的政策. 这不是一个抱负的说法 - - 这是一个在研究小组,任务类型和政策架构中一致的实验性发现. 解释很简单:一个干净,多样化,一致的数据集给了政策一个明确的信号,说明该学习什么. 杂的,偏见的,不一致的数据集给政策一个混乱的信号,

下面的框架确定了六个维度,这些维度将高质量的机器人示范数据与中等数据区分开来.每个维度都有可测量的度量和实用门.

方面1:多样性

多样性是最重要的质量维度,因为它直接决定[政策如何概括]T2).数据集必须包括在每个轴的变化,在训练和部署之间会有不同:对象实例,对象位置,照明条件,背景混乱和操作员行为.

物体多样性: 包含每个目标物体类别的至少10-20个不同的实例,其尺寸,颜色,材料和品牌不同.如果你的任务涉及到取杯子,请用陶杯,纸杯,塑料旅行杯,玻璃杯和金属杯收集示范.每个实例都教导了政策的不同关于该类别的视觉和物理特性.

**位置多样性:**使用至少30 x 40厘米的格格,在可达成的工作空间中使用不同的对象起始位置.包括不同的方向 - - 直立,倾斜,旋转90度.如果在训练期间只看到工作空间中心的对象,则将在部署期间在边缘失败.

**照明多样性:**至少在3种不同的照明条件下收集:热的空头光,窗户的凉爽的白天照明,以及混合或方向照明.照明是部署故障最常见的来源之一,因为它改变了场景中的每个物体和表面的外观.

**操作员多样性:**使用至少3个不同的操作员,每个操作员都贡献了大约相同的示范份额.每个操作员不同的方法来处理任务 - 不同的方法角度,抓住点,速度和恢复策略.这种多样性是有价值的,因为它迫使政策学习任务结构而不是单个人的独特.

两大维度:一致性

一致性意味着任务定义,成功标准和重置程序在所有集中都是一样的.不一致性引入了政策无法解决的模糊性.

**成功标准必须是二进制且明确的.***对于选定位置任务,成功意味着在集集结束时在定义宽容范围内目标位置."足够接近"不是标准.在收集协议中写出成功标准,并检查所有运营商都以相同的方式应用它们.

重置程序必须标准化. 间隔,对象必须根据定义的随机定向协议放置在新的起始位置,工作空间必须清除从前一次试验中的碎片或移动,机器人必须恢复到一致的起始配置. 落的重置引入了系统性偏差, 由于操作员默认地将它们放在某些位置附近积累的物体,

运营商校准是必不可少的. 运营商的示范在数据集中计算之前,他们应该完成 2-4 小时的校准会议,学习远程操作接口,内部化成功标准,制定一致的方法策略. 追踪每个运营商的质量指标 (成功率,轨道顺利,剧集持续时间) 和提供反. 没有校准的运营商会进行活动,这些活动会积极损害政策的执行.

方面3:完整性

每个集都必须从最初的方法到最后的发布,所有的传感器流都同步,没有缺失的数据.不完整的集都以微妙的方式破坏了训练信号,在事实后很难诊断.

没有缺失的模式. 如果您的收藏设置包括两个摄像头,联合编码器和扭矩传感器,每个集必须有四个流.一个单个集中丢失的摄像头传输教导了缺失的摄像头有时是零的政策,这使视觉处理管道混乱.

**同步时间印.**所有传感器流必须在控制期内 (通常5-20ms) 时间一致.不一致的流产生机器人看到和做的事情之间的不一致地图 - - 时T的行动与时间T减50ms的观察相对,产生系统地转移的训练信号. 通过检查每个节目中的时间标签排列,自动验证同步.

** 完整的集录.** 开始在抓时中 (因为录音被启动迟) 或结束在任务完成之前的集录 (因为记录被停止提前) 在大多数政策培训管道中是不可使用的. 配置您的收集系统开始录音之前开始录音任务,停止机器人回到其开始配置后.

方面4:准确性

准确性包括示范本身和附加的元数据的准确性.

示范精度: 只有完全成功的集段才应被纳入模仿学习培训集. 包含失败的示范的性能影响是显著的 - - 增加10%的失败的示范到培训集中通常导致政策成功率下降20-30%. 政策学会了"几乎抓住"或"掉下半路"是可接受的终端状态. 严格过:每一集的二进制成功分类,与人对边界病例的审查.

运行轨迹质量:** 演示应该是顺利的,有意的,高效的. 由于操作员错误,控制器延迟或工作场所的 ergonomics 导致的拙的轨迹, 通过使用""指标 (联合位置的第三衍生值),测量顺度,从最佳运营商中确定每任务基线,并选示范低于该基线的70%.

注释精度: 成功/失败标签,语言指令标签,任务阶段分类和对象身份标签必须正确.错误的注释会破坏训练信号.语言指令应与实际任务行为进行检查 ("取红杯"在操作员取蓝碗的剧集中不应该标记). 自动验证工具应标记注释和观察之间的不匹配.

五大维度:平衡

均衡的数据集在各个条件中几乎均等地表现.不平衡导致政策过度适应过度表现的条件,并且对未能表现的条件表现不佳.

**对象平衡:**如果您有15个对象实例,但60%的示例使用3个,则政策学习了这些3个对象很好,其他12个则很差.

**位置平衡:**如果大多数示范开始与工作空间中心的物体,则工作空间边缘的政策将是弱的.使用定义的网格或随机化方案,以确保空间覆盖.

难度平衡: 大约10-15%的示范应涵盖故意挑战性的场景:可达范围边缘的物体,混沌的工作场所,不寻常的方向,接近故障的恢复.这些边缘情况显著提高了强度,而无需更多的数据. 边缘情况的代表性不足是意外部署失败最常见的原因之一.

尺寸6:格式

数据格式决定数据集如何轻松与培训管道集成,如何有效地存储和传输,以及是否符合社区标准.

使用已建立的格式. HDF5或Zarr用于原始节目存储. LeRobot HuggingFace格式用于共享和社区兼容性. 开放X-Embodiment方案用于跨体体研究. 定制格式为每个下游消费者造成摩擦,是"我们收集数据但无法使用"失败的主要原因.

包括完整的元数据. 每个集都应该包括:任务描述,成功/失败标签,语言说明,机器人平台识别器,摄像头内在和外在,收集日期,操作员识别器以及任何不同环境条件 (照明设置,表面,对象实例ID). 通过这些元数据,可以过,分层分析,并在特定条件下进行针对性的重训.

自动验证格式. 在写作时运行每个节目的方案验证.在收集过程中捕获格式错误比在训练中发现它们要便宜得多,当工程师花费数小时调试为什么数据加载器在3847节时崩时.

七个方面:失败的含义

虽然第4维度 (准确性) 要求将故障排除在初级培训集中,但单独的标签故障示范集为强大的政策培训提供了关键功能.

**为什么失败是重要的.**一个专门基于成功示范的政策没有表达失败的形象. 包含5至10%的标记失败示范 (明确标记为数据集的故障) 允许使用多种培训技术:

  • **反向学习:**培训政策来区分成功轨迹与失败轨迹,从而产生更强大的决策界限.
  • **恢复行为学习:**包括操作员遇到接近故障的情况 (丢弃物体,错误抓住) 并恢复.这些"恢复示范"教导政策在事情发生错误时该怎么做,而不是只有当事情发生错误时该怎么做.
  • 失败检测: 基于成功/失败数据训练的单独分类器可以作为运行时间监测器,当政策进入失败状态时,它会触发人类干预.

如何收集故障数据. 不要故意破坏示范,而是保留在收集过程中发生的自然故障 (每个运营商都有10-30%的故障率,特别是在会议的早期),而不是丢弃它们. 标签它们以失败模式标签:"错误抓住","在运输过程中丢弃","错误放置","与障碍碰撞". 这种标签使得政策弱点有针对性的分析和指导重新收集优先事项.

比率: 85-90%的初级培训成功示范,5%到10%的恢复示范 (接近失败,成功恢复),5%的纯失败示范 (明显失败结果). 恢复示威是每集最有价值的, 因为它们教导了政策处理,

数据质量评分条例

Dimension Score 1 (Poor) Score 3 (Adequate) Score 5 (Excellent)
Diversity 1-2 objects, 1 lighting, 1 operator 5-10 objects, 2 lightings, 2 operators 15+ objects, 3+ lightings, 3+ operators
Consistency No written criteria, ad-hoc resets Written criteria, manual reset verification Written criteria, automated reset verification, operator calibration
Completeness Missing modalities in >5% of episodes All modalities present, sync within 50ms All modalities present, sync within 10ms, auto-validated
Accuracy No filtering; includes failed demos Binary success filter, basic smoothness check Automated success classifier, jerk filtering, annotation validation
Balance >5:1 ratio between most/least represented 3:1 max ratio, basic spatial coverage 2:1 max ratio, grid-based coverage, 10-15% edge cases
Format Custom format, missing metadata HDF5/Zarr, basic metadata LeRobot/RLDS compatible, full metadata, auto-validated at write
Failure Inclusion All failures discarded Failures preserved but unlabeled Labeled failures + recovery demos at 5-10% ratio

给每一个维度一个分数1-5个.一个平均分数4+的数据集在所有七个维度都是生产质量.在扩大收集之前,应该解决任何维度的3分数.在任何维度的1-2分数会积极损害政策培训 - - 在收集更多数据之前,修复它.

机器人数据收集中的常见反模式

这些错误是RCSV在提交政策培训数据集中最常见的错误.

  • **"研究生专业".**一个操作员,一个照明条件,物体总是处于相同的起始位置,数据收集在一个下午.
  • "量与质量"陷. 5,000个示例尽可能快收集,没有质量过. 30%是失败的抓获,20%是疲的运营商的曲轨迹,10%是时间标签同步问题.
  • "示范积累"错误. 收集2000个示范,然后训练一个政策. 然后发现数据有系统问题 (错误的摄像头角度,缺失的模式,不一致的成功标准),需要重新收集整个数据集.
  • **"只有"偏见.**运营商自然地倾向于容易的起始位置和对象方向,因为它们产生更快,更流的示范.数据集在容易的条件下变得过度表示,并在政策部署中遇到的边缘情况下呈现不足.
  • "沉默故障"问题. 数据收集持续数周,但相机校准在3日漂移,没有人注意到,因为没有自动质量监测.3日后的所有数据都有系统错误的外部转变.
  • **"格式转换梦".**数据收集在自定义格式,然后转换为 HDF5进行训练.转换脚本有一个微妙的错误,每10个时间步骤就会出现.该政策在损坏的数据上训练,并未实现.

标准化质量保障管道详细信息

采集时,RCSVQA管道运行在每个集中,而不是批次后处理步骤. 这意味着,在示范完成后几秒钟内,

管道阶段:

  1. 方案验证 (0.1s). 验证所有所需数据流存在,数据类型正确,事件元数据已完整. 如果任何流量缺失,则立即拒绝.
  2. **时间标志同步检查 (0.2s).**计算所有传感器流之间的时间标志对齐. 如果任何流量对齐不一致超过10ms (每个任务可配置).
  3. **成功分类 (0.5s).**一个学习的分类器 (从同一任务中训练在以前标记的剧集上) 预测成功/失败.边界预测 (信心0.4-0.7) 标记为人类审查.
  4. **轨迹顺度评分 (0.3s).**计算动度 (关联位置的第三衍生值) 并与操作员校准过程中确定的每任务基线进行比较.
  5. **覆盖率分析 (0.5s).**将事件嵌入视觉特征空间 (使用预训练的视觉编码器) 并检查与现有数据集相比的多样性.如果新的事件与现有事件太相似 (低于可西因距离门),则标记为冗余.
  6. 检查元数据完整性 (0.1s). 检查所有所需注释字段已填充:任务描述,语言指令,操作员ID,环境条件.

总QA延迟:每集不到2秒.操作员在完成每次示范后立即看到绿色/黄色/红色指标,从而在不打断收集流程的情况下实现实时质量反.

10个数据质量检查清单

  1. 每个目标类别至少有10个不同的对象实例
  2. 至少有3种照明条件
  3. 至少有3家运营商贡献大致相同的剧情
  4. 在所有集中均一致应用的书面成功标准
  5. 记录和遵循的标准重置协议
  6. 所有传感器流在每个节目中存在和同步
  7. 截图从接近到完成
  8. 双重成功分类与人检测边境案件
  9. 到每任务基线的轨道顺度
  10. 已建立格式 (HDF5/Zarr/LeRobot) 存储的数据,具有完整的元数据

如果你的数据集超过10个点,那么它是生产质量数据,适合训练可靠的政策.如果它在任何点上失败,

如何确保RCSV在管理收集中质量

通过 [RCSV数据服务]T4收集的所有示范数据都通过一个自动化质量管道,执行上述各个维度. 管道包括:使用已知分类器进行自动成功分类,使用操作员特定的基线进行顺利分分,对物体和环境多样性进行视觉嵌入空间的覆盖分析,时间标签同步验证,每个集中的方案验证以及所有边界案件的人类审查.

你会获得质量认证的数据,每集的质量分数,总体覆盖数据显示各个轴的多样性,以及质量报告,记录数据集在六个维度中的每个方面如何表现.

对于构建自己的收集基础设施的团队,RCSV还提供了外部收集的数据集的质量审计.我们将相同的质量管道应用到您的数据中,并提供详细的报告,确定需要改进的维度. [联系RCSV团队]T5) 讨论您的数据质量需求.

相关阅读

  • 机器人数据收集成本 -- 首要收集数据的预算规划
  • [OpenArm 设置指南]T7) -- 设置您首次收集数据活动的硬件
  • [LeRobot指南]T8) -- 关于您的质量认证数据集的培训政策
  • [零射击与少射击机器人政策]T9) - 数据质量如何影响少射击精细调节效率
  • 机器人数据隐私和安全 - 在收集过程中负责处理敏感数据
  • [机器人数据市场的未来]T11) - 塑造新兴数据市场的质量标准
  • RCSV数据服务 -- 通过自动化质量检测管道进行质量认证的数据收集

获得质量认证的机器人示范

质量管道覆盖了所有六个维度,所以你可以自信地训练你的数据符合标准.

[查看数据服务]