返回Research

多任务机器人学习:通过任务共享数据以实现更好的政策

多任务机器人学习的调查 <unk>多任务,任务条件和任务共享有助于与政策绩效受损时的联合培训.

联合培训多项任务是提高操纵政策绩效的最可靠方法之一.

为什么要多任务学习

单任务机器人政策有一个基本的局限性:它们只训练从一个任务的数据上,从而浪费了与相关任务之间的共享视觉理解的潜力.只训练挑选红杯的政策从来没有学到"挑选"是适用于蓝杯,绿瓶和金属的一般技能.

多任务学习通过同时进行多项相关任务的示范训练来解决这一问题.

  • 共享视觉功能 工作空间共享任务共享视觉语义.在"选杯","选瓶",和"选碗"上训练的表现学会"可抓取的对象"作为概念.单任务训练只学会"杯".
  • 每次培训运行的更多数据 每次培训10项任务 ×200个演示例 =2000个培训例总数,所有这些都为共享的演示做出贡献.
  • 更好的新任务基础 多任务政策比单任务政策更快地适应真正的新任务,因为表现已经丰富.

任务条件方法

必须知道要执行哪些任务.

  • 政策接收了"拿起红杯,把它放到垃圾桶里".使用语言编码器 (T5,CLIP文本编码器) 来生成任务嵌入. 允许零击对新命令进行通用化.
  • ** 一个热任务ID** 最简单. 政策收到任务索引 (任务 0,任务 1, ...,任务 N). 无需语言理解. 当任务集是固定的和小 (<20任务) 时运行良好. 在许多离线RL论文中使用.
  • 目标图像 政策收到所需的最终状态的图像.不需要语言;对任务很难用语言描述.限制:收集目标图像需要大量的工作,政策必须推断什么行动产生目标,而不是目标的外观.

联合培训的好处:已出版的证据

实验证据表明多任务联合培训是强大的:

  • ** 开放X-Embodiment** 对全多元化的数据集的训练 (22个实施例,527项任务) 连续优于单一数据集的训练,即使单项任务数据集大.多元任务 →更好的概括.关键发现:多元化更好,即使许多任务似乎无关.
  • ALOHA双手任务 共训练25个双手任务 (折叠,包装,组装) 显示,一个共享编码器在每个任务模型的单独模型相比,提高了所有任务的性能.
  • ** 桥 V2 + 其他数据集** 添加 Bridge V2 数据到 OpenVLA 的细调,将新物体的概括性提高1020个百分点,而仅在目标数据集上进行细调.即使 Bridge V2 任务与目标任务不同.

负面转让:当分担任务伤害时

负转移是当多项任务培训一起产生比任何单项任务政策更糟糕的政策时.

  • 冲突的行动分布 "擦拭表" (宽扫运动) 和"选择对象" (精确定位) 基本上有不同的行动分布.一个共享政策负责人试图平均这些,产生对两者都不好的轨迹.
  • 冲突视觉表示 需要注意细粒度的纹理 (接,电子) 的任务与需要全球场景理解的任务 (导航,垃圾桶摘) 冲突.
  • 不同硬件设置 从平行片抓住器的数据与多指手的数据进行联合训练,产生混乱的行动序列.
  • 实际规则:如果两个任务共享相同的最终效应,并且在同一工作空间中的物体上运行,它们几乎总是受益于共同训练.如果它们需要基本不同的运动或传感器,请仔细评估.

建筑选择

  • 单个共享编码器+任务特定头 最常见.共享ResNet或ViT编码器提取视觉功能;每任务多层感知器头预测行动.任务共享视觉背景但不同于行动分布时很好.
  • 专家组合 N专家网络,每个专业于一个子组任务.一个关闭网络将输入输入到适当的专家.减少对冲突任务的负转移.用于一些多任务RL工作.
  • 超网络/任务条件重量生成 超网络生成任务特定的政策重量,因为任务嵌入.
  • 对于大多数实用多任务操纵工作,一个共享的ViT编码器,具有语言任务定制和扩散操作头 (如Octo) 是目前的最佳实践.

数据混合策略

  • 任务比例采样 按数据集规模进行每个任务的样本.较大的数据集占据培训的主导地位.风险:少数示范任务的罕见任务存在不足的代表性,可能不会改善.
  • 超标罕见任务 统一任务样本 (不论任务规模等) 超标罕见任务,防止它们淹没.
  • 课程混合 从简单任务开始,逐渐引入更难的任务. 反映了人类学习:基础技能,而不是复杂技能. 特别有用的是任务难度范围广泛时.
  • 难度加权样本 对当前政策绩效相反比例的样本任务.低绩效的任务获得更多数据.适应性,可以提高趋同性,但需要在线绩效估计.

评估多任务政策

完成任务概括是黄金标准:训练N任务,评估M任务在培训期间没有见到. 这衡量了政策是否学会了可转移技能或仅仅记住了单个任务.

关于完成任务概括的结果:在25多项任务上训练使用语言条件的政策通常在具有类似的价值的真正新任务上取得40~70%的成功.单项任务的政策在这些新任务上几乎达到零. 差距代表了多项任务培训的价值.

实际的指导

  • 总是与3个以上相关任务和相同的硬件/终端效应器一起训练.
  • 使用语言条件,即使你从来不打算在部署时使用语言它强迫更好的任务表示,并简化数据收集 (只需口头描述每个任务).
  • 您的任务表现要比跨任务概括高得多,则您的学习要比记忆更高.
  • 单独的模型只能在任务需要真正不同的硬件,传感器或操作方式时才是合理的.

在 [RCSV数据服务]T1页面上探索多任务数据收集工具,或者通过 [研究平台]T2访问预先收集的多任务数据集.

使用RCSV数据构建多任务政策

访问30多个任务的多种操纵数据集,标准化评估基准和多任务机器人学习的GPU培训基础设施.

[查看数据服务]