返回Research

机器人学习的开放问题:2025年2028年10个研究方向

机器人操纵学习中最重要的开放问题从样本效率到长远规划以及进展的情况.

自2022年以来,机器人学习取得了非凡的进展.

2025年现场状况

机器人学习 从示范数据或环境互动中培训神经政策 在过去三年中比上个十年进步得更高.

但"实验室中可能"和"部署可靠"仍然被一个长的开放问题列表分开.以下十个问题代表了2025年至2028年该领域的最优先研究方向,基于部署经验,文献合成和与实践者对话.

1. 有效地扩展数据收集

: 根据任务复杂性,收集现实世界机器人示范数据成本高于每集 $430 美元.培训最先进的一般主义政策需要数万集.数学对大多数组织的当前收集成本并不适用.

研究指导: 积极学习 (只收集最有信息的示范,而不是随机示范);模拟预训练与域的随机化减少实际数据需求;跨体现转移 (从机器人A的数据训练,部署在机器人B的微微调);以及从无标签的机器人视频中提取信号的半监督方法.

进步信号:尼拉行为克隆基线相比,需要减少10倍的示范,以达到标准化基准任务的成功率.

2 长远任务完成

当前状态: 最先进的机器人政策在控制设置中可靠地处理1020步骤任务.现实世界操纵通常需要50200步骤序列.错误组合:每步骤的 95%的成功率只能在50步骤中获得8%的任务成功.

研究方向: 具有明确的子目标表示的层次性政策;任务和运动规划 (TAMP) 与操纵原始的学习组件的集成;与低水平的学习政策相结合的大型语言模型子目标生成;以及行动表示中的时间抽象.

进步信号: 在非结构化环境中可靠完成50多步骤操纵任务,成功率超过70%.

3. 强有力的手动操纵

**当前状态:**大多数机器人学习工作使用平行爪抓住器执行动力抓. 精巧的手中操纵在多指手中的物体重新定位,旋转和规则在一般物体中基本未解决.

**研究指导:**高分辨率触觉传感阵列,可提供与人类手指尖敏感度相比的接触信息;用手套进行手术手术,以示范数据收集 (RCSV运营[基于手套的数据收集程序]T1));学习了对象形状和表面特性普遍化的接触模型.

进步信号: 50多种新型物体中任意物体在指定的方向上转移,成功率超过80%.

4.将其整体化为新型物体

当前状态: 针对一组对象训练的政策通常在这些对象上取得6075%的成功.新型对象 (在训练中未见) 降至2540%的成功.

研究方向: 基础模型视觉功能 (CLIP,DINOv2) 作为提供语义通用化的结编码器;覆盖100多个对象类别而不是510的多元化训练数据;作为中间表示的类别级别姿势估计;并使用少量的新对象示范来进行测试时间适应.

进步信号: 在50个被持久的对象类别的标准化评估集中,新对象成功率在15%内.

5 物理世界理解

**当前状态:**当前的机器人政策是非常好的模式匹配,但缺乏对物理物体属性的理解.在硬物体上训练的机器人不能适应其抓住力.

**研究方向:**从互动数据中学习的隐含物理模型;触觉世界模型,通过触觉观测预测接触结果;语言条件的属性表示 ("轻轻处理它很脆弱") 集成到政策条件;以及物理信息的架构,将物理约束纳入政策结构.

进步信号: 无需具体任务培训,成功操纵可变形物品 (布料,泡,软食品) 的成功率超过70%.

6. 人与机器人合作

**当前状态:**机器人政策是为静态环境设计的.当人类存在时,不可预测的运动会使该政策的假设无效,导致失败或不安全行为.

研究指导: 从姿势和视觉中实时预测人类意图;安全的符合规则的控制,以应对人类意外的接近性来调整机器人运动;基于人机器人互动数据培训的协作操纵政策;以及明确的交付协议,并有学习时间.

**进步信号:**成功完成协作任务 (人类手对机器人反对,机器人继续任务) 通过优雅的失败模式,当人类行为偏离预期时.

7. 强大的真实模拟器用于接触任务

当前状态: 模拟到真实传输对于自由空间运动 (到达,预抓取方法) 工作很好. 接触任务 (插入,组装,接下面) 由于接触动态中的模拟到真实差距,传输很差.

**研究指导:**可与已学习的接触模型进行模拟,这些模型是根据实际机器人数据进行校准的;在培训期间进行随机化接触参数,以创建强大的政策;学习的残余动力模型,以纠正模拟错误;以及主要基于实际数据进行培训的接触丰富的基础模型,仅用于增强的模拟.

进步信号: 完全训练在模拟中,在实际硬件上达到80%以上的成功,而没有任何实际数据的细节调整.

8. 终身学习

当前状态: 部署的机器人政策是静态的 它们从运营经验上没有改善.当新任务被添加或现有任务需要更新时,标准方法是从零开始全面重新培训,这很昂贵和缓慢.

研究指导: 连续学习方法,不过增加新的任务功能,而不覆盖现有的任务; LoRA和其他参数效率优化的调整方法,可模块化扩展政策;使用精选的存储缓冲器重复体验,以防止灾难性遗忘;以及模块化政策架构,可独立交换特定任务的模块.

进步信号: 机器人政策,同时在所有以前任务上保持90%以上的原始性能,同时连续学习10项新任务,而没有完全重新培训.

9. 有效的实体增强学习

当前状态: 实用机器人上强化学习对于大多数应用程序来说太慢,而且不安全从零开始学习需要数千次环境相互作用,其中许多涉及到损坏设备或造成安全风险的故障.

**研究指导:**基于模型的RL从少数实际互动和计划中学习一个世界模型;安全的探索方法,限制了学习过程中的代理人的行为空间;结合模仿学习初始化与最终性能差距的RL细节调整;以及离线RL方法,通过记录的操作数据改善了政策,而无需在线互动.

进步信号: 通过仅使用2小时的实用机器人交互 (无模拟) 实现接触丰富的操纵任务的85%以上成功率,学习过程中安全性违规性是零的.

10 评估标准化

**当前状态:**机器人学习论文报告了与不同机器人,任务,成功指标和评估协议兼容不的基准结果.没有相似于视觉的图像网或语言的MMLU的一致基准.在论文中,方法的比较几乎是不可能的.

研究方向: 社区融合在一小组标准基准套件上 LIBERO, SimplerEnv和 RoboFlamingo Benchmark是领先的候选人;标准化评估协议 (试验数量,评估条件,成功定义);允许第三方验证声称结果的硬件循环评估服务;和类似于Papers With Code的排名板基础设施.

**进步信号:**三个或多个主要机器人学习场所 (CoRL,ICRA,RSS) 要求在纸质接受的共同基准子集中获得结果.

如何 RCSV 促进这些指导

斯威尔克的研究和基础设施项目直接解决问题1 (数据收集效率),3 (通过手套收集进行丰富的操纵数据),8 (通过连续数据飞行器进行终身学习) 和10 (通过我们的标准化任务组进行评估).

对于研究这些开放问题,RCSV提供[数据收集服务]T2) 制作基准质量的示范数据集,用于硬件循环评估的机器人访问程序,以及对LeRobot Hub和开放X-Embodiment格式的数据集贡献.

合作在机器人学习研究上

国际科学与工业研究项目:数据收集,机器人访问和基础设施.

[查看研究计划]