普遍化挑战:机器人政策在2026年仍失败
深入的技术处理为什么机器人政策没有得到一般化:分布转移,灾难性遗忘,组合性失败以及2026年的实际减缓策略
[←博客]
对于一个新型项目来说,一个在训练对象上取得95%的成功的政策可能完全失败.
对于一般化策略的更广泛概述,请参阅 [机器人政策的一般化:为什么机器人在新物体上失败]
问题规模
整体化失败是机器人学习研究演示和生产部署之间的唯一最大差距.在使用5杯红杯的300次"
问题比基准数字更糟.大多数发表的评估都测试了狭窄带内的概括:相同的物体类别具有不同的颜色,相同的表格具有不同的位置,相同的房间具有不同的照明.现实世界部署需要同时对所有这些轴进行概括,故障模式的复合. 处理新的颜色和新的位置的政策可以在新位置上组合新的颜色上失败,因为代表没有学会独立考虑这些维度.
分配转变:基本机制
在数学层面上,通用性失败是分布转移问题. 政策是一个训练为减少培训分布 P_train的损失的函数近似器. 在部署时,政策会遇到来自不同的分布 P_deploy的观察. 当P_train和P_deploy之间的重叠在相关特征尺寸中很小时,政策的输出是外分而不是插入,神经网络不靠谱地外分.
机器人学习的分布变化比计算机视觉分类更严重,因为随着时间的推移,后果会复杂.在视频中错误识别一个框架的分类器具有本地错误. 错误识别一个观察的政策会产生错误的行动,改变下一个观察,可能远离训练分布,造成
在机器人操纵中,有三个具体机制推动分布转变:
- **视觉分布转移:**新型物体外观 (颜色,纹理,透明度,反射性) 产生了编码器未见的视觉特征.最危险的情况是透明和反射的物体,它们与大多数训练数据集主导的不透明,
质物体产生基本不同的像素模式. 深度传感器也在透明物体上失败,消除了一些政策依赖的深度反弹. - ** 几何分布转移:** 新型物体形状需要不同的抓住配置,而政策尚未学习.在
圆杯上训练的政策可能会产生 圆的方法向量,当它以矩形盒呈现时,因为它已经学习了与 圆几何密切相关的抓住策略. - 动态分布转移: 操作过程中新物体质量,摩擦系数和合规性改变了接触动态.在硬塑料物体上训练的政策产生了对硬塑料进行校准的抓紧力.呈现一个软泡
物体,政策将它压碎 (过度的力) 或放下 (不够的摩擦). 在视觉层面上,这种转变是不可见的,不能仅通过视觉数据增强来解决.
持续学习中遗忘的灾难性
对于一般化失败的自然反应是收集更多数据和重训.但天真重训引入了第二种失败模式:灾难性遗忘.当一个政策对新对象类别进行细节调整时,除非将旧数据混合到重训集中,否则它就会失去以前掌握的类别的性能. 基本原因是,对新数据进行优化的神经网络参数更新,
由于数据收集成本高昂,训练部署再训练周期缓慢,因此机器人学习中,灾难性遗忘特别具有诡诈性.一个团队发现他们的透明物体政策失败了.他们花了两周时间收集透明物体的示范和重训. 现在,该政策处理透明的对象,但它以前掌握的不透明对象已经降低了15%.它们将旧数据添加到后面,重新训练,但现在该模型需要更多的容量或更仔细的学习速度规划.每个新失败模式都会重复.
目前的减轻策略包括重复经验 (在重训期间混合旧和新数据),弹性重量整合 (对旧任务重要的参数的变化受到惩罚),以及渐进的神经网络 (为新任务分配新的网络容量). 2026年最实用的方法是保持全面的数据库,定期从零开始进行重训,以接受计算成本以换取可靠的多类绩效.
组合性:最难的概括性
构成概括意味着执行熟悉元素的新组合. 训练有素的政策"从桌子左边取杯子"和"从桌子右边取碗子"也应该处理"从桌子右边取杯子". 这要求政策学会了对象身份和空间位置的独立表示,而不是把它们纠
在实践中,大多数机器人政策学习纠
语言条件的政策 (VLA) 提供了部分缓解,因为语言指令提供了一个组成结构,该政策可以学习遵循. "取红杯"和"取蓝碗"共享动词和语法结构,鼓励模型学习对象身份是单独的变量与行动. 然而,VLA中构成概括仍然对于精确的操纵任务而言很脆弱,其中行动序列强烈依赖于特定对象几何.
衡量通用化差距:严格的协议
报告单个"通用化"数字是没有意义的,而不明确什么是变化和什么是保持不变.
| 泛化能力 Axis | Test Protocol | Typical Gap (2026) |
|---|---|---|
| Novel objects (same category) | 10 held-out objects, same task setup | 15-40% drop |
| Novel positions | Uniform random across full workspace | 10-25% drop |
| Novel backgrounds/lighting | Different room, table surface, ambient light | 25-50% drop |
| Novel object category | Different object type, same task verb | 40-70% drop |
| Compositional (object + position) | New combination of seen object and seen position | 20-45% drop |
实际上有什么帮助:根据影响排名
根据已发表的废除和RCSV自行评估的政策数据,以下是根据其影响到非分配的通用化排列的干预措施.
- **训练数据中的对象多样性 (最大影响).**每任务类别的15多个真正不同的对象的训练始终产生了最大的通用化改善. 每个额外的不同对象将通用化差距减少2-5个百分点,直到大约25-30个对象,其中回报率减少.这是最昂贵的干预和最有效的干预.
- **预训练的视觉编码器.**使用DINOv2或SigLIP作为视觉脊柱而不是从零开始训练提供了已经在数千个对象类别中普遍化的视觉功能.在操作数据上调整这些编码器,同时保持广泛的表示,在新物体上始终超过从零开始编码器10-20%.
- ** 激进的视觉增强.** 随机色调 (hue +/-0.4),随机收获 (85-100%的图像面积,改造成原始),随机亮度和对比度,以及加斯人模糊在训练期间应用.这些增强是免费的 (没有额外的数据收集成本) 并始终提供了8-15%的改善新物体和新环境评估. 它们并非替代了真正的物体多样性,
- 语言条件化. 调节任务描述 ("收拾容器") 政策而不是任务ID,迫使模型以语义意义而不是视觉模式地形行为.这对对象类别概括最有帮助,而对精确的几何概括最少.
- 训练数据中的位置多样性. 无论方向都包括40厘米以上的物体起始位置.成本是中等的 (每个集中的相同物体,不同的位置) 并且对位置概括的影响是很大的:通常是15-25%的改善.
- **多环境数据收集.**在3+个不同的物理环境 (不同表格,背景,照明) 中收集示范是对视觉分布转移的主要防御.
一般化差距的数学公式
概括差距可以被形式化为分布内和分布外预期损失之间的差距.让L(pi,D) 表示分布D上的政策 pi的预期任务损失.概括差距为G =L(pi,D_部署) -L(pi,D_train.对于一个训练有素的政策,L(pi,D_train) 是小的 (训练对象上的高成功率). 问题是,当D_deploy与D_train分离时,G的变量会有多大.
经验上,G与D_train和D_deploy之间的分布距离相比,但关系非常非线性.小变化 (相同的物体类别,不同的颜色) 生产了G的5-15%.温和变化 (相同的类别,不同的形状) 生产了G的20-40%.大变化 (不同的类别,相同的任务动词) 生产了G的40-70%. 显著的是,G可以表现出悬崖行为:性能会平稳降低到分布距离的门
悬崖效应具有机械解释. 政策的视觉编码器学习接受场模式调整到训练观测的空间频率. 当对象移动到足够远,相关的特性落在学习的受容场激活之外时,编码器的输出进入一个功能空间区域,其中政策主管没有训练信号,预测的行动基本上变得随机. 这不是渐进的降解,而是阶段过渡.
基础模型和蒸:目前的情况
机器人基础模型 (Octo, OpenVLA, pi0, RT-2-X) 通过提供在各种数据上预先训练的视觉和语义表示来解决了通用化.实际问题是它们提供了多少通用化改进,以及成本.
**零射击通用化:**基础模型在熟悉类别内在新物体中获得25%至40%的成功率,而没有任何任务特定的细节调整,而从零开始的政策则达到5-15%.这是一个有意义的改善,但对于大多数应用程序来说仍然远远远没有准备部署.
少量精细调节: 在50-100个具体任务的示范中,一个精细调节的基础模型通常与300-500个示范中训练的从头开始的政策相匹配或超过.
**
基于基础模型的概括的限制:它最适合视觉和语义概括 (看起来不同但功能相似的新物体) 和对几何和动态概括 (需要基本不同的操纵策略的新物体) 最糟糕的情况.一个看到1000个不同的杯子的基础模型将很好地概括到1,001个杯子. 对于一个滑动形状的形形象来说,操纵策略与硬容器的策略基本不同,
悬崖效应:经验证据
悬崖效应 - - 在政策绩效平稳下降到一个门
| Perturbation Type | Graceful Degradation Range | Cliff Threshold | Post-Cliff Performance |
|---|---|---|---|
| Object position offset (tabletop pick) | 0-8 cm: 85-92% success | ~10 cm from training centroid | < 20% success |
| Object orientation (grasp tasks) | 0-15 deg: 80-90% | ~25-30 deg from training orientations | < 25% success |
| Camera displacement | 0-3 cm: 75-90% | ~5 cm from calibrated position | < 30% success |
| Lighting intensity change | +/- 30% lux: 80-90% | +/- 60% lux change | < 40% success |
| Background scene change | Minor changes: 85-90% | Complete scene change (new room) | < 35% success |
| Object mass change (pour/place) | +/- 50g: 80-90% | +/- 200g from training objects | < 30% success |
这些门
苏达通用化排行榜 (2026年4月)
下面表列出了标准化评估协议的主要政策架构中最好的报告通用化结果.结果是从发表的论文和复制的评估中获取的.所有数字都是通过测试条件的成功率.
| Model | Novel Objects (same cat.) | Novel Positions | Novel Environment | Training Demos |
|---|---|---|---|---|
| ACT (from scratch) | 52% | 68% | 35% | 200 |
| ACT + DINOv2 backbone | 67% | 75% | 52% | 200 |
| Diffusion Policy | 58% | 72% | 40% | 300 |
| Octo (zero-shot) | 35% | 42% | 28% | 0 (pre-trained) |
| Octo (fine-tuned, 100 demos) | 68% | 76% | 55% | 100 |
| OpenVLA (fine-tuned, 100 demos) | 72% | 78% | 58% | 100 |
| pi0 (fine-tuned, 50 demos) | 75% | 80% | 60% | 50 |
| RoboAgent (diverse data) | 82% | 85% | 62% | 800 (diverse) |
基本的结论: (1) 基础模型细节调整可以实现与从头开始的训练相比的一般化,比较少的演示表达3-5倍. (2) 数据多样性 (RoboAgent) 在每次演示表达时仍然超过模型规模. (3) 新环境的一般化仍然是所有架构中最困难的轴,标准化评估中没有方法超过62%. (4) 基础模型背骨+多元化的细调数据 (pi0+有针对性的收集) 的组合代表了当前的实践最佳水平.
根据团队规模的实用减轻策略
根据你的团队的资源,你会采取适当的减缓策略.
单独研究人员 / 1-2 人团队. 作为出发点使用基础模型 (Octo或 OpenVLA). 收集50-100个不同的示范,至少10个不同的对象和3+的照明条件. 应用积极的视觉增强 (颜色
小实验室 / 3-10 人团队. 通过15多个对象,3多个环境和语言指导标签收集的200-500个示范模型进行基础调整.通过每一个轴进行系统评估.使用DAgger类型的数据收集来针对特定故障模式.预期的通用化:70-80%. 预算:包括硬件时间和计算.RCSV的 [2,500美元试点]
公司/生产团队. 建立一个连续的数据收集管道. 维护一个多样化的对象库 (在您的目标类别中拥有50多个对象). 收集在生产环境中,而不仅仅是实验室设置. 随着新数据积累,每周或每月进行重训. 实现在每个模型版本上运行的自动评估套件. 目标:在部署相关条件上实现85%+的通用化. 预算:每年5万至200万美元用于数据运营.RCSV的[8,000美元的运动]
总体化评估议定书
严格的通用化评估需要每轴的结构化测试组. 最少建议使用以下协议:
- ** 分开协议:** 保留20%的对象作为训练中从未使用的持久测试对象. 保留20%的工作场所位置为持久测试位置. 评估测试对象的跨产品在测试位置进行最强的通用测试.
- 最低试验数量: 运行至少20次试验,以达到统计意义. 报告成功率以 95% 的信心间隔 (威尔逊分数间隔为二项比例). 具有80%的成功率的20次试验评估具有 95% 的CI 值.
- 系统性扰乱: 除了随机进行的评估之外,单独测试特定的扰乱轴:将相机从训练位置移动5厘米;改变桌面表面 (添加桌面布,改变颜色);改变背景 (添加/移除工作空间后面的物体);改变照明 (
光向LED,添加/移除窗户光源). 这表明政策最容易受到哪些影响, - **每轴报告结果:**不要将总结结果合成单个数字.单独报告新物体成功,新物体位置成功,新环境成功和创作成功.90%的新物体位置概括和30%的新物体概括的政策需要对象多样性在培训中,而不是位置多样性.
2026年边界:什么正在改善,什么没有
机器人基础模型 (Octo, OpenVLA, pi0) 正在稳步改善在熟悉类别内新物体的零射击通用化.精细调整的基础模型和新物体评估的从头开始的政策之间的差距已从2024年的约15%扩大到2026年的25-30%,这意味着基础模型正在推进通用化基准.
没有快速改善的是:精确的几何概括 (处理真正新奇的物体形状,需要不同的把握策略),动态概括 (处理具有新奇的物理特性的物体),以及多步骤的组成概括 (执行熟悉技能的新序列).这些仍然是数据规模和模型规模尚未解决的困难问题.
RCSV的 [数据收集服务]
相关阅读
- [机器人政策概括:为什么机器人在新物体上失败]
- [机器人学习的规模规律:2026年我们所知道的东西]
- [机器人模仿学习:从示范到部署]
- [开放的X-体:改变了一切的机器人数据集]
- [活动与传播政策:何时使用哪种]
- [RCSV数据收集服务]
为了通用化而设计的数据收集
通过各种对象,各种环境和系统性评估,并通过持久的测试集来最大限度地实现政策概括.
[查看数据服务]







