机器人政策概括:为什么这很难,以及2026年能发挥什么作用
机器人政策为什么不能将其整体化:分布转移的类型,从数据增强到基础模型的解决方案,
你的政策在训练对象上取得了90%的成功.你引入了新的杯子,改变了照明,把桌子移动了6英寸到左边,性能下降到30%.这是通用化问题,它仍然是实验室中的机器人学习和现实世界中机器人学习之间的核心挑战.
普遍化实际上意味着什么
机器人策略在没有在训练数据中存在的条件下成功执行任务时将其概括. 这与记忆基本不同,该策略将与特定视觉输入相关的特定运动序列复制. 总体化政策已经学到任务概念 - - 拿起容器,倒液,插入
概括不是二进制的.它存在于一个频谱上,并且概括的不同轴呈现出不同的难度.一个政策可能在对象颜色中概括得很好 (简单),但在对象形状中失败 (硬).它可能在训练工作空间中处理新的位置 (中等),但在新房间 (非常硬). 了解您的部署情况中哪些通用性轴是解决这些问题的数据收集策略的第一步.
分配转移类型
视觉分配转移发生在部署环境的视觉外观与培训不同时. 这包括照明的变化 (温暖的空头与凉爽的白天照明与混合),物体外观 (不同品牌的杯子,不同的颜色,不同的材料反射率),背景
物体分布转移发生在物体或环境的物理特性与训练不同时.在硬塑料杯子上训练的方法可能会失败在软纸杯上,因为抓取动态不同.在平滑的桌面上训练的方法可能失败在纹理的桌面上,因为摩擦系数发生变化. 通过数据增强来解决物理转变更难,因为它需要政策学习不同的物理策略,而不仅仅是识别不同的视觉模式.
任务变化发生在任务的目标或结构发生变化时.训练为将对象放置在特定目标位置的政策可能不会将对象放置在语言或手势指定的任意位置.训练为单个对象的选择和位置的政策可能会失败,当要求处理需要测序决策的多个对象的场景时. 任务变化是最难的通用化形式,通常需要语言定制或明确的任务分解架构.
有效的解决方案:数据方面方法
** 针对数据集的多样化**是提高通用化最可靠的方法.对于对象多样性,收集每个目标对象类别的至少1020个不同的实例,不同尺寸,颜色,材料和品牌的示范.对于位置多样性,在3040厘米的网格中进行不同起始位置,并包括不同的对象方向. 为了环境多样性,在收集会议中改变照明条件 (至少有3个不同的设置),桌面表面和背景
标准视觉增强 - - 颜色
域名随机化是数据多元化的模拟侧模拟.通过随机化视觉和物理参数在 [sim-to-real training]
有效的解决方案:建筑方面方法
语言条件使得通过接受自然语言指令作为输入来将政策在任务变化中概括. 训练用"挑选红杯"和"挑选蓝碗"的语言定制政策通常可以将其简化为"挑选绿瓶" - 即使在训练中没有看到绿瓶 - 因为视觉语言的定位提供了对什么要寻找的含义理解. 像RT-2,OpenVLA和Octo) 模型已经证明了对操纵任务的语言条件的通用化.
基础模型背骨提供了基于互联网规模数据训练的视觉和语义表示,使政策获得比任何机器人数据集都能提供的远远更多视觉知识. 使用[视频训练可编码器] (R3M,SPA,DINOv2) 或预训练可视语言模型 (CLIP,SigLIP) 作为政策背骨,不断提高对新物体的通用化,因为背骨已经学会识别了数千个物体类别.
分散政策架构将行动分布模型作为一种否定性传播过程,该过程自然处理多模式的行动分布 - - 同样的观察可以导致多个有效的行动.这种架构选择改善了通用化,因为政策不被迫承诺单一的行动策略,并且可以代表不同的方法对同一任务. 扩散政策在多种把握策略有效的任务上显示了特别强大的普遍化.
实际上是什么是一般化的 (什么是不一般的)
** 交通运输将其概括得很好.** 走路,运行和粗
基本的抓取可以适度得到一般化. 具有明确的抓取能力 (杯子,盒子,工具) 的硬体的选择和放置政策可以将其一般化为训练有素的类别内的新物体实例,特别是使用基础模型背骨时. 基本要求是训练中有足够的对象多样性 - 每类10次或更多的实例是通用化变得可靠的实际门
**外层操纵一般化不佳.**需要精确的指部放置,手中的重定向或接触丰富的交互 (
**长
测量一般化:做正确的
总体化应通过结构化评估协议明确测量,而不是从分布式性能推断.标准方法采用了持续的测试集:
- ** 留置物体:** 每类别保留5到10个从未在训练中使用的物体实例.这些物体应跨越您在部署中预期的视觉和几何变化范围.
- ** 已保留的位置:** 在不包括在培训分配中的物体起始位置,包括在工作场所边缘的位置和在培训中罕见的方向.
- ** 设置环境:** 如果可能,在与训练设置不同的物理设置中评估 - 不同的表,不同的照明,不同的背景.
单独报告分销和分销成功率.实现 85%分销但仅40%分销的政策具有有限的通用化,需要更多样化的培训数据或更强大的脊柱.实现 80%分销和70%分销的政策具有强大的通用化,可能可部署.
避免通过从训练中相同的分布中进行随机事件来评估通用化. 这衡量了插图,而不是通用化.真正的通用化测试需要系统地改变你希望政策在部署时处理的因素.
概括类别:四个轴
机器人学习的通用化不是单一能力. 它分成四个不同的轴,每个轴都有不同的难度水平和不同的数据要求:
| Axis | What Varies | Difficulty | Primary Mitigation |
|---|---|---|---|
| Object generalization | Color, shape, size, material within a category | Moderate | 15+ diverse object instances in training |
| Scene generalization | Lighting, background, table surface, camera angle | Moderate-Hard | 3+ environments + aggressive augmentation |
| Task generalization | Novel task instructions, new goal configurations | Hard | Language conditioning + multi-task training |
| Robot generalization | Different robot embodiment, kinematics, gripper type | Very Hard | Cross-embodiment pretraining (OXE) |
任务和机器人概括是2026年主要的研究界限 - - 通过基础模型解决,但尚未足够可靠,没有每项任务的细节调整.
为什么政策不通用:变化和分配不一致
对于通用化失败的数学解释是变化变化.一个在分布 P_train 上训练的政策在部署时遇到分布 P_deploy.当部署环境中的图像激活神经网络的功能与训练图像不同时 - 即使微妙 - - 该政策的行动预测变得不可靠. 危险是,这种失败是沉默的:政策产生了自信的行动,
机器人学习的变化更糟,
- ** 组合错误.** 单独错误标记一个图像的分类器具有有限的错误.产生一个错误的行为的政策改变了下一个观察,可能会使其远离训练分布.错误在轨道上构成几何.
- 行动分布纠
. 政策不仅学会"该做什么"而是"该从这个特定的视觉环境中做什么". - **低数据制度.**机器人数据集比计算机视觉数据集小于大小的数量. 500 个示范中训练的政策比ImageNet训练的分类器看到的图像少得多,使其功能空间对新输入更加脆弱.
基准结果:机器人代理和RT-2-X
两项基准为2026年一般化工作提供了最佳数量证据:
**RoboAgent (Bharadhwaj等,2024)**证明,在12项多样化任务上训练的单一政策 (使用图像生成模型取代对象纹理的语义增强) 在完全新型对象中取得了68%的成功,在新型环境中取得了55%的成功,而在标准行为克隆中达到40%和25%. 关键发现:通过生成增强来合成扩大视觉多样性几乎与收集来自其他环境的真实数据一样有效.
RT-2-X (来自 [开放X-体体]项目) 基于22种不同机器人体现的数据训练,在完成的通用化任务上超过了单机专家政策的约50%. 这是最强烈的证据, [数据多样性 (而不是量) 驱动了通用化.
技术:数据增强和域名随机化
操作政策培训的实用增强堆
# PyTorch augmentation pipeline for robot policy training
import torchvision.transforms as T
train_transform = T.Compose([
T.RandomResizedCrop(224, scale=(0.85, 1.0)), # position invariance
T.ColorJitter(
brightness=0.3,
contrast=0.3,
saturation=0.3,
hue=0.1 # conservative hue -- too much breaks object ID
),
T.GaussianBlur(kernel_size=5, sigma=(0.1, 2.0)),
T.RandomAdjustSharpness(sharpness_factor=2, p=0.3),
T.ToTensor(),
T.Normalize(mean=[0.485, 0.456, 0.406],
std=[0.229, 0.224, 0.225]),
])
预计从这个增强堆
技术:基础模型细节调整
精细调制预训练的基础模型 (Octo, OpenVLA, pi0) 是2026年提高通用化的唯一最有效的建筑选择.预训练的脊柱从数千个物体类别,照明条件和环境的数百万图像中学到了视觉表示. 您的任务特定细节调整数据, 只有学习行动映射, 而不是视觉理解.
实际细调方法:在训练时代的前50%时间内,将视觉编码器
按建筑物定量概括结果
根据标准化选择和地点基准,以下表列出了发表的论文和RCSV评估结果 (10项培训对象,10项持久对象,200项培训演示).
| Method | In-Distribution | Novel Objects | Novel Scene | Novel Object + Scene |
|---|---|---|---|---|
| ACT (ResNet, no augmentation) | 85% | 42% | 35% | 22% |
| ACT + augmentation | 83% | 55% | 48% | 35% |
| ACT + DINOv2 backbone | 88% | 65% | 55% | 45% |
| Diffusion Policy + augmentation | 86% | 58% | 50% | 38% |
| Octo (fine-tuned, 200 demos) | 87% | 68% | 58% | 48% |
| OpenVLA (fine-tuned, 200 demos) | 90% | 72% | 60% | 52% |
| RoboAgent (semantic aug + 12 tasks) | 88% | 75% | 62% | 55% |
关键的提升: (1) 数据增强以零收藏成本为新物体提供了10%至15%的改进 - 每个团队都应该使用它. (2) 基础模型脊椎 (DINOv2,Octo,OpenVLA) 除增强外还提供了10%至15%的改进. (3) 通过语义增强 (RoboAgent方法) 进行多任务培训,实现了最佳的整体通用化. (4) 最难的轴 - - 新的物体与新的场景相结合 - - 在所有方法中仍然低于 55%,
嵌入距离作为OOD探测器
实际检测部署观察时的可行性技术:计算观察视觉嵌入与训练嵌入中心之间的可西因距离. 如果距离超过门
# ood_detector.py -- Detect out-of-distribution observations
import torch
import numpy as np
from scipy.spatial.distance import cosine
class OODDetector:
"""Flag observations that are far from the training distribution."""
def __init__(self, encoder, training_embeddings, threshold_percentile=95):
self.encoder = encoder
# Compute centroid and distances for threshold calibration
self.centroid = training_embeddings.mean(axis=0)
train_distances = [cosine(e, self.centroid) for e in training_embeddings]
self.threshold = np.percentile(train_distances, threshold_percentile)
def is_ood(self, observation_image):
with torch.no_grad():
embedding = self.encoder(observation_image).cpu().numpy()
distance = cosine(embedding, self.centroid)
return distance > self.threshold, distance
def get_confidence(self, observation_image):
"""Return 0-1 confidence score (1 = in-distribution)."""
_, distance = self.is_ood(observation_image)
return max(0.0, 1.0 - distance / (2 * self.threshold))
在实践中,这种探测器在发生之前捕获70-85%的通用性故障.当OOD旗
跨体移植:OXE教给我们的
项目提供了最有力的证据,即在部署机器人不在训练组中,也可以通过训练使用各种机器人数据来提高通用化.RT-2-X,基于22个机器人实施体的数据进行训练,与单机机器人基线相比提高了50%的新任务通用化.
机器人并不是模型学会同时控制22个机器人.相反,跨体体训练迫使视觉编码器学习与操纵任务相关的特性 (对象身份,空间关系,抓取能力) 而不是特定于机器人的相机视角或臂 geometry的特性. 这些一般目的的视觉功能转移到新的机器人,因为它们编码了与任务相关的结构.
对于没有22个机器人的团队来说,这种实用意义:从一个跨体体预训练模型 (Octo, OpenVLA) 进行细调捕获了大部分的好处. 预先训练的模型有效地提供了"免费"的数据多样性,
空间通用化:位置和方向不变
对于对象位置概括,通常是第一个失败的概括轴,也是最容易修复的.大多数归因于"差的概括"的IL失败实际上是训练数据中的空间覆盖失败.
**工作场所覆盖要求.**对于典型的40cm x40cm桌面工作场所,培训演示应覆盖一个至少5cm的格格,即目标对象至少有64个不同的起始位置.如果演示在中心集群 (如运营商方便地放置对象时自然会这样做),则将在工作场所边界失败. 采集协议使用标记的网格位置,以确保统一的空间覆盖.
**方向多样性.**对于具有旋转不对称的物体 (工具,标签的瓶子,电子元件),每位置至少包括8个方向 (每45度绕垂直轴).对对称的物体 (杯子,球体),足够的方向是4个. 没有覆盖指导是最常见的数据收集错误,
高度变化. 如果您的部署包括不同高度的物体 (堆积物品,货架),请在训练中包括高度变化.在单个桌子高度训练的政策将失败当桌子高于2厘米或低于因为物体的视觉尺度变化,所需的接近轨迹变化.
跨体体通用化:机器人之间转移
普遍化的特殊例子是将一个机器人实施方案训练的政策部署到不同的机器人.这是Octo和OpenVLA等基础模型的承诺,并且它的工作程度取决于源和目标实施方案之间的相似性.
| Transfer Scenario | Source | Target | 零次迁移 | 50-Demo Fine-Tune |
|---|---|---|---|---|
| Same class, same gripper | WidowX 250 | ViperX 300 | 35-50% | 75-85% |
| Same class, different gripper | Franka + parallel jaw | Franka + Robotiq 2F | 15-25% | 65-78% |
| Different class, same action space | Franka | OpenArm 1 | 10-20% | 60-75% |
| Different action space | 6-DOF arm | Bimanual (ALOHA) | 0-5% | 40-55% |
RCSV客户端的实际含义: 如果您正在从一个机器人平台转换到另一个机器人平台 (例如,从WidowX升级到OpenArm 1),您的现有数据不会浪费.基于WidowX数据训练的视觉编码器仍然提供了有用的对象和场景理解.在新平台上收集50-100个示范,并调整动作头,同时保持视觉编码器冷
关键见解:视觉表示在实施体中传输良好 (预训练的视觉编码器不管机器人看到相同的物体),但行动政策在行动空间不同时传输不好.几乎总是需要通过50-100个目标体现的示范进行细节调整. 通过跨体体预训练的视觉编码器提供了通用化效益;操作头必须适应.
常见的故障模式和目标纠正
当调试通用性失败时,识别特定的失败模式指向正确的修复.
- **模式:政策接近但错失了新物体.**视觉编码器识别了物体,但对新几何学的把握策略是错误的.
- **模式:政策完全忽略了新环境中的对象.**背景视觉特性占主导地位,政策学会了将任务行为与背景线索相结合,而不是对象特征.
- 模式:政策在早上工作,但在下午失败. 该政策对照明变化敏感 (窗口灯光角度在一天内变化). 修复:添加亮度和对比度增强;在一天的多个时间收集示范;考虑只有深度输入,如果颜色不适合任务.
- **模式:政策适用于80%的持久物体,但在透明/反射物体上却不一定成功.**透明和反射物体与不透明物体产生基本不同的视觉特性.
- 模式:在工作空间中心成功,但在边缘失败. 位置概括是有限的. 修正:确保训练示范覆盖整个工作空间,重点放在边界区域;使用随机增长,在训练中改变明显物体的位置.
数据增长与实际多样性:成本效益分析
数据增强是免费的 (仅计算成本).真正的多样性需要额外的数据收集.你应该什么时候增强与收集?
| 泛化能力 Axis | Augmentation Effective? | Real Diversity Needed? | Recommendation |
|---|---|---|---|
| Lighting variation | Yes (brightness, contrast jitter) | Helpful but not required | Augment first; collect in 2-3 lighting setups if augment insufficient |
| Object color/texture | Partially (color jitter helps) | Yes, for material changes | Augment for color; collect for material/texture variation |
| Object shape/geometry | No | Yes, essential | Collect with 15+ geometrically diverse objects |
| Object position | Partially (random crop) | Yes, for workspace coverage | Collect with full workspace grid; augment for sub-grid interpolation |
| Background/environment | Partially (background randomization) | Yes, for real robustness | Augment + collect in 3+ environments |
| Grasp strategy variation | No | Yes, essential | Collect with diverse objects that require different grasp approaches |
实际规则:增强处理视觉变化 (照明,颜色,摄像头角度) 有效.物理变化需要真正的数据收集 (对象几何学,抓取策略,接触动态). 200 个多样化的演示的数据集,在视觉通用化方面,超过了 500 个未增强的数据集,但没有增加对物理物体多样性的替代品.
分布转变下的通用化:现实情况研究
了解在特定类型的分销转移下政策如何失败有助于团队优先考虑数据收集和增强策略. 以下是测量通用性性能的RCSV客户项目中的实际部署场景.
| Scenario | Training Conditions | Deployment Change | Success Rate Drop | Fix Applied |
|---|---|---|---|---|
| Warehouse bin picking | Lab with fluorescent lighting, 15 SKUs | Warehouse with skylights (variable sunlight), 50 SKUs | 92% to 54% | Aggressive color jitter augmentation + 100 on-site demos restored to 82% |
| Lab sample handling | Standard test tubes, white background | Colored reagent tubes, patterned rack | 88% to 41% | DINOv2 backbone (replacing ResNet) + 50 tube demos restored to 79% |
| Kitchen manipulation | RCSV facility kitchen, 20 utensils | Customer kitchen, different counter color, different utensil set | 85% to 62% | Multi-environment training (3 kitchens) during initial collection restored to 78% |
| Electronics assembly | Rev A board design, fixed fixture | Rev B board (shifted connector position by 3mm) | 91% to 12% | 30 new demos on Rev B + random position offset augmentation restored to 87% |
| Retail shelf stocking | Mock shelf, 10 product types | Real store shelf with price tags, adjacent products | 83% to 55% | Background randomization + OpenVLA fine-tune (language conditioning) restored to 76% |
根据这些情况的模式:每次部署都涉及分布转移. 性能下降的大小取决于部署条件与培训不同程度,并且解决方案总是涉及一些结合 (1) 改善视觉表示 (基础模型脊柱), (2) 对特定变化的轴进行数据增强,以及 (3) 针对性地收集数据. 计划从一开始开始进行分销的团队 - - 通过将多样性融入初始收藏 - - 经历了较小的下降,更快的恢复.
测量通用化:超越成功率
双向成功率是标准通用化指标,但它不包括政策稳定性的所有方面.
- **优雅的降解率.**当政策失败时,是否安全 (停止,回家) 或危险 (敲击物体,碰撞障碍)? 70% 的成功和 25% 的优雅失败的政策比 80% 的成功和 15% 的危险失败更可部署.追踪"安全"与"不安全"的失败比例.
- 复试成功率. 如果系统重置并重试,第二次尝试的成功率是多少?第一次尝试失败率高,但重试成功率高 (因为失败使系统处于可恢复状态) 的政策比指标更可部署.
- 信任校准. 如果您部署了OOD探测器 (见上述嵌入距离方法),请测量信任分数与实际成功的相关性.一个精确校准的系统可以标记不确定情况,以便人类审查,从而将通用性失败转化为人体中循环干预而不是默默错误.
- **随着时间的推移,通用化衰退.**每周或每月进行追踪.逐步降解 (随着季节变化的照明,硬件磨损,对象批量变化) 是最常见的生产故障模式,需要定期更新数据来解决.
根据最大通用化的基础模型选择
根据不同基础模型提供不同的通用化配置文件.选择取决于您的部署最重要的是哪个通用化轴.
| 基础模型 | Novel Object 泛化能力 | Novel Environment 泛化能力 | Language 泛化能力 | Compute Requirement |
|---|---|---|---|---|
| Octo (93M) | Good (+20% over ACT) | Moderate (+15%) | Basic | 1x A100 (fine-tune) |
| OpenVLA (7B) | Strong (+30% over ACT) | Strong (+25%) | Strong | 4x A100 (fine-tune) |
| ACT + DINOv2 backbone | Good (+23% over ACT) | Good (+20%) | None | 1x RTX 4090 |
| ACT + R3M backbone | Moderate (+15% over ACT) | Moderate (+12%) | None | 1x RTX 3090 |
对于具有有限计算能力的团队 (1 GPU, RTX 3090/4090),ACT与DINOv2背骨为每美元提供了最佳通用化.对于具有A100访问和语言调节要求的团队,OpenVLA细调提供了最强大的整体通用化.Octo占据了中间场:合理的通用化,适度的计算要求. 详细了解如何将这些脊椎集成到训练管道中.
根据通用化影响排列的数据增强技术
数据增强是提高通用化最便宜的方式,但并非所有增强都具有同等效果. 以下是基于RCSV对12个桌面操作任务的排名.
| Augmentation | OOD Improvement | In-Dist Impact | Compute Cost | Implementation Difficulty |
|---|---|---|---|---|
| Random crop (224 from 256) | +8-15% | -1 to +2% | Near zero | Trivial (2 lines of code) |
| Color jitter (brightness, contrast, saturation) | +5-12% | -2 to +1% | Near zero | Trivial |
| Background randomization (paste object on random bg) | +10-20% | -3 to 0% | Low | Moderate (needs segmentation mask) |
| Gaussian noise (sigma=0.02) | +2-5% | -1 to 0% | Near zero | Trivial |
| Random erasing (cutout 10-20% of image) | +3-8% | -2 to +1% | Near zero | Trivial |
| Spatial action perturbation (+/- 2mm noise on demo actions) | +5-10% | -1 to +3% | Near zero | Easy (add noise to action labels) |
随机增长,色彩
行动增强是一种未充分使用的技术:在培训期间,在示范行动标签中添加小空间噪音 (1-3mm) 作为调节剂,防止政策记忆准确的轨迹.
部署监测:检测生产的通用化幅
一旦实施政策,随着部署环境的变化,通用性失败逐渐表现出来.有效监测在影响生产可靠性之前早期发现这些失败.
- **嵌入漂移监测.**使用您的政策视觉编码器计算生产观察的平均嵌入,并将其与训练集的平均嵌入进行比较. 在成功率下降之前,它可以捕捉到视觉分布转移 (照明变化,新物体,相机的错误排列).
- 通过统计过程控制的成功率跟踪. 绘制每天的成功率在控制图表上,控制的上限和下限设置于与移动平均值的标准偏差3.低于下限的单一天会引发调查;连续两天会引发自动回归到人在循环模式. 这种方法可以检测到突然故障 (硬件问题) 和逐步降解 (环境漂移).
- **失败分类.**记录失败的事件及其视觉编码器嵌入式,并集集成失败.如果出现新的失败集群 (未符合已知的训练分布),这表明一个新型OOD条件.针对该特定失败模式的目标数据收集 (10-30个演示) 通常足以补丁空白而不需要完全重新训练.
- **定期重评.**每月运行完整的通用化评估协议 (保留物体,保留条件).与部署前的基线相比较结果.任何轴上下降超过5%会触发数据更新周期.每月预算为此重评2-4小时.
2026年实用通用化战略
对于2026年构建操纵政策的团队来说,以下是持续产生最佳通用结果的方法:
- 从基础模型背骨开始. 作为您的政策的视觉背骨,使用视频预训练或VLM预训练的视觉编码器 (DINOv2,SigLIP或R3M).
- 收集多样化,而不是大规模的示范. 200 个示范在 15 个对象实例中, 3 个照明设置和 3 个运营商将将超过 2,000 个示范将与一个对象进行通用化. 设计您的收集协议围绕多样性目标.
- 使用语言调节. 如果您的部署需要任何任务变化,请调节语言指令的政策. 这将打开构成通用化.
- ** 激进增强.** 在训练期间,应对颜色
,随机作物,亮度变化和背景增强. - ** 具体测量一般化.** 详细说明对象和条件. 报告OOD指标. 勿发送您未测量的一般化政策.
总体评估检查清单
- 每类别保留5至10个从未在训练中使用的对象实例
- 在3+个工作场所位置进行测试,不包括在培训分配中
- 评估在至少2种照明条件下,在训练期间没有看到
- 进行至少20次评估试验,以确定每种条件的统计意义
- 单独报告在分销和分销之外的成功率
- 轨道按轴的通用化 (物体,位置,照明) 独立
- 记录确切的延续集,以便结果可复制
- 在执行评估之前,而不是在执行评估后,定义通过/失败门
概括测试协议:一个完整的模板
使用此模板来对任何训练有素的操纵政策进行标准化的概括评估.协议执行需要2-3小时,并产生可发布的概括指标.
- **定义测试矩阵.**创建评估条件格: 5个分布式对象 x 3个分布式位置 = 15个分布式条件. 5个持久对象 x 3个持久对象 = 15个 OOD条件. 2个替代照明条件 x 5个对象 = 10个变光条件. 总数: 40个条件.
- **每种条件每次运行3次试验.**每种条件下执行3次政策.记录成功/失败,完成时间和任何必要的干预.总数:120次试验 (每次试验约2-3小时1-2分钟,包括重置).
- 计算指标. 在分布中成功率 (平均和95%的CI超过45项试验).OOD成功率 (平均和95%的CI超过45项试验).照明强度 (从基线下降到替代照明).通用化差距 (在分布中减去OOD率).
- 报告格式. 报告所有四个指标,并以保证间隔. 15%以下的通用化差距表明了良好的通用化. 30%以上的差距表明政策对培训分配过度适应,需要更多的多样性或增强.
根据RCSV的数据服务,我们将各种数据集团的数据集团的数据集团的数据集团的数据集团的数据集团的数据集团的数据集团的数据集团的数据集团的数据集团的数据集团 (RCSV) 数据集团的数据集团的数据集团的数据集团 (RCSV) 数据集团的数据集团的数据集团 (RCSV) 数据集团的数据集团的数据集团 (RCSV) 数据集团的数据集团 (RCSV) 数据集团的数据集团 (RCSV) 数据集团的数据集团 (RCSV) 数据集团的数据集团 (RCSV) 数据集团的数据集团 (RCSV) 数据集团的数据集团 (RCSV) 数据集团的数据集团 (RCSV) 数据集团的数据集团 (RCSV) 数据集团的数据集团 (RCSV) 数据集团) 数据集团的数据集团 (RCSV) 数据集团的数据集团 (RCSV) 数据集团) 数据集团 (RCSV) 数据集团) 数据集团 (RCSV) 数据集团) 数据集团 (RCSV) 数据集团) 数据集团 (SV) 数据集团 (SV) 数据集团) 数据集团 (SV) 数据集团 (SV) 数据集团) 数据集团 (SV) 数据集团 (SV) 数据集团 (V) 数据集团 对于帮助建立一个用于通用化的数据集,或对训练有素的政策进行评估的支持,请联系RCSV团队.
相关阅读
深度潜水:通用化挑战 · 开放X体数据集 · 机器人学习的扩展法规 · Sim-to-Real转移提示 · 学习视频 · 模仿学习指南 · 数据服务
建立一个普遍的政策
根据RCSV的数据收集协议,这些数据收集协议围绕着多样性目标进行设计,以最大限度地实现通用化.我们的标准方案 ($2,500试点 / $8,000竞选) 包括多对象,多环境,多运营商多样性,我们的评估管道包括对新物体和条件进行延续的通用化测试.
[讨论您的通用要求]







