返回Blog

机器人模拟学习指标 (2026) 的完整指南

罗博米米解释了:数据集,BC/offline-RL算法,以及机器人操纵的标准评估协议<unk>以及合成演示的MimicGen.

机器人操作任务的仿真学习和离线RL算法评估的标准基准是RoboMimic.如果你正在开发或评估一个新的政策学习方法,你的结果需要报告与RoboMimic.本指南涵盖数据集,算法,如何运行实验,以及如何使用RCSV硬件收集新的RoboMimic兼容数据.

机器人模拟是什么?

机器人模拟是通过示范进行机器人学习的框架和基准,由阿贾曼德勒加等人在斯坦福大学开发,并在CoRL 2021上发布. 它提供了三个东西:一个有不同操作员质量的示范数据集,一个模仿学习和线下RL算法实现的集合,

在RoboMimic之前,比较模仿学习论文很难,因为每个组都收集了自己的专有数据集, 据报道,一个论文声称80%的成功率可能是使用专家的简单示范,而另一个论文声称60%的新手使用混乱的示范. 数字是无法比拟的. 罗博米米奇通过提供一个固定的公共数据集,每个人都训练,使基准数字直接比较在论文和实施中.

罗博米奇使用[robosuite]T8) 模拟环境 (基于MuJoCo) 来进行评估,这意味着您可以完全没有物理硬件进行结果复制.

机器人模拟数据集

机器人模拟包括四项任务,每个任务都采用了多个数据集变体,这些变体来自不同技能水平的操作员.这种多质量结构是基准标准的最重要的设计决定:它允许您测试您的算法对数据集质量有多强大,这在实践中非常重要,因为现实数据集产生了混合质量的示范.

任务

Task Description Difficulty Demo Count
Lift Pick a small cube off a table and raise it above a height threshold Easy 200 per variant
Can Pick a soda can from a bin and place it in a designated target region Medium 200 per variant
Square Pick a square nut and fit it onto a peg — requires precise insertion alignment Hard 200 per variant
Transport Two-arm task: pick a hammer from a closed bin, transfer between arms, place in target bin Very Hard 200 per variant

数据集变体

每个任务都有四种数据集变体,反映了不同级别的操作员一致性:

  • **PH (熟练人):**一个高技能操作员成功完成每次试验,并进行一致,流的运动.
  • **MH (多人):**来自6个具有不同技能水平的运营商的示范:1个"差"运营商,3个"好"运营商,2个"更好"运营商 (PH的熟练的人).运营商采用不同的策略,成功率不同.这是最现实的数据集
  • MH子集: 单独下载MH的更糟/更好子集,让你研究质量过器如何影响性能.
  • RH (Rendered-Human): 用图像观测而不是基于状态的观测来进行视觉政策评估的示范.

对于大多数研究目的,MH数据集是最有信息性的基准,因为它测试了算法过噪音示范的能力和从多模式数据中学习的能力.在MH上高的PH,但低得点的算法具有过度适应的清洁数据问题.

文件格式和下载

机器人模拟数据集存储在HDF5格式,并使用标准方案.每个文件都以任务和操作员质量命名:

单个RoboMimic演示文件的HDF5文件结构 举起_ph__dim.hdf5 /data/ demo_0/ /obs/ robot0_eef_pos # (T,3) 终端效果器位置机器人0_eef_quat # (T,4) 终端效果器导向机器人0_gripper_qpos # (T,2) 抓住器联合位置 对象 # (T, 14) 对象姿势 +其他环境 /行动 # (T,7) 德拉EEF Pos + ori + gripper /奖励 # (T,) 按步骤回复 (节目1.0 差) /奖励 # (T,终止旗 demo_1/ ... /面具/火车 #指数为火车分拆有效 #有效分拆的指数)

文件范围从50MB (lift_ph_low_dim) 到14GB (transport_mh_image).低维度变体 (仅进行状态观测) 训练更快,足以开发算法;图像变体是视觉政策评估所需的.

算法:BC,BC-RNN,HBC和IRIS

机器人模拟将四种算法作为参考基线. 在选择训练的算法之前,必须了解每个算法的作用和时间.

行为克隆 (BC)

最简单的基线:一个反式多层感知器政策,以最小化预测和示范行动之间的MSE.观察:当前机器人状态 (和/或图像).行动:三角果效应器姿势.没有超越当前框架的时间背景. 在升降 (简单任务,多动性低) 上,BC性能相当高,但在Can和 Square上显著降低,因为它没有最近轨迹历史的记忆,无法处理示范变化.

当它工作时: 具有低变量示范,短视野 (单一抓住),没有多步骤协调要求.

**当它失败时:**任何任务,机器人需要记住刚刚完成的任务 (常见于多步骤任务),或在演示中战略不同.

BC-RNN (使用反复网络进行行为克隆)

后者是: ,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,, 具有2层LSTM的BC-RNN (每层400个隐藏单位) 是最强的标准BC基线,也是模仿学习论文中最常见的报告数.

**当它工作时:**多步骤任务,时间依赖任务,机器人需要记住之前的接触状态的任务.

**当它失败时:**具有高多模式性任务 (多个有效策略) LSTM在隐藏状态中平均跨策略,导致MH数据集中的模式平均文物.

率性行为克隆 (HBC)

两级级层次的层次结构:一个高级"规划者"预测了子目标状态 (例如机器人的中间配置),而一个低级"控制者"学习到达每个子目标.层次结构提供了一个帮助长视界任务的诱导结构. 总体来说,HBC在运输和广场上比BC-RNN (长视界任务) 优于,但需要更仔细的超参数调整,特别是子目标视界长.

置物 (置物) 产品

IRIS通过改进的子目标表示学习扩展了HBC. IRIS不预测原始机器人状态的子目标,而是学习了更抽象和更容易为规划者使用的工作空间状态的隐藏表示.它使用VAE从示范数据中学习子目标隐藏空间. IRIS可以通过测试数据来测试下载的数据,并将其用于测试数据. IRIS可以通过测试数据来测试下载的数据,并将其用于测试数据. IRIS可以通过测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试. IRIS在全类RoboMimic基准指标上实现了四个参考算法中最强的结果,特别是在MH (混合人类质量) 数据集中,其子目标结构为示范变化提供了强性.

添加外部算法到RoboMimic

根据RoboMimic的框架,可以直接添加自己的算法作为一个新的"algo"类. 扩散政策,ACT和最新的模仿学习方法已经适应使用RoboMimic数据格式和评估协议. 实现了标准化观察定律并返回了三角果终端效应器的T1接口T2方法.RCSV在内部平台中维护了对扩散政策和ACT的RoboMimic包装.

如何运行机器模拟实验

装载RoboMimic pip安装robomimic # 或从源头来最新版本的 git klone T18 cd robomimic && pip安装 -e . # 装载robosuite (模拟环境) 装载robosuite # 下载数据集 (例如:升级,熟练的人类,低维度观测) python robomimic/scripts/download_datasets.py \ --tasks lift \ --dataset_types \ --hdf5_types low_dim # 生成一个训练 python robomimic/scripts/generate_configs.py \ --algo bc_r_agent -- -- 升级任务_type phimim \ \ 类型_types \ \ \ _type \ \ \ _type \ \ \ \ _type \ \ \ \ _type \ \ \ \ _type \ \ \ \ _type \ \ \ \ _type \ \ \ \ _type \ \ \ \ _type \ \ \ _type \ \ \ \ _type \ \ \ \ _type \ \ \ \ _type \ \ _type \ \ \ \ _type \ \ \ \ \ \ \ _type \ \ \ _type \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \

通过单个RTX 3090来训练BC-RNN在升降PH低度上需要约30分钟.对图像观测的训练需要46小时.运输MH图像是最长的训练运行时间.

关键配置参数

Parameter Default Notes
train.num_epochs 2000 200 demos × 2000 epochs = ~400k gradient steps; sufficient for low-dim tasks
train.batch_size 100 Increase to 256 or 512 for image tasks if VRAM allows
algo.rnn.hidden_dim 400 For BC-RNN; larger values help on complex tasks but slow training
observation.encoder.core_kwargs.feature_dim 64 For image tasks; feature dimension from ResNet encoder
experiment.rollout.n 50 Number of evaluation rollouts — 50 is the standard; do not reduce below 20

参考基准结果

下面的成功率来自原始的RoboMimic论文 (Mandlekar等,2021) 以及随后的社区更新. 这些是您的算法应该与这些数字进行测量.

Task / Split BC BC-RNN HBC IRIS
Lift PH (low-dim) 100% 100% 100% 100%
Lift MH (low-dim) 98% 100% 100% 100%
Can PH (low-dim) 92% 100% 100% 100%
Can MH (low-dim) 12% 48% 36% 74%
Square PH (low-dim) 70% 80% 100% 98%
Square MH (low-dim) 0% 2% 10% 50%
Transport PH (low-dim) 0% 22% 88% 98%
Transport MH (low-dim) 0% 6% 22% 58%

最有教导性的比较是Can MH:BC从92% (PH) 下降到12% (MH),而IRIS仅从100%下降到74%.这个差距"MH降解"是关键基准信号.一个维持MH性能的算法正在学习过低质量的示范和处理多模数据,这直接预测现实世界性能,而无法保证操作员质量.

RCSV 硬件兼容性

对于物理机器人传输,RCSV支持在 [OpenArm Base]T9) 和AgileX PiPER臂上收集机器人传输数据,这两者都使用相同的7DOF三角果端效应器行动空间作为机器人传输参考实现.

根据任务,在模拟器件的模拟数据传输率中,模拟器件数据传输率约为60~75%;根据任务,在模拟器件的物理数据传输率中,实践的政策是很清楚的. 斯威尔士国家安全委员会 (RCSV) 的方法是使用RoboMimic Sim实验来选择算法和超参数搜索,然后收集物理示范用于最终部署政策.

收集自定义的机器人模拟兼容数据集

如果您想将您的算法进行自定义任务 (不是四个默认任务之一),RoboMimic的数据收集框架允许您在Robosuite中创建新的任务,并通过空间鼠标远程操作收集示范.HDF5方案已记录,您也可以将物理机器人示范转换为RoboMimic格式.

RCSV 的 [数据收集服务]T10) 支持定制的RoboMimic任务创建和示范收集.我们为制药实验室客户 (精密处理液体,样品分类),电子组装客户 (连接器插入,PCB处理) 和学术实验室 (开发算法的定制操纵场景) 进行了定制的RoboMimic基准任务. 数据集是与 RoboMimic 训练脚本兼容的 HDF5 格式提供,不需要转换格式.

针对自定义的RoboMimic任务的标准RCSV数据集包包括:由一个训练有素的操作员进行200个PH示范,由不同技能水平的3个操作员进行200个MH示范 (以实现MH基准),以及与您的物理任务几何学相匹配的自定义的机器人环境定义. 转换期通常是23周. [联系我们]T11)

相关阅读

  • 在许多机器人模拟任务中,超过IRIS的算法
  • ALOHA 的算法;可在 RoboMimic 上使用适配器进行比较
  • T14) 机器人模拟学习平台比较
  • RCSV基准 随着RCSV定制评估而获得的机器人模拟结果