机器人模拟学习指标 (2026) 的完整指南
罗博米米解释了:数据集,BC/offline-RL算法,以及机器人操纵的标准评估协议<unk>以及合成演示的MimicGen.
机器人操作任务的仿真学习和离线RL算法评估的标准基准是RoboMimic.如果你正在开发或评估一个新的政策学习方法,你的结果需要报告与RoboMimic.本指南涵盖数据集,算法,如何运行实验,以及如何使用RCSV硬件收集新的RoboMimic兼容数据.
机器人模拟是什么?
机器人模拟是通过示范进行机器人学习的框架和基准,由阿贾曼德勒加等人在斯坦福大学开发,并在CoRL 2021上发布. 它提供了三个东西:一个有不同操作员质量的示范数据集,一个模仿学习和线下RL算法实现的集合,
在RoboMimic之前,比较模仿学习论文很难,因为每个组都收集了自己的专有数据集, 据报道,一个论文声称80%的成功率可能是使用专家的简单示范,而另一个论文声称60%的新手使用混乱的示范. 数字是无法比拟的. 罗博米米奇通过提供一个固定的公共数据集,每个人都训练,使基准数字直接比较在论文和实施中.
罗博米奇使用[robosuite]
机器人模拟数据集
机器人模拟包括四项任务,每个任务都采用了多个数据集变体,这些变体来自不同技能水平的操作员.这种多质量结构是基准标准的最重要的设计决定:它允许您测试您的算法对数据集质量有多强大,这在实践中非常重要,因为现实数据集产生了混合质量的示范.
任务
| Task | Description | Difficulty | Demo Count |
|---|---|---|---|
| Lift | Pick a small cube off a table and raise it above a height threshold | Easy | 200 per variant |
| Can | Pick a soda can from a bin and place it in a designated target region | Medium | 200 per variant |
| Square | Pick a square nut and fit it onto a peg — requires precise insertion alignment | Hard | 200 per variant |
| Transport | Two-arm task: pick a hammer from a closed bin, transfer between arms, place in target bin | Very Hard | 200 per variant |
数据集变体
每个任务都有四种数据集变体,反映了不同级别的操作员一致性:
- **PH (熟练人):**一个高技能操作员成功完成每次试验,并进行一致,流
的运动. - **MH (多人):**来自6个具有不同技能水平的运营商的示范:1个"差"运营商,3个"好"运营商,2个"更好"运营商 (PH的熟练的人).运营商采用不同的策略,成功率不同.这是最现实的数据集
- MH子集: 单独下载MH的更糟/更好子集,让你研究质量过
器如何影响性能. - RH (Rendered-Human): 用图像观测而不是基于状态的观测来进行视觉政策评估的示范.
对于大多数研究目的,MH数据集是最有信息性的基准,因为它测试了算法过
文件格式和下载
机器人模拟数据集存储在HDF5格式,并使用标准方案.每个文件都以任务和操作员质量命名:
单个RoboMimic演示文件的HDF5文件结构 举起_ph__dim.hdf5 /data/ demo_0/ /obs/ robot0_eef_pos # (T,3) 终端效果器位置机器人0_eef_quat # (T,4) 终端效果器导向机器人0_gripper_qpos # (T,2) 抓住器联合位置 对象 # (T, 14) 对象姿势 +其他环境 /行动 # (T,7) 德拉EEF Pos + ori + gripper /奖励 # (T,) 按步骤回复 (节目1.0 差) /奖励 # (T,终止旗 demo_1/ ... /面具/火车 #指数为火车分拆有效 #有效分拆的指数)
文件范围从50MB (lift_ph_low_dim) 到14GB (transport_mh_image).低维度变体 (仅进行状态观测) 训练更快,足以开发算法;图像变体是视觉政策评估所需的.
算法:BC,BC-RNN,HBC和IRIS
机器人模拟将四种算法作为参考基线. 在选择训练的算法之前,必须了解每个算法的作用和时间.
行为克隆 (BC)
最简单的基线:一个反
当它工作时: 具有低变量示范,短视野 (单一抓住),没有多步骤协调要求.
**当它失败时:**任何任务,机器人需要记住刚刚完成的任务 (常见于多步骤任务),或在演示中战略不同.
BC-RNN (使用反复网络进行行为克隆)
后者是:
**当它工作时:**多步骤任务,时间依赖任务,机器人需要记住之前的接触状态的任务.
**当它失败时:**具有高多模式性任务 (多个有效策略)
率性行为克隆 (HBC)
两级级层次的层次结构:一个高级"规划者"预测了子目标状态 (例如机器人的中间配置),而一个低级"控制者"学习到达每个子目标.层次结构提供了一个帮助长视界任务的诱导结构. 总体来说,HBC在运输和广场上比BC-RNN (长视界任务) 优于,但需要更仔细的超参数调整,特别是子目标视界长.
置物 (置物) 产品
IRIS通过改进的子目标表示学习扩展了HBC. IRIS不预测原始机器人状态的子目标,而是学习了更抽象和更容易为规划者使用的工作空间状态的隐藏表示.它使用VAE从示范数据中学习子目标隐藏空间. IRIS可以通过测试数据来测试下载的数据,并将其用于测试数据. IRIS可以通过测试数据来测试下载的数据,并将其用于测试数据. IRIS可以通过测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试数据,测试. IRIS在全类RoboMimic基准指标上实现了四个参考算法中最强的结果,特别是在MH (混合人类质量) 数据集中,其子目标结构为示范变化提供了强
添加外部算法到RoboMimic
根据RoboMimic的框架,可以直接添加自己的算法作为一个新的"algo"类. 扩散政策,ACT和最新的模仿学习方法已经适应使用RoboMimic数据格式和评估协议. 实现了标准化观察定律并返回了三角果终端效应器的
如何运行机器模拟实验
装载RoboMimic pip安装robomimic # 或从源头来最新版本的 git klone
通过单个RTX 3090来训练BC-RNN在升降PH低
关键配置参数
| Parameter | Default | Notes |
|---|---|---|
train.num_epochs |
2000 | 200 demos × 2000 epochs = ~400k gradient steps; sufficient for low-dim tasks |
train.batch_size |
100 | Increase to 256 or 512 for image tasks if VRAM allows |
algo.rnn.hidden_dim |
400 | For BC-RNN; larger values help on complex tasks but slow training |
observation.encoder.core_kwargs.feature_dim |
64 | For image tasks; feature dimension from ResNet encoder |
experiment.rollout.n |
50 | Number of evaluation rollouts — 50 is the standard; do not reduce below 20 |
参考基准结果
下面的成功率来自原始的RoboMimic论文 (Mandlekar等,2021) 以及随后的社区更新. 这些是您的算法应该与这些数字进行测量.
| Task / Split | BC | BC-RNN | HBC | IRIS |
|---|---|---|---|---|
| Lift PH (low-dim) | 100% | 100% | 100% | 100% |
| Lift MH (low-dim) | 98% | 100% | 100% | 100% |
| Can PH (low-dim) | 92% | 100% | 100% | 100% |
| Can MH (low-dim) | 12% | 48% | 36% | 74% |
| Square PH (low-dim) | 70% | 80% | 100% | 98% |
| Square MH (low-dim) | 0% | 2% | 10% | 50% |
| Transport PH (low-dim) | 0% | 22% | 88% | 98% |
| Transport MH (low-dim) | 0% | 6% | 22% | 58% |
最有教导性的比较是Can MH:BC从92% (PH) 下降到12% (MH),而IRIS仅从100%下降到74%.这个差距
RCSV 硬件兼容性
对于物理机器人传输,RCSV支持在 [OpenArm Base]
根据任务,在模拟器件的模拟数据传输率中,模拟器件数据传输率约为60~75%;根据任务,在模拟器件的物理数据传输率中,实践的政策是很清楚的. 斯威尔士国家安全委员会 (RCSV) 的方法是使用RoboMimic Sim实验来选择算法和超参数搜索,然后收集物理示范用于最终部署政策.
收集自定义的机器人模拟兼容数据集
如果您想将您的算法进行自定义任务 (不是四个默认任务之一),RoboMimic的数据收集框架允许您在Robosuite中创建新的任务,并通过空间鼠标远程操作收集示范.HDF5方案已记录,您也可以将物理机器人示范转换为RoboMimic格式.
RCSV 的 [数据收集服务]
针对自定义的RoboMimic任务的标准RCSV数据集包包括:由一个训练有素的操作员进行200个PH示范,由不同技能水平的3个操作员进行200个MH示范 (以实现MH基准),以及与您的物理任务几何学相匹配的自定义的机器人环境定义. 转换期通常是2
相关阅读
在许多机器人模拟任务中,超过IRIS的算法 ALOHA 的算法;可在 RoboMimic 上使用适配器进行比较 T14 ) 机器人模拟学习平台比较 - RCSV基准
随着RCSV定制评估而获得的机器人模拟结果







