返回Datasets

机器人学:<unk>尼学模仿学习基准

探索Robomimic: 6个任务套件,每任务1000多个演示,基于robosuite和MuJoCo. 下载,重复BC-RNN和传播政策基线,并在下午1点进行基准.

实践者对Robomimic的指南 ARISE倡议的六任务基准,成为BC-RNN,BC-Transformer和传播政策评估的参考点.

Metric Value
Task suites 6 (Lift, Can, Square, Transport, ToolHang, NutAssembly)
Robots Franka Emika Panda, Rethink Sawyer (simulated in robosuite)
Modalities Low-dim state, RGB (agent + wrist camera), object poses
License MIT
Size ~1,000 demonstrations per task × 3 data qualities (PH, MH, MG)
Simulator robosuite (MuJoCo)

什么是Robomimic?

机器人操作的模仿学习实际上是什么工作的严格实验研究. 该团队收集了每个任务的示范的三个版本, 熟练的人 (PH),混合人 (MH) 和机器生成 (MG) ,然后在结果的18个组合中进行了大规模的算法扫描 (BC,BC-RNN,HBC,IRIS,BCQ,CQL和几种离线RL基线). 论文的核心贡献是表明,以历史为条件的BC (BC-RNN) 是一个显著强大的基线,

随着该论文的发布,Python包变得比基准本身更具影响力.它提供了清洁的HDF5数据格式,统一的训练循环,可配置的算法类,以及Robosuite中的确定性评估,这使得它成为过去四年任何行为克隆论文的复制最快的方式. 散政策,ACT和BeT都将Robomimic数字作为其标准的低数据基准.

罗博米奇也是LibERO的直接智力祖先. 罗博米奇保留了Robosuite场景格式和HDF5会议,并通过终身学习课程延伸它们. 如果你了解Robomimic,你已经知道80%的LIBERO管道.

如何下载和加载

罗博米米克发送了一个单行下载脚本,

# Install the framework
pip install robomimic

# Download all task suites at PH, MH, and MG quality
python -m robomimic.scripts.download_datasets \
  --tasks lift can square transport tool_hang nut_assembly \
  --dataset_types ph mh mg \
  --hdf5_types image low_dim

# Train a Diffusion Policy baseline
python -m robomimic.scripts.train \
  --config configs/diffusion_policy.json \
  --dataset datasets/square/ph/low_dim_v141.hdf5

# Evaluate the trained checkpoint in robosuite
python -m robomimic.scripts.run_trained_agent \
  --agent trained_models/.../model_epoch_2000.pth \
  --n_rollouts 50 --video_path eval.mp4

HDF5格式是自我描述的,每个轨迹包括观测,行动,奖励和对象姿势,所以你可以完全绕过机器人训练循环,并将节目输入到自己的框架中 (LeRobot,Octo,扩散器)

常见使用情况和模型配对

  • 博电子的BC基线. 博电子的BC-RNN和BC-Transformer是每一个新的模仿纸都必须击败的正规基线.
  • 散政策评估.奇的散政策论文使用Robomimic作为其主要基准,每篇后续论文都保持相同的任务列表.
  • **非线性RL比较.**MG (机器生成) 分裂是专门用于非线性RL研究的少数真正的机器人操纵数据集之一.
  • **实体课程.**由于任务基于MuJoCo,团队在转向现实数据之前通常在Robomimic Lift或Square上启动了实体机器人Franka政策.

基准和排名表

据统计,在""中,们的数据显示,们的数据是们的数据,们的数据显示,们的数据是们的数据,们的数据显示,们的数据是们的数据.

技术深度潜水:PH与MH对MG数据

罗博米奇最有用的设计决定是每个任务都在三个数据质量模式中运行. **熟练的人 (PH) **是从一个专业的远程运营商那里进行的200个示范,该任务具有广泛的实践. **混合人 (MH) **是300个示范,分为六个具有不同技能的远程运营商,这引入了轨迹形状,成功率和犹的现实异性. **机器生成 (MG) **是从一个低优的SAC代理300个发射,专门用于研究在线RL在低优的行为政策假设下.

根据CRL 2021论文的实验性观点,BC-RNN在PH数据上匹配或超过了每项任务上测试的每种离线RL方法.在MH数据上,差距缩小,但BC仍然获胜.只有在MG数据上,离线RL方法 (具体是CQL和IRIS) 超过BC,这符合理论期望,BC只能像其数据一样好. 这就是为什么传播政策和后续论文几乎总是首先报告PH和MH数字.

T2T3的观察分区是另一个微妙但重要的细节.低深度观测包括地质真相对象姿势,这使得它们比像素更容易学习. 总是报告两个数字.

已知限制

  • **仅是模拟.**所有数据都是由MuJoCo生成的.
  • **每任务的小型覆盖率.**每任务的200-300个演示是现代VLA标准来看很小的.MimicGen专门设计用于扩展Robomimic种子.
  • 没有语言指令. 任务由ID识别,而不是自然语言,因此Robomimic不能直接训练语言条件的政策.
  • 只需要Franka/Sawyer. 交叉体体转移需要与开放X体体或类似的组合.

常见问题

**现在LibERO已经存在了,Robomimic是否已经过时使用了?**不Robomimic仍然是最干净的单任务BC基准.LibERO是终身学习的基准;它们为不同的目的提供服务,并共享基础设施.

我可以使用Robomimic作为训练框架而不使用数据集吗 是的 T4 Python包在自定义数据之上被广泛使用为一般用途的BC训练循环.

** 运行BC-RNN和PH数据上的扩散政策在运输的配置中. 这需要2GPU天,并给你一个可复制的比较点.