机器人学:<unk>尼学模仿学习基准
探索Robomimic: 6个任务套件,每任务1000多个演示,基于robosuite和MuJoCo. 下载,重复BC-RNN和传播政策基线,并在下午1点进行基准.
实践者对Robomimic的指南
利
| Metric | Value |
|---|---|
| Task suites | 6 (Lift, Can, Square, Transport, ToolHang, NutAssembly) |
| Robots | Franka Emika Panda, Rethink Sawyer (simulated in robosuite) |
| Modalities | Low-dim state, RGB (agent + wrist camera), object poses |
| License | MIT |
| Size | ~1,000 demonstrations per task × 3 data qualities (PH, MH, MG) |
| Simulator | robosuite (MuJoCo) |
什么是Robomimic?
机器人操作的模仿学习实际上是什么工作的严格实验研究. 该团队收集了每个任务的示范的三个版本, 熟练的人 (PH),混合人 (MH) 和机器生成 (MG)
随着该论文的发布,Python包变得比基准本身更具影响力.它提供了清洁的HDF5数据格式,统一的训练循环,可配置的算法类,以及Robosuite中的确定性评估,这使得它成为过去四年任何行为克隆论文的复制最快的方式.
罗博米奇也是LibERO的直接智力祖先. 罗博米奇保留了Robosuite场景格式和HDF5会议,并通过终身学习课程延伸它们. 如果你了解Robomimic,你已经知道80%的LIBERO管道.
如何下载和加载
罗博米米克发送了一个单行下载脚本,
# Install the framework
pip install robomimic
# Download all task suites at PH, MH, and MG quality
python -m robomimic.scripts.download_datasets \
--tasks lift can square transport tool_hang nut_assembly \
--dataset_types ph mh mg \
--hdf5_types image low_dim
# Train a Diffusion Policy baseline
python -m robomimic.scripts.train \
--config configs/diffusion_policy.json \
--dataset datasets/square/ph/low_dim_v141.hdf5
# Evaluate the trained checkpoint in robosuite
python -m robomimic.scripts.run_trained_agent \
--agent trained_models/.../model_epoch_2000.pth \
--n_rollouts 50 --video_path eval.mp4
HDF5格式是自我描述的,每个轨迹包括观测,行动,奖励和对象姿势,所以你可以完全绕过机器人训练循环,并将节目输入到自己的框架中 (LeRobot,Octo,扩散器)
常见使用情况和模型配对
博电子的BC基线. 博电子的BC-RNN和BC-Transformer是每一个新的模仿纸都必须击败的正规基线. 散政策评估. 奇的 散政策论文使用Robomimic作为其主要基准,每篇后续论文都保持相同的任务列表. - **非线性RL比较.**MG (机器生成) 分裂是专门用于非线性RL研究的少数真正的机器人操纵数据集之一.
- **实体课程.**由于任务基于MuJoCo,团队在转向现实数据之前通常在Robomimic Lift或Square上启动了实体机器人Franka政策.
基准和排名表
据统计,在"
技术深度潜水:PH与MH对MG数据
罗博米奇最有用的设计决定是每个任务都在三个数据质量模式中运行. **熟练的人 (PH) **是从一个专业的远程运营商那里进行的200个示范,该任务具有广泛的实践. **混合人 (MH) **是300个示范,分为六个具有不同技能的远程运营商,这引入了轨迹形状,成功率和犹
根据CRL 2021论文的实验性观点,BC-RNN在PH数据上匹配或超过了每项任务上测试的每种离线RL方法.在MH数据上,差距缩小,但BC仍然获胜.只有在MG数据上,离线RL方法 (具体是CQL和IRIS) 超过BC,这符合理论期望,BC只能像其数据一样好. 这就是为什么传播政策和后续论文几乎总是首先报告PH和MH数字.
已知限制
- **仅是模拟.**所有数据都是由MuJoCo生成的.
- **每任务的小型覆盖率.**每任务的200-300个演示是现代VLA标准来看很小的.MimicGen专门设计用于扩展Robomimic种子.
- 没有语言指令. 任务由ID识别,而不是自然语言,因此Robomimic不能直接训练语言条件的政策.
- 只需要Franka/Sawyer. 交叉体体转移需要与开放X体体或类似的组合.
常见问题
**现在LibERO已经存在了,Robomimic是否已经过时使用了?**不
我可以使用Robomimic作为训练框架而不使用数据集吗 是的
** 运行BC-RNN和PH数据上的扩散政策在运输的配置中. 这需要2GPU天,并给你一个可复制的比较点.







