机器人:原始的跨机器人视频集
探索罗博网:在7台机器人和4个实验室中15万个视频框架. 下载,训练视频预测和视觉预测模型,并在1周末进行跨机器人传输.
实践者指南到RoboNet
利
| Metric | Value |
|---|---|
| Frame count | ~15,000,000 RGB video frames |
| Robots | 7 (Sawyer, Baxter, WidowX, Kuka iiwa, Franka, Fetch, Widow200) |
| Modalities | RGB video (1-4 cameras), Cartesian delta action, proprioception, gripper |
| License | MIT |
| Institutions | 4 labs (Penn, Stanford, UC Berkeley, CMU) |
| Original paper | CoRL 2019 (Dasari et al.) |
什么是机器人网?
机器人网络是第一个严
显著的是,RoboNet是一个视频预测数据集,而不是语言条件的操纵数据集.大多数集集都是自主收集的 (随机或脚本的探索在各种对象面前),而不是远程操作的专家演示. 这种设计选择使RoboNet成为了多年来对静态视频模型 (SVG,SVP,SV2P),视觉预测规划器和基于世界模型的控制的参考基准,
尽管RoboNet在原始尺寸中被Open X-Embodiment和DROID所推翻,但它仍然是最干净,最小和最具教学用性的跨机器人数据集.其方案
如何下载和加载
标准分布是Robonet维基上的HDF5片段,通过参考GitHub备用程序发送TFRecord镜子:
# Pull the reference code
git clone https://github.com/SudeepDasari/RoboNet.git
cd RoboNet && pip install -e .
# Download the HDF5 shards (see https://www.robonet.wiki/ for bucket URLs)
python robonet/datasets/download_robonet.py --output_dir ./data
# Load episodes with the built-in reader
from robonet.datasets.robonet_dataset import RoboNetDataset
ds = RoboNetDataset(
batch_size=32,
dataset_files=["./data/*.hdf5"],
hparams={"img_size": [64, 64], "load_random_cam": True},
)
for batch in ds:
print(batch["images"].shape, batch["actions"].shape, batch["states"].shape)
由于框架很小 (64x64或 128x128) , 行动向量很短,
常见使用情况和模型配对
- **视频预测基线.**SVG,SVP,FitVid和原始视觉预测堆
都使用RoboNet作为其跨机器人参考. - 基于世界模型的控制. 双对的行动/观察序列使其成为多体体设置中的梦想家式世界模型的自然试验台.
- 体体编码器研究. 因为每个碎片都标记着机器人ID,
- 教学/课程. 由于框架尺寸小,以及清洁的HDF5方案,RoboNet成为研究生机器人学习课程的默认数据集.
基准和排名表
没有封闭的排名表,但标准评估是PSNR/SSIM/LPIPS以10步的未来框架预测,根据一个持久的行动序列进行,对可见和未可见的机器人进行分别报告.
技术深度潜水:卡特西亚三角形行动和实施标识
罗博网的行动表现在2019年非常雄心勃勃.而不是记录原始的联合目标或动机命令 (这将在每个机器人之间不同),作者将每个行动映射到一个5维的卡特西亚三角形:xyz翻译加上
每条轨迹都标记着整数体现 ID,这些政策可以忽略 (学习一个通用跨机器人模型) 或条件 (利用特定机器人动态). 后者方法
视频框架存储在低分辨率 (64x64或 128x128取决于碎片) 具体来说,以便视频预测基线可以在商品硬件上运行.如果你需要更高分辨率的镜头,Open X-Embodiment和DROID都会提供全分辨率RGB,并且应该被首选于现代视觉重管道.
已知限制
- 低分辨率. 64x64或 128x128框架对于现代基于像素的政策是不可使用的.
- **自主 (非专家) 数据.**大多数轨迹都是随机探索,因此RoboNet不适合模仿学习.
- 仅从上下行动作空间. 5DoF正常化降低了
率,这限制了操纵集中的操纵集体到平面抓取. - 没有语言注释. 节目有机器人和环境身份标签,但没有自然语言,因此,
常见问题
在2026年还值得使用吗 是的,有两个原因:它仍然是跨体体视频预测的最佳教学数据集,而且它的小规模使其适合在Open X-Embodiment上太昂贵的
** 罗博网与开放X-Embodiment有什么比较?** OXE大50-100倍,包括专家示范,并发送语言注释.罗博网较小,仅基于视频,基于自主探索.它们是互补的.
我可以将RoboNet与现代动作标签数据集结合吗 是的







