返回Datasets

机器人:原始的跨机器人视频集

探索罗博网:在7台机器人和4个实验室中15万个视频框架. 下载,训练视频预测和视觉预测模型,并在1周末进行跨机器人传输.

实践者指南到RoboNet 1500万个框架,7机器人,4实验室数据集,

Metric Value
Frame count ~15,000,000 RGB video frames
Robots 7 (Sawyer, Baxter, WidowX, Kuka iiwa, Franka, Fetch, Widow200)
Modalities RGB video (1-4 cameras), Cartesian delta action, proprioception, gripper
License MIT
Institutions 4 labs (Penn, Stanford, UC Berkeley, CMU)
Original paper CoRL 2019 (Dasari et al.)

什么是机器人网?

机器人网络是第一个严的尝试来回答一个非常具体的问题:如果几个实验室将自主收集的机器人视频汇集在一起, 苏迪普·达萨里和宾夕法尼亚大学,斯坦福大学,伯克利大学和CMU的合作伙伴将7个不同的机器人平台的1500万个视频框架汇集起来,并将它们与统一的HDF5方案发布,这是2019年取得的显著成就,当时机器人数据集通常是实验室私人和协议特定的.

显著的是,RoboNet是一个视频预测数据集,而不是语言条件的操纵数据集.大多数集集都是自主收集的 (随机或脚本的探索在各种对象面前),而不是远程操作的专家演示. 这种设计选择使RoboNet成为了多年来对静态视频模型 (SVG,SVP,SV2P),视觉预测规划器和基于世界模型的控制的参考基准,

尽管RoboNet在原始尺寸中被Open X-Embodiment和DROID所推翻,但它仍然是最干净,最小和最具教学用性的跨机器人数据集.其方案卡特西亚三角形行动,每机器人实施标签,64x64或128x128RGB仍然是最容易在单个GPU上建立跨机器人视频预测基线的.

如何下载和加载

标准分布是Robonet维基上的HDF5片段,通过参考GitHub备用程序发送TFRecord镜子:

# Pull the reference code
git clone https://github.com/SudeepDasari/RoboNet.git
cd RoboNet && pip install -e .

# Download the HDF5 shards (see https://www.robonet.wiki/ for bucket URLs)
python robonet/datasets/download_robonet.py --output_dir ./data

# Load episodes with the built-in reader
from robonet.datasets.robonet_dataset import RoboNetDataset
ds = RoboNetDataset(
    batch_size=32,
    dataset_files=["./data/*.hdf5"],
    hparams={"img_size": [64, 64], "load_random_cam": True},
)
for batch in ds:
    print(batch["images"].shape, batch["actions"].shape, batch["states"].shape)

由于框架很小 (64x64或 128x128) , 行动向量很短,

常见使用情况和模型配对

  • **视频预测基线.**SVG,SVP,FitVid和原始视觉预测堆都使用RoboNet作为其跨机器人参考.
  • 基于世界模型的控制. 双对的行动/观察序列使其成为多体体设置中的梦想家式世界模型的自然试验台.
  • 体体编码器研究. 因为每个碎片都标记着机器人ID,
  • 教学/课程. 由于框架尺寸小,以及清洁的HDF5方案,RoboNet成为研究生机器人学习课程的默认数据集.

基准和排名表

没有封闭的排名表,但标准评估是PSNR/SSIM/LPIPS以10步的未来框架预测,根据一个持久的行动序列进行,对可见和未可见的机器人进行分别报告.

技术深度潜水:卡特西亚三角形行动和实施标识

罗博网的行动表现在2019年非常雄心勃勃.而不是记录原始的联合目标或动机命令 (这将在每个机器人之间不同),作者将每个行动映射到一个5维的卡特西亚三角形:xyz翻译加上旋转加上二进制抓住器位. 和滚动是固定的,因为大多数贡献机器人只支持了收集设置中的上下抓.这种正常化使得一个单个视频预测模型能够根据七个不同的手臂的行动进行条件.

每条轨迹都标记着整数体现 ID,这些政策可以忽略 (学习一个通用跨机器人模型) 或条件 (利用特定机器人动态). 后者方法 学习实施嵌入式 成为后续文献中的主导模式之一,直接启发了Octo中使用的数据集嵌入式和OpenVLA中的行动正常化方案.

视频框架存储在低分辨率 (64x64或 128x128取决于碎片) 具体来说,以便视频预测基线可以在商品硬件上运行.如果你需要更高分辨率的镜头,Open X-Embodiment和DROID都会提供全分辨率RGB,并且应该被首选于现代视觉重管道.

已知限制

  • 低分辨率. 64x64或 128x128框架对于现代基于像素的政策是不可使用的.
  • **自主 (非专家) 数据.**大多数轨迹都是随机探索,因此RoboNet不适合模仿学习.
  • 仅从上下行动作空间. 5DoF正常化降低了率,这限制了操纵集中的操纵集体到平面抓取.
  • 没有语言注释. 节目有机器人和环境身份标签,但没有自然语言,因此,

常见问题

在2026年还值得使用吗 是的,有两个原因:它仍然是跨体体视频预测的最佳教学数据集,而且它的小规模使其适合在Open X-Embodiment上太昂贵的除研究.

** 罗博网与开放X-Embodiment有什么比较?** OXE大50-100倍,包括专家示范,并发送语言注释.罗博网较小,仅基于视频,基于自主探索.它们是互补的.

我可以将RoboNet与现代动作标签数据集结合吗 是的 实施标签的动作方案与大多数现代VLA训练堆兼容,具有轻微的适配码.