桥数据V2:伯克利的可扩展操作系统
通过24个环境和13个技能下载BridgeData V2: 60,096 WidowX轨迹.
实践者指南 BridgeData V2
利
| Metric | Value |
|---|---|
| Task count | 13 skills across ~100 task variants |
| Robots | WidowX 250 6DOF arm (consumer-grade, ~$6K) |
| Modalities | RGB-D (Intel RealSense), proprioception, gripper, language instruction |
| License | CC-BY 4.0 |
| Size | 60,096 trajectories, ~400 GB raw |
| Environments | 24 scenes including toy kitchens, sinks, and tabletops |
BridgeData V2 是什么?
桥数据 V2 是UC伯克利机器人人工智能与学习实验室 (RAIL) 的原始2021年的 BridgeData发布的继承者. 它是由霍默·沃克,普拉纳夫·阿特雷亚和塞尔盖·莱文领导的共同作者构建的,以回答一个令人欺骗的简单的问题: 为了回答这个问题,RAIL团队在24场景中进行了低成本的WidowX 250 6DOF手臂的远程操作,
两项设计决定使BridgeData V2具有不成比例的影响.第一,每个轨迹都用人群资源的自然语言指令注释,而不是固定任务ID,这意味着在Bridge上训练的政策可以在推断时被定制为自由形式文本. 其次,选择了6000美元的WidowX手臂 (而不是一个Franka或UR5) 让硬件成本低到几十个后续实验室可以复制设置,
现在,BridgeData V2是Open X-Embodiment混合中最大的个人贡献之一,并且是那些想要在没有工业硬件的情况下展示现实世界的结果的论文最受欢迎的细节调整目标.OpenVLA,Octo和几种流散政策变体将BridgeData V2号码作为其正规现实世界的结果发布.
如何下载和加载
数据集是通过开放X-Embodiment桶在Google云存储中作为从伯克利的NumPy片段和RLDS分布式:
# Raw NumPy shards (~400 GB)
wget -r https://rail.eecs.berkeley.edu/datasets/bridge_release/data/demos_8_17.zip
unzip demos_8_17.zip
# Or stream the RLDS copy from OXE (recommended for VLA training)
pip install tensorflow_datasets
import tensorflow_datasets as tfds
ds = tfds.load("bridge", data_dir="gs://gresearch/robotics", split="train")
for ep in ds.take(1):
for step in ep["steps"]:
print(step["observation"]["image_0"].shape,
step["observation"]["state"].shape,
step["action"].shape,
step["language_instruction"])
# Install the reference training stack
git clone https://github.com/rail-berkeley/bridge_data_v2.git
cd bridge_data_v2 && pip install -e .
为了调整OpenVLA或Octo,请将配置指向OpenX混合中的
常见使用情况和模型配对
- 低成本VLA评估. BridgeData V2是OpenVLA和Octo的现实世界默认细节
,任何新的VLA都必须发布桥号码,以至于认真对待. - 语言条件的政策. 免费形式的说明说明使其成为了遵循说明的研究的通用数据集.
- 一般化研究. 因为同一技能在24个环境中重复,所以很容易将场景展开,并测量零镜头场景的一般化.
- ** 传播政策的基线.** 每个技能地图的~4,000集, 清洁地将其用于传播和变革政策,
基准和排名表
桥数据V2评估通常以在使用语言指令的延续集中的分布式成功率,加上在新物体/新场景组合中的分布式成功率.OpenVLA报告约70%的分布式成功率和40-50%的OOD成功率. 参见 Code BridgeData V2 文件 和 RAIL Lab 项目页面 查看可视评估协议.
技术深度潜水:方案和行动空间
BridgeData V2 剧集被存储为每轨迹目录,每个目录包含一个Python的观察片子,加上每步RGB框架和语言指令. 观测记录在5Hz (WidowX电操作循环速度) 上,包括两个RGB流,一个第三人场景摄像头和一个肩膀上腕镜头,以及英特尔RealSense深度 (在场景的子集),WidowX6维终端效应器姿势和二进制抓住器状态.
动作是7维的:卡特西亚三角形终端效应器位置 (xyz),卡特西亚三角形导向 (rpy),抓住器开/关.由于动作频率只有5Hz,BridgeData V2的政策采用4-8步的动作分量,这与扩散政策的标准分量相符. 低控制率是数据收集的好处 (电话运营商在慢速度取得更高的成功率) 和动态任务的轻微诅咒 (数据集不适合需要100ms以下的反应控制的任何东西).
语言指令通过亚马逊机械土耳其人群提供. 工人观察了每个轨迹,并写了自然语言的任务描述,这意味着指令包括字体错误,同义词和句子. 这种噪音实际上是一种功能.
已知限制
- **单个实施.**所有60K轨迹都在WidowX 250上.将桥梁训练的政策转移到Franka或UR5需要跨体现的细节调整.
- 桌面偏差. 场景大致是水槽,炉子或桌面高度的桌面.地板操纵,垂直表面和移动操纵是没有分布的.
- 低动作速度. 5 Hz对于近静态操纵是很好的,但对于倒或捕获等动态任务是不够的.
- **成功标签是
论的.**电话运营商的判断是成功的基本真理;标签成功的小部分事件实际上是部分失败.
常见问题
我需要一个WidowX才能使用BridgeData V2? 只要你想做闭环实体评估.许多团体在桥上训练,通过跨体化转移在模拟或在不同的手臂上进行评估.
BridgeData V2与BridgeData V1有什么关系? V2大约是4倍的大小,增加了12个新场景,通过更清洁的设置重新进行了大多数 V1 任务,并在每个集中发送语言注释 (V1 只有在子集中).
我可以将BridgeData V2与自己的WidowX数据结合吗 是的







