开放X-Embodiment与DROID:你应该使用哪个机器人数据集?
开放X-Embodiment与DROID:轨迹规模,实施例,数据格式,许可证和训练计算相比. 在2026年选择合适的基础模型机器人数据集.
开放X-Embodiment和DROID是2026年最大的开放机器人学习数据集.它们位于设计谱的相反端:开放X-Embodiment是一个由22种不同机器人类型的33个研究实验室组建的联合大团队,而DROID是一个单体,单协议数据集,在数百个真实场景中收集在一个Franka Panda上. 根据你是否关心量度为重新训练或一致性为精细调节而决定使用哪个.
利
- ** 粗轨迹数量:** 开放X-Embodiment赢得了
1M+集与DROID的 ~76K. - 体体多样性: 开放X-体赢得了22种机器人类型与DROID的单一的弗兰卡潘达.
- 每轨道的场景多样性: DROID在13个机构中获得了564场景,
- 数据一致性: DROID 通过大差距获胜
相同的硬件,相同的摄像头设备,相同的集体格式. - ** 简单的培训政策:** DROID 获胜
不需要跨体现行动正常化. - ** 基础模型的训练方便:** 开放X体
这是RT-X建立在之上的.
面对面的比较表
| Attribute | Open X-Embodiment | DROID |
|---|---|---|
| Released | Oct 2023 (Google DeepMind + 33 partners) | Mar 2024 (Stanford / UC Berkeley / TRI + 13 partners) |
| Trajectories | 1,000,000+ episodes | ~76,000 trajectories (~350 hours) |
| Embodiments | 22 robot types (Franka, Google Robot, xArm, WidowX, UR5, etc.) | 1 (Franka Emika Panda with parallel-jaw gripper) |
| Scenes / environments | Mix of labs and uncontrolled environments | 564 scenes across 13 institutions |
| Collection duration | Aggregate of many prior datasets (years) | ~18 months of coordinated collection |
| Cameras | Varies by source dataset | 2x ZED 2 stereo + 1x ZED Mini wrist (consistent) |
| Format | Unified RLDS (TensorFlow Datasets) | RLDS + HDF5; also on HuggingFace / LeRobot |
| Approx. size on disk | Multiple TB (varies by component) | ~1.7 TB raw |
| License | Per-component (mostly CC-BY and Apache-2.0) | MIT + CC-BY-4.0 |
| Reference models | RT-1-X, RT-2-X, OpenVLA, Octo | DROID diffusion policies; used by pi0, OpenVLA fine-tunes |
| Paper | arXiv:2310.08864 | arXiv:2403.12945 |
设计哲学的差距
开放X-Embodiment (OXE) 是一个规模化实验:如果我们把每个开放操作数据集集集结成到一个标准化的格式中,我们可以培训一个单一的政策,将转移到22个不同的机器人? 轨迹在质量,摄像头设备,照明,动作频率和抓住器规范方面有很大的不同;
德罗伊德采用了相反的方法.而不是汇集异质数据,德罗伊德标准化了单个硬件设备 (弗兰卡·潘达,两个ZED 2摄像头,一个ZED 迷你挂在手腕上) 并将其运送到13个研究机构.在大约18个月内,这些实验室收集了大约76,000个处于办公室,厨房,实验室,走廊和家庭的野生轨迹. 每个轨道都有相同的观测形状,相同的行动公约,相同的语言注释格式. 这使得DROID比OXE更容易训练,并且在更清洁的细节中获得回报.
什么时候训练
在OXE上训练,如果你正在构建一个通用化跨体现政策.RT-X和OpenVLA 是存在证明,OXE规模预训练解锁了任何单个体现数据集无法的行为.如果你打算如何调整自己的体现,OXE给你最大的可能的预测.
DROID的精细调节,如果你的目标硬件是Franka Panda或相当的7DoF臂,或者你正在训练一个扩散政策,并希望具有一致的抓住语义的高质量行动标签.
**如果您有计算能力,请做两件事.现在的标准配方是"OXE预训练,DROID细调,任务演示细调-2." 这就是[pi0和几项2025的人类型的政策]
训练所需的计算
开放VLA尺度 (7B参数) 的OXE预训练最初使用了64 A100 GPU 约两周.这是一笔实际的资本成本.在公共云上,这个成本约为100万美元.如果你只想调整一个预训练的检查点,一个8xA100或8xH100节点为一两天是典型的. 由于数据集规模较小,因此可以在1-4个GPU上进行DROID细节调节;许多团队在单个8x3090工作站上训练了完整的DROID扩散政策.
为了推断,两个数据集都会产生在消费者GPU上舒适运行的政策.除非有特定的研究原因,否则我们不建议从零开始训练任何数据集.
许可:阅读细笔
欧克斯是单一的许可证.它是一个组件数据集的注册表,每个组件都有自己的条款.大多数组件是CC-BY-4.0或Apache-2.0,这意味着你可以训练商业模型和运输衍生品重量.少数组件仅用于研究;如果你正在构建产品,请根据你的法律立场审核组件清单. 对于数据来说,DROID是简单的
数据格式和工具
两套数据集都使用RLDS作为定律格式,并且两套都通过LeRobot生态系统在HuggingFaceHub上反映.如果你从2026年开始,LeRobot是最少抵抗的路径.它给你一个均
值得知道的东西
**OXE 操作空间不相同.**即使在共享的RLDS方案中,不同的组件使用不同的操作规范 (终效应对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对对
**DROID手腕摄像头是低分辨率的.**手腕ZED Mini提供720p立体音频;场景摄像头提供1080p.大多数现代VLA架构无论如何都会减少样本,但如果你正在训练一个高分辨率的感知模型,请注意天花板.
**两者都有类失衡.**OXE由少数大型组件 (尤其是谷歌机器人数据集) 占主导地位.
评估:各个政策的培训如何进行比较?
当OpenVLA发布时,其排放包括在OXE,DROID和OXE+DROID上训练的检查站.在分布式DROID任务上,DROID检查站与OXE仅有竞争力,有时更好.在分布式外评估 (未见的场景或物体) 上,OXE检查站进一步普遍化.组合的OXE+DROID检查站比这两点都更好. 这就是现已标准的"OXE预训练,DROID细调"配方的经验基础,
长尾行为中差距特别明显.单独的DROID可靠地处理标准的选择和位置,但在分布之外的任何事情上都很难处理.单独的OXE处理更广泛的任务,但产生更
存储,流媒体和实际下载
接下来,我们将使用了全文的OXE体格. 接下来,我们将使用了全文的OXE体格. 接下来,我们将使用了全文的OXE体格. 如果您正在工作在一个较小的平台上,HuggingFace LeRobot 分布了一个预处理的100轨迹DROID子组 (DROID-100),在您承诺完成完整的推电之前,它非常适合原型管道.
我们建议的
对于大多数团队在2026年建立可部署的操纵政策的建议是:从OXE预训练的OpenVLA或 pi0检查点开始,微调 DROID以稳定行动分布,然后再微调您自己的任务特定的远程操作数据. 如果您仍然选择硬件,Franka Panda是DROID兼容性的明显选择,但如果您计划依靠BridgeData,则WidowX臂也会很好地工作.
相关资源
- [开放X-Embody数据集页面]
- 关于"
"的数据集 - [LIBERO与CALVIN基准比较]
,我认为这是一个非常重要的问题. - [2026年最好的机器人学习数据集]
- [VLA和政策模式目录]
- 现在,我们在
车上.







