机器人学习模型选择哪个?
<unk>谷机器人中心, <unk>谷机器人中心, <unk>谷机器人中心, <unk>谷机器人中心, <unk>谷机器人中心,
对于选择视觉语言行动模型 (VLA) 的研究人员和建筑师进行实际比较.
视频应用模型将感知+语言映射到行动
图像 语言 行动
机器人学习的视觉语言行动模型是开源的. 它们如何比较,以及何时使用.
建筑
OpenVLA基于Prismatic VLM,并添加了行动预测头.它支持多个机器人形态和行动空间. Octo使用基于Open X-Embodiment数据训练的变压器架构.
培训数据
开放VLA在开放X-Embodiment和额外的数据集上进行了培训.Octo在开放X-Embodiment (RT-X,桥数据,DROID等) 上进行了培训.这两个都从大规模,多元化的机器人数据中受益.查看我们的 [数据集目录]
调整
它们都支持对机器人和任务进行细节调整.通常50
选择OpenVLA的时间
- 你需要在常见的操纵任务上强大的出行性能
- 你的机器人与开放X体体 (WidowX,ALOHA等) 的机器人类似.
- 你想要一个有文档的,积极维护的模型
选择十月的时间
- 你正在尝试新型机器人形态
- 您需要最大的灵活性,以实现自定义的操作空间
- 你正在直接建立在开放的X体体数据上
收集数据用于精细调节
无论你选择哪种模型,你可能需要具体任务的示范.我们提供[数据收集服务]
读到评估是一件事 证明实用硬件的政策是另一件事.







