返回Research

机器人学习模型选择哪个?

<unk>谷机器人中心, <unk>谷机器人中心, <unk>谷机器人中心, <unk>谷机器人中心, <unk>谷机器人中心,

对于选择视觉语言行动模型 (VLA) 的研究人员和建筑师进行实际比较.

视频应用模型将感知+语言映射到行动

图像 语言 行动

机器人学习的视觉语言行动模型是开源的. 它们如何比较,以及何时使用.

建筑

OpenVLA基于Prismatic VLM,并添加了行动预测头.它支持多个机器人形态和行动空间. Octo使用基于Open X-Embodiment数据训练的变压器架构.

培训数据

开放VLA在开放X-Embodiment和额外的数据集上进行了培训.Octo在开放X-Embodiment (RT-X,桥数据,DROID等) 上进行了培训.这两个都从大规模,多元化的机器人数据中受益.查看我们的 [数据集目录]T3) 数据来源.

调整

它们都支持对机器人和任务进行细节调整.通常50500次示范可以显著提高性能.OpenVLA为不同机器人类型提供检查点.Octo的架构是灵活的,适用于新的行动空间.

选择OpenVLA的时间

  • 你需要在常见的操纵任务上强大的出行性能
  • 你的机器人与开放X体体 (WidowX,ALOHA等) 的机器人类似.
  • 你想要一个有文档的,积极维护的模型

选择十月的时间

  • 你正在尝试新型机器人形态
  • 您需要最大的灵活性,以实现自定义的操作空间
  • 你正在直接建立在开放的X体体数据上

收集数据用于精细调节

无论你选择哪种模型,你可能需要具体任务的示范.我们提供[数据收集服务]T4) 模仿学习 远程操作,学习式格式化和QA.

查看所有VLA模型 →

读到评估是一件事 证明实用硬件的政策是另一件事.

运行现实世界评估 → 委员会评估数据 → 你的评估设备的硬件 →