返回VLA Models

桥维拉

桥VLA:输入输出配合,可有效的3D操纵. 88.2% RLBench, 64% COLOSSEUM. NeurIPS 2025.

通过视觉语言模型进行高效的3D操纵学习的输入输出配合.

概述

桥VLA预先训练VLM脊柱以以2D图像作为输入和生成2D热地图作为输出,然后在投影点云成多视图时调整细节.

标准标志

  • RLBench 88.2% (从81.4%)
  • 10多个任务 95.4% 每个任务只需要3个轨迹

官方链接

  • T1) 项目网站

引用

查看BibTeX的项目网站.

任何VLA都能根据自己的演示进行调整.

收集演示片 → 运行它的硬件 → 评分一个政策 →