返回VLA Models

开放VLA

机器人技术的视觉语言行动模型.斯坦福,伯克利,TRI,谷歌深思,MIT.

机器人操纵的开源视觉语言行动模型.

概述

开放VLA是一个7B参数视觉语言行动 (VLA) 模型,从开放X-Embodiment中训练了970K现实世界机器人示范.它结合Llama 2与融合的视觉编码器 (DINOv2 + SigLIP) 并超过RT-2-X (55B) 16.5%的性能,参数减少了7×.

建筑与培训

  • 7B参数
  • 拉马2脊柱+DINOv2/SigLIP视觉编码器
  • 开放X体体的970K**演示
  • 无机器人,零射击转移
  • 消费者GPU上的LoRA细调

官方链接

  • T1) 项目网站
  • T2) 代码和培训
  • T3) 检查站的模型

引用

试2025年. 查看BibTeX项目网站.

任何VLA都能根据自己的演示进行调整.

收集演示 → 运行它的硬件 → 评分一个政策 →