开放VLA
机器人技术的视觉语言行动模型.斯坦福,伯克利,TRI,谷歌深思,MIT.
机器人操纵的开源视觉语言行动模型.
概述
开放VLA是一个7B参数视觉语言行动 (VLA) 模型,从开放X-Embodiment中训练了970K现实世界机器人示范.它结合Llama 2与融合的视觉编码器 (DINOv2 + SigLIP) 并超过RT-2-X (55B) 16.5%的性能,参数减少了7×.
建筑与培训
- 7B参数
- 拉马2脊柱+DINOv2/SigLIP视觉编码器
- 开放X体体的970K**演示
- 无机器人,零射击转移
- 消费者GPU上的LoRA细调
官方链接
T1 ) 项目网站 T2 ) 代码和培训 T3 ) 检查站的模型
引用
任何VLA都能根据自己的演示进行调整.







