返回VLA Models

最好的VLA模型2026:完整的视觉语言行动指南

2026年机器人业务的8个最佳视觉语言行动模型:OpenVLA,Octo,pi0,RT-X,Diffusion Policy,ACT 根据许可证,硬件和适应符号排名.

我们实际上推的2026年8种视觉语言行动和模仿学习模型,

更新于2026年4月 8个车型排名 开放权重优先级

浏览所有模型 获取建议

TL;DR 我们2026年排名最好的选项: 1. OpenVLA (最佳全方位开放式VLA) · 2. Octo (最佳紧式传播政策) · 3. pi0 (最佳物理智能发布) · 4. RT-1-X (最佳小历史基线) · 5. 传播政策 (最佳模仿学习算法多模特演示) · 6. ACT (最佳双手机电话) · **7. 国际化技术 (SmartVLA) (最好的轻量级VLA在LeRobot雨下).

2026年什么会使VLA模型成为"最好的"模型?

现在,OpenVLA,Octo,pi0,InternVLA-M1以及十几种研究变体都在运输开放权重,问题是哪种模型适合 _your_部署.我们在五个实用轴中排名模型:

  • ** 开放权重和许可证.** 你能下载,调整,并商业运输它吗?
  • 机器的脚印. 它是否运行在单个A100?A4090?一个边框?这决定了你的BOM.
  • 语言忠诚. 它如何遵循自由形式的指示,而不是崩到训练时间的短语?
  • ** 精细调节成本.** 你能在一天内适应机器人吗?
  • 生产成熟度. 有没有LoRA食谱,量化变体和运输解决的社区?

2026年排名

  1. 开放式VLA 最好的开放式VLA基础

体A100级GPU

2026年默认的VLA.Llama-2 7B脊柱,DINOv2 + SigLIP视觉,微妙的行动代币,训练在970K开放X-体体轨迹上.在 LIBERO上超过RT-2-X,参数减少7x.积极的社区运输LoRA适配器和量化变体.查看[OpenVLA模型页面]T2) 或[OpenVLA与Octo比较]T3).

消费者GPU 27M / 93MMITOpen X-Embodiment

变压器扩散政策从零开始训练在 ~ 800K 开放X轨道上.在单个RTX 4090上运行在 2030Hz.灵活的行动空间,目标图像调整和简单的细节调整.当你无法买下7B模型时,这是一个精简的替代方案.

  1. 下一代最好的一般学家

几亿元部分开放Custom corpus

物理智能公司旗舰总理VLA引入了一个与流量匹配的行动头,并专注于精巧的,长视界任务.堆和检查点的部分已经向社区发布.在发布的演示中强烈地布和家庭级操纵.对于任何精巧或人形部署来看待值得的模型.

  1. 最好的小历史基线

~35MApache 2.0开放X-Embodiment单个GPU

开放X体重训RT-1.小,快速,跨体.研究论文的可信轻量级基线.对于产品部署,更喜欢Octo ,但RT-1-X仍然是正规的历史参考.查看 [RT-X]T5).

  1. 多模式演示的最佳模仿学习

美国CNN/变压器脊柱MITDDPM行动头

哥伦比亚大学的传播政策是专家示范多模式时的基准. 发布时平均改善了46.9%的先前模仿学习方法.自然适合接触丰富的操纵和任何平均策略会崩的环境.

  1. 双手通讯的最佳模仿学习

转变器CVAEMITA 动作碎片

通过移动ALOHA. 随着时间组合的零碎行动预测. 在单个GPU上在几分钟内进行训练,只使用50次演示,并且仍然是双手机电话训练的主导起点. 作为参考政策,在LeRobot中运送. 查看 ACT政策解释者.

开放权重MITGrounding + 行动

上海AI实验室的两阶段VLA,在预测行动之前使用空间定位作为中间表示.在Google机器人上报告了71.81%和LIBERO上95.9%,这是2025年发布的最强大的开放权重数字之一.参见[InternVLA-M1]T9).

  1. 雷罗伯特生态系统中最轻量级的VLA

面部

拥抱面孔的紧VLA在LeRobot框架下发布.设计用于笔记本电脑和爱好级机器人运行,通过LeRobot的管道进行集成数据加载和训练.如果你想要一个没有数据中心GPU运行的VLA,这是一个很好的入口点.

边缘总结

Model Params License Action head Hardware Best for
OpenVLA 7B MIT Discretized tokens A100/H100 Language-grounded manipulation
Octo 27M / 93M MIT Diffusion RTX 4090 Cross-embodiment, high freq
pi0 Multi-B Partial Flow matching Multi-GPU Dexterous long-horizon
RT-1-X ~35M Apache 2.0 Discretized tokens Single GPU Small historical baseline
Diffusion Policy Configurable MIT DDPM chunks Single GPU Multi-modal imitation
ACT Configurable MIT CVAE chunks Single GPU Bimanual teleop
InternVLA-M1 Open MIT Grounded action A100 Spatially precise tasks
SmolVLA 450M Apache 2.0 Chunked Laptop GPU Hobby / edge robots

如何选择部署

诚实答案是,在2026年,大多数团队运行了 _两种_模型:一个基础VLA作为语言到任务前端,一个狭窄的模仿学习政策作为精确的行动头.OpenVLA + 扩散政策,或Octo + ACT,是常见的组合.

如果您还在收集电话数据,请与我们的 [电话数据服务]合作. T12) 演示格式比算法选择更重要.

2024 年至 2026 年发生了什么变化?

现在的VLA景观定义了三个转变.首先,开放权重被封闭权重所追赶.在2023年,RT-2和其他专有DeepMind模型占据了对话的主导地位.到2026年,OpenVLA,Octo,pi0部分版本和InternVLA-M1一起涵盖了生产团队实际使用的大部分功能. 封闭的模型仍然在边界领先,

另一方面,模仿学习原始的基础模型成为了背骨. 扩散政策的行动头现在位于10月内. ACT的分组和组装策略在整个领域都是标准的. "研究IL"和"部署VLA"之间的清洁分歧已经模糊成一个层次的堆,每个层次从下层层借来的技巧.

第三,数据成为瓶. 由于有这么多有能力的开放模型,区别因素是您自己的电话系统的质量和覆盖.到2025年投资于纪律的数据收集. 我们的 [定制收藏]T13) 和 [注释]T14) 服务存在,正是因为这就是实际杆现存的地方.

我们故意将其排除在列表之外.

虽然在每次调查中出现了几种模型,但并没有获得2026年前八名. 罗博弗莱明戈和桥维拉是研究可见的,但在部署范围上比上述选择更窄. RT-2-X是无法下载的,因此无法与实际使用的模型进行排名. 双胞胎机器人和其他深思维的继任者已关闭. 商业实验室的专利产品很有趣,但我们将它们分别排列在企业咨询中.

如果其中任何一个比我们前八个更好地符合您的使用情况,我们希望您选择正确的模型而不是排名的模型. 上面的排名反映了中等_团队的需求:一个小到中型的研究小组或初创公司在允许许可下在商品硬件上运输一个操纵产品.

常见问题

视语言行动 (VLA) 模式是什么?

视觉语言行动模型 (VLA) 是一种神经网络,可以摄像头图像和自然语言指令,并产生机器人操作 (联合或终端效应器命令).现代VLA通常结合Llama-2,PaLI-X等大型视觉语言背骨或专门的变压器,并具有一个动作头,可分辨或分散连续控制输出. 开放VLA,Octo和RT-2-X是正文的例子.

2026年,我应该从哪个VLA模型开始?

对于大多数开源团队在2026年,OpenVLA (7B,MIT许可证,训练在开放X-Embodiment) 是默认的起点.如果你在消费硬件上部署,Octo-Base (93M) 是一个更轻松的替代方案.如果你在使用远程数据进行纯真模仿学习,请从ACT开始进行双手动任务或多模动单臂任务的扩散政策.

我需要什么硬件来运行OpenVLA?

在bfloat16中,OpenVLA需要大约16GB的GPU内存.实际上,团队在A100 (40或80GB),H100或L40S上部署,以510Hz的实时推理.一个4位量化变体可以在24GBRTX 4090上运行,速度处罚较小.边缘部署通常更喜欢Octo或更小的蒸政策.

RT-X 模型的重量是否可用?

RT-1-X重量在Apache 2.0下发布,并在Hugging Face上发布.RT-2-X重量并未公开发布,也从未在Google DeepMind之外提供.

我可以根据自己的数据调整VLA模型吗?

是的.OpenVLA 运输了LoRA和完整的细调配方,这些配方可以在单个A100上在几个小时内调整该政策到一个新机器人或任务中.Octo支持单个24GB的GPU上完整的细调.ACT和扩散政策通常从零开始训练在50200的远程演示中,并且根本不需要基础模型. 您可以使用RCSV的远程操作数据服务来收集示范数据.

相关阅读 OpenVLA vs Octo → RT-X vs OpenVLA → 散政策 vs ACT → VLA模型目录 → 开放X-Embodiment数据集 → LIBERO基准 → [Teleop数据收集 →]T21)

任何VLA都能根据自己的演示进行调整.

收集演示片 → 运行它的硬件 → 评分一个政策 →