返回Tools

2026年VLA模型比较:Octo,OpenVLA,Pi0,GR00T,SmolVLA和OpenPI

对于机器人学习的视觉语言行动 (VLA) 模型进行比较:Octo,OpenVLA,Pi0,GR00T,SmolVLA. 建筑,训练数据,推断速度,硬件兼容性和实机器人性能.

2026年,视觉语言行动 (VLA) 模型是一般机器人学习的主导架构.本页面将每个主要的VLA模型进行比较.

更新于2026年4月16日 · RCSV研究团队 · 12 分钟阅读

什么是VLA模型?

视觉语言行动模型 (VLA) 是一个端到端神经网络,它将摄像头图像 (视觉) 和自然语言任务指令 (语言) 作为输入和输出机器人机器人命令 (行动) 联合位置,终端效应器的速度或扭矩,机器人可以直接执行.

基于VLA的关键见解是建筑统一.在VLA之前,机器人学习系统是模块化管道:一个单独的视觉模型检测到物体,一个单独的规划器生成了一个战略,一个单独的控制器产生了动机命令.每个模块是独立训练的,模块之间有错误. 维LA将这个管道取代一个模型,在示范中进行端到端训练,消除了界面工程和错误传播.

通过根据自然语言指令 (即"把红杯拿起,把毛巾折成两半") 调节,一个VLA可以处理一个无限的任务,而不是仅限于它被训练的特定任务. 语言基础来自预先训练的LLM脊柱,

建筑比较

Model Vision 编码器 LLM Backbone Action Head 动作空间 Context Length
Octo Custom ViT Transformer (93M total) Diffusion Continuous (EEF delta) 2 frames
OpenVLA SigLIP (400M) LLaMA 2 (7B) Discrete tokenization 256 bins per dim 2048 tokens
Pi0 PaLI-based (est.) Custom (~3B total) 流匹配 Continuous (joint + EEF) Not disclosed
GR00T N1 Eagle (NVIDIA) Custom (~2B total) Dual (diffusion + 多层感知器) Continuous (whole-body) Not disclosed
SmolVLA SigLIP (400M) SmolLM2 (135M) Diffusion Continuous (joint pos) 1024 tokens
OpenPI SigLIP (400M) LLaMA-based (~3B) 流匹配 Continuous (joint + EEF) 2048 tokens

模特深潜

周五 (伯克利大学)

果是开源VLA社区的工作马. 在伯克利机器人学习实验室 (Ghosh等,2024年) 建造的果设计了一个明确的工程理念:足够小,可以在单个GPU上调整,足够快,可以实时控制,并且足够通用,可以在实施中工作.

架构: 通过共享注意力层处理标记化图像观测和语言指示的紧变压器,然后通过扩散头生成操作. 扩散头预测16步的行动部分 (0.32秒50Hz),提供时间顺利,而不需要单独的行动碎片机制.

训练数据: 800K 场合来自开放 X-Embodiment 数据集,重量向桥 V2 数据集 (WidowX机器人) 和 RT-1 数据 (谷歌的日常机器人).这意味着Octo在使用 WidowX 类手臂进行桌面操作时最有效.

**精细调节:**Octo在一个A100上在20-30分钟内进行精细调节,50-100次示范.这种快速转换使其非常适合快速代:早上收集50个演示,午餐时精细调节,下午评估.在RCSV,我们使用Octo作为试点数据收集项目的默认基准,因为它提供了数据质量最快的反.

**限制:**93M参数预算限制了语言理解和视觉推理.Octo与需要空间推理 ("把杯放在盘左边") 或新型对象类别不充分代表的任务扎.

最适合: 需要快速运行机器人政策,计算能力有限或在承诺更大的模型之前,正在重复数据收集质量的团队.

开放VLA (斯坦福/伯克利)

开放VLA (Kim等人,2024) 是最有能力的开源VLA,基于 7B参数LLM背骨提供了足够的能力来实现真正的语言条件任务通用化.这是第一个展示零射击转移到未见物体上的新任务描述的开放模型.

** 架构:** SigLIP视觉编码器 (400Mparams) 将视觉代币输入到精细调整的 LLaMA 2 (7B Params). 操作被代币化为每维度的 256个分离式桶,预测为下一个代币. 这种离散的标记化比连续扩散头显得更不出色,但使模型能够利用LLM的全自动降低生成机器.

训练数据: 970K 场合来自Open X-Embodiment数据集 (22个机器人实施例).与Octo相比,更广泛的实施方案覆盖率使OpenVLA更好地实现机器人交叉通用化.

**精细调节:**由于7B参数尺寸,需要8xA100 (或相等) 进行高效的精细调节.LoRA精细调节将其降低到1-2A100,以低性能成本.新任务推100-200次示范.精细调节需要4-8小时.

** 传导:** ~5 Hz A100, ~2 Hz Jetson AGX Orin. 需要动作分量 (预测 10-20 步骤,执行 50 Hz) 进行实时部署. 每次传导的延迟为 200-500ms 意味着机器人在 0.2-0.4 秒的时间内运行.

最适合: 语言条件的多任务系统,其中需要一个模型来处理多种任务指令.

物理智能

皮0是由塞尔盖·莱文,切尔西·芬和其他伯克利/斯坦福校友创立的公司"物理智能"公司的专有技术技术.皮0的独特技术贡献是流量匹配动作头.

**流量匹配与扩散:**这两种模型都产生了行动轨迹,但流量匹配使用直线交差路径 (最佳运输) 而不是曲的噪音到信号扩散路径.实际上,流量匹配在更少的指标步骤 (4-8对比 16-32对扩散),使得更快的推断没有质量损失.

性能: Pi0示范显示了任何开源模型都没有匹配的跨任务通用化:单个检查点折叠洗衣,清除桌子,包装盒和操作厨房设备.

访问: Pi0是不公开的.物理智能为选择的合作伙伴提供API访问.社区重新实现 OpenPI (见下) 使用已发布的架构细节提供了近似.

**最适合:**需要最先进的性能,并且愿意接受供应商锁定的PI合作协议的团队.

其他技术

GR00T N1 是NVIDIA的以人形为中心的基础模型,为艾萨克实验室生态系统设计,并为Jetson Thor边缘部署优化.

双系统架构: GR00T N1采用两个相互连接的模型:一个"慢"VLA背骨 (2-5 Hz) 解释视觉场景和语言指示以制作高层次的行动计划,以及一个"快速"的政策 (200+ Hz) 转换计划为动机命令,以反应反.这反映了有意规划和反射动机控制之间的生物区别.

**Sim-first训练:**在艾萨克实验室 (物理模拟与域随机化) 进行了1M+节目预训练,然后与50K-100K的真实人形节目进行了细节调整.这种Sim-first方法对于运动和整个身体平衡很好,但仍然需要大量的真实数据来进行操纵任务.

硬件生态系统: 优化用于NVIDIA Jetson Thor (人类型计算机平台). 还运行在Jetson AGX Orin上,性能降低.GR00T SDK为Figure,敏捷机器人,Apptronik和1X人类型提供标准化界面.

**最适合:**人体机器人项目,特别是那些已经在NVIDIA生态系统中.不适合桌面操纵臂.

的脸

斯莫尔维拉是 Hugging Face 的投注,即VLA 模型可以在不牺牲有用的通用化的情况下,为消费者硬件做出足够小的模型.

建筑: SigLIP视觉编码器 (400M) 与 SmolLM2 (135M参数语言模型) 和扩散行动头相对. 小语言模型限制了复杂的推理,但仍然为常见任务描述提供了有意义的语言条件.

雷罗бот集成:** SmolVLA 是[雷罗бот]T2) 框架中的一流公民. 培训,评估和部署脚本作为雷罗бот代码库的一部分进行维护.从Hugging Face Hub中数据集的加载是本土的.

性能: 在标准基准 (SIMPLER, Bridge V2 eval) 上,SmolVLA在参数数量1/14时达到OpenVLA的成功率的60-75%.

最适合: LeRobot 用户,拥有消费者GPU,教育和团队的爱好者,需要在Jetson Orin NX ($499) 而不是Jetson AGX Orin ($1,999) 上推断.

开放PI (共同体)

开放PI是基于发表的论文和反向工程设计选择的物理智能 Pi0 架构的社区重新实现.它提供了与流量匹配的行动头,使 Pi0 与其他VLA 区分,在开源包中.

建筑: 基于LLaMA的脊椎 (总数为3B参数) 和流量匹配的动作头的SigLIP视觉编码器.

**培训:**社区培训的数据集是基于Open X-Embodiment,DROID和社区贡献的数据集的组合.

性能: 在可比的基准标准上达到报告的Pi0性能的约70至80%;流量匹配头提供了比基于扩散的替代方案 (Octo, SmolVLA) 更平滑的行动轨迹,一些用户更喜欢接触丰富的任务.

最适合: 对于有兴趣于源源开放访问和检查和修改完整模型的流量匹配架构的研究人员.

硬件兼容性

Model WidowX / ALOHA OpenArm 1 Franka Unitree G1 Koch / SO-100
Octo Native Fine-tune Native Fine-tune Fine-tune
OpenVLA Native Fine-tune Native Fine-tune Fine-tune
Pi0 Supported Via PI API Supported Via PI API Not supported
GR00T N1 Not targeted Not targeted Not targeted Native Not targeted
SmolVLA Native Native (LeRobot) Fine-tune Fine-tune Native (LeRobot)
OpenPI Community Fine-tune Community Fine-tune Community

"原生" = 预先训练在本实体的数据上; 工作零射击或最小的细调. "细调" = 需要50-200次在这个特定机器人上演示. "社区" = 社区维护的集成;可能需要手动设置.

训练自己的VLA

许多团队应该细节调整现有VLA,而不是从头开始训练.

调整 (大多数团队都建议)

  1. **选择您的基模型:**速度为Octo,能力为OpenVLA,LeRobot集成为SmolVLA
  2. 在您的特定机器人平台上收集50-200个示范您的目标任务 (参见[数据收集指南](T3))
  3. 格式数据: 将模型转换为预期格式 (SmolVLA/Octo的LeRobot数据集格式,OpenVLA的RLDS)
  4. 细调: 五月: 30 分钟在 1 个 GPU 上. SmolVLA: 1-2 小时在 1 个 GPU 上. OpenVLA: 4-8 小时在 8 个 GPU 上 (或 1-2 个 GPU 具有 LoRA)
  5. 评估: 运行50次评估,测量成功率,分析失败模式

从零开始的培训 (专业建筑)

从零开始的训练需要100K+的示范和显著的计算 (64-256个GPU小时的Octo-scale,1000个GPU小时的OpenVLA-scale).只有当你拥有新型架构,专有的大规模数据或现有模型无法满足的要求时,这才是合适的.

推理速度基准

Model A100 (80GB) Jetson AGX Orin Jetson Orin NX RTX 4090 Action Chunking Needed?
Octo 40+ Hz 15-20 Hz 8-12 Hz 30+ Hz No (built-in)
OpenVLA 5-8 Hz 1.5-3 Hz OOM 4-6 Hz Yes (10-20 steps)
Pi0 10-15 Hz 5-8 Hz Not tested 8-12 Hz Optional
SmolVLA 25+ Hz 10-15 Hz 5-8 Hz 20+ Hz No (built-in)
OpenPI 8-12 Hz 3-5 Hz OOM 6-10 Hz Optional

测量标准使用FP16精度,批量1,单摄像头输入.现实世界性能与摄像头分辨率和视图数量不同.

什么时候使用哪个VLA

使用这个决定树来选择你的模型:

  • 需要这个星期的结果,最小的计算?
  • 需要语言条件的多任务,具有强大的通用化?OpenVLA. 最好的开源语言基础.
  • 与乐罗伯特合作,需要本地生态系统支持?SmolVLA.
  • 构建一个人形机器人应用?GR00T N1. 专门用于全身人形控制.
  • 想获得最顺利的行动轨迹 (接触丰富的任务)?OpenPI.
  • 需要最大的性能,并拥有PI合作?Pi0. 最先进,但专有.
  • ** 有一个非常具体的单个任务,不需要语言调节?** → 考虑ACT 或[T5) 而不是VLA.它们更简单,训练更快,并且经常实现更高的单项成功率.

收集VLA兼容培训数据

VLA 培训数据有具体的要求,而这些要求与更简单的政策数据不同:

摄像机要求

  • 分辨率: 最少640x480,建议1280x720.VLA视觉编码器内部下样本为224x224或336x336,但更高的源分辨率在下样本过程中保持细节.
  • ** 镜头率:** 30 fps,同步与50 Hz联合状态录音.数据加载器处理不匹配 (近邻插图).
  • 视图: 最少有1个手腕相机+1个外部相机.大多数VLA都接受2~4个视图.额外的视图提高了性能,但增加了存储和推断成本.
  • 校准: 摄像头内在和外在应该记录,但大多数VLA架构不需要 (它们直接从像素中学习视觉特征).

行动格式

  • ** 关联位置:** 记录在50Hz的绝对关联位置.这是最普遍的格式所有VLA都可以使用.
  • 终端效应器姿势: 记录EEF位置+四方向,如果有.一些模型 (Octo, Pi0) 可以直接使用EEF空间操作.
  • 抓住器状态: 双式 (开/关) 或连续抓住器位置. 记录与联合数据相同的50 Hz频率.

语言注释

  • 每个集都需要一个自然语言任务描述: "拿起红杯,把它放在盘子上"
  • 使用具体的描述语言. "做任务"是无用的; "挑选最左边的对象"是有用的
  • 为了提高语言通用性, 剧情中的语言不同, "抓杯子", "拿起咖啡杯", "从桌子上拿杯子"

输出格式

  • HDF5: ACT,散政策和直营果消费标准
  • **RLDS (TensorFlow数据集):**需要在OpenVLA预训数据格式中进行使用
  • LeRobot格式: 包裹+视频文件在拥抱面孔中心.

根据RCSV的数据收集服务,所有三个格式都默认输出.每个输送的数据集都包括HDF5,RLDS和LeRobot兼容的出口,因此您可以在不需要重格式的情况下进行任何VLA训练.

相关阅读

  • 根据"世界"的说法,
  • [VLA模型解释 (入口) ]
  • [法律政策解释]
  • [机器人传播政策]
  • 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持: 技术支持
  • 太空鼠的远程操作指南
  • [RCSV数据服务]

在RCSV收集VLA培训数据

开始使用一个$2,500的试点, 足够的数据来调整您的任务中的任何VLA.

查看数据服务:

任何VLA都能根据自己的演示进行调整.

收集演示片 → 运行它的硬件 → 评分一个政策 →