已进行的VLA模型比较 (2026):OpenVLA, π0,SmolVLA,Octo & RT-2
根据检查点访问,行动表示,计算,数据兼容性和评估协议进行VLA模型的比较.涵盖OpenVLA, π0,SmolVLA,Octo和RT-2.
使用本指南以按检查点访问,行动表示,推断计算,机器人数据兼容性以及产生每个报告结果的评估协议来选择视觉语言行动模型.
更新于2026年7月26日 · RCSV研究团队
直接答案
机器人团队应该选择哪种VLA模型?
没有通用最佳VLA.首先选择您是否可以访问和细节调整检查点,然后根据行动表示,延迟预算,支持的机器人数据格式和您自己的任务级评估的性能. 论文的标题分数不应超过这些部署限制.
证据标准: 建筑和访问事实与论文或官方存储库进行检查.来自不同数据集,机器人实施,硬件和协议的发表得分不被视为直接相比.估计和不可用测量标签.
- [浏览VLA模型]
- [找到兼容的数据集]
- [审查基准协议]
什么是VLA模型?
视觉语言行动模型 (VLA) 是一个神经网络,可以将视觉观测和语言指示映射到机器人的操作中.核心想法是:采用预先训练的视觉语言模型 (已经理解图像和文本),并添加一个动作输出头,为机器人产生动机命令. 视觉语言的脊柱提供语义理解 ("挑起红杯"),而行动头将这种理解转化为物理运动 (关节角或终端效应器位置的序列).
建筑概况
所有VLA模型都有三个组成部分,尽管它们的实现有显著的不同:
- **视觉编码器:**将摄像头图像转换为功能向量.常见的选择是视觉变换器 (ViT) 或SigLIP.视觉编码器通常在互联网尺度图像数据集 (ImageNet,LAION) 上预训练,并在VLA训练中
结或轻微调节. - **语言背骨:**处理文本说明并将其与视觉功能结合起来.大多数VLA使用预训练的大语言模型 (LLaMA,Gemma,PaLI) 作为背骨,利用其推理和遵循说明的能力.
- 动作头: 从融合的视觉语言表示中生成机器人动作.这是VLA架构最显著的分歧.
行动代表性:主要区分因素
如何表现和生成操作,决定了其性能特征:
- 分别代币 (RT-2,OpenVLA): 动作被定量化成分别代币,并被自动降级生成,就像文字代币一样. 简单可实现,但产生
的单步动作. - ** 断片预测 (SmolVLA):** 该模型以ACT为灵感,同时预测未来行动的序列 (通常是10
50步). - 流量匹配 (π0): 通过反复将随机样本归纳到有效行动轨迹中,生成的行动是最顺利的,并且最好处理多模式分布 (多有效解决方案的任务),但需要在推断时多个归纳步骤.
- **
散 (Octo):**类似于流量匹配,但使用DDPM式的 散过程.适用于多模式操作,但推断速度比分断预测慢.
VLA 模型比较表
| Model | Creator | Open Source | Parameters | Action Type | Hardware Compatibility |
|---|---|---|---|---|---|
| RT-2 | Google DeepMind | No | 55B | Discrete tokens | Google RT-X robots |
| OpenVLA | Stanford / Berkeley | Yes (Apache 2.0) | 7.5B | Discrete tokens | Any |
| π0 | Physical Intelligence | No | ~3B (est.) | Flow matching | Any |
| SmolVLA | HuggingFace | Yes (Apache 2.0) | 450M | Chunked (ACT-style) | Any |
| Octo | UC Berkeley | Yes (MIT) | ~93M | Diffusion | Any |
| RoboFlamingo | Shanghai AI Lab | Yes | ~9B | Autoregressive | Any |
| Helix | Figure AI | No | Undisclosed | Undisclosed | Figure 02 |
深度潜水:每个VLA模型
其他技术
架构: RT-2 基于 PaLI-X (55B参数) 或 PaLM-E (12B参数) 构建.视觉编码器是ViT-e (4B参数),语言模型处理视觉代币和文本代币.操作以分辨关联位置的文本字符串表示 (例如, "1 128 91 241 5 101 127") 并由语言模型进行自动降级.
培训数据: 基于谷歌RT-X数据集,包含13种机器人类型的约13万个示范.
**性能:**RT-2 根据在机器人训练中从未见过概念的指令,它表现出新兴能力.
精确调节要求: 没有公开可用.谷歌没有发布体重或训练代码.
** 优势:** 最强的新兴语义通用化;证明VLA概念在规模上运行的第一证据.
缺点:** 封闭源;需要大量计算; 55B参数使实时推断具有挑战性;单步离散操作产生
开放VLA (斯坦福/伯克利)
架构: 基于Prismatic VLM脊柱 (Llama-2 7B + SigLIP + DinoV2视觉编码器). 操作分为每维度的256个桶,并作为代币进行自动降级预测.双视觉编码器 (语义特征的SigLIP +空间特征的DinoV2) 与单个编码器设计相比,OpenVLA具有更强大的视觉基地.
培训数据: 训练在开放的X-Embodiment数据集上 (来自22个机器人实施体中的970K轨迹).
性能: 在 LIBERO 基准上,精细调整的 OpenVLA 根据任务难度达到85
精细调节要求: 2x A100 (80 GB) 对于完整的精细调节; 1x A100对于LoRA精细调节.训练时间:8
** 优势:** 完全开源,有优秀的文档;最强大的开源基础;大社区和积极的开发;在任何机器人上使用简单的行动空间映射.
缺点: 7.5B参数意味着消费者GPU上的每一步操作速度为 ~ 300ms (对于反应性任务来说太慢);离散代币比流量匹配或分量预测产生更不平滑的操作;需要大量的VRAM进行细节调整.
(物理智能)
建筑: π0使用视觉语言的脊柱 (可能基于PaLI,详细信息尚未完全披露) 与流量匹配的行动头.流量匹配通过学习速度场进行反复转换噪音样本成行动轨迹来产生行动.这产生了流
训练数据: 训练基于多个机器人平台 (Franka, UR5,移动操纵器,巧妙的手) 上数千小时的远程操作数据的专有数据集.
性能: π0 显示了任何机器人政策的最广泛任务概括,在单个模型中,在不同机器人实施中执行洗衣
精确调节要求: 无法公开使用.
** 优势:** 最顺利的行动生成; 最广泛的任务概括性; 比基于代币的VLA更好地处理接触丰富的操纵; 多体现支持.
**缺点:**封闭源;没有公开权重;推断需要多个告密步骤 (10
的脸
建筑: SmolVLA 使用SmolVLM (基于Idefics-3) 的紧
培训数据: 培训在Open X-Embodiment和LeRobot社区数据集的组件上.
性能: 在 LIBERO 基准上,SmolVLA 虽然具有16倍较少的参数,但在OpenVLA 的5%内取得了82
精细调节要求: 1x RTX 4090 (24 GB) 进行完整调节; 200 个示范的训练时间为 4
Pros: 最小,最快的开源VLA;运行于消费者硬件; 零碎预测产生了流
**缺点:**比7B+模型较小的脊椎限制语言理解;对新教程不那么强大;碎片预测可能会与非常长视野任务
周五 (伯克利大学)
建筑: Octo使用一个具有扩散动作头的变压器背骨.与上述VLA模型不同,Octo不使用预训练语言模型背骨.相反,它使用一个从零开始训练的较小的变压器,使用机器人数据,具有可选语言定制.
训练数据: 训练在开放的X-Embodiment数据集 (~800K轨迹). 专门用于跨体转移和快速细调.
性能: 在SIMPLER基准上,Octo-Base在多个模拟环境中实现了50
精确调节要求: 1x RTX 3090或更好;训练时间30分钟至2小时.
**优势:**最快的细调;最小的计算要求;扩散头处理多模动作良好;设计用于快速原型制造.
**缺点:**语言理解较弱 (没有LLM脊柱);在复杂任务上,绝对性能低于OpenVLA或SmolVLA;扩散推理比碎片预测慢.
机器人飞行器 (上海人工智能实验室)
**建筑:**基于OpenFlamingo (基于MPT-7B的多模特模型),RoboFlamingo将机器人行动预测头添加到预训练的视觉语言模型中.它使用感知器重新样本模块以有效地处理多框架视觉历史,使模型能够推理时间动态.
培训数据: 培训基于CALVIN基准数据和定制实机器人示范的组合.可在100
性能: 在CALVIN基准上,RoboFlamingo在多步长视界任务上取得了最先进的结果.它的时间视觉推理 (处理框架的序列而不是单个框架) 让它在需要记忆前步的任务上具有优势.
细调要求: 2x A100 (80 GB) 对于9B参数脊椎的完整细调.
优势:** 强大的长远任务性能; 时间视觉推理; 开源.
缺点: 模型大小 (9B); 实际机器人评估的数量有限; 社区比OpenVLA或SmolVLA小; 自动降低行动生成产生单步行动.
如何选择:VLA决策框架
选择正确的VLA模型取决于三个因素:计算预算,数据可用性和任务要求.
通过计算预算
| Budget | 微调 Hardware | Recommended Model | Inference Speed |
|---|---|---|---|
| Consumer ($0–$2K GPU) | 1x RTX 4090 | SmolVLA or Octo | 15–30 Hz |
| Research lab ($5K–$20K) | 1–2x A100 | OpenVLA (LoRA) or SmolVLA | 3–15 Hz |
| Well-funded lab ($20K+) | 4+ A100 or H100 | OpenVLA (full) or custom VLA | 3–10 Hz |
| Enterprise | Cloud cluster | π0 (API) or custom training | Varies |
按任务类型
| Task | Key Requirement | Best Model | Why |
|---|---|---|---|
| Simple pick-and-place | Speed, low compute | SmolVLA or Octo | Fast inference, minimal data needed |
| Language-conditioned manipulation | Semantic understanding | OpenVLA | Strongest language backbone among open models |
| Contact-rich manipulation | Smooth, precise actions | π0 or SmolVLA | Flow matching / chunked actions handle contact better |
| Multi-step long-horizon | Temporal reasoning | RoboFlamingo or OpenVLA | Multi-frame processing, strong LLM backbone |
| Rapid prototyping | Fast iteration | Octo | 30-min fine-tuning on 20 demos |
| Bimanual coordination | Multi-arm action space | SmolVLA or Octo | Flexible action spaces, chunked prediction |
根据数据可用性
- 20
50示例: Octo (设计用于最小数据的快速细调) - 50
200示例: SmolVLA (适度数据的表现良好) 或ACT (非VLA基线,在数据有限的情况下非常有效) - **200
500次示范:**OpenVLA (完全精细调度在这个规模达到最佳结果) - 500+ 示范: 任何模型的好处;考虑OpenVLA的完整调整或培训一个定制模型
调整机器人数据的VLA
数据格式要求
所有主要VLA模型都预计训练数据将在两个格式中的一个:
- RLDS (强化学习数据集): 开放X-Embodiment模型的标准.使用Octo,OpenVLA和RT-2.每个集都作为TFRecord格式的 (观察,行动,奖励) 双组的序列存储.
- LeRobot格式: HuggingFace的 SmolVLA 和 LeRobot 训练框架格式.每个集都作为一个共机图像和动作列的Parquet文件,加上一个JSON文件的元数据.
RCSV 的数据收集管道输出了两种格式. 查看我们的 [数据格式指南]
GPU 要求和培训时间
| Model | Method | Min GPU | VRAM | Time (200 demos) |
|---|---|---|---|---|
| SmolVLA | Full fine-tune | 1x RTX 4090 | 24 GB | 4–12 hours |
| OpenVLA | LoRA | 1x A100 | 40 GB | 8–16 hours |
| OpenVLA | Full fine-tune | 2x A100 | 80 GB each | 12–24 hours |
| Octo | Full fine-tune | 1x RTX 3090 | 24 GB | 0.5–2 hours |
| RoboFlamingo | Full fine-tune | 2x A100 | 80 GB each | 16–32 hours |
洛拉与完整调整
低级适应 (LoRA)
- ** 完整的细调:** 更新了7.5B参数. 需要2xA100 (80GB). 实现最佳性能,特别是当你的任务分布与预训数据显著不同时.
- LoRA精细调节: 训练50M适配器参数 (排名32). 需要1xA100 (40GB). 在大多数任务中,性能在2
5%的完整精细调节内.除非您有过度计算,否则建议作为默认方法.
举个例子:使用LeRobot进行微调的SmolVLA
# Install LeRobot
# pip install lerobot
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
from lerobot.common.policies.smolvla.configuration_smolvla import SmolVLAConfig
from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy
# Load your dataset (collected at RCSV or locally)
dataset = LeRobotDataset("your_org/your_dataset")
# Configure the policy
config = SmolVLAConfig(
input_shapes={
"observation.images.top": [3, 480, 640],
"observation.images.wrist": [3, 480, 640],
"observation.state": [7], # 6 joints + gripper
},
output_shapes={
"action": [7],
},
action_chunk_size=50,
)
# Initialize from pre-trained weights
policy = SmolVLAPolicy(config, dataset_stats=dataset.stats)
policy.load_pretrained("HuggingFaceTB/SmolVLA-base")
# Fine-tune (see LeRobot docs for full training loop)
# python lerobot/scripts/train.py \
# --policy.type=smolvla \
# --dataset.repo_id=your_org/your_dataset \
# --training.num_epochs=100
汇集RCSV数据到细调管道
采用RCSV的 [数据收集服务](
- **任务范围:**定义操纵任务,对象变化,成功标准.RCSV的解决方案团队帮助确定最低数据集尺寸 (通常为VLA细调100
200个演示). - ** 收集示范:** RCSV运营商通过同步的多摄像头录音收集 OpenArm 1或 DK1 的专家示范.试点活动:100个示范 (2500美元).全场活动:500个示范 (8000美元).
- **收到格式数据:**数据均以HDF5 (ACT/传播政策兼容) 和LeRobot格式 (SmolVLA/OpenVLA兼容) 提供.
- ** 调整VLA:** 使用传递的数据集调整SmolVLA (消费者GPU) 或OpenVLA (A100).RCSV可以提供计算访问或云GPU设置指导.
- 评估和重复: 部署精细调整的政策在机器人上. 如果成功率低于目标,收集额外的目标示范失败情况.
现实世界基准:准确性与推理速度
方法说明
不要把这个表当作一个正常化的排名表
下面的值是来自不同模型版本和环境的报告或指导性结果.它们对于形成短名单有用,但它们不会确定获胜者,因为任务定义,检查点,观察空间,行动空间,硬件和成功标准不同.
决策级比较需要每个候选人相同的数据集版本,实施方案,任务套件,种子政策,推断硬件,成功分类和重复运行协议.
| Model | LIBERO-Long (5 tasks) | SIMPLER (avg) | Inference (RTX 4090) | Inference (A100) |
|---|---|---|---|---|
| RT-2 (55B) | N/A (closed) | N/A (closed) | N/A | ~1 Hz |
| OpenVLA (7.5B) | 90% | 72% | ~3 Hz | ~8 Hz |
| π0 | N/A (closed) | N/A (closed) | N/A | ~5 Hz (est.) |
| SmolVLA (450M) | 86% | 68% | ~20 Hz | ~30 Hz |
| Octo (93M) | 72% | 58% | ~10 Hz | ~25 Hz |
| RoboFlamingo (9B) | 82% (CALVIN) | N/A | ~2 Hz | ~6 Hz |
**推断速度差距:**对于反应性任务 (捕获物体,动态组装),需要≥10Hz的控制.这限制了消费者硬件上的 SmolVLA 和 Octo的实际选择.对于较慢的操纵任务 (选择和放置,包装),3
重要注意: 基准号码是根据特定的数据集和评估协议测量的.现实世界性能取决于您的特定任务,环境和机器人.如果在 LIBERO 上达到90%的模型,如果视觉环境或对象组显著不同,则可能会达到60%的任务.
相关阅读
相关: 2026年物理人工智能 · 行动







