返回Research

较量VLA模型:RT-2,OpenVLA,Pi0,SmolVLA,RoboFlamingo (2025)

完成2025年视觉语言行动 (VLA) 模型的比较:RT-2,OpenVLA,Pi0,SmolVLA,RoboFlamingo.参数,训练数据,推断速度,硬件要求,开源状态,以及什么时候从零开始进行微调与训练.

[←研究]T2)

实际比较最重要的视觉语言行动模型,它们是什么,它们如何不同,以及如何在它们之间选择.

视觉感知中的语文指令以生成机器人操作的VLA模型

视觉语言LLM行动

什么是VLA模型?

视觉语言行动模型 (VLA) 是一个神经网络,它以视觉观测 (摄像头图像) 和自然语言指令作为输入,并作为输出产生机器人行动预测. 与早期的机器人学习模型的主要区别是语言调节:相同的模型可以在不接受重训的情况下遵循不同的指令,从而实现了纯模仿学习政策无法实现的任务通用化.

典型的VLA架构连接三个组成部分:

  1. 视觉编码器: 处理原始像素观测成特征表示 (通常是Clip ViT或SigLIP)
  2. 语言模型背骨 一个预先训练的LLM (Llama, Gemma, PaLM, Flamingo风格) 接收视觉代币与语言代币一起,并共同理由两者
  3. ** 行动头:** 轻量级的解码器,将LLM输出代币映射到机器人行动预测 分辨的行动代币 (如RT-2) 或连续行动向量 (如OpenVLA,Pi0)

假设是,在互联网上,视觉语言数据上进行预训练,将使LLM的基础知识转移到机器人操纵,

五个模特:你需要知道的

技术支持:

RT-2 (机器人变换器2) 是谷歌DeepMind在PaLI-X (55B参数) 和PaLM-E (562B参数) 上构建的VLA.它在机器人示范中对一个巨大的视觉语言模型进行了细节调整,以代表作为文本代币的行动. 结果是可以在推断时推理新教程的模型, 要求它"把片移到恐龙"使用一个不见的对配工作, 因为LLM理解语义.

RT-2 展示了新兴推理能力:链接的想法促使任务性能提高,模型可以在执行中回答事实问题.然而,它是封闭源. 它是VLA范式的基准参考和概念证明,而不是大多数实验室的可部署工具.

开放VLA (斯坦福+UC伯克利, 2024)

开放VLA是第一个完全开源,大规模的VLA模型.它基于Prismatic VLM (7B参数,基于Llama 2 + SigLIP视觉编码器) 和从Open X-Embodiment的970k机器人示范进行了细节调整.OpenVLA以RT-2的公式,将操作分为256个桶,并预测它们为语言代币.

整体训练配方,模型重量和细调代码可在HuggingFace上公开使用.在新任务上细调OpenVLA通常需要50200次示范,并且在单个A100上需要612小时.模型在A100上推断在6Hz (它不是快) LLM前进通过是瓶. 开放VLA-OFT (2024) 增加了LoRA细调支持,并将细调时间缩短24倍.

物理智能 (2024年)

Pi0是由塞尔盖·莱文,切尔西·芬和伯克利机器人界的其他创业者创立的物理智能 (pi.ai) 的VLA. Pi0使用了与流量匹配的动作头而不是离散的动作代币. 基模型基于PaliGemma (3B参数) 构建,具有散灵感动作发电头.

皮0具有现实世界的精巧操纵,在一个水平上,未曾被开放式VLA所展示:折叠衣服,清理乱的桌子,组装物体. 物理智能提供商业的调整服务.

果 (果) 产品

SmolVLA是HuggingFace进入VLA空间的,这是一个故意设计的小型,高效的VLA,用于运行消费硬件.SmolVLA使用SmolLM2 (135M1.7B参数) 作为语言背骨,并与SigLIP-400M对视觉进行配对.总模型是450M2B参数,根据配置大约比OpenVLA小315倍.

斯莫尔维拉在RTX 3090上以30Hz的速度推断,使其成为第一个真正实时无企业GPU的机器人控制的VLA.它基于LeRobot数据集训练,并与LeRobot训练堆结合.在复杂的开放词汇任务上性能落后于OpenVLA,但在细调后在狭窄任务域上匹配或超过它. 对于有限的GPU预算的实验室,SmolVLA是最容易获得的起点.

机器人飞行器 (北京技术学院+微软研究, 2023)

机器人操作的RoboFlamingo对OpenFlamingo视觉语言模型进行了细节调整 (9B参数,基于MPT-7B + CLIP ViT-L).与RT-2和OpenVLA不同,RoboFlamingo仅使用解码器** 它使用语言模型进行自动降级,既用于视觉理解,又用于无需单独的动作头的动作生成. 这使得建筑非常灵活,但在推断上也更慢 (A100上~35Hz).

机器人Flamingo主要是研究贡献而不是生产准备的模型.它的关键见解是,OpenFlamingo的内文学习能力 (直接在文本窗口中提供一些示范示例) 转移到机器人操纵:你可以提供14的示范轨迹作为文本,模型也可以在没有梯度更新的情况下适应. 这种"在环境中机器人学习"是真正的新奇,

一眼看比较表

Model Params Base LLM Training Data Inference Hz Open Source? Fine-tune?
RT-2 55B / 562B PaLI-X / PaLM-E RT-1 dataset + web 1–3 Hz No (Google internal) No
OpenVLA 7B Llama 2 + SigLIP Open X-Embodiment (970k) 6 Hz (A100) Yes (weights + code) Yes (LoRA / full)
Pi0 ~3B PaliGemma pi.ai proprietary 10–25 Hz Weights (research) Via pi.ai (commercial)
SmolVLA 450M–2B SmolLM2 + SigLIP LeRobot datasets 30 Hz (RTX 3090) Yes (fully open) Yes (LeRobot native)
RoboFlamingo 9B OpenFlamingo (MPT-7B) Open X-Embodiment 3–5 Hz (A100) Yes (weights + code) Yes (+ in-context)

每个模型的硬件要求

Model Min GPU (inference) Recommended (inference) Fine-tuning GPU VRAM (inference)
RT-2 N/A (not available) TPU pod (Google) N/A N/A
OpenVLA RTX 3090 (slow) A100 40GB A100 80GB (full) / RTX 4090 (LoRA) ~16GB (BF16)
Pi0 RTX 3090 RTX 4090 / A100 A100 40GB ~8GB (BF16)
SmolVLA RTX 3080 10GB RTX 3090 RTX 3090 / RTX 4090 2–6GB
RoboFlamingo A100 40GB A100 80GB 2× A100 80GB ~22GB (BF16)

行动代表:一个关键的区别

每个模型如何输出行动,决定它能做好哪些任务,以及它能运行得多快:

  • 分辨式行动代币 (RT-2,OpenVLA,RoboFlamingo): 行动被定量化成桶 (通常每维 256个) 并由LLM预测为文本代币. 允许利用LLM的全自行降低机器和在环境中学习. 缺点:定量化错误限制精确的操作;控制频率由LLM推断速度限制.
  • ** 连续动作头与流量匹配 (Pi0):** 通过一种散灵感应的流量匹配过程,将动作作为连续向量预测. 实现了平滑,精确的轨迹和精巧的控制. 与相当参数数数量相比,比基于代币的模型更高的频率.
  • **混合代币+连续 (SmolVLA):**语言代币用于推理;连续输出头用于行动.平衡语言通用化与控制精度.

什么时候调整和从零开始训练

对于几乎所有团队来说,精细调节预训练的VLA是正确的起点.从零开始训练一个VLA需要数百万个机器人示范和大规模计算资源,只有谷歌,深思维和物理智能才能调整.实际问题是哪个预训练的模型进行精细调和如何.

在:

  • 您的目标任务与预训练数据 (桌面操作,选择和放置,厨房任务) 的样式相似
  • 您有50500个目标任务的示范
  • 你的机器人形态表现在"开放X-体体"或"乐罗बोट"数据集中
  • 需要一个任务类别内合理的零射击概括

列车从零开始 (或使用非VLA政策)

  • 你的任务领域与预训练 (水下操纵,手术机器人,工业组装) 根本不同
  • 您的动作空间是非标准的 (例如,液压,电缆驱动,>7 DoF手)
  • 您需要最大的推断速度,并且可以负担得起限制任务的概率. 在这种情况下,从零开始训练的ACT或扩散政策将在特定的狭窄任务上优于精细调节的VLA
  • 解释性或安全性限制使大型LLM背骨成为问题

精细调节OpenVLA:实用步骤

对于想要运行自己的微调的实验室来说,OpenVLA是最容易获得的起点.以下是最小的工作流程:

# Install OpenVLA dependencies
pip install openvla

# Fine-tune with LoRA (requires single RTX 4090)
python experiments/robot/finetune.py \
  --pretrained_checkpoint openvla/openvla-7b \
  --data_root_dir /path/to/your/lerobot/dataset \
  --dataset_name your_task_name \
  --run_root_dir ./runs \
  --use_lora True \
  --lora_rank 32 \
  --batch_size 16 \
  --num_steps 10000 \
  --learning_rate 2e-4

预期的细调时间与RTX 4090的LoRA: ~ 6 小时10k步骤100个示例. 完全细调需要A100 80GB,需要 ~ 1824小时.

微调SmolVLA:实用步骤

斯莫尔维拉直接与勒罗бот集成,使其成为您的机器人运行VLA的最快途径:

python lerobot/scripts/train.py \
  policy=smolvla \
  env=aloha \
  dataset_repo_id=your-username/your-dataset \
  hydra.run.dir=outputs/train/smolvla_task \
  training.batch_size=32 \
  training.num_epochs=100 \
  policy.pretrained_backbone_kwargs.pretrained=true

你应该使用哪个模式?

如果:

  • 您的实验室有消费者GPU (RTX 3090或类似)
  • 你已经使用了LeRobot生态系统
  • 你想要最快的代周期从演示收集到机器人推断
  • 你的工作相对狭窄 (一个桌子,一致的照明,已知物体)

如果:

  • 你需要最好的开源通用化性能
  • 你有机会使用A100或H100
  • 你的任务涉及新型对象类别或指令短语,
  • 您希望发布的基准结果可以与

考虑 Pi0 如果:

  • 需要精巧的操纵质量 (多指,接触丰富)
  • 你愿意与物理智能合作,
  • 您的任务需要比OpenVLA提供的更高的控制频率

如果:

  • 您希望在文本中学习机器人 (通过文本窗口中的示范示例适应新任务,没有梯度更新)
  • 你正在研究一些简单的概括,而不是优化任务性能.

参考RT-2:

  • 根据基准指标确定VLA性能理论上上限
  • 写作相关工作 它是VLA的常规参考
  • 但不要把系统围绕它进行计划 它无法部署

为了成功调整细节,需要的数据

无论你选择哪种模型,示范质量是最重要的变量.在噪音,不一致或格式化差的数据上调整的VLA将低于在清洁数据上训练的较小的非VLA政策.

  • 摄像头放置一致性: VLA 在具有特定摄像头配置的示范上预训练.尽可能紧密匹配,或包括在细调中增加摄像头姿势.
  • ** 剧集格式:** HDF5 (RLDS兼容) 或LeRobot原生格式.OpenVLA需要RLDS;SmolVLA更喜欢LeRobot.在训练之前转换,而不是在训练期间.
  • 语言注释: 每个集都需要一个自然语言指令字符串.对于狭窄的任务,每个任务每一个固定指令都能工作.
  • ** 微型演示数:** SmolVLA:50+; OpenVLA:100+; Pi0:200+新型任务.

我们提供[数据收集服务]T3) 在 ALOHA,OpenArm和DK1硬件上进行远程操作,以LeRobot和RLDS格式输出为那些想要在不构建完整的收集管道的情况下调整VLA的团队.

所有模型 → ACT与传播政策 → OpenVLA与10月 →

读到评估是一件事 证明实用硬件的政策是另一件事.

运行现实世界评估 → 委员会评估数据 → 你的评估设备的硬件 →