较量VLA模型:RT-2,OpenVLA,Pi0,SmolVLA,RoboFlamingo (2025)
完成2025年视觉语言行动 (VLA) 模型的比较:RT-2,OpenVLA,Pi0,SmolVLA,RoboFlamingo.参数,训练数据,推断速度,硬件要求,开源状态,以及什么时候从零开始进行微调与训练.
[←研究]
实际比较最重要的视觉语言行动模型,它们是什么,它们如何不同,以及如何在它们之间选择.
视觉感知中的语文指令以生成机器人操作的VLA模型
视觉语言LLM行动
什么是VLA模型?
视觉语言行动模型 (VLA) 是一个神经网络,它以视觉观测 (摄像头图像) 和自然语言指令作为输入,并作为输出产生机器人行动预测. 与早期的机器人学习模型的主要区别是语言调节:相同的模型可以在不接受重训的情况下遵循不同的指令,从而实现了纯模仿学习政策无法实现的任务通用化.
典型的VLA架构连接三个组成部分:
- 视觉编码器: 处理原始像素观测成特征表示 (通常是Clip ViT或SigLIP)
- 语言模型背骨 一个预先训练的LLM (Llama, Gemma, PaLM, Flamingo风格) 接收视觉代币与语言代币一起,并共同理由两者
- ** 行动头:** 轻量级的解码器,将LLM输出代币映射到机器人行动预测
分辨的行动代币 (如RT-2) 或连续行动向量 (如OpenVLA,Pi0)
假设是,在互联网上,视觉语言数据上进行预训练,将使LLM的基础知识转移到机器人操纵,
五个模特:你需要知道的
技术支持:
RT-2 (机器人变换器2) 是谷歌DeepMind在PaLI-X (55B参数) 和PaLM-E (562B参数) 上构建的VLA.它在机器人示范中对一个巨大的视觉语言模型进行了细节调整,以代表作为文本代币的行动. 结果是可以在推断时推理新教程的模型, 要求它"把
RT-2 展示了新兴推理能力:链接的想法促使任务性能提高,模型可以在执行中回答事实问题.然而,它是封闭源. 它是VLA范式的基准参考和概念证明,而不是大多数实验室的可部署工具.
开放VLA (斯坦福+UC伯克利, 2024)
开放VLA是第一个完全开源,大规模的VLA模型.它基于Prismatic VLM (7B参数,基于Llama 2 + SigLIP视觉编码器) 和从Open X-Embodiment的970k机器人示范进行了细节调整.OpenVLA以RT-2的公式,将操作分为256个桶,并预测它们为语言代币.
整体训练配方,模型重量和细调代码可在HuggingFace上公开使用.在新任务上细调OpenVLA通常需要50
物理智能 (2024年)
Pi0是由塞尔盖·莱文,切尔西·芬和伯克利机器人界的其他创业者创立的物理智能 (pi.ai) 的VLA. Pi0使用了与流量匹配的动作头而不是离散的动作代币. 基模型基于PaliGemma (3B参数) 构建,具有
皮0具有现实世界的精巧操纵,在一个水平上,未曾被开放式VLA所展示:折叠衣服,清理
果 (果) 产品
SmolVLA是HuggingFace进入VLA空间的
斯莫尔维拉在RTX 3090上以30Hz的速度推断,使其成为第一个真正实时无企业GPU的机器人控制的VLA.它基于LeRobot数据集训练,并与LeRobot训练堆
机器人飞行器 (北京技术学院+微软研究, 2023)
机器人操作的RoboFlamingo对OpenFlamingo视觉语言模型进行了细节调整 (9B参数,基于MPT-7B + CLIP ViT-L).与RT-2和OpenVLA不同,RoboFlamingo仅使用解码器**
机器人Flamingo主要是研究贡献而不是生产准备的模型.它的关键见解是,OpenFlamingo的内文学习能力 (直接在文本窗口中提供一些示范示例) 转移到机器人操纵:你可以提供1
一眼看比较表
| Model | Params | Base LLM | Training Data | Inference Hz | Open Source? | Fine-tune? |
|---|---|---|---|---|---|---|
| RT-2 | 55B / 562B | PaLI-X / PaLM-E | RT-1 dataset + web | 1–3 Hz | No (Google internal) | No |
| OpenVLA | 7B | Llama 2 + SigLIP | Open X-Embodiment (970k) | 6 Hz (A100) | Yes (weights + code) | Yes (LoRA / full) |
| Pi0 | ~3B | PaliGemma | pi.ai proprietary | 10–25 Hz | Weights (research) | Via pi.ai (commercial) |
| SmolVLA | 450M–2B | SmolLM2 + SigLIP | LeRobot datasets | 30 Hz (RTX 3090) | Yes (fully open) | Yes (LeRobot native) |
| RoboFlamingo | 9B | OpenFlamingo (MPT-7B) | Open X-Embodiment | 3–5 Hz (A100) | Yes (weights + code) | Yes (+ in-context) |
每个模型的硬件要求
| Model | Min GPU (inference) | Recommended (inference) | Fine-tuning GPU | VRAM (inference) |
|---|---|---|---|---|
| RT-2 | N/A (not available) | TPU pod (Google) | N/A | N/A |
| OpenVLA | RTX 3090 (slow) | A100 40GB | A100 80GB (full) / RTX 4090 (LoRA) | ~16GB (BF16) |
| Pi0 | RTX 3090 | RTX 4090 / A100 | A100 40GB | ~8GB (BF16) |
| SmolVLA | RTX 3080 10GB | RTX 3090 | RTX 3090 / RTX 4090 | 2–6GB |
| RoboFlamingo | A100 40GB | A100 80GB | 2× A100 80GB | ~22GB (BF16) |
行动代表:一个关键的区别
每个模型如何输出行动,决定它能做好哪些任务,以及它能运行得多快:
- 分辨式行动代币 (RT-2,OpenVLA,RoboFlamingo): 行动被定量化成桶 (通常每维 256个) 并由LLM预测为文本代币. 允许利用LLM的全自行降低机器和在环境中学习. 缺点:定量化错误限制精确的操作;控制频率由LLM推断速度限制.
- ** 连续动作头与流量匹配 (Pi0):** 通过一种
散灵感应的流量匹配过程,将动作作为连续向量预测. 实现了平滑,精确的轨迹和精巧的控制. 与相当参数数数量相比,比基于代币的模型更高的频率. - **混合代币+连续 (SmolVLA):**语言代币用于推理;连续输出头用于行动.平衡语言通用化与控制精度.
什么时候调整和从零开始训练
对于几乎所有团队来说,精细调节预训练的VLA是正确的起点.从零开始训练一个VLA需要数百万个机器人示范和大规模计算资源,只有谷歌,深思维和物理智能才能调整.实际问题是哪个预训练的模型进行精细调和如何.
在:
- 您的目标任务与预训练数据 (桌面操作,选择和放置,厨房任务) 的样式相似
- 您有50
500个目标任务的示范 - 你的机器人形态表现在"开放X-体体"或"乐罗बोट"数据集中
- 需要一个任务类别内合理的零射击概括
列车从零开始 (或使用非VLA政策)
- 你的任务领域与预训练 (水下操纵,手术机器人,工业组装) 根本不同
- 您的动作空间是非标准的 (例如,液压,电缆驱动,>7 DoF手)
- 您需要最大的推断速度,并且可以负担得起限制任务的概率. 在这种情况下,从零开始训练的ACT或扩散政策将在特定的狭窄任务上优于精细调节的VLA
- 解释性或安全性限制使大型LLM背骨成为问题
精细调节OpenVLA:实用步骤
对于想要运行自己的微调的实验室来说,OpenVLA是最容易获得的起点.以下是最小的工作流程:
# Install OpenVLA dependencies
pip install openvla
# Fine-tune with LoRA (requires single RTX 4090)
python experiments/robot/finetune.py \
--pretrained_checkpoint openvla/openvla-7b \
--data_root_dir /path/to/your/lerobot/dataset \
--dataset_name your_task_name \
--run_root_dir ./runs \
--use_lora True \
--lora_rank 32 \
--batch_size 16 \
--num_steps 10000 \
--learning_rate 2e-4
预期的细调时间与RTX 4090的LoRA: ~ 6 小时10k步骤100个示例. 完全细调需要A100 80GB,需要 ~ 18
微调SmolVLA:实用步骤
斯莫尔维拉直接与勒罗бот集成,使其成为您的机器人运行VLA的最快途径:
python lerobot/scripts/train.py \
policy=smolvla \
env=aloha \
dataset_repo_id=your-username/your-dataset \
hydra.run.dir=outputs/train/smolvla_task \
training.batch_size=32 \
training.num_epochs=100 \
policy.pretrained_backbone_kwargs.pretrained=true
你应该使用哪个模式?
如果:
- 您的实验室有消费者GPU (RTX 3090或类似)
- 你已经使用了LeRobot生态系统
- 你想要最快的
代周期从演示收集到机器人推断 - 你的工作相对狭窄 (一个桌子,一致的照明,已知物体)
如果:
- 你需要最好的开源通用化性能
- 你有机会使用A100或H100
- 你的任务涉及新型对象类别或指令短语,
- 您希望发布的基准结果可以与
考虑 Pi0 如果:
- 需要精巧的操纵质量 (多指,接触丰富)
- 你愿意与物理智能合作,
- 您的任务需要比OpenVLA提供的更高的控制频率
如果:
- 您希望在文本中学习机器人 (通过文本窗口中的示范示例适应新任务,没有梯度更新)
- 你正在研究一些简单的概括,而不是优化任务性能.
参考RT-2:
- 根据基准指标确定VLA性能理论上上限
- 写作相关工作
它是VLA的常规参考 - 但不要把系统围绕它进行计划
它无法部署
为了成功调整细节,需要的数据
无论你选择哪种模型,示范质量是最重要的变量.在噪音,不一致或格式化差的数据上调整的VLA将低于在清洁数据上训练的较小的非VLA政策.
- 摄像头放置一致性: VLA 在具有特定摄像头配置的示范上预训练.尽可能紧密匹配,或包括在细调中增加摄像头姿势.
- ** 剧集格式:** HDF5 (RLDS兼容) 或LeRobot原生格式.OpenVLA需要RLDS;SmolVLA更喜欢LeRobot.在训练之前转换,而不是在训练期间.
- 语言注释: 每个集都需要一个自然语言指令字符串.对于狭窄的任务,每个任务每一个固定指令都能工作.
- ** 微型演示数:** SmolVLA:50+; OpenVLA:100+; Pi0:200+新型任务.
我们提供[数据收集服务]
所有模型 → ACT与传播政策 → OpenVLA与10月 →
读到评估是一件事 证明实用硬件的政策是另一件事.







