视觉语言行动模型:VLA如何提供现代机器人的动力
了解OpenVLA,pi0和RT-2等视觉语言行动模型如何工作,它们与经典政策如何不同,以及如何与RCSV数据进行细节调整.
部分: [模仿学习指南]
视觉语言行动模型是GPT-4
通过
视觉语言行动模式是什么?
视觉语言行动模型 (VLA) 是一个神经网络,它以视觉观测 (摄像头图像) 和自然语言指令作为输入,并输出机器人操作
核心见解是,在互联网数据上进行预训练,让机器人背骨能够丰富地描述物理世界,对象是什么,它们如何在空间上相处,以及语言意味着什么. 因为脊椎已经理解"拿起蓝杯"或"打开左边的抽
维拉架构:三个组成部分
每个VLA都具有相同的三阶段架构,尽管实现方式在每个阶段的实现方面有显著的不同:
1.视觉编码器: 将摄像头图像转换为视觉代币的序列.大多数VLA使用预训练的视觉变压器 (ViT). 视觉编码器是从互联网预训练中最直接转移的组件,因为从网络图像中学习的视觉特性 (对象识别,空间布局,纹理理解) 对机器人感知直接有用. 图像分辨率问题:224x224是标准的,但限制了细粒度的感知;一些模型 (pi0) 使用384x384或更高的任务需要分小公分的视觉精度.
**2.语言条件背骨:**一个大型语言模型,它与语言指令令令一起处理视觉代币. 这就是语义推理发生的地方. 开放VLA使用LLaMA-2 7B;RT-2使用PaLM-E 55B;pi0使用定制3B脊柱.脊柱大小决定了模型的推理能力和推断成本.
3. 动作头: 将脊柱输出转换为机器人特定的动作.这是区分VLA架构的关键设计选择:
- ** 代币化操作 (RT-2, OpenVLA):** 将连续操作空间分为桶 (通常每维度256桶) 并使用语言模型的代币预测头预测操作代币. 简单实现,因为它重复使用语言模型现有的输出机器. 限制:分辨率引入量化错误 (~0.5mm在12cm工作空间上的256桶) 多步预测需要自动降低生成,这是缓慢的.
- 连续行动回归 (Octo): 添加一个小的多层感知器头,直接预测连续行动值.比代币化方法低延迟,但可能会失去语言模型的一些通用化好处.
- 流量匹配行动头 (pi0): 通过一种
散式的 化过程来模拟动作分布为连续流量,并从中采样.产生平稳,连续的动作轨迹.最适合精巧的任务,但增加50-100ms的推断时间.
关键模型的比较
| Model | Parameters | Action Head | Training Data | GPU for Fine-Tune | Inference 延迟 | Access |
|---|---|---|---|---|---|---|
| RT-2 | 55B | Tokenized | Google internal + web | TPU v4 pod (not public) | ~1-2s per step | Closed (Google) |
| RT-2-X | 55B | Tokenized | Open X-Embodiment | TPU v4 pod (not public) | ~1-2s per step | Closed (Google) |
| OpenVLA | 7B | Tokenized | Open X-Embodiment (970K eps) | 1x A100 80GB | ~200ms per step | Open source (HuggingFace) |
| Octo | 93M | Continuous (diffusion) | Open X-Embodiment (800K eps) | 1x RTX 4090 24GB | ~50ms per step | Open source (HuggingFace) |
| pi0 | 3B | Flow-matching | Proprietary (10K+ hours) | Enterprise access only | ~100ms per step | Commercial (Physical Intelligence) |
RT-2和RT-2-X:谷歌深度思维基准
谷歌 DeepMind在2023年发布的RT-2 (机器人变革器2) 是第一个证明,将视觉语言模型扩展到机器人控制产生了质量新功能. RT-2同时调整了 PaLI-X视觉语言模型,在网络数据和机器人轨迹上,产生了一个可以遵循新教程,推理对象属性,并将其将化为从未在机器人示范中看到的物体的政策.
RT-2显示,VLA可以进行连锁思维推理:被要求拿起"你可以用什么来清理泄漏",模型从现场发现了一个海绵,
RT-2-X通过对开放X-Embodiment数据集进行训练 (来自22个机器人体现的示范) 扩展RT-2,表明跨体现训练提高了通用化.基于多个机器人数据训练的政策对每个机器人进行更好的表现,而不是仅基于该机器人的数据训练的政策
开源开源的起点
通过建立在开源Prismatic VLM (基于LLaMA) 和训练在开放X-Embodiment数据集上,民主化了2024年的VLA细节调整,从22种不同的实施中收集了970k集中的机器人示范. 开放VLA是大多数研究团队今天使用的起点,因为它完全开源,有文档,并且在标准操纵基准上取得了强大的成绩.
针对自定义任务的OpenVLA调整需要50-200次演示,一个采用HuggingFace LeRobot公约格式化的数据集,以及一个80GB A100或H100 GPU,可进行数小时的训练.
需要: 1x A100 80GB, ~4小时的200个演示管安装 openvla # 格式化您的数据在 LeRobot格式 python脚本/转换_to_lerobot.py \ --input_dir svrc_demos/ \ --output_dir lerobot_dataset/ # 精密调整 OpenVLA 在您的任务 python finetune.py \ model -- openvla/openvla-7b \ --dataset lerobot_dataset/ \ --task_name "pick_and_place_cups" \ --epochs 50 --batch size_ 8 -- 2e-5 -- \ \ \ \ _ 32 卡片 # 进行测试.
RCSV的 [数据收集服务]
八月:轻量级替代品
欧克托 (Ghosh等同,2024) 采用了不同的方法:而不是扩大一个大型语言模型,建立一个专门构建的变压器架构,它足够小以运行在商品硬件上.在93M参数上,欧克托比OpenVLA小75倍,并在RTX 4090
对于没有A100访问或需要在边缘硬件上实时推断的团队来说,Octo是实用的选择.Octo使用了扩散行动头,而不是标记式行动,从而产生了更平稳的轨迹.它支持语言定制和目标图像定制 (显示机器人想要的终端状态的图像,而不是用语言描述它). 在200个定制示例上,Octo进行精细调调,只需单个RTX 4090进行约2小时.
折衷:Octo的较小的脊柱意味着更少的语义理解.它不能执行RT-2可以的链思维推理.对于指令简单 ("
pi0:物理智能的一般主义政策
物理智能 (pi.ai) 的 pi0,代表了VLA开发的商业界限. 与继承语言模型背骨的OpenVLA不同, pi0使用一个与流量匹配的动作头,产生连续,流
基于语言条件的"慢"推理路径与"快"反应动机控制路径之间的分离是区别的.这反映了认知科学对双进程控制系统的见解.慢路径处理任务指令和当前场景以产生高层次的计划;快路径产生低延迟的动机命令. 结果是能够处理长视线推理和高频反应控制的政策, 开辟了
对于探索 pi0 类型的架构的团队,RCSV的 [标准标志]
培训数据要求
基于VLA的性能量度,包括预训练数据多样性和任务特定细调数据质量.在发布的VLA结果中观察到的经验性规模关系:
| Scenario | Fine-Tune Demos | Expected Success Rate | Notes |
|---|---|---|---|
| Zero-shot (no fine-tuning) | 0 | 10-30% | Works only if task is in pre-training distribution |
| Minimal fine-tuning | 10-50 | 40-60% | Sufficient for simple tasks with pre-trained backbone |
| Standard fine-tuning | 50-200 | 70-85% | Sweet spot for most tasks — best ROI on data collection |
| Heavy fine-tuning | 200-1000 | 85-95% | Diminishing returns above 500; variation matters more |
| Specialist fine-tuning | 1000+ | 90-98% | Industrial deployment quality; may overfit to task |
重要数据质量要求:演示必须包括语言指令作为元数据,摄像头的视角应与部署设置匹配,演示应涵盖该政策所遇到的全部对象姿势和场景配置. 200 个具有多种配置的演示数据集比 500 个具有重复配置的演示更高.
推广要求和部署
基于VLA的部署是一个计算问题.
- **Octo (93M参数):**在RTX 4090 (24GB VRAM) 上以20Hz速度运行.可在Jetson AGX Orin上部署在5-8Hz的TensorRT优化下.最小的VLA保持跨体体通用化.
- **OpenVLA (7B参数):**需要A100或H100 (80GBVRAM) 进行5Hz的完全精度推理.在4位量化 (GPTQ或 AWQ) 时,适用于RTX 4090在3-4Hz.LoRA细调缩小内存到40GB.
- **RT-2 (55B参数):**需要多个A100/H100 GPU,具有
光平行性.不适用于单机机器人部署;最初运行在谷歌内部TPU基础设施上.这就是为什么OpenVLA存在 以提供可部署的规模RT-2-类功能. - pi0 (3B参数): 优化用于部署. 运行在单个A100或相等于10Hz. 物理智能提供了一个推断服务器,处理多机器人部署的批量请求.
对于大多数研究团队来说,实际选择是Octo (廉价,快速,不太能力) 和OpenVLA (昂贵,慢,更有能力).开始使用Octo来验证您的任务和数据管道,然后升级到OpenVLA,如果你需要更好的语言理解或新物体通用化.
零射击与精细调节性能
专业人员的关键问题是:细调有多少重要,
**零镜头工作时:**任务是常见的 (选择位置,抽
**当任务涉及定制硬件或不寻常的动力学时,对象是专业的 (实验室设备,工业部件),相机配置是不标准的,任务需要超出预训练模型的精度,或部署环境具有独特的视觉特征 (特定的照明,背景).
实际上,几乎所有生产部署都需要细节调整.零射击性能提供了有用的智能检查
目前的限制
- ** 传导延迟:** 即使是最快的VLA (Octo在50ms) 比经典的政策慢 (ACT在10ms,DDIM的15ms的扩散政策).对于需要30Hz控制 (强力敏感组装,反应式抓取) 任务,VLA是没有专门的硬件加速的太慢.
- **接触阶段性能:**VLA在接近阶段 (识别对象,规划轨迹) 优秀,但与接触阶段 (控制力,插入,手中的操纵) 斗争.语言背骨对接触动态没有有用的先验.混合方法
VLA在接近,力/触觉政策 是当前的最佳实践. - **幻觉:**像语言模型一样,VLA可以"幻觉"
预测在不确定正确行动的情况下采取自信行动.这表现为机器人执行在没有可抓住的对象的情况下抓住运动,或遵循物理不可能的指示.安全层 (力限制,工作空间限制) 是必不可少的. - **训练成本:**从零开始预先训练VLA需要数百万个机器人示范和数百个GPU小时.即使是微调OpenVLA也需要每次训练运行的云计算成本50-200美元.对于队伍在任务定义上快速演变,这个成本增加.
如何与传统模仿学习政策不同
经典的IL政策 (ACT,T3
对于一般化而言,VLA 交易计算.在 GPU 上的一种经典 ACT 政策每次推理成本几分钟;在 7B 参数模型上的一步推理成本大小的订单.对于需要在环境和指令中广泛概括的任务,VLA 获胜. 对于一个狭义定义的,重复性的工业任务,其中你有1000多个示范,并且可以调整环境,经典的政策通常以更低的成本实现更好的速度和可靠性.
精细调节VLA与RCSV数据
我们的 [远程运营基础设施]
对于需要量身定制数据的团队,我们在旧金山设施的管理收集服务可以每天与训练有素的操作员在操作任务库中进行数百次示范.我们还提供任务设计
相关: 机器人模仿学习 · 机器人学习的分散政策 · ALOHA机器人指南 · 数据服务 · 基准标志







