视觉语言行动模式是哪个获胜的?
面对面对 OpenVLA (7B) 和 Octo (27M/93M) <unk>架构,Open-X培训,许可证,硬件需求和部署适合.今天选择正确的 VLA.
两个开放式VLA训练在开放式X体体体体体
更新于2026年4月 7B vs 93M 参数 MIT授权
在操作基准上选择OpenVLA,当你想要一个宽泛的语言基础,一个Llama-2背骨,以及最好的零射出盒子行为, 当您需要一个紧
为什么这次比较很重要
开放VLA和Octo是2024年发布的最受引用的开放权重视觉语言行动模型,两者都基于开放X-Embodiment数据集训练.如果你在2026年建立一个机器人学习堆
如果您想要更深入的目录视图,请参阅我们的 [VLA模型目录]
一眼对比
| Dimension | OpenVLA | Octo |
|---|---|---|
| Parameters | 7B | 27M (Octo-Small) / 93M (Octo-Base) |
| Backbone / architecture | Llama-2 7B LLM + DINOv2 + SigLIP vision encoders | Transformer diffusion policy from scratch, multimodal token stream |
| Action head | Discretized action tokens output by the LLM | Conditional diffusion over continuous actions (DDPM-style) |
| Training data | ~970K trajectories from Open X-Embodiment | ~800K trajectories from Open X-Embodiment |
| Language conditioning | Native (LLM-level), strong instruction following | Supported via text or goal-image tokens, weaker instruction grounding |
| Action space | 7-DOF end-effector delta (extensible via fine-tune) | Flexible — supports varied action dims across embodiments |
| Inference hardware | ~16 GB VRAM bf16, ideally A100/H100/L40S for real-time | Runs comfortably on a single RTX 4090 or smaller |
| Throughput (typical) | ~5–10 Hz on A100 without quantization | ~10–30 Hz on consumer GPUs with action chunking |
| Fine-tuning cost | LoRA on 1× A100 is practical; full fine-tune needs multi-GPU | Full fine-tune feasible on a single 24 GB GPU |
| License | MIT | MIT |
| Paper | Kim et al., CoRL 2024 (arXiv:2406.09246) | Octo Model Team, arXiv:2405.12213 |
| Code | github.com/openvla/openvla | github.com/octo-models/octo |
建筑深度潜水
开放VLA:语言模型的设计
开放VLA基本上是一个Llama-2 7B,被教导发射行动代币.图像由合并的DINOv2 + SigLIP视觉堆
成本是尺寸:OpenVLA的7B重量和自动降解使实时控制变得要求高.实际上,团队使用动作分量,bfloat16推理和专用A100级GPU
果:在政策规模的扩散变压器
据悉,Octo是一个由零开始训练的变压器,使用了条件扩散头,它表示了基于图像,语言和目标图像的操作序列. 行动的
27M和93M变体足够小,可以在消费者硬件上提供高频率服务,而扩散式采用多模式示范分布式清洁地捕捉,使得Octo自然适合[扩散政策风格]
培训数据和通用化
两种模型都基于[Open X-Embodiment]
当OpenVLA获胜时
- 您需要语言定位. 如果操作员会发出自由形式指令 ("将红色块放到杯的左边"),OpenVLA的Llama-2背骨将给您出了无需的语言理解.
- 您拥有H100/A100级硬件. 在40GB GPU的工作站上,OpenVLA运行得很舒服,语言忠诚性自行支付.
- **数据收集前,你需要一个强大的零截图基线.**OpenVLA在 LIBERO-Spatial, LIBERO-Object和 BridgeData V2上发布的数字是一个坚实的起点.
- **你计划为特定的体现做LoRA细调.**OpenVLA社区已经发送了许多LoRA食谱,而适配器的重量与完整的细调相比很小.
当奥克托赢得时
- **您正在部署一个24GB的消费GPU或边框. ** Octo-Small (27M) 足够小,可以与感知和规划堆
一起运行. - 你的任务是多模式示范模仿. 传播头自然捕捉到"有三种方法"的示范分布,
- 您想在各种体现上进行细节调整. Octo 显然被设计成接受不同动作尺寸和摄像头视图.
- **高控制频率重要.**Octo的较小的足迹和分散性使得在单个GPU上可实现20
30Hz闭环控制.
诚实的交易
开放VLA的语言优势一旦你对一个狭窄的任务分布进行细节调整,就会消失. 另一方面,Octo的语言调节在出于分发的指示上可以默默地失败,当政策没有LLM提示时,调试"为什么机器人选择错误的对象"是更困难的.如果您的部署是语言轻量和任务狭窄 (
值观关注的基准
根据标准化套件,我们建议在您自己的任务分布上评估两种模型. [LIBERO基准]
微妙但重要的一点:OpenVLA和Octo之间的基准数字并不总是
为了实现部署的健康,我们建议在选择一个模型之前,在自己任务的10个集中进行短暂的内部评估. 这两天的比较成本远低于在错误的基础上进行8周的细节调整.
精细调节的做法
两种模型都已经成熟的细调管道,配方揭示了很多关于模型的.OpenVLA的参考LoRA配方训练一个级-16适配器大约20K
由于模型很小,24GB GPU上的完整的细节调节是常规的,社区已经分享了Franka,UR5,xArm和几种人形平台的食谱. 如果您的数据管道已经在LeRobot或RLDS格式中,
生态系统和工具
对于LLM推理而构建的每一个量化,服务和适配工具都适用于.你可以通过自定义样本器运行OpenVLA,将其量化为4位,使用位和字节,或者编译为TensorRT-LLM来生产吞吐量.当你生产时,生态系统遗产是一个真正的优势.
虽然Octo的生态系统较小,但与机器人技术高度相一致:LeRobot,RLDS和大多数现代数据收集堆
我们的建议
如果这是您的第一个VLA部署,并且您有一个A100级工作站,请使用OpenVLA
如果您想要针对您的特定机器人和任务的模型建议,请 [预订电话]
相关阅读 RT-X vs OpenVLA →
任何VLA都能根据自己的演示进行调整.







