返回VLA Models

视觉语言行动模式是哪个获胜的?

面对面对 OpenVLA (7B) 和 Octo (27M/93M) <unk>架构,Open-X培训,许可证,硬件需求和部署适合.今天选择正确的 VLA.

两个开放式VLA训练在开放式X体体体体体一个7B多模兽,另一个瘦27M/93M扩散变压器.哪个适合你的机器人,你的GPU预算,

更新于2026年4月 7B vs 93M 参数 MIT授权

浏览所有模型 与工程师谈话

在操作基准上选择OpenVLA,当你想要一个宽泛的语言基础,一个Llama-2背骨,以及最好的零射出盒子行为, 当您需要一个紧,快速的扩散变压器时,选择Octo,它可以在各种体现中调整廉价,并运行在原材料GPU上,以接受较低的语言忠实性来换取速度和灵活性.

为什么这次比较很重要

开放VLA和Octo是2024年发布的最受引用的开放权重视觉语言行动模型,两者都基于开放X-Embodiment数据集训练.如果你在2026年建立一个机器人学习堆,无论是[仓库采集]T3),[实验室自动化]T4),还是一个人形电波管道,其中一个几乎肯定是你的起点. 但这两种模型的设计是非常不同的,错误的选择会让你花费几周的精细调和大量的GPU时间.

如果您想要更深入的目录视图,请参阅我们的 [VLA模型目录]T5) 或个人 [OpenVLA页面]T6) 和 [Octo页面]T7).

一眼对比

Dimension OpenVLA Octo
Parameters 7B 27M (Octo-Small) / 93M (Octo-Base)
Backbone / architecture Llama-2 7B LLM + DINOv2 + SigLIP vision encoders Transformer diffusion policy from scratch, multimodal token stream
Action head Discretized action tokens output by the LLM Conditional diffusion over continuous actions (DDPM-style)
Training data ~970K trajectories from Open X-Embodiment ~800K trajectories from Open X-Embodiment
Language conditioning Native (LLM-level), strong instruction following Supported via text or goal-image tokens, weaker instruction grounding
Action space 7-DOF end-effector delta (extensible via fine-tune) Flexible — supports varied action dims across embodiments
Inference hardware ~16 GB VRAM bf16, ideally A100/H100/L40S for real-time Runs comfortably on a single RTX 4090 or smaller
Throughput (typical) ~5–10 Hz on A100 without quantization ~10–30 Hz on consumer GPUs with action chunking
Fine-tuning cost LoRA on 1× A100 is practical; full fine-tune needs multi-GPU Full fine-tune feasible on a single 24 GB GPU
License MIT MIT
Paper Kim et al., CoRL 2024 (arXiv:2406.09246) Octo Model Team, arXiv:2405.12213
Code github.com/openvla/openvla github.com/octo-models/octo

建筑深度潜水

开放VLA:语言模型的设计

开放VLA基本上是一个Llama-2 7B,被教导发射行动代币.图像由合并的DINOv2 + SigLIP视觉堆编码并投射到LLM的代币流中.连续的行动被分为每维 256个桶,并被视为模型预测的新词汇. 由于行动空间与语言相同的代币空间中表达,所以您可以继承LLM的构成通用化. 模型可以遵循在训练中从未见过的新教程, 作者表明它在LIBERO和BridgeData V2套件上超越RT-2-X,尽管使用了7x少参数,

成本是尺寸:OpenVLA的7B重量和自动降解使实时控制变得要求高.实际上,团队使用动作分量,bfloat16推理和专用A100级GPU部署它,或者他们为特定机器人调整更小的动作头.OpenVLA在OpenArm或AlphaRobot平台上工作,但你为语言行为支付了溢价.

果:在政策规模的扩散变压器

据悉,Octo是一个由零开始训练的变压器,使用了条件扩散头,它表示了基于图像,语言和目标图像的操作序列. 行动的碎是在.

27M和93M变体足够小,可以在消费者硬件上提供高频率服务,而扩散式采用多模式示范分布式清洁地捕捉,使得Octo自然适合[扩散政策风格]T8) 模仿学习工作流程. 折衷是Octo的语言理解基于培训时间分布而不是LLM之前,所以遵循真正新鲜提示的零射击指导比OpenVLA更弱.

培训数据和通用化

两种模型都基于[Open X-Embodiment]T9的数据集,在22个实体化中约有970K的实体机器人轨迹的多机构体.OpenVLA使用了完整的970K版本;Octo使用了编辑的800K轨迹子集.这种共享来源意味着两种模型都看到了Franka,WidowX,Google机器人以及长尾的实验室臂,但它们的诱导偏见不同. 开放VLA继承了语言模型前 (适合通用指令语句).Octo继承了扩散前 (适合多模式,高频轨迹).当你通过 [RCSV的数据服务]T10收集的自己的电话数据进行微调时,这些前则塑造了你需要的数据量.

当OpenVLA获胜时

  • 您需要语言定位. 如果操作员会发出自由形式指令 ("将红色块放到杯的左边"),OpenVLA的Llama-2背骨将给您出了无需的语言理解.
  • 您拥有H100/A100级硬件. 在40GB GPU的工作站上,OpenVLA运行得很舒服,语言忠诚性自行支付.
  • **数据收集前,你需要一个强大的零截图基线.**OpenVLA在 LIBERO-Spatial, LIBERO-Object和 BridgeData V2上发布的数字是一个坚实的起点.
  • **你计划为特定的体现做LoRA细调.**OpenVLA社区已经发送了许多LoRA食谱,而适配器的重量与完整的细调相比很小.

当奥克托赢得时

  • **您正在部署一个24GB的消费GPU或边框. ** Octo-Small (27M) 足够小,可以与感知和规划堆一起运行.
  • 你的任务是多模式示范模仿. 传播头自然捕捉到"有三种方法"的示范分布,
  • 您想在各种体现上进行细节调整. Octo 显然被设计成接受不同动作尺寸和摄像头视图.
  • **高控制频率重要.**Octo的较小的足迹和分散性使得在单个GPU上可实现2030Hz闭环控制.

诚实的交易

开放VLA的语言优势一旦你对一个狭窄的任务分布进行细节调整,就会消失. 另一方面,Octo的语言调节在出于分发的指示上可以默默地失败,当政策没有LLM提示时,调试"为什么机器人选择错误的对象"是更困难的.如果您的部署是语言轻量和任务狭窄 (装箱装),Octo几乎总是正确的呼叫. 如果您的部署是语言繁重且任务广泛 (家庭辅助,灵活的实验室自动化),

值观关注的基准

根据标准化套件,我们建议在您自己的任务分布上评估两种模型. [LIBERO基准]T12) 涵盖短视野操作, [CALVIN]T13) 涵盖长视野语言条件任务, [Google机器人]T14) 涵盖桌面通用化.

微妙但重要的一点:OpenVLA和Octo之间的基准数字并不总是果对果.OpenVLA的发布的 LIBERO分数是在LIBERO轨迹上的短时间LoRA细节调整后,通过7B基点检查收集;Octo的分数是在Octo-Base评估的零射击下收集的. 当你复制任何一个,记录准确的检查点,细节调整的食谱和评估协议 温度,行动分量和时间组合的小差异占你在社区结果中看到的大部分传播.

为了实现部署的健康,我们建议在选择一个模型之前,在自己任务的10个集中进行短暂的内部评估. 这两天的比较成本远低于在错误的基础上进行8周的细节调整.

精细调节的做法

两种模型都已经成熟的细调管道,配方揭示了很多关于模型的.OpenVLA的参考LoRA配方训练一个级-16适配器大约20K50K步骤在一个80GB A100上,批量大小为16个,使用T0训练堆. 完全细调需要四个A100或更好的. 检查点通常为LoRA适配器的150200MB,使得运送许多任务特定适配器与共享7B基地是实验室自动化T15) 部署的有用性,每个工作站运行一个略有不同的协议.

由于模型很小,24GB GPU上的完整的细节调节是常规的,社区已经分享了Franka,UR5,xArm和几种人形平台的食谱. 如果您的数据管道已经在LeRobot或RLDS格式中,

生态系统和工具

对于LLM推理而构建的每一个量化,服务和适配工具都适用于.你可以通过自定义样本器运行OpenVLA,将其量化为4位,使用位和字节,或者编译为TensorRT-LLM来生产吞吐量.当你生产时,生态系统遗产是一个真正的优势.

虽然Octo的生态系统较小,但与机器人技术高度相一致:LeRobot,RLDS和大多数现代数据收集堆都支持它.如果你已经在生态系统的拥抱面孔机器人方面建立,Octo就像是家庭团队模型.

我们的建议

如果这是您的第一个VLA部署,并且您有一个A100级工作站,请使用OpenVLA 来开始,语言行为将节省您数周的快速模板工程,而MIT许可证将保持商业路径. 许多生产团队最终运行了 both:OpenVLA作为指令后面,Octo作为快速低级政策.

如果您想要针对您的特定机器人和任务的模型建议,请 [预订电话]T16.

相关阅读 RT-X vs OpenVLA → 散政策 vs ACT → 最佳VLA模型2026 → 开放X-Embodiment数据集 → LIBERO基准 → Teleop数据收集 →

任何VLA都能根据自己的演示进行调整.

收集演示 → 运行它的硬件 → 评分一个政策 →