返回VLA Models

RT-X与OpenVLA:机器人基础模型的比较

比较谷歌DeepMind的RT-X家族与OpenVLA 7B <unk>架构,Open-X培训,许可,访问,硬件足迹以及要建立什么基础模型.

谷歌深度思维的RT-X家族启动了机器人控制的基础模型的当前时代.OpenVLA是开放式反释放,使7BVLA可访问每个实验室.

2026年4月更新 开放式重量vs关闭 开放式X训练

浏览所有模型 获取建议

TL;DR RT-X (包括RT-1-X和RT-2-X) 是谷歌深度思维公司内部的动作模型,训练在开放X-Embodiment. RT-1-X检查站在 Apache 2.0 版下发布,具有 JAX/TF 代码;RT-2-X 和后代模型是专有产品,无法用于外部部署. OpenVLA是社区专门建立的7B MIT许可后代,因为RT-2-X被关闭了,并且在几个参数较少的基准上超过RT-2-X.

为什么这次比较很重要

"RT-X"是一个家族,而不是单一模型,这种混乱会杀死很多采购对话.RT-1-X是35M参数变压器政策.Open X-Embodiment作者培训并开源以证明跨体化转移.RT-2-X是55B PaLI-X基于VLA,显示大型多模型模型可以做机器人控制零射击. RT-2-X从未发布,后来深思模型 (Gemini Robotics,RT-H) 仍然存在于谷歌内部.如果你正在评估"RT-X"作为自己的系统的基础,你真的在评估什么RT-X检查点是可用的?通常只针对OpenVLA,它被发布的端到端,含有权重,代码和适配器.

查看我们的 VLA模型目录, RT-X页面,或 OpenVLA页面.

一眼对比

Dimension RT-X family OpenVLA
Parameters RT-1-X ~35M · RT-2-X 55B (PaLI-X based) 7B
Backbone RT-1-X: EfficientNet + token learner + transformer. RT-2-X: PaLI-X multimodal LLM Llama-2 7B + DINOv2 + SigLIP
Action head Discretized action tokens (both variants) Discretized action tokens
Training data Open X-Embodiment (22 embodiments, ~970K traj) Open X-Embodiment (~970K traj)
Language conditioning Strong on RT-2-X, moderate on RT-1-X Strong (LLM-native)
Action space End-effector delta, configurable dim 7-DOF end-effector delta (extensible)
Inference hardware RT-1-X: single GPU. RT-2-X: multi-GPU inference cluster Single A100/H100/L40S bf16
Weights available? RT-1-X: yes. RT-2-X: no (proprietary) Yes, on Hugging Face
License RT-1-X: Apache 2.0. RT-2-X: closed MIT
Fine-tuning RT-1-X fine-tune supported. RT-2-X: no external access LoRA, QLoRA, and full fine-tune recipes published
Paper Open X-Embodiment paper (2023), RT-2 (arXiv:2307.15818) Kim et al., CoRL 2024 (arXiv:2406.09246)
Code github.com/google-deepmind/open_x_embodiment github.com/openvla/openvla

RT-X:这一切的起始者是家庭

RT-1-X 可用的

RT-1-X是Google原始RT-1架构的开放X-Embodiment重训:一个EfficientNet视觉背骨,一个FiLM语言调节器,一个代币学习器和一个输出微妙的变压器.它小 (~35M参数),快速,重量在Apache 2.0下拥抱面. 如果您的使用案例是使用法兰卡或谷歌机器人手臂进行移动操作,

RT-2-X 你不能得到的

RT-2-X是基于 PaLI-X 的55B VLA,谷歌以相同的Open X-Embodiment数据训练.它建立了论点,即大型VLM可以控制机器人,但重量从未发布.如果你在博客文章中读到"RT-X性能",请检查它们是否意味着35M RT-1-X或55B RT-2-X.这两者之间的差距巨大.RT-2-X是一个发表的参考,而不是一个你可以部署的模型.

开放VLA:开放的答案

开放VLA 专门用于关闭RT-2-X的差距.它是7B参数足以捕捉语言先驱,足以服务于一个高端GPU. [OpenVLA 纸]T5) 报告说,它在使用7×少参数的同时,在 LIBERO-Spatial, LIBERO-Object, LIBERO-Goal和 BridgeData V2上超过RT-2-X. 它使用Llama-2 7B LLM与DINOv2 + SigLIP视觉编码器,分辨出每维度的动作为256个桶,并使用相同的Open X-Embodiment corpus RT-X进行训练.

对于建造者来说更重要的是:OpenVLA 运输了LoRA细节调整配方,让团队在几个小时内适应该政策,而不是几天内,在单个80GB A100上的新机器人上.

许可和访问问题

这通常是决定性的因素.阿帕奇2.0下的RT-1-X是商业级的,但旧且小.RT-2-X完全不能获得许可.MIT下的OpenVLA是唯一的方法来获得商业可用的包中的 _RT-2-类_行为. 团队将在2026年运送真正的机器人 特别是 [仓库部署]T6) 或 [实验室自动化]T7) 安装需要明确的权利 几乎总是登陆OpenVLA或其衍生品之一.

硬件足迹

RT-1-X在一个GPU上以实时速度运行,并在一系列机器人上进行了演示,从Franka到Google Robot.它是轻量级的选项.OpenVLA需要bfloat16中的~16GBVRAM,通常在A100上运行在510Hz上,而没有量化,这对大多数操作都很好,但对于精巧的控制来说很紧密. 团队经常将OpenVLA与动作分量和低级阻抗控制器结合起来,以达到所需的循环速度.如果RT-2-X可用,则需要多GPU推理服务器.

当RT-1-X仍然有意义时

  • 你需要最小,最快的开放X基线,
  • 你在研究论文中比较跨体体转移,
  • 你在边缘硬件上运行, 7B模型不适用.

当OpenVLA是显而易见的选择时

  • 你想要使用RT-2类语言行为,
  • 你需要商业许可证路径 (MIT).
  • 你需要一个积极的社区运输 LoRA 适配器,量化变体,
  • 您计划在自己的电话数据上调整, OpenVLA的文档在下游使用方面比RT-X的文档实质上更好.

诚实的交易

DeepMind 继续推进内部模型远远超过RT-2-X,谷歌的生产机器人堆使用闭后代.OpenVLA is,无疑是RT-X系列中最好的开放权重基础模型.如果你需要任何成本的SOTA,并且可以与DeepMind合作,那就是一个不同的对话. 如果您正在构建产品,OpenVLA的MIT权重加上一个由Supabase托管的数据管道加上 [远程运营数据收集]T8) 是今天一个现实的堆.

基准和评估

两家模型家庭都在 LIBERO, 谷歌机器人 和 [RLBench](T11上发布数字.OpenVLA的 LIBERO号码都在纸上,可复制.RT-X的号码因变体而异.

在阅读涉及RT-X的基准索赔时,总是问三个问题:哪个RT-X变体 (RT-1-X或RT-2-X),Open X-Embodiment的体现子集用于评估,以及机器人是否是谷歌的现实世界WidowX或外部复制.根据这些选择,数字可以波动20个百分点. 开放VLA评估通常更容易解释,因为论文明确地介绍了检查点,协议和数据集分区.

调整和部署的食谱

沿线团队通常在开放X-Embodiment中调整较窄的任务组,仅选择与目标实施相关的轨迹,然后运行一个短的培训循环,将政策推出到他们的特定硬件上. RT-1-X培训代码成熟,但生产指导很少,大部分下游知识都在文献中,而不是食谱中.

官方存储库提供了LoRA细调示例,完整的细调示例,用于定制RLDS数据的数据集转换工具和几个受欢迎的机器人的参考配置.社区已添加了4位量化,vLLM服务和与 [LeRobot]T13的集成. 对于一个团队需要在不到一个月内从"我们有电话数据"转变到"我们在机器人上运行政策",

们在未来的时间里,

谷歌深思一直在内部反复RT-2-X.双子机器人和相关项目将基础模型为机器人论文扩展到更大的VLM和更紧密的配合到生产谷歌机器人.这些检查站都没有为外部部署提供,因此从构建者的角度来看,它们值得阅读,但不值得建立在. 开放VLA, pi0和LeRobot生态系统模型是开源工作的现实前进道路.

我们的建议

对于几乎每一个实际团队来说,OpenVLA是答案.它继承了RT-X的知识,在公共基准上匹配或超过RT-2-X,在MIT下拥有开放权重的船只,并且有一个活跃的细节调节生态系统.RT-1-X仍然是一个细微的基线,但你更有可能在2026年使用[Octo]T14) 或一个小的传播政策. RT-2-X是一个纸质参考,不要依靠它.

相关阅读 OpenVLA vs Octo → 散政策 vs ACT → 最佳VLA模型2026 → 开放X-Embodiment数据集 → OpenVLA模型页面 → RT-X模型页面 →

任何VLA都能根据自己的演示进行调整.

收集演示片 → 运行它的硬件 → 评分一个政策 →