RT-X与OpenVLA:机器人基础模型的比较
比较谷歌DeepMind的RT-X家族与OpenVLA 7B <unk>架构,Open-X培训,许可,访问,硬件足迹以及要建立什么基础模型.
谷歌深度思维的RT-X家族启动了机器人控制的基础模型的当前时代.OpenVLA是开放式反释放,使7BVLA可访问每个实验室.
2026年4月更新 开放式重量vs关闭 开放式X训练
TL;DR RT-X (包括RT-1-X和RT-2-X) 是谷歌深度思维公司内部的动作模型,训练在开放X-Embodiment. RT-1-X检查站在 Apache 2.0 版下发布,具有 JAX/TF 代码;RT-2-X 和后代模型是专有产品,无法用于外部部署. OpenVLA是社区专门建立的7B MIT许可后代,因为RT-2-X被关闭了
为什么这次比较很重要
"RT-X"是一个家族,而不是单一模型,这种混乱会杀死很多采购对话.RT-1-X是35M参数变压器政策.Open X-Embodiment作者培训并开源以证明跨体化转移.RT-2-X是55B PaLI-X基于VLA,显示大型多模型模型可以做机器人控制零射击. RT-2-X从未发布,后来深思模型 (Gemini Robotics,RT-H) 仍然存在于谷歌内部.如果你正在评估"RT-X"作为自己的系统的基础,你真的在评估什么RT-X检查点是可用的?通常只针对OpenVLA,它被发布的端到端,含有权重,代码和适配器.
查看我们的 VLA模型目录, RT-X页面,或 OpenVLA页面.
一眼对比
| Dimension | RT-X family | OpenVLA |
|---|---|---|
| Parameters | RT-1-X ~35M · RT-2-X 55B (PaLI-X based) | 7B |
| Backbone | RT-1-X: EfficientNet + token learner + transformer. RT-2-X: PaLI-X multimodal LLM | Llama-2 7B + DINOv2 + SigLIP |
| Action head | Discretized action tokens (both variants) | Discretized action tokens |
| Training data | Open X-Embodiment (22 embodiments, ~970K traj) | Open X-Embodiment (~970K traj) |
| Language conditioning | Strong on RT-2-X, moderate on RT-1-X | Strong (LLM-native) |
| Action space | End-effector delta, configurable dim | 7-DOF end-effector delta (extensible) |
| Inference hardware | RT-1-X: single GPU. RT-2-X: multi-GPU inference cluster | Single A100/H100/L40S bf16 |
| Weights available? | RT-1-X: yes. RT-2-X: no (proprietary) | Yes, on Hugging Face |
| License | RT-1-X: Apache 2.0. RT-2-X: closed | MIT |
| Fine-tuning | RT-1-X fine-tune supported. RT-2-X: no external access | LoRA, QLoRA, and full fine-tune recipes published |
| Paper | Open X-Embodiment paper (2023), RT-2 (arXiv:2307.15818) | Kim et al., CoRL 2024 (arXiv:2406.09246) |
| Code | github.com/google-deepmind/open_x_embodiment | github.com/openvla/openvla |
RT-X:这一切的起始者是家庭
RT-1-X 可用的
RT-1-X是Google原始RT-1架构的开放X-Embodiment重训:一个EfficientNet视觉背骨,一个FiLM语言调节器,一个代币学习器和一个输出微妙的变压器.它小 (~35M参数),快速,
RT-2-X 你不能得到的
RT-2-X是基于 PaLI-X 的55B VLA,谷歌以相同的Open X-Embodiment数据训练.它建立了论点,即大型VLM可以控制机器人,但重量从未发布.如果你在博客文章中读到"RT-X性能",请检查它们是否意味着35M RT-1-X或55B RT-2-X.这两者之间的差距巨大.RT-2-X是一个发表的参考,而不是一个你可以部署的模型.
开放VLA:开放的答案
开放VLA 专门用于关闭RT-2-X的差距.它是7B参数
对于建造者来说更重要的是:OpenVLA 运输了LoRA细节调整配方,让团队在几个小时内适应该政策,而不是几天内,在单个80GB A100上的新机器人上.
许可和访问问题
这通常是决定性的因素.阿帕奇2.0下的RT-1-X是商业级的,但旧且小.RT-2-X完全不能获得许可.MIT下的OpenVLA是唯一的方法来获得商业可用的包中的 _RT-2-类_行为. 团队将在2026年运送真正的机器人
硬件足迹
RT-1-X在一个GPU上以实时速度运行,并在一系列机器人上进行了演示,从Franka到Google Robot.它是轻量级的选项.OpenVLA需要bfloat16中的~16GBVRAM,通常在A100上运行在5
当RT-1-X仍然有意义时
- 你需要最小,最快的开放X基线,
- 你在研究论文中比较跨体体转移,
- 你在边缘硬件上运行, 7B模型不适用.
当OpenVLA是显而易见的选择时
- 你想要使用RT-2类语言行为,
- 你需要商业许可证路径 (MIT).
- 你需要一个积极的社区运输 LoRA 适配器,量化变体,
- 您计划在自己的电话数据上调整,
OpenVLA的文档在下游使用方面比RT-X的文档实质上更好.
诚实的交易
基准和评估
两家模型家庭都在 LIBERO, 谷歌机器人 和 [RLBench](
在阅读涉及RT-X的基准索赔时,总是问三个问题:哪个RT-X变体 (RT-1-X或RT-2-X),Open X-Embodiment的体现子集用于评估,以及机器人是否是谷歌的现实世界WidowX或外部复制.根据这些选择,数字可以波动20个百分点. 开放VLA评估通常更容易解释,因为论文明确地介绍了检查点,协议和数据集分区.
调整和部署的食谱
沿线团队通常在开放X-Embodiment
官方存储库提供了LoRA细调示例,完整的细调示例,用于定制RLDS数据的数据集转换工具和几个受欢迎的机器人的参考配置.社区已添加了4位量化,vLLM服务和与 [LeRobot]
们在未来的时间里,
谷歌深思一直在内部反复RT-2-X.双子机器人和相关项目将基础模型为机器人论文扩展到更大的VLM和更紧密的配合到生产谷歌机器人.这些检查站都没有为外部部署提供,因此从构建者的角度来看,它们值得阅读,但不值得建立在. 开放VLA, pi0和LeRobot生态系统模型是开源工作的现实前进道路.
我们的建议
对于几乎每一个实际团队来说,OpenVLA是答案.它继承了RT-X的知识,在公共基准上匹配或超过RT-2-X,在MIT下拥有开放权重的船只,并且有一个活跃的细节调节生态系统.RT-1-X仍然是一个细微的基线,但你更有可能在2026年使用[Octo]
相关阅读 OpenVLA vs Octo →
任何VLA都能根据自己的演示进行调整.







