返回Research

机器人操纵的基础模型:RT-2,OpenVLA,Octo和 π0

2025年机器人操纵的基础模型调查 建筑,培训数据,能力和部署考虑.

现在大型预先训练的机器人操纵模型的现状 它们能做什么, 它们需要多少钱来调整,

机器人基础模型的组成部分

机器人基础模型是一个大型神经网络,预先训练在各种机器人交互数据 (通常是网络数据) 上,可以通过相对少的示范调整到新的任务.类似于GPT-4或CLIP如何调整到特定域的NLP或视觉任务.

关键属性是_转移性:模型必须学会了对象,场景和行动的可普遍表示,这些表示适用于未经明确训练的任务.在许多环境和机器人类型中的100,000+个示范上预训练是获得这种可普遍性的首要机制.

基础模型并不普遍优于任务特定政策.对于一个任务部署的良好规模,在5001,000个任务特定示范上训练有素的ACT或传播政策将超过一个精细调整的基础模型. 基础模型在需要快速适应许多新任务 (>每季度10个新任务) 或在一个新任务的演示非常少时会产生效果 (550次).

机器人变压器2

RT-2 (Google DeepMind, 2023) 是最常引用的机器人基础模型.它调整了大型视觉语言模型 (PaLI-X,55B参数) 来同时输出作为文本代码的机器人操作,同时训练了Web图像-文本数据和机器人轨迹数据的组合.

  • 建筑: PaLI-X VLM 脊柱,与动作代币附加到词汇库.动作分为每维度256个桶,并被解码为文本代币.
  • 训练数据: ~130K来自RT-1数据集 (谷歌机器人厨房任务) 的机器人集,加上大量的网页文本/图像数据.
  • 关键结果: RT-2 在新物体上取得了62%,在零射击通用的新背景上达到55%,而 RT-1则分别达到32%,28%.它可以响应自然语言指令,如"挑选可以用于灭火的物体".
  • ** 输入成本:** 运行55B参数需要多GPU服务器.不能在边缘硬件上部署. 输入延迟13秒 仅适用于较慢的机器人控制循环.
  • 限制: 关闭权重 (谷歌内部). 无法直接由外部团队调整. 继任者SayCan2扩展到多步骤任务规划.

开放VLA

开放VLA (斯坦福+UC Berkeley, 2024) 是2025年以开放权重机器人基础模型的领先型号. 它基于7B参数LLaMA-2语言模型,具有DINOv2 + SigLIP视觉编码器,在开放X-Embodiment数据集上进行了细节调整.

  • ** 架构:** 亲密VLM (LLaMA-2 7B + DINOv2视觉编码器). 通过代币化分辨率 (256个桶) 执行输出. 输入: 512×512图像 + 自然语言指令.
  • 培训数据: 开放的X-Embodiment数据集 来自22个研究机构的22种不同机器人类型的100多万个机器人集.
  • 开放权重: 在 HuggingFace (openvla/openvla-7b) 上发布的模型权重.
  • ** 精细调节成本:** 在1,000个任务特定示范中,LoRA精细调节需要大约48小时在单个A100GPU上 (云计算中约500美元800美元).
  • ** 输入速度:** 500 ms/动作A100 (7B参数). 量化INT4版本运行在100200 ms. 不适合在没有优化的情况下控制2 Hz.
  • **性能:**与BridgeV2基准任务的RT-2相匹配或超过. 在未见的任务中获得56%的成功,并且没有额外的细节调整.

周五

据悉,Octo (伯克利,2024) 采用了不同的建筑方法:一个较小的变压器模型,具有扩散政策行动头,完全基于机器人数据 (没有网页数据).这使得更快地调整和部署.

  • **建筑:**变体观测编码器 (图像+自感+语言) +扩散行动头.总参数大约93M 比基于VLM的方法小得多.
  • 培训数据: 800,000 个机器人示范机器人从开放X-Embodiment (过质量).
  • ** 传输速度:** ~30100ms/动作在标准GPU上.可在NVIDIA Jetson AGX Orin (275 TOPS) 部署用于边缘传输.
  • **精细调节:**在1小时内调整了1000个示例,在单个A100上.比基于VLM的模型更快的代周期.
  • 限制: 不了解自然语言语义以及基于VLM的模型. 较差的是零击的新物体通用化. 较好用于具体任务细节调节数据的场景.

(物理智能)

π0 (物理智能, 2024) 是最有能力的报告机器人基础模型,用于巧妙的双手操作.它使用了相匹配流量的动作头 (一种连续正常化的流量变体),以避免一些标记式动作输出的分辨器件.

  • **建筑:**VLM脊柱 (PaLI-Gemma) + 流量匹配动作头.
  • 能力: 通过洗衣,桌子,做三明治 度双手工任务,使用其他模型无法匹配的可变物体.
  • 可用性: 不开放权重.可通过物理智能的商业API (限量访问,企业定价). 不自主托管.
  • **流量匹配优势:**流量匹配避免了代币化操作输出所需的分辨容器,从而使得操作更加顺利和精确,特别重要的是高DOF手动和双手动任务.

能力比较

Model Params Weights Zero-Shot Fine-Tune Cost Inference Speed Best For
RT-2 55B Closed Excellent N/A 1–3 s Google internal
OpenVLA 7B Open Good $500–$800 100–500 ms Open research, fine-tuning
Octo 93M Open Moderate <$100 30–100 ms Edge deployment, fast iteration
π0 ~3B Closed API Excellent Custom Unknown Dexterous bimanual
Task-specific ACT ~300M N/A None $50–$200 15–30 ms Single well-scoped task

部署问题

  • **量化:**OpenVLA INT8量化将GPU内存从14GB减少到7GB,性能降低5%以下.INT4 (4位) 降低到3.5GB,降低812%.使用位数和字节或GPTQ进行量化.
  • 边缘推理: Octo (93M参数) 是目前唯一在NVIDIA Jetson AGX Orin上舒适运行的基础模型.OpenVLA和 π0需要服务器.对于更大的模型的边缘部署,请考虑在以太网连接到机器人的共处GPU服务器上运行推理.
  • **精细调节数据:**即使是基础模型也从具体目标任务和机器人上的2001,000个示范中得到了很大的好处.

通过单击接口支持OpenVLA和Octo细调. 带来收集的示范,我们处理计算,超参数搜索和评估标准基准.

调整数据的基础模型

RCSV为您的任务特定示范数据提供了管理的OpenVLA和Octo细调. 我们处理GPU配置,培训和评估.

开始训练 →]