返回Research

精细调节机器人基础模型:一个实用的指南

如何调整机器人基础模型 (OpenVLA,Octo, π0) 如何对您的任务进行调整?

[←研究]T4)

机器人基础模型将对新任务的数据需求减少310x.本指南涵盖模型选择,最低数据要求,培训配置和预期结果.

为什么要调整,而不是从零开始

训练从零开始操纵政策需要数千次具体任务的示范.

基于互联网规模的多种视觉数据和数千个机器人示范的机器人基础模型已经理解了:视觉语义 ("红杯"与"蓝杯"),对象的供应 (杯子可以通过边缘或身体抓住),语言的定位 ("取"与"推"),以及基本的行动前者 (光滑的轨迹,接近角).

调整细节将这些先进转移到您的具体任务.结果是 310×样本效率:从零开始的训练可能需要5000次示范,调整基础模型通常会达到200500的性能. 这意味着数据收集的几周与几天.

基础模型选择

  • OpenVLA (7B参数,LLaMA背骨,完全开放的权重) 最容易获得的基础模型,从2025年开始进行细调.强大的社区,文档良好的细调配方,活跃的HuggingFace页面.语言条件:接受自由文本指令.视觉领域中最好的通用化.A100上6 Hz,RTX4090上2 Hz.
  • Octo (90M变压器+扩散动作头,完全开放的重量) 更快的推断 (25Hz在单个A100上) 和较低的细调成本比OpenVLA.扩散头产生了平滑的轨迹.视觉通用性较少于OpenVLA,但对于内部分销任务非常好.
  • π0 (物理智能,流量匹配架构,限制访问) 2025年初对精巧操纵基准的最新技术.流量匹配为接触丰富的任务产生高质量的轨迹.通过物理智能合作计划访问;截至此撰文,尚未完全开放.最好的选择是精巧操纵 (折叠,组装) 是目标.
  • RoboFlamingo / 3D-VLA 具有强大的3D空间推理的新兴替代方案.

数据要求

微调和从零开始训练的最低示范数:

  • OpenVLA精细调度:根据任务复杂性进行50500次示范.简单的选择和放置:50次示范通常足够.复杂的多步组装:300500次.使用手腕安装的摄像头+外部视图收集.
  • Octo精细调:2001,000次示范.比OpenVLA略有更多的数据渴望,但训练更快.特别有效,当你的任务类似于BridgeData (桌面操作).
  • **从零开始的培训 (ACT,传播政策) **:根据任务进行5000~50,000次示范.ALOHA纸使用了50个示范,用于简单任务,200个用于复杂的双手动;但这些是强大的分布式模型,没有通用化.
  • 数据质量比数量更重要. 100个专家示范 (顺利,一致,无犹) 比500个中等的示范更高. 使用具有触觉反的远程操作系统来收集高质量的数据.

培训设置

细调的实际计算要求:

  • OpenVLA 完整调整: 4×A100 80GB,大约8小时用于500个示范,10,000个梯度步骤. 云总成本: Lambda Cloud或 RunPod 约200400美元.
  • LoRA的OpenVLA:Rank-16 LoRA将内存降低到适合单个A100 40GB的性能损失最小 (通常是5%的成功率差异,而完全的细节调节).训练时间:34小时.
  • 果调整: 1×A100 40GB, 200500次示范的时间为24小时.
  • 通过HuggingFace <unk>T0 + <unk>T1来使用OpenVLA LoRA. 库 <unk>T2提供Octo细调脚本. 在运行硬件评估之前,验证您的示范的20%

预期结果

Model Demos Required Expected Success Rate (Fine-Tune) Training from Scratch (Same Demos)
OpenVLA 100 55–70% 15–30%
OpenVLA 300 70–85% 35–55%
Octo 200 60–75% 20–40%
Octo 500 75–88% 45–65%
π0 (if available) 100 65–80% N/A (requires much more)

编号是近似的,依赖于任务. 清晰的视觉区分的选择和位置任务在高端. 精致的操纵 (布料,可变形的物体) 在低端. 始终验证在被持有物体.

常见的失败方式

  • 解决方案:使用LoRA (结大多数重量) 或添加小部分预训练数据到您的精细调节混合.
  • 解决方案:增加数据集的多样性,增加增强 (随机作物,色彩),确保训练对象的姿势和方向不同.
  • 标志:训练成功率 >>80%但新项目成功率 <30%.解决方案:在训练期间验证已被保留的物体,使用早期停止,添加退休.
  • ** 动作分布不匹配** 机器人的动作空间 (关角,终端效应器姿势) 不符合基础模型的预期格式. 在细调之前,仔细地将机器人的动作空间映射到模型的预期界面.

部署

在细调后,优化您的部署硬件的推断速度:

  • ONNX出口 出口OpenVLA或Octo到ONNX用于硬件无知性部署.减少Python的上海费用,实现边缘部署.
  • ** Jetson 的 TensorRT** 转换 ONNX 为 NVIDIA Jetson AGX Orin 的 TensorRT 发动机.
  • 量化 INT8量化减少模型大小4x,大多数操纵任务的成功率下降<3%.

通过 [RCSV平台]T5访问细调基础设施和收集的数据集,或者探索我们的 [数据收集服务]T6) 进行高质量的示范收集.

开始对RCSV数据集进行精细调节

访问精选的操纵数据集,GPU训练基础设施和评估环境,以对您的任务进行细节调整的机器人基础模型.

[查看数据服务]