返回Blog

预算上扩展VLA模型培训:100多个细节的教训

基于数据集与模型的交易, 基于现实预算的VLA细调游戏手册.

调整一个7B参数视觉语言行动模型听起来像只是一个边界实验室活动.如果您选择正确的基模型,正确的参数效率方法和正确的故障模式,则不会.我们已经学会了运行这个循环数百次.

发表于2026-04-03年,由谷机器人中心研究团队.

**TL;DR.***你不需要一个H100集群来调整一个有用的VLA.一个单个H100带有LoRA (或在较小的预算上QLoRA) 加上FlashAttention-2和梯度检查将在几百集中调整OpenVLA.Octo在下午调整24GB的消费卡.稀有的资源几乎从来没有FLOPs它是干净的,标签好的,装好的示范数据. 选择Octo,以选择小数据集和单个实施方案;选择OpenVLA,当你有500个集或需要语言调节时.

预算的框架正确

在选择GPU或模型之前,把预算设置为一个单一的数字:每次"有用评估"的成本. 不是每期的成本,不是每次梯度步骤的成本,不是每次TFLOP的成本.有用的评估是一个成功的实际机器人推出,测量与固定的评估协议.每美元用于计算,工程师或数据都应该追溯到提高这一数字.

团队花了六周时间优化训练配方,以减少15%的墙钟时间,然后发现他们的评估协议无法区分两个政策,实际成功率差异20个百分点.一个有仪器的评估套件价值超过第二个GPU.

2. 根据数据集大小选择基模型,而不是根据声望

周五

对于您的示范数据集来说,Octo是正确的默认选择,当您的示范数据集是温和的 (每任务大约为500集),您的实施形式是单个已知的手臂,并且您不需要开放词汇语言调节.它在几个小时内在单个24GB的消费者GPU上调整,具有允许许可,并且比较大的VLA更宽容噪音数据. 它们的操作解码器很简单,

开放VLA

开放VLA是当你有500个示例,需要语言条件的行为,或者想从跨体体预训练中受益时的正确默认. 7B参数基则意味着你需要至少40GB A100或,理想情况下,80GB H100,以适合LoRA的批量.参考实现位于 [github.com/openvla/vlaopen]T0. 我们的 VLA模型解释 帖子涵盖了建筑方面;我们的编辑列表位于 /vla-models/.

其他

许多边界VLA (pi0和后代) 在最困难的任务上超过OpenVLA,但承担更重的计算和许可成本.对于大多数团队来说,这是早前优化.

通过300到600个精心整理的示范,可靠地超过1B到7B模型,而成本只占计算成本的小部分.

3. 参数效率微调:LoRA,QLoRA,当每个赢得时

洛拉

洛拉将可训练的小级r适配器矩阵连接到每个注意力和多层感知器重量,结了基础.对于7B VLA,洛拉16-32级可训练参数减少了100倍,显著降低了内存,在我们的经验中,在大多数下游操纵任务上完全匹配了细调性能.

LoRA将冷的基模型加载到4位NF4量化中,并将LoRA适配器训练在顶部.它以小的吞吐量成本大约将LoRA的内存减半.QLoRA是使OpenVLA细调在单个A100 40GB或24-32GB的消费卡上实现的原因,这是我们对于没有H100访问的团队的建议.

什么时候才能完全调整

完全细调只能超过LoRA,只要 (a) 你有一个非常大的数据集 (>10k集,体现不同) 或 (b) 下游任务与预训练有所不同,以至于适配器无法弥合差距.对于大多数实践者来说,这些条件是不合适的.

4. 记忆和吞吐量技巧,实际上是重要的

闪光注意力-2

注-2是不可选的.使用与您选择的变压器库捆绑的版本.在1024代币背景的7B模型上,它通常会减少注意力内存3-4倍,并加快端到端训练20-40%.参考是[github.com/Dao-AILab/flash-attention]T3.

渐进的检查点

换取内存的计算.随着梯度检查点启动,7B模型的峰值激活内存大约在输出成本的20-30%下降了2.

混合精密训练

在Ampere和Hopper上使用bfloat16;在VLA细节调节上,更喜欢它而不是fp16以获得数值稳定性.除非你积极缺少内存,否则保持优化器状态在fp32.

通过积累的有效批量大小

如果你的硬件不能满足你的食谱所需的批量,请使用梯度积累来构建它.对于LoRA细调,有效的批量大小64-128通常是足够的;推高很少有帮助.

编译

PyTorch 2.x torch.compile 在大多数情况下,在没有代码变化的情况下,提供了10-25%的吞吐量,只要模型没有变形控制流.

5.计算选择:什么运行到哪里

GPU VRAM OpenVLA (QLoRA) OpenVLA (LoRA bf16) Octo fine-tune Typical use
RTX 3090 / 4090 24GB Works, small batch Tight, small batch Comfortable Solo researchers, prototypes
A6000 / L40S 48GB Comfortable Works Very comfortable Small labs, shared workstation
A100 40GB 40GB Comfortable Works, modest batch Very comfortable Cloud default, good value
A100 80GB / H100 80GB 80GB Large batch Comfortable Overkill Production, multi-run sweeps

云计算价格有很大的不同;如果您的训练循环容忍先决性,主要云上的现场实例将可靠地超过需求量40-70%.

6.数据集大小与模型大小:真正的交易

在100多个细节调度中,我们经验中,下游成功率的唯一最强大的预测因素是示范数据质量,而不是模型大小.第二强大的是任务适当的摄像头设置.

具体来说:在200个噪音,不一致标签的示范中调整的7B OpenVLA将在一个日后在同一200个示范中训练的小型Octo通常表现得不佳. 我们的策划和验证数据集位于[RCSV数据集目录]T5) 中,我们的[数据服务]T6) 团队进行策划任务.

假设你没有做好任何工作,你首先应该把三个假设都放在数据上. 糟糕的集局界限,不一致的行动正常化,摄像头在录音会话之间漂移,以及错误标签的成功标志,

评估:预算的另一半

通过"定"的VLA,我们建议使用以下三个评估模式:

  • 快速检查智力. 廉价. 不预测现实世界成功.
  • ** 在模拟中部署.**一个模拟环境,反映了你的真正任务. 作为预过器,在燃烧机器人时间之前有用.我们的 [模拟到真实提示]T7) 涵盖了高查.
  • 根据"全球安全计划"的规定, 美国的安全部署将在200年内完成一次"全球安全计划".

对于没有专用评估机器人的团队, [RCSV租计划]T9) 可以提供对校准硬件的评估时间,可用于审查员的请求和可复制性保证.

8 预算类型

单独研究员 (每月0~500美元)

专注:一个任务,一个实施,严格评估.我们的 [LeRobot开始]T10) 指南是最快的登山.

实验室 (每月2-5万美元)

通过云计算共享A600或A100.默认的 LoRA OpenVLA;快速代的Octo. 投入大量在每项任务的小型 (200-1000集) 策划数据集中. [比较机器人平台]T11) 在提交硬件之前.

企业试点 (每月20-50万美元)

储备H100访问,在每个实验中建立多种种子扫描,投资专用数据库拉管道.在这个预算中,瓶很少是计算;它是数据吞吐量和评估的严格性.我们的 [数据服务]T12) 团队处理为这个规模的团队构建数据集.

9.常见的陷

  • 对于小数据集,LoRA适配器很快就会过度训练.在延期成功率上,提前停止比损失更重要.
  • ** 行动正常化不匹配.** 如果你的数据集被记录在一个正常化中,然后你使用另一个,你会得到一个在纸上看起来很正常的政策,而在硬件上失败.
  • 摄像头漂移. 外部校准在几个月内变化. 在每次主要数据收集运行之前重新校准.
  • ** 事件边界错误.** 如果你的数据集有错误的段落, LoRA将尽职地学习错误的事情.
  • 声称缺口* 如果您的持续评估有50次试验,并且您看到5%的差异,则您的测量噪音不是结果.

10 结尾说明

维拉微调游戏本不再仅用于研究实验室.Octo和OpenVLA加上LoRA加上单个使用良好的GPU足以为大多数单任务单体化问题产生出版质量结果.成功的团队与努力的团队的区别不是计算.它是处理数据,评估和硬件校准的学科,作为一流工程. 按照这些费用.

对于硬件,我们的 [T14], 比较工具,和 买家指南 是测量程序的最快方法. 对于台级细节,我们的 教程 通过了具体的培训食谱. 当你准备好在规模上评估时, 联系我们.

相关阅读: VLA模型解释, 远程运营数据质量检查清单, [开源机器人堆2026T21),以及机器人学习的状态Q1 2026.

11.常见问题

洛拉排名有什么关系?

排名16-32对大多数VLA细节调节有效.排名8有时在双手工任务上不足;排名64有时在小数据集上过度.如果你不确定,请从32开始,只需有特定的症状才能调整.

我们应该从零开始训练?

几乎从未.从零开始预训练7BVLA需要预算,使细节调整无关紧要.从OpenVLA或Octo检查站开始.从零开始训练的唯一情况是真正的新动作空间,没有任何开放的检查站.

我们如何决定训练结束时?

通过损失曲线来确定评估预算 (例如每一个检查点50次) 并在该指标上提前停止,以耐心的评估运行 1-3次.

关于扩散政策的内存使用呢?

扩散政策通常比VLA更轻,因为视觉背骨较小.一个24GB卡可舒适地训练它在大多数桌面任务上.瓶通常是数据加载,而不是GPU内存.