预算上扩展VLA模型培训:100多个细节的教训
基于数据集与模型的交易, 基于现实预算的VLA细调游戏手册.
调整一个7B参数视觉语言行动模型听起来像只是一个边界实验室活动.如果您选择正确的基模型,正确的参数效率方法和正确的故障模式,则不会.我们已经学会了运行这个循环数百次.
发表于2026-04-03年,由
**TL;DR.***你不需要一个H100集群来调整一个有用的VLA.一个单个H100带有LoRA (或在较小的预算上QLoRA) 加上FlashAttention-2和梯度检查将在几百集中调整OpenVLA.Octo在下午调整24GB的消费卡.稀有的资源几乎从来没有FLOPs
预算的框架正确
在选择GPU或模型之前,把预算设置为一个单一的数字:每次"有用评估"的成本. 不是每期的成本,不是每次梯度步骤的成本,不是每次TFLOP的成本.有用的评估是一个成功的实际机器人推出,测量与固定的评估协议.每美元用于计算,工程师或数据都应该追溯到提高这一数字.
团队花了六周时间优化训练配方,以减少15%的墙钟时间,然后发现他们的评估协议无法区分两个政策,实际成功率差异20个百分点.一个有仪器的评估套件价值超过第二个GPU.
2. 根据数据集大小选择基模型,而不是根据声望
周五
对于您的示范数据集来说,Octo是正确的默认选择,当您的示范数据集是温和的 (每任务大约为500集),您的实施形式是单个已知的手臂,并且您不需要开放词汇语言调节.它在几个小时内在单个24GB的消费者GPU上调整,具有允许许可,并且比较大的VLA更宽容噪音数据. 它们的操作解码器很简单,
开放VLA
开放VLA是当你有500个示例,需要语言条件的行为,或者想从跨体体预训练中受益时的正确默认. 7B参数基则意味着你需要至少40GB A100或,理想情况下,80GB H100,以适合LoRA的批量.参考实现位于 [github.com/openvla/vlaopen]
其他
许多边界VLA (pi0和后代) 在最困难的任务上超过OpenVLA,但承担更重的计算和许可成本.对于大多数团队来说,这是早前优化.
通过300到600个精心整理的示范,可靠地超过1B到7B模型,而成本只占计算成本的小部分.
3. 参数效率微调:LoRA,QLoRA,当每个赢得时
洛拉
洛拉将可训练的小级r适配器矩阵连接到每个注意力和多层感知器重量,
鱼
什么时候才能完全调整
完全细调只能超过LoRA,只要 (a) 你有一个非常大的数据集 (>10k集,体现不同) 或 (b) 下游任务与预训练有所不同,以至于适配器无法弥合差距.对于大多数实践者来说,这些条件是不合适的.
4. 记忆和吞吐量技巧,实际上是重要的
闪光注意力-2
渐进的检查点
换取内存的计算.随着梯度检查点启动,7B模型的峰值激活内存大约在输出成本的20-30%下降了2.
混合精密训练
在Ampere和Hopper上使用bfloat16;在VLA细节调节上,更喜欢它而不是fp16以获得数值稳定性.除非你积极缺少内存,否则保持优化器状态在fp32.
通过积累的有效批量大小
如果你的硬件不能满足你的食谱所需的批量,请使用梯度积累来构建它.对于LoRA细调,有效的批量大小64-128通常是足够的;推高很少有帮助.
编译
PyTorch 2.x torch.compile 在大多数情况下,在没有代码变化的情况下,提供了10-25%的吞吐量,只要模型没有变形控制流.
5.计算选择:什么运行到哪里
| GPU | VRAM | OpenVLA (QLoRA) | OpenVLA (LoRA bf16) | Octo fine-tune | Typical use |
|---|---|---|---|---|---|
| RTX 3090 / 4090 | 24GB | Works, small batch | Tight, small batch | Comfortable | Solo researchers, prototypes |
| A6000 / L40S | 48GB | Comfortable | Works | Very comfortable | Small labs, shared workstation |
| A100 40GB | 40GB | Comfortable | Works, modest batch | Very comfortable | Cloud default, good value |
| A100 80GB / H100 80GB | 80GB | Large batch | Comfortable | Overkill | Production, multi-run sweeps |
云计算价格有很大的不同;如果您的训练循环容忍先决性,主要云上的现场实例将可靠地超过需求量40-70%.
6.数据集大小与模型大小:真正的交易
在100多个细节调度中,我们经验中,下游成功率的唯一最强大的预测因素是示范数据质量,而不是模型大小.第二强大的是任务适当的摄像头设置.
具体来说:在200个噪音,不一致标签的示范中调整的7B OpenVLA将在一个日后在同一200个示范中训练的小型Octo通常表现得不佳. 我们的策划和验证数据集位于[RCSV数据集目录]
假设你没有做好任何工作,你首先应该把三个假设都放在数据上. 糟糕的集局界限,不一致的行动正常化,摄像头在录音会话之间漂移,以及错误标签的成功标志,
评估:预算的另一半
通过"
- 快速检查智力. 廉价. 不预测现实世界成功.
- ** 在模拟中部署.**一个模拟环境,反映了你的真正任务. 作为预过
器,在燃烧机器人时间之前有用.我们的 [模拟到真实提示] T7 ) 涵盖了高查. - 根据"全球安全计划"的规定, 美国的安全部署将在200年内完成一次"全球安全计划".
对于没有专用评估机器人的团队, [RCSV租
8 预算类型
单独研究员 (每月0~500美元)
专注:一个任务,一个实施,严格评估.我们的 [LeRobot开始]
实验室 (每月2-5万美元)
通过云计算共享A600或A100.默认的 LoRA OpenVLA;快速
企业试点 (每月20-50万美元)
储备H100访问,在每个实验中建立多种种子扫描,投资专用数据库拉管道.在这个预算中,瓶
9.常见的陷
- 对于小数据集,LoRA适配器很快就会过度训练.在延期成功率上,提前停止比损失更重要.
- ** 行动正常化不匹配.** 如果你的数据集被记录在一个正常化中,然后你使用另一个,你会得到一个在纸上看起来很正常的政策,而在硬件上失败.
- 摄像头漂移. 外部校准在几个月内变化. 在每次主要数据收集运行之前重新校准.
- ** 事件边界错误.** 如果你的数据集有错误的段落, LoRA将尽职地学习错误的事情.
- 声称缺口* 如果您的持续评估有50次试验,并且您看到5%的差异,则您的测量噪音不是结果.
10 结尾说明
维拉微调游戏本不再仅用于研究实验室.Octo和OpenVLA加上LoRA加上单个使用良好的GPU足以为大多数单任务单体化问题产生出版质量结果.成功的团队与努力的团队的区别不是计算.它是处理数据,评估和硬件校准的学科,作为一流工程. 按照这些费用.
对于硬件,我们的 [
相关阅读: VLA模型解释, 远程运营数据质量检查清单, [开源机器人堆
11.常见问题
洛拉排名有什么关系?
排名16-32对大多数VLA细节调节有效.排名8有时在双手工任务上不足;排名64有时在小数据集上过度.如果你不确定,请从32开始,只需有特定的症状才能调整.
我们应该从零开始训练?
几乎从未.从零开始预训练7BVLA需要预算,使细节调整无关紧要.从OpenVLA或Octo检查站开始.从零开始训练的唯一情况是真正的新动作空间,没有任何开放的检查站.
我们如何决定训练结束时?
通过损失曲线来确定评估预算 (例如每一个检查点50次) 并在该指标上提前停止,以耐心的评估运行 1-3次.
关于扩散政策的内存使用呢?
扩散政策通常比VLA更轻,因为视觉背骨较小.一个24GB卡可舒适地训练它在大多数桌面任务上.瓶







