Blogに戻る

予算で VLAモデルトレーニングをスケーリングする: 100+ の ファイナ・チューン から の 教訓

グラデントチェックポイント,FlashAttention,A100/H100 vs.消費者GPU,データセット vs.モデルトレードオフ リアルワールド予算でVLAの細かな調節プレイブック

調整は, 7Bパラメータの視言語行動モデルに限られた研究室での活動のように聞こえます. 正しいベースモデル,適切なパラメータ効率的方法,適切な失敗モードを最適化するには,それはありません.ここでは,このループを何百回実行することを学びました.

シリコンバレーの研究チームによる2026-04-03年発行

TL;DR. 役に立つVLAをフィニットチューニングするにはH100クラスタは必要ありません.LoRA (または小予算でQLoRA) を搭載した単一のH100とFlashAttention-2と梯度チェックポイントは,一晩間に数百回のエピソードでOpenVLAをフィニットチューニングします.午後は消費者の24GBカードにOctoのフィニットチューニングです.稀有資源はほとんど決してFLOPsではありません. 需要に応じて計算を購入する.データに構造的に投資する.小さなデータセットや単一の実施形態のために Octoを選択する.エピソード500以上または言語条件が必要である場合,OpenVLAを選択する.

1 予算を正しく設定する

GPU や モデル を 選べる 前 に,予算 を 単一 項 に 組み込む. "有用 な 評価" の 費用. "時代 の 費用, 梯度 の ステップ, TFLOP の 費用 は ない. 有用 な 評価 は,実用 な ロボット の 成功 の 展開 で ある.固定 な 評価 プロトコル に 基づいて 測定 さ れ て いる.計算,エンジニア,データ に 費やさ れる 費用 は,その 数値 の 改善 に 繋がる こと に 追いつく べき です.

チームでは,ウォールクロック時間の15%を削減するために6週間トレーニングレシピを最適化して,評価プロトコルが現実の世界での成功率で20%ポイントの差異を伴う2つのポリシーを区別できないことを発見します. ツールが備えた評価セットは,2番目のGPUよりも価値があります.

2. ベースモデルを評価するのではなく,データセットサイズによって選択する

オークト

Octoは,デモデータセットが控えめな場合 (タスクあたり約500エピソード),実施形態は単一の既知の腕であり,オープン語彙言語の条件付けは必要ありません.それは,単一の24GB消費 GPUに数時間で微調化します.許容的なライセンスがあり,より大きなVLAよりも騒音データに対して寛容です. 動作デコーダーはシンプルで 障害モードは診断が簡単です

オープンVLA

OpenVLAは,500以上のデモを実施し,言語条件付きの行動が必要とする場合,またはクロスエンボディメントのプレトレーニングから恩恵を受けたい場合,デフォルトの正しいものです. 7Bパラメータベースは,LoRAで快適なバッチサイズのために少なくとも40GB A100または,理想的には80GB H100が必要になると意味します.参照実装は [github.com/openvla/vlaopen]T0であります. VLAモデル説明 投稿は建築側面をカバーし,キュレーティングリストは /vla-models/ にあります.

pi0およびその他の

複数のフロンティア VLA (pi0および後代) は,最も困難な作業で OpenVLA を上回る性能が高く,より重い計算とライセンスコストを伴う.ほとんどのチームにとって,これは早期の最適化です.

モデルを倍にする前にデータセットを倍増する. 300~600のクレーティングの良いデモは,計算コストのわずかな部分で 1Bから 7Bモデルに移動するよりも信頼性のあるパフォーマンスです.

3.パラメータ効率の調整: LoRA, QLoRA,そして当選時

ロラ

LoRAは,それぞれの注意力とMLP重量に小さな訓練可能なランク-rアダプターマトリクスを結合し,ベースを凍結する. 7B VLAでは,ランク16-32を持つ LoRAは,訓練可能なパラメータを~100倍削減し,メモリを劇的に低下させ,私たちの経験では,ほとんどの下流操作作業で完全な細かな調節性能に匹敵します.新しいプロジェクトではランク-32設定はデフォルトです.

ローラ

QLoRAは,凍結されたベースモデルを4ビットNF4量化で読み込み,LoRAアダプターを上部に訓練します.小さな経路コストで約LoRAのメモリを半分に縮小します.QLoRAは,単一のA100 40GBまたは24-32GBの消費カードでOpenVLAの微調整を可能にするものであり,H100アクセスのないチームのために私たちの推奨です.Hugging Face PEFTライブラリは両方の方法をコードの数行にする.

完全に細かな調子をする時

完全細調は LoRA を 勝てるのは (a) 非常大データセット (>10k エピソード,実施形態様々) または (b) 下流作業は,訓練前の作業と十分に異なるため,アダプターがギャップを埋めることができない場合だけです.

記憶力と経路が重要な

閃電注意力-2

FlashAttention-2はオプションではありません.あなたの選択したトランスフォーマーライブラリに組み込まれたバージョンを使用してください. 1024トークンコンテキストを持つ7Bモデルでは,通常は注意力メモリを 3-4x削減し,端から端までトレーニングを 20-40%加速します.参照は [github.com/Dao-AILab/flash-attention]T3です.

段階的なチェックポイント

グラデントチェックポイントがオンになった場合,メモリの通路率が20~30%で7Bモデルでのピークアクティベーションメモリが約2倍減少する.

ミックスプレシッション訓練

Ampere と Hopper で bfloat16 を使って, VLA の 細かな音で数値安定のために fp16 に優先する. 記憶力 欠乏 を 積極的に 感じない限り, fp32 で 最適化 状態 を 保持する. 安定 配当 は 余計 の 記憶力 に 値する.

蓄積による有効な配分量

配方 の 配達 量 に 合わさ ない 硬 具 は,配達 量 に 合わさ ない の で は,配達 量 の 積分 を 使っ て 配達 する こと が でき ます.LoRA 精細 調節 に は,効果 的 な 64-128 の 配達 量 が 十分 に 十分 です.それ より 高い 量 を 押す こと は めった に 役立つ こと は ない.

編成する

PyTorch 2.x torch.compileは,ほとんどの場合,コードの変更はゼロで, 10~25%のループットを提供します. モデルには形の変化制御流がない限り. レシピごとに一度試してみる価値があります.

5.計算選択:何がどこに行っている

GPU VRAM OpenVLA (QLoRA) OpenVLA (LoRA bf16) Octo fine-tune Typical use
RTX 3090 / 4090 24GB Works, small batch Tight, small batch Comfortable Solo researchers, prototypes
A6000 / L40S 48GB Comfortable Works Very comfortable Small labs, shared workstation
A100 40GB 40GB Comfortable Works, modest batch Very comfortable Cloud default, good value
A100 80GB / H100 80GB 80GB Large batch Comfortable Overkill Production, multi-run sweeps

クラウド価格は大きく異なります. クラウド上のスポットインスタンスは,トレーニングループが優先順位を許容した場合,需要に応じて4070%に信頼性が高くなります. 再現可能性のために,1530分ごとにチェックポイントを推奨します.

6.データセットサイズ対モデルサイズ:実際のトレードオフ

テストの成功率の予測要因は デモデータ品質であり モデルサイズではなく 作業に適したカメラの設定です モデルサイズは3位です

具体的には,200の騒音で,不一致なラベルを付けているデモに細かく調節された7B OpenVLAは,キュレーションの1日後に同じ200のデモで訓練された小さなOctoよりも,定期的に劣っている.キュレーション作業は [テレオペレーションデータ品質チェックリスト]T4で詳細に説明されています. キュレーション・検証されたデータセットは [RCSVデータセット・カタログ] (T5) にあり, [データサービス] (T6) チームはキュレーション・エンゲージメントを運営しています.

効果が悪い場合 最初の3つの仮説は全てデータに関するものでなければなりません 悪いエピソード境界線,不一致なアクション正常化,録音セッション間のカメラ漂移,誤ったラベル付けの成功の標識は 診断したファイナティーン失敗の大部分の原因です

7 評価:予算の残りの半分

評価ループがない負債です. この順序で実行する3つの評価モードを推奨します.

  • オフラインアクション-MSE* 迅速な精神検査. 低価格. 現実の世界での成功を予測しない.
  • インシム・ロールアウト * リアルな作業を反映するシム環境. ロボット時間を燃やす前にプリフィルターとして有用です.
  • ロープを導入する ロープを導入する ロープを導入する ロープを導入する ロープを導入する ロープを導入する ロープを導入する ロープを導入する ロープを導入する

専用の評価ロボットを持たないチームにとって, [RCSVリースプログラム]T9) は,審査員の要求や再現性保証に役立つ校準ハードウェアの評価時間を提供することができます.

8 予算アーキタイプ

単独研究者 (月 0~500ドル)

クラウッドスポットは,時々より大きな実行のための.集中:1つのタスク,1つの実施形態,厳格な評価.私たちの [LeRobot開始]T10) ガイドは,ランプ上で最も速い.

実験室 (2~5千ドル/月)

クラウドを通じてA6000または共有A100を設定する. LoRA OpenVLAはデフォルトで,Octoは高速リターンで.タスクごとに小さな (200~1000話) のキュレーティングデータセットに大きく投資する.

企業パイロット (月20~50Kドル)

H100 アクセスを予約し,各実験に多種種を掃描し,データキュレーションパイプラインに投資する.この予算では,ボトルネックはほとんど計算されません.データ通量と評価の厳しさです.私たちの [データサービス]T12) チームは,この規模でのチームのためにデータセット構築を処理します.

9 常識の罠

  • Overtraining* LoRA アダプターは小さなデータセットで迅速にオーバーフィットします. 遅れた成功率で早期停止は損失よりも重要です.
  • アクションの正常化が一致しない. もしあなたのデータセットが1つの正常化で記録され,別の標準化で展開された場合,紙に健全に見えるポリシーが紙に失敗するポリシーが表示されます. 標準化を凍結してバージョンします.
  • カメラ漂移. 外部校正は数ヶ月間さまよっている. 大規模なデータ収集の実行前に再校正する. ロボットカメラの設定 を参照.
  • エピソード境界エラー.* データのセットに誤ったエピソードが集まった場合, LoRAは義務的に間違ったことを学ぶ.境界審査にリアルタイムを費やします.
  • 存在しない差を主張する. 長期評価が50回の試験で 5%の差が確認された場合,測定騒音が結果ではなく統計力予算になります.

10 締めくくりの注釈

VLAのフィントチューンプレイブックはもはや研究ラボのみではありません.OctoとOpenVLAとLoRAと単一のよく使用されたGPUは,単作業,単体化問題の多くに出版品質の結果を生成するのに十分です.成功するチームと苦戦するチームを区別するのは,計算ではありません. 適切な支出をする

ハードウェアについては, [店舗] (T14), [比較ツール] (T15), [購入者ガイド] (T16) は,プログラムをサイズにする最も速い方法です.ベンチレベルの詳細については, [教程] (T17) は特定のトレーニングレシピを通行します. 規模で評価する準備ができるとき, [連絡してください] (T18).

関連読み: VLAモデル説明, テレオペレーションデータ品質チェックリスト, オープンソースロボットスタック 2026,および ロボット学習の現状 Q1 2026.

11 頻繁に聞かれる質問

ロラランクが重要か?

ランク16-32はほとんどのVLAのフィニチューンのために有効です.ランク8は偶発的に二手作業に不足し,ランク64は偶発的に小さなデータセットに過剰です.確信がない場合は32から始め,特定の症状がある場合にのみ調整してください.

ゼロから訓練すべきか?

ゼロから7BVLAを訓練するには,細かな調整が不適切になる予算が必要です.OpenVLAやOctoチェックポイントからスタートします.ゼロからトレーニングを行う唯一のケースは,オープンチェックポイントがカバーされていない,真に新しいアクションスペースです.

訓練が終わったら どう決められるのか?

損失曲線ではなく,実用ロボットでの評価成功率により,理想的には,評価予算を設定し (例えばチェックポイントごとに50回のロールアウト) そのメトリックを早期停止し,耐心で1〜3回の評価を実行します.

拡散政策のメモリ使用はどうでしょう?

拡散ポリシーは,視覚の背骨が小さいため,VLAよりも軽いものです.単一の24GBカードは,ほとんどのタスクで快適に訓練します.ボトルネックは通常,GPUメモリではなくデータロードです.