Researchに戻る

精細調整 ロボット 基礎 モデル: 実践 的 な ガイド

作業のデータ要件,トレーニング設定,期待されるパフォーマンス向上に合わせてロボット基盤モデル (OpenVLA,Octo, π0) を細かく調整する方法

[←研究]

ロボット基盤モデルでは新しいタスクに対してデータ要求を310×削減する.このガイドにはモデル選択,最小データ要求,トレーニング構成,期待される結果が含まれています.

なぜ 素直 な 列車 に 代わる の は なく 細かい 調子 を 調節 する の です か

操作政策をゼロから訓練するには,何千もの課題特有の示範が必要になります. 訓練された基礎モデルはこの方程式を劇的に変えます.

異なるインターネット規模での視覚データと何千ものロボットデモで訓練されたロボット基盤モデルは既に理解している:視覚的意味論 ("赤杯"と"青杯"),オブジェクトの提供 (カップはリムまたはボディで握ることができる),言語の定着 ("ピックアップ"と"プッシュ") と基本的なアクション先駆 (スムーズな軌跡,接近角度).

精細調整はこれらの先端を特定の作業に転送します. 結果は 310×サンプル効率:ゼロからトレーニングを行う場合,5,000回の示例が必要になりますが,基礎モデルを精細調整すると200500と比較されるパフォーマンスを得ます.この差は数週間のデータ収集と数日の違いを意味します.

基礎モデルオプション

  • OpenVLA (7Bパラメータ,LLaMA背骨,完全にオープンな重量) 2025年より細かな調節のための最もアクセス可能な基礎モデル. 強力なコミュニティ,文書化された細かな調節レシピ,アクティブ HuggingFaceページ.言語条件:フリーテキスト指示を受け入れます.視覚域間の最良の通用化. 推移:A100で6 Hz,RTX4090で2 Hz.
  • Octo (90Mトランスフォーマー +拡散アクションヘッド,完全にオープンな重量) 速度の推論 (25 Hz 単一のA100) と,微調整コストがOpenVLAより低い.拡散ヘッドは滑らかな軌道を生成する.OpenVLAよりも視界一般化が少ないが,内部配送作業に優れた. CoRL 2024で公開.
  • π0 (物理知能,フローマッチングアーキテクチャ,アクセス制限) 2025年初旬から精巧な操作基準の最新技術.フローマッチングは接触豊富な作業のための高品質の軌道を生成します.物理知能パートナーシッププログラムを通じてアクセス;この執筆時点では完全に開かれていません.精巧な操作 (折り畳み,組み立て) が目標である場合,最良の選択です.
  • RoboFlamingo / 3D-VLA 強力な3D空間推理を持つ新興代替品.正確な3D配置を必要とする課題のためにこれらのことをご覧ください.

データ要件

細かな調整とゼロから訓練のための最低示例数:

  • OpenVLAの細かな調整:作業の複雑さに応じて50500のデモ.シンプルなピックアンド・プレイス:50のデモはしばしば十分.複雑な多段階の組み立て:300500.腕に搭載されたカメラ +外部ビューで収集します.
  • Octofine-tuning: 2001,000 デモンストレーション.同じ作業のOpenVLAよりもデータに飢えているが,トレーニング速度が速い. 特にあなたの作業が BridgeData (タスクタップ操作) に似ている場合効率的です.
  • **ゼロから訓練 (ACT,拡散政策) **: 5,000~50,000のデモが,課題に応じて実施されました. ALOHA紙は,簡単な作業に50のデモ,複雑な双手作業に200のデモを使用しましたが,概括なしの強力な配布モデルです.
  • データ品質は量よりも重要だ.100人の専門家デモ (スムーズで一貫性があり,躊躇しない) は,中等な500人のデモよりも優れている. 最高品質のデータ収集のためにハプティックフィードバックを持つ遠隔操作システムを活用する.

訓練の設定

細かな調整のための実用的な計算要件:

  • OpenVLA 完全調整: 4×A100 80GB,約8時間500回のデモ,10,000の梯度ステップ.クラウド総コスト: Lambda Cloudまたは RunPodで~200400ドル.
  • LoRAとOpenVLA:ランク-16 LoRAは,最小限の性能損失 (通常は成功率差が5%未満で,完全な微調整と対照する) と,単一のA100 40GBに収まるメモリを削減します.トレーニング時間: 34時間.
  • Octofine-tuning: 1×A100 40GB, 200500のデモでは24時間. 適度な作業では最も費用対効果の高いオプション.
  • OpenVLA LoRA では HuggingFace <unk>T0 + <unk>T1 を使用します. <unk>T2 ライブラリでは Octo の細かな調節スクリプトが提供されています.ハードウェア評価を実行する前に,あなたの示範の20% を保持して検証してください.

期待 さ れ た 結果

Model Demos Required Expected Success Rate (Fine-Tune) Training from Scratch (Same Demos)
OpenVLA 100 55–70% 15–30%
OpenVLA 300 70–85% 35–55%
Octo 200 60–75% 20–40%
Octo 500 75–88% 45–65%
π0 (if available) 100 65–80% N/A (requires much more)

図は近似で,作業に依存する.はっきりとした視覚的区別を持つピックアンド・プレイスタスクは,高端にある. 精巧な操作 (布,変形可能な物体) は,低端にある.常に持ち物で検証する.

失敗 の 常見 な 方法

  • ** 災害的な忘れ** 精細調整は,訓練前の特徴を覆い,一般化を退化します.解決策: LoRA (ほとんどの重量を凍結する) を使用するか,精細調整ミックスに,訓練前のデータの小さな部分を追加します.
  • モード崩壊 政策は,オブジェクト多様性を無視して,単一の行動 (例えば,常に同じ角度から接近) に収束する.解決策:データセットの多様性を増加させ,拡張を加え (ランダム作物,色の振動),トレーニングオブジェクトの姿勢と方向性が異なることを確認する.
  • 過学習 政策はトレーニングデモを覚えています. 兆候:トレーニング成功率 >>80%だが,新作対象の成功率 <30%. 解決策:トレーニング中に持ち上げられた対象を検証し,早期停止を活用し,中断を追加する.
  • アクション配分不一致 ロボットのアクションスペース (関節角,エンドエフェクターポーズ) は,基礎モデルの予想されたフォーマットと一致しない. 細かな調整前に,ロボットのアクションスペースをモデルの予想されたインターフェースに注意深くマップします.

部署

配達した後に, 配達ハードウェアの推理速度を最適化します.

  • ONNX輸出 硬件無知的な展開のために OpenVLA または Octo を ONNX に輸出する. Python のオーバーヘッドを削減し,エッジ展開を可能にします.
  • JetsonのTensorRT はNVIDIA Jetson AGX OrinのONNXをTensorRTエンジンに変換する.OpenVLA LoRAモデルはINT8量子化でJetson AGX Orinで46Hzで動作する.
  • 量子化 INT8量子化によりモデルサイズは4×減少し,ほとんどの操作作業の成功率は<3%低下する.

[RCSVプラットフォーム] (T5) を介して細かな調整インフラストラクチャと収集されたデータセットにアクセスするか,高品質の示例収集のために,当社の [データ収集サービス] (T6) を探求してください.

RCSV データセットの調整を開始する

作業の基礎モデルを細かく調整するために キュレーティングされた操作データセット,GPUトレーニングインフラストラクチャ,評価環境にアクセスできます

[データサービスを探求]