精細調整 ロボット 基礎 モデル: 実践 的 な ガイド
作業のデータ要件,トレーニング設定,期待されるパフォーマンス向上に合わせてロボット基盤モデル (OpenVLA,Octo, π0) を細かく調整する方法
[←研究]
ロボット基盤モデルでは新しいタスクに対してデータ要求を3
なぜ 素直 な 列車 に 代わる の は なく 細かい 調子 を 調節 する の です か
操作政策をゼロから訓練するには,何千もの課題特有の示範が必要になります. 訓練された基礎モデルはこの方程式を劇的に変えます.
異なるインターネット規模での視覚データと何千ものロボットデモで訓練されたロボット基盤モデルは既に理解している:視覚的意味論 ("赤杯"と"青杯"),オブジェクトの提供 (カップはリムまたはボディで握ることができる),言語の定着 ("ピックアップ"と"プッシュ") と基本的なアクション先駆 (スムーズな軌跡,接近角度).
精細調整はこれらの先端を特定の作業に転送します. 結果は 3
基礎モデルオプション
- OpenVLA (7Bパラメータ,LLaMA背骨,完全にオープンな重量)
2025年より細かな調節のための最もアクセス可能な基礎モデル. 強力なコミュニティ,文書化された細かな調節レシピ,アクティブ HuggingFaceページ.言語条件:フリーテキスト指示を受け入れます.視覚域間の最良の通用化. 推移:A100で6 Hz,RTX4090で2 Hz. - Octo (90Mトランスフォーマー +拡散アクションヘッド,完全にオープンな重量)
速度の推論 (25 Hz 単一のA100) と,微調整コストがOpenVLAより低い.拡散ヘッドは滑らかな軌道を生成する.OpenVLAよりも視界一般化が少ないが,内部配送作業に優れた. CoRL 2024で公開. - π0 (物理知能,フローマッチングアーキテクチャ,アクセス制限)
2025年初旬から精巧な操作基準の最新技術.フローマッチングは接触豊富な作業のための高品質の軌道を生成します.物理知能パートナーシッププログラムを通じてアクセス;この執筆時点では完全に開かれていません.精巧な操作 (折り畳み,組み立て) が目標である場合,最良の選択です. - RoboFlamingo / 3D-VLA
強力な3D空間推理を持つ新興代替品.正確な3D配置を必要とする課題のためにこれらのことをご覧ください.
データ要件
細かな調整とゼロから訓練のための最低示例数:
- OpenVLAの細かな調整:作業の複雑さに応じて50
500のデモ.シンプルなピックアンド・プレイス:50のデモはしばしば十分.複雑な多段階の組み立て:300500.腕に搭載されたカメラ +外部ビューで収集します. - Octofine-tuning: 200
1,000 デモンストレーション.同じ作業のOpenVLAよりもデータに飢えているが,トレーニング速度が速い. 特にあなたの作業が BridgeData (タスクタップ操作) に似ている場合効率的です. - **ゼロから訓練 (ACT,拡散政策) **: 5,000~50,000のデモが,課題に応じて実施されました. ALOHA紙は,簡単な作業に50のデモ,複雑な双手作業に200のデモを使用しましたが,概括なしの強力な配布モデルです.
- データ品質は量よりも重要だ.100人の専門家デモ (スムーズで一貫性があり,躊躇しない) は,中等な500人のデモよりも優れている. 最高品質のデータ収集のためにハプティックフィードバックを持つ遠隔操作システムを活用する.
訓練の設定
細かな調整のための実用的な計算要件:
- OpenVLA 完全調整: 4×A100 80GB,約8時間500回のデモ,10,000の梯度ステップ.クラウド総コスト: Lambda Cloudまたは RunPodで~200
400ドル. - LoRAとOpenVLA:ランク-16 LoRAは,最小限の性能損失 (通常は成功率差が5%未満で,完全な微調整と対照する) と,単一のA100 40GBに収まるメモリを削減します.トレーニング時間: 3
4時間. - Octofine-tuning: 1×A100 40GB, 200
500のデモでは2 4時間. 適度な作業では最も費用対効果の高いオプション. - OpenVLA LoRA では HuggingFace <unk>T0
+ <unk>T1 を使用します. <unk>T2 ライブラリでは Octo の細かな調節スクリプトが提供されています.ハードウェア評価を実行する前に,あなたの示範の20% を保持して検証してください.
期待 さ れ た 結果
| Model | Demos Required | Expected Success Rate (Fine-Tune) | Training from Scratch (Same Demos) |
|---|---|---|---|
| OpenVLA | 100 | 55–70% | 15–30% |
| OpenVLA | 300 | 70–85% | 35–55% |
| Octo | 200 | 60–75% | 20–40% |
| Octo | 500 | 75–88% | 45–65% |
| π0 (if available) | 100 | 65–80% | N/A (requires much more) |
図は近似で,作業に依存する.はっきりとした視覚的区別を持つピックアンド・プレイスタスクは,高端にある. 精巧な操作 (布,変形可能な物体) は,低端にある.常に持ち物で検証する.
失敗 の 常見 な 方法
- ** 災害的な忘れ**
精細調整は,訓練前の特徴を覆い,一般化を退化します.解決策: LoRA (ほとんどの重量を凍結する) を使用するか,精細調整ミックスに,訓練前のデータの小さな部分を追加します. - モード崩壊
政策は,オブジェクト多様性を無視して,単一の行動 (例えば,常に同じ角度から接近) に収束する.解決策:データセットの多様性を増加させ,拡張を加え (ランダム作物,色の振動),トレーニングオブジェクトの姿勢と方向性が異なることを確認する. - 過学習
政策はトレーニングデモを覚えています. 兆候:トレーニング成功率 >>80%だが,新作対象の成功率 <30%. 解決策:トレーニング中に持ち上げられた対象を検証し,早期停止を活用し,中断を追加する. - アクション配分不一致
ロボットのアクションスペース (関節角,エンドエフェクターポーズ) は,基礎モデルの予想されたフォーマットと一致しない. 細かな調整前に,ロボットのアクションスペースをモデルの予想されたインターフェースに注意深くマップします.
部署
配達した後に, 配達ハードウェアの推理速度を最適化します.
- ONNX輸出 硬件無知的な展開のために OpenVLA または Octo を ONNX に輸出する. Python のオーバーヘッドを削減し,エッジ展開を可能にします.
- JetsonのTensorRT
はNVIDIA Jetson AGX OrinのONNXをTensorRTエンジンに変換する.OpenVLA LoRAモデルはINT8量子化でJetson AGX Orinで4 6Hzで動作する. - 量子化
INT8量子化によりモデルサイズは4×減少し,ほとんどの操作作業の成功率は<3%低下する.
[RCSVプラットフォーム] (
RCSV データセットの調整を開始する
作業の基礎モデルを細かく調整するために キュレーティングされた操作データセット,GPUトレーニングインフラストラクチャ,評価環境にアクセスできます
[データサービスを探求]







