Blogに戻る

視覚言語行動モデルが説明:VLAが現代ロボットにどのように力を貸すのか

VLA モデルとは? OpenVLA, pi0, RT-2 のような視覚言語行動モデルがどのように機能するか,伝統的なポリシーとはどのように異なるのか,および RCSV データでどのように調整するかについて学びましょう.

部分: [模倣学習ガイド]

視覚言語行動モデルは,GPT-4 の巨大,訓練済みの神経ネットワークに相当するロボットであり,幅広い物理的な作業を行うために細かく調整することができます.VLAが何であるか,どのように機能するか,そしていつ使うかを理解することは,現在,すべての真剣なロボット学者のための不可欠な知識です.

シリアリックバレーのロボットセンター

視覚言語 の 行動 モデル は 何 です か

視覚言語行動モデル (VLA) は,視覚観測 (カメラ画像) と自然言語の指示を入力として受け取り,ロボットアクションを 関節速度,エンドエフェクターポーズ,またはグリッパーコマンドを出力する神経ネットワークです. "視言語"の部分は,前訓練された脊椎を指す.これらのモデルは,Clipや視言語モデル (VLM) のようなイメージテキストペアで大規模なインターネット前訓練から視覚的および意味的理解を継承する. "アクション"の部分は,ロボット示範データで訓練された細かな調節頭です.

基礎知識は,インターネットデータでの予備訓練により,ロボットが物理世界の豊かな表現を与えることである. 対象はどのようなものなのか,空間的にどのように関係しているのか,言語の意味はどのようなものなのか. ロボットがデモを見たことのない前に,その表現をロボットの実施形態とターゲットタスクに適応させる. モデルは"青いカップを拾い上げ"や"左側のドラフトを開け"を理解しているため,ゼロから訓練されたポリシーよりも示例が少ない新しいオブジェクトやタスクフレーズに一般化できます.

VLAアーキテクチャ:三つの構成要素

各VLAは同じ3段階のアーキテクチャを共有していますが,実装は各段階の実現方法によって大きく異なります.

1.ビジョンエンコード: カメラ画像を視覚トークン配列に変換する.ほとんどのVLAは,先訓練のビジョントランスフォーマー (ViT) を使用する. 視覚エンコードは,インターネットプレトレーニングから最も直接的に転送される構成要素である. なぜなら,ウェブ画像から学んだ視覚的特徴 (オブジェクト認識,空間レイアウト,質感理解) は,ロボット認識に直接有用であるからです. 画像解像度の問題: 224x224は標準ですが,細粒度認識を制限します.一部のモデル (pi0) は,サブセンチメートル視力精度を必要とする作業では 384x384またはそれ以上のものを使用します.

2.言語条件の背骨: 言語指導トークンとともに視覚トークンを処理する大きな言語モデル.ここで意味論的推論が行われます. OpenVLAは LLaMA-2 7Bを使用し,RT-2は PaLM-E 55Bを使用し,pi0はカスタマイズされた 3Bのバックボーンを使用する.バックボーンサイズはモデルの推理能力と推論コストの両方を決定する.

3.アクションヘッド: 脊椎の出力をロボット専用アクションに変換します.これはVLAアーキテクチャを区別する重要なデザイン選択です:

  • トークン化されたアクション (RT-2, OpenVLA): 連続したアクションスペースをビーンに分けて (通常は1次元あたり256ビーン) 言語モデルのトークン予測ヘッドを使用してアクショントークンを予測する.言語モデルの既存の出力マシンを再利用するので実装が簡単です. 制限: diskretization は量子化エラー (~0.5mm の 256 缶で 12cm の作業空間) を導入し,多段階予測には自動退縮生成が必要であり,これは遅い.
  • 連続アクションレグレーション (Octo): 連続アクション値を直接予測する小さな MLP ヘッドを追加する.トークン化されたアプローチよりも遅延が低いが,言語モデルの一般化利点の一部を失う可能性があります.
  • フローマッチングアクションヘッド (pi0): 動力分布を連続流としてモデル化して,拡散のようなデノイズプロセスを用い,そこからサンプルを採取する.滑らかで連続的な動力軌道を生成する.巧妙な作業に最適だが,推論時間には50~100ms を追加する.

キーモデル比較

Model Parameters Action Head Training Data GPU for Fine-Tune Inference レイテンシ Access
RT-2 55B Tokenized Google internal + web TPU v4 pod (not public) ~1-2s per step Closed (Google)
RT-2-X 55B Tokenized Open X-Embodiment TPU v4 pod (not public) ~1-2s per step Closed (Google)
OpenVLA 7B Tokenized Open X-Embodiment (970K eps) 1x A100 80GB ~200ms per step Open source (HuggingFace)
Octo 93M Continuous (diffusion) Open X-Embodiment (800K eps) 1x RTX 4090 24GB ~50ms per step Open source (HuggingFace)
pi0 3B Flow-matching Proprietary (10K+ hours) Enterprise access only ~100ms per step Commercial (Physical Intelligence)

RT-2とRT-2-X:Googleのディープマインドベースライン

2023年にGoogle DeepMindがリリースしたRT-2 (ロボットトランスフォーマー2) は,視覚言語モデルをロボット制御に拡大することで質的に新しい機能がもたらされた最初の実証でした. RT-2は同時にウェブデータとロボット軌道を合わせた PaLI-Xビジョン言語モデルを共同調整し,新しい指示に従って物体特性について推論し,インターネットでのロボットデモで見たことのない物体に一般化できる政策を生産しました.

RT-2はVLAが思考の連鎖の推論を行うことができると示した. "流出を清めるために使うことができるもの"を拾い出すように頼まれたモデルは,スポンジを清掃と関連付けるよう明示されずに,現場からスポンジを特定した. 訓練分布を超えた意味的通用化という新興能力が VLAをクラシックな模倣学習政策とは質的に異なるものとする.

RT-2-Xは,オープンX-Embodimentデータセットのトレーニング (ロボット実施形態22の示例) を実施し,RT-2を拡張し,クロス-エンボディメントトレーニングが一般化を改善することを示した.複数のロボットからのデータで訓練されたポリシーが,単言語モデルよりも単言語モデルに優れているように,そのロボットデータのみで訓練されたポリシーよりも個々のロボットでより良いパフォーマンスを発揮する.

OpenVLA:オープンソースのスタートポイント

2024年にスタンフォードとバークレーの研究者によってリリースされたOpenVLAは,オープンソースのプリズマティックVLM (LLaMAをベースとする) を構築し,Open X-Embodimentデータセットのトレーニングによって, 22種類の実施形態から970kエピソードのロボットデモのコレクションを民主化しました. OpenVLAは,ほとんどの研究チームが今日使用する出発点です. それは完全にオープンソースで,文書がよく書かれていて,標準的な操作基準で強力なパフォーマンスを達成しているからです.

オーダーメイドタスクでOpenVLAを精細調整するには,HuggingFace LeRobotコンベンションでフォーマットされたデータセット,および数時間間のトレーニング期間のための単一の80GB A100または H100 GPUが必要です.結果のポリシーは,訓練で見られなかったシーン変異と新しいオブジェクトポジションに一般化することが驚くほど可能です.

# OpenVLA 細かな調節 (簡略化) # 要求: 1x A100 80GB, ~4時間200デモパイプをインストール openvla # LeRobot形式のデータフォーマット python スクリプト/変換_to_lerobot.py \ --input_dir svrc_demos/ \ --output_dir lerobot_dataset/ # 細かな調節 OpenVLA 作業 python finetune.py \model -- openvla/openvla-7b \ --dataset lerobot_dataset/ \ --task_name "pick_and_place_cups" \ --epochs 50 --batch\size_8 \ -e-5 -- \ \ \ \ \ \ _ 32 記憶力 # ロープットでOutputの効率を評価する \ \ \ ビデオ_checkpoint \ \ \ チェックポイント_50 \ \ チェックポイント_

RCSVの [データ収集サービス]T1) は,LeRobot対応のフォーマットでデータセットを生成し,OpenVLAの微調整を準備しています.

オクト:軽量代替品

Octo (Ghosh et al., 2024) は別のアプローチをとります.大きな言語モデルを拡大する代わりに,商品ハードウェアで動作するほど小さい目的で構築されたトランスフォーマーアーキテクチャを構築します.93Mパラメータでは,Octoは OpenVLAより75倍小さいし,RTX 4090 で50msで推論を実行します.

Octoは,トークン化されたアクションではなく,拡散アクションヘッドを使用し,よりスムーズな軌道を生成します.言語条件と目標画像条件の両方をサポートします (ロボットに言語で記述する代わりに,望ましいエンドステートの画像を表示します).A100アクセスのないチームまたはエッジハードウェアでリアルタイム推論を必要とするチームにとって,Octoは実践的な選択です. 200台のカスタムデモでOctoの調整は,単一のRTX 4090で約2時間かかります.

妥協点:Octoの小さな脊椎は意味力理解が少ない.RT-2ができる思考連鎖推理を実行することはできません.指示がシンプルである ("カップを拾い上げ") と新しいオブジェクトに一般化することが重要でないタスクでは,Octoの性能は計算コストのわずかな一部でOpenVLAに匹敵します. 複合的な言語理解やオブジェクトの性質についての推論を必要とするタスクでは,OpenVLAまたはより大きなモデルが必要である.

pi0: 物理知能の一般主義政策

物理知能 (pi.ai) から pi0 は VLAの開発の商業的な境界線を表しています. OpenVLAとは異なり,言語モデルのバックボーンを継承する pi0は,連続でスムーズなアクション軌道を生成するフローマッチングアクションヘッドを使用し, 離散トークン化されたアクションよりも巧妙な作業に適しています. pi0は数十のタスクとハードウェアプラットフォームで1万時間以上のロボットデモのプロパティナイトデータセットで訓練されました.

建築的に pi0 を区別するものは,言語条件による"遅い"推理経路と"速い"反応性モーター制御経路の分離である.これは二重プロセス制御システムに関する認知科学からの洞察を反映している.遅い経路は,タスク指示と現在のシーンを処理して,高レベルのプランを作成する.高速経路は低遅延のモーターコマンドを生成する. 長い視線推論と高周波反応制御の両方を処理できる政策です 洗濯物を折り畳むような作業の扉を開くため,両方が同時に必要となります

商業部署のために pi0へのアクセスは,Physical Intelligenceのエンタープライズプログラムを通じて利用できます. pi0スタイルアーキテクチャを探求するチームにとって,RCSVの ベンチマーク には標準操作スイートでのフローマッチングポリシーの評価が含まれ,トレーニング実行にコミットする前に期待されるパフォーマンスの基準点を提供します.

訓練データ要件

VLA の性能スケールは,訓練前のデータ多様性とタスク特有の細かな調整データ品質の両方で,公開された VLA 結果で観察された経験的スケール関係:

Scenario Fine-Tune Demos Expected Success Rate Notes
Zero-shot (no fine-tuning) 0 10-30% Works only if task is in pre-training distribution
Minimal fine-tuning 10-50 40-60% Sufficient for simple tasks with pre-trained backbone
Standard fine-tuning 50-200 70-85% Sweet spot for most tasks — best ROI on data collection
Heavy fine-tuning 200-1000 85-95% Diminishing returns above 500; variation matters more
Specialist fine-tuning 1000+ 90-98% Industrial deployment quality; may overfit to task

重要データ品質要件: デモには言語指示がメタデータとして含まれ,カメラのビューポイントは部署設定と一致し,デモには,ポリシーが直面するオブジェクトポーズとシーン構成の全範囲をカバーする必要があります.多様な構成を持つ200のデモのデータセットは,繰り返し構成を持つ500のデモを上回ります.

推移要件と展開

VLAの展開は計算上の問題である.推論要求はモデルごとに劇的に異なります.

  • Octo (93Mパラム): RTX 4090 (24GB VRAM) で20 Hz で動作する.TensorRT最適化により5-8 Hz で Jetson AGX Orin に展開できる.クロスエンボディメント一般化を維持する最小の VLA.
  • OpenVLA (7Bパラメータ): 5 Hz で完全精度推理のために A100 または H100 (80GB VRAM) を必要とする. 4 ビット量化 (GPTQ または AWQ) で,RTX 4090 に 3-4 Hz で適合する. LoRA 細かな調節によりメモリが ~ 40 GB に減少する.
  • RT-2 (55Bパラメータ): テンソールパラレル性を持つ複数のA100/H100GPUを必要とします.単ロボットの展開には実用ではありません.当初はGoogleの内部TPUインフラストラクチャで実行されました.
  • pi0 (3Bパラメータ): 展開のために最適化.A100またはそれと同等で10 Hzで動作する.Fisical Intelligenceは,複数のロボット展開のためのバッチリクエストを処理する推論サーバを提供します.

ほとんどの研究チームにとって,実践的な選択はOcto (安価で速く,能力が低い) と OpenVLA (高価で,速度が遅い,能力が高い) の間であります.タスクとデータパイプラインを検証するためにOctoから始め,よりよい言語理解や新しいオブジェクト一般化が必要な場合は OpenVLAにアップグレードします.

ゼロショット対フィニットチューニングパフォーマンス

練習者のための重要な質問です 調整がどれだけ重要か ゼロショットが十分であるのはいつですか?

ゼロショットが動作する時: 作業は一般的 (ピック・プレス,ドラフトオープン/クローズ),オブジェクトは訓練前のデータに表示される日常用アイテム,カメラの視角は標準的な研究設定 (第三者オーバーヘッドまたは目立) に類似し,言語指導はシンプルで曖昧です.

**** 作業にはカスタマイズされたハードウェアや異常なシナマティックが含まれる場合,オブジェクトは専門 (ラボ機器,工業部品),カメラの配置は標準でない場合,作業は,訓練前のモデルが達成する精度を超えた精度を必要とする場合,または部署環境はユニークな視覚的特性を備えている場合 (特定の照明,背景).

生産部署はほとんどすべて細かな調整が必要である.ゼロショット性能は,VLAがゼロショットモードでタスクを実行できない場合,作業はトレーニング配分から非常に遠く (細かな調整データが必要) またはVLA以外のアプローチによってよりうまく機能する可能性があります.

現行の制限

  • インフェレンスの遅延: 最も速いVLA (Octo 50ms) も,クラシックなポリシーよりも遅い (ACT 10ms,DDDIMで15msでの拡散ポリシー).
  • 連絡段階の性能: VLAは接近段階 (物体を識別,計画軌道を) で優れているが接触段階 (力規制,挿入,手操作) で苦労している.言語の脊髄は接触動力学にとって有用な先駆けを提供していない.ハイブリッドアプローチ VLAは接近,力/触覚政策 は現在のベストプラクティスである.
  • ハルシネーション: VLAは言語モデルと同様に,正しい行動が不確実である状況において自信のある行動を予測する"ハルシネーション"をすることができる.これは,ロボットが触れる物体が存在しないときに握る動きを実行したり,物理的に不可能な指示に従うように表される.安全層 (力制限,作業空間制限) は不可欠である.
  • トレーニングコスト: VLAをゼロからプリートレーニングするには,何百ものロボットデモと数百時間のGPUが必要です.OpenVLAを微調整するとしても,トレーニングランごとにクラウドコンピューティングで50~200ドルかかります.タスク定義を急速に繰り返すチームにとって,このコストは増加します.

標準的な模倣学習政策とは異なる

クラシックILポリシー (ACT, Difusion Policy,BC-Z はロボット示例データから完全に学習します.それらの視覚表現はゼロからまたは狭い予備訓練されたエンコード (R3Mまたは MVPのような) から学習されます.彼らはトレーニング配分の中でよく一般化しますが,新しいオブジェクト,照明変更,または目標を再発するタスク指示に苦労します. また,特定のパフォーマンスレベルを達成するために,より多くの示範が必要である.

VLAは一般化のために計算を交換する.GPUのクラシック ACTポリシーには,推論ごとにペニーがかかる.7Bパラメータモデルでの VLA推論ステップには,大 ukwuの数値が高くなる.環境や指示を広く一般化する必要があるタスクでは,VLAは勝利する. 狭い定義で繰り返し行われている産業作業では,環境を調節できる 1,000 以上のデモがあり,クラシックな方針は,コストが低くなってより高速で信頼性が高くなります.実践的な意思決定枠組み:あなたの作業に一般化が必要なら,VLA 脊髄から始めましょう.狭いと高出力であれば,クラシックな方針を最適化します.

RCSVデータによるVLAの微調整

RCSVはVLAの細かな調整プロジェクトに端から端までサポートを提供しています.私たちの [テレオペレーションインフラストラクチャ] (T4) は,同期されたマルチカメラビデオ,プロピオセプティブ状態,および 50HzでアクションラベルでRLDS/LeRobot形式でのデモをキャプチャします. データのセットのパイプラインにはエピソード品質フィルタリング (失敗した試行と躊躇を削除),カメラの校正メタデータ,タスク指示注釈などがあります 効果的な微調整のために必要なメタデータVLAはすべてです

規模でカスタムデータが必要なチームにとって,サンフランシスコ施設の管理された収集サービスは,操作タスクのライブラリを介して訓練されたオペレーターと毎日数百回のデモを制作できます.また,一般化可能なポリシーを実際に訓練するデータセットの範囲,変異軸,成功基準を定義するタスクデザインに関する相談も提供します. 試行プロジェクトは200回のデモで2,500ドルから開始し,全キャンペーンは1,000以上のデモで8,000ドルから開始します. [我々のチームに連絡してください]

関連: ロボットのための模倣学習 · ロボット学習のための分散政策 · ALOHAロボットガイド · データサービス · ベンチマーク