Researchに戻る

ロボット操作のための基礎モデル: RT-2, OpenVLA, Octo, π0

2025年にロボット操作のための基礎モデルに関する調査 建築物,訓練データ,能力,展開考慮

[←研究]

ロボット操作のための大きな訓練前のモデルが どれだけのコストをかけて 調整し,どれだけの選択肢を 選ぶかについて

ロボット 基礎 モデル に なす

ロボット基盤モデルは,さまざまなロボット相互作用データ (そしてしばしばウェブデータ) で訓練された大きな神経ネットワークで,比較的少ない示範で新しいタスクに調整することができます. GPT-4または CLIPはドメイン特定 NLPまたはビジョンタスクにどのように調整できるのかと類似しています.

重要な性質は _ 移転性_:モデルは,明確に訓練されていない課題に適用されるオブジェクト,シーン,アクションの一般化表現を学んだ必要があります.多くの環境およびロボットタイプにおける100,000+以上の示範で予備訓練は,この一般化性を獲得するための主要なメカニズムです.

基礎モデルは,タスク特有の政策よりも普遍的に優れているわけではありません. 十分にスケーパングされた,単作業部署のために, 500~1,000つのタスク特有の示範でよく訓練されたACTまたは拡散政策は,精細な基礎モデルよりも優れているでしょう. 基礎モデルが効果的なのは,多くの新しい課題に迅速に適応する必要がある場合 (>3ヶ月あたり10つの新しい課題) または新しい課題に示例が少ない場合 (550ショット) です.

RT-2: ロボットトランスフォーマー 2

RT-2 (Google DeepMind, 2023) は最も引用されているロボット基盤モデルである.このモデルは,大きな視覚言語モデル (PaLI-X,55Bパラメータ) を細かく調整し,テキストとしてトークン化されたロボットアクションを同時に生成し,Web画像-テキストデータとロボット軌跡データを組み合わせてトレーニングします.

  • アーキテクチャ: PaLI-X VLM 脊椎で,アクショントークンが語彙に添付されている.アクションは,次元ごとに256つのビンのように分断され,テキストトークンとして解読されます.
  • トレーニングデータ: ~ RT-1データセット (Googleロボットキッチンタスク) から130Kのロボットエピソードと大規模なウェブテキスト/画像データ.ウェブデータは鍵です 対象とシーンを意味的に理解できるようにします.
  • キー結果: RT-2は新型オブジェクトで62%,ゼロショット一般化で新型背景では55%, RT-1の32%,それぞれ28%に成功する. "火を消すのに使用できるオブジェクトを拾い上げ"などの自然言語指示に反応する.
  • インフェレンスのコスト: 55Bパラメータを実行するには,マルチGPUサーバが必要です. 端末ハードウェアで展開できません.インフェレンスの遅延時間は13秒 . ロボット制御ループが遅い場合にのみ受け入れられます.
  • 制限: 閉ざされた重量 (Google 内).外部チームによって直接調整できない. 継承 SayCan2 は多段階のタスク計画に拡張されています.

オープンVLA

OpenVLA (スタンフォード + UC バークレー, 2024) は 2025 年より主要なオープンボートベースモデルである.これは,Open X-Embodiment データセットに細かく調節された DINOv2 + SigLIP ビジョンエンコードで7B パラメーター LLaMA-2 言語モデルに基づいている.

  • アーキテクチャ: プリズマティック VLM (LLaMA-2 7B + DINOv2 ビジョンエンコード). 代引き分別 (256 箱) を介してアクション出力. 入力: 512 × 512 画像 + 自然言語指導.
  • 訓練データ: オープンX-Embodimentデータセット 22つの研究機関における 22種類のロボットから100万以上のロボットエピソード.29の異なるロボット実施形態が代表された.
  • オープン・ウェイト: HuggingFace (openvla/openvla-7b) で公開されたモデル・ウェイト.標準 LoRA または消費ハードウェアで完全にフィーナティューニング可能.
  • ** 微調整コスト:** 1,000 つのタスク特有のデモで LoRA 微調整は,単一の A100 GPU で約48時間 (クラウドコンピューティングでは~500$~800$) を要する.完全な微調整には 48× A100 が必要である.
  • インファレンスの速度: ~500 ms/アクション A100 (7Bパラマ). 量化 INT4 バージョンは ~100200 msで実行されます. 最適化なしでは2 Hz > 制御には適していません.
  • パフォーマンス: BridgeV2 基準課題のRT-2と一致するまたは超え. 見えない課題で56%の成功を達成し,追加的な微調整はゼロ.

オークト

Octo (バークレー,2024) は,異なる建築的アプローチをとる:分散政策アクションヘッドを持つ小型トランスフォーマーモデル,完全にロボットデータ (ウェブデータなし) に訓練されている. これにより,細節調整と展開が速くなります.

  • 建築: 変換器観測エンコード (画像+自感+言語) + 拡散アクションヘッド. 総パラメータはVLMベースのアプローチよりも劇的に小さい.
  • 訓練データ: 800,000のロボットデモをオープンX-エンボディメント (質量にフィルタリング) から実施した.
  • インフェレンスの速度: ~30100 ms/アクション標準GPUで. 端末推論のためにNVIDIA Jetson AGX Orin (275 TOPS) で展開できます.
  • 精細調整: 1時間以内で精細調整された1000のデモは,単一のA100で.VLMベースのモデルよりもはるかに速い繰り返しのサイクル.
  • 制限: 自然言語の意味論やVLMベースのモデルを理解していない.ゼロショット新型オブジェクト概括で悪化.タスク特別の微調整データがあるシナリオではよりよい.

π0 (物理知能)

π0 (Physical Intelligence, 2024) は,巧妙な双手操作のための最も能力のある報告されたロボット基盤モデルである.このモデルは,トークン化されたアクション出力のいくつかの分辨なアーテファクトを回避するフローマッチングアクションヘッド (連続的正常化フロー変数) を使用する.

  • 建築: VLM背骨 (PaLI-Gemma) + フローマッチングアクションヘッド. 物理知能のロボット艦隊の独占データで訓練されています.
  • 能力: 洗濯物を折り畳み,テーブルバス,サンドイッチを作る上で示された 他のモデルに匹敵していない変形可能な物体で高濃度な双手作業.
  • 利用可能: オープン・ウェイトではありません. 物理知能の商業 API (アクセス制限,企業価格) を介して利用可能です. 自主ホストできません.
  • フローマッチングの利点: フローマッチングは,トークン化されたアクションアウトプットに必要な diskretization bin を回避し,特に高DOFの手作業や双手作業において重要な,よりスムーズで正確なアクションを可能にします.

能力の比較

Model Params Weights Zero-Shot Fine-Tune Cost Inference Speed Best For
RT-2 55B Closed Excellent N/A 1–3 s Google internal
OpenVLA 7B Open Good $500–$800 100–500 ms Open research, fine-tuning
Octo 93M Open Moderate <$100 30–100 ms Edge deployment, fast iteration
π0 ~3B Closed API Excellent Custom Unknown Dexterous bimanual
Task-specific ACT ~300M N/A None $50–$200 15–30 ms Single well-scoped task

部署に関する考慮事項

  • ** 量化:** OpenVLA INT8量化により,GPUメモリが14GBから7GBに減少し,性能低下は<5%に及びます. INT4 (4ビット) は812%の劣化により3.5GBに減少します.量化のためにビットとGBまたはGPTQを使用します.
  • Edge inference: Octo (93M params) は,NVIDIA Jetson AGX Orinで快適に実行できる唯一の現在の基礎モデルである.OpenVLAと π0にはサーバーが必要です.より大きなモデルのエッジデプロイメントのために,イーサネットでロボットに接続された共同位置のGPUサーバで推論を実行することを検討してください.
  • 精細な調整データ: 基礎モデルでさえも,特定の目標タスクとロボットに関する2001,000の示範から実質的に恩恵を受けています. 交叉体現の転送は不完全です

RCSV トレーニングプラットフォーム は,一クリックインターフェースでOpenVLAとOctoの微調整をサポートします.収集したデモを持ってきて,標準基準と比較して計算,超パラメータ検索,評価を処理します.

基礎モデルを 細かく調整する

RCSVは,作業特有の示範データで OpenVLAと Octoの管理された細かな調整を提供します. GPUのプロビジョニング,トレーニング,評価を担当します.

[スタートトレーニング →]