Researchに戻る

VLA モデル比較: RT-2, OpenVLA, π₀ (パイゼロ), SmolVLA, RoboFlamingo (2025)

2025年のビジョン言語行動 (VLA) モデルの比較を完了する: RT-2,OpenVLA,π₀ (パイゼロ),SmolVLA,RoboFlamingo.パラメータ,トレーニングデータ,推論速度,ハードウェア要件,オープンソース状態,そしていつから訓練を調整するか.

[←研究]

ビジョン・言語・行動モデルが最も重要であることの実用的な比較 どれが,どのように異なるのか,そしてどのように選択するかについて

VLAはロボット操作を生成するために視覚認識における地面言語指示をモデル化します

ビジョン言語 LLM アクション

VLAモデルとは?

視覚言語行動モデル (VLA) は,視覚観測 (カメラ画像) と自然言語の指示を入力として受け取り,輸出としてロボット行動予測を生成する神経ネットワークです. 初期のロボット学習モデルから重要な違いは 言語条件化です.同じモデルは再訓練なしで異なる指示に従うことができ,純粋な模倣学習政策が達成できないタスク概括を可能にします.

典型的なVLAアーキテクチャは3つの要素を連結しています

  1. ビジョンエンコーダー: 原画ピクセル観測を特徴表示 (通常 CLIP ViT または SigLIP) に処理する
  2. 言語モデル背骨: 視覚トークンと言語トークンと共に受信し,両方を共同で理由とする,以前に訓練されたLLM (Llama, Gemma, PaLM, Flamingoスタイル)
  3. アクションヘッド: LLM アウトプットトークンをロボットアクション予測にマッピングする軽量デコーダー 抽象化されたアクショントークン (RT-2のような) または連続アクションベクター (OpenVLA,π₀ (パイゼロ))

前提は,視覚言語データに関するインターネット規模での予備訓練が,LLMの背骨を基にした世界知識を与え,ゼロから訓練よりもロボット特有のデータがはるかに少ないロボット操作に転送するということです.

5つの モデル: 知ら れる 必要

RT-2 (Google DeepMind, 2023)

RT-2 (ロボットトランスフォーマー2) は,Google DeepMindによってPaLI-X (55Bパラメータ) とPaLM-E (562Bパラメータ) の上に構築されたVLAです.ロボットデモでは,言語モデルと同じ語彙のテキストトークンとしてアクションを表現する大規模なビジョン言語モデルを端から端に細かく調節します. 結論付け時に新しい指示について考えることができるモデルです 結論付け時に"米チップを恐竜に移動する"と尋ねるのが目に見えないペアリングで作用します LLMは意味を理解しているからです

RT-2は新興推論能力を示した.思考連鎖は作業性能を改善し,モデルは実行中間に事実上の質問に答えることができる.しかし,それは閉源です. Googleは重量やトレーニングコードをリリースしていない.あなたは自分のロボットでRT-2を微調整することはできません. VLAパラダイムのための基準基準であり,ほとんどのラボに展開できるツールではありません.

OpenVLA (スタンフォード + UC バークレー, 2024)

OpenVLAは,完全にオープンソースで初めて使用された大規模VLAモデルである.プリズマティックVLM (7Bパラメータ,Llama 2 + SigLIPビジョンエンコードをベースとする) に構築され,Open X-Embodimentから970kのロボットデモに精密に調節されている.OpenVLAは,各次元に256本に分け,RT-2の公式に従って言語トークンとして予測する.

完全トレーニングレシピ,モデル重量,フィニットチューニングコードはHuggingFaceで公開されています.新しいタスクでフィニットチューニング OpenVLAは通常50200のデモを必要とし,A100で612時間かかります.モデルはA100で6Hzで推論を実行します (それは速いではありません. OpenVLA-OFT (2024) は LoRAの細かな調節サポートを追加し,細かな調節時間を24倍短縮します.

物理知能 (Physical Intelligence, 2024)

π₀ (パイゼロ)は,バーケルキーロボットコミュニティのセルゲイ・レヴィン,チェルシー・フィン,その他によって設立されたスタートアップであるフィジカル・インテリジェンス (pi.ai) のVLAです. π₀ (パイゼロ)は,離散アクショントークンではなくフローマッチングアクションヘッドを使用します.これはトークンベースのVLAよりもスムーズで,より巧妙な軌跡と高周波制御を可能にします. ベースモデルはパリゲーマ (3Bパラメータ) に基づいて,拡散インスピレーションによるアクション生成ヘッドを搭載しています.

π₀ (パイゼロ)は,オープンボートVLAでこれまで示されていないレベルでの実世界の巧妙な操作を実証することで知られています. 洗濯物を折り畳み,混雑したテーブルを掃除し,物体を組み立てます. 体重は 部分的に開いている ベース π₀ (パイゼロ)体重は研究用に使用できますが,細かな調節パイプラインと生産規模でのトレーニングデータは特許です. 物理知能は商業的な 調整サービスを提供します

スモル・VLA (HuggingFace, 2025)

SmolVLAは,VLA領域へのHuggingFaceの入場です.これは,消費ハードウェアで動作するように設計された故意に小さな効率的なVLAです.SmolVLAは,SmolLM2 (135M1.7Bパラメータ) を言語の骨髄として使用し,視覚のためにSigLIP-400Mとペアします. 総モデルは,設定に応じて450M2Bパラメータです.

SmolVLA は RTX 3090 で ~30 Hz で推測を実行し,企業GPU なしでリアルタイム ロボット制御のための最初の実用的な VLA になります.レロボット データセットで訓練され,レロボットトレーニングスタックとネイティブに統合されます. 性能は複雑なオープン語彙タスクでOpenVLA を遅いものとするが,細かいタスクドメインで調整後,それに匹敵または超えます. 限られた GPU 予算を持つラボでは,SmolVLAは最もアクセス可能な出発点です.

ロボフラミンゴ (北京技術研究所 + マイクロソフト研究, 2023)

RoboFlamingoは,ロボット操作のためにOpenFlamingo視言語モデル (9Bパラメータ,MPT-7B + CLIP ViT-Lに基づいて) を細かく調節する.RT-2とOpenVLAとは異なり,RoboFlamingoは,視力理解とアクション生成の両方で,独立したアクションヘッドなしで言語モデルを自動退化的に使用します. これは建築を非常に柔軟性のあるものですが,推論速度も遅い (A100で~35Hz) になります.

RoboFlamingoは主に研究貢献であり,生産準備の良いモデルではなく.その重要な洞察は,OpenFlamingoのコンテキスト内学習能力 (コンテキストウィンドウに直接いくつかの示例を供給) がロボット操作に移行するということです. この"コンテキスト内ロボット学習"は 本当に新しいもので フォローアップ作業では まだ未知です

比較表

Model Params Base LLM Training Data Inference Hz Open Source? Fine-tune?
RT-2 55B / 562B PaLI-X / PaLM-E RT-1 dataset + web 1–3 Hz No (Google internal) No
OpenVLA 7B Llama 2 + SigLIP Open X-Embodiment (970k) 6 Hz (A100) Yes (weights + code) Yes (LoRA / full)
π₀ (パイゼロ) ~3B PaliGemma pi.ai proprietary 10–25 Hz Weights (research) Via pi.ai (commercial)
SmolVLA 450M–2B SmolLM2 + SigLIP LeRobot datasets 30 Hz (RTX 3090) Yes (fully open) Yes (LeRobot native)
RoboFlamingo 9B OpenFlamingo (MPT-7B) Open X-Embodiment 3–5 Hz (A100) Yes (weights + code) Yes (+ in-context)

各モデルに付くハードウェア要件

Model Min GPU (inference) Recommended (inference) Fine-tuning GPU VRAM (inference)
RT-2 N/A (not available) TPU pod (Google) N/A N/A
OpenVLA RTX 3090 (slow) A100 40GB A100 80GB (full) / RTX 4090 (LoRA) ~16GB (BF16)
π₀ (パイゼロ) RTX 3090 RTX 4090 / A100 A100 40GB ~8GB (BF16)
SmolVLA RTX 3080 10GB RTX 3090 RTX 3090 / RTX 4090 2–6GB
RoboFlamingo A100 40GB A100 80GB 2× A100 80GB ~22GB (BF16)

行動表現: 重要な違い

各モデルはどのように行動を出力するかによって,どの作業をうまくやれ,どの程度速く実行できるかを決定します.

  • ** ディスクレートアクショントークン (RT-2, OpenVLA, RoboFlamingo):** アクションは,コンビン (通常,各次元に256) に量化され,LLMによってテキストトークンとして予測されます. LLMの完全な自動退縮機械と文脈内学習を活用できます.
  • 流量配合 (π₀ (パイゼロ)) の連続動力頭: 動作は,拡散による流量配合プロセスを通じて連続動力ベクトルとして予測されます. 滑らかで正確な軌跡と巧妙な制御を可能にします. 同等パラメータ数でトークンベースのモデルよりも高い周波数です.
  • ハイブリッドトークン+連続 (SmolVLA): 推理のための言語トークン; 行動のための連続輸出頭. 言語概括を制御精度とバランスします.

訓練 を 始める と し て 調整 する 時

訓練されたVLAを素早く訓練するには,Google,DeepMind,Physical Intelligenceだけが利用できる数百万のロボットデモと大規模な計算資源が必要です.

調節する時:

  • 目標作業は,訓練前のデータ (テーブル操作,ピックアンド・プレイス,キッチン作業) に似たスタイルです
  • 目標の 50 〜 500 回のデモがあります
  • ロボット形質は,オープンX-エンボディメントやLeRobotデータセットで表現されています
  • 作業カテゴリー内では合理的なゼロショット概要が必要

ゼロから電車 (またはVLA以外の政策を使用) を行う場合

  • 作業領域は 訓練前の作業とは 根本的に異なります (水下操作,外科ロボット工学,工業組み立て)
  • 動作空間は標準ではない (例えば水力,ケーブル駆動,>7 DoF手)
  • 作業の概率を制限する能力がある場合, ACTやゼロから訓練された拡散方針は,特定の狭い作業で精細調整されたVLAを上回る
  • 解釈性や安全性上の制約により,大きなLLM背骨が問題となる.

精細な調節 オープンVLA: 実践 的 な ステップ

OpenVLA は,独自の微調整を実行したい研究室にとって最もアクセス可能な出発点です.以下は最小限の作業流程です.

# Install OpenVLA dependencies
pip install openvla

# Fine-tune with LoRA (requires single RTX 4090)
python experiments/robot/finetune.py \
  --pretrained_checkpoint openvla/openvla-7b \
  --data_root_dir /path/to/your/lerobot/dataset \
  --dataset_name your_task_name \
  --run_root_dir ./runs \
  --use_lora True \
  --lora_rank 32 \
  --batch_size 16 \
  --num_steps 10000 \
  --learning_rate 2e-4

RTX 4090 で LoRA で 精細調整 時間を 期待する: 10k ステップ で ~6 時間, 100 回の 演示.完全な精細調整 に A100 80GB が 必要 で, 1824 時間 かかります.

スモルヴァーラ を 精細 に 調節 する: 実践 的 な ステップ

スモルVLAは LeRobotと直接統合され,ロボットで実行されている VLAへの最も速い経路になります.

python lerobot/scripts/train.py \
  policy=smolvla \
  env=aloha \
  dataset_repo_id=your-username/your-dataset \
  hydra.run.dir=outputs/train/smolvla_task \
  training.batch_size=32 \
  training.num_epochs=100 \
  policy.pretrained_backbone_kwargs.pretrained=true

どの モデル を 使う べき です か

SmolVLA を使用する場合は

  • 実験室には消費 GPU (RTX 3090または類似) が備わっている
  • あなたは既にLeRobotエコシステムを利用しています
  • 試行錯誤からロボット推論まで
  • 作業は比較的狭い (テーブル,一貫した照明,既知の物体)

OpenVLA を使用する

  • オープンソースの通用化性能が最高になる
  • A100やH100にアクセスできます
  • 訓練中に見られなかった新しいオブジェクトカテゴリーや指示式を 作業します
  • 基準値が公開された結果と比較したい

π₀ (パイゼロ) を考慮すると:

  • 操作の質が巧妙に 操作される必要があります (多指で接触が豊富です)
  • 物理知能を調整する
  • 作業には OpenVLA が提供できるより高い制御周波数が必要です

以下のような場合,RoboFlamingoを使用します.

  • 文脈内ロボット学習 (文脈ウィンドウの示例で新しい作業に適応する,格レーデント更新がない)
  • 作業のパフォーマンスを最適化する代わりに 短縮的な概要化について研究しています

参照 RT-2:

  • 基準値でVLAのパフォーマンスの理論上上上限を設定する
  • 文献関連作品 文献のVLA参照
  • システムに計画しないでください 展開できない

順利な細かな調節のためのデータ要件

試行錯誤の仕様を考慮して,このモデルを選択する際には,示範品質が最も重要な変数である.騒音や不一致性,または格式化が悪いデータに調整されたVLAは,清潔データに訓練された小さな非VLAポリシーよりも低性能である.

  • カメラ配置一貫性: VLAは,特定のカメラ構成の示範で訓練された.可能な限り近い対応,または細かな調整でカメラポーズ拡張を含む.
  • エピソードフォーマット: HDF5 (RLDS対応) またはLeRobotネイティブフォーマット.OpenVLAはRLDSを必要とします.SmolVLAはLeRobotを好みます.トレーニング前に変換します.
  • 言語注釈: 各エピソードには自然言語指示文字列が必要です.狭い作業では,タスクごとに固定的指示が機能します.一般化のために,収集中にフレーズを変更します.
  • 最小デモ数: SmolVLA: 50+; OpenVLA: 100+; π₀ (パイゼロ): 200+ 新しいタスクタイプ.

[データ収集サービス] T3) ALOHA, OpenArm, DK1ハードウェアで遠隔操作を提供します LeRobotとRLDSフォーマットで出力します VLAを完全に収集パイプラインを自分で構築せずに調整したいチームのために.

すべてのモデル → ACT対拡散政策 → OpenVLA対Octo →

評価について読むことは"つ 真のハードウェアに関する政策を証明することは"つ

実世界の評価を実行する → 委員会評価データ → あなたの評価装置のためのハードウェア →