Guidesに戻る

VLAモデル比較 (2026): OpenVLA, π0, SmolVLA, Octo & RT-2

チェックポイントアクセス,アクション表示,計算,データ互換性,評価プロトコルによるVLAモデルを比較する. OpenVLA, π0, SmolVLA, Octo, RT-2をカバーする.

このガイドを使用してチェックポイントアクセス,アクション表示,推論計算,ロボットデータ互換性,および各報告結果を生成した評価プロトコルによってビジョン言語行動モデルをショートリストにします.

2026年7月26日更新された · RCSV研究チーム

直接的な答え

ロボットチームが選ぶべきVLAモデルは?

標準的なベストVLAは存在しない.まずチェックポイントにアクセスし,調整できるかどうかによって選択し,次にアクション表示,遅延予算,サポートされるロボットデータフォーマット,およびタスクレベル評価でのパフォーマンスを別にしてください.論文の見出しスコアは,これらの展開制限を覆してはならない.

**証拠基準:**建築とアクセス事実は,文書や公式資料庫と比較して検証されます.異なるデータセット,ロボット実施形態,ハードウェア,プロトコルから公開されたスコアは直接比較できない.推定と不可利用の測定はラベル付けされます.

  • [OpenVLA vs Octo]
  • [VLAモデルを閲覧する]
  • [互換性のあるデータセットを見つけること]
  • [基準基準プロトコルレビュー]

VLAモデルとは?

視覚言語行動モデル (VLA) は,視覚観測と言語指示をロボット行動に映射する神経ネットワークである.核心アイデアは:前訓練された視覚言語モデル ( 이미画像とテキストを理解している) を取り,ロボットのためのモーターコマンドを生成するアクション出力ヘッドを追加する. 視覚言語の脊椎は意味的理解 ("赤い杯を拾い上げ") を提供し,アクションヘッドはその理解を物理的な動き (関節角またはエンドエフェクター位置の配列) に変換します.

建築概要

すべてのVLAモデルは3つの要素を共有していますが,実装は大きく異なります.

  • ビジョンエンコーダー: カメラ画像を機能ベクトルに変換する.一般的な選択肢はビジョントランスフォーマー (ViT) またはSigLIP.ビジョンエンコーダーは通常,インターネット規模画像データセット (ImageNet,LAION) で予備訓練され,VLAトレーニング中に凍結または軽微調整されます.
  • 言語の背骨: テキスト指示を処理し,視覚機能と統合する.ほとんどのVLAは,その推論と指示のフォロー機能を利用して,先程訓練された大きな言語モデル (LLaMA, Gemma, PaLI) を背骨として使用する.
  • アクションヘッド: 融合した視覚言語表現からロボットアクションを生成します. VLA アーキテクチャが最も大きく異なっているところです.

行動表現:主要な区別

VLAがアクションを表現し,生成する方法は,その性能特性を決定する.

  • ** ディスクレットトークン (RT-2, OpenVLA):** アクションは,ディスクレットトークンに分け,テキストトークンのように自動再生生成されます.実装が簡単ですが,単段階の操作が難しいです.
  • ** 断片予測 (SmolVLA):** このモデルはACTによってインスピレーションを受けた,将来的なアクションの連続を同時に予測する (通常は1050ステップ). より滑らかな軌道を生成し,推論時により計算効率的です.
  • フローマッチング (π0): アクションは,ランダムサンプルを有効なアクション軌道を繰り返し代入することで生成されます.最も平滑なアクションを生成し,多モダルの分布 (複数の有効ソリューションを持つタスク) を最もうまく処理しますが,推論時に複数の代入手順が必要です.
  • 拡散 (Octo): フローマッチングに類似するが,DDPM型の拡散プロセスを使用する.多モードアクションには適しているが,断片予測よりも推論速度が遅い.

VLAモデル比較表

Model Creator Open Source Parameters Action Type Hardware Compatibility
RT-2 Google DeepMind No 55B Discrete tokens Google RT-X robots
OpenVLA Stanford / Berkeley Yes (Apache 2.0) 7.5B Discrete tokens Any
π0 Physical Intelligence No ~3B (est.) Flow matching Any
SmolVLA HuggingFace Yes (Apache 2.0) 450M Chunked (ACT-style) Any
Octo UC Berkeley Yes (MIT) ~93M Diffusion Any
RoboFlamingo Shanghai AI Lab Yes ~9B Autoregressive Any
Helix Figure AI No Undisclosed Undisclosed Figure 02

深層ダイビング:各VLAモデル

RT-2 (Google DeepMind)

アーキテクチャ: RT-2は PaLI-X (55Bパラメータ) または PaLM-E (12Bパラメータ) に基づいています.視力エンコードは ViT-e (4Bパラメータ) で,言語モデルは視覚トークンとテキストトークンの両方を処理します.アクションは,微妙な関節位置のテキスト文字文字列として表示され,言語モデルによって自動再生生成されます.

トレーニングデータ: GoogleのRT-Xデータセットで訓練されています. 13種類のロボットから約13万のデモが含まれています.また, PaLI-Xの脊椎からインターネット規模での視覚言語の予備訓練を利用しています.

パフォーマンス: RT-2は新鮮な能力を示した ロボット訓練中に見たことのない概念を含む指示に従った (例えば",オブジェクトをテイラー・スウィフトアルバムに移動する").標準基準では, RT-1の32%と比べて,新型セマンティック概念で62%の成功を達成した.

** 調整要件:** 公に利用できない.Googleは体重やトレーニングコードを公開していない.

Pros: 最強の新興セマンティック概括; VLA概念が規模で機能する最初の証明.

デメリット: 封鎖されたソース; 大規模な計算が必要; 55Bパラメータはリアルタイム推論を困難にする;単段階の離散行動は揺るぎない動きを生む.

OpenVLA (スタンフォード / バークレー)

アーキテクチャ: Prismatic VLM 脊椎 (Llama-2 7B + SigLIP + DinoV2 視野エンコーダー) に構築された.アクションは,各次元に256のビンを分けて,自動退縮的にトークンとして予測される.双視野エンコーダー (セマンティック機能のためのSigLIP +空間機能のためのDinoV2) は,OpenVLA に単一のエンコーダー設計よりも強い視野の基盤を与える.

訓練データ: オープンX-Embodimentデータセット (22のロボット実施形態から970K軌道) で訓練された. 精細調整は特定のロボットで新しい作業のために100200回の示例を必要とします.

パフォーマンス: LIBERO 基準では,微調整された OpenVLA は,作業の困難に応じて85~95%の成功を達成する.WidowXとFranka 腕で実際のロボット評価では,見られた作業に関するタスクの特定 ACT ポリシーに一致するまたは超え,見られなかったタスク変数では大幅に優れている.

精細調整の要求: 2x A100 (80 GB) の完全な精細調整; 1x A100 の LoRA 精細調整.訓練時間: 200 回のデモで 824 時間. LoRA は,性能コストが少ないのでメモリを ~ 40 GB に削減します.

プロス: 優れたドキュメントを持つ完全にオープンソース; 最も強力なオープンソースベースライン; コミュニティの規模とアクティブ開発; 単純なアクションスペースマッピングを持つあらゆるロボットで動作する.

メリット: 7.5B パラメータは,消費者のGPUで動作ステップあたり ~300ms (反応性作業に遅すぎる) を意味します. 離散トークンはフローマッチングまたは小切断予測よりもスムーズな動作を生み出します. 細かな調整のために重要なVRAMが必要です.

π0 (物理知能)

アーキテクチャ: π0 は,フローマッチングアクションヘッドを持つ視言語のバックボーン (おそらくPaLIベースの,詳細は完全に開示されていない) を使用します.フローマッチングは,学習速度フィールドを通じて騒音サンプルを動作軌道を繰り返して変換することによってアクションを生成します.これはトークンベースのアプローチの分辨装置なしで,スムーズで連続した軌道を生成します.

訓練データ: 複数のロボットプラットフォーム (フランカ,UR5,モバイル操作機,巧妙な手) で数千時間の遠隔操作データで構成される独自のデータセットで訓練されています.

パフォーマンス: π0は,ロボット政策の最も広範な作業概括を示した.単一のモデルから異なるロボット実施形態における洗濯機折り畳み,テーブルバスリング,箱包装,および組み立て作業を実施した. 量学的基準では,訓練された作業の8095%の成功と関連した未見な作業の4060%のゼロショットを示した.

** 調整要件:** 公に利用できない. 物理知能は選択されたパートナーにAPIアクセスを提供します.

Pros: 最もスムーズなアクション生成; 最も広範なタスク概括が示された; トークンベースのVLAよりも接触豊富な操作をうまく処理する; 多体体化サポート.

メリット: 閉鎖ソース;公開の重みがない;推論には複数のデノイジングステップ (1020),遅延を加えることが必要である. 商業的なアクセスは物理知能パートナーシップを通じてのみです.

スモルヴァーラ (HuggingFace)

アーキテクチャ: SmolVLA は,Idefics-3をベースとしたコンパクトビジョン言語モデルである SmolVLM を,部品のアクション予測ヘッドの骨干として使用する.アクションヘッドはACTの部品の予測からインスピレーションを得て,単一の前進パスで将来のアクション (アクション・チャック) の連続を予測する.ビジョンエンコードは SigLIP-400M モデルであり,言語の骨干は500M パラメータートランスフォーマーである.

トレーニングデータ: Open X-EmbodimentとLeRobotコミュニティのデータセットをキュレーティングしたサブセットで訓練されています. 精細調整には50~200回のデモが必要です.

パフォーマンス: LIBERO基準では,SmolVLAは,実際のロボット評価では,16倍少ないパラメータを持つにもかかわらず,OpenVLAの5%以内に8290%の成功を達成する.実際のロボット評価では,精細な SmolVLAは,単純なタスクでOpenVLAと一致し,複雑な多段階タスクではわずかに低性能である.主要な利点は推論速度である.SmolVLAは,単一のRTX 4090で1530Hzで動作する.

精細調整の要求: 完全精細調整のための1x RTX 4090 (24 GB) 訓練時間200のデモでは412時間. 資源の要求が低いため,現代消費 GPUを持つすべてのラボにSmolVLA が利用可能になります.

プロス: 最小で最速のオープンソース VLA;消費者のハードウェアで実行される; 断片予測はスムーズなアクションを生成する; HuggingFaceで利用可能な完全なトレーニングコード; 活発なコミュニティ.

メリット: 7B+モデルと比較して言語理解を制限する脊椎が小さく,新しい指示に強度が低い. 断片的な予測は非常に長い視線の課題に苦労する.

オクト (UC バークレー)

建築: Octoは,拡散アクションヘッドを持つトランスフォーマーバックboneを使用している.上記のVLAモデルとは異なり,Octoは,先訓練された言語モデルバックboneを使用していない.代わりに,ロボットデータから訓練された小型トランスフォーマーを使用している.オプション言語コンディショニングがある.拡散ヘッドは,繰り返しデノイズを通じてアクション軌道を生成する.

訓練データ: オープンX-Embodimentデータセット (~800K軌道) で訓練された.

パフォーマンス: SIMPLER基準では,Octo-Baseは複数のシミュレーション環境で5075%の成功を達成しています.その強さは適応速度です.新しいタスクの2050の示範で細かな調整は,単一のGPUで30分から2時間かかります.

精細調整の要求: 1x RTX 3090以上;訓練時間30分~2時間.この比較ではどのモデルでも計算の要求が最低である.

プロス: 最速の細かな調整,最小の計算要求,拡散ヘッドは多モード操作をうまく処理し,高速プロトタイプ設計されています.

メリット: 言語理解が弱く (LLMの骨髄がない);複雑な作業でOpenVLAやSmolVLAよりも絶対的なパフォーマンスは低い; 拡散推論は 断片予測よりも遅い.

ロボフラミンゴ (上海AIラボ)

アーキテクチャ: OpenFlamingo (MPT-7Bをベースにした多モダルのモデル) に構築された,RoboFlamingoは,先訓練された視覚言語モデルにロボットアクション予測ヘッドを追加しています.これは,多フレーム視覚史を効率的に処理するために感知器再サンプルモジュールを使用し,モデルが時間動力について推論できるようにします.

訓練データ: CALVIN基準データとカスタマイズされた実用ロボットデモを組み合わせて訓練されています. 100~500回のデモのタスク特有のデータセットで調整できます.

パフォーマンス: CALVIN基準では,RoboFlamingoは長方角作業の多段階で最先端の成果を上げています.その時間視覚的推理 (単一のフレームではなくフレームの配列を処理する) は,前のステップの記憶を必要とする作業で優位性を提供します.

精細調整の要件: 9Bパラメータの背骨による完全な精細調整のために2x A100 (80 GB)

プロス: 長期作業の性能; タイムロード・ビジュアル・推理; オープンソース.

メリット: モデルサイズが大きい (9B); リアルロボットによる評価が公開されている限度; OpenVLAや SmolVLAよりも小さなコミュニティ; 自転後退的アクション生成は単段階のアクションを生成する.

選択方法: VLA 決定枠組

適切なVLAモデルを選択することは,計算予算,データ利用量,作業要件など3つの要因に依存します.

計算予算による

Budget ファインチューニング Hardware Recommended Model Inference Speed
Consumer ($0–$2K GPU) 1x RTX 4090 SmolVLA or Octo 15–30 Hz
Research lab ($5K–$20K) 1–2x A100 OpenVLA (LoRA) or SmolVLA 3–15 Hz
Well-funded lab ($20K+) 4+ A100 or H100 OpenVLA (full) or custom VLA 3–10 Hz
Enterprise Cloud cluster π0 (API) or custom training Varies

任務タイプ

Task Key Requirement Best Model Why
Simple pick-and-place Speed, low compute SmolVLA or Octo Fast inference, minimal data needed
Language-conditioned manipulation Semantic understanding OpenVLA Strongest language backbone among open models
Contact-rich manipulation Smooth, precise actions π0 or SmolVLA Flow matching / chunked actions handle contact better
Multi-step long-horizon Temporal reasoning RoboFlamingo or OpenVLA Multi-frame processing, strong LLM backbone
Rapid prototyping Fast iteration Octo 30-min fine-tuning on 20 demos
Bimanual coordination Multi-arm action space SmolVLA or Octo Flexible action spaces, chunked prediction

データの利用量

  • 2050 デモンストレーション: Octo (最小限のデータで迅速な微調整のために設計されています)
  • 50200 デモンストレーション: SmolVLA (適度データで良好なパフォーマンス) または ACT (VLA以外のベースライン,データ制限で非常に有効)
  • 200500のデモ: OpenVLA (このスケールで完全な微調整が最高の結果をもたらす)
  • 500+ の示例: モデル の 利点; OpenVLA の 完全な 微調整 や 定番 モデル の 訓練 を 考慮 する

ロボットデータにおけるVLAを細かく調整する

データフォーマット要求

すべての主要なVLAモデルは,訓練データを2つの形式のいずれかに期待します:

  • RLDS (Reinforcement Learning Datasets): オープンX-Embodimentモデルのための標準.Octo,OpenVLA,RT-2によって使用されます.各エピソードはTFRecord形式で (観察,アクション,報酬) のトップルの連続として保存されます.
  • **LeRobot形式:**HuggingFaceのSmolVLAとLeRobotトレーニングフレームワークのフォーマット.各エピソードは,同期画像とアクション列,メタデータ JSONファイルを含むパークレットファイルとして保存されます.

RCSVのデータ収集パイプラインは両方のフォーマットを出力します.変換詳細については, [データフォーマットガイド]T5]を参照してください.

GPUの要求とトレーニング時間

Model Method Min GPU VRAM Time (200 demos)
SmolVLA Full fine-tune 1x RTX 4090 24 GB 4–12 hours
OpenVLA LoRA 1x A100 40 GB 8–16 hours
OpenVLA Full fine-tune 2x A100 80 GB each 12–24 hours
Octo Full fine-tune 1x RTX 3090 24 GB 0.5–2 hours
RoboFlamingo Full fine-tune 2x A100 80 GB each 16–32 hours

ロラ対フル・フィニチューニング

ローランク アダプテーション (LoRA) は,訓練前の重量を凍結し,小さなアダプターマトリスを訓練し,メモリ要求を50%~70%削減します.

  • ** 完全な細かな調整:** 7.5Bのパラメータを更新します. 2x A100 (80 GB) を必要とします. 特に,作業分布が訓練前のデータと大きく異なる場合,最高のパフォーマンスを達成します.
  • LoRA 精細調整: 調整器パラメータは ~50M (ランク 32). 1x A100 (40 GB) を必要とする. ほとんどの作業では完全精細調整の25%以内に性能. 計算余計がない限り,デフォルトアプローチとして推奨されます.

例: スモルボットでスモルボラを細かく調節する

# Install LeRobot
# pip install lerobot

from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
from lerobot.common.policies.smolvla.configuration_smolvla import SmolVLAConfig
from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy

# Load your dataset (collected at RCSV or locally)
dataset = LeRobotDataset("your_org/your_dataset")

# Configure the policy
config = SmolVLAConfig(
    input_shapes={
        "observation.images.top": [3, 480, 640],
        "observation.images.wrist": [3, 480, 640],
        "observation.state": [7],  # 6 joints + gripper
    },
    output_shapes={
        "action": [7],
    },
    action_chunk_size=50,
)

# Initialize from pre-trained weights
policy = SmolVLAPolicy(config, dataset_stats=dataset.stats)
policy.load_pretrained("HuggingFaceTB/SmolVLA-base")

# Fine-tune (see LeRobot docs for full training loop)
# python lerobot/scripts/train.py \
#     --policy.type=smolvla \
#     --dataset.repo_id=your_org/your_dataset \
#     --training.num_epochs=100

RCSVのデータ収集を細かな調節パイプラインに

RCSVの [データ収集サービス](T6を使用するチームの一般的な作業流程:

  1. タスクの範囲: 操作タスク,オブジェクト変異,成功基準を定義する.RCSVのソリューションチームは,最小データセットサイズ (通常VLAの微調整のための100200のデモ) を決定するのに役立ちます.
  2. ** 集計デモ:** RCSV 運営者は,同期マルチカメラ録音による [OpenArm 1 または DK1] (T7) で専門家デモを集める.パイロットキャンペーン:100デモ (2500ドル).フルキャンペーン:500デモ (8000ドル).
  3. **フォーマットされたデータを受信する:**データはHDF5 (ACT/diffusion policy対応) とLeRobot (SmolVLA/OpenVLA対応) の両方で提供されます.
  4. VLAを精細に調整する: 送られたデータセットを使用して SmolVLA (消費者のGPU) または OpenVLA (A100) を精細に調整します. RCSVはクラウドGPUの設定に関する計算アクセスまたはガイドを提供できます.
  5. 評価・再演: 機械に精細な調整されたポリシーを導入します. 目標の低い成功率であれば,失敗事例についてはさらに標的の示範を収集してください.

リアルワールドベンチマーク:精度対推理速度

方法論記号

この表を標準化ランキングボードとして読まないでください

下記値は,異なるモデルリリースや環境から収集された報告または指針的な結果である.これらの値は,ショートリストを作成するのに有用であるが,タスク定義,チェックポイント,観測スペース,アクションスペース,ハードウェア,および成功基準が異なるため,勝者を確立しない.

決定等級比較には,それぞれの候補者に対して同じデータセットバージョン,実施形態,タスクセット,シードポリシー,推論ハードウェア,成功ルシーク,および繰り返し実行プロトコルが必要です.

Model LIBERO-Long (5 tasks) SIMPLER (avg) Inference (RTX 4090) Inference (A100)
RT-2 (55B) N/A (closed) N/A (closed) N/A ~1 Hz
OpenVLA (7.5B) 90% 72% ~3 Hz ~8 Hz
π0 N/A (closed) N/A (closed) N/A ~5 Hz (est.)
SmolVLA (450M) 86% 68% ~20 Hz ~30 Hz
Octo (93M) 72% 58% ~10 Hz ~25 Hz
RoboFlamingo (9B) 82% (CALVIN) N/A ~2 Hz ~6 Hz

推論速度トレードオフ: 反応性作業 (物体捕捉,動的組み立て) において,≥10 Hz制御が必要.これは消費者のハードウェアにおける SmolVLAとOctoの実践的な選択を制限します.よりゆっくりとした操作作業 (ピック・アンド・プレス,パッケージ) において,35 Hz が十分で,OpenVLA を実行可能にする. 速度 (挿入,組み立て) に比べて精度を必要とする接触型作業では,動作品質が高くなる場合,遅い推理は許容される.

重要な注意: 基準値は特定のデータセットや評価プロトコルで測定されます.実世界のパフォーマンスは,特定のタスク,環境,ロボットに依存します.LIBEROで90%を達成するモデルは,視覚環境またはオブジェクトセットが大きく異なる場合,タスクの60%を達成することができます.常に目標設定で評価してください.

関連 読書

関連: [2026年の物理AI] [T8] · [アクションチャンキングトランスフォーマー] [T9] · [データサービス] [T10] · [レロボットフレームワークガイド] [T11] · [スペースマウステレオペレーション] [T12] · [ハードウェアカタログ] [T13] · [ロボット語彙]