VLAモデル比較2026: Octo, OpenVLA, π₀ (パイゼロ), GR00T, SmolVLA,および OpenPI
ロボット学習のための視覚言語アクション (VLA) モデルを比較する:Octo,OpenVLA,π₀ (パイゼロ),GR00T,SmolVLA.アーキテクチャ,トレーニングデータ,推論速度,ハードウェア互換性,リアルロボット性能.
このページでは,すべての主要なVLAモデルを比較します 建築詳細,トレーニングデータ,推論速度,ハードウェア互換性,そして実際のロボット性能.
2026年4月16日更新された · RCSV研究チーム · 12分読み
VLA モデルとは何か?
ビジョン言語行動 (VLA) モデルは,カメラ画像** (ビジョン) と自然言語タスク指示** (言語) を入力および出力として取る端から端まで神経ネットワークである. ロボットが直接実行できるコマンド** (アクション)
VLAの背後にある重要な洞察は建築統一である.VLA以前,ロボット学習システムは模組型パイプラインであった.別々のビジョンモデルが物体を検出し,別々のプランナーが戦略を生成し,別々のコントローラーがモーターコマンドを生成した.各モジュールが独立して訓練され,モジュール間のエラーがカスケードされた. VLAは,このパイプラインを,端から端まで示範に訓練された単一のモデルに置き換え,インターフェースエンジニアリングとエラー拡散を排除する.
"言語"の構成要素は,VLAを以前のロボット学習方法 (ACT) 〜T0
建築の比較
| Model | Vision エンコーダ | LLM Backbone | Action Head | アクション空間 | Context Length |
|---|---|---|---|---|---|
| Octo | Custom ViT | Transformer (93M total) | Diffusion | Continuous (EEF delta) | 2 frames |
| OpenVLA | SigLIP (400M) | LLaMA 2 (7B) | Discrete tokenization | 256 bins per dim | 2048 tokens |
| π₀ (パイゼロ) | PaLI-based (est.) | Custom (~3B total) | フロー・マッチング | Continuous (joint + EEF) | Not disclosed |
| GR00T N1 | Eagle (NVIDIA) | Custom (~2B total) | Dual (diffusion + MLP) | Continuous (whole-body) | Not disclosed |
| SmolVLA | SigLIP (400M) | SmolLM2 (135M) | Diffusion | Continuous (joint pos) | 1024 tokens |
| OpenPI | SigLIP (400M) | LLaMA-based (~3B) | フロー・マッチング | Continuous (joint + EEF) | 2048 tokens |
モデル ディープダイブ
オクト (UC バークレー)
OctoはオープンソースのVLAコミュニティのワークホースである.バークレーロボット学習ラボ (Ghosh et al., 2024) で構築されたOctoは,明確なエンジニアリング哲学で設計された:単一のGPUに細かく調節できるほど小さい,リアルタイム制御のための速度で,実施形態を介して動作するほど一般的です.
アーキテクチャ: 共有注意層を通じてトークン化された画像観測と言語指示を処理し,その後拡散ヘッドを通じてアクションを生成するコンパクトトランスフォーマー.拡散ヘッドは,別々のアクション・チャッキングメカニズムを必要とせずに,時間的なスムーズさを提供する16ステップアクション・チャック (0.32秒50Hz) を予測する.
トレーニングデータ: 800K 回の公開X-Embodiment データセットから,ブリッジ V2 データセット (WidowX ロボット) と RT-1 データ (Google の Everyday Robots) に重重点を置く.これは,Octo は WidowX クラス腕でテーブル操作で最もうまく機能していることを意味します.
** 精細調節:** Octoは50-100のデモを伴う単一のA100で20~30分で精細調節します.この迅速なターンアウトは,迅速な繰り返しの理想的です.朝に50のデモを収集し,昼食に精細調節し,午後に評価します.RCSVでは,我々はデータ品質に関する最も速いフィードバックを提供しているため,パイロットデータ収集プロジェクトではオクトをデフォルトベースラインとして使用します.
制限: 93Mパラメータ予算は言語理解と視覚的推論を制限する.Octoは空間推論 ("グラフをプレートの左に置く") またはブリッジV2で十分に表現されていない新しいオブジェクトカテゴリーを必要とする課題に苦戦します.これらの課題のために,OpenVLAの大きなLLM背骨は,大幅により良いパフォーマンスを発揮します.
最も適した: ロボット・ポリシーが迅速に機能するチーム,コンピューティングが限られているチーム,またはより大きなモデルにコミットする前にデータ収集品質を繰り返しているチーム.
OpenVLA (スタンフォード / バークレー)
OpenVLA (Kim et al., 2024) は,最も能力のあるオープンソース VLAであり, 7Bパラメータ LLM のバックボーンが,見えない物体における新しいタスク説明にゼロショット転送を実証する最初のオープンモデルであった.
アーキテクチャ: SigLIP視力エンコーダー (400Mパラマックス) は視覚トークンを精細調された LLaMA 2 (7Bパラマックス) に供給します.アクションは,各次元に256個別なビンのトークン化され,次のトークンとして予測されます. この分離したトークनाइゼーションは連続拡散ヘッドよりも表現が少ないが,このモデルはLLMの完全な自動後退性生成機械を活用できるようにします.
トレーニングデータ: Open X-Embodiment データセットから970K 件 (22 件) の実施データ.Octoと比較してより広い実施形態の覆盖により,OpenVLA はよりよいクロスロボット通用化を提供します.
** 精細調節:** 7Bパラメータサイズにより効率的な精細調節のために8xA100 (またはそれと同等) が必要です. LoRA精細調節は,軽度の低性能のコストでこれを1-2A100に削減します.新しい作業のために100-200の示範が推奨されます.精細調化は4-8時間かかります.
インフェレンスは: ~5 Hz A100, ~2 Hz Jetson AGX Orin.リアルタイム展開のためにアクション・チャッキング (予測 10-20 ステップ,実行 50 Hz) を必要とする.インフェレンスの間200-500ms の遅延は,ロボットが0.2-0.4 秒のプランで動作することを意味します.
**言語条件付きの多作業システムで,複数のタスク指示を処理する単一のモデルが必要とする.十分なGPUリソースを持つ研究チーム.
物理知能
π₀ (パイゼロ)は,セルゲイ・ルヴィーン,チェルシー・フィン,および他のバークレー/スタンフォード校友によって設立された物理知能の独自の最新の技術です. π₀ (パイゼロ)の特徴的な技術貢献は フローマッチングアクションヘッドです.
流出相応対対拡散: 両者とも,行動軌道を生成する生成モデルだが,流出相応対は,曲げな騒音から信号への拡散経路よりも直線間接経路 (最適輸送) を使用する.実際,流出相応対は,より少ないデノイジングステップ (4-8対 16-32で拡散) で収束し,質の喪失なしにより速い推論が可能となる.
パフォーマンス: π₀ (パイゼロ)の示例では,オープンソースモデルが一致していないクロスタスク通用化を示しています.単一のチェックポイントで洗濯物を折り畳む,クリアテーブル,パッケージングボックス,そしてキッチン用電器を操作する. π₀ (パイゼロ)とオープンモデル間の差は,より大きな独自のデータセットとフローマッチングアーキテクチャの両方に関連する,多タスクベンチマークで15~25%の成功率を推定しています.
アクセス: π₀ (パイゼロ)は公開されていません.Fisical Intelligenceは選択されたパートナーにAPIアクセスを提供します.コミュニティの再実装 OpenPI (下記を参照) は,公開されたアーキテクチャ詳細を使用して近似を提供します.
** PI 提携契約を持つチームにとって最適です. チームには最新のパフォーマンスが必要で,ベンダー・ロックインを受け入れたい.
GR00T N1 (NVIDIA)
GR00T N1は,NVIDIAのヒューマノイドを中心とした基礎モデルであり,アイザックラボエコシステムのために設計され,ジェットソン・ソーエッジ展開のために最適化されています.
双システムアーキテクチャ: GR00T N1は,相互接続された2つのモデルを使用します. "遅い" VLA 脊椎 (2-5 Hz) は,視覚シーンと言語指示を解釈して,高レベルのアクションプランを作成し,プランを反応フィードバックでモーターコマンドに変換する"速い"ポリシー (200+ Hz) は,意図的な計画と反射モーター制御の間の生物学的な区別を反映します.
Sim-Firstトレーニング: イザック・ラボで1M+エピソードで訓練 (ドメインランダム化による物理シミュレーション) を進めて,その後50K-100Kのリアルヒューマノイドエピソードで精巧調節した.このSim-Firstアプローチは,移動と全体のバランスにはうまく機能しますが,操作作業には依然として重要な実際のデータが必要です.
ハードウェアエコシステム: NVIDIA Jetson Thor (ヒューマノイド特有のコンピューティングプラットフォーム) に最適化.また,性能が低下した Jetson AGX Orin で動作する.GR00T SDK はFigure,Agility Robotics,Apptronik,および1Xヒューマノイドのための標準化されたインターフェースを提供します.
機械人プロジェクト,特にNVIDIAエコシステムに既に存在しているロボットプロジェクトには最適です.
スモルヴァーラ (ハグする顔)
SmolVLAは,消費ハードウェアのためにVLAモデルを十分に小さくして,有用な通用化を犠牲にすることなく作ることができるというハグジングフェイスの賭けである.合計500Mのパラメータで,研究者や趣味者にとって最もアクセス可能なVLAです.
アーキテクチャ: SigLIP視野エンコード (400M) をSmolLM2 (135Mパラメータ言語モデル) と拡散アクションヘッドと組み合わせた.小さな言語モデルは複雑な推論を制限しますが,依然として一般的なタスク説明のための意味のある言語条件を提供します.
LeRobot統合: SmolVLAは[LeRobot]
**パフォーマンス:**標準基準 (SIMPLER, Bridge V2 eval) では,SmolVLAはパラメータ数値の1/14 で,OpenVLAの成功率の6075%を達成する.単作業の微調整では,十分な示例 (200+) でギャップは510%に縮小する.
**LeRobotユーザー,消費者のGPU,教育,およびJetson AGX Orin ($1,999) の代わりにJetson Orin NX で推論を実行する必要があるチームのためのベスト.
OpenPI (共同体)
OpenPIは,公開された紙とリバースエンジニアリングのデザイン選択に基づいて,フィジカルインテリジェンスのπ₀ (パイゼロ)アーキテクチャのコミュニティリインプレーションです. オープンソースパッケージで π₀ (パイゼロ)を他のVLAから区別するフローマッチングアクションヘッドを提供します.
アーキテクチャ: LLaMAベースの脊椎 (合計3Bパラメータ) とフローマッチングアクションヘッドを持つSigLIP視力エンコード.アクションヘッドは8ステップフローマッチングを使用して推論を行い,スムーズな連続的なアクション予測を達成します.
トレーニング: Open X-Embodiment,DROID,およびコミュニティが寄与するデータセットの組み合わせでコミュニティーに訓練された.
性能: 比較基準で報告された π₀ (パイゼロ) の性能の約70~80%を達成する.フローマッチングヘッドは,接触に富んだ作業に好む一部のユーザが使用する拡散ベースの代替品 (Octo, SmolVLA) より顕著に滑らかな行動軌跡を提供します.
**Flow matching architecturesに興味のある研究者が,オープンソースアクセスと完全なモデルを検査し,修正する能力を望む.
ハードウェアの互換性
| Model | WidowX / ALOHA | OpenArm 1 | Franka | Unitree G1 | Koch / SO-100 |
|---|---|---|---|---|---|
| Octo | Native | Fine-tune | Native | Fine-tune | Fine-tune |
| OpenVLA | Native | Fine-tune | Native | Fine-tune | Fine-tune |
| π₀ (パイゼロ) | Supported | Via PI API | Supported | Via PI API | Not supported |
| GR00T N1 | Not targeted | Not targeted | Not targeted | Native | Not targeted |
| SmolVLA | Native | Native (LeRobot) | Fine-tune | Fine-tune | Native (LeRobot) |
| OpenPI | Community | Fine-tune | Community | Fine-tune | Community |
"ネイティブ" =この実施形態からのデータで事前訓練された;ゼロショットまたは最小の微調整で動作する. "微調整" =この特定のロボットで50~200回の示しが必要. "コミュニティ" =コミュニティが維持する統合;手動の設定が必要かもしれません.
自分 の VLA を 訓練 する
チームの大半は,ゼロから訓練するのではなく,既存の VLA を**細かく調整すべきです.
調整 (ほとんどのチームに推奨)
- **ベースモデルを選択:**速度にOcto,能力にOpenVLA,レロボット統合にSmolVLA
- **特定のロボットプラットフォームで目標作業の50~200のデモを集める (データ収集ガイドを参照)
- **フォーマットデータ:**モデルが予想されるフォーマットに変換する (SmolVLA/OctoのLeRobotデータセットフォーマット,OpenVLAのRLDS)
- ** 調節:** 五月: 1 GPU で30分. SmolVLA: 1 GPU で1-2時間. OpenVLA: 8 GPU で4~8時間 (または LoRA で1-2 GPU)
- 評価: 50回の評価を実行し,成功率を測定し,失敗モードを分析する
ゼロから訓練 (専門建築のための)
ゼロからトレーニングを行うには,100K以上のデモと重要な計算 (64-256 GPU時間,Octoスケールで1,000+ GPU時間) が必要です.これは新しいアーキテクチャ,独自の大規模データ,または既存のモデルが満たせない要件がある場合にのみ適切です.
推移速度基準
| Model | A100 (80GB) | Jetson AGX Orin | Jetson Orin NX | RTX 4090 | Action Chunking Needed? |
|---|---|---|---|---|---|
| Octo | 40+ Hz | 15-20 Hz | 8-12 Hz | 30+ Hz | No (built-in) |
| OpenVLA | 5-8 Hz | 1.5-3 Hz | OOM | 4-6 Hz | Yes (10-20 steps) |
| π₀ (パイゼロ) | 10-15 Hz | 5-8 Hz | Not tested | 8-12 Hz | Optional |
| SmolVLA | 25+ Hz | 10-15 Hz | 5-8 Hz | 20+ Hz | No (built-in) |
| OpenPI | 8-12 Hz | 3-5 Hz | OOM | 6-10 Hz | Optional |
標準値はFP16精度で測定され,パッチサイズ1で1台のカメラ入力.現実世界での性能はカメラの解像度とビュー数によって異なります.
どの VLA を いつ 使うか
この決定木を使ってモデルを選択します
- 計算を最小限にすると,30分で調整し,同じ日に展開します.
- 言語条件付きのマルチタスクが必要ですか? → OpenVLA. 最良のオープンソース言語の基礎.
- LeRobotと連携し,ネイティブエコシステムサポートを希望する? → SmolVLA.
- 人間型ロボットアプリケーションを構築する** → GR00T N1. 全体の人形制御のために設計された.
- 最も平滑な行動軌跡 (接触豊富な作業) を望みますか? → OpenPI. フローマッチングは拡散よりも平滑な動きを生み出します.
- 最高性能が必要で PI 提携をしていますか? → π₀ (パイゼロ). 最新技術だが独占的.
- ** 特定の単一のタスクがあり,言語の条件付けは必要ないか** → VLA の代わりに ACT または 拡散政策 を考慮してください.これらはよりシンプルで,トレーニングが速いし,しばしば単一のタスクの成功率が高い.
VLA-対応のトレーニングデータを収集する
VLAの訓練データには,よりシンプルな政策に関するデータとは異なる特定の要件があります.
カメラの要求
- 解析度: 最低640x480,推奨1280x720.VLA視野コードは内部にサンプルを224x224または336x336にダウンしますが,より高いソース解析度により,ダウンサンプリング中に詳細が保たれます.
- **フレーム速度は:**カメラフレームでは30fps,50Hzの共同状態記録と同期される.不一致はデータロードで処理されます (近隣のインターポレーション).
- ビュー: 腕時計カメラ1台+外部のカメラ.ほとんどのVLAは2~4台表示を承認する.追加表示は性能を向上させるが,ストレージと推論コストを増加させる.
- 校正: カメラ内部の内部のと外部の内部の記録が求められるが,ほとんどのVLAアーキテクチャでは要求されない (彼らはピクセルから直接視覚的特性を学ぶ).
行動形式
- ** 合体位置:** 絶対合体位置を50 Hzで記録する.これは最も普遍的な形式です
- エンドエフェクターポーズ: EEF位置 + クアテリアン方向も記録する.一部のモデル (Octo, π₀ (パイゼロ)) は EEF空間アクションを直接使用することができる.
- グリッパー状態: バイナリー (開/閉) または連続グリッパー位置. 結合データと同じ周波数50 Hzで記録する.
言語記号
- "赤いカップを拾ってスイッチに放す"
- 具体的,説明的な言語を使用します. "タスクをこなせ"は役に立たない. "左側にある物体を拾い上げなさい"は役に立たない
- 言語の通用化を改善するために同じ作業のエピソードごとに異なる言語です "カップを握って", "コーヒーカップを拾って", "テーブルからカップを取って"
輸出形式
- HDF5: ACT,拡散政策,直接のオクト消費基準
- RLDS (TensorFlow Data Sets): OpenVLA 訓練前のデータフォーマットに必須
- LeRobot形式: パーク + ビデオファイル 抱きしめく顔ハブ. スモルVLA のネイティブ
RCSVの [データ収集サービス]
関連 読書
- [2026年の物理AI: 基礎モデル 深層ダイブ]
- [VLAモデル説明 (イントロ) ]
- [ACT政策説明]
- [ロボットに関する拡散政策]
- [LeRobotフレームワークガイド]
- [宇宙マウスの遠隔操作ガイド]
- [RCSVデータサービス]
RCSVでVLA訓練データを収集する
標準化されたHDF5,RLDS,LeRobotの出力50以上のロボットセットアップから開始します 2,500ドルのパイロットから開始します 作業の任意のVLAを調整するのに十分なデータです
ビデオの各部には 自分のデモで調整できます







