VLA Modelsに戻る

2026年ベストVLAモデル:完全なビジョン言語行動ガイド

2026年にロボット工学のための8つのベストビジョン言語アクションモデル OpenVLA,Octo,pi0,RT-X,Difusion Policy,ACT ライセンス,ハードウェア,フィットノートでランク付けされました.

2026年に ライセンス,ハードウェア・フットプリント,言語の信頼性,生産部署に関する 誠実な注釈で 推奨する 8つのビジョン・言語・アクションと模倣学習モデルです

更新された2026年4月 8モデル ランキングオープン重量優先

[すべてのモデルを閲覧する] T0) [推奨を取得] T1)

TL;DR2026年のトップピークは,以下のようにランク付けされています: 1. OpenVLA (ベストオールラウンドオープンウェイト VLA) · 2. Octo (ベストコンパクト拡散ポリシー) · 3. pi0 (ベストフィジカル・インテリジェンスリリース) · 4. RT-1-X (ベスト小歴史ベースライン) · 5. ディフュージョンポリシー (ベスト模倣学習アルゴリズム) · 6. ACT (ベストバイマンシャルテレオプ) · 7. インターンVLA-M1 (上海AIラボのベストスペースリー・アグラウンド VLA) · 8. スモルVLA (レロボット傘下でベストライトライト VLA).

2026年にVLAモデルが"ベスト"になるのは?

VLA 景観は急速に成熟した.2年前",ベスト"は"まったく機能するどんなモデルも"を意味していた.今日,OpenVLA,Octo,pi0,InternVLA-M1と12種類の研究変異がオープン・ウェイトを運ぶことで,どのモデルが _あなたの_展開に合っているかという疑問が浮かび上がっています.我々はモデルを5つの実用軸に分類します:

  • Open Weights & License* ダウンロードして 調整して 商業的に 運送できますか? MIT と Apache 2.0 は 安全なライセンスです.
  • 硬件足跡は A100? 4090? 端の箱? これがBOMを決める
  • 言語の忠誠性* 訓練時のフレーズに 崩壊する対照的に 表現の自由形式の指示をどの程度順守しているのでしょうか?
    • 調整コスト** 1日間でロボットを適応させられるか 多ノード訓練が必要なのか?
  • 生産成熟度* LoRAレシピ,量化したバリエーション,そして,船が修正するコミュニティはありますか?

2026年ランキング

  1. OpenVLA 最高のオープンウェイトファンデーション VLA

7BパラメータMITOpen X-EmbodimentA100級GPU

Llama-2 7B 脊椎,DINOv2 + SigLIP 視野,微妙なアクショントークン,970K オープンX-エンボディメント軌道を訓練.LIBERO で RT-2-X を 7 × 少ないパラメータで上回る.アクティブコミュニティの LoRA アダプターと量化変異を運送する. [OpenVLA モデルページ]T2) または [OpenVLA vs Octo 比較]T3 を参照).

27M / 93MMITOpen X-Embodiment消費者のGPU

トランスフォーマー拡散方針は, ~800KオープンX軌道をゼロから訓練した.単一のRTX 4090で2030Hzで実行する.柔軟なアクションスペース,目標画像コンディショニング,直接的な細かな調節. 7Bモデルが買えないときのスムーズな代替品. [Octo]T4参照.

  1. 物理知能 最良の次世代一般学者

多兆 部分公開 定例のコルプス

物理知能の旗艦の一般学者VLAは,フローマッチングアクションヘッドと長視線のタスクに焦点を当てたフローマッチングアクションヘッドを導入しました.スタックとチェックポイントの一部がコミュニティにリリースされました. 出版されたデモで洗濯物を折り畳み,家庭クラスの操作に強い. 巧妙なまたはヒューマノイド展開のために見るべきモデルです.

  1. RT-1-X 最良の小さな歴史基線

~35MApache 2.0Open X-EmbodimentシングルGPU

RT-1のオープンX体再訓練.小型で高速で交叉体化.研究論文の信頼性の高い軽量ベースライン.製品展開については,オクトーを好むが,RT-1-Xは定例的な歴史的参照であり続ける. [RT-X]T5を参照).

  1. 拡散政策 複数モードデモの模倣学習のベスト

CNN/トランスフォーマーバックboneMITDDPMアクションヘッド

コロンビアの拡散政策は,専門家デモが多様式である場合の基調である.出版時に以前の模倣学習方法よりも46.9%の平均改善.接触豊富な操作および平均戦略が行動崩れをもたらすあらゆる環境に自然に適している. [拡散政策]T6) または私たちの [拡散政策対ACT比較]T7を参照してください.

  1. 双手通話の模倣学習のベスト

CVAEトランスフォーマーMITAクション・チャッキング

モバイルALOHAから. タイムリー・アンセッティングによるアクション予測.単一のGPUで数分で電車,50回のデモで動作し,双手通用電視訓練の主な出発点であり続けています.レロボットで参照ポリシーとして配信されています. [ACTポリシー説明書](T8参照).

  1. 空間的に地面に開かれたVLAのベスト

オープン・ウェイトMITGrounding + アクション

シャンਘーAIラボの2段階のVLAは,行動予測前に空間的アースティングを中間表現として使用する.Googleロボットで71.8%とLibEROで95.9%を報告した.2025年に発表された最も強力なオープンウェイト数字の中で. [InternVLA-M1]T9を参照.]

  1. スモルVLA リーロボットエコシステムで最高の軽量VLA

450MAPACH 2.0 ハグリングフェイス

ハグジング・フェイスのコンパクトVLAはLeRobotフレームワークの下でリリースされました.ノートパソコンや趣味級のロボットで動作するように設計され,LeRobotのパイプラインを通じて統合されたデータロードとトレーニングがあります.データセンターGPUなしで動作するVLAを希望している場合は良い入門点です. [LeRobot](T10参照).

副次要

Model Params License Action head Hardware Best for
OpenVLA 7B MIT Discretized tokens A100/H100 Language-grounded manipulation
Octo 27M / 93M MIT Diffusion RTX 4090 Cross-embodiment, high freq
pi0 Multi-B Partial Flow matching Multi-GPU Dexterous long-horizon
RT-1-X ~35M Apache 2.0 Discretized tokens Single GPU Small historical baseline
Diffusion Policy Configurable MIT DDPM chunks Single GPU Multi-modal imitation
ACT Configurable MIT CVAE chunks Single GPU Bimanual teleop
InternVLA-M1 Open MIT Grounded action A100 Spatially precise tasks
SmolVLA 450M Apache 2.0 Chunked Laptop GPU Hobby / edge robots

部署をどのように選ぶか

誠実な答えは,2026年のほとんどのチームは _2_モデルを実行しているということです.言語からタスクへの前端としてVLAの基礎と,正確なアクションヘッドとして狭い模倣学習ポリシーです.OpenVLA + ディフュージョンポリシー,またはOcto + ACTは一般的な組み合わせです.タスクタイプとハードウェアに鍵をつけられた意思決定ツリーの場合は, [ロボットモデルを選択する方法]T11に関するガイドを参照してください.

テスト形式はアルゴリズム選択よりも重要だ. すでにデモがある場合は,その形式を記入して,上記の8つのモデルのうちどれから始めればいいか教えて下さい.

2024年から2026年の間に何が変わったか

3つのシフトが現在のVLA景観を定義する.まず,オープンウェイトが閉じたウェイトに追いつく**.2023年にはRT-2および他のプロプライエタリなDeepMindモデルが会話を支配していた.2026年までにOpenVLA,Octo,pi0部分リリース,およびInternVLA-M1は,生産チームが実際に使用するほとんどの機能をカバーする. 閉鎖されたモデルは依然として国境をリードしていますが 展開可能なオープンチェックポイントのギャップは劇的に縮小しています

2つ目は 模倣学習原始は基礎モデルの背骨となった.拡散政策のアクションヘッドは現在10月内にある.ACTのチャッキング&アセンブリ戦略は全分野において標準です. "リサーチIL"と"デプロイメントVLA"の間の清潔な分割は,各層が下の層からトリックを借りる層次なスタックに模糊化しました.

第三に, データがボトルネックになった.多くの有効なオープンモデルにより,あなたの自身のテレオップコルプスの質とカバーが差別化します. 2025年まで規律的なデータ収集に投資したチームは, 一貫したカメラ配置,クリーンな注釈,サブタスクの合理的な分類を 明らかにした. サービス (カスタム・コレクション) 及び (注釈) サービス (T14) はまさにこの場所から存在している.

注目すべきモデルを 意図的にリストから外した

2026年,RoboFlamingoとBridgeVLAは研究に注目されているが,上記のピックよりも展開範囲が狭い.RT-2-Xはダウンロードできないため,実際に使用できるモデルと比較してランク付けできない.Gemini Roboticsおよび他のDeepMindの後継者は閉鎖されている. 複数の商業ラボのプロパティオファーは興味深いですが 特定のクラウドエンドポイントに 閉じ込められます

ランキング上のランキングは _median_チームのニーズを反映しています. 小規模から中規模の研究グループまたは初創企業が許容許諾の下で商品ハードウェアに操作製品を輸送します.

よく聞かれる質問

視覚言語行動 (VLA) モデルとは

ビジョン言語行動 (VLA) モデルは,カメラ画像と自然言語の指示を吸収し,ロボットアクション (関節またはエンドエフェクターコマンド) を生成する神経ネットワークである.現代のVLAは,通常Llama-2,PaLI-Xなどの大きなビジョン言語の脊髄または連続制御出力を分泌または拡散するアクションヘッドを持つ専用トランスフォーマーを組み合わせます. OpenVLA,Octo,RT-2-Xは,法典的な例です.

2026年にどのVLAモデルから始めればいいのか?

2026年のほとんどのオープンソースチームにとって,OpenVLA (7B,MITライセンス,Open X-Embodimentで訓練) はデフォルトの出発点です.消費ハードウェアに展開している場合は,Octo-Base (93M) はより軽い代替品です.テレオップデータで純粋な模倣学習をしている場合は,双手作業のためのACTまたは多モダルの単腕作業のための拡散ポリシーから始めましょう.

OpenVLAを実行するにはどんなハードウェアが必要ですか?

bfloat16の OpenVLA には約16GBのGPUメモリが必要です.実態では,チームは510Hzでリアルタイム推論のために単一のA100 (40または80GB),H100,またはL40Sで展開します. 4ビット量化バリエーションは,小規模な速度罰金で24GB RTX 4090で実行できます.エッジ部署は通常Octoまたはより小さな蒸留政策を好みます.

RT-Xモデルの重量はあるのか?

RT-1-X 体重は Apache 2.0 でリリースされ,Hugging Face であります.RT-2-X 体重は公開されず,Google DeepMind の外では利用可能になったことはありません.この理由で,RT-2-クラス行動を求めるほとんどの実践的な展開は,MITライセンスで公開されているOpenVLA を使用します.

VLAモデルを自分のデータで調整できますか?

Octoは,単一のA100で新しいロボットやタスクに変更する,LoRAと完全なフィーナティューンレシピを搭載する.Octoは単一の24GBGPUで完全なフィーナティューンをサポートする.ACTとディフュージョンポリシーは,通常,50200のテレオップデモでゼロから訓練され,根本モデルを必要としません. RCSVの遠隔操作データサービスにより デモの資料を収集することができます

関連読み方 OpenVLA vs Octo → RT-X vs OpenVLA → 拡散政策 vs ACT → VLAモデルディレクトリ → オープンX-Embodimentデータセット → LIBEROベンチマーク → [Teleopデータ収集 →]T21)

ビデオの各部には 自分のデモで調整できます

デモを集める → それを実行するハードウェア → ポリシーをスコア →