RT-X vs OpenVLA:ロボット学の基礎モデルを比較する
オープンVLA 7B <unk> 建築,オープンX 訓練,ライセンス,アクセス,ハードウェアの足跡,どの基盤モデルをベースにするかと比較してください.
オープンVLAはオープン・ウェイトの対リリースで 7BVLAをあらゆるラボに利用できるようにしました チームは何の上に構築すべきか?
更新された2026年4月 オープン・ウェイト vs 閉鎖 両方オープン・X訓練
[すべてのモデルを閲覧する]
TL;DR RT-X (RT-1-XとRT-2-Xを含む) は,Google DeepMindの内部アクションモデルファミリーで,Open X-Embodimentで訓練されています. RT-1-Xチェックポイントは,JAX/TFコード付きのApache 2.0の下でリリースされました.RT-2-Xと後代モデルはプロテッショナルで外部部署には利用できません. OpenVLAは,RT-2-Xが閉鎖されたため,コミュニティによって特別に構築された7B MITライセンス付きの後代であり,いくつかのベンチマークで7×少ないパラメータでRT-2-Xを上回った.商業的なものであれば,OpenVLAは現実的な選択です.
なぜこの比較が重要なのか
"RT-X"は家族であり,単一モデルではなく,その混乱は多くの調達会話を殺す.RT-1-Xは~35Mパラメータトランスフォーマー政策である.オープンX-Embodimentの著者は,クロス-エンボディメント転送を実証するために訓練し,オープンソースで公開した.RT-2-Xは55B PaLI-XベースのVLAで,大型マルチモダルのモデルはロボット制御をゼロショットで行うことが示された. RT-2-Xはリリースされず,後になってDeepMindモデル (Gemini Robotics,RT-H) がGoogle内にとどまりました.もしあなたが自分のシステムのためのベースとして"RT-X"を評価している場合は,実際に評価しているのが,重量,コード,アダプタが付いているOpenVLAに対して通常,RT-1-X
詳細については, VLAモデルディレクトリ, RT-Xページ,または [OpenVLAページ](
瞬間の比較
| Dimension | RT-X family | OpenVLA |
|---|---|---|
| Parameters | RT-1-X ~35M · RT-2-X 55B (PaLI-X based) | 7B |
| Backbone | RT-1-X: EfficientNet + token learner + transformer. RT-2-X: PaLI-X multimodal LLM | Llama-2 7B + DINOv2 + SigLIP |
| Action head | Discretized action tokens (both variants) | Discretized action tokens |
| Training data | Open X-Embodiment (22 embodiments, ~970K traj) | Open X-Embodiment (~970K traj) |
| Language conditioning | Strong on RT-2-X, moderate on RT-1-X | Strong (LLM-native) |
| Action space | End-effector delta, configurable dim | 7-DOF end-effector delta (extensible) |
| Inference hardware | RT-1-X: single GPU. RT-2-X: multi-GPU inference cluster | Single A100/H100/L40S bf16 |
| Weights available? | RT-1-X: yes. RT-2-X: no (proprietary) | Yes, on Hugging Face |
| License | RT-1-X: Apache 2.0. RT-2-X: closed | MIT |
| Fine-tuning | RT-1-X fine-tune supported. RT-2-X: no external access | LoRA, QLoRA, and full fine-tune recipes published |
| Paper | Open X-Embodiment paper (2023), RT-2 (arXiv:2307.15818) | Kim et al., CoRL 2024 (arXiv:2406.09246) |
| Code | github.com/google-deepmind/open_x_embodiment | github.com/openvla/openvla |
RT-X: すべてを始めた家族
RT-1-X 入手可能なもの
RT-1-Xは,GoogleのオリジナルのRT-1アーキテクチャのオープンX-Embodiment再訓練である.エフェシントネット視覚の背骨,FiLM言語コンディショナー,トークン学習者,そして,不透明なアクションを出すトランスフォーマー.小さい (~35Mパラメータ),速い,そして,批判的に重さはApache 2.0の下のハグジングフェイスです. もしあなたの使用例は フランカやGoogleロボット腕で移動操作で 軽量なベースラインを希望しているなら,RT-1-Xは2026年でも信頼できる出発点です.
RT-2-X 持てないもの
RT-2-Xは,Googleが同じOpen X Embodimentデータで訓練したPaLI-Xベースの55BVLAです.この研究では,大きなVLMがロボット制御を行うことができるという説が確立されましたが,重量は公開されていません.ブログ記事で"RT-X性能"を読んだ場合は,35MRT-1-Xまたは55BRT-2-X
OpenVLA:オープンな答え
OpenVLA はオープンソースコミュニティのRT-2-Xギャップをクリアするために明示的に構築された.言語先端を捕捉するのに十分な7Bパラメータ,高級GPUにサービスするのに十分な小さい.OpenVLA紙は,リベロ-スペース,リベロ-オブジェクト,リベロ-ゴール,ブリッジデータ V2のゼロショットで7×少ないパラメータを使用しているにもかかわらず,RT-2-Xを上回っていると報告している. DINOv2 + SigLIP視力エンコーダー付きのLlama-2 7B LLMを使用し,各次元に動作を256個に分割し,同じオープンX-Embodiment corpus RT-Xシールで訓練されています.
建設者にとってさらに重要なのは,OverVLAは,チームに新しいロボットに 80 GB A100を1時間ではなく数日間で適応させる LoRAの細かな調節レシピを搭載する.RT-2-Xでは,その展開経路は存在しない.
ライセンスとアクセスに関する問題
これは通常決定的な要因である.アパッチ2.0ではRT-1-Xは商業的なグレードですが,古いし小さい.RT-2-Xはまったくライセンスできない.MITではOpenVLAは商業的に利用可能なパッケージで _RT-2-クラス_行動を得る唯一の方法である. 2026年に実際のロボットを派遣するチーム 特に [倉庫部署] (T6
ハードウェアの足跡
RT-1-Xは,リアルタイムで1つのGPUで動作し,フランカからGoogleロボットまでのロボットで示された.これは軽量オプションです.OpenVLAはbfloat16で~16GBのVRAMを必要とし,通常は量子化なしのA100で5
RT-1-Xがまだ意味があるとき
- 言語理解が強くなくても 最小で最速のOpen-Xベースラインが必要です
- 論文で 異体移植を比較しているのに 歴史的に基礎的な基調を求めています
- 7Bモデルが実行可能でない 端末ハードウェアで動作します
OpenVLAが明らかに選択される時
- RT-2-クラスでの言語行動が ダウンロードできる重量で
- 商業ライセンスパス (MIT) が必要です
- コミュニティの LoRA アダプタや 量子変数や配達レシピを 積極的に提供したいのです
- 公開VLAのドキュメントは,下流使用のために RT-Xよりも,実質的に優れている.
誠実な妥協
OpenVLAはRT-2-Xより厳格に"優れている"とは限らない.DeepMindはRT-2-Xをはるかに超えて内部モデルを推し進め続けている.Googleの生産ロボットスタックでは,閉鎖された子孫を使用している.OpenVLAは,明らかにRT-X系における最高のオープンウェイトベースモデルである.あなたがSOTAを費用対価で必要とし,DeepMindと提携できるなら,それは別の会話です. 製品を作っている場合,OpenVLAのMITの重みと,Supabaseがホストするデータパイプラインと [テレオペレーションデータ収集]
基準と評価
両モデルファミリーもLIBERO,Google Robot に番号を公開しています.OpenVLAの LIBERO番号は紙に載っていて再現可能です.RT-Xの番号は変数によって異なります. RT-Xの行列を引用しているのが注意してください.現在のスイートについては,私たちの ベンチマークディレクトリ を参照してください.
RT-Xに関するベンチマーク請求を読むとき,常に3つの質問をしてください. RT-X バリアント (RT-1-Xまたは RT-2-X),Open X-Embodimentの実施形態サブセットが評価に使用されたもの,ロボットがGoogleのリアルワールドのWidowXか外部複製か.これらの選択によって数字は20%の振動を起こすことができます. OpenVLA 評価は,通常,解読が簡単である. 論文はチェックポイント,プロトコル,データセットの分割について明示している.
精細調整と配備のレシピ
RT-1-Xで働く下流チームは,通常,Open X-Embodimentの傘内の狭いタスクセットに細かく調整し,ターゲット実施形態に関連する軌道を選択し,その後の短いトレーニングループを実行して,特定のハードウェアにポリシーをアップします. RT-1-Xのトレーニングコードは成熟していますが,生産指針では稀であり,下流の知識の大半はレシピではなく論文に存在します.
OpenVLAのフィーナティューニングストーリーはかなり豊かである.公式リポジトリはLoRAフィーナティューニング例,フルフィーナティューニング例,カスタムRLDSデータのためのデータセット変換ツール,およびいくつかの人気ロボットのための参照設定を送信する.コミュニティは4ビット量化,vLLM配信,および [LeRobot](
ディープマインドが今後の
Google DeepMindはRT-2-Xを内部で繰り返し続けています.ゲミニロボットと関連プロジェクトは,より大きなVLMと生産Googleロボットへの緊密な結合で基礎モデル-フォー-ロボティクス論文を拡張しています.これらのチェックポイントは外部部署のために利用可能になっていません. OpenVLA,pi0とLeRobotエコシステムモデルはオープンソースの作業の現実的な前進の道です
推奨事項
現在,ほぼすべての実用チームにとって,OpenVLAは答えです.知識的にはRT-X系を継承し,公的な基準点でのRT-2-Xに匹敵するか,MITの下でオープン体重を持つ船と並べ替えのエコシステムを持っています.RT-1-Xは細かい基線であり続けていますが,2026年にその役割のために[Octo]
関連読み物 OpenVLA vs Octo → 拡散政策 vs ACT → ベストVLAモデル2026 → オープンX-Embodimentデータセット → OpenVLAモデルページ → RT-Xモデルページ →
ビデオの各部には 自分のデモで調整できます







