VLA Modelsに戻る

OpenVLA vs Octo:どのビジョン言語アクションモデルが勝てるのか

OpenVLA (7B) と Octo (27M/93M) 建築,Open-Xトレーニング,ライセンス,ハードウェアのニーズ,展開フィットに関する対照.今日正しい VLA を選択してください.

2つの重要なオープンウェイトVLAがオープンX-Embodiment corpusに訓練されています 1つは7Bマルチモダルの獣 もう1つは 27M/93Mのスリーンな拡散トランスフォーマーです ロボット,GPU予算,そしてあなたの任務に合致します

更新された2026年4月 7B vs 93M パラム MITライセンス

[すべてのモデルを閲覧する] T1] [エンジニアと話]

操作基準で最も優れた操作性ゼロショット行動と 幅広い言語の基礎,Llama-2のバックボーンを望むとき TL;DRを選択します 推論で単一のA100/H100を手に入れることができます 異なる実施形態で安価に調整し,商品GPUで動作するコンパクトで高速な拡散トランスフォーマーが必要な場合,Language fidelityが低いと速度と柔軟性に対して受け入れます.

なぜこの比較が重要なのか

OpenVLAとOctoは2024年にリリースされた最も引用されたオープンボートビジョン言語アクションモデルで,どちらもOpen X-Embodimentデータセットで訓練されています. 2026年にロボット学習スタックを立ち上げている場合, (倉庫ピックアップ) T3), (ラボ自動化) T4,またはヒューマノイドのテレオプパイプラインのいずれか,ほぼ確実にあなたの出発点です. しかしこの2つのモデルは 全く異なる哲学で設計されました 間違った選択は 数週間の調整と多くの GPU 時間に 代わるでしょう

このページでは,建築,トレーニングデータ,展開足跡,言語コンディショニング,そして正直なトレードオフを紹介しています.代わりに,深いディレクトリビューを希望する場合は,私たちの VLAモデルディレクトリ または個別 OpenVLAページ と [Octoページ](T7を参照してください.

瞬間の比較

Dimension OpenVLA Octo
Parameters 7B 27M (Octo-Small) / 93M (Octo-Base)
Backbone / architecture Llama-2 7B LLM + DINOv2 + SigLIP vision encoders Transformer diffusion policy from scratch, multimodal token stream
Action head Discretized action tokens output by the LLM Conditional diffusion over continuous actions (DDPM-style)
Training data ~970K trajectories from Open X-Embodiment ~800K trajectories from Open X-Embodiment
Language conditioning Native (LLM-level), strong instruction following Supported via text or goal-image tokens, weaker instruction grounding
Action space 7-DOF end-effector delta (extensible via fine-tune) Flexible — supports varied action dims across embodiments
Inference hardware ~16 GB VRAM bf16, ideally A100/H100/L40S for real-time Runs comfortably on a single RTX 4090 or smaller
Throughput (typical) ~5–10 Hz on A100 without quantization ~10–30 Hz on consumer GPUs with action chunking
Fine-tuning cost LoRA on 1× A100 is practical; full fine-tune needs multi-GPU Full fine-tune feasible on a single 24 GB GPU
License MIT MIT
Paper Kim et al., CoRL 2024 (arXiv:2406.09246) Octo Model Team, arXiv:2405.12213
Code github.com/openvla/openvla github.com/octo-models/octo

建築の深層潜水

OpenVLA:言語モデル初設計

OpenVLAは基本的にアクショントークンを発信するように教えられたLlama-2 7Bです.画像は,融合したDINOv2 + SigLIPビジュアルスタックによってコードされ,LLMのトークンストリームに投影されます.連続したアクションは,次元ごとに256ビンのように分断され,モデルが自動後退的に予測する新しい語彙として扱われます. 動作空間は言語と同じトークン空間で表現されているため, LLMの構成概要を継承します モデルはトレーニング中に見たことのない新しい指示に従うことができます. そして,ライバーとブリッジデータ V2 セットではRT-2-Xの55B変数よりも7×少ないパラメータを使用しているにもかかわらず,RT-2-Xの55B変数よりも7×少ない性能が表れていることを著者は示しました.

費用はサイズである:OpenVLAの7B重量と自動解読によりリアルタイム制御が要求される.実際,チームはアクションチャンキング,bfloat16推論,および専用A100クラスのGPUを導入する.または特定のロボットに小さなアクションヘッドをLoRA-tuneする.OpenArmまたはAlphaRobotプラットフォームでのOpenVLAは動作しますが,言語行動にはプレミアムを払います.

Octo:政策規模での拡散トランスフォーマー

Octoは,他の方法で設計された.Octoチームは,ほとんどのロボット政策が7B言語モデルを必要としないという観察からスタートした.彼らは,多様な実施形態とアクションスペースを吸収できる小さな高速マルチモダルのネットワークを必要としている.Octoは,画像,言語,目標画像に条件付けされたアクションシーケンスを指す条件性拡散ヘッドでゼロから訓練されたトランスフォーマーです. 行動の部分が 組み込まれています

27Mと93Mの変数は,消費者のハードウェアで高周波で提供できるほど小さい.そして,拡散式は多モード式示範分布をきれいに捕捉します. Octoは, [拡散政策スタイル] (T8) 模倣学習作業流に自然に適しています. 妥協点は,オクトーの言語理解は LLM以前のよりもトレーニング時間の分布に基づいているため,本当に新しい提示に従うゼロショット指導は OpenVLAよりも弱です.

訓練データと一般化

両モデルは[Open X-Embodiment]T9) データセットに訓練された.このモデルには22種実施形態で約970Kのリアルロボット軌跡が多機関で組み込まれています.OpenVLAは970Kの完全なリリースを使用し,Octoは800Kの軌跡サブセットを使用しました.この共有起源は,両モデルはフランカ,ウィドウックス,Googleロボット,および長い尾のラボ腕を見たことを意味します.しかし,彼らの誘導偏見は異なる. OpenVLA は言語モデルプリア (指示式の通用化に適した).Octo は拡散プリア (多モダルの高周波軌跡に適した) を継承します. [RCSVのデータサービス]T10を通じて収集された自分のテレオップデータに微調整するときに,これらのプリアーは,あなたが必要とするデータの量を形作ります.

OpenVLAが勝利したとき

  • 言語の基礎が必要です. 操作者がフリーフォームの指示を出す場合 ("マップの左に赤いブロックを入れ") OpenVLA のLlama-2のバックボーンが,構成言語の理解を無事に提供します.
    • H100/A100クラスのハードウェアがあります.** 40 GB の GPU を搭載した作業ステーションでは,OpenVLA は快適に動作し,言語の信頼性が自費します.
  • データ収集前に 強いゼロショットベースラインが必要です. LIBERO-Spatial, LIBERO-Object,BridgeData V2に関するOpenVLAの公開された数字は,しっかりとしたスタート地点です.
  • LoRAを特定の実施形態に調整する計画です. OpenVLAコミュニティは多くのLoRAレシピを配達しており,アダプターの重量は完全な調整と比較して小さすぎます.

オクトが勝った時

  • ** 24 GB の消費 GPU や edge box に 搭載している. ** Octo-Small (27M) は,認識と計画スタックと共に動作するほど小さい.
  • あなたの仕事は多モダルの示範模倣です. 拡散ヘッドは自然に"このことを行う方法が3つある"と示範分布を捕捉します 交差エントロピー政策が崩壊します
  • ** 異なる実施形態を調整したいです.** Octoは,異なるアクション次元とカメラビューを受け入れるために明確に構築されました.
  • 高制御周波数の問題です. Octoの小さな足跡と断片分散により,単一のGPUで20~30 Hzの閉ループ制御が達成可能になります.

誠実な妥協

OpenVLAの言語優位性は,狭いタスク分布に微調整するとなくなり,93Mのポリシーがもたらす行動に対して 7Bパラメータを支払っている. Octoの言語コンディショニングは,分散外指示で黙って失敗し,ポリシーに LLMが提示できない場合"ロボットはなぜ間違ったオブジェクトを選んだのか"をデバッグすることは難しくなります.あなたのデプロイメントは言語軽量でタスク狭い (bin picking, [倉庫キッティング]T11),固定置換組) であれば,Octoはほぼ常に正しい呼び出しです. 言語が重くて課題が広い (家庭支援,柔軟なラボ自動化) の場合は,OpenVLAは足跡を勝ち取る.

チェックする基準

単一紙番号を信頼する代わりに,標準化されたスイートを使用して両方のモデルを標準化されたタスク分布で評価することをお勧めします. [LIBERO基準値]T12) は短視野操作, [CALVIN]T13) は長視野言語条件のタスク, [Google ロボット]T14) はテーブルトップ一般化をカバーします. OpenVLAと Octoの両方で参照番号を公開します.

微妙だが重要な点:OpenVLAとOctoの基準値は常にリンゴ対リンゴではありません.OpenVLAの公開された LIBEROスコアは,LIBERO軌道をローラ細かな調整後7B基点検問で収集されました.OctoはOcto-Base評価されたゼロショットで収集されました. 温度やアクション・チャックリング,タイムリー・エンセンブルの微小違いが コミュニティ結果で見られる 差のほとんどを占めています

導入の健全性のために,私たちは10回の自分の作業のエピソードで短期間内評価を実行することをお勧めします. 1つのモデルにコミットする前に. その2日間の比較のコストは,間違ったベースで8週間分の微調整のコストよりもはるかに低い.

精細調節のレシピ

両モデルは細かな調節パイプラインを熟練しており,レシピはモデルについて多くを明らかにしています.OpenVLAの基準LoRAレシピは, T0訓練スタックを使用して,単一の80GB A100で16のバッチサイズで約20K50Kのステップのためのランク-16アダプターを訓練します.完全な細かな調節には4A100またはそれ以上の必要があります. チェックポイントは通常,LoRAアダプタの150~200MBで,共有7Bベースに対して多くのタスク特有のアダプタを輸送することが実用化される.

Octoの細かな調節のストーリーはよりシンプルです.ベースチェックポイントをロードし,アクションスペースが異なる場合,タスクの特定ヘッドを付加し,軌道のデータで10K50Kの梯度ステップを実行します.モデルが小さいため,単一の24GBGPUの完全な細かな調節はルーティンであり,コミュニティはフランカ,UR5,xArm,およびいくつかのヒューマノイドプラットフォームのレシピを共有しています. データを処理する際には,Octoは既に LeRobotや RLDS 形式でデータを処理します.

生態系と道具

OpenVLAはLlamaエコシステムから恩恵を受けます LLM推理のために構築されたすべての量化,配分,アダプターツールが適用されます.カスタムサンプラーを使用して OpenVLA をvLLMを通じて実行したり,ビットとバイトで4ビットに量化したり,生産通量のためにTensorRT-LLMにコンパイルしたりできます.生産しているときにエコシステム遺産は本当の利点です.

Octoのエコシステムは小さくてもロボットと高度に連携している.レロボット,RLDS,そしてほとんどの現代のデータ収集スタックがネイティブでサポートしている.あなたがすでにエコシステムのハグジングフェイスロボット側面を構築している場合は,Octoはホームチームモデルのように感じます.

推奨事項

このバージョンは,最初のVLAデプロイメントで,A100クラスのワークステーションを搭載している場合は,OpenVLA で開始します.言語の動作は,数週間のプロンプトテンプレートエンジニアリングを節約します. MITのライセンスが商業的経路を開いている.消費ハードウェアでデプロイしている場合,高周波で実行している場合,または狭いタスクをターゲットにしている場合,Octo-Baseを選択して,自分のテレオップデータに微調整します. 多くの制作チームは _both_を実行します: 指示に従うフロントエンドとして OpenVLA, 低レベルの高速ポリシーとして Octo.

RCSVはOpenArm,Unitree G1およびMobile ALOHAの両方で展開しています.特定のロボットとタスクに対してモデル推薦を希望している場合は, 電話予約

関連読み物 RT-X vs OpenVLA → 拡散政策 vs ACT → ベスト VLAモデル2026 → オープンX-Embodimentデータセット → LIBEROベンチマーク → テレオップデータ収集 →

ビデオの各部には 自分のデモで調整できます

デモを集める → それを実行するハードウェア → ポリシーをスコア →