Researchに戻る

OpenVLA vs Octo:どのロボット学習モデルを選びますか?

オープンVLAとオクトの比較:建築,トレーニングデータ,細かな調整,部署. ロボット用のVLAモデルは何ですか? シリコンバレーのロボットセンター

[←研究]

視覚言語行動 (VLA) モデルを選択する研究者と建設者にとって実践的な比較.

VLAモデルが認識 +言語を行動に映し出す

画像 言語 行動

[OpenVLA] (T1) と [Octo] (T2) はロボット学習のためのオープンソースのビジョン言語アクションモデルです.

建築

OpenVLAはPrismatic VLMをベースに作動予測ヘッドを追加し,複数のロボット形形法とアクションスペースをサポートします. Octoは,Open X-Embodimentデータで訓練されたトランスフォーマーベースのアーキテクチャを使用します.両者は画像 +言語と出力アクションを撮影します.

訓練データ

OpenVLAはOpen X-Embodimentおよび追加のデータセットで訓練されています.OctoはOpen X-Embodiment (RT-X, BridgeData, DROID,など) で訓練されています.どちらも大規模な多様なロボットデータから恩恵を受けています.データソースについては,私たちの [Data Sets カタログ]T3 を参照してください.

調節

オクトのアーキテクチャは新しいアクションスペースに柔軟性がある.Octoは,OSVのチェックポイントを搭載している.Octoは,OSVのチェックポイントを設定し,OSVのチェックポイントを設定する.

OpenVLA を 選ぶ 時

  • 普通の操作作業で 優れたパフォーマンスを 求められる
  • ロボットは,オープンX-エンボディメント (WidowX, ALOHA,など) のロボットに似ている.
  • 文書化され,積極的に維持されたモデルが欲しい

オクトゥー を 選ぶ 時

  • 機械形質を試している
  • パーソナルアクションスペースの最大限の柔軟性が必要です
  • 直接X体体データを公開する

細かい調整のためのデータ収集

学習型は,どのモデルを選んでも,タスクの特定デモが必要になる. 模倣学習,遠隔操作,学習式化,QAのための [データ収集サービス] (T4) を提供します.

すべてのVLAモデルを見る →

評価について読むことは"つ 真のハードウェアに関する政策を証明することは"つ

実世界の評価を実行する → 委員会評価データ → あなたの評価装置のためのハードウェア →