OpenVLA vs Octo:どのロボット学習モデルを選びますか?
オープンVLAとオクトの比較:建築,トレーニングデータ,細かな調整,部署. ロボット用のVLAモデルは何ですか? シリコンバレーのロボットセンター
[←研究]
視覚言語行動 (VLA) モデルを選択する研究者と建設者にとって実践的な比較.
VLAモデルが認識 +言語を行動に映し出す
画像 言語 行動
[OpenVLA] (
建築
OpenVLAはPrismatic VLMをベースに作動予測ヘッドを追加し,複数のロボット形形法とアクションスペースをサポートします. Octoは,Open X-Embodimentデータで訓練されたトランスフォーマーベースのアーキテクチャを使用します.両者は画像 +言語と出力アクションを撮影します.
訓練データ
OpenVLAはOpen X-Embodimentおよび追加のデータセットで訓練されています.OctoはOpen X-Embodiment (RT-X, BridgeData, DROID,など) で訓練されています.どちらも大規模な多様なロボットデータから恩恵を受けています.データソースについては,私たちの [Data Sets カタログ]
調節
オクトのアーキテクチャは新しいアクションスペースに柔軟性がある.Octoは,OSVのチェックポイントを搭載している.Octoは,OSVのチェックポイントを設定し,OSVのチェックポイントを設定する.
OpenVLA を 選ぶ 時
- 普通の操作作業で 優れたパフォーマンスを 求められる
- ロボットは,オープンX-エンボディメント (WidowX, ALOHA,など) のロボットに似ている.
- 文書化され,積極的に維持されたモデルが欲しい
オクトゥー を 選ぶ 時
- 機械形質を試している
- パーソナルアクションスペースの最大限の柔軟性が必要です
- 直接X体体データを公開する
細かい調整のためのデータ収集
学習型は,どのモデルを選んでも,タスクの特定デモが必要になる. 模倣学習,遠隔操作,学習式化,QAのための [データ収集サービス] (T4
評価について読むことは"つ 真のハードウェアに関する政策を証明することは"つ







