VLA Modelsに戻る

インターンVLA-M1

インターVLA-M1:空間指导のビジョン言語行動フレームワーク 上海AIラボ,インターロボティクス 71~81%Googleロボット,95.9% LIBERO

[←モデル]

広域指导ビジョン・言語・行動枠組み 汎用ロボット政策 上海人工知能研究所

概要

InternVLA-M1は,2段階のパイプラインを使用します: (1) 2.3Mサンプルで"行動する場所"を決定するために空間的アースティング前訓練, (2) "行動する方法"のための空間的に導かれたアクション後訓練.

基準値

  • Googleロボット 71.7% (WidowX), 76.0% (VM), 80.7% (VA)
  • LIBERO 95.9%の成功
    • 14.6% シンプラーエンブで + 20.6% 合成共同訓練で見られない物体で

公式リンク

引用

プロジェクトサイトで BibTeXと紙の参照を参照してください.

ビデオの各部には 自分のデモで調整できます

デモを集める → それを実行するハードウェア → ポリシーをスコア →