インターンVLA-M1
インターVLA-M1:空間指导のビジョン言語行動フレームワーク 上海AIラボ,インターロボティクス 71~81%Googleロボット,95.9% LIBERO
[←モデル]
広域指导ビジョン・言語・行動枠組み 汎用ロボット政策 上海人工知能研究所
概要
InternVLA-M1は,2段階のパイプラインを使用します: (1) 2.3Mサンプルで"行動する場所"を決定するために空間的アースティング前訓練, (2) "行動する方法"のための空間的に導かれたアクション後訓練.
基準値
- Googleロボット 71.7% (WidowX), 76.0% (VM), 80.7% (VA)
- LIBERO 95.9%の成功
- 14.6% シンプラーエンブで + 20.6% 合成共同訓練で見られない物体で
公式リンク
- internrobotics.github.io/internvla-m1
プロジェクトサイト - github.com/InternRobotics/InternVLA-M1
コード (MIT) - [ハグリングフェイス:InternRobotics]
T3 ) モデルとデータセット
引用
プロジェクトサイトで BibTeXと紙の参照を参照してください.
ビデオの各部には 自分のデモで調整できます







